{ "best_global_step": 650, "best_metric": 0.6772647500038147, "best_model_checkpoint": "./tamilrav_checkpoints/checkpoint-650", "epoch": 1.0, "eval_steps": 500, "global_step": 650, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.015396458814472672, "grad_norm": 0.29363131523132324, "learning_rate": 1.8e-05, "loss": 1.4163263320922852, "step": 10 }, { "epoch": 0.030792917628945343, "grad_norm": 0.265934020280838, "learning_rate": 3.8e-05, "loss": 1.188729953765869, "step": 20 }, { "epoch": 0.046189376443418015, "grad_norm": 0.1696174591779709, "learning_rate": 5.8e-05, "loss": 1.0048276901245117, "step": 30 }, { "epoch": 0.061585835257890686, "grad_norm": 0.1621861755847931, "learning_rate": 7.800000000000001e-05, "loss": 0.939247989654541, "step": 40 }, { "epoch": 0.07698229407236336, "grad_norm": 0.16908901929855347, "learning_rate": 9.8e-05, "loss": 0.9107258796691895, "step": 50 }, { "epoch": 0.09237875288683603, "grad_norm": 0.16060316562652588, "learning_rate": 0.000118, "loss": 0.8661402702331543, "step": 60 }, { "epoch": 0.1077752117013087, "grad_norm": 0.15463921427726746, "learning_rate": 0.000138, "loss": 0.8585456848144531, "step": 70 }, { "epoch": 0.12317167051578137, "grad_norm": 0.14651408791542053, "learning_rate": 0.00015800000000000002, "loss": 0.8524063110351563, "step": 80 }, { "epoch": 0.13856812933025403, "grad_norm": 0.1593480259180069, "learning_rate": 0.00017800000000000002, "loss": 0.8573471069335937, "step": 90 }, { "epoch": 0.15396458814472672, "grad_norm": 0.14837513864040375, "learning_rate": 0.00019800000000000002, "loss": 0.8089125633239747, "step": 100 }, { "epoch": 0.16936104695919937, "grad_norm": 0.1440625786781311, "learning_rate": 0.00019998832107530538, "loss": 0.8235550880432129, "step": 110 }, { "epoch": 0.18475750577367206, "grad_norm": 0.1411304473876953, "learning_rate": 0.00019994795298602624, "loss": 0.8093386650085449, "step": 120 }, { "epoch": 0.20015396458814472, "grad_norm": 0.1452978402376175, "learning_rate": 0.0001998787631859678, "loss": 0.8320710182189941, "step": 130 }, { "epoch": 0.2155504234026174, "grad_norm": 0.13940446078777313, "learning_rate": 0.00019978077162719857, "loss": 0.821429443359375, "step": 140 }, { "epoch": 0.23094688221709006, "grad_norm": 0.14506584405899048, "learning_rate": 0.00019965400656726942, "loss": 0.7923899173736573, "step": 150 }, { "epoch": 0.24634334103156275, "grad_norm": 0.14369885623455048, "learning_rate": 0.000199498504561065, "loss": 0.7901590824127197, "step": 160 }, { "epoch": 0.2617397998460354, "grad_norm": 0.14093971252441406, "learning_rate": 0.00019931431045026255, "loss": 0.8111134529113769, "step": 170 }, { "epoch": 0.27713625866050806, "grad_norm": 0.13777726888656616, "learning_rate": 0.00019910147735040102, "loss": 0.791386604309082, "step": 180 }, { "epoch": 0.2925327174749808, "grad_norm": 0.1432289332151413, "learning_rate": 0.00019886006663556426, "loss": 0.7923940181732178, "step": 190 }, { "epoch": 0.30792917628945343, "grad_norm": 0.13564977049827576, "learning_rate": 0.00019859014792068282, "loss": 0.7843753337860108, "step": 200 }, { "epoch": 0.3233256351039261, "grad_norm": 0.13792838156223297, "learning_rate": 0.00019829179904145918, "loss": 0.7822946071624756, "step": 210 }, { "epoch": 0.33872209391839875, "grad_norm": 0.13952118158340454, "learning_rate": 0.00019796510603192253, "loss": 0.7925955772399902, "step": 220 }, { "epoch": 0.35411855273287146, "grad_norm": 0.13627943396568298, "learning_rate": 0.00019761016309961948, "loss": 0.7559749603271484, "step": 230 }, { "epoch": 0.3695150115473441, "grad_norm": 0.13699838519096375, "learning_rate": 0.00019722707259844756, "loss": 0.769603681564331, "step": 240 }, { "epoch": 0.3849114703618168, "grad_norm": 0.13574793934822083, "learning_rate": 0.0001968159449991397, "loss": 0.7658140659332275, "step": 250 }, { "epoch": 0.40030792917628943, "grad_norm": 0.13491615653038025, "learning_rate": 0.00019637689885740827, "loss": 0.7487314701080322, "step": 260 }, { "epoch": 0.41570438799076215, "grad_norm": 0.1336905062198639, "learning_rate": 0.0001959100607797573, "loss": 0.7576127052307129, "step": 270 }, { "epoch": 0.4311008468052348, "grad_norm": 0.12657032907009125, "learning_rate": 0.0001954155653869735, "loss": 0.7317625999450683, "step": 280 }, { "epoch": 0.44649730561970746, "grad_norm": 0.13930626213550568, "learning_rate": 0.00019489355527530576, "loss": 0.7514139652252197, "step": 290 }, { "epoch": 0.4618937644341801, "grad_norm": 0.1464177966117859, "learning_rate": 0.00019434418097534554, "loss": 0.750247573852539, "step": 300 }, { "epoch": 0.47729022324865283, "grad_norm": 0.14013901352882385, "learning_rate": 0.00019376760090861824, "loss": 0.736499834060669, "step": 310 }, { "epoch": 0.4926866820631255, "grad_norm": 0.131071999669075, "learning_rate": 0.0001931639813419, "loss": 0.7452194690704346, "step": 320 }, { "epoch": 0.5080831408775982, "grad_norm": 0.13927963376045227, "learning_rate": 0.0001925334963392717, "loss": 0.7342241764068603, "step": 330 }, { "epoch": 0.5234795996920708, "grad_norm": 0.1341823786497116, "learning_rate": 0.00019187632771192466, "loss": 0.7511595726013184, "step": 340 }, { "epoch": 0.5388760585065435, "grad_norm": 0.13563531637191772, "learning_rate": 0.00019119266496573208, "loss": 0.7299445629119873, "step": 350 }, { "epoch": 0.5542725173210161, "grad_norm": 0.1313074827194214, "learning_rate": 0.00019048270524660196, "loss": 0.7165977001190186, "step": 360 }, { "epoch": 0.5696689761354888, "grad_norm": 0.14486627280712128, "learning_rate": 0.00018974665328362654, "loss": 0.710158109664917, "step": 370 }, { "epoch": 0.5850654349499615, "grad_norm": 0.14865578711032867, "learning_rate": 0.00018898472133004531, "loss": 0.7281487941741943, "step": 380 }, { "epoch": 0.6004618937644342, "grad_norm": 0.14025066792964935, "learning_rate": 0.00018819712910203795, "loss": 0.7306881904602051, "step": 390 }, { "epoch": 0.6158583525789069, "grad_norm": 0.1385616809129715, "learning_rate": 0.00018738410371536545, "loss": 0.715015983581543, "step": 400 }, { "epoch": 0.6312548113933796, "grad_norm": 0.13913969695568085, "learning_rate": 0.00018654587961987754, "loss": 0.6998976230621338, "step": 410 }, { "epoch": 0.6466512702078522, "grad_norm": 0.14493151009082794, "learning_rate": 0.00018568269853190482, "loss": 0.7252633094787597, "step": 420 }, { "epoch": 0.6620477290223249, "grad_norm": 0.1407926082611084, "learning_rate": 0.00018479480936455577, "loss": 0.705822229385376, "step": 430 }, { "epoch": 0.6774441878367975, "grad_norm": 0.1485988348722458, "learning_rate": 0.00018388246815593848, "loss": 0.7083362579345703, "step": 440 }, { "epoch": 0.6928406466512702, "grad_norm": 0.13596095144748688, "learning_rate": 0.00018294593799532752, "loss": 0.7086032867431641, "step": 450 }, { "epoch": 0.7082371054657429, "grad_norm": 0.1445472687482834, "learning_rate": 0.00018198548894729765, "loss": 0.7101798057556152, "step": 460 }, { "epoch": 0.7236335642802155, "grad_norm": 0.13956452906131744, "learning_rate": 0.0001810013979738462, "loss": 0.6983530044555664, "step": 470 }, { "epoch": 0.7390300230946882, "grad_norm": 0.14123016595840454, "learning_rate": 0.00017999394885452605, "loss": 0.6674805641174316, "step": 480 }, { "epoch": 0.7544264819091608, "grad_norm": 0.1448190063238144, "learning_rate": 0.00017896343210461319, "loss": 0.68931565284729, "step": 490 }, { "epoch": 0.7698229407236336, "grad_norm": 0.14515918493270874, "learning_rate": 0.00017791014489133147, "loss": 0.6919535636901856, "step": 500 }, { "epoch": 0.7852193995381063, "grad_norm": 0.13914334774017334, "learning_rate": 0.00017683439094815938, "loss": 0.6638880729675293, "step": 510 }, { "epoch": 0.8006158583525789, "grad_norm": 0.14346542954444885, "learning_rate": 0.00017573648048724327, "loss": 0.6776976585388184, "step": 520 }, { "epoch": 0.8160123171670516, "grad_norm": 0.1400802731513977, "learning_rate": 0.00017461673010994236, "loss": 0.7085250854492188, "step": 530 }, { "epoch": 0.8314087759815243, "grad_norm": 0.1518496870994568, "learning_rate": 0.0001734754627155313, "loss": 0.6884902000427247, "step": 540 }, { "epoch": 0.8468052347959969, "grad_norm": 0.14645785093307495, "learning_rate": 0.00017231300740808654, "loss": 0.7027451992034912, "step": 550 }, { "epoch": 0.8622016936104696, "grad_norm": 0.14037857949733734, "learning_rate": 0.00017112969940158359, "loss": 0.6541213035583496, "step": 560 }, { "epoch": 0.8775981524249422, "grad_norm": 0.14151780307292938, "learning_rate": 0.0001699258799232323, "loss": 0.6418449401855468, "step": 570 }, { "epoch": 0.8929946112394149, "grad_norm": 0.14554472267627716, "learning_rate": 0.00016870189611507813, "loss": 0.6883684635162354, "step": 580 }, { "epoch": 0.9083910700538876, "grad_norm": 0.14308355748653412, "learning_rate": 0.00016745810093389766, "loss": 0.6611432552337646, "step": 590 }, { "epoch": 0.9237875288683602, "grad_norm": 0.153996542096138, "learning_rate": 0.0001661948530494176, "loss": 0.6723202705383301, "step": 600 }, { "epoch": 0.939183987682833, "grad_norm": 0.14034205675125122, "learning_rate": 0.00016491251674088613, "loss": 0.6433265686035157, "step": 610 }, { "epoch": 0.9545804464973057, "grad_norm": 0.15295536816120148, "learning_rate": 0.00016361146179202666, "loss": 0.6759867191314697, "step": 620 }, { "epoch": 0.9699769053117783, "grad_norm": 0.14949378371238708, "learning_rate": 0.00016229206338440447, "loss": 0.6557295799255372, "step": 630 }, { "epoch": 0.985373364126251, "grad_norm": 0.15767240524291992, "learning_rate": 0.00016095470198923648, "loss": 0.6578701972961426, "step": 640 }, { "epoch": 1.0, "grad_norm": 0.3094935119152069, "learning_rate": 0.00015959976325767607, "loss": 0.656089973449707, "step": 650 }, { "epoch": 1.0, "eval_loss": 0.6772647500038147, "eval_runtime": 193.0976, "eval_samples_per_second": 2.978, "eval_steps_per_second": 0.373, "step": 650 } ], "logging_steps": 10, "max_steps": 1950, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.665508132426875e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }