{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 20, "global_step": 513, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05865102639296188, "grad_norm": 0.2199089378118515, "learning_rate": 9.992407582166581e-05, "loss": 2.171413612365723, "step": 10 }, { "epoch": 0.11730205278592376, "grad_norm": 0.18916942179203033, "learning_rate": 9.966191788709716e-05, "loss": 1.8421794891357421, "step": 20 }, { "epoch": 0.11730205278592376, "eval_loss": 1.7743369340896606, "eval_runtime": 61.8903, "eval_samples_per_second": 39.263, "eval_steps_per_second": 0.42, "step": 20 }, { "epoch": 0.17595307917888564, "grad_norm": 0.12417227029800415, "learning_rate": 9.921357148779606e-05, "loss": 1.7548107147216796, "step": 30 }, { "epoch": 0.23460410557184752, "grad_norm": 0.0854392722249031, "learning_rate": 9.85807175279907e-05, "loss": 1.7152568817138671, "step": 40 }, { "epoch": 0.23460410557184752, "eval_loss": 1.6997339725494385, "eval_runtime": 50.7944, "eval_samples_per_second": 47.84, "eval_steps_per_second": 0.512, "step": 40 }, { "epoch": 0.2932551319648094, "grad_norm": 0.07562987506389618, "learning_rate": 9.776572865280207e-05, "loss": 1.6737960815429687, "step": 50 }, { "epoch": 0.3519061583577713, "grad_norm": 0.07606321573257446, "learning_rate": 9.677166035291405e-05, "loss": 1.6580020904541015, "step": 60 }, { "epoch": 0.3519061583577713, "eval_loss": 1.6625698804855347, "eval_runtime": 50.7016, "eval_samples_per_second": 47.928, "eval_steps_per_second": 0.513, "step": 60 }, { "epoch": 0.41055718475073316, "grad_norm": 0.07690507918596268, "learning_rate": 9.560223950917353e-05, "loss": 1.658456802368164, "step": 70 }, { "epoch": 0.46920821114369504, "grad_norm": 0.08297807723283768, "learning_rate": 9.42618504200689e-05, "loss": 1.6370161056518555, "step": 80 }, { "epoch": 0.46920821114369504, "eval_loss": 1.6375877857208252, "eval_runtime": 50.7877, "eval_samples_per_second": 47.846, "eval_steps_per_second": 0.512, "step": 80 }, { "epoch": 0.5278592375366569, "grad_norm": 0.09066126495599747, "learning_rate": 9.275551836447103e-05, "loss": 1.639760971069336, "step": 90 }, { "epoch": 0.5865102639296188, "grad_norm": 0.08974612504243851, "learning_rate": 9.108889076126226e-05, "loss": 1.6200483322143555, "step": 100 }, { "epoch": 0.5865102639296188, "eval_loss": 1.6185985803604126, "eval_runtime": 50.8043, "eval_samples_per_second": 47.831, "eval_steps_per_second": 0.512, "step": 100 }, { "epoch": 0.6451612903225806, "grad_norm": 0.0942302867770195, "learning_rate": 8.926821599648816e-05, "loss": 1.6054956436157226, "step": 110 }, { "epoch": 0.7038123167155426, "grad_norm": 0.10261812061071396, "learning_rate": 8.730031999741158e-05, "loss": 1.6100627899169921, "step": 120 }, { "epoch": 0.7038123167155426, "eval_loss": 1.6033717393875122, "eval_runtime": 50.7978, "eval_samples_per_second": 47.837, "eval_steps_per_second": 0.512, "step": 120 }, { "epoch": 0.7624633431085044, "grad_norm": 0.1043047085404396, "learning_rate": 8.519258064129558e-05, "loss": 1.6290523529052734, "step": 130 }, { "epoch": 0.8211143695014663, "grad_norm": 0.11067894846200943, "learning_rate": 8.295290009486006e-05, "loss": 1.5792938232421876, "step": 140 }, { "epoch": 0.8211143695014663, "eval_loss": 1.5912233591079712, "eval_runtime": 50.855, "eval_samples_per_second": 47.783, "eval_steps_per_second": 0.511, "step": 140 }, { "epoch": 0.8797653958944281, "grad_norm": 0.10661020874977112, "learning_rate": 8.058967518811425e-05, "loss": 1.5838823318481445, "step": 150 }, { "epoch": 0.9384164222873901, "grad_norm": 0.12469790130853653, "learning_rate": 7.811176593363772e-05, "loss": 1.5862667083740234, "step": 160 }, { "epoch": 0.9384164222873901, "eval_loss": 1.5811413526535034, "eval_runtime": 50.8651, "eval_samples_per_second": 47.773, "eval_steps_per_second": 0.511, "step": 160 }, { "epoch": 0.9970674486803519, "grad_norm": 0.125987708568573, "learning_rate": 7.552846230933437e-05, "loss": 1.5710247039794922, "step": 170 }, { "epoch": 1.0527859237536656, "grad_norm": 0.12022332847118378, "learning_rate": 7.284944942919519e-05, "loss": 1.5837053298950194, "step": 180 }, { "epoch": 1.0527859237536656, "eval_loss": 1.573178768157959, "eval_runtime": 50.8352, "eval_samples_per_second": 47.802, "eval_steps_per_second": 0.511, "step": 180 }, { "epoch": 1.1114369501466275, "grad_norm": 0.13042506575584412, "learning_rate": 7.008477123264848e-05, "loss": 1.5391403198242188, "step": 190 }, { "epoch": 1.1700879765395895, "grad_norm": 0.12966230511665344, "learning_rate": 6.724479282863072e-05, "loss": 1.5630327224731446, "step": 200 }, { "epoch": 1.1700879765395895, "eval_loss": 1.5658373832702637, "eval_runtime": 50.7515, "eval_samples_per_second": 47.88, "eval_steps_per_second": 0.512, "step": 200 }, { "epoch": 1.2287390029325513, "grad_norm": 0.12177792936563492, "learning_rate": 6.434016163555452e-05, "loss": 1.5479339599609374, "step": 210 }, { "epoch": 1.2873900293255132, "grad_norm": 0.1271909475326538, "learning_rate": 6.138176746286468e-05, "loss": 1.5333200454711915, "step": 220 }, { "epoch": 1.2873900293255132, "eval_loss": 1.5592361688613892, "eval_runtime": 50.88, "eval_samples_per_second": 47.759, "eval_steps_per_second": 0.511, "step": 220 }, { "epoch": 1.3460410557184752, "grad_norm": 0.13476736843585968, "learning_rate": 5.838070168384118e-05, "loss": 1.548457717895508, "step": 230 }, { "epoch": 1.404692082111437, "grad_norm": 0.1285582035779953, "learning_rate": 5.534821565271542e-05, "loss": 1.5389267921447753, "step": 240 }, { "epoch": 1.404692082111437, "eval_loss": 1.5531750917434692, "eval_runtime": 50.7263, "eval_samples_per_second": 47.904, "eval_steps_per_second": 0.513, "step": 240 }, { "epoch": 1.4633431085043989, "grad_norm": 0.5709601640701294, "learning_rate": 5.229567852199859e-05, "loss": 1.544548225402832, "step": 250 }, { "epoch": 1.5219941348973607, "grad_norm": 0.14010146260261536, "learning_rate": 4.9234534618170395e-05, "loss": 1.5372689247131348, "step": 260 }, { "epoch": 1.5219941348973607, "eval_loss": 1.5480340719223022, "eval_runtime": 50.6848, "eval_samples_per_second": 47.943, "eval_steps_per_second": 0.513, "step": 260 }, { "epoch": 1.5806451612903225, "grad_norm": 0.14289264380931854, "learning_rate": 4.6176260535531395e-05, "loss": 1.5423521041870116, "step": 270 }, { "epoch": 1.6392961876832843, "grad_norm": 0.13429485261440277, "learning_rate": 4.3132322109079596e-05, "loss": 1.5462657928466796, "step": 280 }, { "epoch": 1.6392961876832843, "eval_loss": 1.5433279275894165, "eval_runtime": 50.7331, "eval_samples_per_second": 47.898, "eval_steps_per_second": 0.512, "step": 280 }, { "epoch": 1.6979472140762464, "grad_norm": 0.14501748979091644, "learning_rate": 4.011413142772484e-05, "loss": 1.5275556564331054, "step": 290 }, { "epoch": 1.7565982404692082, "grad_norm": 0.13486360013484955, "learning_rate": 3.713300404900376e-05, "loss": 1.5159502029418945, "step": 300 }, { "epoch": 1.7565982404692082, "eval_loss": 1.5394600629806519, "eval_runtime": 50.742, "eval_samples_per_second": 47.889, "eval_steps_per_second": 0.512, "step": 300 }, { "epoch": 1.8152492668621703, "grad_norm": 0.1557241827249527, "learning_rate": 3.420011657570238e-05, "loss": 1.5319683074951171, "step": 310 }, { "epoch": 1.873900293255132, "grad_norm": 0.14938898384571075, "learning_rate": 3.132646475343665e-05, "loss": 1.534824275970459, "step": 320 }, { "epoch": 1.873900293255132, "eval_loss": 1.535933494567871, "eval_runtime": 50.6698, "eval_samples_per_second": 47.958, "eval_steps_per_second": 0.513, "step": 320 }, { "epoch": 1.932551319648094, "grad_norm": 0.14145061373710632, "learning_rate": 2.8522822246288173e-05, "loss": 1.5147466659545898, "step": 330 }, { "epoch": 1.9912023460410557, "grad_norm": 0.1560547649860382, "learning_rate": 2.5799700245050074e-05, "loss": 1.5312614440917969, "step": 340 }, { "epoch": 1.9912023460410557, "eval_loss": 1.5332497358322144, "eval_runtime": 50.7774, "eval_samples_per_second": 47.856, "eval_steps_per_second": 0.512, "step": 340 }, { "epoch": 2.0469208211143695, "grad_norm": 0.15864278376102448, "learning_rate": 2.3167308059516678e-05, "loss": 1.5440088272094727, "step": 350 }, { "epoch": 2.1055718475073313, "grad_norm": 0.14240412414073944, "learning_rate": 2.063551484256107e-05, "loss": 1.516731357574463, "step": 360 }, { "epoch": 2.1055718475073313, "eval_loss": 1.5310300588607788, "eval_runtime": 50.8129, "eval_samples_per_second": 47.823, "eval_steps_per_second": 0.512, "step": 360 }, { "epoch": 2.164222873900293, "grad_norm": 0.15173648297786713, "learning_rate": 1.821381258950161e-05, "loss": 1.4962255477905273, "step": 370 }, { "epoch": 2.222873900293255, "grad_norm": 0.15619643032550812, "learning_rate": 1.5911280551477185e-05, "loss": 1.5161256790161133, "step": 380 }, { "epoch": 2.222873900293255, "eval_loss": 1.5295287370681763, "eval_runtime": 50.8214, "eval_samples_per_second": 47.814, "eval_steps_per_second": 0.512, "step": 380 }, { "epoch": 2.281524926686217, "grad_norm": 0.1521531194448471, "learning_rate": 1.3736551196249759e-05, "loss": 1.4899578094482422, "step": 390 }, { "epoch": 2.340175953079179, "grad_norm": 0.15226739645004272, "learning_rate": 1.1697777844051105e-05, "loss": 1.5050838470458985, "step": 400 }, { "epoch": 2.340175953079179, "eval_loss": 1.5282557010650635, "eval_runtime": 50.8187, "eval_samples_per_second": 47.817, "eval_steps_per_second": 0.512, "step": 400 }, { "epoch": 2.398826979472141, "grad_norm": 0.14956440031528473, "learning_rate": 9.802604099810997e-06, "loss": 1.5099305152893066, "step": 410 }, { "epoch": 2.4574780058651027, "grad_norm": 0.15371431410312653, "learning_rate": 8.058135196368877e-06, "loss": 1.4888692855834962, "step": 420 }, { "epoch": 2.4574780058651027, "eval_loss": 1.5272583961486816, "eval_runtime": 50.6668, "eval_samples_per_second": 47.96, "eval_steps_per_second": 0.513, "step": 420 }, { "epoch": 2.5161290322580645, "grad_norm": 0.15528695285320282, "learning_rate": 6.470911356106885e-06, "loss": 1.5185343742370605, "step": 430 }, { "epoch": 2.5747800586510263, "grad_norm": 0.16078710556030273, "learning_rate": 5.046883270874603e-06, "loss": 1.506414794921875, "step": 440 }, { "epoch": 2.5747800586510263, "eval_loss": 1.5265320539474487, "eval_runtime": 50.6741, "eval_samples_per_second": 47.954, "eval_steps_per_second": 0.513, "step": 440 }, { "epoch": 2.633431085043988, "grad_norm": 0.15603981912136078, "learning_rate": 3.7913897921341866e-06, "loss": 1.5100496292114258, "step": 450 }, { "epoch": 2.6920821114369504, "grad_norm": 0.15229907631874084, "learning_rate": 2.7091379149682685e-06, "loss": 1.493442916870117, "step": 460 }, { "epoch": 2.6920821114369504, "eval_loss": 1.5261310338974, "eval_runtime": 50.735, "eval_samples_per_second": 47.896, "eval_steps_per_second": 0.512, "step": 460 }, { "epoch": 2.7507331378299122, "grad_norm": 0.15283197164535522, "learning_rate": 1.8041851309928802e-06, "loss": 1.4831109046936035, "step": 470 }, { "epoch": 2.809384164222874, "grad_norm": 0.15298782289028168, "learning_rate": 1.0799242163365419e-06, "loss": 1.505828285217285, "step": 480 }, { "epoch": 2.809384164222874, "eval_loss": 1.5259722471237183, "eval_runtime": 50.8213, "eval_samples_per_second": 47.815, "eval_steps_per_second": 0.512, "step": 480 }, { "epoch": 2.868035190615836, "grad_norm": 0.1547379195690155, "learning_rate": 5.390705117171047e-07, "loss": 1.5249052047729492, "step": 490 }, { "epoch": 2.9266862170087977, "grad_norm": 0.14859049022197723, "learning_rate": 1.8365174230492998e-07, "loss": 1.497894287109375, "step": 500 }, { "epoch": 2.9266862170087977, "eval_loss": 1.5259029865264893, "eval_runtime": 50.8143, "eval_samples_per_second": 47.821, "eval_steps_per_second": 0.512, "step": 500 }, { "epoch": 2.9853372434017595, "grad_norm": 0.16615204513072968, "learning_rate": 1.5000415538901636e-08, "loss": 1.4946805953979492, "step": 510 }, { "epoch": 3.0, "eval_loss": 1.525899887084961, "eval_runtime": 50.8318, "eval_samples_per_second": 47.805, "eval_steps_per_second": 0.511, "step": 513 } ], "logging_steps": 10, "max_steps": 513, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.7660971754916413e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }