Ashapu's picture
step 800 | loss 0.6317
de7b99e verified
Raw
History Blame Contribute Delete
14.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.7231229874018417,
"eval_steps": 500,
"global_step": 800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.009039037342523022,
"grad_norm": 7.855499744415283,
"learning_rate": 6.000000000000001e-07,
"loss": 1.4181,
"step": 10
},
{
"epoch": 0.018078074685046044,
"grad_norm": 3.3778610229492188,
"learning_rate": 1.2666666666666669e-06,
"loss": 1.2494,
"step": 20
},
{
"epoch": 0.027117112027569064,
"grad_norm": 2.6225311756134033,
"learning_rate": 1.9333333333333336e-06,
"loss": 1.0602,
"step": 30
},
{
"epoch": 0.03615614937009209,
"grad_norm": 1.594939112663269,
"learning_rate": 2.6e-06,
"loss": 0.9123,
"step": 40
},
{
"epoch": 0.045195186712615104,
"grad_norm": 0.9766483902931213,
"learning_rate": 3.266666666666667e-06,
"loss": 0.7841,
"step": 50
},
{
"epoch": 0.05423422405513813,
"grad_norm": 0.43368658423423767,
"learning_rate": 3.9333333333333335e-06,
"loss": 0.6803,
"step": 60
},
{
"epoch": 0.06327326139766115,
"grad_norm": 0.49014410376548767,
"learning_rate": 4.600000000000001e-06,
"loss": 0.5921,
"step": 70
},
{
"epoch": 0.07231229874018417,
"grad_norm": 0.46368488669395447,
"learning_rate": 5.2666666666666665e-06,
"loss": 0.6214,
"step": 80
},
{
"epoch": 0.0813513360827072,
"grad_norm": 0.46477940678596497,
"learning_rate": 5.933333333333335e-06,
"loss": 0.6157,
"step": 90
},
{
"epoch": 0.09039037342523021,
"grad_norm": 0.4853752553462982,
"learning_rate": 6.600000000000001e-06,
"loss": 0.6628,
"step": 100
},
{
"epoch": 0.09942941076775323,
"grad_norm": 0.36940082907676697,
"learning_rate": 7.266666666666668e-06,
"loss": 0.5775,
"step": 110
},
{
"epoch": 0.10846844811027626,
"grad_norm": 0.34785982966423035,
"learning_rate": 7.933333333333334e-06,
"loss": 0.6343,
"step": 120
},
{
"epoch": 0.11750748545279928,
"grad_norm": 0.4787227511405945,
"learning_rate": 8.6e-06,
"loss": 0.6016,
"step": 130
},
{
"epoch": 0.1265465227953223,
"grad_norm": 0.4643513262271881,
"learning_rate": 9.266666666666667e-06,
"loss": 0.6388,
"step": 140
},
{
"epoch": 0.1355855601378453,
"grad_norm": 0.384676456451416,
"learning_rate": 9.933333333333334e-06,
"loss": 0.5895,
"step": 150
},
{
"epoch": 0.14462459748036835,
"grad_norm": 0.4324859380722046,
"learning_rate": 9.99991503499922e-06,
"loss": 0.5942,
"step": 160
},
{
"epoch": 0.15366363482289136,
"grad_norm": 0.41830965876579285,
"learning_rate": 9.99962133253095e-06,
"loss": 0.6121,
"step": 170
},
{
"epoch": 0.1627026721654144,
"grad_norm": 0.3795354962348938,
"learning_rate": 9.999117855964797e-06,
"loss": 0.6041,
"step": 180
},
{
"epoch": 0.1717417095079374,
"grad_norm": 0.28756389021873474,
"learning_rate": 9.998404626425627e-06,
"loss": 0.5529,
"step": 190
},
{
"epoch": 0.18078074685046042,
"grad_norm": 0.40732458233833313,
"learning_rate": 9.997481673839125e-06,
"loss": 0.6321,
"step": 200
},
{
"epoch": 0.18981978419298345,
"grad_norm": 0.3699369430541992,
"learning_rate": 9.996349036930533e-06,
"loss": 0.5886,
"step": 210
},
{
"epoch": 0.19885882153550646,
"grad_norm": 0.4334062337875366,
"learning_rate": 9.995006763223028e-06,
"loss": 0.646,
"step": 220
},
{
"epoch": 0.2078978588780295,
"grad_norm": 0.3638211786746979,
"learning_rate": 9.993454909035724e-06,
"loss": 0.5996,
"step": 230
},
{
"epoch": 0.2169368962205525,
"grad_norm": 0.377408891916275,
"learning_rate": 9.991693539481317e-06,
"loss": 0.5999,
"step": 240
},
{
"epoch": 0.22597593356307552,
"grad_norm": 0.4337885081768036,
"learning_rate": 9.989722728463345e-06,
"loss": 0.6233,
"step": 250
},
{
"epoch": 0.23501497090559856,
"grad_norm": 0.35624244809150696,
"learning_rate": 9.98754255867309e-06,
"loss": 0.6279,
"step": 260
},
{
"epoch": 0.24405400824812157,
"grad_norm": 0.385580837726593,
"learning_rate": 9.985153121586111e-06,
"loss": 0.5896,
"step": 270
},
{
"epoch": 0.2530930455906446,
"grad_norm": 0.36690962314605713,
"learning_rate": 9.982554517458403e-06,
"loss": 0.6212,
"step": 280
},
{
"epoch": 0.26213208293316764,
"grad_norm": 0.3190907835960388,
"learning_rate": 9.979746855322192e-06,
"loss": 0.6019,
"step": 290
},
{
"epoch": 0.2711711202756906,
"grad_norm": 0.33014318346977234,
"learning_rate": 9.976730252981354e-06,
"loss": 0.5906,
"step": 300
},
{
"epoch": 0.28021015761821366,
"grad_norm": 0.4516271650791168,
"learning_rate": 9.973504837006487e-06,
"loss": 0.612,
"step": 310
},
{
"epoch": 0.2892491949607367,
"grad_norm": 0.3498607873916626,
"learning_rate": 9.97007074272958e-06,
"loss": 0.5591,
"step": 320
},
{
"epoch": 0.2982882323032597,
"grad_norm": 0.4618026316165924,
"learning_rate": 9.966428114238353e-06,
"loss": 0.5808,
"step": 330
},
{
"epoch": 0.3073272696457827,
"grad_norm": 0.35378628969192505,
"learning_rate": 9.962577104370206e-06,
"loss": 0.5983,
"step": 340
},
{
"epoch": 0.31636630698830576,
"grad_norm": 0.3605310916900635,
"learning_rate": 9.958517874705793e-06,
"loss": 0.5898,
"step": 350
},
{
"epoch": 0.3254053443308288,
"grad_norm": 0.41437646746635437,
"learning_rate": 9.954250595562267e-06,
"loss": 0.5746,
"step": 360
},
{
"epoch": 0.3344443816733518,
"grad_norm": 0.3715222477912903,
"learning_rate": 9.949775445986112e-06,
"loss": 0.5994,
"step": 370
},
{
"epoch": 0.3434834190158748,
"grad_norm": 0.41986992955207825,
"learning_rate": 9.945092613745642e-06,
"loss": 0.5492,
"step": 380
},
{
"epoch": 0.35252245635839785,
"grad_norm": 0.3996647000312805,
"learning_rate": 9.940202295323116e-06,
"loss": 0.6066,
"step": 390
},
{
"epoch": 0.36156149370092083,
"grad_norm": 0.3808385729789734,
"learning_rate": 9.935104695906506e-06,
"loss": 0.5628,
"step": 400
},
{
"epoch": 0.37060053104344387,
"grad_norm": 0.3926442563533783,
"learning_rate": 9.92980002938087e-06,
"loss": 0.6087,
"step": 410
},
{
"epoch": 0.3796395683859669,
"grad_norm": 0.3604278862476349,
"learning_rate": 9.924288518319394e-06,
"loss": 0.5661,
"step": 420
},
{
"epoch": 0.3886786057284899,
"grad_norm": 0.36008164286613464,
"learning_rate": 9.918570393974041e-06,
"loss": 0.5948,
"step": 430
},
{
"epoch": 0.3977176430710129,
"grad_norm": 0.3590993285179138,
"learning_rate": 9.912645896265858e-06,
"loss": 0.5692,
"step": 440
},
{
"epoch": 0.40675668041353596,
"grad_norm": 0.3519396483898163,
"learning_rate": 9.906515273774903e-06,
"loss": 0.5289,
"step": 450
},
{
"epoch": 0.415795717756059,
"grad_norm": 0.33698147535324097,
"learning_rate": 9.900178783729817e-06,
"loss": 0.5643,
"step": 460
},
{
"epoch": 0.424834755098582,
"grad_norm": 0.41117480397224426,
"learning_rate": 9.89363669199703e-06,
"loss": 0.5875,
"step": 470
},
{
"epoch": 0.433873792441105,
"grad_norm": 0.3583988547325134,
"learning_rate": 9.886889273069614e-06,
"loss": 0.5494,
"step": 480
},
{
"epoch": 0.44291282978362806,
"grad_norm": 0.3181304633617401,
"learning_rate": 9.879936810055746e-06,
"loss": 0.5652,
"step": 490
},
{
"epoch": 0.45195186712615104,
"grad_norm": 0.3814559280872345,
"learning_rate": 9.872779594666856e-06,
"loss": 0.6046,
"step": 500
},
{
"epoch": 0.4609909044686741,
"grad_norm": 0.33179372549057007,
"learning_rate": 9.865417927205363e-06,
"loss": 0.6156,
"step": 510
},
{
"epoch": 0.4700299418111971,
"grad_norm": 0.4139130115509033,
"learning_rate": 9.857852116552094e-06,
"loss": 0.5993,
"step": 520
},
{
"epoch": 0.47906897915372015,
"grad_norm": 0.32068437337875366,
"learning_rate": 9.850082480153306e-06,
"loss": 0.603,
"step": 530
},
{
"epoch": 0.48810801649624314,
"grad_norm": 0.9201164841651917,
"learning_rate": 9.842109344007386e-06,
"loss": 0.6036,
"step": 540
},
{
"epoch": 0.4971470538387662,
"grad_norm": 0.42034047842025757,
"learning_rate": 9.833933042651156e-06,
"loss": 0.5678,
"step": 550
},
{
"epoch": 0.5061860911812892,
"grad_norm": 0.3811807632446289,
"learning_rate": 9.825553919145845e-06,
"loss": 0.5596,
"step": 560
},
{
"epoch": 0.5152251285238122,
"grad_norm": 0.36168864369392395,
"learning_rate": 9.816972325062694e-06,
"loss": 0.5906,
"step": 570
},
{
"epoch": 0.5242641658663353,
"grad_norm": 0.3304130733013153,
"learning_rate": 9.808188620468204e-06,
"loss": 0.5398,
"step": 580
},
{
"epoch": 0.5333032032088583,
"grad_norm": 0.32785892486572266,
"learning_rate": 9.799203173909028e-06,
"loss": 0.5982,
"step": 590
},
{
"epoch": 0.5423422405513812,
"grad_norm": 0.39726918935775757,
"learning_rate": 9.790016362396506e-06,
"loss": 0.5561,
"step": 600
},
{
"epoch": 0.5513812778939043,
"grad_norm": 0.3174471855163574,
"learning_rate": 9.780628571390853e-06,
"loss": 0.5268,
"step": 610
},
{
"epoch": 0.5604203152364273,
"grad_norm": 0.4243045151233673,
"learning_rate": 9.771040194784973e-06,
"loss": 0.5954,
"step": 620
},
{
"epoch": 0.5694593525789503,
"grad_norm": 0.35231855511665344,
"learning_rate": 9.761251634887949e-06,
"loss": 0.5711,
"step": 630
},
{
"epoch": 0.5784983899214734,
"grad_norm": 0.349280446767807,
"learning_rate": 9.751263302408146e-06,
"loss": 0.6263,
"step": 640
},
{
"epoch": 0.5875374272639964,
"grad_norm": 0.7063365578651428,
"learning_rate": 9.741075616435995e-06,
"loss": 0.6093,
"step": 650
},
{
"epoch": 0.5965764646065194,
"grad_norm": 0.3803994059562683,
"learning_rate": 9.730689004426392e-06,
"loss": 0.5552,
"step": 660
},
{
"epoch": 0.6056155019490425,
"grad_norm": 0.36839503049850464,
"learning_rate": 9.720103902180776e-06,
"loss": 0.5987,
"step": 670
},
{
"epoch": 0.6146545392915654,
"grad_norm": 0.39339619874954224,
"learning_rate": 9.709320753828837e-06,
"loss": 0.5621,
"step": 680
},
{
"epoch": 0.6236935766340884,
"grad_norm": 0.35199737548828125,
"learning_rate": 9.698340011809883e-06,
"loss": 0.5732,
"step": 690
},
{
"epoch": 0.6327326139766115,
"grad_norm": 0.37193241715431213,
"learning_rate": 9.687162136853858e-06,
"loss": 0.5534,
"step": 700
},
{
"epoch": 0.6417716513191345,
"grad_norm": 0.3605504035949707,
"learning_rate": 9.675787597962007e-06,
"loss": 0.608,
"step": 710
},
{
"epoch": 0.6508106886616576,
"grad_norm": 0.3748184144496918,
"learning_rate": 9.664216872387202e-06,
"loss": 0.5903,
"step": 720
},
{
"epoch": 0.6598497260041806,
"grad_norm": 0.3527565896511078,
"learning_rate": 9.652450445613913e-06,
"loss": 0.5836,
"step": 730
},
{
"epoch": 0.6688887633467036,
"grad_norm": 0.34412819147109985,
"learning_rate": 9.64048881133784e-06,
"loss": 0.5672,
"step": 740
},
{
"epoch": 0.6779278006892266,
"grad_norm": 0.3731626868247986,
"learning_rate": 9.628332471445206e-06,
"loss": 0.6236,
"step": 750
},
{
"epoch": 0.6869668380317496,
"grad_norm": 0.35358232259750366,
"learning_rate": 9.615981935991683e-06,
"loss": 0.5535,
"step": 760
},
{
"epoch": 0.6960058753742726,
"grad_norm": 0.3264493942260742,
"learning_rate": 9.603437723181002e-06,
"loss": 0.6,
"step": 770
},
{
"epoch": 0.7050449127167957,
"grad_norm": 0.3995952308177948,
"learning_rate": 9.59070035934321e-06,
"loss": 0.5739,
"step": 780
},
{
"epoch": 0.7140839500593187,
"grad_norm": 0.4088019132614136,
"learning_rate": 9.577770378912584e-06,
"loss": 0.5463,
"step": 790
},
{
"epoch": 0.7231229874018417,
"grad_norm": 0.36028265953063965,
"learning_rate": 9.564648324405206e-06,
"loss": 0.6317,
"step": 800
}
],
"logging_steps": 10,
"max_steps": 5000,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.525205823727493e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}