Negative-v1.0 / trainer_state.json
Harley-ml's picture
Upload 9 files
909a630 verified
Raw
History Blame Contribute Delete
37.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.22103569035662726,
"eval_steps": 250,
"global_step": 8000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0013814730647289204,
"grad_norm": 1.3092303276062012,
"learning_rate": 0.0009187500000000001,
"loss": 5.301650390625,
"step": 50
},
{
"epoch": 0.0027629461294578408,
"grad_norm": 0.2540936768054962,
"learning_rate": 0.00185625,
"loss": 3.7713958740234377,
"step": 100
},
{
"epoch": 0.004144419194186761,
"grad_norm": 0.8980741500854492,
"learning_rate": 0.0027937500000000002,
"loss": 3.084112548828125,
"step": 150
},
{
"epoch": 0.0055258922589156816,
"grad_norm": 0.513289213180542,
"learning_rate": 0.003,
"loss": 2.6681784057617186,
"step": 200
},
{
"epoch": 0.006907365323644602,
"grad_norm": 0.8646414875984192,
"learning_rate": 0.003,
"loss": 2.4488145446777345,
"step": 250
},
{
"epoch": 0.006907365323644602,
"eval_loss": 2.3864049911499023,
"eval_runtime": 5.0393,
"eval_samples_per_second": 404.423,
"eval_steps_per_second": 3.175,
"step": 250
},
{
"epoch": 0.008288838388373522,
"grad_norm": 1.049102783203125,
"learning_rate": 0.003,
"loss": 2.3174089050292968,
"step": 300
},
{
"epoch": 0.009670311453102444,
"grad_norm": 2.3267924785614014,
"learning_rate": 0.003,
"loss": 2.2231291198730467,
"step": 350
},
{
"epoch": 0.011051784517831363,
"grad_norm": 1.4895470142364502,
"learning_rate": 0.003,
"loss": 2.136985168457031,
"step": 400
},
{
"epoch": 0.012433257582560284,
"grad_norm": 0.8463179469108582,
"learning_rate": 0.003,
"loss": 2.075450897216797,
"step": 450
},
{
"epoch": 0.013814730647289204,
"grad_norm": 1.4170407056808472,
"learning_rate": 0.003,
"loss": 2.0253837585449217,
"step": 500
},
{
"epoch": 0.013814730647289204,
"eval_loss": 2.0032660961151123,
"eval_runtime": 4.8177,
"eval_samples_per_second": 423.027,
"eval_steps_per_second": 3.321,
"step": 500
},
{
"epoch": 0.015196203712018125,
"grad_norm": 0.9727197289466858,
"learning_rate": 0.003,
"loss": 1.985428924560547,
"step": 550
},
{
"epoch": 0.016577676776747045,
"grad_norm": 1.3294126987457275,
"learning_rate": 0.003,
"loss": 1.945387725830078,
"step": 600
},
{
"epoch": 0.017959149841475966,
"grad_norm": 1.1075317859649658,
"learning_rate": 0.003,
"loss": 1.909156494140625,
"step": 650
},
{
"epoch": 0.019340622906204887,
"grad_norm": 1.532372236251831,
"learning_rate": 0.003,
"loss": 1.8862774658203125,
"step": 700
},
{
"epoch": 0.02072209597093381,
"grad_norm": 1.4036468267440796,
"learning_rate": 0.003,
"loss": 1.8624417114257812,
"step": 750
},
{
"epoch": 0.02072209597093381,
"eval_loss": 1.8611562252044678,
"eval_runtime": 4.8927,
"eval_samples_per_second": 416.539,
"eval_steps_per_second": 3.27,
"step": 750
},
{
"epoch": 0.022103569035662726,
"grad_norm": 0.9797951579093933,
"learning_rate": 0.003,
"loss": 1.8470022583007812,
"step": 800
},
{
"epoch": 0.023485042100391647,
"grad_norm": 1.0192056894302368,
"learning_rate": 0.003,
"loss": 1.8303775024414062,
"step": 850
},
{
"epoch": 0.02486651516512057,
"grad_norm": 1.3044160604476929,
"learning_rate": 0.003,
"loss": 1.8083892822265626,
"step": 900
},
{
"epoch": 0.02624798822984949,
"grad_norm": 1.347043514251709,
"learning_rate": 0.003,
"loss": 1.7919261169433593,
"step": 950
},
{
"epoch": 0.027629461294578408,
"grad_norm": 1.4868067502975464,
"learning_rate": 0.003,
"loss": 1.7848297119140626,
"step": 1000
},
{
"epoch": 0.027629461294578408,
"eval_loss": 1.7806859016418457,
"eval_runtime": 4.9437,
"eval_samples_per_second": 412.245,
"eval_steps_per_second": 3.236,
"step": 1000
},
{
"epoch": 0.02901093435930733,
"grad_norm": 1.3199470043182373,
"learning_rate": 0.003,
"loss": 1.770255584716797,
"step": 1050
},
{
"epoch": 0.03039240742403625,
"grad_norm": 0.942984402179718,
"learning_rate": 0.003,
"loss": 1.764229278564453,
"step": 1100
},
{
"epoch": 0.03177388048876517,
"grad_norm": 1.001526951789856,
"learning_rate": 0.003,
"loss": 1.748619842529297,
"step": 1150
},
{
"epoch": 0.03315535355349409,
"grad_norm": 0.9165797233581543,
"learning_rate": 0.003,
"loss": 1.7377178955078125,
"step": 1200
},
{
"epoch": 0.034536826618223014,
"grad_norm": 1.5860354900360107,
"learning_rate": 0.003,
"loss": 1.7299589538574218,
"step": 1250
},
{
"epoch": 0.034536826618223014,
"eval_loss": 1.7355499267578125,
"eval_runtime": 4.8017,
"eval_samples_per_second": 424.429,
"eval_steps_per_second": 3.332,
"step": 1250
},
{
"epoch": 0.03591829968295193,
"grad_norm": 1.7614655494689941,
"learning_rate": 0.003,
"loss": 1.7231251525878906,
"step": 1300
},
{
"epoch": 0.03729977274768085,
"grad_norm": 0.8269591927528381,
"learning_rate": 0.003,
"loss": 1.7191682434082032,
"step": 1350
},
{
"epoch": 0.038681245812409774,
"grad_norm": 1.2936993837356567,
"learning_rate": 0.003,
"loss": 1.715775146484375,
"step": 1400
},
{
"epoch": 0.04006271887713869,
"grad_norm": 0.8943546414375305,
"learning_rate": 0.003,
"loss": 1.7027583312988281,
"step": 1450
},
{
"epoch": 0.04144419194186762,
"grad_norm": 0.8446581959724426,
"learning_rate": 0.003,
"loss": 1.7010877990722657,
"step": 1500
},
{
"epoch": 0.04144419194186762,
"eval_loss": 1.7066650390625,
"eval_runtime": 4.8419,
"eval_samples_per_second": 420.908,
"eval_steps_per_second": 3.304,
"step": 1500
},
{
"epoch": 0.042825665006596535,
"grad_norm": 1.1785316467285156,
"learning_rate": 0.003,
"loss": 1.6969337463378906,
"step": 1550
},
{
"epoch": 0.04420713807132545,
"grad_norm": 1.1146525144577026,
"learning_rate": 0.003,
"loss": 1.6898464965820312,
"step": 1600
},
{
"epoch": 0.04558861113605438,
"grad_norm": 1.050032377243042,
"learning_rate": 0.003,
"loss": 1.6903854370117188,
"step": 1650
},
{
"epoch": 0.046970084200783295,
"grad_norm": 0.817931056022644,
"learning_rate": 0.003,
"loss": 1.6805955505371093,
"step": 1700
},
{
"epoch": 0.04835155726551221,
"grad_norm": 0.7598580121994019,
"learning_rate": 0.003,
"loss": 1.6817108154296876,
"step": 1750
},
{
"epoch": 0.04835155726551221,
"eval_loss": 1.681281328201294,
"eval_runtime": 4.9443,
"eval_samples_per_second": 412.196,
"eval_steps_per_second": 3.236,
"step": 1750
},
{
"epoch": 0.04973303033024114,
"grad_norm": 1.0627769231796265,
"learning_rate": 0.003,
"loss": 1.6690780639648437,
"step": 1800
},
{
"epoch": 0.051114503394970055,
"grad_norm": 0.9967713952064514,
"learning_rate": 0.003,
"loss": 1.6677894592285156,
"step": 1850
},
{
"epoch": 0.05249597645969898,
"grad_norm": 0.8788776397705078,
"learning_rate": 0.003,
"loss": 1.671481170654297,
"step": 1900
},
{
"epoch": 0.0538774495244279,
"grad_norm": 0.8975939750671387,
"learning_rate": 0.003,
"loss": 1.6636967468261719,
"step": 1950
},
{
"epoch": 0.055258922589156816,
"grad_norm": 0.8807463645935059,
"learning_rate": 0.003,
"loss": 1.662882080078125,
"step": 2000
},
{
"epoch": 0.055258922589156816,
"eval_loss": 1.659508228302002,
"eval_runtime": 4.8341,
"eval_samples_per_second": 421.589,
"eval_steps_per_second": 3.31,
"step": 2000
},
{
"epoch": 0.05664039565388574,
"grad_norm": 0.8365132212638855,
"learning_rate": 0.003,
"loss": 1.6577224731445312,
"step": 2050
},
{
"epoch": 0.05802186871861466,
"grad_norm": 1.006463646888733,
"learning_rate": 0.003,
"loss": 1.651870574951172,
"step": 2100
},
{
"epoch": 0.059403341783343576,
"grad_norm": 1.0645591020584106,
"learning_rate": 0.003,
"loss": 1.655391845703125,
"step": 2150
},
{
"epoch": 0.0607848148480725,
"grad_norm": 0.7508670091629028,
"learning_rate": 0.003,
"loss": 1.641587677001953,
"step": 2200
},
{
"epoch": 0.06216628791280142,
"grad_norm": 0.9019992351531982,
"learning_rate": 0.003,
"loss": 1.6511729431152344,
"step": 2250
},
{
"epoch": 0.06216628791280142,
"eval_loss": 1.6495267152786255,
"eval_runtime": 4.9408,
"eval_samples_per_second": 412.485,
"eval_steps_per_second": 3.238,
"step": 2250
},
{
"epoch": 0.06354776097753034,
"grad_norm": 0.8229948282241821,
"learning_rate": 0.003,
"loss": 1.647374725341797,
"step": 2300
},
{
"epoch": 0.06492923404225927,
"grad_norm": 0.9779911041259766,
"learning_rate": 0.003,
"loss": 1.6417164611816406,
"step": 2350
},
{
"epoch": 0.06631070710698818,
"grad_norm": 0.8557340502738953,
"learning_rate": 0.003,
"loss": 1.6406777954101563,
"step": 2400
},
{
"epoch": 0.0676921801717171,
"grad_norm": 0.7618058919906616,
"learning_rate": 0.003,
"loss": 1.6387905883789062,
"step": 2450
},
{
"epoch": 0.06907365323644603,
"grad_norm": 0.9702732563018799,
"learning_rate": 0.003,
"loss": 1.6384074401855468,
"step": 2500
},
{
"epoch": 0.06907365323644603,
"eval_loss": 1.6367918252944946,
"eval_runtime": 5.186,
"eval_samples_per_second": 392.979,
"eval_steps_per_second": 3.085,
"step": 2500
},
{
"epoch": 0.07045512630117494,
"grad_norm": 0.8180472254753113,
"learning_rate": 0.003,
"loss": 1.6398277282714844,
"step": 2550
},
{
"epoch": 0.07183659936590386,
"grad_norm": 0.8394176959991455,
"learning_rate": 0.003,
"loss": 1.6309616088867187,
"step": 2600
},
{
"epoch": 0.07321807243063279,
"grad_norm": 1.1738929748535156,
"learning_rate": 0.003,
"loss": 1.6329539489746094,
"step": 2650
},
{
"epoch": 0.0745995454953617,
"grad_norm": 0.7382224798202515,
"learning_rate": 0.003,
"loss": 1.6252481079101562,
"step": 2700
},
{
"epoch": 0.07598101856009062,
"grad_norm": 0.7925794720649719,
"learning_rate": 0.003,
"loss": 1.628258056640625,
"step": 2750
},
{
"epoch": 0.07598101856009062,
"eval_loss": 1.6294986009597778,
"eval_runtime": 5.0001,
"eval_samples_per_second": 407.594,
"eval_steps_per_second": 3.2,
"step": 2750
},
{
"epoch": 0.07736249162481955,
"grad_norm": 1.0887517929077148,
"learning_rate": 0.003,
"loss": 1.6292604064941407,
"step": 2800
},
{
"epoch": 0.07874396468954846,
"grad_norm": 0.8471100926399231,
"learning_rate": 0.003,
"loss": 1.6208766174316407,
"step": 2850
},
{
"epoch": 0.08012543775427738,
"grad_norm": 0.8405469059944153,
"learning_rate": 0.003,
"loss": 1.6250108337402345,
"step": 2900
},
{
"epoch": 0.08150691081900631,
"grad_norm": 0.7940107583999634,
"learning_rate": 0.003,
"loss": 1.6223403930664062,
"step": 2950
},
{
"epoch": 0.08288838388373523,
"grad_norm": 0.9527040123939514,
"learning_rate": 0.003,
"loss": 1.62312744140625,
"step": 3000
},
{
"epoch": 0.08288838388373523,
"eval_loss": 1.622558832168579,
"eval_runtime": 4.9038,
"eval_samples_per_second": 415.594,
"eval_steps_per_second": 3.263,
"step": 3000
},
{
"epoch": 0.08426985694846414,
"grad_norm": 0.7105967402458191,
"learning_rate": 0.003,
"loss": 1.6175238037109374,
"step": 3050
},
{
"epoch": 0.08565133001319307,
"grad_norm": 1.089608907699585,
"learning_rate": 0.003,
"loss": 1.6170733642578126,
"step": 3100
},
{
"epoch": 0.087032803077922,
"grad_norm": 0.8875170350074768,
"learning_rate": 0.003,
"loss": 1.61830322265625,
"step": 3150
},
{
"epoch": 0.0884142761426509,
"grad_norm": 0.9304706454277039,
"learning_rate": 0.003,
"loss": 1.6177555847167968,
"step": 3200
},
{
"epoch": 0.08979574920737983,
"grad_norm": 0.8498280644416809,
"learning_rate": 0.0029992286819925424,
"loss": 1.6121067810058594,
"step": 3250
},
{
"epoch": 0.08979574920737983,
"eval_loss": 1.6201170682907104,
"eval_runtime": 4.8624,
"eval_samples_per_second": 419.135,
"eval_steps_per_second": 3.291,
"step": 3250
},
{
"epoch": 0.09117722227210875,
"grad_norm": 0.884667694568634,
"learning_rate": 0.0029968522736369967,
"loss": 1.6176124572753907,
"step": 3300
},
{
"epoch": 0.09255869533683767,
"grad_norm": 0.8628567457199097,
"learning_rate": 0.0029928729983747797,
"loss": 1.6118777465820313,
"step": 3350
},
{
"epoch": 0.09394016840156659,
"grad_norm": 0.7607647776603699,
"learning_rate": 0.002987295117313512,
"loss": 1.6121871948242188,
"step": 3400
},
{
"epoch": 0.09532164146629551,
"grad_norm": 0.6003952622413635,
"learning_rate": 0.002980124603387944,
"loss": 1.6035992431640624,
"step": 3450
},
{
"epoch": 0.09670311453102443,
"grad_norm": 0.668270468711853,
"learning_rate": 0.0029713691349639894,
"loss": 1.6169198608398438,
"step": 3500
},
{
"epoch": 0.09670311453102443,
"eval_loss": 1.61012864112854,
"eval_runtime": 4.8048,
"eval_samples_per_second": 424.158,
"eval_steps_per_second": 3.33,
"step": 3500
},
{
"epoch": 0.09808458759575335,
"grad_norm": 0.8415676355361938,
"learning_rate": 0.002961038087616538,
"loss": 1.6114456176757812,
"step": 3550
},
{
"epoch": 0.09946606066048228,
"grad_norm": 0.7975565195083618,
"learning_rate": 0.002949142524089853,
"loss": 1.6004766845703124,
"step": 3600
},
{
"epoch": 0.10084753372521119,
"grad_norm": 0.6167800426483154,
"learning_rate": 0.00293569518245131,
"loss": 1.60706298828125,
"step": 3650
},
{
"epoch": 0.10222900678994011,
"grad_norm": 0.6672324538230896,
"learning_rate": 0.0029207104624511555,
"loss": 1.6043368530273439,
"step": 3700
},
{
"epoch": 0.10361047985466904,
"grad_norm": 0.7184829115867615,
"learning_rate": 0.0029042044101028914,
"loss": 1.6044706726074218,
"step": 3750
},
{
"epoch": 0.10361047985466904,
"eval_loss": 1.608585238456726,
"eval_runtime": 4.872,
"eval_samples_per_second": 418.307,
"eval_steps_per_second": 3.284,
"step": 3750
},
{
"epoch": 0.10499195291939796,
"grad_norm": 0.6598625779151917,
"learning_rate": 0.002886194700500804,
"loss": 1.6044143676757812,
"step": 3800
},
{
"epoch": 0.10637342598412687,
"grad_norm": 0.7797738313674927,
"learning_rate": 0.002866700618893029,
"loss": 1.600813751220703,
"step": 3850
},
{
"epoch": 0.1077548990488558,
"grad_norm": 0.6865859031677246,
"learning_rate": 0.002845743040030426,
"loss": 1.6023855590820313,
"step": 3900
},
{
"epoch": 0.10913637211358472,
"grad_norm": 0.6436059474945068,
"learning_rate": 0.002823344405813371,
"loss": 1.6005615234375,
"step": 3950
},
{
"epoch": 0.11051784517831363,
"grad_norm": 0.6858559250831604,
"learning_rate": 0.0027995287012604077,
"loss": 1.5992294311523438,
"step": 4000
},
{
"epoch": 0.11051784517831363,
"eval_loss": 1.6017545461654663,
"eval_runtime": 4.9861,
"eval_samples_per_second": 408.736,
"eval_steps_per_second": 3.209,
"step": 4000
},
{
"epoch": 0.11189931824304256,
"grad_norm": 0.7086427807807922,
"learning_rate": 0.0027743214288244904,
"loss": 1.5969778442382812,
"step": 4050
},
{
"epoch": 0.11328079130777148,
"grad_norm": 0.6547996997833252,
"learning_rate": 0.002747749581084317,
"loss": 1.5946481323242188,
"step": 4100
},
{
"epoch": 0.11466226437250039,
"grad_norm": 0.6854317784309387,
"learning_rate": 0.0027198416118399986,
"loss": 1.594525146484375,
"step": 4150
},
{
"epoch": 0.11604373743722932,
"grad_norm": 0.8039860129356384,
"learning_rate": 0.0026906274056440215,
"loss": 1.6002627563476564,
"step": 4200
},
{
"epoch": 0.11742521050195824,
"grad_norm": 0.7050207257270813,
"learning_rate": 0.0026601382458001166,
"loss": 1.5937403869628906,
"step": 4250
},
{
"epoch": 0.11742521050195824,
"eval_loss": 1.5975710153579712,
"eval_runtime": 4.8014,
"eval_samples_per_second": 424.46,
"eval_steps_per_second": 3.332,
"step": 4250
},
{
"epoch": 0.11880668356668715,
"grad_norm": 0.6737009286880493,
"learning_rate": 0.0026284067808643144,
"loss": 1.5923365783691406,
"step": 4300
},
{
"epoch": 0.12018815663141608,
"grad_norm": 0.7063266634941101,
"learning_rate": 0.002595466989684055,
"loss": 1.5977363586425781,
"step": 4350
},
{
"epoch": 0.121569629696145,
"grad_norm": 0.6896716356277466,
"learning_rate": 0.0025613541450127857,
"loss": 1.5926210021972655,
"step": 4400
},
{
"epoch": 0.12295110276087393,
"grad_norm": 0.6772384643554688,
"learning_rate": 0.0025261047757390138,
"loss": 1.5924766540527344,
"step": 4450
},
{
"epoch": 0.12433257582560284,
"grad_norm": 0.6963664293289185,
"learning_rate": 0.002489756627770259,
"loss": 1.5876535034179688,
"step": 4500
},
{
"epoch": 0.12433257582560284,
"eval_loss": 1.5943443775177002,
"eval_runtime": 4.8657,
"eval_samples_per_second": 418.853,
"eval_steps_per_second": 3.288,
"step": 4500
},
{
"epoch": 0.12571404889033175,
"grad_norm": 0.7814108729362488,
"learning_rate": 0.002452348623613788,
"loss": 1.5891021728515624,
"step": 4550
},
{
"epoch": 0.1270955219550607,
"grad_norm": 0.6211883425712585,
"learning_rate": 0.002413920820697419,
"loss": 1.5855482482910157,
"step": 4600
},
{
"epoch": 0.1284769950197896,
"grad_norm": 0.6522833108901978,
"learning_rate": 0.0023745143684750264,
"loss": 1.5884809875488282,
"step": 4650
},
{
"epoch": 0.12985846808451854,
"grad_norm": 0.6828014254570007,
"learning_rate": 0.002334171464362675,
"loss": 1.5833425903320313,
"step": 4700
},
{
"epoch": 0.13123994114924745,
"grad_norm": 0.6603298783302307,
"learning_rate": 0.002292935308552567,
"loss": 1.583031005859375,
"step": 4750
},
{
"epoch": 0.13123994114924745,
"eval_loss": 1.5896168947219849,
"eval_runtime": 4.8861,
"eval_samples_per_second": 417.099,
"eval_steps_per_second": 3.275,
"step": 4750
},
{
"epoch": 0.13262141421397636,
"grad_norm": 0.6717214584350586,
"learning_rate": 0.002250850057753197,
"loss": 1.5836068725585937,
"step": 4800
},
{
"epoch": 0.1340028872787053,
"grad_norm": 0.6846370100975037,
"learning_rate": 0.002207960777905242,
"loss": 1.586727294921875,
"step": 4850
},
{
"epoch": 0.1353843603434342,
"grad_norm": 0.7362879514694214,
"learning_rate": 0.0021643133959238225,
"loss": 1.5847500610351561,
"step": 4900
},
{
"epoch": 0.13676583340816312,
"grad_norm": 0.7345172166824341,
"learning_rate": 0.0021199546505188105,
"loss": 1.5825830078125,
"step": 4950
},
{
"epoch": 0.13814730647289206,
"grad_norm": 0.5534242391586304,
"learning_rate": 0.0020749320421458535,
"loss": 1.5811091613769532,
"step": 5000
},
{
"epoch": 0.13814730647289206,
"eval_loss": 1.5833630561828613,
"eval_runtime": 4.9704,
"eval_samples_per_second": 410.03,
"eval_steps_per_second": 3.219,
"step": 5000
},
{
"epoch": 0.13952877953762097,
"grad_norm": 0.552155613899231,
"learning_rate": 0.002029293782141689,
"loss": 1.5763238525390626,
"step": 5050
},
{
"epoch": 0.14091025260234988,
"grad_norm": 0.7206612825393677,
"learning_rate": 0.001983088741098243,
"loss": 1.5772702026367187,
"step": 5100
},
{
"epoch": 0.14229172566707882,
"grad_norm": 0.6678832769393921,
"learning_rate": 0.001936366396530776,
"loss": 1.5752102661132812,
"step": 5150
},
{
"epoch": 0.14367319873180773,
"grad_norm": 0.6534181237220764,
"learning_rate": 0.0018891767798961177,
"loss": 1.5794488525390624,
"step": 5200
},
{
"epoch": 0.14505467179653664,
"grad_norm": 0.6262516379356384,
"learning_rate": 0.0018415704230177307,
"loss": 1.574145050048828,
"step": 5250
},
{
"epoch": 0.14505467179653664,
"eval_loss": 1.5795270204544067,
"eval_runtime": 4.8927,
"eval_samples_per_second": 416.542,
"eval_steps_per_second": 3.27,
"step": 5250
},
{
"epoch": 0.14643614486126558,
"grad_norm": 0.5793588757514954,
"learning_rate": 0.0017935983039749706,
"loss": 1.5746864318847655,
"step": 5300
},
{
"epoch": 0.1478176179259945,
"grad_norm": 0.6871621012687683,
"learning_rate": 0.0017453117925144783,
"loss": 1.5744833374023437,
"step": 5350
},
{
"epoch": 0.1491990909907234,
"grad_norm": 0.6331185102462769,
"learning_rate": 0.0016967625950421712,
"loss": 1.57496337890625,
"step": 5400
},
{
"epoch": 0.15058056405545234,
"grad_norm": 0.6986100673675537,
"learning_rate": 0.0016480026992547268,
"loss": 1.578210906982422,
"step": 5450
},
{
"epoch": 0.15196203712018125,
"grad_norm": 0.6834849715232849,
"learning_rate": 0.001599084318469858,
"loss": 1.5710919189453125,
"step": 5500
},
{
"epoch": 0.15196203712018125,
"eval_loss": 1.5749062299728394,
"eval_runtime": 4.8609,
"eval_samples_per_second": 419.261,
"eval_steps_per_second": 3.292,
"step": 5500
},
{
"epoch": 0.15334351018491016,
"grad_norm": 0.6833263039588928,
"learning_rate": 0.0015500598357149793,
"loss": 1.5740811157226562,
"step": 5550
},
{
"epoch": 0.1547249832496391,
"grad_norm": 0.8077707886695862,
"learning_rate": 0.001500981747634155,
"loss": 1.5700558471679686,
"step": 5600
},
{
"epoch": 0.156106456314368,
"grad_norm": 0.6584182977676392,
"learning_rate": 0.001451902608273374,
"loss": 1.5697401428222657,
"step": 5650
},
{
"epoch": 0.15748792937909692,
"grad_norm": 0.7573363184928894,
"learning_rate": 0.0014028749728043628,
"loss": 1.5668351745605469,
"step": 5700
},
{
"epoch": 0.15886940244382586,
"grad_norm": 0.6129063963890076,
"learning_rate": 0.0013539513412471889,
"loss": 1.570359344482422,
"step": 5750
},
{
"epoch": 0.15886940244382586,
"eval_loss": 1.5709928274154663,
"eval_runtime": 4.859,
"eval_samples_per_second": 419.431,
"eval_steps_per_second": 3.293,
"step": 5750
},
{
"epoch": 0.16025087550855477,
"grad_norm": 0.5028947591781616,
"learning_rate": 0.0013051841022519272,
"loss": 1.561181640625,
"step": 5800
},
{
"epoch": 0.16163234857328368,
"grad_norm": 0.7434332966804504,
"learning_rate": 0.0012566254769995806,
"loss": 1.5647598266601563,
"step": 5850
},
{
"epoch": 0.16301382163801262,
"grad_norm": 0.5033641457557678,
"learning_rate": 0.0012083274632823304,
"loss": 1.5645637512207031,
"step": 5900
},
{
"epoch": 0.16439529470274153,
"grad_norm": 0.5664800405502319,
"learning_rate": 0.0011603417798229966,
"loss": 1.567978515625,
"step": 5950
},
{
"epoch": 0.16577676776747047,
"grad_norm": 0.6270240545272827,
"learning_rate": 0.0011127198108933402,
"loss": 1.5611529541015625,
"step": 6000
},
{
"epoch": 0.16577676776747047,
"eval_loss": 1.5664807558059692,
"eval_runtime": 4.8532,
"eval_samples_per_second": 419.927,
"eval_steps_per_second": 3.297,
"step": 6000
},
{
"epoch": 0.16715824083219938,
"grad_norm": 0.5457693934440613,
"learning_rate": 0.0010655125512904898,
"loss": 1.5654832458496093,
"step": 6050
},
{
"epoch": 0.1685397138969283,
"grad_norm": 0.5332794785499573,
"learning_rate": 0.0010187705517304413,
"loss": 1.5635955810546875,
"step": 6100
},
{
"epoch": 0.16992118696165723,
"grad_norm": 0.5312942862510681,
"learning_rate": 0.0009725438647170831,
"loss": 1.5631723022460937,
"step": 6150
},
{
"epoch": 0.17130266002638614,
"grad_norm": 0.6611814498901367,
"learning_rate": 0.0009268819909447218,
"loss": 1.5617874145507813,
"step": 6200
},
{
"epoch": 0.17268413309111505,
"grad_norm": 0.5385921001434326,
"learning_rate": 0.000881833826291497,
"loss": 1.5621722412109376,
"step": 6250
},
{
"epoch": 0.17268413309111505,
"eval_loss": 1.5625797510147095,
"eval_runtime": 4.9424,
"eval_samples_per_second": 412.354,
"eval_steps_per_second": 3.237,
"step": 6250
},
{
"epoch": 0.174065606155844,
"grad_norm": 0.48100849986076355,
"learning_rate": 0.0008374476094604538,
"loss": 1.5620567321777343,
"step": 6300
},
{
"epoch": 0.1754470792205729,
"grad_norm": 0.5656850934028625,
"learning_rate": 0.0007937708703243286,
"loss": 1.5645301818847657,
"step": 6350
},
{
"epoch": 0.1768285522853018,
"grad_norm": 0.6062788367271423,
"learning_rate": 0.0007508503790293705,
"loss": 1.5537733459472656,
"step": 6400
},
{
"epoch": 0.17821002535003075,
"grad_norm": 0.5672012567520142,
"learning_rate": 0.0007087320959126999,
"loss": 1.559359130859375,
"step": 6450
},
{
"epoch": 0.17959149841475966,
"grad_norm": 0.5249131321907043,
"learning_rate": 0.0006674611222868254,
"loss": 1.5566461181640625,
"step": 6500
},
{
"epoch": 0.17959149841475966,
"eval_loss": 1.559727430343628,
"eval_runtime": 4.8874,
"eval_samples_per_second": 416.989,
"eval_steps_per_second": 3.274,
"step": 6500
},
{
"epoch": 0.18097297147948857,
"grad_norm": 0.5304768681526184,
"learning_rate": 0.000627081652144031,
"loss": 1.5591546630859374,
"step": 6550
},
{
"epoch": 0.1823544445442175,
"grad_norm": 0.5281299948692322,
"learning_rate": 0.0005876369248323417,
"loss": 1.5576934814453125,
"step": 6600
},
{
"epoch": 0.18373591760894642,
"grad_norm": 0.4922367334365845,
"learning_rate": 0.0005491691787537452,
"loss": 1.5613423156738282,
"step": 6650
},
{
"epoch": 0.18511739067367533,
"grad_norm": 0.6296632289886475,
"learning_rate": 0.000511719606134253,
"loss": 1.5597859191894532,
"step": 6700
},
{
"epoch": 0.18649886373840427,
"grad_norm": 0.49581730365753174,
"learning_rate": 0.00047532830891423806,
"loss": 1.5527120971679687,
"step": 6750
},
{
"epoch": 0.18649886373840427,
"eval_loss": 1.5563873052597046,
"eval_runtime": 4.8751,
"eval_samples_per_second": 418.047,
"eval_steps_per_second": 3.282,
"step": 6750
},
{
"epoch": 0.18788033680313318,
"grad_norm": 0.5099366307258606,
"learning_rate": 0.00044003425580626496,
"loss": 1.549066619873047,
"step": 6800
},
{
"epoch": 0.1892618098678621,
"grad_norm": 0.4683798551559448,
"learning_rate": 0.0004058752405664207,
"loss": 1.5529069519042968,
"step": 6850
},
{
"epoch": 0.19064328293259103,
"grad_norm": 0.5025731921195984,
"learning_rate": 0.0003728878415238149,
"loss": 1.5490866088867188,
"step": 6900
},
{
"epoch": 0.19202475599731994,
"grad_norm": 0.5808431506156921,
"learning_rate": 0.00034110738241158677,
"loss": 1.5539451599121095,
"step": 6950
},
{
"epoch": 0.19340622906204885,
"grad_norm": 0.5575580596923828,
"learning_rate": 0.0003105678945413668,
"loss": 1.5520620727539063,
"step": 7000
},
{
"epoch": 0.19340622906204885,
"eval_loss": 1.5543574094772339,
"eval_runtime": 4.8945,
"eval_samples_per_second": 416.387,
"eval_steps_per_second": 3.269,
"step": 7000
},
{
"epoch": 0.1947877021267778,
"grad_norm": 0.4817080497741699,
"learning_rate": 0.0002813020803616979,
"loss": 1.552979736328125,
"step": 7050
},
{
"epoch": 0.1961691751915067,
"grad_norm": 0.45744574069976807,
"learning_rate": 0.00025334127843943164,
"loss": 1.548302459716797,
"step": 7100
},
{
"epoch": 0.1975506482562356,
"grad_norm": 0.46788737177848816,
"learning_rate": 0.00022671542990160843,
"loss": 1.5542337036132812,
"step": 7150
},
{
"epoch": 0.19893212132096455,
"grad_norm": 0.44763970375061035,
"learning_rate": 0.00020145304637374757,
"loss": 1.5487118530273438,
"step": 7200
},
{
"epoch": 0.20031359438569346,
"grad_norm": 0.4314698576927185,
"learning_rate": 0.0001775811794488842,
"loss": 1.5508662414550782,
"step": 7250
},
{
"epoch": 0.20031359438569346,
"eval_loss": 1.551482915878296,
"eval_runtime": 4.8891,
"eval_samples_per_second": 416.845,
"eval_steps_per_second": 3.273,
"step": 7250
},
{
"epoch": 0.20169506745042237,
"grad_norm": 0.44681674242019653,
"learning_rate": 0.00015512539172004598,
"loss": 1.5449916076660157,
"step": 7300
},
{
"epoch": 0.2030765405151513,
"grad_norm": 0.4624103903770447,
"learning_rate": 0.00013410972940719012,
"loss": 1.5420948791503906,
"step": 7350
},
{
"epoch": 0.20445801357988022,
"grad_norm": 0.42456161975860596,
"learning_rate": 0.00011455669660790574,
"loss": 1.5426979064941406,
"step": 7400
},
{
"epoch": 0.20583948664460916,
"grad_norm": 0.43187159299850464,
"learning_rate": 9.648723119946411e-05,
"loss": 1.55113037109375,
"step": 7450
},
{
"epoch": 0.20722095970933807,
"grad_norm": 0.4058364927768707,
"learning_rate": 7.992068241801543e-05,
"loss": 1.5490814208984376,
"step": 7500
},
{
"epoch": 0.20722095970933807,
"eval_loss": 1.5499120950698853,
"eval_runtime": 4.6438,
"eval_samples_per_second": 438.865,
"eval_steps_per_second": 3.445,
"step": 7500
},
{
"epoch": 0.20860243277406698,
"grad_norm": 0.41115882992744446,
"learning_rate": 6.487479013894215e-05,
"loss": 1.53897705078125,
"step": 7550
},
{
"epoch": 0.20998390583879592,
"grad_norm": 0.40895798802375793,
"learning_rate": 5.1365665880554635e-05,
"loss": 1.5461245727539064,
"step": 7600
},
{
"epoch": 0.21136537890352483,
"grad_norm": 0.43710294365882874,
"learning_rate": 3.940777555147568e-05,
"loss": 1.5500086975097656,
"step": 7650
},
{
"epoch": 0.21274685196825374,
"grad_norm": 0.37500861287117004,
"learning_rate": 2.9013923960182153e-05,
"loss": 1.5431840515136719,
"step": 7700
},
{
"epoch": 0.21412832503298268,
"grad_norm": 0.4327012598514557,
"learning_rate": 2.019524110329557e-05,
"loss": 1.5467581176757812,
"step": 7750
},
{
"epoch": 0.21412832503298268,
"eval_loss": 1.548779010772705,
"eval_runtime": 5.0548,
"eval_samples_per_second": 403.183,
"eval_steps_per_second": 3.165,
"step": 7750
},
{
"epoch": 0.2155097980977116,
"grad_norm": 0.3742528557777405,
"learning_rate": 1.2961170247303034e-05,
"loss": 1.543158721923828,
"step": 7800
},
{
"epoch": 0.2168912711624405,
"grad_norm": 0.39662519097328186,
"learning_rate": 7.319457816470754e-06,
"loss": 1.5452882385253905,
"step": 7850
},
{
"epoch": 0.21827274422716944,
"grad_norm": 0.439929336309433,
"learning_rate": 3.276145097779237e-06,
"loss": 1.54449462890625,
"step": 7900
},
{
"epoch": 0.21965421729189835,
"grad_norm": 0.3996962904930115,
"learning_rate": 8.355617717617503e-07,
"loss": 1.5445120239257812,
"step": 7950
},
{
"epoch": 0.22103569035662726,
"grad_norm": 0.3886605203151703,
"learning_rate": 3.2127617349830827e-10,
"loss": 1.541259765625,
"step": 8000
},
{
"epoch": 0.22103569035662726,
"eval_loss": 1.5484822988510132,
"eval_runtime": 10.2225,
"eval_samples_per_second": 199.364,
"eval_steps_per_second": 1.565,
"step": 8000
}
],
"logging_steps": 50,
"max_steps": 8000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 110584922112000.0,
"train_batch_size": 128,
"trial_name": null,
"trial_params": null
}