hartular's picture
Upload training checkpoint at step 1000
620c534 verified
Raw
History Blame Contribute Delete
18.2 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.16,
"eval_steps": 250,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0016,
"grad_norm": NaN,
"learning_rate": 9.574468085106383e-06,
"loss": 0.6083179950714112,
"step": 10
},
{
"epoch": 0.0032,
"grad_norm": 0.2735198438167572,
"learning_rate": 1.9148936170212766e-05,
"loss": 0.6088993072509765,
"step": 20
},
{
"epoch": 0.0048,
"grad_norm": 0.15276113152503967,
"learning_rate": 2.9787234042553192e-05,
"loss": 0.5225989818572998,
"step": 30
},
{
"epoch": 0.0064,
"grad_norm": 0.17109858989715576,
"learning_rate": 4.0425531914893614e-05,
"loss": 0.4329381942749023,
"step": 40
},
{
"epoch": 0.008,
"grad_norm": 0.17585736513137817,
"learning_rate": 5.1063829787234044e-05,
"loss": 0.35364015102386476,
"step": 50
},
{
"epoch": 0.0096,
"grad_norm": 0.16095905005931854,
"learning_rate": 6.170212765957447e-05,
"loss": 0.26982028484344484,
"step": 60
},
{
"epoch": 0.0112,
"grad_norm": 0.11053046584129333,
"learning_rate": 7.23404255319149e-05,
"loss": 0.20504410266876222,
"step": 70
},
{
"epoch": 0.0128,
"grad_norm": 0.12669840455055237,
"learning_rate": 8.297872340425533e-05,
"loss": 0.19483240842819213,
"step": 80
},
{
"epoch": 0.0144,
"grad_norm": 0.11641468852758408,
"learning_rate": 9.361702127659576e-05,
"loss": 0.17770581245422362,
"step": 90
},
{
"epoch": 0.016,
"grad_norm": 0.14681392908096313,
"learning_rate": 0.00010425531914893618,
"loss": 0.15753360986709594,
"step": 100
},
{
"epoch": 0.0176,
"grad_norm": 0.09883147478103638,
"learning_rate": 0.00011489361702127661,
"loss": 0.16169432401657105,
"step": 110
},
{
"epoch": 0.0192,
"grad_norm": 0.1138603463768959,
"learning_rate": 0.00012553191489361702,
"loss": 0.16089822053909303,
"step": 120
},
{
"epoch": 0.0208,
"grad_norm": 0.13063949346542358,
"learning_rate": 0.00013617021276595746,
"loss": 0.1603950023651123,
"step": 130
},
{
"epoch": 0.0224,
"grad_norm": 0.06824357807636261,
"learning_rate": 0.00014680851063829788,
"loss": 0.14956578016281127,
"step": 140
},
{
"epoch": 0.024,
"grad_norm": 0.12136659771203995,
"learning_rate": 0.00015744680851063832,
"loss": 0.1617922306060791,
"step": 150
},
{
"epoch": 0.0256,
"grad_norm": 0.10032546520233154,
"learning_rate": 0.00016808510638297873,
"loss": 0.1547396659851074,
"step": 160
},
{
"epoch": 0.0272,
"grad_norm": 0.07678422331809998,
"learning_rate": 0.00017872340425531915,
"loss": 0.14475579261779786,
"step": 170
},
{
"epoch": 0.0288,
"grad_norm": 0.10933304578065872,
"learning_rate": 0.00018936170212765957,
"loss": 0.1330868124961853,
"step": 180
},
{
"epoch": 0.0304,
"grad_norm": 0.12041473388671875,
"learning_rate": 0.0002,
"loss": 0.14836544990539552,
"step": 190
},
{
"epoch": 0.032,
"grad_norm": 0.0896446481347084,
"learning_rate": 0.00019967007588254704,
"loss": 0.14405652284622192,
"step": 200
},
{
"epoch": 0.0336,
"grad_norm": 0.0876811295747757,
"learning_rate": 0.00019934015176509403,
"loss": 0.14646297693252563,
"step": 210
},
{
"epoch": 0.0352,
"grad_norm": 0.09327778220176697,
"learning_rate": 0.00019901022764764106,
"loss": 0.14419257640838623,
"step": 220
},
{
"epoch": 0.0368,
"grad_norm": 0.08388442546129227,
"learning_rate": 0.00019868030353018806,
"loss": 0.15150091648101807,
"step": 230
},
{
"epoch": 0.0384,
"grad_norm": 0.09979762881994247,
"learning_rate": 0.00019835037941273509,
"loss": 0.14006744623184203,
"step": 240
},
{
"epoch": 0.04,
"grad_norm": 0.0845855325460434,
"learning_rate": 0.0001980204552952821,
"loss": 0.15045372247695923,
"step": 250
},
{
"epoch": 0.0416,
"grad_norm": 0.09481288492679596,
"learning_rate": 0.0001976905311778291,
"loss": 0.15042688846588134,
"step": 260
},
{
"epoch": 0.0432,
"grad_norm": 0.10349375009536743,
"learning_rate": 0.0001973606070603761,
"loss": 0.13992291688919067,
"step": 270
},
{
"epoch": 0.0448,
"grad_norm": 0.07897678017616272,
"learning_rate": 0.00019703068294292314,
"loss": 0.13927781581878662,
"step": 280
},
{
"epoch": 0.0464,
"grad_norm": 0.08341789990663528,
"learning_rate": 0.00019670075882547014,
"loss": 0.14076149463653564,
"step": 290
},
{
"epoch": 0.048,
"grad_norm": 0.10565593093633652,
"learning_rate": 0.00019637083470801716,
"loss": 0.14325612783432007,
"step": 300
},
{
"epoch": 0.0496,
"grad_norm": 0.07861499488353729,
"learning_rate": 0.0001960409105905642,
"loss": 0.1343199133872986,
"step": 310
},
{
"epoch": 0.0512,
"grad_norm": 0.09252545982599258,
"learning_rate": 0.0001957109864731112,
"loss": 0.12891001701354982,
"step": 320
},
{
"epoch": 0.0528,
"grad_norm": 0.08716761320829391,
"learning_rate": 0.0001953810623556582,
"loss": 0.1449826717376709,
"step": 330
},
{
"epoch": 0.0544,
"grad_norm": 0.07750111818313599,
"learning_rate": 0.0001950511382382052,
"loss": 0.1274427056312561,
"step": 340
},
{
"epoch": 0.056,
"grad_norm": 0.07396410405635834,
"learning_rate": 0.00019472121412075224,
"loss": 0.12241615056991577,
"step": 350
},
{
"epoch": 0.0576,
"grad_norm": 0.07157568633556366,
"learning_rate": 0.00019439129000329926,
"loss": 0.14313431978225707,
"step": 360
},
{
"epoch": 0.0592,
"grad_norm": 0.08780192583799362,
"learning_rate": 0.00019406136588584626,
"loss": 0.13534088134765626,
"step": 370
},
{
"epoch": 0.0608,
"grad_norm": 0.09394513815641403,
"learning_rate": 0.0001937314417683933,
"loss": 0.1249586820602417,
"step": 380
},
{
"epoch": 0.0624,
"grad_norm": 0.0853569507598877,
"learning_rate": 0.0001934015176509403,
"loss": 0.13353261947631836,
"step": 390
},
{
"epoch": 0.064,
"grad_norm": 0.08356380462646484,
"learning_rate": 0.00019307159353348731,
"loss": 0.12304072380065918,
"step": 400
},
{
"epoch": 0.0656,
"grad_norm": 0.08608467876911163,
"learning_rate": 0.00019274166941603434,
"loss": 0.13379846811294555,
"step": 410
},
{
"epoch": 0.0672,
"grad_norm": 0.07890665531158447,
"learning_rate": 0.0001924117452985813,
"loss": 0.11951367855072022,
"step": 420
},
{
"epoch": 0.0688,
"grad_norm": 0.08108149468898773,
"learning_rate": 0.00019208182118112834,
"loss": 0.12902278900146485,
"step": 430
},
{
"epoch": 0.0704,
"grad_norm": 0.09603618830442429,
"learning_rate": 0.00019175189706367536,
"loss": 0.12690144777297974,
"step": 440
},
{
"epoch": 0.072,
"grad_norm": 0.09471320360898972,
"learning_rate": 0.00019142197294622236,
"loss": 0.13802603483200074,
"step": 450
},
{
"epoch": 0.0736,
"grad_norm": 0.08374392986297607,
"learning_rate": 0.0001910920488287694,
"loss": 0.12328752279281616,
"step": 460
},
{
"epoch": 0.0752,
"grad_norm": 0.08944465219974518,
"learning_rate": 0.00019076212471131642,
"loss": 0.12756569385528566,
"step": 470
},
{
"epoch": 0.0768,
"grad_norm": 0.0898577868938446,
"learning_rate": 0.00019043220059386341,
"loss": 0.13218681812286376,
"step": 480
},
{
"epoch": 0.0784,
"grad_norm": 0.07767961174249649,
"learning_rate": 0.00019010227647641044,
"loss": 0.135015869140625,
"step": 490
},
{
"epoch": 0.08,
"grad_norm": 0.0865555852651596,
"learning_rate": 0.00018977235235895744,
"loss": 0.128175950050354,
"step": 500
},
{
"epoch": 0.0816,
"grad_norm": 0.07919178158044815,
"learning_rate": 0.00018944242824150447,
"loss": 0.12430660724639893,
"step": 510
},
{
"epoch": 0.0832,
"grad_norm": 0.08649525046348572,
"learning_rate": 0.0001891125041240515,
"loss": 0.12590073347091674,
"step": 520
},
{
"epoch": 0.0848,
"grad_norm": 0.08704695850610733,
"learning_rate": 0.0001887825800065985,
"loss": 0.12156925201416016,
"step": 530
},
{
"epoch": 0.0864,
"grad_norm": 0.06752946227788925,
"learning_rate": 0.00018845265588914552,
"loss": 0.12604955434799195,
"step": 540
},
{
"epoch": 0.088,
"grad_norm": 0.09034618735313416,
"learning_rate": 0.00018812273177169252,
"loss": 0.13052459955215454,
"step": 550
},
{
"epoch": 0.0896,
"grad_norm": 0.0869947075843811,
"learning_rate": 0.00018779280765423954,
"loss": 0.12303999662399293,
"step": 560
},
{
"epoch": 0.0912,
"grad_norm": 0.0702558308839798,
"learning_rate": 0.00018746288353678654,
"loss": 0.12230894565582276,
"step": 570
},
{
"epoch": 0.0928,
"grad_norm": 0.08718933910131454,
"learning_rate": 0.00018713295941933354,
"loss": 0.1285646677017212,
"step": 580
},
{
"epoch": 0.0944,
"grad_norm": 0.07396125048398972,
"learning_rate": 0.00018680303530188057,
"loss": 0.1259121775627136,
"step": 590
},
{
"epoch": 0.096,
"grad_norm": 0.10813502222299576,
"learning_rate": 0.0001864731111844276,
"loss": 0.12581136226654052,
"step": 600
},
{
"epoch": 0.0976,
"grad_norm": 0.07332257181406021,
"learning_rate": 0.0001861431870669746,
"loss": 0.120159912109375,
"step": 610
},
{
"epoch": 0.0992,
"grad_norm": 0.08529425412416458,
"learning_rate": 0.00018581326294952162,
"loss": 0.1297559142112732,
"step": 620
},
{
"epoch": 0.1008,
"grad_norm": 0.09605136513710022,
"learning_rate": 0.00018548333883206864,
"loss": 0.12067115306854248,
"step": 630
},
{
"epoch": 0.1024,
"grad_norm": 0.08586304634809494,
"learning_rate": 0.00018515341471461564,
"loss": 0.12730380296707153,
"step": 640
},
{
"epoch": 0.104,
"grad_norm": 0.06986010074615479,
"learning_rate": 0.00018482349059716267,
"loss": 0.12864140272140503,
"step": 650
},
{
"epoch": 0.1056,
"grad_norm": 0.08565957844257355,
"learning_rate": 0.00018449356647970967,
"loss": 0.13535914421081544,
"step": 660
},
{
"epoch": 0.1072,
"grad_norm": 0.07841351628303528,
"learning_rate": 0.0001841636423622567,
"loss": 0.12447234392166137,
"step": 670
},
{
"epoch": 0.1088,
"grad_norm": 0.07424665987491608,
"learning_rate": 0.00018383371824480372,
"loss": 0.12037907838821411,
"step": 680
},
{
"epoch": 0.1104,
"grad_norm": 0.0957612544298172,
"learning_rate": 0.00018350379412735072,
"loss": 0.11919810771942138,
"step": 690
},
{
"epoch": 0.112,
"grad_norm": 0.07862170785665512,
"learning_rate": 0.00018317387000989775,
"loss": 0.12414863109588622,
"step": 700
},
{
"epoch": 0.1136,
"grad_norm": 0.12410055845975876,
"learning_rate": 0.00018284394589244474,
"loss": 0.12083030939102173,
"step": 710
},
{
"epoch": 0.1152,
"grad_norm": 0.07692275941371918,
"learning_rate": 0.00018251402177499174,
"loss": 0.11559462547302246,
"step": 720
},
{
"epoch": 0.1168,
"grad_norm": 0.07810766994953156,
"learning_rate": 0.00018218409765753877,
"loss": 0.12092136144638062,
"step": 730
},
{
"epoch": 0.1184,
"grad_norm": 0.08475863188505173,
"learning_rate": 0.00018185417354008577,
"loss": 0.12225215435028076,
"step": 740
},
{
"epoch": 0.12,
"grad_norm": 0.09497244656085968,
"learning_rate": 0.0001815242494226328,
"loss": 0.12478446960449219,
"step": 750
},
{
"epoch": 0.1216,
"grad_norm": 0.07779653370380402,
"learning_rate": 0.00018119432530517982,
"loss": 0.11081166267395019,
"step": 760
},
{
"epoch": 0.1232,
"grad_norm": 0.08435814827680588,
"learning_rate": 0.00018086440118772682,
"loss": 0.10844987630844116,
"step": 770
},
{
"epoch": 0.1248,
"grad_norm": 0.07567104697227478,
"learning_rate": 0.00018053447707027385,
"loss": 0.11887184381484986,
"step": 780
},
{
"epoch": 0.1264,
"grad_norm": 0.07750700414180756,
"learning_rate": 0.00018020455295282087,
"loss": 0.11811846494674683,
"step": 790
},
{
"epoch": 0.128,
"grad_norm": 0.09390198439359665,
"learning_rate": 0.00017987462883536787,
"loss": 0.11379201412200927,
"step": 800
},
{
"epoch": 0.1296,
"grad_norm": 0.08400580286979675,
"learning_rate": 0.0001795447047179149,
"loss": 0.11909257173538208,
"step": 810
},
{
"epoch": 0.1312,
"grad_norm": 0.09543855488300323,
"learning_rate": 0.0001792147806004619,
"loss": 0.10916774272918701,
"step": 820
},
{
"epoch": 0.1328,
"grad_norm": 0.07908441871404648,
"learning_rate": 0.00017888485648300892,
"loss": 0.107346510887146,
"step": 830
},
{
"epoch": 0.1344,
"grad_norm": 0.1085224449634552,
"learning_rate": 0.00017855493236555595,
"loss": 0.12227011919021606,
"step": 840
},
{
"epoch": 0.136,
"grad_norm": 0.07472517341375351,
"learning_rate": 0.00017822500824810295,
"loss": 0.11575174331665039,
"step": 850
},
{
"epoch": 0.1376,
"grad_norm": 0.07198534905910492,
"learning_rate": 0.00017789508413064997,
"loss": 0.12281327247619629,
"step": 860
},
{
"epoch": 0.1392,
"grad_norm": 0.09142109006643295,
"learning_rate": 0.00017756516001319697,
"loss": 0.11497378349304199,
"step": 870
},
{
"epoch": 0.1408,
"grad_norm": 0.09548252075910568,
"learning_rate": 0.00017723523589574397,
"loss": 0.11615512371063233,
"step": 880
},
{
"epoch": 0.1424,
"grad_norm": 0.06250233203172684,
"learning_rate": 0.000176905311778291,
"loss": 0.11593252420425415,
"step": 890
},
{
"epoch": 0.144,
"grad_norm": 0.08740886300802231,
"learning_rate": 0.000176575387660838,
"loss": 0.11546707153320312,
"step": 900
},
{
"epoch": 0.1456,
"grad_norm": 0.11061470210552216,
"learning_rate": 0.00017624546354338502,
"loss": 0.12130849361419678,
"step": 910
},
{
"epoch": 0.1472,
"grad_norm": 0.07824647426605225,
"learning_rate": 0.00017591553942593205,
"loss": 0.1188379168510437,
"step": 920
},
{
"epoch": 0.1488,
"grad_norm": 0.08214984834194183,
"learning_rate": 0.00017558561530847905,
"loss": 0.11806504726409912,
"step": 930
},
{
"epoch": 0.1504,
"grad_norm": 0.09313149005174637,
"learning_rate": 0.00017525569119102607,
"loss": 0.11112408638000489,
"step": 940
},
{
"epoch": 0.152,
"grad_norm": 0.08523363620042801,
"learning_rate": 0.0001749257670735731,
"loss": 0.1136185884475708,
"step": 950
},
{
"epoch": 0.1536,
"grad_norm": 0.06718438863754272,
"learning_rate": 0.0001745958429561201,
"loss": 0.1142117738723755,
"step": 960
},
{
"epoch": 0.1552,
"grad_norm": 0.08877789974212646,
"learning_rate": 0.00017426591883866713,
"loss": 0.11236680746078491,
"step": 970
},
{
"epoch": 0.1568,
"grad_norm": 0.07814772427082062,
"learning_rate": 0.00017393599472121412,
"loss": 0.10925638675689697,
"step": 980
},
{
"epoch": 0.1584,
"grad_norm": 0.08659686148166656,
"learning_rate": 0.00017360607060376115,
"loss": 0.11623308658599854,
"step": 990
},
{
"epoch": 0.16,
"grad_norm": 0.08823436498641968,
"learning_rate": 0.00017327614648630818,
"loss": 0.11374906301498414,
"step": 1000
}
],
"logging_steps": 10,
"max_steps": 6250,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.8688917455755264e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}