hartular's picture
Upload training checkpoint at step 1500
ea88643 verified
Raw
History Blame Contribute Delete
27.1 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.24,
"eval_steps": 250,
"global_step": 1500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0016,
"grad_norm": NaN,
"learning_rate": 9.574468085106383e-06,
"loss": 0.6083179950714112,
"step": 10
},
{
"epoch": 0.0032,
"grad_norm": 0.2735198438167572,
"learning_rate": 1.9148936170212766e-05,
"loss": 0.6088993072509765,
"step": 20
},
{
"epoch": 0.0048,
"grad_norm": 0.15276113152503967,
"learning_rate": 2.9787234042553192e-05,
"loss": 0.5225989818572998,
"step": 30
},
{
"epoch": 0.0064,
"grad_norm": 0.17109858989715576,
"learning_rate": 4.0425531914893614e-05,
"loss": 0.4329381942749023,
"step": 40
},
{
"epoch": 0.008,
"grad_norm": 0.17585736513137817,
"learning_rate": 5.1063829787234044e-05,
"loss": 0.35364015102386476,
"step": 50
},
{
"epoch": 0.0096,
"grad_norm": 0.16095905005931854,
"learning_rate": 6.170212765957447e-05,
"loss": 0.26982028484344484,
"step": 60
},
{
"epoch": 0.0112,
"grad_norm": 0.11053046584129333,
"learning_rate": 7.23404255319149e-05,
"loss": 0.20504410266876222,
"step": 70
},
{
"epoch": 0.0128,
"grad_norm": 0.12669840455055237,
"learning_rate": 8.297872340425533e-05,
"loss": 0.19483240842819213,
"step": 80
},
{
"epoch": 0.0144,
"grad_norm": 0.11641468852758408,
"learning_rate": 9.361702127659576e-05,
"loss": 0.17770581245422362,
"step": 90
},
{
"epoch": 0.016,
"grad_norm": 0.14681392908096313,
"learning_rate": 0.00010425531914893618,
"loss": 0.15753360986709594,
"step": 100
},
{
"epoch": 0.0176,
"grad_norm": 0.09883147478103638,
"learning_rate": 0.00011489361702127661,
"loss": 0.16169432401657105,
"step": 110
},
{
"epoch": 0.0192,
"grad_norm": 0.1138603463768959,
"learning_rate": 0.00012553191489361702,
"loss": 0.16089822053909303,
"step": 120
},
{
"epoch": 0.0208,
"grad_norm": 0.13063949346542358,
"learning_rate": 0.00013617021276595746,
"loss": 0.1603950023651123,
"step": 130
},
{
"epoch": 0.0224,
"grad_norm": 0.06824357807636261,
"learning_rate": 0.00014680851063829788,
"loss": 0.14956578016281127,
"step": 140
},
{
"epoch": 0.024,
"grad_norm": 0.12136659771203995,
"learning_rate": 0.00015744680851063832,
"loss": 0.1617922306060791,
"step": 150
},
{
"epoch": 0.0256,
"grad_norm": 0.10032546520233154,
"learning_rate": 0.00016808510638297873,
"loss": 0.1547396659851074,
"step": 160
},
{
"epoch": 0.0272,
"grad_norm": 0.07678422331809998,
"learning_rate": 0.00017872340425531915,
"loss": 0.14475579261779786,
"step": 170
},
{
"epoch": 0.0288,
"grad_norm": 0.10933304578065872,
"learning_rate": 0.00018936170212765957,
"loss": 0.1330868124961853,
"step": 180
},
{
"epoch": 0.0304,
"grad_norm": 0.12041473388671875,
"learning_rate": 0.0002,
"loss": 0.14836544990539552,
"step": 190
},
{
"epoch": 0.032,
"grad_norm": 0.0896446481347084,
"learning_rate": 0.00019967007588254704,
"loss": 0.14405652284622192,
"step": 200
},
{
"epoch": 0.0336,
"grad_norm": 0.0876811295747757,
"learning_rate": 0.00019934015176509403,
"loss": 0.14646297693252563,
"step": 210
},
{
"epoch": 0.0352,
"grad_norm": 0.09327778220176697,
"learning_rate": 0.00019901022764764106,
"loss": 0.14419257640838623,
"step": 220
},
{
"epoch": 0.0368,
"grad_norm": 0.08388442546129227,
"learning_rate": 0.00019868030353018806,
"loss": 0.15150091648101807,
"step": 230
},
{
"epoch": 0.0384,
"grad_norm": 0.09979762881994247,
"learning_rate": 0.00019835037941273509,
"loss": 0.14006744623184203,
"step": 240
},
{
"epoch": 0.04,
"grad_norm": 0.0845855325460434,
"learning_rate": 0.0001980204552952821,
"loss": 0.15045372247695923,
"step": 250
},
{
"epoch": 0.0416,
"grad_norm": 0.09481288492679596,
"learning_rate": 0.0001976905311778291,
"loss": 0.15042688846588134,
"step": 260
},
{
"epoch": 0.0432,
"grad_norm": 0.10349375009536743,
"learning_rate": 0.0001973606070603761,
"loss": 0.13992291688919067,
"step": 270
},
{
"epoch": 0.0448,
"grad_norm": 0.07897678017616272,
"learning_rate": 0.00019703068294292314,
"loss": 0.13927781581878662,
"step": 280
},
{
"epoch": 0.0464,
"grad_norm": 0.08341789990663528,
"learning_rate": 0.00019670075882547014,
"loss": 0.14076149463653564,
"step": 290
},
{
"epoch": 0.048,
"grad_norm": 0.10565593093633652,
"learning_rate": 0.00019637083470801716,
"loss": 0.14325612783432007,
"step": 300
},
{
"epoch": 0.0496,
"grad_norm": 0.07861499488353729,
"learning_rate": 0.0001960409105905642,
"loss": 0.1343199133872986,
"step": 310
},
{
"epoch": 0.0512,
"grad_norm": 0.09252545982599258,
"learning_rate": 0.0001957109864731112,
"loss": 0.12891001701354982,
"step": 320
},
{
"epoch": 0.0528,
"grad_norm": 0.08716761320829391,
"learning_rate": 0.0001953810623556582,
"loss": 0.1449826717376709,
"step": 330
},
{
"epoch": 0.0544,
"grad_norm": 0.07750111818313599,
"learning_rate": 0.0001950511382382052,
"loss": 0.1274427056312561,
"step": 340
},
{
"epoch": 0.056,
"grad_norm": 0.07396410405635834,
"learning_rate": 0.00019472121412075224,
"loss": 0.12241615056991577,
"step": 350
},
{
"epoch": 0.0576,
"grad_norm": 0.07157568633556366,
"learning_rate": 0.00019439129000329926,
"loss": 0.14313431978225707,
"step": 360
},
{
"epoch": 0.0592,
"grad_norm": 0.08780192583799362,
"learning_rate": 0.00019406136588584626,
"loss": 0.13534088134765626,
"step": 370
},
{
"epoch": 0.0608,
"grad_norm": 0.09394513815641403,
"learning_rate": 0.0001937314417683933,
"loss": 0.1249586820602417,
"step": 380
},
{
"epoch": 0.0624,
"grad_norm": 0.0853569507598877,
"learning_rate": 0.0001934015176509403,
"loss": 0.13353261947631836,
"step": 390
},
{
"epoch": 0.064,
"grad_norm": 0.08356380462646484,
"learning_rate": 0.00019307159353348731,
"loss": 0.12304072380065918,
"step": 400
},
{
"epoch": 0.0656,
"grad_norm": 0.08608467876911163,
"learning_rate": 0.00019274166941603434,
"loss": 0.13379846811294555,
"step": 410
},
{
"epoch": 0.0672,
"grad_norm": 0.07890665531158447,
"learning_rate": 0.0001924117452985813,
"loss": 0.11951367855072022,
"step": 420
},
{
"epoch": 0.0688,
"grad_norm": 0.08108149468898773,
"learning_rate": 0.00019208182118112834,
"loss": 0.12902278900146485,
"step": 430
},
{
"epoch": 0.0704,
"grad_norm": 0.09603618830442429,
"learning_rate": 0.00019175189706367536,
"loss": 0.12690144777297974,
"step": 440
},
{
"epoch": 0.072,
"grad_norm": 0.09471320360898972,
"learning_rate": 0.00019142197294622236,
"loss": 0.13802603483200074,
"step": 450
},
{
"epoch": 0.0736,
"grad_norm": 0.08374392986297607,
"learning_rate": 0.0001910920488287694,
"loss": 0.12328752279281616,
"step": 460
},
{
"epoch": 0.0752,
"grad_norm": 0.08944465219974518,
"learning_rate": 0.00019076212471131642,
"loss": 0.12756569385528566,
"step": 470
},
{
"epoch": 0.0768,
"grad_norm": 0.0898577868938446,
"learning_rate": 0.00019043220059386341,
"loss": 0.13218681812286376,
"step": 480
},
{
"epoch": 0.0784,
"grad_norm": 0.07767961174249649,
"learning_rate": 0.00019010227647641044,
"loss": 0.135015869140625,
"step": 490
},
{
"epoch": 0.08,
"grad_norm": 0.0865555852651596,
"learning_rate": 0.00018977235235895744,
"loss": 0.128175950050354,
"step": 500
},
{
"epoch": 0.0816,
"grad_norm": 0.07919178158044815,
"learning_rate": 0.00018944242824150447,
"loss": 0.12430660724639893,
"step": 510
},
{
"epoch": 0.0832,
"grad_norm": 0.08649525046348572,
"learning_rate": 0.0001891125041240515,
"loss": 0.12590073347091674,
"step": 520
},
{
"epoch": 0.0848,
"grad_norm": 0.08704695850610733,
"learning_rate": 0.0001887825800065985,
"loss": 0.12156925201416016,
"step": 530
},
{
"epoch": 0.0864,
"grad_norm": 0.06752946227788925,
"learning_rate": 0.00018845265588914552,
"loss": 0.12604955434799195,
"step": 540
},
{
"epoch": 0.088,
"grad_norm": 0.09034618735313416,
"learning_rate": 0.00018812273177169252,
"loss": 0.13052459955215454,
"step": 550
},
{
"epoch": 0.0896,
"grad_norm": 0.0869947075843811,
"learning_rate": 0.00018779280765423954,
"loss": 0.12303999662399293,
"step": 560
},
{
"epoch": 0.0912,
"grad_norm": 0.0702558308839798,
"learning_rate": 0.00018746288353678654,
"loss": 0.12230894565582276,
"step": 570
},
{
"epoch": 0.0928,
"grad_norm": 0.08718933910131454,
"learning_rate": 0.00018713295941933354,
"loss": 0.1285646677017212,
"step": 580
},
{
"epoch": 0.0944,
"grad_norm": 0.07396125048398972,
"learning_rate": 0.00018680303530188057,
"loss": 0.1259121775627136,
"step": 590
},
{
"epoch": 0.096,
"grad_norm": 0.10813502222299576,
"learning_rate": 0.0001864731111844276,
"loss": 0.12581136226654052,
"step": 600
},
{
"epoch": 0.0976,
"grad_norm": 0.07332257181406021,
"learning_rate": 0.0001861431870669746,
"loss": 0.120159912109375,
"step": 610
},
{
"epoch": 0.0992,
"grad_norm": 0.08529425412416458,
"learning_rate": 0.00018581326294952162,
"loss": 0.1297559142112732,
"step": 620
},
{
"epoch": 0.1008,
"grad_norm": 0.09605136513710022,
"learning_rate": 0.00018548333883206864,
"loss": 0.12067115306854248,
"step": 630
},
{
"epoch": 0.1024,
"grad_norm": 0.08586304634809494,
"learning_rate": 0.00018515341471461564,
"loss": 0.12730380296707153,
"step": 640
},
{
"epoch": 0.104,
"grad_norm": 0.06986010074615479,
"learning_rate": 0.00018482349059716267,
"loss": 0.12864140272140503,
"step": 650
},
{
"epoch": 0.1056,
"grad_norm": 0.08565957844257355,
"learning_rate": 0.00018449356647970967,
"loss": 0.13535914421081544,
"step": 660
},
{
"epoch": 0.1072,
"grad_norm": 0.07841351628303528,
"learning_rate": 0.0001841636423622567,
"loss": 0.12447234392166137,
"step": 670
},
{
"epoch": 0.1088,
"grad_norm": 0.07424665987491608,
"learning_rate": 0.00018383371824480372,
"loss": 0.12037907838821411,
"step": 680
},
{
"epoch": 0.1104,
"grad_norm": 0.0957612544298172,
"learning_rate": 0.00018350379412735072,
"loss": 0.11919810771942138,
"step": 690
},
{
"epoch": 0.112,
"grad_norm": 0.07862170785665512,
"learning_rate": 0.00018317387000989775,
"loss": 0.12414863109588622,
"step": 700
},
{
"epoch": 0.1136,
"grad_norm": 0.12410055845975876,
"learning_rate": 0.00018284394589244474,
"loss": 0.12083030939102173,
"step": 710
},
{
"epoch": 0.1152,
"grad_norm": 0.07692275941371918,
"learning_rate": 0.00018251402177499174,
"loss": 0.11559462547302246,
"step": 720
},
{
"epoch": 0.1168,
"grad_norm": 0.07810766994953156,
"learning_rate": 0.00018218409765753877,
"loss": 0.12092136144638062,
"step": 730
},
{
"epoch": 0.1184,
"grad_norm": 0.08475863188505173,
"learning_rate": 0.00018185417354008577,
"loss": 0.12225215435028076,
"step": 740
},
{
"epoch": 0.12,
"grad_norm": 0.09497244656085968,
"learning_rate": 0.0001815242494226328,
"loss": 0.12478446960449219,
"step": 750
},
{
"epoch": 0.1216,
"grad_norm": 0.07779653370380402,
"learning_rate": 0.00018119432530517982,
"loss": 0.11081166267395019,
"step": 760
},
{
"epoch": 0.1232,
"grad_norm": 0.08435814827680588,
"learning_rate": 0.00018086440118772682,
"loss": 0.10844987630844116,
"step": 770
},
{
"epoch": 0.1248,
"grad_norm": 0.07567104697227478,
"learning_rate": 0.00018053447707027385,
"loss": 0.11887184381484986,
"step": 780
},
{
"epoch": 0.1264,
"grad_norm": 0.07750700414180756,
"learning_rate": 0.00018020455295282087,
"loss": 0.11811846494674683,
"step": 790
},
{
"epoch": 0.128,
"grad_norm": 0.09390198439359665,
"learning_rate": 0.00017987462883536787,
"loss": 0.11379201412200927,
"step": 800
},
{
"epoch": 0.1296,
"grad_norm": 0.08400580286979675,
"learning_rate": 0.0001795447047179149,
"loss": 0.11909257173538208,
"step": 810
},
{
"epoch": 0.1312,
"grad_norm": 0.09543855488300323,
"learning_rate": 0.0001792147806004619,
"loss": 0.10916774272918701,
"step": 820
},
{
"epoch": 0.1328,
"grad_norm": 0.07908441871404648,
"learning_rate": 0.00017888485648300892,
"loss": 0.107346510887146,
"step": 830
},
{
"epoch": 0.1344,
"grad_norm": 0.1085224449634552,
"learning_rate": 0.00017855493236555595,
"loss": 0.12227011919021606,
"step": 840
},
{
"epoch": 0.136,
"grad_norm": 0.07472517341375351,
"learning_rate": 0.00017822500824810295,
"loss": 0.11575174331665039,
"step": 850
},
{
"epoch": 0.1376,
"grad_norm": 0.07198534905910492,
"learning_rate": 0.00017789508413064997,
"loss": 0.12281327247619629,
"step": 860
},
{
"epoch": 0.1392,
"grad_norm": 0.09142109006643295,
"learning_rate": 0.00017756516001319697,
"loss": 0.11497378349304199,
"step": 870
},
{
"epoch": 0.1408,
"grad_norm": 0.09548252075910568,
"learning_rate": 0.00017723523589574397,
"loss": 0.11615512371063233,
"step": 880
},
{
"epoch": 0.1424,
"grad_norm": 0.06250233203172684,
"learning_rate": 0.000176905311778291,
"loss": 0.11593252420425415,
"step": 890
},
{
"epoch": 0.144,
"grad_norm": 0.08740886300802231,
"learning_rate": 0.000176575387660838,
"loss": 0.11546707153320312,
"step": 900
},
{
"epoch": 0.1456,
"grad_norm": 0.11061470210552216,
"learning_rate": 0.00017624546354338502,
"loss": 0.12130849361419678,
"step": 910
},
{
"epoch": 0.1472,
"grad_norm": 0.07824647426605225,
"learning_rate": 0.00017591553942593205,
"loss": 0.1188379168510437,
"step": 920
},
{
"epoch": 0.1488,
"grad_norm": 0.08214984834194183,
"learning_rate": 0.00017558561530847905,
"loss": 0.11806504726409912,
"step": 930
},
{
"epoch": 0.1504,
"grad_norm": 0.09313149005174637,
"learning_rate": 0.00017525569119102607,
"loss": 0.11112408638000489,
"step": 940
},
{
"epoch": 0.152,
"grad_norm": 0.08523363620042801,
"learning_rate": 0.0001749257670735731,
"loss": 0.1136185884475708,
"step": 950
},
{
"epoch": 0.1536,
"grad_norm": 0.06718438863754272,
"learning_rate": 0.0001745958429561201,
"loss": 0.1142117738723755,
"step": 960
},
{
"epoch": 0.1552,
"grad_norm": 0.08877789974212646,
"learning_rate": 0.00017426591883866713,
"loss": 0.11236680746078491,
"step": 970
},
{
"epoch": 0.1568,
"grad_norm": 0.07814772427082062,
"learning_rate": 0.00017393599472121412,
"loss": 0.10925638675689697,
"step": 980
},
{
"epoch": 0.1584,
"grad_norm": 0.08659686148166656,
"learning_rate": 0.00017360607060376115,
"loss": 0.11623308658599854,
"step": 990
},
{
"epoch": 0.16,
"grad_norm": 0.08823436498641968,
"learning_rate": 0.00017327614648630818,
"loss": 0.11374906301498414,
"step": 1000
},
{
"epoch": 0.1616,
"grad_norm": 0.12844692170619965,
"learning_rate": 0.00017294622236885518,
"loss": 0.10570265054702759,
"step": 1010
},
{
"epoch": 0.1632,
"grad_norm": 0.09296935796737671,
"learning_rate": 0.00017261629825140217,
"loss": 0.10974518060684205,
"step": 1020
},
{
"epoch": 0.1648,
"grad_norm": 0.09684396535158157,
"learning_rate": 0.0001722863741339492,
"loss": 0.11235146522521973,
"step": 1030
},
{
"epoch": 0.1664,
"grad_norm": 0.0794069766998291,
"learning_rate": 0.0001719564500164962,
"loss": 0.11345041990280151,
"step": 1040
},
{
"epoch": 0.168,
"grad_norm": 0.0808623656630516,
"learning_rate": 0.00017162652589904323,
"loss": 0.11226475238800049,
"step": 1050
},
{
"epoch": 0.1696,
"grad_norm": 0.09042982757091522,
"learning_rate": 0.00017129660178159022,
"loss": 0.11745167970657348,
"step": 1060
},
{
"epoch": 0.1712,
"grad_norm": 0.0925358310341835,
"learning_rate": 0.00017096667766413725,
"loss": 0.11483606100082397,
"step": 1070
},
{
"epoch": 0.1728,
"grad_norm": 0.08630611002445221,
"learning_rate": 0.00017063675354668428,
"loss": 0.11297872066497802,
"step": 1080
},
{
"epoch": 0.1744,
"grad_norm": 0.07782171666622162,
"learning_rate": 0.00017030682942923128,
"loss": 0.12509260177612305,
"step": 1090
},
{
"epoch": 0.176,
"grad_norm": 0.09083843231201172,
"learning_rate": 0.0001699769053117783,
"loss": 0.1190922737121582,
"step": 1100
},
{
"epoch": 0.1776,
"grad_norm": 0.09185738116502762,
"learning_rate": 0.00016964698119432533,
"loss": 0.11026453971862793,
"step": 1110
},
{
"epoch": 0.1792,
"grad_norm": 0.10063742846250534,
"learning_rate": 0.00016931705707687233,
"loss": 0.11582765579223633,
"step": 1120
},
{
"epoch": 0.1808,
"grad_norm": 0.09147176891565323,
"learning_rate": 0.00016898713295941935,
"loss": 0.11444920301437378,
"step": 1130
},
{
"epoch": 0.1824,
"grad_norm": 0.10646630078554153,
"learning_rate": 0.00016865720884196635,
"loss": 0.10560888051986694,
"step": 1140
},
{
"epoch": 0.184,
"grad_norm": 0.12107925117015839,
"learning_rate": 0.00016832728472451338,
"loss": 0.11672050952911377,
"step": 1150
},
{
"epoch": 0.1856,
"grad_norm": 0.10743635892868042,
"learning_rate": 0.0001679973606070604,
"loss": 0.11454172134399414,
"step": 1160
},
{
"epoch": 0.1872,
"grad_norm": 0.0912097841501236,
"learning_rate": 0.00016766743648960738,
"loss": 0.10987292528152466,
"step": 1170
},
{
"epoch": 0.1888,
"grad_norm": 0.08923039585351944,
"learning_rate": 0.0001673375123721544,
"loss": 0.11110665798187255,
"step": 1180
},
{
"epoch": 0.1904,
"grad_norm": 0.11190492659807205,
"learning_rate": 0.00016700758825470143,
"loss": 0.12069671154022217,
"step": 1190
},
{
"epoch": 0.192,
"grad_norm": 0.09391149133443832,
"learning_rate": 0.00016667766413724843,
"loss": 0.10857542753219604,
"step": 1200
},
{
"epoch": 0.1936,
"grad_norm": 0.09822124242782593,
"learning_rate": 0.00016634774001979545,
"loss": 0.11493276357650757,
"step": 1210
},
{
"epoch": 0.1952,
"grad_norm": 0.08219283819198608,
"learning_rate": 0.00016601781590234245,
"loss": 0.10868325233459472,
"step": 1220
},
{
"epoch": 0.1968,
"grad_norm": 0.1040310487151146,
"learning_rate": 0.00016568789178488948,
"loss": 0.10602080821990967,
"step": 1230
},
{
"epoch": 0.1984,
"grad_norm": 0.0804198682308197,
"learning_rate": 0.0001653579676674365,
"loss": 0.10579434633255005,
"step": 1240
},
{
"epoch": 0.2,
"grad_norm": 0.08008287101984024,
"learning_rate": 0.0001650280435499835,
"loss": 0.10420469045639039,
"step": 1250
},
{
"epoch": 0.2016,
"grad_norm": 0.08706449717283249,
"learning_rate": 0.00016469811943253053,
"loss": 0.10426139831542969,
"step": 1260
},
{
"epoch": 0.2032,
"grad_norm": 0.10690020024776459,
"learning_rate": 0.00016436819531507756,
"loss": 0.10465244054794312,
"step": 1270
},
{
"epoch": 0.2048,
"grad_norm": 0.10291136056184769,
"learning_rate": 0.00016403827119762456,
"loss": 0.09800633192062377,
"step": 1280
},
{
"epoch": 0.2064,
"grad_norm": 0.09384270757436752,
"learning_rate": 0.00016370834708017158,
"loss": 0.10762728452682495,
"step": 1290
},
{
"epoch": 0.208,
"grad_norm": 0.09748148173093796,
"learning_rate": 0.00016337842296271858,
"loss": 0.10190448760986329,
"step": 1300
},
{
"epoch": 0.2096,
"grad_norm": 0.08641976118087769,
"learning_rate": 0.0001630484988452656,
"loss": 0.10793905258178711,
"step": 1310
},
{
"epoch": 0.2112,
"grad_norm": 0.08845674246549606,
"learning_rate": 0.0001627185747278126,
"loss": 0.1030082106590271,
"step": 1320
},
{
"epoch": 0.2128,
"grad_norm": 0.08985752612352371,
"learning_rate": 0.0001623886506103596,
"loss": 0.10357458591461181,
"step": 1330
},
{
"epoch": 0.2144,
"grad_norm": 0.11634411662817001,
"learning_rate": 0.00016205872649290663,
"loss": 0.10648585557937622,
"step": 1340
},
{
"epoch": 0.216,
"grad_norm": 0.10860881209373474,
"learning_rate": 0.00016172880237545366,
"loss": 0.10430452823638917,
"step": 1350
},
{
"epoch": 0.2176,
"grad_norm": 0.10317538678646088,
"learning_rate": 0.00016139887825800066,
"loss": 0.10179120302200317,
"step": 1360
},
{
"epoch": 0.2192,
"grad_norm": 0.10053454339504242,
"learning_rate": 0.00016106895414054768,
"loss": 0.10597822666168213,
"step": 1370
},
{
"epoch": 0.2208,
"grad_norm": 0.08927279710769653,
"learning_rate": 0.00016073903002309468,
"loss": 0.09684351682662964,
"step": 1380
},
{
"epoch": 0.2224,
"grad_norm": 0.1257501095533371,
"learning_rate": 0.0001604091059056417,
"loss": 0.11261625289916992,
"step": 1390
},
{
"epoch": 0.224,
"grad_norm": 0.1243852972984314,
"learning_rate": 0.00016007918178818873,
"loss": 0.10365232229232788,
"step": 1400
},
{
"epoch": 0.2256,
"grad_norm": 0.10740727186203003,
"learning_rate": 0.00015974925767073573,
"loss": 0.10951308012008668,
"step": 1410
},
{
"epoch": 0.2272,
"grad_norm": 0.09918347746133804,
"learning_rate": 0.00015941933355328276,
"loss": 0.0985394537448883,
"step": 1420
},
{
"epoch": 0.2288,
"grad_norm": 0.08673065900802612,
"learning_rate": 0.00015908940943582978,
"loss": 0.09536778330802917,
"step": 1430
},
{
"epoch": 0.2304,
"grad_norm": 0.08423957228660583,
"learning_rate": 0.00015875948531837678,
"loss": 0.10208734273910522,
"step": 1440
},
{
"epoch": 0.232,
"grad_norm": 0.08404131233692169,
"learning_rate": 0.0001584295612009238,
"loss": 0.11047152280807496,
"step": 1450
},
{
"epoch": 0.2336,
"grad_norm": 0.09844925999641418,
"learning_rate": 0.0001580996370834708,
"loss": 0.10863144397735595,
"step": 1460
},
{
"epoch": 0.2352,
"grad_norm": 0.0969533696770668,
"learning_rate": 0.0001577697129660178,
"loss": 0.10357078313827514,
"step": 1470
},
{
"epoch": 0.2368,
"grad_norm": 0.09240443259477615,
"learning_rate": 0.00015743978884856483,
"loss": 0.1025089144706726,
"step": 1480
},
{
"epoch": 0.2384,
"grad_norm": 0.08052058517932892,
"learning_rate": 0.00015710986473111183,
"loss": 0.10557924509048462,
"step": 1490
},
{
"epoch": 0.24,
"grad_norm": 0.08213961869478226,
"learning_rate": 0.00015677994061365886,
"loss": 0.10791049003601075,
"step": 1500
}
],
"logging_steps": 10,
"max_steps": 6250,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.807714853021389e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}