gptoss-raft / trainer_state.json
cuongdk253's picture
Upload folder using huggingface_hub
e905e9a verified
Raw
History Blame Contribute Delete
69.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 250,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.0973353385925293,
"epoch": 0.004,
"grad_norm": 56.63088607788086,
"learning_rate": 0.0,
"loss": 8.81,
"mean_token_accuracy": 0.1589217633008957,
"num_tokens": 11020.0,
"step": 1
},
{
"entropy": 2.359926462173462,
"epoch": 0.008,
"grad_norm": 48.76058578491211,
"learning_rate": 2.5e-05,
"loss": 7.5185,
"mean_token_accuracy": 0.20284946262836456,
"num_tokens": 21059.0,
"step": 2
},
{
"entropy": 2.3848068714141846,
"epoch": 0.012,
"grad_norm": 51.160762786865234,
"learning_rate": 5e-05,
"loss": 8.4107,
"mean_token_accuracy": 0.1458083838224411,
"num_tokens": 31081.0,
"step": 3
},
{
"entropy": 2.5165743827819824,
"epoch": 0.016,
"grad_norm": 57.92226028442383,
"learning_rate": 7.500000000000001e-05,
"loss": 8.7345,
"mean_token_accuracy": 0.10784424096345901,
"num_tokens": 39994.0,
"step": 4
},
{
"entropy": 3.0336835384368896,
"epoch": 0.02,
"grad_norm": 42.479244232177734,
"learning_rate": 0.0001,
"loss": 6.6625,
"mean_token_accuracy": 0.15363158285617828,
"num_tokens": 49317.0,
"step": 5
},
{
"entropy": 3.2910828590393066,
"epoch": 0.024,
"grad_norm": 35.47465515136719,
"learning_rate": 0.000125,
"loss": 5.5297,
"mean_token_accuracy": 0.2194845825433731,
"num_tokens": 60805.0,
"step": 6
},
{
"entropy": 2.9953644275665283,
"epoch": 0.028,
"grad_norm": 24.23429298400879,
"learning_rate": 0.00015000000000000001,
"loss": 3.7,
"mean_token_accuracy": 0.40734514594078064,
"num_tokens": 72706.0,
"step": 7
},
{
"entropy": 2.88269305229187,
"epoch": 0.032,
"grad_norm": 25.993759155273438,
"learning_rate": 0.000175,
"loss": 2.7163,
"mean_token_accuracy": 0.5192126631736755,
"num_tokens": 85460.0,
"step": 8
},
{
"entropy": 2.2315902709960938,
"epoch": 0.036,
"grad_norm": 11.012210845947266,
"learning_rate": 0.0002,
"loss": 2.1933,
"mean_token_accuracy": 0.5909518003463745,
"num_tokens": 99299.0,
"step": 9
},
{
"entropy": 1.8418952226638794,
"epoch": 0.04,
"grad_norm": 5.978642463684082,
"learning_rate": 0.00019999241639982352,
"loss": 2.1315,
"mean_token_accuracy": 0.6005287170410156,
"num_tokens": 112919.0,
"step": 10
},
{
"entropy": 1.6634621620178223,
"epoch": 0.044,
"grad_norm": 5.048736572265625,
"learning_rate": 0.00019996966687731613,
"loss": 2.092,
"mean_token_accuracy": 0.6170734763145447,
"num_tokens": 121074.0,
"step": 11
},
{
"entropy": 1.4140448570251465,
"epoch": 0.048,
"grad_norm": 3.720097303390503,
"learning_rate": 0.00019993175526632852,
"loss": 1.7816,
"mean_token_accuracy": 0.6572261452674866,
"num_tokens": 132057.0,
"step": 12
},
{
"entropy": 1.261852502822876,
"epoch": 0.052,
"grad_norm": 2.3393256664276123,
"learning_rate": 0.0001998786879558941,
"loss": 1.4815,
"mean_token_accuracy": 0.6984454989433289,
"num_tokens": 144153.0,
"step": 13
},
{
"entropy": 1.5389002561569214,
"epoch": 0.056,
"grad_norm": 1.971347451210022,
"learning_rate": 0.00019981047388915196,
"loss": 1.6526,
"mean_token_accuracy": 0.6537265777587891,
"num_tokens": 154768.0,
"step": 14
},
{
"entropy": 1.3573092222213745,
"epoch": 0.06,
"grad_norm": 1.3137863874435425,
"learning_rate": 0.00019972712456184022,
"loss": 1.3945,
"mean_token_accuracy": 0.6989641189575195,
"num_tokens": 165968.0,
"step": 15
},
{
"entropy": 1.477573037147522,
"epoch": 0.064,
"grad_norm": 1.0724811553955078,
"learning_rate": 0.00019962865402035814,
"loss": 1.5077,
"mean_token_accuracy": 0.6758458614349365,
"num_tokens": 176610.0,
"step": 16
},
{
"entropy": 1.062203288078308,
"epoch": 0.068,
"grad_norm": 0.7103755474090576,
"learning_rate": 0.00019951507885939952,
"loss": 1.1178,
"mean_token_accuracy": 0.7602011561393738,
"num_tokens": 188743.0,
"step": 17
},
{
"entropy": 1.2973206043243408,
"epoch": 0.072,
"grad_norm": 0.6334678530693054,
"learning_rate": 0.00019938641821915564,
"loss": 1.3933,
"mean_token_accuracy": 0.7131435871124268,
"num_tokens": 201253.0,
"step": 18
},
{
"entropy": 1.3070148229599,
"epoch": 0.076,
"grad_norm": 0.708212673664093,
"learning_rate": 0.00019924269378208997,
"loss": 1.3897,
"mean_token_accuracy": 0.6967664361000061,
"num_tokens": 211244.0,
"step": 19
},
{
"entropy": 1.4724856615066528,
"epoch": 0.08,
"grad_norm": 0.6635432839393616,
"learning_rate": 0.00019908392976928396,
"loss": 1.5634,
"mean_token_accuracy": 0.6638235449790955,
"num_tokens": 221446.0,
"step": 20
},
{
"entropy": 1.0885224342346191,
"epoch": 0.084,
"grad_norm": 0.535370409488678,
"learning_rate": 0.0001989101529363553,
"loss": 1.1798,
"mean_token_accuracy": 0.7438462376594543,
"num_tokens": 232945.0,
"step": 21
},
{
"entropy": 1.2113245725631714,
"epoch": 0.088,
"grad_norm": 0.5345674753189087,
"learning_rate": 0.00019872139256894885,
"loss": 1.2599,
"mean_token_accuracy": 0.7245048880577087,
"num_tokens": 243753.0,
"step": 22
},
{
"entropy": 1.2911491394042969,
"epoch": 0.092,
"grad_norm": 0.5416544079780579,
"learning_rate": 0.00019851768047780144,
"loss": 1.3408,
"mean_token_accuracy": 0.7001619338989258,
"num_tokens": 256105.0,
"step": 23
},
{
"entropy": 1.128836750984192,
"epoch": 0.096,
"grad_norm": 0.48422297835350037,
"learning_rate": 0.00019829905099338086,
"loss": 1.1527,
"mean_token_accuracy": 0.748742938041687,
"num_tokens": 269432.0,
"step": 24
},
{
"entropy": 1.5081233978271484,
"epoch": 0.1,
"grad_norm": 0.5165230631828308,
"learning_rate": 0.00019806554096010035,
"loss": 1.4886,
"mean_token_accuracy": 0.680823802947998,
"num_tokens": 279582.0,
"step": 25
},
{
"entropy": 1.3273299932479858,
"epoch": 0.104,
"grad_norm": 0.534648597240448,
"learning_rate": 0.00019781718973010948,
"loss": 1.2789,
"mean_token_accuracy": 0.7176167964935303,
"num_tokens": 292021.0,
"step": 26
},
{
"entropy": 1.508842945098877,
"epoch": 0.108,
"grad_norm": 0.4762946665287018,
"learning_rate": 0.00019755403915666227,
"loss": 1.4154,
"mean_token_accuracy": 0.6926988959312439,
"num_tokens": 303035.0,
"step": 27
},
{
"entropy": 1.5553829669952393,
"epoch": 0.112,
"grad_norm": 0.5048977732658386,
"learning_rate": 0.00019727613358706396,
"loss": 1.4793,
"mean_token_accuracy": 0.683097779750824,
"num_tokens": 311456.0,
"step": 28
},
{
"entropy": 1.1076712608337402,
"epoch": 0.116,
"grad_norm": 0.40861934423446655,
"learning_rate": 0.00019698351985519735,
"loss": 1.0217,
"mean_token_accuracy": 0.7810451984405518,
"num_tokens": 323666.0,
"step": 29
},
{
"entropy": 1.2993760108947754,
"epoch": 0.12,
"grad_norm": 0.4528363049030304,
"learning_rate": 0.00019667624727363019,
"loss": 1.2028,
"mean_token_accuracy": 0.7430762052536011,
"num_tokens": 334753.0,
"step": 30
},
{
"entropy": 1.3225066661834717,
"epoch": 0.124,
"grad_norm": 0.5367140173912048,
"learning_rate": 0.0001963543676253048,
"loss": 1.2189,
"mean_token_accuracy": 0.7315188050270081,
"num_tokens": 343683.0,
"step": 31
},
{
"entropy": 1.677242398262024,
"epoch": 0.128,
"grad_norm": 0.4724753201007843,
"learning_rate": 0.0001960179351548113,
"loss": 1.602,
"mean_token_accuracy": 0.6546955108642578,
"num_tokens": 357496.0,
"step": 32
},
{
"entropy": 0.9450194239616394,
"epoch": 0.132,
"grad_norm": 0.4643884003162384,
"learning_rate": 0.00019566700655924626,
"loss": 0.9468,
"mean_token_accuracy": 0.7905657291412354,
"num_tokens": 369306.0,
"step": 33
},
{
"entropy": 1.4320679903030396,
"epoch": 0.136,
"grad_norm": 0.4968578815460205,
"learning_rate": 0.00019530164097865768,
"loss": 1.4105,
"mean_token_accuracy": 0.6940935254096985,
"num_tokens": 381024.0,
"step": 34
},
{
"entropy": 1.4245866537094116,
"epoch": 0.14,
"grad_norm": 0.40614748001098633,
"learning_rate": 0.0001949218999860784,
"loss": 1.4487,
"mean_token_accuracy": 0.6868099570274353,
"num_tokens": 392891.0,
"step": 35
},
{
"entropy": 1.1022300720214844,
"epoch": 0.144,
"grad_norm": 0.3792162835597992,
"learning_rate": 0.00019452784757714974,
"loss": 1.1092,
"mean_token_accuracy": 0.761519730091095,
"num_tokens": 404395.0,
"step": 36
},
{
"entropy": 1.097092628479004,
"epoch": 0.148,
"grad_norm": 0.4267388880252838,
"learning_rate": 0.00019411955015933657,
"loss": 1.1114,
"mean_token_accuracy": 0.7575680613517761,
"num_tokens": 416190.0,
"step": 37
},
{
"entropy": 1.1763945817947388,
"epoch": 0.152,
"grad_norm": 0.49878817796707153,
"learning_rate": 0.00019369707654073601,
"loss": 1.2312,
"mean_token_accuracy": 0.7294224500656128,
"num_tokens": 428329.0,
"step": 38
},
{
"entropy": 1.103309154510498,
"epoch": 0.156,
"grad_norm": 0.5332479476928711,
"learning_rate": 0.00019326049791848154,
"loss": 1.0894,
"mean_token_accuracy": 0.7563456892967224,
"num_tokens": 438062.0,
"step": 39
},
{
"entropy": 1.3513190746307373,
"epoch": 0.16,
"grad_norm": 0.665856122970581,
"learning_rate": 0.00019280988786674467,
"loss": 1.4117,
"mean_token_accuracy": 0.6817158460617065,
"num_tokens": 446503.0,
"step": 40
},
{
"entropy": 1.1249470710754395,
"epoch": 0.164,
"grad_norm": 0.44063600897789,
"learning_rate": 0.0001923453223243358,
"loss": 1.1345,
"mean_token_accuracy": 0.7451761960983276,
"num_tokens": 457544.0,
"step": 41
},
{
"entropy": 1.139631986618042,
"epoch": 0.168,
"grad_norm": 0.5003185272216797,
"learning_rate": 0.00019186687958190667,
"loss": 1.1346,
"mean_token_accuracy": 0.7483499050140381,
"num_tokens": 467091.0,
"step": 42
},
{
"entropy": 0.9406906962394714,
"epoch": 0.172,
"grad_norm": 0.6294145584106445,
"learning_rate": 0.00019137464026875654,
"loss": 0.9044,
"mean_token_accuracy": 0.7882066965103149,
"num_tokens": 475318.0,
"step": 43
},
{
"entropy": 1.039001703262329,
"epoch": 0.176,
"grad_norm": 0.4918760657310486,
"learning_rate": 0.0001908686873392441,
"loss": 1.0364,
"mean_token_accuracy": 0.7681604623794556,
"num_tokens": 485741.0,
"step": 44
},
{
"entropy": 1.1919207572937012,
"epoch": 0.18,
"grad_norm": 0.5181702971458435,
"learning_rate": 0.00019034910605880776,
"loss": 1.1167,
"mean_token_accuracy": 0.7450622916221619,
"num_tokens": 498907.0,
"step": 45
},
{
"entropy": 1.003733515739441,
"epoch": 0.184,
"grad_norm": 0.5143950581550598,
"learning_rate": 0.0001898159839895961,
"loss": 0.963,
"mean_token_accuracy": 0.7841158509254456,
"num_tokens": 510304.0,
"step": 46
},
{
"entropy": 1.3185124397277832,
"epoch": 0.188,
"grad_norm": 0.5639718174934387,
"learning_rate": 0.00018926941097571182,
"loss": 1.268,
"mean_token_accuracy": 0.7116304039955139,
"num_tokens": 521389.0,
"step": 47
},
{
"entropy": 1.1227295398712158,
"epoch": 0.192,
"grad_norm": 0.6089756488800049,
"learning_rate": 0.00018870947912807048,
"loss": 1.0814,
"mean_token_accuracy": 0.7578927874565125,
"num_tokens": 532097.0,
"step": 48
},
{
"entropy": 1.2459306716918945,
"epoch": 0.196,
"grad_norm": 0.7441679239273071,
"learning_rate": 0.00018813628280887795,
"loss": 1.2047,
"mean_token_accuracy": 0.7300441861152649,
"num_tokens": 541382.0,
"step": 49
},
{
"entropy": 1.0864311456680298,
"epoch": 0.2,
"grad_norm": 0.5735241174697876,
"learning_rate": 0.00018754991861572766,
"loss": 1.0827,
"mean_token_accuracy": 0.7548420429229736,
"num_tokens": 551039.0,
"step": 50
},
{
"entropy": 0.9783708453178406,
"epoch": 0.204,
"grad_norm": 0.6659897565841675,
"learning_rate": 0.00018695048536532182,
"loss": 0.978,
"mean_token_accuracy": 0.7748624682426453,
"num_tokens": 562856.0,
"step": 51
},
{
"entropy": 1.0906152725219727,
"epoch": 0.208,
"grad_norm": 0.5842542052268982,
"learning_rate": 0.00018633808407681827,
"loss": 1.1066,
"mean_token_accuracy": 0.7530777454376221,
"num_tokens": 575692.0,
"step": 52
},
{
"entropy": 1.1353249549865723,
"epoch": 0.212,
"grad_norm": 1.0452736616134644,
"learning_rate": 0.0001857128179548063,
"loss": 1.2501,
"mean_token_accuracy": 0.7129384875297546,
"num_tokens": 587040.0,
"step": 53
},
{
"entropy": 1.1658884286880493,
"epoch": 0.216,
"grad_norm": 0.7569848299026489,
"learning_rate": 0.0001850747923719143,
"loss": 1.1789,
"mean_token_accuracy": 0.7339466214179993,
"num_tokens": 598130.0,
"step": 54
},
{
"entropy": 0.9339560866355896,
"epoch": 0.22,
"grad_norm": 0.6351683139801025,
"learning_rate": 0.0001844241148510516,
"loss": 0.9055,
"mean_token_accuracy": 0.7876133322715759,
"num_tokens": 611259.0,
"step": 55
},
{
"entropy": 1.1959530115127563,
"epoch": 0.224,
"grad_norm": 0.8705658912658691,
"learning_rate": 0.00018376089504728847,
"loss": 1.1617,
"mean_token_accuracy": 0.7372428774833679,
"num_tokens": 622686.0,
"step": 56
},
{
"entropy": 1.2461718320846558,
"epoch": 0.228,
"grad_norm": 0.8680962324142456,
"learning_rate": 0.0001830852447293765,
"loss": 1.1835,
"mean_token_accuracy": 0.7315577864646912,
"num_tokens": 632638.0,
"step": 57
},
{
"entropy": 1.1705292463302612,
"epoch": 0.232,
"grad_norm": 0.7268466353416443,
"learning_rate": 0.00018239727776091282,
"loss": 1.1152,
"mean_token_accuracy": 0.7414857745170593,
"num_tokens": 643974.0,
"step": 58
},
{
"entropy": 1.153640866279602,
"epoch": 0.236,
"grad_norm": 0.7480162978172302,
"learning_rate": 0.00018169711008115126,
"loss": 1.1153,
"mean_token_accuracy": 0.7440808415412903,
"num_tokens": 654366.0,
"step": 59
},
{
"entropy": 1.097459077835083,
"epoch": 0.24,
"grad_norm": 0.7212317585945129,
"learning_rate": 0.00018098485968546385,
"loss": 1.0895,
"mean_token_accuracy": 0.7482320666313171,
"num_tokens": 666105.0,
"step": 60
},
{
"entropy": 1.05923593044281,
"epoch": 0.244,
"grad_norm": 0.8075670599937439,
"learning_rate": 0.00018026064660545552,
"loss": 1.067,
"mean_token_accuracy": 0.7528573870658875,
"num_tokens": 676781.0,
"step": 61
},
{
"entropy": 1.0399152040481567,
"epoch": 0.248,
"grad_norm": 0.9833256602287292,
"learning_rate": 0.00017952459288873623,
"loss": 1.0939,
"mean_token_accuracy": 0.7464929819107056,
"num_tokens": 686763.0,
"step": 62
},
{
"entropy": 1.0377105474472046,
"epoch": 0.252,
"grad_norm": 0.852209210395813,
"learning_rate": 0.00017877682257835242,
"loss": 1.0704,
"mean_token_accuracy": 0.7448949217796326,
"num_tokens": 700085.0,
"step": 63
},
{
"entropy": 0.8170187473297119,
"epoch": 0.256,
"grad_norm": 0.8792871832847595,
"learning_rate": 0.00017801746169188328,
"loss": 0.6947,
"mean_token_accuracy": 0.833350419998169,
"num_tokens": 709832.0,
"step": 64
},
{
"entropy": 1.0612165927886963,
"epoch": 0.26,
"grad_norm": 0.8374829888343811,
"learning_rate": 0.0001772466382002032,
"loss": 0.9753,
"mean_token_accuracy": 0.7734495401382446,
"num_tokens": 720847.0,
"step": 65
},
{
"entropy": 1.0511215925216675,
"epoch": 0.264,
"grad_norm": 0.8725335001945496,
"learning_rate": 0.00017646448200591596,
"loss": 1.0397,
"mean_token_accuracy": 0.7560197710990906,
"num_tokens": 732768.0,
"step": 66
},
{
"entropy": 1.16708242893219,
"epoch": 0.268,
"grad_norm": 0.9981763958930969,
"learning_rate": 0.0001756711249214627,
"loss": 1.2386,
"mean_token_accuracy": 0.7174420952796936,
"num_tokens": 743044.0,
"step": 67
},
{
"entropy": 0.9941532611846924,
"epoch": 0.272,
"grad_norm": 0.9159516096115112,
"learning_rate": 0.0001748667006469085,
"loss": 0.9769,
"mean_token_accuracy": 0.7736346125602722,
"num_tokens": 752915.0,
"step": 68
},
{
"entropy": 0.9163703322410583,
"epoch": 0.276,
"grad_norm": 0.7718108892440796,
"learning_rate": 0.0001740513447474104,
"loss": 0.8858,
"mean_token_accuracy": 0.79206782579422,
"num_tokens": 765070.0,
"step": 69
},
{
"entropy": 1.043192744255066,
"epoch": 0.28,
"grad_norm": 0.7897371649742126,
"learning_rate": 0.00017322519463037168,
"loss": 1.0291,
"mean_token_accuracy": 0.7658995985984802,
"num_tokens": 776110.0,
"step": 70
},
{
"entropy": 0.8629508018493652,
"epoch": 0.284,
"grad_norm": 0.8085194230079651,
"learning_rate": 0.00017238838952228502,
"loss": 0.8871,
"mean_token_accuracy": 0.7935369610786438,
"num_tokens": 786850.0,
"step": 71
},
{
"entropy": 1.0944290161132812,
"epoch": 0.288,
"grad_norm": 0.9569735527038574,
"learning_rate": 0.00017154107044526964,
"loss": 1.0377,
"mean_token_accuracy": 0.7588126063346863,
"num_tokens": 796554.0,
"step": 72
},
{
"entropy": 0.7297062277793884,
"epoch": 0.292,
"grad_norm": 0.9553439021110535,
"learning_rate": 0.00017068338019330564,
"loss": 0.6367,
"mean_token_accuracy": 0.8526090979576111,
"num_tokens": 806387.0,
"step": 73
},
{
"entropy": 0.9341362714767456,
"epoch": 0.296,
"grad_norm": 0.9124618768692017,
"learning_rate": 0.00016981546330816953,
"loss": 0.8903,
"mean_token_accuracy": 0.7885122299194336,
"num_tokens": 816626.0,
"step": 74
},
{
"entropy": 0.5450064539909363,
"epoch": 0.3,
"grad_norm": 0.8968790769577026,
"learning_rate": 0.0001689374660550757,
"loss": 0.625,
"mean_token_accuracy": 0.8518457412719727,
"num_tokens": 828737.0,
"step": 75
},
{
"entropy": 0.7374886870384216,
"epoch": 0.304,
"grad_norm": 1.0030460357666016,
"learning_rate": 0.00016804953639802677,
"loss": 0.7191,
"mean_token_accuracy": 0.8276105523109436,
"num_tokens": 840068.0,
"step": 76
},
{
"entropy": 0.7412508130073547,
"epoch": 0.308,
"grad_norm": 1.2331219911575317,
"learning_rate": 0.00016715182397487844,
"loss": 0.8017,
"mean_token_accuracy": 0.8093528151512146,
"num_tokens": 851489.0,
"step": 77
},
{
"entropy": 1.0338571071624756,
"epoch": 0.312,
"grad_norm": 0.9198253154754639,
"learning_rate": 0.00016624448007212167,
"loss": 1.0164,
"mean_token_accuracy": 0.7691991329193115,
"num_tokens": 863640.0,
"step": 78
},
{
"entropy": 0.9462264776229858,
"epoch": 0.316,
"grad_norm": 0.7652691602706909,
"learning_rate": 0.0001653276575993871,
"loss": 0.9116,
"mean_token_accuracy": 0.7878068089485168,
"num_tokens": 878798.0,
"step": 79
},
{
"entropy": 1.003931999206543,
"epoch": 0.32,
"grad_norm": 0.9275044202804565,
"learning_rate": 0.0001644015110636762,
"loss": 0.9505,
"mean_token_accuracy": 0.774969220161438,
"num_tokens": 889363.0,
"step": 80
},
{
"entropy": 0.708422839641571,
"epoch": 0.324,
"grad_norm": 0.9531024694442749,
"learning_rate": 0.00016346619654332298,
"loss": 0.6343,
"mean_token_accuracy": 0.8398601412773132,
"num_tokens": 899375.0,
"step": 81
},
{
"entropy": 1.028533935546875,
"epoch": 0.328,
"grad_norm": 0.9965426921844482,
"learning_rate": 0.00016252187166169107,
"loss": 0.9782,
"mean_token_accuracy": 0.7718014121055603,
"num_tokens": 908803.0,
"step": 82
},
{
"entropy": 0.7851366400718689,
"epoch": 0.332,
"grad_norm": 0.8076054453849792,
"learning_rate": 0.0001615686955606102,
"loss": 0.765,
"mean_token_accuracy": 0.8145228028297424,
"num_tokens": 920855.0,
"step": 83
},
{
"entropy": 0.9262005090713501,
"epoch": 0.336,
"grad_norm": 0.9758970737457275,
"learning_rate": 0.000160606828873557,
"loss": 0.9151,
"mean_token_accuracy": 0.7844375371932983,
"num_tokens": 931151.0,
"step": 84
},
{
"entropy": 0.6350160837173462,
"epoch": 0.34,
"grad_norm": 1.0767849683761597,
"learning_rate": 0.00015963643369858437,
"loss": 0.7041,
"mean_token_accuracy": 0.8317089080810547,
"num_tokens": 940387.0,
"step": 85
},
{
"entropy": 0.9434180855751038,
"epoch": 0.344,
"grad_norm": 1.190125823020935,
"learning_rate": 0.0001586576735710038,
"loss": 0.9578,
"mean_token_accuracy": 0.7776371240615845,
"num_tokens": 949869.0,
"step": 86
},
{
"entropy": 0.8093811273574829,
"epoch": 0.348,
"grad_norm": 0.9406972527503967,
"learning_rate": 0.00015767071343582588,
"loss": 0.7415,
"mean_token_accuracy": 0.8234021663665771,
"num_tokens": 959118.0,
"step": 87
},
{
"entropy": 0.7648224234580994,
"epoch": 0.352,
"grad_norm": 0.7738968729972839,
"learning_rate": 0.00015667571961996296,
"loss": 0.7306,
"mean_token_accuracy": 0.8252065181732178,
"num_tokens": 971466.0,
"step": 88
},
{
"entropy": 0.659711480140686,
"epoch": 0.356,
"grad_norm": 0.801194965839386,
"learning_rate": 0.000155672859804199,
"loss": 0.6591,
"mean_token_accuracy": 0.8405287265777588,
"num_tokens": 983119.0,
"step": 89
},
{
"entropy": 0.9075393080711365,
"epoch": 0.36,
"grad_norm": 1.1619821786880493,
"learning_rate": 0.00015466230299493125,
"loss": 0.8609,
"mean_token_accuracy": 0.7937808632850647,
"num_tokens": 992640.0,
"step": 90
},
{
"entropy": 0.7225161790847778,
"epoch": 0.364,
"grad_norm": 0.9581741690635681,
"learning_rate": 0.00015364421949568853,
"loss": 0.688,
"mean_token_accuracy": 0.8366522192955017,
"num_tokens": 1003037.0,
"step": 91
},
{
"entropy": 0.7597986459732056,
"epoch": 0.368,
"grad_norm": 1.0615458488464355,
"learning_rate": 0.00015261878087843085,
"loss": 0.7226,
"mean_token_accuracy": 0.824986457824707,
"num_tokens": 1014101.0,
"step": 92
},
{
"entropy": 0.6454391479492188,
"epoch": 0.372,
"grad_norm": 0.9587013721466064,
"learning_rate": 0.00015158615995463566,
"loss": 0.6641,
"mean_token_accuracy": 0.8425232172012329,
"num_tokens": 1025311.0,
"step": 93
},
{
"entropy": 0.8424079418182373,
"epoch": 0.376,
"grad_norm": 1.2206848859786987,
"learning_rate": 0.00015054653074617443,
"loss": 0.9094,
"mean_token_accuracy": 0.7876355648040771,
"num_tokens": 1037024.0,
"step": 94
},
{
"entropy": 0.8714436292648315,
"epoch": 0.38,
"grad_norm": 1.2640056610107422,
"learning_rate": 0.00014950006845598603,
"loss": 0.8689,
"mean_token_accuracy": 0.7946674823760986,
"num_tokens": 1046815.0,
"step": 95
},
{
"entropy": 0.5807708501815796,
"epoch": 0.384,
"grad_norm": 0.8595563173294067,
"learning_rate": 0.00014844694943855067,
"loss": 0.5039,
"mean_token_accuracy": 0.8740711212158203,
"num_tokens": 1056775.0,
"step": 96
},
{
"entropy": 0.6972081661224365,
"epoch": 0.388,
"grad_norm": 0.8816290497779846,
"learning_rate": 0.00014738735117016978,
"loss": 0.6369,
"mean_token_accuracy": 0.8466954827308655,
"num_tokens": 1067429.0,
"step": 97
},
{
"entropy": 0.5604634881019592,
"epoch": 0.392,
"grad_norm": 0.9110663533210754,
"learning_rate": 0.0001463214522190571,
"loss": 0.501,
"mean_token_accuracy": 0.8726220726966858,
"num_tokens": 1078838.0,
"step": 98
},
{
"entropy": 0.8191442489624023,
"epoch": 0.396,
"grad_norm": 1.2301007509231567,
"learning_rate": 0.00014524943221524533,
"loss": 0.8723,
"mean_token_accuracy": 0.7879535555839539,
"num_tokens": 1089781.0,
"step": 99
},
{
"entropy": 0.9090349674224854,
"epoch": 0.4,
"grad_norm": 1.0221482515335083,
"learning_rate": 0.00014417147182031428,
"loss": 0.8904,
"mean_token_accuracy": 0.7897399067878723,
"num_tokens": 1102239.0,
"step": 100
},
{
"entropy": 0.6675378084182739,
"epoch": 0.404,
"grad_norm": 1.0766475200653076,
"learning_rate": 0.0001430877526969448,
"loss": 0.5804,
"mean_token_accuracy": 0.8515596985816956,
"num_tokens": 1113397.0,
"step": 101
},
{
"entropy": 0.6440110802650452,
"epoch": 0.408,
"grad_norm": 0.9045482873916626,
"learning_rate": 0.00014199845747830446,
"loss": 0.6087,
"mean_token_accuracy": 0.8539875149726868,
"num_tokens": 1125261.0,
"step": 102
},
{
"entropy": 0.8418194651603699,
"epoch": 0.412,
"grad_norm": 1.4091824293136597,
"learning_rate": 0.00014090376973726896,
"loss": 0.9077,
"mean_token_accuracy": 0.7805910706520081,
"num_tokens": 1136598.0,
"step": 103
},
{
"entropy": 0.7668788433074951,
"epoch": 0.416,
"grad_norm": 1.2579201459884644,
"learning_rate": 0.00013980387395548608,
"loss": 0.8016,
"mean_token_accuracy": 0.8103581070899963,
"num_tokens": 1146988.0,
"step": 104
},
{
"entropy": 0.9310951232910156,
"epoch": 0.42,
"grad_norm": 1.0861616134643555,
"learning_rate": 0.0001386989554922857,
"loss": 0.9118,
"mean_token_accuracy": 0.7869442701339722,
"num_tokens": 1157269.0,
"step": 105
},
{
"entropy": 0.48249903321266174,
"epoch": 0.424,
"grad_norm": 1.08878755569458,
"learning_rate": 0.00013758920055344226,
"loss": 0.3668,
"mean_token_accuracy": 0.9031632542610168,
"num_tokens": 1167071.0,
"step": 106
},
{
"entropy": 0.689582884311676,
"epoch": 0.428,
"grad_norm": 1.249678611755371,
"learning_rate": 0.00013647479615979468,
"loss": 0.581,
"mean_token_accuracy": 0.8578310608863831,
"num_tokens": 1175584.0,
"step": 107
},
{
"entropy": 0.5986989736557007,
"epoch": 0.432,
"grad_norm": 0.9662414193153381,
"learning_rate": 0.0001353559301157287,
"loss": 0.5368,
"mean_token_accuracy": 0.8663188219070435,
"num_tokens": 1187278.0,
"step": 108
},
{
"entropy": 0.9165630340576172,
"epoch": 0.436,
"grad_norm": 1.785701036453247,
"learning_rate": 0.00013423279097752713,
"loss": 1.015,
"mean_token_accuracy": 0.7645655870437622,
"num_tokens": 1196085.0,
"step": 109
},
{
"entropy": 0.6729641556739807,
"epoch": 0.44,
"grad_norm": 1.1485984325408936,
"learning_rate": 0.0001331055680215937,
"loss": 0.6846,
"mean_token_accuracy": 0.8309648633003235,
"num_tokens": 1209457.0,
"step": 110
},
{
"entropy": 0.5594127178192139,
"epoch": 0.444,
"grad_norm": 0.9643635153770447,
"learning_rate": 0.00013197445121255523,
"loss": 0.5453,
"mean_token_accuracy": 0.8717948794364929,
"num_tokens": 1219482.0,
"step": 111
},
{
"entropy": 0.8685882687568665,
"epoch": 0.448,
"grad_norm": 1.0649855136871338,
"learning_rate": 0.00013083963117124802,
"loss": 0.8078,
"mean_token_accuracy": 0.8030028939247131,
"num_tokens": 1232205.0,
"step": 112
},
{
"entropy": 0.6931924223899841,
"epoch": 0.452,
"grad_norm": 1.0093775987625122,
"learning_rate": 0.00012970129914259356,
"loss": 0.6155,
"mean_token_accuracy": 0.8536151647567749,
"num_tokens": 1242331.0,
"step": 113
},
{
"entropy": 0.940833568572998,
"epoch": 0.456,
"grad_norm": 1.1867045164108276,
"learning_rate": 0.00012855964696336896,
"loss": 0.9769,
"mean_token_accuracy": 0.7758588790893555,
"num_tokens": 1253219.0,
"step": 114
},
{
"entropy": 0.644160270690918,
"epoch": 0.46,
"grad_norm": 1.0405246019363403,
"learning_rate": 0.00012741486702987797,
"loss": 0.5985,
"mean_token_accuracy": 0.853334367275238,
"num_tokens": 1266012.0,
"step": 115
},
{
"entropy": 0.6467909812927246,
"epoch": 0.464,
"grad_norm": 1.0041617155075073,
"learning_rate": 0.00012626715226552745,
"loss": 0.589,
"mean_token_accuracy": 0.8532326817512512,
"num_tokens": 1278728.0,
"step": 116
},
{
"entropy": 0.6697924733161926,
"epoch": 0.468,
"grad_norm": 1.225751519203186,
"learning_rate": 0.00012511669608831485,
"loss": 0.6097,
"mean_token_accuracy": 0.8501642942428589,
"num_tokens": 1289989.0,
"step": 117
},
{
"entropy": 0.5410375595092773,
"epoch": 0.472,
"grad_norm": 1.1570745706558228,
"learning_rate": 0.00012396369237823286,
"loss": 0.4868,
"mean_token_accuracy": 0.8764288425445557,
"num_tokens": 1300139.0,
"step": 118
},
{
"entropy": 0.7634984254837036,
"epoch": 0.476,
"grad_norm": 1.26356041431427,
"learning_rate": 0.00012280833544459568,
"loss": 0.7205,
"mean_token_accuracy": 0.8254125118255615,
"num_tokens": 1310262.0,
"step": 119
},
{
"entropy": 0.7683166265487671,
"epoch": 0.48,
"grad_norm": 1.263581395149231,
"learning_rate": 0.0001216508199932932,
"loss": 0.8117,
"mean_token_accuracy": 0.8081841468811035,
"num_tokens": 1322385.0,
"step": 120
},
{
"entropy": 0.7120152115821838,
"epoch": 0.484,
"grad_norm": 1.0431994199752808,
"learning_rate": 0.00012049134109397832,
"loss": 0.6529,
"mean_token_accuracy": 0.8445841073989868,
"num_tokens": 1337186.0,
"step": 121
},
{
"entropy": 0.7104185819625854,
"epoch": 0.488,
"grad_norm": 1.0483670234680176,
"learning_rate": 0.00011933009414719301,
"loss": 0.7264,
"mean_token_accuracy": 0.8267722725868225,
"num_tokens": 1349686.0,
"step": 122
},
{
"entropy": 0.9004740118980408,
"epoch": 0.492,
"grad_norm": 1.2728326320648193,
"learning_rate": 0.0001181672748514383,
"loss": 0.8288,
"mean_token_accuracy": 0.7991729378700256,
"num_tokens": 1361295.0,
"step": 123
},
{
"entropy": 0.7324482798576355,
"epoch": 0.496,
"grad_norm": 1.113187313079834,
"learning_rate": 0.00011700307917019457,
"loss": 0.6708,
"mean_token_accuracy": 0.8380022048950195,
"num_tokens": 1371328.0,
"step": 124
},
{
"entropy": 0.4651513993740082,
"epoch": 0.5,
"grad_norm": 0.9615445733070374,
"learning_rate": 0.00011583770329889687,
"loss": 0.3927,
"mean_token_accuracy": 0.8962194919586182,
"num_tokens": 1383577.0,
"step": 125
},
{
"entropy": 0.7203623056411743,
"epoch": 0.504,
"grad_norm": 1.9821685552597046,
"learning_rate": 0.00011467134363187099,
"loss": 0.7477,
"mean_token_accuracy": 0.8203157782554626,
"num_tokens": 1393079.0,
"step": 126
},
{
"entropy": 0.6460074186325073,
"epoch": 0.508,
"grad_norm": 2.170309543609619,
"learning_rate": 0.0001135041967292364,
"loss": 0.7293,
"mean_token_accuracy": 0.8246410489082336,
"num_tokens": 1402553.0,
"step": 127
},
{
"entropy": 0.5284869074821472,
"epoch": 0.512,
"grad_norm": 1.1976059675216675,
"learning_rate": 0.00011233645928378105,
"loss": 0.4515,
"mean_token_accuracy": 0.8835397362709045,
"num_tokens": 1412567.0,
"step": 128
},
{
"entropy": 0.4933440089225769,
"epoch": 0.516,
"grad_norm": 1.259605050086975,
"learning_rate": 0.00011116832808781378,
"loss": 0.4273,
"mean_token_accuracy": 0.8937007784843445,
"num_tokens": 1424507.0,
"step": 129
},
{
"entropy": 0.7313682436943054,
"epoch": 0.52,
"grad_norm": 1.3257278203964233,
"learning_rate": 0.00011000000000000002,
"loss": 0.6628,
"mean_token_accuracy": 0.8386083245277405,
"num_tokens": 1433419.0,
"step": 130
},
{
"entropy": 0.4719448387622833,
"epoch": 0.524,
"grad_norm": 1.0190857648849487,
"learning_rate": 0.00010883167191218624,
"loss": 0.394,
"mean_token_accuracy": 0.9015878438949585,
"num_tokens": 1444568.0,
"step": 131
},
{
"entropy": 0.671485185623169,
"epoch": 0.528,
"grad_norm": 1.0616258382797241,
"learning_rate": 0.00010766354071621898,
"loss": 0.6002,
"mean_token_accuracy": 0.8531094193458557,
"num_tokens": 1458029.0,
"step": 132
},
{
"entropy": 0.37650296092033386,
"epoch": 0.532,
"grad_norm": 1.3387216329574585,
"learning_rate": 0.00010649580327076363,
"loss": 0.3286,
"mean_token_accuracy": 0.9205968379974365,
"num_tokens": 1469290.0,
"step": 133
},
{
"entropy": 0.5341144800186157,
"epoch": 0.536,
"grad_norm": 1.3382490873336792,
"learning_rate": 0.00010532865636812906,
"loss": 0.5154,
"mean_token_accuracy": 0.8731343150138855,
"num_tokens": 1482290.0,
"step": 134
},
{
"entropy": 0.5627509951591492,
"epoch": 0.54,
"grad_norm": 1.9341037273406982,
"learning_rate": 0.00010416229670110314,
"loss": 0.6165,
"mean_token_accuracy": 0.8522540330886841,
"num_tokens": 1491409.0,
"step": 135
},
{
"entropy": 0.40396589040756226,
"epoch": 0.544,
"grad_norm": 1.1782172918319702,
"learning_rate": 0.0001029969208298054,
"loss": 0.3003,
"mean_token_accuracy": 0.9240846037864685,
"num_tokens": 1501106.0,
"step": 136
},
{
"entropy": 0.7882451415061951,
"epoch": 0.548,
"grad_norm": 1.2071242332458496,
"learning_rate": 0.00010183272514856172,
"loss": 0.7402,
"mean_token_accuracy": 0.8205325603485107,
"num_tokens": 1511511.0,
"step": 137
},
{
"entropy": 0.645850419998169,
"epoch": 0.552,
"grad_norm": 1.2258726358413696,
"learning_rate": 0.00010066990585280704,
"loss": 0.6628,
"mean_token_accuracy": 0.8416417241096497,
"num_tokens": 1523208.0,
"step": 138
},
{
"entropy": 0.42336830496788025,
"epoch": 0.556,
"grad_norm": 1.5242387056350708,
"learning_rate": 9.95086589060217e-05,
"loss": 0.2851,
"mean_token_accuracy": 0.9278303980827332,
"num_tokens": 1532078.0,
"step": 139
},
{
"entropy": 0.7408692240715027,
"epoch": 0.56,
"grad_norm": 1.1541547775268555,
"learning_rate": 9.834918000670681e-05,
"loss": 0.6626,
"mean_token_accuracy": 0.8373293280601501,
"num_tokens": 1544092.0,
"step": 140
},
{
"entropy": 0.5522950887680054,
"epoch": 0.564,
"grad_norm": 1.2949033975601196,
"learning_rate": 9.719166455540436e-05,
"loss": 0.4288,
"mean_token_accuracy": 0.8930450081825256,
"num_tokens": 1554360.0,
"step": 141
},
{
"entropy": 0.6674742698669434,
"epoch": 0.568,
"grad_norm": 1.4206823110580444,
"learning_rate": 9.603630762176718e-05,
"loss": 0.6521,
"mean_token_accuracy": 0.8428549766540527,
"num_tokens": 1567420.0,
"step": 142
},
{
"entropy": 0.48524826765060425,
"epoch": 0.572,
"grad_norm": 2.079292058944702,
"learning_rate": 9.488330391168516e-05,
"loss": 0.5301,
"mean_token_accuracy": 0.8732667565345764,
"num_tokens": 1577735.0,
"step": 143
},
{
"entropy": 0.6761812567710876,
"epoch": 0.576,
"grad_norm": 2.401937246322632,
"learning_rate": 9.373284773447259e-05,
"loss": 0.7367,
"mean_token_accuracy": 0.8284353613853455,
"num_tokens": 1587605.0,
"step": 144
},
{
"entropy": 0.6450383067131042,
"epoch": 0.58,
"grad_norm": 1.4243282079696655,
"learning_rate": 9.258513297012204e-05,
"loss": 0.5896,
"mean_token_accuracy": 0.8545143008232117,
"num_tokens": 1598694.0,
"step": 145
},
{
"entropy": 0.6930188536643982,
"epoch": 0.584,
"grad_norm": 1.256988763809204,
"learning_rate": 9.14403530366311e-05,
"loss": 0.6308,
"mean_token_accuracy": 0.8471713662147522,
"num_tokens": 1610716.0,
"step": 146
},
{
"entropy": 0.5218924283981323,
"epoch": 0.588,
"grad_norm": 1.4413528442382812,
"learning_rate": 9.029870085740649e-05,
"loss": 0.3976,
"mean_token_accuracy": 0.8993197083473206,
"num_tokens": 1621743.0,
"step": 147
},
{
"entropy": 0.6881991028785706,
"epoch": 0.592,
"grad_norm": 1.6851704120635986,
"learning_rate": 8.916036882875198e-05,
"loss": 0.5696,
"mean_token_accuracy": 0.8667510151863098,
"num_tokens": 1635186.0,
"step": 148
},
{
"entropy": 0.5879225134849548,
"epoch": 0.596,
"grad_norm": 1.0631791353225708,
"learning_rate": 8.802554878744481e-05,
"loss": 0.5184,
"mean_token_accuracy": 0.8734765648841858,
"num_tokens": 1647660.0,
"step": 149
},
{
"entropy": 0.2675434947013855,
"epoch": 0.6,
"grad_norm": 0.8148598670959473,
"learning_rate": 8.689443197840636e-05,
"loss": 0.1821,
"mean_token_accuracy": 0.9514302015304565,
"num_tokens": 1658080.0,
"step": 150
},
{
"entropy": 0.7003239989280701,
"epoch": 0.604,
"grad_norm": 2.1313421726226807,
"learning_rate": 8.576720902247291e-05,
"loss": 0.7331,
"mean_token_accuracy": 0.8224857449531555,
"num_tokens": 1668622.0,
"step": 151
},
{
"entropy": 0.3838817775249481,
"epoch": 0.608,
"grad_norm": 1.2568340301513672,
"learning_rate": 8.464406988427134e-05,
"loss": 0.3143,
"mean_token_accuracy": 0.9187853336334229,
"num_tokens": 1678536.0,
"step": 152
},
{
"entropy": 0.5554172992706299,
"epoch": 0.612,
"grad_norm": 2.047208786010742,
"learning_rate": 8.352520384020535e-05,
"loss": 0.5846,
"mean_token_accuracy": 0.8602444529533386,
"num_tokens": 1690974.0,
"step": 153
},
{
"entropy": 0.45566004514694214,
"epoch": 0.616,
"grad_norm": 1.319417953491211,
"learning_rate": 8.241079944655776e-05,
"loss": 0.429,
"mean_token_accuracy": 0.8949615955352783,
"num_tokens": 1702686.0,
"step": 154
},
{
"entropy": 0.592678964138031,
"epoch": 0.62,
"grad_norm": 1.4309483766555786,
"learning_rate": 8.130104450771434e-05,
"loss": 0.5834,
"mean_token_accuracy": 0.8569459319114685,
"num_tokens": 1712845.0,
"step": 155
},
{
"entropy": 0.6900731921195984,
"epoch": 0.624,
"grad_norm": 1.4166367053985596,
"learning_rate": 8.019612604451394e-05,
"loss": 0.5856,
"mean_token_accuracy": 0.8577383160591125,
"num_tokens": 1723883.0,
"step": 156
},
{
"entropy": 0.6701188087463379,
"epoch": 0.628,
"grad_norm": 1.5286020040512085,
"learning_rate": 7.909623026273107e-05,
"loss": 0.5537,
"mean_token_accuracy": 0.8609554767608643,
"num_tokens": 1733702.0,
"step": 157
},
{
"entropy": 0.6067744493484497,
"epoch": 0.632,
"grad_norm": 1.2828212976455688,
"learning_rate": 7.80015425216956e-05,
"loss": 0.5559,
"mean_token_accuracy": 0.8636751770973206,
"num_tokens": 1744245.0,
"step": 158
},
{
"entropy": 0.510319173336029,
"epoch": 0.636,
"grad_norm": 1.2530028820037842,
"learning_rate": 7.69122473030552e-05,
"loss": 0.4339,
"mean_token_accuracy": 0.8923482894897461,
"num_tokens": 1755617.0,
"step": 159
},
{
"entropy": 0.5396801829338074,
"epoch": 0.64,
"grad_norm": 1.4599785804748535,
"learning_rate": 7.582852817968576e-05,
"loss": 0.4212,
"mean_token_accuracy": 0.8964771628379822,
"num_tokens": 1766718.0,
"step": 160
},
{
"entropy": 0.5178655385971069,
"epoch": 0.644,
"grad_norm": 1.1682523488998413,
"learning_rate": 7.475056778475469e-05,
"loss": 0.4751,
"mean_token_accuracy": 0.8846276998519897,
"num_tokens": 1776107.0,
"step": 161
},
{
"entropy": 0.48712846636772156,
"epoch": 0.648,
"grad_norm": 1.3003511428833008,
"learning_rate": 7.367854778094291e-05,
"loss": 0.4654,
"mean_token_accuracy": 0.8929698467254639,
"num_tokens": 1786564.0,
"step": 162
},
{
"entropy": 0.3912014961242676,
"epoch": 0.652,
"grad_norm": 1.110151767730713,
"learning_rate": 7.261264882983024e-05,
"loss": 0.3429,
"mean_token_accuracy": 0.915362536907196,
"num_tokens": 1798771.0,
"step": 163
},
{
"entropy": 0.55037522315979,
"epoch": 0.656,
"grad_norm": 1.7164385318756104,
"learning_rate": 7.155305056144937e-05,
"loss": 0.5739,
"mean_token_accuracy": 0.8635889291763306,
"num_tokens": 1811228.0,
"step": 164
},
{
"entropy": 0.47252118587493896,
"epoch": 0.66,
"grad_norm": 1.010840654373169,
"learning_rate": 7.0499931544014e-05,
"loss": 0.4453,
"mean_token_accuracy": 0.890230119228363,
"num_tokens": 1822745.0,
"step": 165
},
{
"entropy": 0.4593927264213562,
"epoch": 0.664,
"grad_norm": 1.1940021514892578,
"learning_rate": 6.94534692538256e-05,
"loss": 0.3447,
"mean_token_accuracy": 0.9129361510276794,
"num_tokens": 1834497.0,
"step": 166
},
{
"entropy": 0.5545728802680969,
"epoch": 0.668,
"grad_norm": 1.5106139183044434,
"learning_rate": 6.841384004536434e-05,
"loss": 0.5047,
"mean_token_accuracy": 0.8748116493225098,
"num_tokens": 1841800.0,
"step": 167
},
{
"entropy": 0.4316740036010742,
"epoch": 0.672,
"grad_norm": 1.1023913621902466,
"learning_rate": 6.738121912156914e-05,
"loss": 0.3654,
"mean_token_accuracy": 0.9105084538459778,
"num_tokens": 1855077.0,
"step": 168
},
{
"entropy": 0.5366147756576538,
"epoch": 0.676,
"grad_norm": 1.2672346830368042,
"learning_rate": 6.63557805043115e-05,
"loss": 0.4416,
"mean_token_accuracy": 0.8936067819595337,
"num_tokens": 1865465.0,
"step": 169
},
{
"entropy": 0.5674976110458374,
"epoch": 0.68,
"grad_norm": 1.43003249168396,
"learning_rate": 6.533769700506875e-05,
"loss": 0.4565,
"mean_token_accuracy": 0.8876559138298035,
"num_tokens": 1875650.0,
"step": 170
},
{
"entropy": 0.49446940422058105,
"epoch": 0.684,
"grad_norm": 1.2005430459976196,
"learning_rate": 6.4327140195801e-05,
"loss": 0.417,
"mean_token_accuracy": 0.9007508158683777,
"num_tokens": 1885375.0,
"step": 171
},
{
"entropy": 0.6743717193603516,
"epoch": 0.688,
"grad_norm": 1.4010748863220215,
"learning_rate": 6.332428038003706e-05,
"loss": 0.637,
"mean_token_accuracy": 0.8471227884292603,
"num_tokens": 1896412.0,
"step": 172
},
{
"entropy": 0.49895045161247253,
"epoch": 0.692,
"grad_norm": 1.7875854969024658,
"learning_rate": 6.232928656417416e-05,
"loss": 0.449,
"mean_token_accuracy": 0.8918893933296204,
"num_tokens": 1907116.0,
"step": 173
},
{
"entropy": 0.3326154351234436,
"epoch": 0.696,
"grad_norm": 0.9512577652931213,
"learning_rate": 6.134232642899626e-05,
"loss": 0.2697,
"mean_token_accuracy": 0.9238321781158447,
"num_tokens": 1917201.0,
"step": 174
},
{
"entropy": 0.4969325065612793,
"epoch": 0.7,
"grad_norm": 1.3267816305160522,
"learning_rate": 6.036356630141565e-05,
"loss": 0.4614,
"mean_token_accuracy": 0.8914347887039185,
"num_tokens": 1929205.0,
"step": 175
},
{
"entropy": 0.5694164037704468,
"epoch": 0.704,
"grad_norm": 1.334541916847229,
"learning_rate": 5.9393171126443005e-05,
"loss": 0.5125,
"mean_token_accuracy": 0.8812792301177979,
"num_tokens": 1942246.0,
"step": 176
},
{
"entropy": 0.658866286277771,
"epoch": 0.708,
"grad_norm": 1.2868497371673584,
"learning_rate": 5.843130443938983e-05,
"loss": 0.6569,
"mean_token_accuracy": 0.8416849374771118,
"num_tokens": 1956397.0,
"step": 177
},
{
"entropy": 0.7168298959732056,
"epoch": 0.712,
"grad_norm": 1.1754109859466553,
"learning_rate": 5.747812833830895e-05,
"loss": 0.7006,
"mean_token_accuracy": 0.8340783715248108,
"num_tokens": 1967808.0,
"step": 178
},
{
"entropy": 0.7076151967048645,
"epoch": 0.716,
"grad_norm": 1.5503113269805908,
"learning_rate": 5.653380345667705e-05,
"loss": 0.616,
"mean_token_accuracy": 0.8446282148361206,
"num_tokens": 1980869.0,
"step": 179
},
{
"entropy": 0.7145153880119324,
"epoch": 0.72,
"grad_norm": 1.6007428169250488,
"learning_rate": 5.559848893632385e-05,
"loss": 0.6182,
"mean_token_accuracy": 0.8411088585853577,
"num_tokens": 1992703.0,
"step": 180
},
{
"entropy": 0.698581337928772,
"epoch": 0.724,
"grad_norm": 1.5277796983718872,
"learning_rate": 5.467234240061293e-05,
"loss": 0.6196,
"mean_token_accuracy": 0.8507580757141113,
"num_tokens": 2001543.0,
"step": 181
},
{
"entropy": 0.5171747803688049,
"epoch": 0.728,
"grad_norm": 1.39127516746521,
"learning_rate": 5.375551992787835e-05,
"loss": 0.3984,
"mean_token_accuracy": 0.9049353003501892,
"num_tokens": 2011980.0,
"step": 182
},
{
"entropy": 0.509817898273468,
"epoch": 0.732,
"grad_norm": 1.0949788093566895,
"learning_rate": 5.2848176025121535e-05,
"loss": 0.4335,
"mean_token_accuracy": 0.8921334147453308,
"num_tokens": 2024516.0,
"step": 183
},
{
"entropy": 0.4842955470085144,
"epoch": 0.736,
"grad_norm": 1.3567887544631958,
"learning_rate": 5.195046360197325e-05,
"loss": 0.4199,
"mean_token_accuracy": 0.8933181762695312,
"num_tokens": 2035054.0,
"step": 184
},
{
"entropy": 0.48027482628822327,
"epoch": 0.74,
"grad_norm": 1.9636229276657104,
"learning_rate": 5.106253394492435e-05,
"loss": 0.4542,
"mean_token_accuracy": 0.8890615105628967,
"num_tokens": 2044710.0,
"step": 185
},
{
"entropy": 0.47678428888320923,
"epoch": 0.744,
"grad_norm": 1.8577853441238403,
"learning_rate": 5.0184536691830476e-05,
"loss": 0.4531,
"mean_token_accuracy": 0.8908271789550781,
"num_tokens": 2056922.0,
"step": 186
},
{
"entropy": 0.4041728079319,
"epoch": 0.748,
"grad_norm": 1.4495080709457397,
"learning_rate": 4.931661980669439e-05,
"loss": 0.3819,
"mean_token_accuracy": 0.9036104083061218,
"num_tokens": 2068834.0,
"step": 187
},
{
"entropy": 0.3090624511241913,
"epoch": 0.752,
"grad_norm": 1.0853344202041626,
"learning_rate": 4.845892955473038e-05,
"loss": 0.291,
"mean_token_accuracy": 0.9313488006591797,
"num_tokens": 2080795.0,
"step": 188
},
{
"entropy": 0.5363933444023132,
"epoch": 0.756,
"grad_norm": 1.2786738872528076,
"learning_rate": 4.7611610477715026e-05,
"loss": 0.5352,
"mean_token_accuracy": 0.867972731590271,
"num_tokens": 2093711.0,
"step": 189
},
{
"entropy": 0.48970481753349304,
"epoch": 0.76,
"grad_norm": 1.483815312385559,
"learning_rate": 4.6774805369628324e-05,
"loss": 0.3646,
"mean_token_accuracy": 0.9098596572875977,
"num_tokens": 2104474.0,
"step": 190
},
{
"entropy": 0.5898410081863403,
"epoch": 0.764,
"grad_norm": 1.2790271043777466,
"learning_rate": 4.59486552525896e-05,
"loss": 0.5362,
"mean_token_accuracy": 0.8709191083908081,
"num_tokens": 2114431.0,
"step": 191
},
{
"entropy": 0.7715857028961182,
"epoch": 0.768,
"grad_norm": 1.4260997772216797,
"learning_rate": 4.51332993530915e-05,
"loss": 0.688,
"mean_token_accuracy": 0.8307946920394897,
"num_tokens": 2125922.0,
"step": 192
},
{
"entropy": 0.5289206504821777,
"epoch": 0.772,
"grad_norm": 1.214869499206543,
"learning_rate": 4.43288750785373e-05,
"loss": 0.4668,
"mean_token_accuracy": 0.8906829953193665,
"num_tokens": 2136700.0,
"step": 193
},
{
"entropy": 0.4115394949913025,
"epoch": 0.776,
"grad_norm": 1.061026930809021,
"learning_rate": 4.3535517994084064e-05,
"loss": 0.333,
"mean_token_accuracy": 0.9176801443099976,
"num_tokens": 2148789.0,
"step": 194
},
{
"entropy": 0.4777131974697113,
"epoch": 0.78,
"grad_norm": 1.1228642463684082,
"learning_rate": 4.275336179979683e-05,
"loss": 0.4044,
"mean_token_accuracy": 0.9039993286132812,
"num_tokens": 2161093.0,
"step": 195
},
{
"entropy": 0.42037472128868103,
"epoch": 0.784,
"grad_norm": 1.2192764282226562,
"learning_rate": 4.198253830811677e-05,
"loss": 0.3361,
"mean_token_accuracy": 0.9074494242668152,
"num_tokens": 2172116.0,
"step": 196
},
{
"entropy": 0.549899160861969,
"epoch": 0.788,
"grad_norm": 1.4125242233276367,
"learning_rate": 4.12231774216476e-05,
"loss": 0.4924,
"mean_token_accuracy": 0.879365086555481,
"num_tokens": 2181883.0,
"step": 197
},
{
"entropy": 0.42284148931503296,
"epoch": 0.792,
"grad_norm": 1.1463818550109863,
"learning_rate": 4.0475407111263817e-05,
"loss": 0.3531,
"mean_token_accuracy": 0.9119821190834045,
"num_tokens": 2194871.0,
"step": 198
},
{
"entropy": 0.5124052166938782,
"epoch": 0.796,
"grad_norm": 1.7839992046356201,
"learning_rate": 3.9739353394544477e-05,
"loss": 0.4233,
"mean_token_accuracy": 0.898973286151886,
"num_tokens": 2204613.0,
"step": 199
},
{
"entropy": 0.46030405163764954,
"epoch": 0.8,
"grad_norm": 1.3598767518997192,
"learning_rate": 3.901514031453619e-05,
"loss": 0.4143,
"mean_token_accuracy": 0.9042191505432129,
"num_tokens": 2215494.0,
"step": 200
},
{
"entropy": 0.5470673441886902,
"epoch": 0.804,
"grad_norm": 1.4430607557296753,
"learning_rate": 3.830288991884876e-05,
"loss": 0.527,
"mean_token_accuracy": 0.8680225610733032,
"num_tokens": 2224543.0,
"step": 201
},
{
"entropy": 0.43841931223869324,
"epoch": 0.808,
"grad_norm": 1.203965187072754,
"learning_rate": 3.7602722239087204e-05,
"loss": 0.4137,
"mean_token_accuracy": 0.894135594367981,
"num_tokens": 2236362.0,
"step": 202
},
{
"entropy": 0.4509918987751007,
"epoch": 0.812,
"grad_norm": 1.2725450992584229,
"learning_rate": 3.691475527062352e-05,
"loss": 0.4209,
"mean_token_accuracy": 0.8999525308609009,
"num_tokens": 2246899.0,
"step": 203
},
{
"entropy": 0.5433053970336914,
"epoch": 0.816,
"grad_norm": 1.3696599006652832,
"learning_rate": 3.6239104952711543e-05,
"loss": 0.463,
"mean_token_accuracy": 0.8843159079551697,
"num_tokens": 2254992.0,
"step": 204
},
{
"entropy": 0.5255707502365112,
"epoch": 0.82,
"grad_norm": 1.202747106552124,
"learning_rate": 3.557588514894843e-05,
"loss": 0.453,
"mean_token_accuracy": 0.8915954232215881,
"num_tokens": 2268213.0,
"step": 205
},
{
"entropy": 0.5911931395530701,
"epoch": 0.824,
"grad_norm": 1.4482736587524414,
"learning_rate": 3.492520762808572e-05,
"loss": 0.4987,
"mean_token_accuracy": 0.8807631134986877,
"num_tokens": 2279537.0,
"step": 206
},
{
"entropy": 0.4150068759918213,
"epoch": 0.828,
"grad_norm": 1.2278997898101807,
"learning_rate": 3.428718204519369e-05,
"loss": 0.2919,
"mean_token_accuracy": 0.9287025928497314,
"num_tokens": 2292611.0,
"step": 207
},
{
"entropy": 0.3332892954349518,
"epoch": 0.832,
"grad_norm": 1.3437390327453613,
"learning_rate": 3.366191592318176e-05,
"loss": 0.2095,
"mean_token_accuracy": 0.9491567015647888,
"num_tokens": 2304886.0,
"step": 208
},
{
"entropy": 0.6497487425804138,
"epoch": 0.836,
"grad_norm": 1.673365831375122,
"learning_rate": 3.3049514634678204e-05,
"loss": 0.6501,
"mean_token_accuracy": 0.8420344591140747,
"num_tokens": 2313067.0,
"step": 209
},
{
"entropy": 0.6357022523880005,
"epoch": 0.84,
"grad_norm": 1.2789956331253052,
"learning_rate": 3.245008138427235e-05,
"loss": 0.5881,
"mean_token_accuracy": 0.8542210459709167,
"num_tokens": 2327248.0,
"step": 210
},
{
"entropy": 0.5384138226509094,
"epoch": 0.844,
"grad_norm": 1.6131337881088257,
"learning_rate": 3.186371719112206e-05,
"loss": 0.5152,
"mean_token_accuracy": 0.8732239007949829,
"num_tokens": 2339918.0,
"step": 211
},
{
"entropy": 0.5150956511497498,
"epoch": 0.848,
"grad_norm": 1.2851109504699707,
"learning_rate": 3.1290520871929525e-05,
"loss": 0.4407,
"mean_token_accuracy": 0.8878676295280457,
"num_tokens": 2350800.0,
"step": 212
},
{
"entropy": 0.5567672252655029,
"epoch": 0.852,
"grad_norm": 1.4837950468063354,
"learning_rate": 3.0730589024288226e-05,
"loss": 0.4587,
"mean_token_accuracy": 0.8859366774559021,
"num_tokens": 2364163.0,
"step": 213
},
{
"entropy": 0.5855469107627869,
"epoch": 0.856,
"grad_norm": 1.4510327577590942,
"learning_rate": 3.0184016010403938e-05,
"loss": 0.5231,
"mean_token_accuracy": 0.8731569647789001,
"num_tokens": 2373389.0,
"step": 214
},
{
"entropy": 0.42299529910087585,
"epoch": 0.86,
"grad_norm": 1.2330726385116577,
"learning_rate": 2.965089394119227e-05,
"loss": 0.332,
"mean_token_accuracy": 0.9186156392097473,
"num_tokens": 2387116.0,
"step": 215
},
{
"entropy": 0.43762826919555664,
"epoch": 0.864,
"grad_norm": 1.1993961334228516,
"learning_rate": 2.9131312660755904e-05,
"loss": 0.3706,
"mean_token_accuracy": 0.9101641178131104,
"num_tokens": 2399062.0,
"step": 216
},
{
"entropy": 0.5866155624389648,
"epoch": 0.868,
"grad_norm": 1.4377245903015137,
"learning_rate": 2.8625359731243486e-05,
"loss": 0.4993,
"mean_token_accuracy": 0.8804880380630493,
"num_tokens": 2410703.0,
"step": 217
},
{
"entropy": 0.5209600329399109,
"epoch": 0.872,
"grad_norm": 1.2498382329940796,
"learning_rate": 2.8133120418093347e-05,
"loss": 0.4693,
"mean_token_accuracy": 0.8875941634178162,
"num_tokens": 2420660.0,
"step": 218
},
{
"entropy": 0.4361816346645355,
"epoch": 0.876,
"grad_norm": 1.188899040222168,
"learning_rate": 2.765467767566422e-05,
"loss": 0.3418,
"mean_token_accuracy": 0.9192692637443542,
"num_tokens": 2430460.0,
"step": 219
},
{
"entropy": 0.5995680093765259,
"epoch": 0.88,
"grad_norm": 1.4681471586227417,
"learning_rate": 2.7190112133255337e-05,
"loss": 0.5184,
"mean_token_accuracy": 0.8720136284828186,
"num_tokens": 2439838.0,
"step": 220
},
{
"entropy": 0.5519295930862427,
"epoch": 0.884,
"grad_norm": 1.2246594429016113,
"learning_rate": 2.673950208151847e-05,
"loss": 0.477,
"mean_token_accuracy": 0.8802193403244019,
"num_tokens": 2450234.0,
"step": 221
},
{
"entropy": 0.6201585531234741,
"epoch": 0.888,
"grad_norm": 1.4758093357086182,
"learning_rate": 2.6302923459264006e-05,
"loss": 0.5529,
"mean_token_accuracy": 0.8612440228462219,
"num_tokens": 2460686.0,
"step": 222
},
{
"entropy": 0.5428203344345093,
"epoch": 0.892,
"grad_norm": 1.0732289552688599,
"learning_rate": 2.5880449840663413e-05,
"loss": 0.4952,
"mean_token_accuracy": 0.8789449334144592,
"num_tokens": 2473806.0,
"step": 223
},
{
"entropy": 0.5736177563667297,
"epoch": 0.896,
"grad_norm": 1.1641875505447388,
"learning_rate": 2.547215242285026e-05,
"loss": 0.5083,
"mean_token_accuracy": 0.8738900423049927,
"num_tokens": 2486646.0,
"step": 224
},
{
"entropy": 0.3208327293395996,
"epoch": 0.9,
"grad_norm": 1.3467357158660889,
"learning_rate": 2.507810001392163e-05,
"loss": 0.2289,
"mean_token_accuracy": 0.9426351189613342,
"num_tokens": 2495399.0,
"step": 225
},
{
"entropy": 0.43385663628578186,
"epoch": 0.904,
"grad_norm": 1.3956007957458496,
"learning_rate": 2.469835902134236e-05,
"loss": 0.3405,
"mean_token_accuracy": 0.9122757315635681,
"num_tokens": 2505934.0,
"step": 226
},
{
"entropy": 0.399286150932312,
"epoch": 0.908,
"grad_norm": 1.0955601930618286,
"learning_rate": 2.4332993440753746e-05,
"loss": 0.322,
"mean_token_accuracy": 0.9209378957748413,
"num_tokens": 2518091.0,
"step": 227
},
{
"entropy": 0.5215837955474854,
"epoch": 0.912,
"grad_norm": 1.1155186891555786,
"learning_rate": 2.398206484518871e-05,
"loss": 0.4673,
"mean_token_accuracy": 0.8811452984809875,
"num_tokens": 2532657.0,
"step": 228
},
{
"entropy": 0.5278834104537964,
"epoch": 0.916,
"grad_norm": 1.7340788841247559,
"learning_rate": 2.3645632374695246e-05,
"loss": 0.4788,
"mean_token_accuracy": 0.8789379596710205,
"num_tokens": 2542150.0,
"step": 229
},
{
"entropy": 0.47815102338790894,
"epoch": 0.92,
"grad_norm": 1.61054265499115,
"learning_rate": 2.3323752726369835e-05,
"loss": 0.442,
"mean_token_accuracy": 0.8940832614898682,
"num_tokens": 2554473.0,
"step": 230
},
{
"entropy": 0.4165140390396118,
"epoch": 0.924,
"grad_norm": 1.14963698387146,
"learning_rate": 2.3016480144802675e-05,
"loss": 0.328,
"mean_token_accuracy": 0.9183060526847839,
"num_tokens": 2564794.0,
"step": 231
},
{
"entropy": 0.38186386227607727,
"epoch": 0.928,
"grad_norm": 1.187225580215454,
"learning_rate": 2.272386641293606e-05,
"loss": 0.3076,
"mean_token_accuracy": 0.9227842688560486,
"num_tokens": 2574522.0,
"step": 232
},
{
"entropy": 0.46965232491493225,
"epoch": 0.932,
"grad_norm": 1.2771713733673096,
"learning_rate": 2.2445960843337744e-05,
"loss": 0.3789,
"mean_token_accuracy": 0.9045142531394958,
"num_tokens": 2587793.0,
"step": 233
},
{
"entropy": 0.39393627643585205,
"epoch": 0.936,
"grad_norm": 1.0977147817611694,
"learning_rate": 2.218281026989053e-05,
"loss": 0.2874,
"mean_token_accuracy": 0.933529257774353,
"num_tokens": 2597664.0,
"step": 234
},
{
"entropy": 0.4673425555229187,
"epoch": 0.94,
"grad_norm": 1.0229376554489136,
"learning_rate": 2.1934459039899662e-05,
"loss": 0.3796,
"mean_token_accuracy": 0.9101356267929077,
"num_tokens": 2611676.0,
"step": 235
},
{
"entropy": 0.3621935546398163,
"epoch": 0.944,
"grad_norm": 1.1729012727737427,
"learning_rate": 2.1700949006619168e-05,
"loss": 0.2125,
"mean_token_accuracy": 0.9498928785324097,
"num_tokens": 2622415.0,
"step": 236
},
{
"entropy": 0.47119855880737305,
"epoch": 0.948,
"grad_norm": 1.2110202312469482,
"learning_rate": 2.1482319522198588e-05,
"loss": 0.3581,
"mean_token_accuracy": 0.9117594957351685,
"num_tokens": 2633693.0,
"step": 237
},
{
"entropy": 0.6427318453788757,
"epoch": 0.952,
"grad_norm": 1.4238137006759644,
"learning_rate": 2.127860743105119e-05,
"loss": 0.6113,
"mean_token_accuracy": 0.8502632975578308,
"num_tokens": 2646798.0,
"step": 238
},
{
"entropy": 0.6078838109970093,
"epoch": 0.956,
"grad_norm": 1.5493922233581543,
"learning_rate": 2.108984706364474e-05,
"loss": 0.5309,
"mean_token_accuracy": 0.874631941318512,
"num_tokens": 2657329.0,
"step": 239
},
{
"entropy": 0.4323933720588684,
"epoch": 0.96,
"grad_norm": 1.1048017740249634,
"learning_rate": 2.0916070230716063e-05,
"loss": 0.3455,
"mean_token_accuracy": 0.9157264232635498,
"num_tokens": 2668853.0,
"step": 240
},
{
"entropy": 0.6867014169692993,
"epoch": 0.964,
"grad_norm": 1.5176868438720703,
"learning_rate": 2.0757306217910032e-05,
"loss": 0.7058,
"mean_token_accuracy": 0.8293052911758423,
"num_tokens": 2680068.0,
"step": 241
},
{
"entropy": 0.4175410568714142,
"epoch": 0.968,
"grad_norm": 1.427336573600769,
"learning_rate": 2.0613581780844353e-05,
"loss": 0.3294,
"mean_token_accuracy": 0.9166304469108582,
"num_tokens": 2689270.0,
"step": 242
},
{
"entropy": 0.30933189392089844,
"epoch": 0.972,
"grad_norm": 1.0740463733673096,
"learning_rate": 2.048492114060048e-05,
"loss": 0.2382,
"mean_token_accuracy": 0.9348580837249756,
"num_tokens": 2701077.0,
"step": 243
},
{
"entropy": 0.4613304138183594,
"epoch": 0.976,
"grad_norm": 1.318914532661438,
"learning_rate": 2.037134597964185e-05,
"loss": 0.4104,
"mean_token_accuracy": 0.8936565518379211,
"num_tokens": 2711846.0,
"step": 244
},
{
"entropy": 0.4268723130226135,
"epoch": 0.98,
"grad_norm": 1.142288327217102,
"learning_rate": 2.0272875438159798e-05,
"loss": 0.3691,
"mean_token_accuracy": 0.9119612574577332,
"num_tokens": 2725467.0,
"step": 245
},
{
"entropy": 0.5718749165534973,
"epoch": 0.984,
"grad_norm": 1.352400541305542,
"learning_rate": 2.018952611084803e-05,
"loss": 0.4803,
"mean_token_accuracy": 0.8806823492050171,
"num_tokens": 2735962.0,
"step": 246
},
{
"entropy": 0.4914339780807495,
"epoch": 0.988,
"grad_norm": 1.3557024002075195,
"learning_rate": 2.012131204410593e-05,
"loss": 0.4089,
"mean_token_accuracy": 0.8950228095054626,
"num_tokens": 2745166.0,
"step": 247
},
{
"entropy": 0.3986694812774658,
"epoch": 0.992,
"grad_norm": 1.19772469997406,
"learning_rate": 2.0068244733671478e-05,
"loss": 0.283,
"mean_token_accuracy": 0.9307823777198792,
"num_tokens": 2757477.0,
"step": 248
},
{
"entropy": 0.49750185012817383,
"epoch": 0.996,
"grad_norm": 1.2758872509002686,
"learning_rate": 2.0030333122683887e-05,
"loss": 0.4291,
"mean_token_accuracy": 0.8971313834190369,
"num_tokens": 2767414.0,
"step": 249
},
{
"entropy": 0.41299375891685486,
"epoch": 1.0,
"grad_norm": 1.3803913593292236,
"learning_rate": 2.0007583600176482e-05,
"loss": 0.3336,
"mean_token_accuracy": 0.9214777946472168,
"num_tokens": 2777133.0,
"step": 250
}
],
"logging_steps": 1,
"max_steps": 250,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.78349455918081e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}