olmoe-sft / trainer_state.json
ddidacus's picture
Upload folder using huggingface_hub
7e0859a verified
Raw
History Blame Contribute Delete
55.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.0,
"eval_steps": 500,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.699141651391983,
"epoch": 0.02,
"grad_norm": 1.7043750286102295,
"learning_rate": 0.0,
"loss": 1.5967991352081299,
"mean_token_accuracy": 0.665926069021225,
"num_tokens": 74699.0,
"step": 1
},
{
"entropy": 0.6601996421813965,
"epoch": 0.04,
"grad_norm": 1.6597099304199219,
"learning_rate": 1e-05,
"loss": 1.5338245630264282,
"mean_token_accuracy": 0.6820768415927887,
"num_tokens": 138614.0,
"step": 2
},
{
"entropy": 0.7289904654026031,
"epoch": 0.06,
"grad_norm": 1.796127438545227,
"learning_rate": 2e-05,
"loss": 1.6285251379013062,
"mean_token_accuracy": 0.6539906561374664,
"num_tokens": 209509.0,
"step": 3
},
{
"entropy": 0.7412302494049072,
"epoch": 0.08,
"grad_norm": 1.4846091270446777,
"learning_rate": 3e-05,
"loss": 1.5454721450805664,
"mean_token_accuracy": 0.6691758334636688,
"num_tokens": 283751.0,
"step": 4
},
{
"entropy": 0.7322555780410767,
"epoch": 0.1,
"grad_norm": 1.4136911630630493,
"learning_rate": 4e-05,
"loss": 1.5077476501464844,
"mean_token_accuracy": 0.6744928658008575,
"num_tokens": 354066.0,
"step": 5
},
{
"entropy": 0.7739330530166626,
"epoch": 0.12,
"grad_norm": 0.9657893180847168,
"learning_rate": 5e-05,
"loss": 1.43147611618042,
"mean_token_accuracy": 0.6826294660568237,
"num_tokens": 422170.0,
"step": 6
},
{
"entropy": 0.8858513236045837,
"epoch": 0.14,
"grad_norm": 0.7331474423408508,
"learning_rate": 6e-05,
"loss": 1.450822353363037,
"mean_token_accuracy": 0.6648280322551727,
"num_tokens": 494040.0,
"step": 7
},
{
"entropy": 0.9634815156459808,
"epoch": 0.16,
"grad_norm": 0.5526663661003113,
"learning_rate": 7e-05,
"loss": 1.3808112144470215,
"mean_token_accuracy": 0.6719212830066681,
"num_tokens": 566616.0,
"step": 8
},
{
"entropy": 1.0627405643463135,
"epoch": 0.18,
"grad_norm": 0.48948273062705994,
"learning_rate": 8e-05,
"loss": 1.3656816482543945,
"mean_token_accuracy": 0.663449615240097,
"num_tokens": 637093.0,
"step": 9
},
{
"entropy": 1.1328747868537903,
"epoch": 0.2,
"grad_norm": 0.37054377794265747,
"learning_rate": 9e-05,
"loss": 1.2878801822662354,
"mean_token_accuracy": 0.6749334335327148,
"num_tokens": 701945.0,
"step": 10
},
{
"entropy": 1.2100302577018738,
"epoch": 0.22,
"grad_norm": 0.3048469126224518,
"learning_rate": 0.0001,
"loss": 1.236545443534851,
"mean_token_accuracy": 0.6853303909301758,
"num_tokens": 774533.0,
"step": 11
},
{
"entropy": 1.2940571904182434,
"epoch": 0.24,
"grad_norm": 0.3031807243824005,
"learning_rate": 0.0001,
"loss": 1.211038589477539,
"mean_token_accuracy": 0.6858378350734711,
"num_tokens": 847636.0,
"step": 12
},
{
"entropy": 1.299929440021515,
"epoch": 0.26,
"grad_norm": 0.2886947691440582,
"learning_rate": 0.0001,
"loss": 1.197202205657959,
"mean_token_accuracy": 0.6924754083156586,
"num_tokens": 923420.0,
"step": 13
},
{
"entropy": 1.252187728881836,
"epoch": 0.28,
"grad_norm": 0.25853437185287476,
"learning_rate": 0.0001,
"loss": 1.1612238883972168,
"mean_token_accuracy": 0.6976969540119171,
"num_tokens": 992109.0,
"step": 14
},
{
"entropy": 1.220507800579071,
"epoch": 0.3,
"grad_norm": 0.24553938210010529,
"learning_rate": 0.0001,
"loss": 1.1456246376037598,
"mean_token_accuracy": 0.6981014311313629,
"num_tokens": 1065114.0,
"step": 15
},
{
"entropy": 1.198462724685669,
"epoch": 0.32,
"grad_norm": 0.24306544661521912,
"learning_rate": 0.0001,
"loss": 1.1577763557434082,
"mean_token_accuracy": 0.6941779851913452,
"num_tokens": 1136722.0,
"step": 16
},
{
"entropy": 1.1386296153068542,
"epoch": 0.34,
"grad_norm": 0.22727081179618835,
"learning_rate": 0.0001,
"loss": 1.0986605882644653,
"mean_token_accuracy": 0.7019487023353577,
"num_tokens": 1209030.0,
"step": 17
},
{
"entropy": 1.117907702922821,
"epoch": 0.36,
"grad_norm": 0.21270814538002014,
"learning_rate": 0.0001,
"loss": 1.110465407371521,
"mean_token_accuracy": 0.701825737953186,
"num_tokens": 1276624.0,
"step": 18
},
{
"entropy": 1.1316577792167664,
"epoch": 0.38,
"grad_norm": 0.1995684653520584,
"learning_rate": 0.0001,
"loss": 1.1611299514770508,
"mean_token_accuracy": 0.6892036497592926,
"num_tokens": 1348478.0,
"step": 19
},
{
"entropy": 1.0270569920539856,
"epoch": 0.4,
"grad_norm": 0.18478907644748688,
"learning_rate": 0.0001,
"loss": 1.04264235496521,
"mean_token_accuracy": 0.7172180116176605,
"num_tokens": 1421488.0,
"step": 20
},
{
"entropy": 1.01737579703331,
"epoch": 0.42,
"grad_norm": 0.19284074008464813,
"learning_rate": 0.0001,
"loss": 1.0274319648742676,
"mean_token_accuracy": 0.718668669462204,
"num_tokens": 1488403.0,
"step": 21
},
{
"entropy": 1.0264459252357483,
"epoch": 0.44,
"grad_norm": 0.1576310396194458,
"learning_rate": 0.0001,
"loss": 1.0518046617507935,
"mean_token_accuracy": 0.7142763733863831,
"num_tokens": 1564657.0,
"step": 22
},
{
"entropy": 1.059712529182434,
"epoch": 0.46,
"grad_norm": 0.15488146245479584,
"learning_rate": 0.0001,
"loss": 1.082923412322998,
"mean_token_accuracy": 0.7053070664405823,
"num_tokens": 1633972.0,
"step": 23
},
{
"entropy": 1.0438059866428375,
"epoch": 0.48,
"grad_norm": 0.15164747834205627,
"learning_rate": 0.0001,
"loss": 1.0578590631484985,
"mean_token_accuracy": 0.7133743166923523,
"num_tokens": 1700893.0,
"step": 24
},
{
"entropy": 0.9979909062385559,
"epoch": 0.5,
"grad_norm": 0.14712916314601898,
"learning_rate": 0.0001,
"loss": 1.0294842720031738,
"mean_token_accuracy": 0.7216654419898987,
"num_tokens": 1767721.0,
"step": 25
},
{
"entropy": 1.0120922327041626,
"epoch": 0.52,
"grad_norm": 0.1360112428665161,
"learning_rate": 0.0001,
"loss": 1.0354883670806885,
"mean_token_accuracy": 0.7223899960517883,
"num_tokens": 1835156.0,
"step": 26
},
{
"entropy": 0.9896539449691772,
"epoch": 0.54,
"grad_norm": 0.12824475765228271,
"learning_rate": 0.0001,
"loss": 1.0203971862792969,
"mean_token_accuracy": 0.7212119996547699,
"num_tokens": 1910430.0,
"step": 27
},
{
"entropy": 0.9603240489959717,
"epoch": 0.56,
"grad_norm": 0.1179676204919815,
"learning_rate": 0.0001,
"loss": 0.9597353339195251,
"mean_token_accuracy": 0.7346547842025757,
"num_tokens": 1985373.0,
"step": 28
},
{
"entropy": 1.0493255257606506,
"epoch": 0.58,
"grad_norm": 0.12462859600782394,
"learning_rate": 0.0001,
"loss": 1.0499563217163086,
"mean_token_accuracy": 0.7120701968669891,
"num_tokens": 2054409.0,
"step": 29
},
{
"entropy": 1.0497854351997375,
"epoch": 0.6,
"grad_norm": 0.11791805922985077,
"learning_rate": 0.0001,
"loss": 1.0524396896362305,
"mean_token_accuracy": 0.7136416733264923,
"num_tokens": 2122893.0,
"step": 30
},
{
"entropy": 1.0638166069984436,
"epoch": 0.62,
"grad_norm": 0.12578116357326508,
"learning_rate": 0.0001,
"loss": 1.067002534866333,
"mean_token_accuracy": 0.7095249891281128,
"num_tokens": 2194755.0,
"step": 31
},
{
"entropy": 1.099778175354004,
"epoch": 0.64,
"grad_norm": 0.12349284440279007,
"learning_rate": 0.0001,
"loss": 1.0939478874206543,
"mean_token_accuracy": 0.7056429386138916,
"num_tokens": 2262214.0,
"step": 32
},
{
"entropy": 1.0646151900291443,
"epoch": 0.66,
"grad_norm": 0.12846575677394867,
"learning_rate": 0.0001,
"loss": 1.0653318166732788,
"mean_token_accuracy": 0.7122560441493988,
"num_tokens": 2331419.0,
"step": 33
},
{
"entropy": 1.0158570408821106,
"epoch": 0.68,
"grad_norm": 0.11879603564739227,
"learning_rate": 0.0001,
"loss": 1.0267729759216309,
"mean_token_accuracy": 0.7170567810535431,
"num_tokens": 2403814.0,
"step": 34
},
{
"entropy": 1.0103608667850494,
"epoch": 0.7,
"grad_norm": 0.12001688033342361,
"learning_rate": 0.0001,
"loss": 1.0078749656677246,
"mean_token_accuracy": 0.7219332754611969,
"num_tokens": 2474066.0,
"step": 35
},
{
"entropy": 1.0085046291351318,
"epoch": 0.72,
"grad_norm": 0.11229556053876877,
"learning_rate": 0.0001,
"loss": 1.015348196029663,
"mean_token_accuracy": 0.7219782471656799,
"num_tokens": 2547283.0,
"step": 36
},
{
"entropy": 1.0116952955722809,
"epoch": 0.74,
"grad_norm": 0.12163597345352173,
"learning_rate": 0.0001,
"loss": 1.0121233463287354,
"mean_token_accuracy": 0.7187064588069916,
"num_tokens": 2613331.0,
"step": 37
},
{
"entropy": 0.9940676093101501,
"epoch": 0.76,
"grad_norm": 0.11075941473245621,
"learning_rate": 0.0001,
"loss": 0.992800235748291,
"mean_token_accuracy": 0.7255141139030457,
"num_tokens": 2683528.0,
"step": 38
},
{
"entropy": 1.0126079320907593,
"epoch": 0.78,
"grad_norm": 0.11469519883394241,
"learning_rate": 0.0001,
"loss": 0.9988532066345215,
"mean_token_accuracy": 0.7211731672286987,
"num_tokens": 2750069.0,
"step": 39
},
{
"entropy": 0.9906446635723114,
"epoch": 0.8,
"grad_norm": 0.11193952709436417,
"learning_rate": 0.0001,
"loss": 0.9900511503219604,
"mean_token_accuracy": 0.722189337015152,
"num_tokens": 2821887.0,
"step": 40
},
{
"entropy": 0.9898229837417603,
"epoch": 0.82,
"grad_norm": 0.11920945346355438,
"learning_rate": 0.0001,
"loss": 0.9936800599098206,
"mean_token_accuracy": 0.7267130017280579,
"num_tokens": 2885811.0,
"step": 41
},
{
"entropy": 0.9716921448707581,
"epoch": 0.84,
"grad_norm": 0.11293631792068481,
"learning_rate": 0.0001,
"loss": 0.9800352454185486,
"mean_token_accuracy": 0.7265651822090149,
"num_tokens": 2955201.0,
"step": 42
},
{
"entropy": 0.9296073317527771,
"epoch": 0.86,
"grad_norm": 0.11454292386770248,
"learning_rate": 0.0001,
"loss": 0.9429284334182739,
"mean_token_accuracy": 0.734944611787796,
"num_tokens": 3019665.0,
"step": 43
},
{
"entropy": 0.9590237438678741,
"epoch": 0.88,
"grad_norm": 0.1102190762758255,
"learning_rate": 0.0001,
"loss": 0.9501940011978149,
"mean_token_accuracy": 0.7321249544620514,
"num_tokens": 3093335.0,
"step": 44
},
{
"entropy": 0.9053312838077545,
"epoch": 0.9,
"grad_norm": 0.11164271831512451,
"learning_rate": 0.0001,
"loss": 0.9103053212165833,
"mean_token_accuracy": 0.7460834383964539,
"num_tokens": 3159757.0,
"step": 45
},
{
"entropy": 0.9606629908084869,
"epoch": 0.92,
"grad_norm": 0.11079204827547073,
"learning_rate": 0.0001,
"loss": 0.9644097089767456,
"mean_token_accuracy": 0.7342032492160797,
"num_tokens": 3230892.0,
"step": 46
},
{
"entropy": 0.943544864654541,
"epoch": 0.94,
"grad_norm": 0.11624015867710114,
"learning_rate": 0.0001,
"loss": 0.9410842061042786,
"mean_token_accuracy": 0.7351740300655365,
"num_tokens": 3299869.0,
"step": 47
},
{
"entropy": 0.9592801034450531,
"epoch": 0.96,
"grad_norm": 0.11560477316379547,
"learning_rate": 0.0001,
"loss": 0.975141704082489,
"mean_token_accuracy": 0.7269536554813385,
"num_tokens": 3371272.0,
"step": 48
},
{
"entropy": 0.9194359481334686,
"epoch": 0.98,
"grad_norm": 0.11588755995035172,
"learning_rate": 0.0001,
"loss": 0.9375251531600952,
"mean_token_accuracy": 0.7386307418346405,
"num_tokens": 3439636.0,
"step": 49
},
{
"entropy": 0.9375229477882385,
"epoch": 1.0,
"grad_norm": 0.10675432533025742,
"learning_rate": 0.0001,
"loss": 0.9375709891319275,
"mean_token_accuracy": 0.7371015846729279,
"num_tokens": 3515643.0,
"step": 50
},
{
"entropy": 0.9784637987613678,
"epoch": 1.02,
"grad_norm": 0.12157473713159561,
"learning_rate": 0.0001,
"loss": 0.9589431881904602,
"mean_token_accuracy": 0.7312025725841522,
"num_tokens": 3579936.0,
"step": 51
},
{
"entropy": 0.9976795613765717,
"epoch": 1.04,
"grad_norm": 0.1218739002943039,
"learning_rate": 0.0001,
"loss": 0.9651644825935364,
"mean_token_accuracy": 0.7295917272567749,
"num_tokens": 3645097.0,
"step": 52
},
{
"entropy": 0.9457567930221558,
"epoch": 1.06,
"grad_norm": 0.11789195984601974,
"learning_rate": 0.0001,
"loss": 0.924875020980835,
"mean_token_accuracy": 0.7387276589870453,
"num_tokens": 3722386.0,
"step": 53
},
{
"entropy": 0.9368592202663422,
"epoch": 1.08,
"grad_norm": 0.11367881298065186,
"learning_rate": 0.0001,
"loss": 0.9108861088752747,
"mean_token_accuracy": 0.7435753047466278,
"num_tokens": 3795107.0,
"step": 54
},
{
"entropy": 0.9856767952442169,
"epoch": 1.1,
"grad_norm": 0.1143391951918602,
"learning_rate": 0.0001,
"loss": 0.9522716999053955,
"mean_token_accuracy": 0.7351356148719788,
"num_tokens": 3863645.0,
"step": 55
},
{
"entropy": 0.9017468690872192,
"epoch": 1.12,
"grad_norm": 0.11213760077953339,
"learning_rate": 0.0001,
"loss": 0.890508770942688,
"mean_token_accuracy": 0.75059974193573,
"num_tokens": 3933157.0,
"step": 56
},
{
"entropy": 0.9076333045959473,
"epoch": 1.1400000000000001,
"grad_norm": 0.10830755531787872,
"learning_rate": 0.0001,
"loss": 0.8893829584121704,
"mean_token_accuracy": 0.7474276721477509,
"num_tokens": 4002549.0,
"step": 57
},
{
"entropy": 0.9090627431869507,
"epoch": 1.16,
"grad_norm": 0.11783402413129807,
"learning_rate": 0.0001,
"loss": 0.9097412824630737,
"mean_token_accuracy": 0.7423691749572754,
"num_tokens": 4068026.0,
"step": 58
},
{
"entropy": 0.928420215845108,
"epoch": 1.18,
"grad_norm": 0.11873085796833038,
"learning_rate": 0.0001,
"loss": 0.9404212236404419,
"mean_token_accuracy": 0.7362638711929321,
"num_tokens": 4136948.0,
"step": 59
},
{
"entropy": 0.9221147298812866,
"epoch": 1.2,
"grad_norm": 0.11550325155258179,
"learning_rate": 0.0001,
"loss": 0.924960732460022,
"mean_token_accuracy": 0.7427571713924408,
"num_tokens": 4204112.0,
"step": 60
},
{
"entropy": 0.9216603636741638,
"epoch": 1.22,
"grad_norm": 0.11623509228229523,
"learning_rate": 0.0001,
"loss": 0.9106500148773193,
"mean_token_accuracy": 0.7429015040397644,
"num_tokens": 4272140.0,
"step": 61
},
{
"entropy": 0.9455150067806244,
"epoch": 1.24,
"grad_norm": 0.11591103672981262,
"learning_rate": 0.0001,
"loss": 0.9491208791732788,
"mean_token_accuracy": 0.7350127100944519,
"num_tokens": 4346769.0,
"step": 62
},
{
"entropy": 0.8898249566555023,
"epoch": 1.26,
"grad_norm": 0.11488021910190582,
"learning_rate": 0.0001,
"loss": 0.8970361351966858,
"mean_token_accuracy": 0.7481776773929596,
"num_tokens": 4418760.0,
"step": 63
},
{
"entropy": 0.8663885295391083,
"epoch": 1.28,
"grad_norm": 0.1245160847902298,
"learning_rate": 0.0001,
"loss": 0.8572047352790833,
"mean_token_accuracy": 0.7511683106422424,
"num_tokens": 4483453.0,
"step": 64
},
{
"entropy": 0.9115520715713501,
"epoch": 1.3,
"grad_norm": 0.12362005561590195,
"learning_rate": 0.0001,
"loss": 0.9021918773651123,
"mean_token_accuracy": 0.7433571219444275,
"num_tokens": 4553398.0,
"step": 65
},
{
"entropy": 0.9173152148723602,
"epoch": 1.32,
"grad_norm": 0.11844731867313385,
"learning_rate": 0.0001,
"loss": 0.9107658863067627,
"mean_token_accuracy": 0.7352526783943176,
"num_tokens": 4626227.0,
"step": 66
},
{
"entropy": 0.849992573261261,
"epoch": 1.34,
"grad_norm": 0.11784010380506516,
"learning_rate": 0.0001,
"loss": 0.8525710105895996,
"mean_token_accuracy": 0.7550307512283325,
"num_tokens": 4701977.0,
"step": 67
},
{
"entropy": 0.9553567171096802,
"epoch": 1.3599999999999999,
"grad_norm": 0.1190195307135582,
"learning_rate": 0.0001,
"loss": 0.9455575346946716,
"mean_token_accuracy": 0.7316735982894897,
"num_tokens": 4774545.0,
"step": 68
},
{
"entropy": 0.8593668639659882,
"epoch": 1.38,
"grad_norm": 0.11937589198350906,
"learning_rate": 0.0001,
"loss": 0.8549792170524597,
"mean_token_accuracy": 0.7569719552993774,
"num_tokens": 4847366.0,
"step": 69
},
{
"entropy": 0.9686211943626404,
"epoch": 1.4,
"grad_norm": 0.12214019149541855,
"learning_rate": 0.0001,
"loss": 0.9648027420043945,
"mean_token_accuracy": 0.7249570488929749,
"num_tokens": 4923060.0,
"step": 70
},
{
"entropy": 0.867369145154953,
"epoch": 1.42,
"grad_norm": 0.11730711907148361,
"learning_rate": 0.0001,
"loss": 0.8510935306549072,
"mean_token_accuracy": 0.7553304731845856,
"num_tokens": 4996176.0,
"step": 71
},
{
"entropy": 0.9160025417804718,
"epoch": 1.44,
"grad_norm": 0.12190750241279602,
"learning_rate": 0.0001,
"loss": 0.9096644520759583,
"mean_token_accuracy": 0.7384364008903503,
"num_tokens": 5068522.0,
"step": 72
},
{
"entropy": 0.9069952070713043,
"epoch": 1.46,
"grad_norm": 0.13640820980072021,
"learning_rate": 0.0001,
"loss": 0.8875448703765869,
"mean_token_accuracy": 0.7457329034805298,
"num_tokens": 5137623.0,
"step": 73
},
{
"entropy": 0.9026708900928497,
"epoch": 1.48,
"grad_norm": 0.12538853287696838,
"learning_rate": 0.0001,
"loss": 0.8914889097213745,
"mean_token_accuracy": 0.7435721457004547,
"num_tokens": 5208737.0,
"step": 74
},
{
"entropy": 0.9324445724487305,
"epoch": 1.5,
"grad_norm": 0.13337835669517517,
"learning_rate": 0.0001,
"loss": 0.9412592649459839,
"mean_token_accuracy": 0.7320683300495148,
"num_tokens": 5279457.0,
"step": 75
},
{
"entropy": 0.8831305801868439,
"epoch": 1.52,
"grad_norm": 0.1287890523672104,
"learning_rate": 0.0001,
"loss": 0.890162467956543,
"mean_token_accuracy": 0.7474140524864197,
"num_tokens": 5344457.0,
"step": 76
},
{
"entropy": 0.8844259679317474,
"epoch": 1.54,
"grad_norm": 0.12595458328723907,
"learning_rate": 0.0001,
"loss": 0.8862929940223694,
"mean_token_accuracy": 0.7448306679725647,
"num_tokens": 5416486.0,
"step": 77
},
{
"entropy": 0.9768937230110168,
"epoch": 1.56,
"grad_norm": 0.13385823369026184,
"learning_rate": 0.0001,
"loss": 0.9855270981788635,
"mean_token_accuracy": 0.7242069244384766,
"num_tokens": 5488930.0,
"step": 78
},
{
"entropy": 0.8970398604869843,
"epoch": 1.58,
"grad_norm": 0.12776781618595123,
"learning_rate": 0.0001,
"loss": 0.9010695219039917,
"mean_token_accuracy": 0.7380562722682953,
"num_tokens": 5558044.0,
"step": 79
},
{
"entropy": 0.8510560393333435,
"epoch": 1.6,
"grad_norm": 0.12845851480960846,
"learning_rate": 0.0001,
"loss": 0.8674848675727844,
"mean_token_accuracy": 0.7530980706214905,
"num_tokens": 5630814.0,
"step": 80
},
{
"entropy": 0.9194655120372772,
"epoch": 1.62,
"grad_norm": 0.12733094394207,
"learning_rate": 0.0001,
"loss": 0.9001493453979492,
"mean_token_accuracy": 0.7473941147327423,
"num_tokens": 5696496.0,
"step": 81
},
{
"entropy": 0.9078547358512878,
"epoch": 1.6400000000000001,
"grad_norm": 0.12357509136199951,
"learning_rate": 0.0001,
"loss": 0.9031519889831543,
"mean_token_accuracy": 0.7443413436412811,
"num_tokens": 5765578.0,
"step": 82
},
{
"entropy": 0.9426756799221039,
"epoch": 1.6600000000000001,
"grad_norm": 0.12899024784564972,
"learning_rate": 0.0001,
"loss": 0.9363412857055664,
"mean_token_accuracy": 0.7349725663661957,
"num_tokens": 5831979.0,
"step": 83
},
{
"entropy": 0.9146726131439209,
"epoch": 1.6800000000000002,
"grad_norm": 0.12931226193904877,
"learning_rate": 0.0001,
"loss": 0.9105992317199707,
"mean_token_accuracy": 0.7388072907924652,
"num_tokens": 5905661.0,
"step": 84
},
{
"entropy": 0.9316370487213135,
"epoch": 1.7,
"grad_norm": 0.13409629464149475,
"learning_rate": 0.0001,
"loss": 0.9174567461013794,
"mean_token_accuracy": 0.7437045872211456,
"num_tokens": 5973162.0,
"step": 85
},
{
"entropy": 0.9444582164287567,
"epoch": 1.72,
"grad_norm": 0.13663342595100403,
"learning_rate": 0.0001,
"loss": 0.9291839599609375,
"mean_token_accuracy": 0.7356755137443542,
"num_tokens": 6040751.0,
"step": 86
},
{
"entropy": 0.8949260711669922,
"epoch": 1.74,
"grad_norm": 0.12818805873394012,
"learning_rate": 0.0001,
"loss": 0.8870834112167358,
"mean_token_accuracy": 0.7440982460975647,
"num_tokens": 6112173.0,
"step": 87
},
{
"entropy": 0.9360968768596649,
"epoch": 1.76,
"grad_norm": 0.14662906527519226,
"learning_rate": 0.0001,
"loss": 0.9298614859580994,
"mean_token_accuracy": 0.7370602786540985,
"num_tokens": 6179601.0,
"step": 88
},
{
"entropy": 0.8710778653621674,
"epoch": 1.78,
"grad_norm": 0.13221921026706696,
"learning_rate": 0.0001,
"loss": 0.8649511337280273,
"mean_token_accuracy": 0.7522627413272858,
"num_tokens": 6246710.0,
"step": 89
},
{
"entropy": 0.8752692639827728,
"epoch": 1.8,
"grad_norm": 0.14055795967578888,
"learning_rate": 0.0001,
"loss": 0.8573565483093262,
"mean_token_accuracy": 0.754420816898346,
"num_tokens": 6319796.0,
"step": 90
},
{
"entropy": 0.779484897851944,
"epoch": 1.8199999999999998,
"grad_norm": 0.12845420837402344,
"learning_rate": 0.0001,
"loss": 0.7835309505462646,
"mean_token_accuracy": 0.7740673124790192,
"num_tokens": 6389425.0,
"step": 91
},
{
"entropy": 0.8905294835567474,
"epoch": 1.8399999999999999,
"grad_norm": 0.1387389600276947,
"learning_rate": 0.0001,
"loss": 0.8962739706039429,
"mean_token_accuracy": 0.7440564632415771,
"num_tokens": 6460606.0,
"step": 92
},
{
"entropy": 0.8370858132839203,
"epoch": 1.8599999999999999,
"grad_norm": 0.13243098556995392,
"learning_rate": 0.0001,
"loss": 0.8395211696624756,
"mean_token_accuracy": 0.7600894570350647,
"num_tokens": 6532762.0,
"step": 93
},
{
"entropy": 0.9130788445472717,
"epoch": 1.88,
"grad_norm": 0.13279658555984497,
"learning_rate": 0.0001,
"loss": 0.9157933592796326,
"mean_token_accuracy": 0.7389859557151794,
"num_tokens": 6601952.0,
"step": 94
},
{
"entropy": 0.889918178319931,
"epoch": 1.9,
"grad_norm": 0.134121835231781,
"learning_rate": 0.0001,
"loss": 0.8863574266433716,
"mean_token_accuracy": 0.7509450018405914,
"num_tokens": 6667993.0,
"step": 95
},
{
"entropy": 0.8806619942188263,
"epoch": 1.92,
"grad_norm": 0.1342441886663437,
"learning_rate": 0.0001,
"loss": 0.8897389769554138,
"mean_token_accuracy": 0.751017302274704,
"num_tokens": 6741003.0,
"step": 96
},
{
"entropy": 0.8719884157180786,
"epoch": 1.94,
"grad_norm": 0.13280296325683594,
"learning_rate": 0.0001,
"loss": 0.8737912178039551,
"mean_token_accuracy": 0.748961865901947,
"num_tokens": 6814733.0,
"step": 97
},
{
"entropy": 0.9378086924552917,
"epoch": 1.96,
"grad_norm": 0.142800435423851,
"learning_rate": 0.0001,
"loss": 0.928570032119751,
"mean_token_accuracy": 0.7347837388515472,
"num_tokens": 6887723.0,
"step": 98
},
{
"entropy": 0.8699579238891602,
"epoch": 1.98,
"grad_norm": 0.13884496688842773,
"learning_rate": 0.0001,
"loss": 0.8652123808860779,
"mean_token_accuracy": 0.7550584077835083,
"num_tokens": 6957156.0,
"step": 99
},
{
"entropy": 0.8680048286914825,
"epoch": 2.0,
"grad_norm": 0.13625894486904144,
"learning_rate": 0.0001,
"loss": 0.8566628694534302,
"mean_token_accuracy": 0.7550990581512451,
"num_tokens": 7030824.0,
"step": 100
},
{
"entropy": 0.8759163916110992,
"epoch": 2.02,
"grad_norm": 0.13642925024032593,
"learning_rate": 0.0001,
"loss": 0.8173877596855164,
"mean_token_accuracy": 0.7642171382904053,
"num_tokens": 7099794.0,
"step": 101
},
{
"entropy": 0.872030109167099,
"epoch": 2.04,
"grad_norm": 0.13444599509239197,
"learning_rate": 0.0001,
"loss": 0.8315644860267639,
"mean_token_accuracy": 0.7598301768302917,
"num_tokens": 7168851.0,
"step": 102
},
{
"entropy": 0.8999165594577789,
"epoch": 2.06,
"grad_norm": 0.14029845595359802,
"learning_rate": 0.0001,
"loss": 0.8543646335601807,
"mean_token_accuracy": 0.7513293921947479,
"num_tokens": 7239717.0,
"step": 103
},
{
"entropy": 0.8488370180130005,
"epoch": 2.08,
"grad_norm": 0.13906973600387573,
"learning_rate": 0.0001,
"loss": 0.8071736097335815,
"mean_token_accuracy": 0.768627405166626,
"num_tokens": 7310897.0,
"step": 104
},
{
"entropy": 0.8458687663078308,
"epoch": 2.1,
"grad_norm": 0.14410872757434845,
"learning_rate": 0.0001,
"loss": 0.8336784243583679,
"mean_token_accuracy": 0.7576306164264679,
"num_tokens": 7381044.0,
"step": 105
},
{
"entropy": 0.8117028772830963,
"epoch": 2.12,
"grad_norm": 0.15016138553619385,
"learning_rate": 0.0001,
"loss": 0.8016491532325745,
"mean_token_accuracy": 0.761463850736618,
"num_tokens": 7448539.0,
"step": 106
},
{
"entropy": 0.8423402607440948,
"epoch": 2.14,
"grad_norm": 0.14620108902454376,
"learning_rate": 0.0001,
"loss": 0.8520156145095825,
"mean_token_accuracy": 0.7559936344623566,
"num_tokens": 7523326.0,
"step": 107
},
{
"entropy": 0.7789672613143921,
"epoch": 2.16,
"grad_norm": 0.14582377672195435,
"learning_rate": 0.0001,
"loss": 0.7745522260665894,
"mean_token_accuracy": 0.7746096849441528,
"num_tokens": 7589964.0,
"step": 108
},
{
"entropy": 0.8252202570438385,
"epoch": 2.18,
"grad_norm": 0.15269358456134796,
"learning_rate": 0.0001,
"loss": 0.8253834247589111,
"mean_token_accuracy": 0.760587066411972,
"num_tokens": 7663822.0,
"step": 109
},
{
"entropy": 0.8460159599781036,
"epoch": 2.2,
"grad_norm": 0.15312956273555756,
"learning_rate": 0.0001,
"loss": 0.834621012210846,
"mean_token_accuracy": 0.7548129558563232,
"num_tokens": 7736094.0,
"step": 110
},
{
"entropy": 0.8546044528484344,
"epoch": 2.22,
"grad_norm": 0.1496986299753189,
"learning_rate": 0.0001,
"loss": 0.8300120830535889,
"mean_token_accuracy": 0.759436160326004,
"num_tokens": 7812027.0,
"step": 111
},
{
"entropy": 0.754067599773407,
"epoch": 2.24,
"grad_norm": 0.1404401957988739,
"learning_rate": 0.0001,
"loss": 0.7299779653549194,
"mean_token_accuracy": 0.7858331501483917,
"num_tokens": 7881889.0,
"step": 112
},
{
"entropy": 0.8271636366844177,
"epoch": 2.26,
"grad_norm": 0.15130330622196198,
"learning_rate": 0.0001,
"loss": 0.8026934862136841,
"mean_token_accuracy": 0.7606152594089508,
"num_tokens": 7958772.0,
"step": 113
},
{
"entropy": 0.8311681747436523,
"epoch": 2.2800000000000002,
"grad_norm": 0.15545408427715302,
"learning_rate": 0.0001,
"loss": 0.8179649114608765,
"mean_token_accuracy": 0.7627213597297668,
"num_tokens": 8029445.0,
"step": 114
},
{
"entropy": 0.8371923565864563,
"epoch": 2.3,
"grad_norm": 0.15620867908000946,
"learning_rate": 0.0001,
"loss": 0.8322392106056213,
"mean_token_accuracy": 0.7557950615882874,
"num_tokens": 8100496.0,
"step": 115
},
{
"entropy": 0.8774853646755219,
"epoch": 2.32,
"grad_norm": 0.16020546853542328,
"learning_rate": 0.0001,
"loss": 0.8756296634674072,
"mean_token_accuracy": 0.7484939396381378,
"num_tokens": 8172797.0,
"step": 116
},
{
"entropy": 0.7841235101222992,
"epoch": 2.34,
"grad_norm": 0.16341933608055115,
"learning_rate": 0.0001,
"loss": 0.7845247387886047,
"mean_token_accuracy": 0.7680597603321075,
"num_tokens": 8239973.0,
"step": 117
},
{
"entropy": 0.8059554100036621,
"epoch": 2.36,
"grad_norm": 0.14973363280296326,
"learning_rate": 0.0001,
"loss": 0.7868502140045166,
"mean_token_accuracy": 0.7696151733398438,
"num_tokens": 8312997.0,
"step": 118
},
{
"entropy": 0.790012925863266,
"epoch": 2.38,
"grad_norm": 0.15735657513141632,
"learning_rate": 0.0001,
"loss": 0.7770582437515259,
"mean_token_accuracy": 0.7715879082679749,
"num_tokens": 8380963.0,
"step": 119
},
{
"entropy": 0.7878563702106476,
"epoch": 2.4,
"grad_norm": 0.15908536314964294,
"learning_rate": 0.0001,
"loss": 0.7946950197219849,
"mean_token_accuracy": 0.7720945775508881,
"num_tokens": 8453009.0,
"step": 120
},
{
"entropy": 0.8163405060768127,
"epoch": 2.42,
"grad_norm": 0.15914228558540344,
"learning_rate": 0.0001,
"loss": 0.8022626042366028,
"mean_token_accuracy": 0.765992671251297,
"num_tokens": 8522525.0,
"step": 121
},
{
"entropy": 0.8679061532020569,
"epoch": 2.44,
"grad_norm": 0.1549653708934784,
"learning_rate": 0.0001,
"loss": 0.8452656269073486,
"mean_token_accuracy": 0.7564500868320465,
"num_tokens": 8591511.0,
"step": 122
},
{
"entropy": 0.8327716588973999,
"epoch": 2.46,
"grad_norm": 0.16247446835041046,
"learning_rate": 0.0001,
"loss": 0.8243684768676758,
"mean_token_accuracy": 0.7590730786323547,
"num_tokens": 8665286.0,
"step": 123
},
{
"entropy": 0.7765352427959442,
"epoch": 2.48,
"grad_norm": 0.15758228302001953,
"learning_rate": 0.0001,
"loss": 0.7422535419464111,
"mean_token_accuracy": 0.783282607793808,
"num_tokens": 8730146.0,
"step": 124
},
{
"entropy": 0.8039740025997162,
"epoch": 2.5,
"grad_norm": 0.1573210507631302,
"learning_rate": 0.0001,
"loss": 0.7967308759689331,
"mean_token_accuracy": 0.7692459225654602,
"num_tokens": 8801629.0,
"step": 125
},
{
"entropy": 0.8415170609951019,
"epoch": 2.52,
"grad_norm": 0.16268476843833923,
"learning_rate": 0.0001,
"loss": 0.8165377378463745,
"mean_token_accuracy": 0.7615750133991241,
"num_tokens": 8877985.0,
"step": 126
},
{
"entropy": 0.8203210234642029,
"epoch": 2.54,
"grad_norm": 0.16346436738967896,
"learning_rate": 0.0001,
"loss": 0.8121747970581055,
"mean_token_accuracy": 0.761315256357193,
"num_tokens": 8951559.0,
"step": 127
},
{
"entropy": 0.8293347358703613,
"epoch": 2.56,
"grad_norm": 0.17023281753063202,
"learning_rate": 0.0001,
"loss": 0.8173530101776123,
"mean_token_accuracy": 0.759048581123352,
"num_tokens": 9021509.0,
"step": 128
},
{
"entropy": 0.7746993601322174,
"epoch": 2.58,
"grad_norm": 0.1615564227104187,
"learning_rate": 0.0001,
"loss": 0.7658690214157104,
"mean_token_accuracy": 0.7726005017757416,
"num_tokens": 9090508.0,
"step": 129
},
{
"entropy": 0.8143576085567474,
"epoch": 2.6,
"grad_norm": 0.1704084575176239,
"learning_rate": 0.0001,
"loss": 0.8276199102401733,
"mean_token_accuracy": 0.7586769461631775,
"num_tokens": 9156045.0,
"step": 130
},
{
"entropy": 0.7868927419185638,
"epoch": 2.62,
"grad_norm": 0.16065886616706848,
"learning_rate": 0.0001,
"loss": 0.7649659514427185,
"mean_token_accuracy": 0.7774228751659393,
"num_tokens": 9221515.0,
"step": 131
},
{
"entropy": 0.8241930305957794,
"epoch": 2.64,
"grad_norm": 0.1710738241672516,
"learning_rate": 0.0001,
"loss": 0.8104192018508911,
"mean_token_accuracy": 0.7651428282260895,
"num_tokens": 9290829.0,
"step": 132
},
{
"entropy": 0.7782109975814819,
"epoch": 2.66,
"grad_norm": 0.3252999484539032,
"learning_rate": 0.0001,
"loss": 0.7537873983383179,
"mean_token_accuracy": 0.7770578563213348,
"num_tokens": 9358923.0,
"step": 133
},
{
"entropy": 0.7932650744915009,
"epoch": 2.68,
"grad_norm": 0.16687457263469696,
"learning_rate": 0.0001,
"loss": 0.771995484828949,
"mean_token_accuracy": 0.7717720866203308,
"num_tokens": 9431495.0,
"step": 134
},
{
"entropy": 0.8635589182376862,
"epoch": 2.7,
"grad_norm": 0.17788194119930267,
"learning_rate": 0.0001,
"loss": 0.839271605014801,
"mean_token_accuracy": 0.7549299001693726,
"num_tokens": 9502949.0,
"step": 135
},
{
"entropy": 0.8827160894870758,
"epoch": 2.7199999999999998,
"grad_norm": 0.17214906215667725,
"learning_rate": 0.0001,
"loss": 0.8584389686584473,
"mean_token_accuracy": 0.7523661851882935,
"num_tokens": 9572738.0,
"step": 136
},
{
"entropy": 0.7438818514347076,
"epoch": 2.74,
"grad_norm": 0.15866513550281525,
"learning_rate": 0.0001,
"loss": 0.7251607179641724,
"mean_token_accuracy": 0.7865616679191589,
"num_tokens": 9643339.0,
"step": 137
},
{
"entropy": 0.8008526265621185,
"epoch": 2.76,
"grad_norm": 0.17728553712368011,
"learning_rate": 0.0001,
"loss": 0.7907190322875977,
"mean_token_accuracy": 0.7696272730827332,
"num_tokens": 9712087.0,
"step": 138
},
{
"entropy": 0.7775652408599854,
"epoch": 2.7800000000000002,
"grad_norm": 0.16898134350776672,
"learning_rate": 0.0001,
"loss": 0.7762832641601562,
"mean_token_accuracy": 0.7671337127685547,
"num_tokens": 9787274.0,
"step": 139
},
{
"entropy": 0.7524736523628235,
"epoch": 2.8,
"grad_norm": 0.1687132865190506,
"learning_rate": 0.0001,
"loss": 0.7515966892242432,
"mean_token_accuracy": 0.7743718028068542,
"num_tokens": 9850649.0,
"step": 140
},
{
"entropy": 0.784816324710846,
"epoch": 2.82,
"grad_norm": 0.16266104578971863,
"learning_rate": 0.0001,
"loss": 0.7850303649902344,
"mean_token_accuracy": 0.7671224176883698,
"num_tokens": 9919647.0,
"step": 141
},
{
"entropy": 0.845661848783493,
"epoch": 2.84,
"grad_norm": 0.177549347281456,
"learning_rate": 0.0001,
"loss": 0.8321537375450134,
"mean_token_accuracy": 0.7545971870422363,
"num_tokens": 9988951.0,
"step": 142
},
{
"entropy": 0.7890813946723938,
"epoch": 2.86,
"grad_norm": 0.16998162865638733,
"learning_rate": 0.0001,
"loss": 0.7851375937461853,
"mean_token_accuracy": 0.77273029088974,
"num_tokens": 10059418.0,
"step": 143
},
{
"entropy": 0.8383583724498749,
"epoch": 2.88,
"grad_norm": 0.16811728477478027,
"learning_rate": 0.0001,
"loss": 0.8264563083648682,
"mean_token_accuracy": 0.7561212778091431,
"num_tokens": 10130582.0,
"step": 144
},
{
"entropy": 0.7998828291893005,
"epoch": 2.9,
"grad_norm": 0.162356436252594,
"learning_rate": 0.0001,
"loss": 0.7867046594619751,
"mean_token_accuracy": 0.7678299248218536,
"num_tokens": 10205184.0,
"step": 145
},
{
"entropy": 0.8201400637626648,
"epoch": 2.92,
"grad_norm": 0.1775413304567337,
"learning_rate": 0.0001,
"loss": 0.8155138492584229,
"mean_token_accuracy": 0.7631427645683289,
"num_tokens": 10272128.0,
"step": 146
},
{
"entropy": 0.8001563251018524,
"epoch": 2.94,
"grad_norm": 0.1714172512292862,
"learning_rate": 0.0001,
"loss": 0.7718967795372009,
"mean_token_accuracy": 0.7731671333312988,
"num_tokens": 10339140.0,
"step": 147
},
{
"entropy": 0.8686825633049011,
"epoch": 2.96,
"grad_norm": 0.1718156337738037,
"learning_rate": 0.0001,
"loss": 0.841813862323761,
"mean_token_accuracy": 0.7538741528987885,
"num_tokens": 10405402.0,
"step": 148
},
{
"entropy": 0.8255911767482758,
"epoch": 2.98,
"grad_norm": 0.17787101864814758,
"learning_rate": 0.0001,
"loss": 0.7991260290145874,
"mean_token_accuracy": 0.7636489570140839,
"num_tokens": 10473811.0,
"step": 149
},
{
"entropy": 0.8001417219638824,
"epoch": 3.0,
"grad_norm": 0.17027507722377777,
"learning_rate": 0.0001,
"loss": 0.7719438076019287,
"mean_token_accuracy": 0.7698873281478882,
"num_tokens": 10546089.0,
"step": 150
},
{
"entropy": 0.8200977146625519,
"epoch": 3.02,
"grad_norm": 0.16800017654895782,
"learning_rate": 0.0001,
"loss": 0.7360785007476807,
"mean_token_accuracy": 0.7826903462409973,
"num_tokens": 10618015.0,
"step": 151
},
{
"entropy": 0.8175333142280579,
"epoch": 3.04,
"grad_norm": 0.18896523118019104,
"learning_rate": 0.0001,
"loss": 0.7504415512084961,
"mean_token_accuracy": 0.7746379971504211,
"num_tokens": 10688911.0,
"step": 152
},
{
"entropy": 0.7592836618423462,
"epoch": 3.06,
"grad_norm": 0.18069066107273102,
"learning_rate": 0.0001,
"loss": 0.7176339626312256,
"mean_token_accuracy": 0.7862937152385712,
"num_tokens": 10755190.0,
"step": 153
},
{
"entropy": 0.7064773738384247,
"epoch": 3.08,
"grad_norm": 0.17506442964076996,
"learning_rate": 0.0001,
"loss": 0.6661837697029114,
"mean_token_accuracy": 0.7990798652172089,
"num_tokens": 10824572.0,
"step": 154
},
{
"entropy": 0.7049046158790588,
"epoch": 3.1,
"grad_norm": 0.18128055334091187,
"learning_rate": 0.0001,
"loss": 0.6970986127853394,
"mean_token_accuracy": 0.7910968661308289,
"num_tokens": 10897921.0,
"step": 155
},
{
"entropy": 0.7131330072879791,
"epoch": 3.12,
"grad_norm": 0.1793287843465805,
"learning_rate": 0.0001,
"loss": 0.6969539523124695,
"mean_token_accuracy": 0.7904528379440308,
"num_tokens": 10967473.0,
"step": 156
},
{
"entropy": 0.7718028426170349,
"epoch": 3.14,
"grad_norm": 0.18882189691066742,
"learning_rate": 0.0001,
"loss": 0.7447178959846497,
"mean_token_accuracy": 0.7770456969738007,
"num_tokens": 11040256.0,
"step": 157
},
{
"entropy": 0.753845751285553,
"epoch": 3.16,
"grad_norm": 0.20335878431797028,
"learning_rate": 0.0001,
"loss": 0.7178476452827454,
"mean_token_accuracy": 0.7853229939937592,
"num_tokens": 11106853.0,
"step": 158
},
{
"entropy": 0.6985587477684021,
"epoch": 3.18,
"grad_norm": 0.18876291811466217,
"learning_rate": 0.0001,
"loss": 0.6741787195205688,
"mean_token_accuracy": 0.7952553629875183,
"num_tokens": 11178868.0,
"step": 159
},
{
"entropy": 0.7184737622737885,
"epoch": 3.2,
"grad_norm": 0.19795499742031097,
"learning_rate": 0.0001,
"loss": 0.6854847073554993,
"mean_token_accuracy": 0.7917522490024567,
"num_tokens": 11246484.0,
"step": 160
},
{
"entropy": 0.7506313323974609,
"epoch": 3.22,
"grad_norm": 0.2013498693704605,
"learning_rate": 0.0001,
"loss": 0.7236944437026978,
"mean_token_accuracy": 0.7839900851249695,
"num_tokens": 11319820.0,
"step": 161
},
{
"entropy": 0.7317833006381989,
"epoch": 3.24,
"grad_norm": 0.19697904586791992,
"learning_rate": 0.0001,
"loss": 0.7071319222450256,
"mean_token_accuracy": 0.7910904288291931,
"num_tokens": 11389201.0,
"step": 162
},
{
"entropy": 0.7270588874816895,
"epoch": 3.26,
"grad_norm": 0.19727207720279694,
"learning_rate": 0.0001,
"loss": 0.7034903168678284,
"mean_token_accuracy": 0.7924522161483765,
"num_tokens": 11458094.0,
"step": 163
},
{
"entropy": 0.6620264649391174,
"epoch": 3.2800000000000002,
"grad_norm": 0.1949145644903183,
"learning_rate": 0.0001,
"loss": 0.6431432366371155,
"mean_token_accuracy": 0.8045243918895721,
"num_tokens": 11526439.0,
"step": 164
},
{
"entropy": 0.7114729583263397,
"epoch": 3.3,
"grad_norm": 0.2044411301612854,
"learning_rate": 0.0001,
"loss": 0.6916588544845581,
"mean_token_accuracy": 0.7911301851272583,
"num_tokens": 11593907.0,
"step": 165
},
{
"entropy": 0.7394631803035736,
"epoch": 3.32,
"grad_norm": 0.20598116517066956,
"learning_rate": 0.0001,
"loss": 0.7143540978431702,
"mean_token_accuracy": 0.7861869037151337,
"num_tokens": 11659313.0,
"step": 166
},
{
"entropy": 0.7148211598396301,
"epoch": 3.34,
"grad_norm": 0.19798815250396729,
"learning_rate": 0.0001,
"loss": 0.6806311011314392,
"mean_token_accuracy": 0.7966620624065399,
"num_tokens": 11729203.0,
"step": 167
},
{
"entropy": 0.7278057634830475,
"epoch": 3.36,
"grad_norm": 0.2106526643037796,
"learning_rate": 0.0001,
"loss": 0.6907294392585754,
"mean_token_accuracy": 0.7917556762695312,
"num_tokens": 11798662.0,
"step": 168
},
{
"entropy": 0.7575972974300385,
"epoch": 3.38,
"grad_norm": 0.19657012820243835,
"learning_rate": 0.0001,
"loss": 0.7215894460678101,
"mean_token_accuracy": 0.7850257754325867,
"num_tokens": 11874700.0,
"step": 169
},
{
"entropy": 0.7198713719844818,
"epoch": 3.4,
"grad_norm": 0.19392815232276917,
"learning_rate": 0.0001,
"loss": 0.6976982355117798,
"mean_token_accuracy": 0.7894782423973083,
"num_tokens": 11946770.0,
"step": 170
},
{
"entropy": 0.6691116690635681,
"epoch": 3.42,
"grad_norm": 0.1919872909784317,
"learning_rate": 0.0001,
"loss": 0.6429901123046875,
"mean_token_accuracy": 0.8067097663879395,
"num_tokens": 12016943.0,
"step": 171
},
{
"entropy": 0.7087913751602173,
"epoch": 3.44,
"grad_norm": 0.19245345890522003,
"learning_rate": 0.0001,
"loss": 0.6743010878562927,
"mean_token_accuracy": 0.8007382750511169,
"num_tokens": 12088223.0,
"step": 172
},
{
"entropy": 0.7334369122982025,
"epoch": 3.46,
"grad_norm": 0.1944996863603592,
"learning_rate": 0.0001,
"loss": 0.7241754531860352,
"mean_token_accuracy": 0.781945675611496,
"num_tokens": 12164031.0,
"step": 173
},
{
"entropy": 0.7216465771198273,
"epoch": 3.48,
"grad_norm": 0.195100337266922,
"learning_rate": 0.0001,
"loss": 0.6905370950698853,
"mean_token_accuracy": 0.7926844656467438,
"num_tokens": 12235488.0,
"step": 174
},
{
"entropy": 0.7634322941303253,
"epoch": 3.5,
"grad_norm": 0.20126116275787354,
"learning_rate": 0.0001,
"loss": 0.7199342250823975,
"mean_token_accuracy": 0.784062385559082,
"num_tokens": 12304402.0,
"step": 175
},
{
"entropy": 0.7162297964096069,
"epoch": 3.52,
"grad_norm": 0.19708800315856934,
"learning_rate": 0.0001,
"loss": 0.6828768253326416,
"mean_token_accuracy": 0.7963770925998688,
"num_tokens": 12376874.0,
"step": 176
},
{
"entropy": 0.7292175590991974,
"epoch": 3.54,
"grad_norm": 0.19853827357292175,
"learning_rate": 0.0001,
"loss": 0.6944613456726074,
"mean_token_accuracy": 0.7901931405067444,
"num_tokens": 12443682.0,
"step": 177
},
{
"entropy": 0.7690876424312592,
"epoch": 3.56,
"grad_norm": 0.2102740854024887,
"learning_rate": 0.0001,
"loss": 0.7348027229309082,
"mean_token_accuracy": 0.7807092070579529,
"num_tokens": 12511430.0,
"step": 178
},
{
"entropy": 0.7362220287322998,
"epoch": 3.58,
"grad_norm": 0.20193730294704437,
"learning_rate": 0.0001,
"loss": 0.7197112441062927,
"mean_token_accuracy": 0.7791264057159424,
"num_tokens": 12582173.0,
"step": 179
},
{
"entropy": 0.716655433177948,
"epoch": 3.6,
"grad_norm": 0.19548293948173523,
"learning_rate": 0.0001,
"loss": 0.7020804286003113,
"mean_token_accuracy": 0.789775550365448,
"num_tokens": 12655124.0,
"step": 180
},
{
"entropy": 0.7400652468204498,
"epoch": 3.62,
"grad_norm": 0.20551350712776184,
"learning_rate": 0.0001,
"loss": 0.7202802300453186,
"mean_token_accuracy": 0.7863712012767792,
"num_tokens": 12728612.0,
"step": 181
},
{
"entropy": 0.7541409730911255,
"epoch": 3.64,
"grad_norm": 0.200267493724823,
"learning_rate": 0.0001,
"loss": 0.713320255279541,
"mean_token_accuracy": 0.7859389185905457,
"num_tokens": 12800056.0,
"step": 182
},
{
"entropy": 0.6940381526947021,
"epoch": 3.66,
"grad_norm": 0.19558116793632507,
"learning_rate": 0.0001,
"loss": 0.6574203968048096,
"mean_token_accuracy": 0.8014397621154785,
"num_tokens": 12868372.0,
"step": 183
},
{
"entropy": 0.7630845606327057,
"epoch": 3.68,
"grad_norm": 0.20073311030864716,
"learning_rate": 0.0001,
"loss": 0.7155758738517761,
"mean_token_accuracy": 0.7896965146064758,
"num_tokens": 12937518.0,
"step": 184
},
{
"entropy": 0.7708411812782288,
"epoch": 3.7,
"grad_norm": 0.22150248289108276,
"learning_rate": 0.0001,
"loss": 0.7369881868362427,
"mean_token_accuracy": 0.7802594602108002,
"num_tokens": 13003915.0,
"step": 185
},
{
"entropy": 0.7173754870891571,
"epoch": 3.7199999999999998,
"grad_norm": 0.19912731647491455,
"learning_rate": 0.0001,
"loss": 0.6876958608627319,
"mean_token_accuracy": 0.7933018803596497,
"num_tokens": 13075561.0,
"step": 186
},
{
"entropy": 0.7382989227771759,
"epoch": 3.74,
"grad_norm": 0.20131585001945496,
"learning_rate": 0.0001,
"loss": 0.7099729180335999,
"mean_token_accuracy": 0.7907689809799194,
"num_tokens": 13147726.0,
"step": 187
},
{
"entropy": 0.7296792566776276,
"epoch": 3.76,
"grad_norm": 0.19849984347820282,
"learning_rate": 0.0001,
"loss": 0.7037006616592407,
"mean_token_accuracy": 0.7868267595767975,
"num_tokens": 13219764.0,
"step": 188
},
{
"entropy": 0.7335399687290192,
"epoch": 3.7800000000000002,
"grad_norm": 0.20115980505943298,
"learning_rate": 0.0001,
"loss": 0.7100788354873657,
"mean_token_accuracy": 0.786194235086441,
"num_tokens": 13291698.0,
"step": 189
},
{
"entropy": 0.7148082256317139,
"epoch": 3.8,
"grad_norm": 0.19843769073486328,
"learning_rate": 0.0001,
"loss": 0.6846855878829956,
"mean_token_accuracy": 0.7930681705474854,
"num_tokens": 13364738.0,
"step": 190
},
{
"entropy": 0.71998131275177,
"epoch": 3.82,
"grad_norm": 0.20854182541370392,
"learning_rate": 0.0001,
"loss": 0.6897561550140381,
"mean_token_accuracy": 0.7933003902435303,
"num_tokens": 13436984.0,
"step": 191
},
{
"entropy": 0.7520318031311035,
"epoch": 3.84,
"grad_norm": 0.21299579739570618,
"learning_rate": 0.0001,
"loss": 0.7223616242408752,
"mean_token_accuracy": 0.7838756442070007,
"num_tokens": 13504383.0,
"step": 192
},
{
"entropy": 0.7173813283443451,
"epoch": 3.86,
"grad_norm": 0.20238681137561798,
"learning_rate": 0.0001,
"loss": 0.6963660717010498,
"mean_token_accuracy": 0.7877775430679321,
"num_tokens": 13578910.0,
"step": 193
},
{
"entropy": 0.7405160069465637,
"epoch": 3.88,
"grad_norm": 0.21617071330547333,
"learning_rate": 0.0001,
"loss": 0.7227989435195923,
"mean_token_accuracy": 0.782155841588974,
"num_tokens": 13646579.0,
"step": 194
},
{
"entropy": 0.6996143460273743,
"epoch": 3.9,
"grad_norm": 0.20972195267677307,
"learning_rate": 0.0001,
"loss": 0.6725365519523621,
"mean_token_accuracy": 0.7987044751644135,
"num_tokens": 13712265.0,
"step": 195
},
{
"entropy": 0.6924785077571869,
"epoch": 3.92,
"grad_norm": 0.20143532752990723,
"learning_rate": 0.0001,
"loss": 0.6744241118431091,
"mean_token_accuracy": 0.7988313138484955,
"num_tokens": 13778938.0,
"step": 196
},
{
"entropy": 0.7586347460746765,
"epoch": 3.94,
"grad_norm": 0.21675406396389008,
"learning_rate": 0.0001,
"loss": 0.720883846282959,
"mean_token_accuracy": 0.7846451103687286,
"num_tokens": 13850680.0,
"step": 197
},
{
"entropy": 0.7003247439861298,
"epoch": 3.96,
"grad_norm": 0.20092730224132538,
"learning_rate": 0.0001,
"loss": 0.6743336915969849,
"mean_token_accuracy": 0.797335296869278,
"num_tokens": 13922486.0,
"step": 198
},
{
"entropy": 0.7424158155918121,
"epoch": 3.98,
"grad_norm": 0.2068347930908203,
"learning_rate": 0.0001,
"loss": 0.7222142815589905,
"mean_token_accuracy": 0.7855294048786163,
"num_tokens": 13994794.0,
"step": 199
},
{
"entropy": 0.7328775823116302,
"epoch": 4.0,
"grad_norm": 0.21473339200019836,
"learning_rate": 0.0001,
"loss": 0.6824338436126709,
"mean_token_accuracy": 0.7947524189949036,
"num_tokens": 14060764.0,
"step": 200
}
],
"logging_steps": 1,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 8.561776579712123e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}