Modelo-Treinado-Gemma3 / trainer_state.json
alexiaassis's picture
Upload folder using huggingface_hub
63bb3aa verified
Raw
History Blame Contribute Delete
41.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 1395,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.021528525296017224,
"grad_norm": 16.47992515563965,
"learning_rate": 9.998973021172564e-06,
"loss": 1.7834,
"num_input_tokens_seen": 43648,
"step": 10,
"train_runtime": 64.3878,
"train_tokens_per_second": 677.892
},
{
"epoch": 0.04305705059203445,
"grad_norm": 16.372161865234375,
"learning_rate": 9.995423512524277e-06,
"loss": 0.7676,
"num_input_tokens_seen": 87072,
"step": 20,
"train_runtime": 95.1979,
"train_tokens_per_second": 914.642
},
{
"epoch": 0.06458557588805167,
"grad_norm": 11.686817169189453,
"learning_rate": 9.98934059499448e-06,
"loss": 0.5817,
"num_input_tokens_seen": 131520,
"step": 30,
"train_runtime": 126.5065,
"train_tokens_per_second": 1039.63
},
{
"epoch": 0.0861141011840689,
"grad_norm": 3.2975926399230957,
"learning_rate": 9.980727353510257e-06,
"loss": 0.3531,
"num_input_tokens_seen": 175680,
"step": 40,
"train_runtime": 157.6702,
"train_tokens_per_second": 1114.225
},
{
"epoch": 0.10764262648008611,
"grad_norm": 3.4886627197265625,
"learning_rate": 9.969588156242282e-06,
"loss": 0.3352,
"num_input_tokens_seen": 219584,
"step": 50,
"train_runtime": 188.7104,
"train_tokens_per_second": 1163.603
},
{
"epoch": 0.12917115177610333,
"grad_norm": 3.484487295150757,
"learning_rate": 9.95592865238951e-06,
"loss": 0.2298,
"num_input_tokens_seen": 263392,
"step": 60,
"train_runtime": 219.7077,
"train_tokens_per_second": 1198.829
},
{
"epoch": 0.15069967707212056,
"grad_norm": 4.422971725463867,
"learning_rate": 9.939755769314215e-06,
"loss": 0.1981,
"num_input_tokens_seen": 306912,
"step": 70,
"train_runtime": 250.6069,
"train_tokens_per_second": 1224.675
},
{
"epoch": 0.1722282023681378,
"grad_norm": 1.4185198545455933,
"learning_rate": 9.9210777090288e-06,
"loss": 0.1755,
"num_input_tokens_seen": 349824,
"step": 80,
"train_runtime": 281.2405,
"train_tokens_per_second": 1243.86
},
{
"epoch": 0.193756727664155,
"grad_norm": 1.1935056447982788,
"learning_rate": 9.899903944036185e-06,
"loss": 0.1791,
"num_input_tokens_seen": 393664,
"step": 90,
"train_runtime": 312.2075,
"train_tokens_per_second": 1260.905
},
{
"epoch": 0.21528525296017223,
"grad_norm": 2.463397741317749,
"learning_rate": 9.87624521252587e-06,
"loss": 0.2051,
"num_input_tokens_seen": 437952,
"step": 100,
"train_runtime": 343.3508,
"train_tokens_per_second": 1275.523
},
{
"epoch": 0.23681377825618946,
"grad_norm": 3.8650355339050293,
"learning_rate": 9.850113512928094e-06,
"loss": 0.1912,
"num_input_tokens_seen": 481472,
"step": 110,
"train_runtime": 374.2539,
"train_tokens_per_second": 1286.485
},
{
"epoch": 0.25834230355220666,
"grad_norm": 4.704444885253906,
"learning_rate": 9.821522097828884e-06,
"loss": 0.1637,
"num_input_tokens_seen": 525472,
"step": 120,
"train_runtime": 405.4374,
"train_tokens_per_second": 1296.062
},
{
"epoch": 0.2798708288482239,
"grad_norm": 2.7267754077911377,
"learning_rate": 9.790485467249065e-06,
"loss": 0.1537,
"num_input_tokens_seen": 569696,
"step": 130,
"train_runtime": 436.4834,
"train_tokens_per_second": 1305.195
},
{
"epoch": 0.3013993541442411,
"grad_norm": 3.512826681137085,
"learning_rate": 9.757019361290621e-06,
"loss": 0.1846,
"num_input_tokens_seen": 613760,
"step": 140,
"train_runtime": 467.5968,
"train_tokens_per_second": 1312.584
},
{
"epoch": 0.32292787944025836,
"grad_norm": 2.484517812728882,
"learning_rate": 9.721140752154182e-06,
"loss": 0.1872,
"num_input_tokens_seen": 657824,
"step": 150,
"train_runtime": 498.6389,
"train_tokens_per_second": 1319.239
},
{
"epoch": 0.3444564047362756,
"grad_norm": 2.296607255935669,
"learning_rate": 9.682867835531624e-06,
"loss": 0.1372,
"num_input_tokens_seen": 701760,
"step": 160,
"train_runtime": 529.7256,
"train_tokens_per_second": 1324.761
},
{
"epoch": 0.36598493003229277,
"grad_norm": 3.887946128845215,
"learning_rate": 9.642220021378212e-06,
"loss": 0.2028,
"num_input_tokens_seen": 745184,
"step": 170,
"train_runtime": 560.5239,
"train_tokens_per_second": 1329.442
},
{
"epoch": 0.38751345532831,
"grad_norm": 2.1227307319641113,
"learning_rate": 9.59921792406891e-06,
"loss": 0.1765,
"num_input_tokens_seen": 789216,
"step": 180,
"train_runtime": 591.5958,
"train_tokens_per_second": 1334.046
},
{
"epoch": 0.40904198062432723,
"grad_norm": 3.007882595062256,
"learning_rate": 9.553883351943882e-06,
"loss": 0.1882,
"num_input_tokens_seen": 832960,
"step": 190,
"train_runtime": 622.6094,
"train_tokens_per_second": 1337.853
},
{
"epoch": 0.43057050592034446,
"grad_norm": 1.8637208938598633,
"learning_rate": 9.506239296248497e-06,
"loss": 0.1336,
"num_input_tokens_seen": 877664,
"step": 200,
"train_runtime": 654.0867,
"train_tokens_per_second": 1341.816
},
{
"epoch": 0.4520990312163617,
"grad_norm": 1.1324244737625122,
"learning_rate": 9.456309919473384e-06,
"loss": 0.1521,
"num_input_tokens_seen": 921536,
"step": 210,
"train_runtime": 685.133,
"train_tokens_per_second": 1345.047
},
{
"epoch": 0.4736275565123789,
"grad_norm": 3.536208391189575,
"learning_rate": 9.404120543100553e-06,
"loss": 0.1864,
"num_input_tokens_seen": 965344,
"step": 220,
"train_runtime": 716.7323,
"train_tokens_per_second": 1346.868
},
{
"epoch": 0.4951560818083961,
"grad_norm": 1.73074209690094,
"learning_rate": 9.34969763476168e-06,
"loss": 0.1625,
"num_input_tokens_seen": 1008672,
"step": 230,
"train_runtime": 747.5266,
"train_tokens_per_second": 1349.346
},
{
"epoch": 0.5166846071044133,
"grad_norm": 1.4830386638641357,
"learning_rate": 9.293068794815175e-06,
"loss": 0.1456,
"num_input_tokens_seen": 1051936,
"step": 240,
"train_runtime": 778.3038,
"train_tokens_per_second": 1351.575
},
{
"epoch": 0.5382131324004306,
"grad_norm": 2.7361512184143066,
"learning_rate": 9.234262742348764e-06,
"loss": 0.165,
"num_input_tokens_seen": 1095904,
"step": 250,
"train_runtime": 809.3485,
"train_tokens_per_second": 1354.057
},
{
"epoch": 0.5597416576964478,
"grad_norm": 1.9473741054534912,
"learning_rate": 9.17330930061471e-06,
"loss": 0.1487,
"num_input_tokens_seen": 1140064,
"step": 260,
"train_runtime": 840.5464,
"train_tokens_per_second": 1356.337
},
{
"epoch": 0.581270182992465,
"grad_norm": 2.0610098838806152,
"learning_rate": 9.11023938190509e-06,
"loss": 0.1687,
"num_input_tokens_seen": 1183872,
"step": 270,
"train_runtime": 871.5774,
"train_tokens_per_second": 1358.31
},
{
"epoch": 0.6027987082884823,
"grad_norm": 3.2189598083496094,
"learning_rate": 9.045084971874738e-06,
"loss": 0.1511,
"num_input_tokens_seen": 1228544,
"step": 280,
"train_runtime": 903.1191,
"train_tokens_per_second": 1360.334
},
{
"epoch": 0.6243272335844995,
"grad_norm": 3.902757406234741,
"learning_rate": 8.977879113319847e-06,
"loss": 0.184,
"num_input_tokens_seen": 1271968,
"step": 290,
"train_runtime": 934.0522,
"train_tokens_per_second": 1361.774
},
{
"epoch": 0.6458557588805167,
"grad_norm": 4.2983012199401855,
"learning_rate": 8.90865588942046e-06,
"loss": 0.1305,
"num_input_tokens_seen": 1316096,
"step": 300,
"train_runtime": 965.1778,
"train_tokens_per_second": 1363.579
},
{
"epoch": 0.667384284176534,
"grad_norm": 2.6156394481658936,
"learning_rate": 8.83745040645531e-06,
"loss": 0.1405,
"num_input_tokens_seen": 1360256,
"step": 310,
"train_runtime": 996.4077,
"train_tokens_per_second": 1365.16
},
{
"epoch": 0.6889128094725512,
"grad_norm": 1.3506444692611694,
"learning_rate": 8.764298775997823e-06,
"loss": 0.1651,
"num_input_tokens_seen": 1404064,
"step": 320,
"train_runtime": 1027.5151,
"train_tokens_per_second": 1366.466
},
{
"epoch": 0.7104413347685683,
"grad_norm": 1.5117799043655396,
"learning_rate": 8.68923809660227e-06,
"loss": 0.1519,
"num_input_tokens_seen": 1448256,
"step": 330,
"train_runtime": 1058.74,
"train_tokens_per_second": 1367.905
},
{
"epoch": 0.7319698600645855,
"grad_norm": 1.2659231424331665,
"learning_rate": 8.612306434989395e-06,
"loss": 0.1574,
"num_input_tokens_seen": 1492448,
"step": 340,
"train_runtime": 1090.0052,
"train_tokens_per_second": 1369.212
},
{
"epoch": 0.7534983853606028,
"grad_norm": 2.6010894775390625,
"learning_rate": 8.53354280674102e-06,
"loss": 0.1587,
"num_input_tokens_seen": 1537440,
"step": 350,
"train_runtime": 1121.55,
"train_tokens_per_second": 1370.817
},
{
"epoch": 0.77502691065662,
"grad_norm": 1.6968097686767578,
"learning_rate": 8.452987156513457e-06,
"loss": 0.1513,
"num_input_tokens_seen": 1581280,
"step": 360,
"train_runtime": 1152.6858,
"train_tokens_per_second": 1371.822
},
{
"epoch": 0.7965554359526372,
"grad_norm": 2.0298380851745605,
"learning_rate": 8.370680337779737e-06,
"loss": 0.1401,
"num_input_tokens_seen": 1625824,
"step": 370,
"train_runtime": 1184.3507,
"train_tokens_per_second": 1372.756
},
{
"epoch": 0.8180839612486545,
"grad_norm": 2.7614028453826904,
"learning_rate": 8.286664092110935e-06,
"loss": 0.1135,
"num_input_tokens_seen": 1669472,
"step": 380,
"train_runtime": 1215.2935,
"train_tokens_per_second": 1373.719
},
{
"epoch": 0.8396124865446717,
"grad_norm": 1.6297581195831299,
"learning_rate": 8.200981028007095e-06,
"loss": 0.1645,
"num_input_tokens_seen": 1713312,
"step": 390,
"train_runtime": 1246.1254,
"train_tokens_per_second": 1374.911
},
{
"epoch": 0.8611410118406889,
"grad_norm": 2.32612943649292,
"learning_rate": 8.11367459928851e-06,
"loss": 0.1129,
"num_input_tokens_seen": 1757056,
"step": 400,
"train_runtime": 1277.0951,
"train_tokens_per_second": 1375.822
},
{
"epoch": 0.8826695371367062,
"grad_norm": 1.5576270818710327,
"learning_rate": 8.024789083058289e-06,
"loss": 0.1333,
"num_input_tokens_seen": 1801632,
"step": 410,
"train_runtime": 1308.5556,
"train_tokens_per_second": 1376.81
},
{
"epoch": 0.9041980624327234,
"grad_norm": 8.420344352722168,
"learning_rate": 7.934369557247397e-06,
"loss": 0.1311,
"num_input_tokens_seen": 1845280,
"step": 420,
"train_runtime": 1339.4668,
"train_tokens_per_second": 1377.623
},
{
"epoch": 0.9257265877287406,
"grad_norm": 1.7291479110717773,
"learning_rate": 7.842461877753575e-06,
"loss": 0.1395,
"num_input_tokens_seen": 1889472,
"step": 430,
"train_runtime": 1370.6369,
"train_tokens_per_second": 1378.536
},
{
"epoch": 0.9472551130247578,
"grad_norm": 2.441693067550659,
"learning_rate": 7.7491126551857e-06,
"loss": 0.1175,
"num_input_tokens_seen": 1932832,
"step": 440,
"train_runtime": 1401.3047,
"train_tokens_per_second": 1379.309
},
{
"epoch": 0.9687836383207751,
"grad_norm": 1.3606727123260498,
"learning_rate": 7.654369231225398e-06,
"loss": 0.1154,
"num_input_tokens_seen": 1976000,
"step": 450,
"train_runtime": 1431.9402,
"train_tokens_per_second": 1379.946
},
{
"epoch": 0.9903121636167922,
"grad_norm": 2.911600351333618,
"learning_rate": 7.5582796546179125e-06,
"loss": 0.1408,
"num_input_tokens_seen": 2019968,
"step": 460,
"train_runtime": 1463.035,
"train_tokens_per_second": 1380.67
},
{
"epoch": 1.0107642626480087,
"grad_norm": 2.967047929763794,
"learning_rate": 7.460892656804366e-06,
"loss": 0.1126,
"num_input_tokens_seen": 2061440,
"step": 470,
"train_runtime": 1492.4083,
"train_tokens_per_second": 1381.284
},
{
"epoch": 1.0322927879440258,
"grad_norm": 1.90776789188385,
"learning_rate": 7.362257627207818e-06,
"loss": 0.1329,
"num_input_tokens_seen": 2105216,
"step": 480,
"train_runtime": 1523.2979,
"train_tokens_per_second": 1382.012
},
{
"epoch": 1.0538213132400431,
"grad_norm": 2.7770872116088867,
"learning_rate": 7.2624245881856094e-06,
"loss": 0.111,
"num_input_tokens_seen": 2149888,
"step": 490,
"train_runtime": 1554.9287,
"train_tokens_per_second": 1382.628
},
{
"epoch": 1.0753498385360603,
"grad_norm": 1.9737987518310547,
"learning_rate": 7.161444169660723e-06,
"loss": 0.113,
"num_input_tokens_seen": 2194304,
"step": 500,
"train_runtime": 1586.2216,
"train_tokens_per_second": 1383.353
},
{
"epoch": 1.0968783638320776,
"grad_norm": 1.2335457801818848,
"learning_rate": 7.059367583445034e-06,
"loss": 0.1303,
"num_input_tokens_seen": 2238080,
"step": 510,
"train_runtime": 1617.0801,
"train_tokens_per_second": 1384.025
},
{
"epoch": 1.1184068891280947,
"grad_norm": 2.525258779525757,
"learning_rate": 6.956246597267438e-06,
"loss": 0.1404,
"num_input_tokens_seen": 2282368,
"step": 520,
"train_runtime": 1648.4109,
"train_tokens_per_second": 1384.587
},
{
"epoch": 1.1399354144241118,
"grad_norm": 4.016520977020264,
"learning_rate": 6.852133508520057e-06,
"loss": 0.0972,
"num_input_tokens_seen": 2325984,
"step": 530,
"train_runtime": 1679.3164,
"train_tokens_per_second": 1385.078
},
{
"epoch": 1.1614639397201292,
"grad_norm": 1.405586838722229,
"learning_rate": 6.747081117735829e-06,
"loss": 0.1092,
"num_input_tokens_seen": 2369664,
"step": 540,
"train_runtime": 1710.2475,
"train_tokens_per_second": 1385.568
},
{
"epoch": 1.1829924650161463,
"grad_norm": 2.151442766189575,
"learning_rate": 6.641142701810932e-06,
"loss": 0.1186,
"num_input_tokens_seen": 2413312,
"step": 550,
"train_runtime": 1741.213,
"train_tokens_per_second": 1385.995
},
{
"epoch": 1.2045209903121636,
"grad_norm": 1.9706578254699707,
"learning_rate": 6.534371986985618e-06,
"loss": 0.1332,
"num_input_tokens_seen": 2457120,
"step": 560,
"train_runtime": 1772.1204,
"train_tokens_per_second": 1386.542
},
{
"epoch": 1.2260495156081808,
"grad_norm": 2.3035449981689453,
"learning_rate": 6.426823121597169e-06,
"loss": 0.1481,
"num_input_tokens_seen": 2500736,
"step": 570,
"train_runtime": 1803.0834,
"train_tokens_per_second": 1386.922
},
{
"epoch": 1.247578040904198,
"grad_norm": 3.713632106781006,
"learning_rate": 6.318550648618785e-06,
"loss": 0.1332,
"num_input_tokens_seen": 2545056,
"step": 580,
"train_runtime": 1834.1935,
"train_tokens_per_second": 1387.561
},
{
"epoch": 1.2691065662002152,
"grad_norm": 1.8667478561401367,
"learning_rate": 6.209609477998339e-06,
"loss": 0.0978,
"num_input_tokens_seen": 2588416,
"step": 590,
"train_runtime": 1864.9784,
"train_tokens_per_second": 1387.907
},
{
"epoch": 1.2906350914962326,
"grad_norm": 2.295342445373535,
"learning_rate": 6.100054858811012e-06,
"loss": 0.1176,
"num_input_tokens_seen": 2632352,
"step": 600,
"train_runtime": 1896.108,
"train_tokens_per_second": 1388.292
},
{
"epoch": 1.3121636167922497,
"grad_norm": 2.2867720127105713,
"learning_rate": 5.989942351239954e-06,
"loss": 0.1279,
"num_input_tokens_seen": 2676640,
"step": 610,
"train_runtime": 1927.5126,
"train_tokens_per_second": 1388.65
},
{
"epoch": 1.333692142088267,
"grad_norm": 2.1158223152160645,
"learning_rate": 5.879327798399155e-06,
"loss": 0.1407,
"num_input_tokens_seen": 2719968,
"step": 620,
"train_runtime": 1958.2576,
"train_tokens_per_second": 1388.974
},
{
"epoch": 1.3552206673842842,
"grad_norm": 4.076441287994385,
"learning_rate": 5.768267298012841e-06,
"loss": 0.1168,
"num_input_tokens_seen": 2764352,
"step": 630,
"train_runtime": 1989.6781,
"train_tokens_per_second": 1389.346
},
{
"epoch": 1.3767491926803013,
"grad_norm": 4.354236602783203,
"learning_rate": 5.656817173965733e-06,
"loss": 0.1188,
"num_input_tokens_seen": 2808832,
"step": 640,
"train_runtime": 2021.0224,
"train_tokens_per_second": 1389.807
},
{
"epoch": 1.3982777179763186,
"grad_norm": 4.40167236328125,
"learning_rate": 5.545033947738624e-06,
"loss": 0.1326,
"num_input_tokens_seen": 2852192,
"step": 650,
"train_runtime": 2051.72,
"train_tokens_per_second": 1390.147
},
{
"epoch": 1.419806243272336,
"grad_norm": 2.4845104217529297,
"learning_rate": 5.4329743097437316e-06,
"loss": 0.1331,
"num_input_tokens_seen": 2896256,
"step": 660,
"train_runtime": 2082.7361,
"train_tokens_per_second": 1390.602
},
{
"epoch": 1.441334768568353,
"grad_norm": 2.7233705520629883,
"learning_rate": 5.320695090574386e-06,
"loss": 0.1082,
"num_input_tokens_seen": 2939552,
"step": 670,
"train_runtime": 2113.5367,
"train_tokens_per_second": 1390.821
},
{
"epoch": 1.4628632938643702,
"grad_norm": 3.289949893951416,
"learning_rate": 5.208253232183625e-06,
"loss": 0.1184,
"num_input_tokens_seen": 2984000,
"step": 680,
"train_runtime": 2144.7931,
"train_tokens_per_second": 1391.276
},
{
"epoch": 1.4843918191603875,
"grad_norm": 4.015010833740234,
"learning_rate": 5.095705759006311e-06,
"loss": 0.0942,
"num_input_tokens_seen": 3028192,
"step": 690,
"train_runtime": 2176.0229,
"train_tokens_per_second": 1391.618
},
{
"epoch": 1.5059203444564049,
"grad_norm": 5.474874973297119,
"learning_rate": 4.9831097490394195e-06,
"loss": 0.1204,
"num_input_tokens_seen": 3071392,
"step": 700,
"train_runtime": 2206.8218,
"train_tokens_per_second": 1391.772
},
{
"epoch": 1.527448869752422,
"grad_norm": 2.4211018085479736,
"learning_rate": 4.870522304895164e-06,
"loss": 0.1358,
"num_input_tokens_seen": 3114496,
"step": 710,
"train_runtime": 2237.5127,
"train_tokens_per_second": 1391.946
},
{
"epoch": 1.5489773950484391,
"grad_norm": 2.5446665287017822,
"learning_rate": 4.758000524841632e-06,
"loss": 0.1313,
"num_input_tokens_seen": 3158432,
"step": 720,
"train_runtime": 2268.6496,
"train_tokens_per_second": 1392.208
},
{
"epoch": 1.5705059203444565,
"grad_norm": 5.643487453460693,
"learning_rate": 4.645601473845636e-06,
"loss": 0.0879,
"num_input_tokens_seen": 3201888,
"step": 730,
"train_runtime": 2299.4823,
"train_tokens_per_second": 1392.439
},
{
"epoch": 1.5920344456404736,
"grad_norm": 1.8654100894927979,
"learning_rate": 4.533382154632442e-06,
"loss": 0.0977,
"num_input_tokens_seen": 3245856,
"step": 740,
"train_runtime": 2330.5679,
"train_tokens_per_second": 1392.732
},
{
"epoch": 1.6135629709364907,
"grad_norm": 2.2264926433563232,
"learning_rate": 4.421399478777064e-06,
"loss": 0.1483,
"num_input_tokens_seen": 3290208,
"step": 750,
"train_runtime": 2361.9169,
"train_tokens_per_second": 1393.024
},
{
"epoch": 1.635091496232508,
"grad_norm": 2.8280999660491943,
"learning_rate": 4.3097102378417985e-06,
"loss": 0.1285,
"num_input_tokens_seen": 3333152,
"step": 760,
"train_runtime": 2392.5926,
"train_tokens_per_second": 1393.113
},
{
"epoch": 1.6566200215285254,
"grad_norm": 3.5213840007781982,
"learning_rate": 4.198371074574597e-06,
"loss": 0.1475,
"num_input_tokens_seen": 3377664,
"step": 770,
"train_runtime": 2423.9491,
"train_tokens_per_second": 1393.455
},
{
"epoch": 1.6781485468245425,
"grad_norm": 3.323622226715088,
"learning_rate": 4.087438454182942e-06,
"loss": 0.0904,
"num_input_tokens_seen": 3422400,
"step": 780,
"train_runtime": 2455.5818,
"train_tokens_per_second": 1393.723
},
{
"epoch": 1.6996770721205596,
"grad_norm": 4.368185997009277,
"learning_rate": 3.976968635697732e-06,
"loss": 0.1199,
"num_input_tokens_seen": 3465760,
"step": 790,
"train_runtime": 2486.3362,
"train_tokens_per_second": 1393.922
},
{
"epoch": 1.721205597416577,
"grad_norm": 3.0081822872161865,
"learning_rate": 3.867017643441746e-06,
"loss": 0.102,
"num_input_tokens_seen": 3509760,
"step": 800,
"train_runtime": 2517.434,
"train_tokens_per_second": 1394.182
},
{
"epoch": 1.7427341227125943,
"grad_norm": 3.7257721424102783,
"learning_rate": 3.757641238617137e-06,
"loss": 0.1194,
"num_input_tokens_seen": 3554560,
"step": 810,
"train_runtime": 2549.4732,
"train_tokens_per_second": 1394.233
},
{
"epoch": 1.7642626480086114,
"grad_norm": 3.8365535736083984,
"learning_rate": 3.648894891026358e-06,
"loss": 0.1507,
"num_input_tokens_seen": 3599488,
"step": 820,
"train_runtime": 2581.0241,
"train_tokens_per_second": 1394.597
},
{
"epoch": 1.7857911733046286,
"grad_norm": 2.1309561729431152,
"learning_rate": 3.5408337509408764e-06,
"loss": 0.1015,
"num_input_tokens_seen": 3643680,
"step": 830,
"train_runtime": 2612.3216,
"train_tokens_per_second": 1394.805
},
{
"epoch": 1.807319698600646,
"grad_norm": 2.5082457065582275,
"learning_rate": 3.4335126211319412e-06,
"loss": 0.1165,
"num_input_tokens_seen": 3688160,
"step": 840,
"train_runtime": 2643.6717,
"train_tokens_per_second": 1395.09
},
{
"epoch": 1.8288482238966632,
"grad_norm": 1.4419660568237305,
"learning_rate": 3.32698592907757e-06,
"loss": 0.0958,
"num_input_tokens_seen": 3731392,
"step": 850,
"train_runtime": 2674.4286,
"train_tokens_per_second": 1395.211
},
{
"epoch": 1.8503767491926801,
"grad_norm": 2.402513027191162,
"learning_rate": 3.2213076993598857e-06,
"loss": 0.1505,
"num_input_tokens_seen": 3776128,
"step": 860,
"train_runtime": 2706.116,
"train_tokens_per_second": 1395.405
},
{
"epoch": 1.8719052744886975,
"grad_norm": 0.9779609441757202,
"learning_rate": 3.1165315262667535e-06,
"loss": 0.1003,
"num_input_tokens_seen": 3820896,
"step": 870,
"train_runtime": 2737.6181,
"train_tokens_per_second": 1395.701
},
{
"epoch": 1.8934337997847148,
"grad_norm": 3.727255344390869,
"learning_rate": 3.012710546611659e-06,
"loss": 0.1483,
"num_input_tokens_seen": 3864704,
"step": 880,
"train_runtime": 2768.6885,
"train_tokens_per_second": 1395.861
},
{
"epoch": 1.914962325080732,
"grad_norm": 1.5679094791412354,
"learning_rate": 2.9098974127856e-06,
"loss": 0.117,
"num_input_tokens_seen": 3908544,
"step": 890,
"train_runtime": 2799.6713,
"train_tokens_per_second": 1396.072
},
{
"epoch": 1.936490850376749,
"grad_norm": 2.775408983230591,
"learning_rate": 2.8081442660546126e-06,
"loss": 0.1303,
"num_input_tokens_seen": 3952576,
"step": 900,
"train_runtime": 2830.9247,
"train_tokens_per_second": 1396.214
},
{
"epoch": 1.9580193756727664,
"grad_norm": 1.0387197732925415,
"learning_rate": 2.7075027101165706e-06,
"loss": 0.0971,
"num_input_tokens_seen": 3996416,
"step": 910,
"train_runtime": 2862.0695,
"train_tokens_per_second": 1396.338
},
{
"epoch": 1.9795479009687837,
"grad_norm": 3.794166326522827,
"learning_rate": 2.6080237849305467e-06,
"loss": 0.132,
"num_input_tokens_seen": 4040736,
"step": 920,
"train_runtime": 2893.2903,
"train_tokens_per_second": 1396.589
},
{
"epoch": 2.0,
"grad_norm": 1.547866702079773,
"learning_rate": 2.5097579408321264e-06,
"loss": 0.093,
"num_input_tokens_seen": 4083200,
"step": 930,
"train_runtime": 2923.2158,
"train_tokens_per_second": 1396.818
},
{
"epoch": 2.0215285252960173,
"grad_norm": 3.5177085399627686,
"learning_rate": 2.4127550129477145e-06,
"loss": 0.1324,
"num_input_tokens_seen": 4127040,
"step": 940,
"train_runtime": 2954.2784,
"train_tokens_per_second": 1396.971
},
{
"epoch": 2.0430570505920342,
"grad_norm": 1.8717275857925415,
"learning_rate": 2.317064195920852e-06,
"loss": 0.0841,
"num_input_tokens_seen": 4170816,
"step": 950,
"train_runtime": 2985.3333,
"train_tokens_per_second": 1397.102
},
{
"epoch": 2.0645855758880516,
"grad_norm": 1.233929991722107,
"learning_rate": 2.2227340189633508e-06,
"loss": 0.1138,
"num_input_tokens_seen": 4214272,
"step": 960,
"train_runtime": 3016.1559,
"train_tokens_per_second": 1397.233
},
{
"epoch": 2.086114101184069,
"grad_norm": 1.6053682565689087,
"learning_rate": 2.1298123212439028e-06,
"loss": 0.0892,
"num_input_tokens_seen": 4258592,
"step": 970,
"train_runtime": 3047.3824,
"train_tokens_per_second": 1397.459
},
{
"epoch": 2.1076426264800863,
"grad_norm": 2.4293172359466553,
"learning_rate": 2.0383462276266347e-06,
"loss": 0.1277,
"num_input_tokens_seen": 4302656,
"step": 980,
"train_runtime": 3078.5923,
"train_tokens_per_second": 1397.605
},
{
"epoch": 2.129171151776103,
"grad_norm": 2.0637197494506836,
"learning_rate": 1.948382124771927e-06,
"loss": 0.0968,
"num_input_tokens_seen": 4345888,
"step": 990,
"train_runtime": 3109.3083,
"train_tokens_per_second": 1397.703
},
{
"epoch": 2.1506996770721205,
"grad_norm": 3.5659446716308594,
"learning_rate": 1.8599656376116026e-06,
"loss": 0.1226,
"num_input_tokens_seen": 4390528,
"step": 1000,
"train_runtime": 3140.7259,
"train_tokens_per_second": 1397.934
},
{
"epoch": 2.172228202368138,
"grad_norm": 3.0801503658294678,
"learning_rate": 1.773141606210431e-06,
"loss": 0.1201,
"num_input_tokens_seen": 4434784,
"step": 1010,
"train_runtime": 3178.3674,
"train_tokens_per_second": 1395.303
},
{
"epoch": 2.193756727664155,
"grad_norm": 2.0641636848449707,
"learning_rate": 1.687954063025663e-06,
"loss": 0.0966,
"num_input_tokens_seen": 4478976,
"step": 1020,
"train_runtime": 3209.6721,
"train_tokens_per_second": 1395.462
},
{
"epoch": 2.215285252960172,
"grad_norm": 2.951422929763794,
"learning_rate": 1.604446210576157e-06,
"loss": 0.1143,
"num_input_tokens_seen": 4523616,
"step": 1030,
"train_runtime": 3241.2178,
"train_tokens_per_second": 1395.653
},
{
"epoch": 2.2368137782561894,
"grad_norm": 5.046944618225098,
"learning_rate": 1.5226603995323897e-06,
"loss": 0.1114,
"num_input_tokens_seen": 4567264,
"step": 1040,
"train_runtime": 3272.1686,
"train_tokens_per_second": 1395.791
},
{
"epoch": 2.2583423035522068,
"grad_norm": 1.3710857629776,
"learning_rate": 1.4426381072384866e-06,
"loss": 0.0981,
"num_input_tokens_seen": 4611104,
"step": 1050,
"train_runtime": 3303.3652,
"train_tokens_per_second": 1395.881
},
{
"epoch": 2.2798708288482237,
"grad_norm": 2.5878543853759766,
"learning_rate": 1.3644199166771531e-06,
"loss": 0.1135,
"num_input_tokens_seen": 4655040,
"step": 1060,
"train_runtime": 3334.5323,
"train_tokens_per_second": 1396.01
},
{
"epoch": 2.301399354144241,
"grad_norm": 2.481158494949341,
"learning_rate": 1.2880454958881794e-06,
"loss": 0.1081,
"num_input_tokens_seen": 4698432,
"step": 1070,
"train_runtime": 3365.4557,
"train_tokens_per_second": 1396.076
},
{
"epoch": 2.3229278794402584,
"grad_norm": 1.2142502069473267,
"learning_rate": 1.2135535778509545e-06,
"loss": 0.0685,
"num_input_tokens_seen": 4742848,
"step": 1080,
"train_runtime": 3396.7938,
"train_tokens_per_second": 1396.272
},
{
"epoch": 2.3444564047362757,
"grad_norm": 3.040208339691162,
"learning_rate": 1.1409819408411898e-06,
"loss": 0.0857,
"num_input_tokens_seen": 4786944,
"step": 1090,
"train_runtime": 3427.8943,
"train_tokens_per_second": 1396.468
},
{
"epoch": 2.3659849300322926,
"grad_norm": 1.4514607191085815,
"learning_rate": 1.070367389271823e-06,
"loss": 0.1008,
"num_input_tokens_seen": 4830624,
"step": 1100,
"train_runtime": 3458.8433,
"train_tokens_per_second": 1396.601
},
{
"epoch": 2.38751345532831,
"grad_norm": 3.533973455429077,
"learning_rate": 1.001745735027801e-06,
"loss": 0.1137,
"num_input_tokens_seen": 4874944,
"step": 1110,
"train_runtime": 3490.3116,
"train_tokens_per_second": 1396.707
},
{
"epoch": 2.4090419806243273,
"grad_norm": 4.195890426635742,
"learning_rate": 9.351517793042408e-07,
"loss": 0.1038,
"num_input_tokens_seen": 4918496,
"step": 1120,
"train_runtime": 3521.354,
"train_tokens_per_second": 1396.763
},
{
"epoch": 2.4305705059203446,
"grad_norm": 4.139116287231445,
"learning_rate": 8.706192949571262e-07,
"loss": 0.1194,
"num_input_tokens_seen": 4961920,
"step": 1130,
"train_runtime": 3552.2441,
"train_tokens_per_second": 1396.841
},
{
"epoch": 2.4520990312163615,
"grad_norm": 3.0998311042785645,
"learning_rate": 8.081810093755537e-07,
"loss": 0.1161,
"num_input_tokens_seen": 5005440,
"step": 1140,
"train_runtime": 3583.1755,
"train_tokens_per_second": 1396.928
},
{
"epoch": 2.473627556512379,
"grad_norm": 2.2539584636688232,
"learning_rate": 7.478685878841629e-07,
"loss": 0.1,
"num_input_tokens_seen": 5049344,
"step": 1150,
"train_runtime": 3614.3079,
"train_tokens_per_second": 1397.043
},
{
"epoch": 2.495156081808396,
"grad_norm": 3.1125545501708984,
"learning_rate": 6.897126176841978e-07,
"loss": 0.0996,
"num_input_tokens_seen": 5092896,
"step": 1160,
"train_runtime": 3645.2176,
"train_tokens_per_second": 1397.145
},
{
"epoch": 2.5166846071044136,
"grad_norm": 3.5130155086517334,
"learning_rate": 6.337425923413276e-07,
"loss": 0.0944,
"num_input_tokens_seen": 5136928,
"step": 1170,
"train_runtime": 3676.3104,
"train_tokens_per_second": 1397.305
},
{
"epoch": 2.5382131324004304,
"grad_norm": 2.059572696685791,
"learning_rate": 5.799868968281075e-07,
"loss": 0.08,
"num_input_tokens_seen": 5180960,
"step": 1180,
"train_runtime": 3707.5494,
"train_tokens_per_second": 1397.408
},
{
"epoch": 2.559741657696448,
"grad_norm": 4.341704845428467,
"learning_rate": 5.284727931286526e-07,
"loss": 0.0962,
"num_input_tokens_seen": 5225376,
"step": 1190,
"train_runtime": 3738.9161,
"train_tokens_per_second": 1397.564
},
{
"epoch": 2.581270182992465,
"grad_norm": 2.8424837589263916,
"learning_rate": 4.792264064128327e-07,
"loss": 0.094,
"num_input_tokens_seen": 5268992,
"step": 1200,
"train_runtime": 3769.9587,
"train_tokens_per_second": 1397.626
},
{
"epoch": 2.602798708288482,
"grad_norm": 3.76309871673584,
"learning_rate": 4.322727117869951e-07,
"loss": 0.1005,
"num_input_tokens_seen": 5312992,
"step": 1210,
"train_runtime": 3801.0547,
"train_tokens_per_second": 1397.768
},
{
"epoch": 2.6243272335844994,
"grad_norm": 2.470759153366089,
"learning_rate": 3.8763552162794983e-07,
"loss": 0.1167,
"num_input_tokens_seen": 5356448,
"step": 1220,
"train_runtime": 3831.9201,
"train_tokens_per_second": 1397.85
},
{
"epoch": 2.6458557588805167,
"grad_norm": 2.948512315750122,
"learning_rate": 3.453374735066034e-07,
"loss": 0.0907,
"num_input_tokens_seen": 5400672,
"step": 1230,
"train_runtime": 3863.178,
"train_tokens_per_second": 1397.987
},
{
"epoch": 2.667384284176534,
"grad_norm": 2.082956552505493,
"learning_rate": 3.054000187074224e-07,
"loss": 0.1074,
"num_input_tokens_seen": 5444576,
"step": 1240,
"train_runtime": 3894.1783,
"train_tokens_per_second": 1398.132
},
{
"epoch": 2.6889128094725514,
"grad_norm": 2.035034656524658,
"learning_rate": 2.678434113494882e-07,
"loss": 0.1128,
"num_input_tokens_seen": 5488160,
"step": 1250,
"train_runtime": 3925.0458,
"train_tokens_per_second": 1398.241
},
{
"epoch": 2.7104413347685683,
"grad_norm": 3.7168209552764893,
"learning_rate": 2.326866981147091e-07,
"loss": 0.1016,
"num_input_tokens_seen": 5532000,
"step": 1260,
"train_runtime": 3956.0804,
"train_tokens_per_second": 1398.354
},
{
"epoch": 2.7319698600645856,
"grad_norm": 4.349425315856934,
"learning_rate": 1.999477085883711e-07,
"loss": 0.1052,
"num_input_tokens_seen": 5575808,
"step": 1270,
"train_runtime": 3987.1129,
"train_tokens_per_second": 1398.458
},
{
"epoch": 2.7534983853606025,
"grad_norm": 1.8204060792922974,
"learning_rate": 1.6964304621693516e-07,
"loss": 0.0918,
"num_input_tokens_seen": 5619200,
"step": 1280,
"train_runtime": 4017.8653,
"train_tokens_per_second": 1398.554
},
{
"epoch": 2.77502691065662,
"grad_norm": 3.752577066421509,
"learning_rate": 1.4178807988766419e-07,
"loss": 0.109,
"num_input_tokens_seen": 5662656,
"step": 1290,
"train_runtime": 4048.795,
"train_tokens_per_second": 1398.603
},
{
"epoch": 2.7965554359526372,
"grad_norm": 3.749866247177124,
"learning_rate": 1.1639693613435921e-07,
"loss": 0.1224,
"num_input_tokens_seen": 5706656,
"step": 1300,
"train_runtime": 4079.9279,
"train_tokens_per_second": 1398.715
},
{
"epoch": 2.8180839612486546,
"grad_norm": 2.628767251968384,
"learning_rate": 9.348249197313918e-08,
"loss": 0.0992,
"num_input_tokens_seen": 5751232,
"step": 1310,
"train_runtime": 4111.4798,
"train_tokens_per_second": 1398.823
},
{
"epoch": 2.839612486544672,
"grad_norm": 0.7992174625396729,
"learning_rate": 7.305636837191876e-08,
"loss": 0.107,
"num_input_tokens_seen": 5794976,
"step": 1320,
"train_runtime": 4142.503,
"train_tokens_per_second": 1398.907
},
{
"epoch": 2.861141011840689,
"grad_norm": 3.0042312145233154,
"learning_rate": 5.512892435687645e-08,
"loss": 0.0944,
"num_input_tokens_seen": 5838368,
"step": 1330,
"train_runtime": 4173.35,
"train_tokens_per_second": 1398.964
},
{
"epoch": 2.882669537136706,
"grad_norm": 3.208315134048462,
"learning_rate": 3.970925175892093e-08,
"loss": 0.0867,
"num_input_tokens_seen": 5881984,
"step": 1340,
"train_runtime": 4204.3268,
"train_tokens_per_second": 1399.031
},
{
"epoch": 2.9041980624327235,
"grad_norm": 3.5772690773010254,
"learning_rate": 2.6805170602803297e-08,
"loss": 0.1075,
"num_input_tokens_seen": 5925664,
"step": 1350,
"train_runtime": 4235.1869,
"train_tokens_per_second": 1399.151
},
{
"epoch": 2.9257265877287404,
"grad_norm": 3.261751413345337,
"learning_rate": 1.6423225141223854e-08,
"loss": 0.1042,
"num_input_tokens_seen": 5969408,
"step": 1360,
"train_runtime": 4266.2069,
"train_tokens_per_second": 1399.231
},
{
"epoch": 2.9472551130247577,
"grad_norm": 4.744147300720215,
"learning_rate": 8.568680535939177e-09,
"loss": 0.0964,
"num_input_tokens_seen": 6012576,
"step": 1370,
"train_runtime": 4297.0229,
"train_tokens_per_second": 1399.242
},
{
"epoch": 2.968783638320775,
"grad_norm": 2.3966517448425293,
"learning_rate": 3.2455201875586372e-09,
"loss": 0.0922,
"num_input_tokens_seen": 6056000,
"step": 1380,
"train_runtime": 4328.462,
"train_tokens_per_second": 1399.111
},
{
"epoch": 2.9903121636167924,
"grad_norm": 1.2950575351715088,
"learning_rate": 4.5644371537756363e-10,
"loss": 0.115,
"num_input_tokens_seen": 6100192,
"step": 1390,
"train_runtime": 4359.7222,
"train_tokens_per_second": 1399.216
},
{
"epoch": 3.0,
"num_input_tokens_seen": 6120032,
"step": 1395,
"total_flos": 4.115769119160883e+17,
"train_loss": 0.1491297289889346,
"train_runtime": 4379.932,
"train_samples_per_second": 2.545,
"train_steps_per_second": 0.318
}
],
"logging_steps": 10,
"max_steps": 1395,
"num_input_tokens_seen": 6120032,
"num_train_epochs": 3,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.115769119160883e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}