conversation-model / checkpoint-2000 /trainer_state.json
noweshere's picture
Upload folder using huggingface_hub
97dc501 verified
Raw
History Blame Contribute Delete
32.8 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.8421052631578947,
"eval_steps": 2000,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0,
"grad_norm": 1.0191779136657715,
"learning_rate": 8.403361344537815e-07,
"loss": 1.4757,
"step": 1
},
{
"epoch": 0.0,
"grad_norm": 0.947059690952301,
"learning_rate": 8.403361344537817e-06,
"loss": 1.5145,
"step": 10
},
{
"epoch": 0.01,
"grad_norm": 0.9549775719642639,
"learning_rate": 1.6806722689075634e-05,
"loss": 1.5546,
"step": 20
},
{
"epoch": 0.01,
"grad_norm": 1.1984186172485352,
"learning_rate": 2.5210084033613446e-05,
"loss": 1.6809,
"step": 30
},
{
"epoch": 0.02,
"grad_norm": 0.9854737520217896,
"learning_rate": 3.361344537815127e-05,
"loss": 1.8074,
"step": 40
},
{
"epoch": 0.02,
"grad_norm": 1.3563014268875122,
"learning_rate": 4.201680672268908e-05,
"loss": 1.699,
"step": 50
},
{
"epoch": 0.03,
"grad_norm": 0.6414602398872375,
"learning_rate": 5.042016806722689e-05,
"loss": 1.3419,
"step": 60
},
{
"epoch": 0.03,
"grad_norm": 0.580333948135376,
"learning_rate": 5.882352941176471e-05,
"loss": 1.2524,
"step": 70
},
{
"epoch": 0.03,
"grad_norm": 0.6972444653511047,
"learning_rate": 6.722689075630254e-05,
"loss": 1.4261,
"step": 80
},
{
"epoch": 0.04,
"grad_norm": 0.8142390847206116,
"learning_rate": 7.563025210084033e-05,
"loss": 1.5472,
"step": 90
},
{
"epoch": 0.04,
"grad_norm": 1.9213963747024536,
"learning_rate": 8.403361344537815e-05,
"loss": 1.5581,
"step": 100
},
{
"epoch": 0.05,
"grad_norm": 0.7875838279724121,
"learning_rate": 9.243697478991598e-05,
"loss": 1.2596,
"step": 110
},
{
"epoch": 0.05,
"grad_norm": 0.6198441982269287,
"learning_rate": 0.00010084033613445378,
"loss": 1.2901,
"step": 120
},
{
"epoch": 0.05,
"grad_norm": 0.6708433032035828,
"learning_rate": 0.00010924369747899159,
"loss": 1.3087,
"step": 130
},
{
"epoch": 0.06,
"grad_norm": 0.8415197730064392,
"learning_rate": 0.00011764705882352942,
"loss": 1.4806,
"step": 140
},
{
"epoch": 0.06,
"grad_norm": 1.7113947868347168,
"learning_rate": 0.00012605042016806722,
"loss": 1.5082,
"step": 150
},
{
"epoch": 0.07,
"grad_norm": 0.7543832659721375,
"learning_rate": 0.00013445378151260507,
"loss": 1.1818,
"step": 160
},
{
"epoch": 0.07,
"grad_norm": 0.577403724193573,
"learning_rate": 0.00014285714285714287,
"loss": 1.2308,
"step": 170
},
{
"epoch": 0.08,
"grad_norm": 0.6748159527778625,
"learning_rate": 0.00015126050420168066,
"loss": 1.3738,
"step": 180
},
{
"epoch": 0.08,
"grad_norm": 0.8842242360115051,
"learning_rate": 0.0001596638655462185,
"loss": 1.4544,
"step": 190
},
{
"epoch": 0.08,
"grad_norm": 1.7435425519943237,
"learning_rate": 0.0001680672268907563,
"loss": 1.4997,
"step": 200
},
{
"epoch": 0.09,
"grad_norm": 0.5861243009567261,
"learning_rate": 0.00017647058823529413,
"loss": 1.1774,
"step": 210
},
{
"epoch": 0.09,
"grad_norm": 0.5415711998939514,
"learning_rate": 0.00018487394957983195,
"loss": 1.0529,
"step": 220
},
{
"epoch": 0.1,
"grad_norm": 0.6118600964546204,
"learning_rate": 0.00019327731092436975,
"loss": 1.3117,
"step": 230
},
{
"epoch": 0.1,
"grad_norm": 0.8368746042251587,
"learning_rate": 0.00019999990304024961,
"loss": 1.4745,
"step": 240
},
{
"epoch": 0.11,
"grad_norm": 1.086878776550293,
"learning_rate": 0.00019999650946872738,
"loss": 1.3995,
"step": 250
},
{
"epoch": 0.11,
"grad_norm": 0.6036991477012634,
"learning_rate": 0.00019998826809770645,
"loss": 1.2325,
"step": 260
},
{
"epoch": 0.11,
"grad_norm": 0.5606744289398193,
"learning_rate": 0.0001999751793267259,
"loss": 1.2043,
"step": 270
},
{
"epoch": 0.12,
"grad_norm": 0.6112542748451233,
"learning_rate": 0.00019995724379032526,
"loss": 1.2512,
"step": 280
},
{
"epoch": 0.12,
"grad_norm": 0.7892420887947083,
"learning_rate": 0.00019993446235801367,
"loss": 1.3604,
"step": 290
},
{
"epoch": 0.13,
"grad_norm": 1.2104417085647583,
"learning_rate": 0.00019990683613422787,
"loss": 1.4282,
"step": 300
},
{
"epoch": 0.13,
"grad_norm": 0.5284091234207153,
"learning_rate": 0.0001998743664582786,
"loss": 1.1223,
"step": 310
},
{
"epoch": 0.13,
"grad_norm": 0.5215238928794861,
"learning_rate": 0.0001998370549042855,
"loss": 1.1399,
"step": 320
},
{
"epoch": 0.14,
"grad_norm": 0.6061808466911316,
"learning_rate": 0.0001997949032811011,
"loss": 1.2432,
"step": 330
},
{
"epoch": 0.14,
"grad_norm": 0.7220178246498108,
"learning_rate": 0.0001997479136322229,
"loss": 1.4737,
"step": 340
},
{
"epoch": 0.15,
"grad_norm": 1.035914421081543,
"learning_rate": 0.00019969608823569433,
"loss": 1.5087,
"step": 350
},
{
"epoch": 0.15,
"grad_norm": 0.5120232701301575,
"learning_rate": 0.00019963942960399446,
"loss": 1.1583,
"step": 360
},
{
"epoch": 0.16,
"grad_norm": 0.5209968686103821,
"learning_rate": 0.00019957794048391602,
"loss": 1.1494,
"step": 370
},
{
"epoch": 0.16,
"grad_norm": 0.5688252449035645,
"learning_rate": 0.0001995116238564323,
"loss": 1.2648,
"step": 380
},
{
"epoch": 0.16,
"grad_norm": 0.7350272536277771,
"learning_rate": 0.00019944048293655265,
"loss": 1.3836,
"step": 390
},
{
"epoch": 0.17,
"grad_norm": 1.117912769317627,
"learning_rate": 0.00019936452117316663,
"loss": 1.3725,
"step": 400
},
{
"epoch": 0.17,
"grad_norm": 0.5087815523147583,
"learning_rate": 0.00019928374224887678,
"loss": 1.0783,
"step": 410
},
{
"epoch": 0.18,
"grad_norm": 0.4944276213645935,
"learning_rate": 0.00019919815007982003,
"loss": 1.0936,
"step": 420
},
{
"epoch": 0.18,
"grad_norm": 0.5578716397285461,
"learning_rate": 0.000199107748815478,
"loss": 1.1705,
"step": 430
},
{
"epoch": 0.19,
"grad_norm": 0.670518696308136,
"learning_rate": 0.00019901254283847573,
"loss": 1.3099,
"step": 440
},
{
"epoch": 0.19,
"grad_norm": 0.9550499320030212,
"learning_rate": 0.00019891253676436915,
"loss": 1.3971,
"step": 450
},
{
"epoch": 0.19,
"grad_norm": 0.48883694410324097,
"learning_rate": 0.00019880773544142148,
"loss": 1.1091,
"step": 460
},
{
"epoch": 0.2,
"grad_norm": 0.5331695675849915,
"learning_rate": 0.00019869814395036807,
"loss": 1.1169,
"step": 470
},
{
"epoch": 0.2,
"grad_norm": 0.6103072166442871,
"learning_rate": 0.0001985837676041701,
"loss": 1.2462,
"step": 480
},
{
"epoch": 0.21,
"grad_norm": 0.7295002937316895,
"learning_rate": 0.00019846461194775712,
"loss": 1.3711,
"step": 490
},
{
"epoch": 0.21,
"grad_norm": 1.003199815750122,
"learning_rate": 0.000198340682757758,
"loss": 1.3987,
"step": 500
},
{
"epoch": 0.21,
"grad_norm": 0.49524402618408203,
"learning_rate": 0.00019821198604222113,
"loss": 1.1002,
"step": 510
},
{
"epoch": 0.22,
"grad_norm": 0.4883529543876648,
"learning_rate": 0.00019807852804032305,
"loss": 1.0895,
"step": 520
},
{
"epoch": 0.22,
"grad_norm": 0.5645517110824585,
"learning_rate": 0.00019794031522206594,
"loss": 1.1673,
"step": 530
},
{
"epoch": 0.23,
"grad_norm": 0.7130540609359741,
"learning_rate": 0.00019779735428796395,
"loss": 1.2775,
"step": 540
},
{
"epoch": 0.23,
"grad_norm": 1.035349726676941,
"learning_rate": 0.00019764965216871846,
"loss": 1.3272,
"step": 550
},
{
"epoch": 0.24,
"grad_norm": 0.5434763431549072,
"learning_rate": 0.00019749721602488207,
"loss": 1.1483,
"step": 560
},
{
"epoch": 0.24,
"grad_norm": 0.472807914018631,
"learning_rate": 0.0001973400532465113,
"loss": 1.0666,
"step": 570
},
{
"epoch": 0.24,
"grad_norm": 0.575896143913269,
"learning_rate": 0.00019717817145280844,
"loss": 1.122,
"step": 580
},
{
"epoch": 0.25,
"grad_norm": 0.6578025817871094,
"learning_rate": 0.00019701157849175228,
"loss": 1.2858,
"step": 590
},
{
"epoch": 0.25,
"grad_norm": 1.2908504009246826,
"learning_rate": 0.0001968402824397174,
"loss": 1.3983,
"step": 600
},
{
"epoch": 0.26,
"grad_norm": 0.5685085654258728,
"learning_rate": 0.0001966642916010829,
"loss": 1.0992,
"step": 610
},
{
"epoch": 0.26,
"grad_norm": 0.4999242126941681,
"learning_rate": 0.0001964836145078295,
"loss": 1.1434,
"step": 620
},
{
"epoch": 0.27,
"grad_norm": 0.5502079129219055,
"learning_rate": 0.00019629825991912623,
"loss": 1.1573,
"step": 630
},
{
"epoch": 0.27,
"grad_norm": 0.6397935748100281,
"learning_rate": 0.0001961082368209055,
"loss": 1.3418,
"step": 640
},
{
"epoch": 0.27,
"grad_norm": 0.9650578498840332,
"learning_rate": 0.00019591355442542775,
"loss": 1.3298,
"step": 650
},
{
"epoch": 0.28,
"grad_norm": 0.49895137548446655,
"learning_rate": 0.00019571422217083454,
"loss": 1.0907,
"step": 660
},
{
"epoch": 0.28,
"grad_norm": 0.49023300409317017,
"learning_rate": 0.00019551024972069126,
"loss": 1.1305,
"step": 670
},
{
"epoch": 0.29,
"grad_norm": 0.5746453404426575,
"learning_rate": 0.00019530164696351848,
"loss": 1.1865,
"step": 680
},
{
"epoch": 0.29,
"grad_norm": 0.6834538578987122,
"learning_rate": 0.00019508842401231257,
"loss": 1.3113,
"step": 690
},
{
"epoch": 0.29,
"grad_norm": 1.0113998651504517,
"learning_rate": 0.0001948705912040556,
"loss": 1.3686,
"step": 700
},
{
"epoch": 0.3,
"grad_norm": 0.5399815440177917,
"learning_rate": 0.0001946481590992139,
"loss": 1.1602,
"step": 710
},
{
"epoch": 0.3,
"grad_norm": 0.5135788321495056,
"learning_rate": 0.00019442113848122636,
"loss": 1.0881,
"step": 720
},
{
"epoch": 0.31,
"grad_norm": 0.5519896149635315,
"learning_rate": 0.00019418954035598152,
"loss": 1.1885,
"step": 730
},
{
"epoch": 0.31,
"grad_norm": 0.7329438328742981,
"learning_rate": 0.000193953375951284,
"loss": 1.2668,
"step": 740
},
{
"epoch": 0.32,
"grad_norm": 1.0599132776260376,
"learning_rate": 0.00019371265671631037,
"loss": 1.3524,
"step": 750
},
{
"epoch": 0.32,
"grad_norm": 0.5613999962806702,
"learning_rate": 0.00019346739432105374,
"loss": 1.0983,
"step": 760
},
{
"epoch": 0.32,
"grad_norm": 0.5169478058815002,
"learning_rate": 0.00019321760065575834,
"loss": 1.1699,
"step": 770
},
{
"epoch": 0.33,
"grad_norm": 0.5800842642784119,
"learning_rate": 0.00019296328783034294,
"loss": 1.2105,
"step": 780
},
{
"epoch": 0.33,
"grad_norm": 0.7089204788208008,
"learning_rate": 0.00019270446817381377,
"loss": 1.3458,
"step": 790
},
{
"epoch": 0.34,
"grad_norm": 0.8912138342857361,
"learning_rate": 0.00019244115423366678,
"loss": 1.3386,
"step": 800
},
{
"epoch": 0.34,
"grad_norm": 0.5033462047576904,
"learning_rate": 0.00019217335877527947,
"loss": 1.0824,
"step": 810
},
{
"epoch": 0.35,
"grad_norm": 0.5139713287353516,
"learning_rate": 0.0001919010947812918,
"loss": 1.0122,
"step": 820
},
{
"epoch": 0.35,
"grad_norm": 0.5905170440673828,
"learning_rate": 0.00019162437545097719,
"loss": 1.2924,
"step": 830
},
{
"epoch": 0.35,
"grad_norm": 0.715568482875824,
"learning_rate": 0.00019134321419960203,
"loss": 1.2982,
"step": 840
},
{
"epoch": 0.36,
"grad_norm": 1.046240210533142,
"learning_rate": 0.00019105762465777598,
"loss": 1.4013,
"step": 850
},
{
"epoch": 0.36,
"grad_norm": 0.49822917580604553,
"learning_rate": 0.00019076762067079059,
"loss": 1.0633,
"step": 860
},
{
"epoch": 0.37,
"grad_norm": 0.47567543387413025,
"learning_rate": 0.0001904732162979485,
"loss": 1.0497,
"step": 870
},
{
"epoch": 0.37,
"grad_norm": 0.5331007242202759,
"learning_rate": 0.0001901744258118816,
"loss": 1.166,
"step": 880
},
{
"epoch": 0.37,
"grad_norm": 0.7400739789009094,
"learning_rate": 0.00018987126369785916,
"loss": 1.3527,
"step": 890
},
{
"epoch": 0.38,
"grad_norm": 1.1264495849609375,
"learning_rate": 0.00018956374465308563,
"loss": 1.3475,
"step": 900
},
{
"epoch": 0.38,
"grad_norm": 0.5124080777168274,
"learning_rate": 0.00018925188358598813,
"loss": 1.05,
"step": 910
},
{
"epoch": 0.39,
"grad_norm": 0.522303581237793,
"learning_rate": 0.00018893569561549364,
"loss": 1.156,
"step": 920
},
{
"epoch": 0.39,
"grad_norm": 0.5782234072685242,
"learning_rate": 0.00018861519607029606,
"loss": 1.158,
"step": 930
},
{
"epoch": 0.4,
"grad_norm": 0.7259439826011658,
"learning_rate": 0.00018829040048811305,
"loss": 1.306,
"step": 940
},
{
"epoch": 0.4,
"grad_norm": 0.9230518937110901,
"learning_rate": 0.0001879613246149329,
"loss": 1.4171,
"step": 950
},
{
"epoch": 0.4,
"grad_norm": 0.5070952773094177,
"learning_rate": 0.00018762798440425096,
"loss": 1.0647,
"step": 960
},
{
"epoch": 0.41,
"grad_norm": 0.540289044380188,
"learning_rate": 0.00018729039601629634,
"loss": 1.0823,
"step": 970
},
{
"epoch": 0.41,
"grad_norm": 0.6044334173202515,
"learning_rate": 0.00018694857581724855,
"loss": 1.2258,
"step": 980
},
{
"epoch": 0.42,
"grad_norm": 0.6775342226028442,
"learning_rate": 0.00018660254037844388,
"loss": 1.3045,
"step": 990
},
{
"epoch": 0.42,
"grad_norm": 1.0051116943359375,
"learning_rate": 0.00018625230647557217,
"loss": 1.3275,
"step": 1000
},
{
"epoch": 0.43,
"grad_norm": 0.522710382938385,
"learning_rate": 0.00018589789108786344,
"loss": 1.1284,
"step": 1010
},
{
"epoch": 0.43,
"grad_norm": 0.527962327003479,
"learning_rate": 0.00018553931139726485,
"loss": 1.0688,
"step": 1020
},
{
"epoch": 0.43,
"grad_norm": 0.5457212924957275,
"learning_rate": 0.0001851765847876076,
"loss": 1.1434,
"step": 1030
},
{
"epoch": 0.44,
"grad_norm": 0.6518785357475281,
"learning_rate": 0.00018480972884376434,
"loss": 1.2961,
"step": 1040
},
{
"epoch": 0.44,
"grad_norm": 1.0324338674545288,
"learning_rate": 0.00018443876135079638,
"loss": 1.407,
"step": 1050
},
{
"epoch": 0.45,
"grad_norm": 0.6092559099197388,
"learning_rate": 0.0001840637002930918,
"loss": 1.0535,
"step": 1060
},
{
"epoch": 0.45,
"grad_norm": 0.5149545073509216,
"learning_rate": 0.00018368456385349334,
"loss": 1.0546,
"step": 1070
},
{
"epoch": 0.45,
"grad_norm": 0.6056516766548157,
"learning_rate": 0.0001833013704124169,
"loss": 1.1735,
"step": 1080
},
{
"epoch": 0.46,
"grad_norm": 0.7382489442825317,
"learning_rate": 0.00018291413854696077,
"loss": 1.3044,
"step": 1090
},
{
"epoch": 0.46,
"grad_norm": 0.9548698663711548,
"learning_rate": 0.0001825228870300046,
"loss": 1.3571,
"step": 1100
},
{
"epoch": 0.47,
"grad_norm": 0.5410871505737305,
"learning_rate": 0.0001821276348292995,
"loss": 1.097,
"step": 1110
},
{
"epoch": 0.47,
"grad_norm": 0.5245351195335388,
"learning_rate": 0.00018172840110654862,
"loss": 1.0923,
"step": 1120
},
{
"epoch": 0.48,
"grad_norm": 0.6045931577682495,
"learning_rate": 0.00018132520521647785,
"loss": 1.2115,
"step": 1130
},
{
"epoch": 0.48,
"grad_norm": 0.6429124474525452,
"learning_rate": 0.00018091806670589788,
"loss": 1.2736,
"step": 1140
},
{
"epoch": 0.48,
"grad_norm": 0.9760797619819641,
"learning_rate": 0.0001805070053127563,
"loss": 1.2964,
"step": 1150
},
{
"epoch": 0.49,
"grad_norm": 0.48860272765159607,
"learning_rate": 0.0001800920409651809,
"loss": 1.0942,
"step": 1160
},
{
"epoch": 0.49,
"grad_norm": 0.5090013146400452,
"learning_rate": 0.00017967319378051343,
"loss": 1.0925,
"step": 1170
},
{
"epoch": 0.5,
"grad_norm": 0.5822442770004272,
"learning_rate": 0.00017925048406433437,
"loss": 1.1583,
"step": 1180
},
{
"epoch": 0.5,
"grad_norm": 0.7363468408584595,
"learning_rate": 0.00017882393230947855,
"loss": 1.3283,
"step": 1190
},
{
"epoch": 0.51,
"grad_norm": 0.840218186378479,
"learning_rate": 0.00017839355919504164,
"loss": 1.3098,
"step": 1200
},
{
"epoch": 0.51,
"grad_norm": 0.5360991954803467,
"learning_rate": 0.00017795938558537753,
"loss": 1.1028,
"step": 1210
},
{
"epoch": 0.51,
"grad_norm": 0.5553500056266785,
"learning_rate": 0.00017752143252908705,
"loss": 1.0737,
"step": 1220
},
{
"epoch": 0.52,
"grad_norm": 0.5366541743278503,
"learning_rate": 0.00017707972125799735,
"loss": 1.1918,
"step": 1230
},
{
"epoch": 0.52,
"grad_norm": 0.7474969029426575,
"learning_rate": 0.0001766342731861327,
"loss": 1.2756,
"step": 1240
},
{
"epoch": 0.53,
"grad_norm": 1.0241633653640747,
"learning_rate": 0.00017618510990867624,
"loss": 1.298,
"step": 1250
},
{
"epoch": 0.53,
"grad_norm": 0.5135468244552612,
"learning_rate": 0.00017573225320092323,
"loss": 0.9818,
"step": 1260
},
{
"epoch": 0.53,
"grad_norm": 0.5308533906936646,
"learning_rate": 0.00017527572501722512,
"loss": 1.0729,
"step": 1270
},
{
"epoch": 0.54,
"grad_norm": 0.6265894174575806,
"learning_rate": 0.00017481554748992553,
"loss": 1.1791,
"step": 1280
},
{
"epoch": 0.54,
"grad_norm": 0.7500415444374084,
"learning_rate": 0.00017435174292828695,
"loss": 1.2722,
"step": 1290
},
{
"epoch": 0.55,
"grad_norm": 1.0609970092773438,
"learning_rate": 0.00017388433381740952,
"loss": 1.3034,
"step": 1300
},
{
"epoch": 0.55,
"grad_norm": 0.5286604166030884,
"learning_rate": 0.00017341334281714064,
"loss": 0.9932,
"step": 1310
},
{
"epoch": 0.56,
"grad_norm": 0.5054761171340942,
"learning_rate": 0.00017293879276097677,
"loss": 1.0386,
"step": 1320
},
{
"epoch": 0.56,
"grad_norm": 0.6337370872497559,
"learning_rate": 0.00017246070665495608,
"loss": 1.1341,
"step": 1330
},
{
"epoch": 0.56,
"grad_norm": 0.7288526892662048,
"learning_rate": 0.00017197910767654352,
"loss": 1.2551,
"step": 1340
},
{
"epoch": 0.57,
"grad_norm": 1.0159952640533447,
"learning_rate": 0.0001714940191735069,
"loss": 1.3048,
"step": 1350
},
{
"epoch": 0.57,
"grad_norm": 0.5907754898071289,
"learning_rate": 0.00017100546466278504,
"loss": 1.0322,
"step": 1360
},
{
"epoch": 0.58,
"grad_norm": 0.5079711675643921,
"learning_rate": 0.00017051346782934786,
"loss": 1.0071,
"step": 1370
},
{
"epoch": 0.58,
"grad_norm": 0.6100701689720154,
"learning_rate": 0.00017001805252504795,
"loss": 1.1588,
"step": 1380
},
{
"epoch": 0.59,
"grad_norm": 0.7802088260650635,
"learning_rate": 0.00016951924276746425,
"loss": 1.2911,
"step": 1390
},
{
"epoch": 0.59,
"grad_norm": 1.0676313638687134,
"learning_rate": 0.00016901706273873777,
"loss": 1.2942,
"step": 1400
},
{
"epoch": 0.59,
"grad_norm": 0.527285099029541,
"learning_rate": 0.00016851153678439922,
"loss": 1.0107,
"step": 1410
},
{
"epoch": 0.6,
"grad_norm": 0.5518642663955688,
"learning_rate": 0.00016800268941218876,
"loss": 1.0683,
"step": 1420
},
{
"epoch": 0.6,
"grad_norm": 0.6224582195281982,
"learning_rate": 0.0001674905452908678,
"loss": 1.1685,
"step": 1430
},
{
"epoch": 0.61,
"grad_norm": 0.6205934882164001,
"learning_rate": 0.0001669751292490231,
"loss": 1.302,
"step": 1440
},
{
"epoch": 0.61,
"grad_norm": 1.0423789024353027,
"learning_rate": 0.0001664564662738632,
"loss": 1.2654,
"step": 1450
},
{
"epoch": 0.61,
"grad_norm": 0.5314890742301941,
"learning_rate": 0.00016593458151000688,
"loss": 1.083,
"step": 1460
},
{
"epoch": 0.62,
"grad_norm": 0.5361500978469849,
"learning_rate": 0.00016540950025826422,
"loss": 1.0952,
"step": 1470
},
{
"epoch": 0.62,
"grad_norm": 0.5990237593650818,
"learning_rate": 0.00016488124797441004,
"loss": 1.1923,
"step": 1480
},
{
"epoch": 0.63,
"grad_norm": 0.7383199334144592,
"learning_rate": 0.00016434985026794987,
"loss": 1.288,
"step": 1490
},
{
"epoch": 0.63,
"grad_norm": 1.0500961542129517,
"learning_rate": 0.0001638153329008782,
"loss": 1.318,
"step": 1500
},
{
"epoch": 0.64,
"grad_norm": 0.5643898248672485,
"learning_rate": 0.00016327772178642986,
"loss": 1.0641,
"step": 1510
},
{
"epoch": 0.64,
"grad_norm": 0.509543776512146,
"learning_rate": 0.0001627370429878235,
"loss": 1.0216,
"step": 1520
},
{
"epoch": 0.64,
"grad_norm": 0.6048777103424072,
"learning_rate": 0.0001621933227169981,
"loss": 1.136,
"step": 1530
},
{
"epoch": 0.65,
"grad_norm": 0.7480033040046692,
"learning_rate": 0.0001616465873333423,
"loss": 1.2798,
"step": 1540
},
{
"epoch": 0.65,
"grad_norm": 1.0061513185501099,
"learning_rate": 0.00016109686334241655,
"loss": 1.2482,
"step": 1550
},
{
"epoch": 0.66,
"grad_norm": 0.5828456282615662,
"learning_rate": 0.0001605441773946679,
"loss": 1.1134,
"step": 1560
},
{
"epoch": 0.66,
"grad_norm": 0.5483405590057373,
"learning_rate": 0.00015998855628413823,
"loss": 1.0308,
"step": 1570
},
{
"epoch": 0.67,
"grad_norm": 0.6139534711837769,
"learning_rate": 0.00015943002694716519,
"loss": 1.1093,
"step": 1580
},
{
"epoch": 0.67,
"grad_norm": 0.6477651000022888,
"learning_rate": 0.0001588686164610763,
"loss": 1.2047,
"step": 1590
},
{
"epoch": 0.67,
"grad_norm": 0.9526233077049255,
"learning_rate": 0.00015830435204287628,
"loss": 1.3359,
"step": 1600
},
{
"epoch": 0.68,
"grad_norm": 0.5442110896110535,
"learning_rate": 0.00015773726104792768,
"loss": 1.0236,
"step": 1610
},
{
"epoch": 0.68,
"grad_norm": 0.5667725801467896,
"learning_rate": 0.0001571673709686245,
"loss": 0.9956,
"step": 1620
},
{
"epoch": 0.69,
"grad_norm": 0.567449688911438,
"learning_rate": 0.00015659470943305955,
"loss": 1.1698,
"step": 1630
},
{
"epoch": 0.69,
"grad_norm": 0.7154501080513,
"learning_rate": 0.00015601930420368486,
"loss": 1.2682,
"step": 1640
},
{
"epoch": 0.69,
"grad_norm": 0.9630643725395203,
"learning_rate": 0.00015544118317596605,
"loss": 1.3124,
"step": 1650
},
{
"epoch": 0.7,
"grad_norm": 0.5698636770248413,
"learning_rate": 0.0001548603743770296,
"loss": 1.0047,
"step": 1660
},
{
"epoch": 0.7,
"grad_norm": 0.538144588470459,
"learning_rate": 0.0001542769059643045,
"loss": 0.9859,
"step": 1670
},
{
"epoch": 0.71,
"grad_norm": 0.6153010725975037,
"learning_rate": 0.00015369080622415683,
"loss": 1.1059,
"step": 1680
},
{
"epoch": 0.71,
"grad_norm": 0.7482182383537292,
"learning_rate": 0.00015310210357051863,
"loss": 1.2589,
"step": 1690
},
{
"epoch": 0.72,
"grad_norm": 1.014577031135559,
"learning_rate": 0.00015251082654351044,
"loss": 1.2322,
"step": 1700
},
{
"epoch": 0.72,
"grad_norm": 0.5590934157371521,
"learning_rate": 0.00015191700380805752,
"loss": 1.0283,
"step": 1710
},
{
"epoch": 0.72,
"grad_norm": 0.5307114124298096,
"learning_rate": 0.00015132066415250042,
"loss": 1.0196,
"step": 1720
},
{
"epoch": 0.73,
"grad_norm": 0.6487598419189453,
"learning_rate": 0.000150721836487199,
"loss": 1.0595,
"step": 1730
},
{
"epoch": 0.73,
"grad_norm": 0.8052285313606262,
"learning_rate": 0.00015012054984313116,
"loss": 1.2083,
"step": 1740
},
{
"epoch": 0.74,
"grad_norm": 1.1172990798950195,
"learning_rate": 0.00014951683337048537,
"loss": 1.2899,
"step": 1750
},
{
"epoch": 0.74,
"grad_norm": 0.5224259495735168,
"learning_rate": 0.00014891071633724737,
"loss": 1.0475,
"step": 1760
},
{
"epoch": 0.75,
"grad_norm": 0.5798863768577576,
"learning_rate": 0.00014830222812778126,
"loss": 0.9953,
"step": 1770
},
{
"epoch": 0.75,
"grad_norm": 0.6029157638549805,
"learning_rate": 0.00014769139824140516,
"loss": 1.1619,
"step": 1780
},
{
"epoch": 0.75,
"grad_norm": 0.7881869673728943,
"learning_rate": 0.00014707825629096084,
"loss": 1.2333,
"step": 1790
},
{
"epoch": 0.76,
"grad_norm": 0.9496088624000549,
"learning_rate": 0.00014646283200137828,
"loss": 1.2424,
"step": 1800
},
{
"epoch": 0.76,
"grad_norm": 0.5425153374671936,
"learning_rate": 0.00014584515520823453,
"loss": 0.9886,
"step": 1810
},
{
"epoch": 0.77,
"grad_norm": 0.5590393543243408,
"learning_rate": 0.0001452252558563073,
"loss": 1.0041,
"step": 1820
},
{
"epoch": 0.77,
"grad_norm": 0.5956026911735535,
"learning_rate": 0.00014460316399812325,
"loss": 1.1507,
"step": 1830
},
{
"epoch": 0.77,
"grad_norm": 0.7304853796958923,
"learning_rate": 0.00014397890979250108,
"loss": 1.2183,
"step": 1840
},
{
"epoch": 0.78,
"grad_norm": 1.0130630731582642,
"learning_rate": 0.0001433525235030894,
"loss": 1.2944,
"step": 1850
},
{
"epoch": 0.78,
"grad_norm": 0.5265572667121887,
"learning_rate": 0.00014272403549689955,
"loss": 1.0166,
"step": 1860
},
{
"epoch": 0.79,
"grad_norm": 0.5423105955123901,
"learning_rate": 0.0001420934762428335,
"loss": 0.9559,
"step": 1870
},
{
"epoch": 0.79,
"grad_norm": 0.6281871199607849,
"learning_rate": 0.00014146087631020665,
"loss": 1.064,
"step": 1880
},
{
"epoch": 0.8,
"grad_norm": 0.7130801677703857,
"learning_rate": 0.00014082626636726582,
"loss": 1.1955,
"step": 1890
},
{
"epoch": 0.8,
"grad_norm": 1.038220763206482,
"learning_rate": 0.00014018967717970254,
"loss": 1.2621,
"step": 1900
},
{
"epoch": 0.8,
"grad_norm": 0.5577895045280457,
"learning_rate": 0.00013955113960916146,
"loss": 0.9577,
"step": 1910
},
{
"epoch": 0.81,
"grad_norm": 0.526157796382904,
"learning_rate": 0.0001389106846117443,
"loss": 1.0109,
"step": 1920
},
{
"epoch": 0.81,
"grad_norm": 0.6196286678314209,
"learning_rate": 0.000138268343236509,
"loss": 1.1256,
"step": 1930
},
{
"epoch": 0.82,
"grad_norm": 0.7702537178993225,
"learning_rate": 0.00013762414662396444,
"loss": 1.2524,
"step": 1940
},
{
"epoch": 0.82,
"grad_norm": 0.8746676445007324,
"learning_rate": 0.00013697812600456093,
"loss": 1.288,
"step": 1950
},
{
"epoch": 0.83,
"grad_norm": 0.5723572969436646,
"learning_rate": 0.000136330312697176,
"loss": 0.995,
"step": 1960
},
{
"epoch": 0.83,
"grad_norm": 0.5687806606292725,
"learning_rate": 0.00013568073810759615,
"loss": 1.042,
"step": 1970
},
{
"epoch": 0.83,
"grad_norm": 0.5694392323493958,
"learning_rate": 0.00013502943372699426,
"loss": 1.0513,
"step": 1980
},
{
"epoch": 0.84,
"grad_norm": 0.770982563495636,
"learning_rate": 0.00013437643113040301,
"loss": 1.2595,
"step": 1990
},
{
"epoch": 0.84,
"grad_norm": 1.0096752643585205,
"learning_rate": 0.000133721761975184,
"loss": 1.2178,
"step": 2000
},
{
"epoch": 0.84,
"eval_loss": 1.0813658237457275,
"eval_runtime": 229.3235,
"eval_samples_per_second": 4.361,
"eval_steps_per_second": 0.545,
"step": 2000
}
],
"logging_steps": 10,
"max_steps": 4750,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 2000,
"total_flos": 2.0110035829948416e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}