Safetensors
ParagonLight's picture
update loras
60bd5ed
Raw
History Blame Contribute Delete
34 kB
{
"best_metric": 3.648681376944296e-05,
"best_model_checkpoint": "ckpt/llama3_8b_fuze27_no_sys/contextual_parametric_knowledge_conflicts_no_sys/checkpoint-1000",
"epoch": 2.4161073825503356,
"eval_steps": 200,
"global_step": 1800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.013422818791946308,
"grad_norm": 14.714207649230957,
"learning_rate": 5e-06,
"loss": 1.9703,
"step": 10
},
{
"epoch": 0.026845637583892617,
"grad_norm": 18.66051483154297,
"learning_rate": 1e-05,
"loss": 1.7696,
"step": 20
},
{
"epoch": 0.040268456375838924,
"grad_norm": 5.510164260864258,
"learning_rate": 9.999955304738815e-06,
"loss": 0.8218,
"step": 30
},
{
"epoch": 0.053691275167785234,
"grad_norm": 2.901658773422241,
"learning_rate": 9.999821219754324e-06,
"loss": 0.2814,
"step": 40
},
{
"epoch": 0.06711409395973154,
"grad_norm": 3.764986991882324,
"learning_rate": 9.999597747443714e-06,
"loss": 0.1097,
"step": 50
},
{
"epoch": 0.08053691275167785,
"grad_norm": 0.4956361949443817,
"learning_rate": 9.999284891802246e-06,
"loss": 0.0313,
"step": 60
},
{
"epoch": 0.09395973154362416,
"grad_norm": 0.07353239506483078,
"learning_rate": 9.998882658423185e-06,
"loss": 0.0179,
"step": 70
},
{
"epoch": 0.10738255033557047,
"grad_norm": 0.12591932713985443,
"learning_rate": 9.998391054497703e-06,
"loss": 0.0013,
"step": 80
},
{
"epoch": 0.12080536912751678,
"grad_norm": 0.04427539184689522,
"learning_rate": 9.997810088814745e-06,
"loss": 0.0019,
"step": 90
},
{
"epoch": 0.1342281879194631,
"grad_norm": 0.01067450549453497,
"learning_rate": 9.997139771760876e-06,
"loss": 0.0005,
"step": 100
},
{
"epoch": 0.1476510067114094,
"grad_norm": 0.0212077796459198,
"learning_rate": 9.996380115320095e-06,
"loss": 0.0005,
"step": 110
},
{
"epoch": 0.1610738255033557,
"grad_norm": 0.01207214966416359,
"learning_rate": 9.995531133073619e-06,
"loss": 0.0001,
"step": 120
},
{
"epoch": 0.174496644295302,
"grad_norm": 0.1107475608587265,
"learning_rate": 9.994592840199642e-06,
"loss": 0.0002,
"step": 130
},
{
"epoch": 0.18791946308724833,
"grad_norm": 0.00909244641661644,
"learning_rate": 9.99356525347306e-06,
"loss": 0.01,
"step": 140
},
{
"epoch": 0.20134228187919462,
"grad_norm": 0.0034464739728718996,
"learning_rate": 9.99244839126518e-06,
"loss": 0.0003,
"step": 150
},
{
"epoch": 0.21476510067114093,
"grad_norm": 0.01978999376296997,
"learning_rate": 9.991242273543376e-06,
"loss": 0.0068,
"step": 160
},
{
"epoch": 0.22818791946308725,
"grad_norm": 0.005352655425667763,
"learning_rate": 9.989946921870749e-06,
"loss": 0.0034,
"step": 170
},
{
"epoch": 0.24161073825503357,
"grad_norm": 0.002363240346312523,
"learning_rate": 9.988562359405733e-06,
"loss": 0.0004,
"step": 180
},
{
"epoch": 0.2550335570469799,
"grad_norm": 0.04204447194933891,
"learning_rate": 9.987088610901678e-06,
"loss": 0.0051,
"step": 190
},
{
"epoch": 0.2684563758389262,
"grad_norm": 0.0113844508305192,
"learning_rate": 9.985525702706415e-06,
"loss": 0.0001,
"step": 200
},
{
"epoch": 0.2684563758389262,
"eval_loss": 0.0006864700117148459,
"eval_runtime": 36.5199,
"eval_samples_per_second": 57.612,
"eval_steps_per_second": 3.614,
"step": 200
},
{
"epoch": 0.28187919463087246,
"grad_norm": 0.014903889037668705,
"learning_rate": 9.98387366276178e-06,
"loss": 0.0086,
"step": 210
},
{
"epoch": 0.2953020134228188,
"grad_norm": 0.04282082989811897,
"learning_rate": 9.982132520603115e-06,
"loss": 0.0001,
"step": 220
},
{
"epoch": 0.3087248322147651,
"grad_norm": 0.0007326242630369961,
"learning_rate": 9.980302307358743e-06,
"loss": 0.0066,
"step": 230
},
{
"epoch": 0.3221476510067114,
"grad_norm": 0.0007314328686334193,
"learning_rate": 9.978383055749407e-06,
"loss": 0.0001,
"step": 240
},
{
"epoch": 0.33557046979865773,
"grad_norm": 0.07381263375282288,
"learning_rate": 9.976374800087687e-06,
"loss": 0.0001,
"step": 250
},
{
"epoch": 0.348993288590604,
"grad_norm": 0.0032492601312696934,
"learning_rate": 9.974277576277386e-06,
"loss": 0.0001,
"step": 260
},
{
"epoch": 0.3624161073825503,
"grad_norm": 0.0010357198771089315,
"learning_rate": 9.972091421812893e-06,
"loss": 0.0001,
"step": 270
},
{
"epoch": 0.37583892617449666,
"grad_norm": 0.002767580561339855,
"learning_rate": 9.969816375778504e-06,
"loss": 0.0002,
"step": 280
},
{
"epoch": 0.38926174496644295,
"grad_norm": 0.05809437856078148,
"learning_rate": 9.967452478847735e-06,
"loss": 0.0001,
"step": 290
},
{
"epoch": 0.40268456375838924,
"grad_norm": 0.0023956859949976206,
"learning_rate": 9.964999773282574e-06,
"loss": 0.0091,
"step": 300
},
{
"epoch": 0.4161073825503356,
"grad_norm": 0.002156985690817237,
"learning_rate": 9.962458302932753e-06,
"loss": 0.0001,
"step": 310
},
{
"epoch": 0.42953020134228187,
"grad_norm": 0.002653814386576414,
"learning_rate": 9.959828113234945e-06,
"loss": 0.0001,
"step": 320
},
{
"epoch": 0.4429530201342282,
"grad_norm": 0.0016466390807181597,
"learning_rate": 9.95710925121195e-06,
"loss": 0.0001,
"step": 330
},
{
"epoch": 0.4563758389261745,
"grad_norm": 0.0011488753370940685,
"learning_rate": 9.954301765471874e-06,
"loss": 0.0003,
"step": 340
},
{
"epoch": 0.4697986577181208,
"grad_norm": 0.0007752739475108683,
"learning_rate": 9.951405706207236e-06,
"loss": 0.0,
"step": 350
},
{
"epoch": 0.48322147651006714,
"grad_norm": 0.0023285429924726486,
"learning_rate": 9.948421125194089e-06,
"loss": 0.0001,
"step": 360
},
{
"epoch": 0.4966442953020134,
"grad_norm": 0.015918292105197906,
"learning_rate": 9.945348075791084e-06,
"loss": 0.0,
"step": 370
},
{
"epoch": 0.5100671140939598,
"grad_norm": 0.0003664461546577513,
"learning_rate": 9.942186612938515e-06,
"loss": 0.0001,
"step": 380
},
{
"epoch": 0.5234899328859061,
"grad_norm": 0.0018171434057876468,
"learning_rate": 9.938936793157351e-06,
"loss": 0.0018,
"step": 390
},
{
"epoch": 0.5369127516778524,
"grad_norm": 0.005321137141436338,
"learning_rate": 9.935598674548208e-06,
"loss": 0.0,
"step": 400
},
{
"epoch": 0.5369127516778524,
"eval_loss": 0.0006335359648801386,
"eval_runtime": 37.8172,
"eval_samples_per_second": 55.636,
"eval_steps_per_second": 3.49,
"step": 400
},
{
"epoch": 0.5503355704697986,
"grad_norm": 0.0010172220645472407,
"learning_rate": 9.932172316790317e-06,
"loss": 0.0021,
"step": 410
},
{
"epoch": 0.5637583892617449,
"grad_norm": 0.0016757710836827755,
"learning_rate": 9.928657781140461e-06,
"loss": 0.0,
"step": 420
},
{
"epoch": 0.5771812080536913,
"grad_norm": 0.0011584250023588538,
"learning_rate": 9.925055130431876e-06,
"loss": 0.0,
"step": 430
},
{
"epoch": 0.5906040268456376,
"grad_norm": 0.0007248067413456738,
"learning_rate": 9.921364429073128e-06,
"loss": 0.0,
"step": 440
},
{
"epoch": 0.6040268456375839,
"grad_norm": 0.0004155105270911008,
"learning_rate": 9.91758574304696e-06,
"loss": 0.0,
"step": 450
},
{
"epoch": 0.6174496644295302,
"grad_norm": 0.0006713890470564365,
"learning_rate": 9.913719139909118e-06,
"loss": 0.0,
"step": 460
},
{
"epoch": 0.6308724832214765,
"grad_norm": 0.0022148373536765575,
"learning_rate": 9.909764688787133e-06,
"loss": 0.0001,
"step": 470
},
{
"epoch": 0.6442953020134228,
"grad_norm": 0.02001265622675419,
"learning_rate": 9.9057224603791e-06,
"loss": 0.0001,
"step": 480
},
{
"epoch": 0.6577181208053692,
"grad_norm": 0.002333961194381118,
"learning_rate": 9.901592526952397e-06,
"loss": 0.0001,
"step": 490
},
{
"epoch": 0.6711409395973155,
"grad_norm": 0.001215808093547821,
"learning_rate": 9.897374962342407e-06,
"loss": 0.0,
"step": 500
},
{
"epoch": 0.6845637583892618,
"grad_norm": 0.009857764467597008,
"learning_rate": 9.89306984195119e-06,
"loss": 0.0,
"step": 510
},
{
"epoch": 0.697986577181208,
"grad_norm": 0.0007901525241322815,
"learning_rate": 9.88867724274614e-06,
"loss": 0.0,
"step": 520
},
{
"epoch": 0.7114093959731543,
"grad_norm": 0.0030371681787073612,
"learning_rate": 9.884197243258604e-06,
"loss": 0.0001,
"step": 530
},
{
"epoch": 0.7248322147651006,
"grad_norm": 0.008034367114305496,
"learning_rate": 9.87962992358248e-06,
"loss": 0.0,
"step": 540
},
{
"epoch": 0.738255033557047,
"grad_norm": 0.0002114562230417505,
"learning_rate": 9.874975365372782e-06,
"loss": 0.0,
"step": 550
},
{
"epoch": 0.7516778523489933,
"grad_norm": 0.0004826551885344088,
"learning_rate": 9.870233651844197e-06,
"loss": 0.0001,
"step": 560
},
{
"epoch": 0.7651006711409396,
"grad_norm": 0.004415383096784353,
"learning_rate": 9.865404867769567e-06,
"loss": 0.0012,
"step": 570
},
{
"epoch": 0.7785234899328859,
"grad_norm": 0.0016952032456174493,
"learning_rate": 9.860489099478404e-06,
"loss": 0.0001,
"step": 580
},
{
"epoch": 0.7919463087248322,
"grad_norm": 0.306771844625473,
"learning_rate": 9.855486434855323e-06,
"loss": 0.0001,
"step": 590
},
{
"epoch": 0.8053691275167785,
"grad_norm": 0.00039068079786375165,
"learning_rate": 9.850396963338486e-06,
"loss": 0.0009,
"step": 600
},
{
"epoch": 0.8053691275167785,
"eval_loss": 0.0002706491795834154,
"eval_runtime": 36.315,
"eval_samples_per_second": 57.937,
"eval_steps_per_second": 3.635,
"step": 600
},
{
"epoch": 0.8187919463087249,
"grad_norm": 0.0022268325556069613,
"learning_rate": 9.845220775917997e-06,
"loss": 0.0,
"step": 610
},
{
"epoch": 0.8322147651006712,
"grad_norm": 0.00018392472702544183,
"learning_rate": 9.839957965134276e-06,
"loss": 0.0103,
"step": 620
},
{
"epoch": 0.8456375838926175,
"grad_norm": 0.000130903281387873,
"learning_rate": 9.834608625076402e-06,
"loss": 0.0027,
"step": 630
},
{
"epoch": 0.8590604026845637,
"grad_norm": 0.0025654262863099575,
"learning_rate": 9.829172851380438e-06,
"loss": 0.0,
"step": 640
},
{
"epoch": 0.87248322147651,
"grad_norm": 0.0009044542675837874,
"learning_rate": 9.82365074122771e-06,
"loss": 0.0,
"step": 650
},
{
"epoch": 0.8859060402684564,
"grad_norm": 0.011315861716866493,
"learning_rate": 9.818042393343086e-06,
"loss": 0.0001,
"step": 660
},
{
"epoch": 0.8993288590604027,
"grad_norm": 0.001662239315919578,
"learning_rate": 9.812347907993191e-06,
"loss": 0.0,
"step": 670
},
{
"epoch": 0.912751677852349,
"grad_norm": 0.0006356589146889746,
"learning_rate": 9.806567386984629e-06,
"loss": 0.0,
"step": 680
},
{
"epoch": 0.9261744966442953,
"grad_norm": 0.004927029367536306,
"learning_rate": 9.800700933662162e-06,
"loss": 0.0,
"step": 690
},
{
"epoch": 0.9395973154362416,
"grad_norm": 0.001120736706070602,
"learning_rate": 9.79474865290685e-06,
"loss": 0.0001,
"step": 700
},
{
"epoch": 0.9530201342281879,
"grad_norm": 0.0011548739857971668,
"learning_rate": 9.788710651134197e-06,
"loss": 0.0,
"step": 710
},
{
"epoch": 0.9664429530201343,
"grad_norm": 0.0007091641309671104,
"learning_rate": 9.782587036292224e-06,
"loss": 0.0,
"step": 720
},
{
"epoch": 0.9798657718120806,
"grad_norm": 0.0025191467721015215,
"learning_rate": 9.77637791785956e-06,
"loss": 0.0,
"step": 730
},
{
"epoch": 0.9932885906040269,
"grad_norm": 0.0007312273373827338,
"learning_rate": 9.77008340684347e-06,
"loss": 0.0,
"step": 740
},
{
"epoch": 1.0067114093959733,
"grad_norm": 0.001142745721153915,
"learning_rate": 9.763703615777881e-06,
"loss": 0.0,
"step": 750
},
{
"epoch": 1.0201342281879195,
"grad_norm": 0.002548090647906065,
"learning_rate": 9.757238658721368e-06,
"loss": 0.0001,
"step": 760
},
{
"epoch": 1.0335570469798658,
"grad_norm": 0.000620865379460156,
"learning_rate": 9.750688651255102e-06,
"loss": 0.0001,
"step": 770
},
{
"epoch": 1.0469798657718121,
"grad_norm": 0.01897359825670719,
"learning_rate": 9.744053710480806e-06,
"loss": 0.0,
"step": 780
},
{
"epoch": 1.0604026845637584,
"grad_norm": 0.0007367522921413183,
"learning_rate": 9.737333955018641e-06,
"loss": 0.0,
"step": 790
},
{
"epoch": 1.0738255033557047,
"grad_norm": 0.000936626922339201,
"learning_rate": 9.7305295050051e-06,
"loss": 0.0,
"step": 800
},
{
"epoch": 1.0738255033557047,
"eval_loss": 5.021028846385889e-05,
"eval_runtime": 35.3959,
"eval_samples_per_second": 59.442,
"eval_steps_per_second": 3.729,
"step": 800
},
{
"epoch": 1.087248322147651,
"grad_norm": 0.0032772677950561047,
"learning_rate": 9.723640482090849e-06,
"loss": 0.0,
"step": 810
},
{
"epoch": 1.1006711409395973,
"grad_norm": 0.0012591411359608173,
"learning_rate": 9.71666700943856e-06,
"loss": 0.0,
"step": 820
},
{
"epoch": 1.1140939597315436,
"grad_norm": 0.0003189941344317049,
"learning_rate": 9.709609211720707e-06,
"loss": 0.0,
"step": 830
},
{
"epoch": 1.1275167785234899,
"grad_norm": 0.004900411702692509,
"learning_rate": 9.702467215117333e-06,
"loss": 0.0001,
"step": 840
},
{
"epoch": 1.1409395973154361,
"grad_norm": 0.005429003853350878,
"learning_rate": 9.6952411473138e-06,
"loss": 0.0,
"step": 850
},
{
"epoch": 1.1543624161073827,
"grad_norm": 0.004705165047198534,
"learning_rate": 9.687931137498505e-06,
"loss": 0.0,
"step": 860
},
{
"epoch": 1.167785234899329,
"grad_norm": 0.0001935947366291657,
"learning_rate": 9.680537316360563e-06,
"loss": 0.0,
"step": 870
},
{
"epoch": 1.1812080536912752,
"grad_norm": 0.0003382129652891308,
"learning_rate": 9.673059816087485e-06,
"loss": 0.0,
"step": 880
},
{
"epoch": 1.1946308724832215,
"grad_norm": 0.0031510302796959877,
"learning_rate": 9.6654987703628e-06,
"loss": 0.0,
"step": 890
},
{
"epoch": 1.2080536912751678,
"grad_norm": 0.00032090378226712346,
"learning_rate": 9.657854314363673e-06,
"loss": 0.0,
"step": 900
},
{
"epoch": 1.221476510067114,
"grad_norm": 0.000652803631965071,
"learning_rate": 9.650126584758488e-06,
"loss": 0.0,
"step": 910
},
{
"epoch": 1.2348993288590604,
"grad_norm": 0.0010263837175443769,
"learning_rate": 9.642315719704402e-06,
"loss": 0.0,
"step": 920
},
{
"epoch": 1.2483221476510067,
"grad_norm": 0.0048846108838915825,
"learning_rate": 9.634421858844877e-06,
"loss": 0.0,
"step": 930
},
{
"epoch": 1.261744966442953,
"grad_norm": 0.004617949482053518,
"learning_rate": 9.626445143307183e-06,
"loss": 0.0,
"step": 940
},
{
"epoch": 1.2751677852348993,
"grad_norm": 0.011888934299349785,
"learning_rate": 9.618385715699872e-06,
"loss": 0.0,
"step": 950
},
{
"epoch": 1.2885906040268456,
"grad_norm": 0.0007617058581672609,
"learning_rate": 9.610243720110231e-06,
"loss": 0.0,
"step": 960
},
{
"epoch": 1.302013422818792,
"grad_norm": 0.002630546223372221,
"learning_rate": 9.602019302101711e-06,
"loss": 0.0,
"step": 970
},
{
"epoch": 1.3154362416107381,
"grad_norm": 0.00037842453457415104,
"learning_rate": 9.593712608711316e-06,
"loss": 0.0,
"step": 980
},
{
"epoch": 1.3288590604026846,
"grad_norm": 0.00104868458583951,
"learning_rate": 9.585323788446977e-06,
"loss": 0.0,
"step": 990
},
{
"epoch": 1.342281879194631,
"grad_norm": 0.0007262201397679746,
"learning_rate": 9.5768529912849e-06,
"loss": 0.0,
"step": 1000
},
{
"epoch": 1.342281879194631,
"eval_loss": 3.648681376944296e-05,
"eval_runtime": 35.3334,
"eval_samples_per_second": 59.547,
"eval_steps_per_second": 3.736,
"step": 1000
},
{
"epoch": 1.3557046979865772,
"grad_norm": 0.0010115931509062648,
"learning_rate": 9.56830036866688e-06,
"loss": 0.0,
"step": 1010
},
{
"epoch": 1.3691275167785235,
"grad_norm": 0.0012278178473934531,
"learning_rate": 9.559666073497602e-06,
"loss": 0.0,
"step": 1020
},
{
"epoch": 1.3825503355704698,
"grad_norm": 0.0025386980269104242,
"learning_rate": 9.550950260141893e-06,
"loss": 0.0,
"step": 1030
},
{
"epoch": 1.395973154362416,
"grad_norm": 0.004029413219541311,
"learning_rate": 9.542153084421974e-06,
"loss": 0.0,
"step": 1040
},
{
"epoch": 1.4093959731543624,
"grad_norm": 0.0012687516864389181,
"learning_rate": 9.533274703614675e-06,
"loss": 0.0,
"step": 1050
},
{
"epoch": 1.4228187919463087,
"grad_norm": 0.0002910475595854223,
"learning_rate": 9.524315276448615e-06,
"loss": 0.0,
"step": 1060
},
{
"epoch": 1.436241610738255,
"grad_norm": 0.0001882436336018145,
"learning_rate": 9.515274963101366e-06,
"loss": 0.0,
"step": 1070
},
{
"epoch": 1.4496644295302015,
"grad_norm": 0.004969654604792595,
"learning_rate": 9.506153925196599e-06,
"loss": 0.0,
"step": 1080
},
{
"epoch": 1.4630872483221475,
"grad_norm": 0.00046876867418177426,
"learning_rate": 9.496952325801178e-06,
"loss": 0.0,
"step": 1090
},
{
"epoch": 1.476510067114094,
"grad_norm": 0.0035596322268247604,
"learning_rate": 9.487670329422262e-06,
"loss": 0.0,
"step": 1100
},
{
"epoch": 1.4899328859060403,
"grad_norm": 0.001743100001476705,
"learning_rate": 9.47830810200435e-06,
"loss": 0.0,
"step": 1110
},
{
"epoch": 1.5033557046979866,
"grad_norm": 0.0005936401430517435,
"learning_rate": 9.46886581092632e-06,
"loss": 0.0,
"step": 1120
},
{
"epoch": 1.516778523489933,
"grad_norm": 0.0004633254138752818,
"learning_rate": 9.459343624998444e-06,
"loss": 0.0003,
"step": 1130
},
{
"epoch": 1.5302013422818792,
"grad_norm": 0.000729815277736634,
"learning_rate": 9.449741714459353e-06,
"loss": 0.0,
"step": 1140
},
{
"epoch": 1.5436241610738255,
"grad_norm": 0.002619138453155756,
"learning_rate": 9.440060250973006e-06,
"loss": 0.0,
"step": 1150
},
{
"epoch": 1.5570469798657718,
"grad_norm": 0.0005363261443562806,
"learning_rate": 9.430299407625621e-06,
"loss": 0.0,
"step": 1160
},
{
"epoch": 1.570469798657718,
"grad_norm": 0.002522964496165514,
"learning_rate": 9.420459358922573e-06,
"loss": 0.0,
"step": 1170
},
{
"epoch": 1.5838926174496644,
"grad_norm": 0.0003401544236112386,
"learning_rate": 9.410540280785281e-06,
"loss": 0.0,
"step": 1180
},
{
"epoch": 1.5973154362416109,
"grad_norm": 0.0032590986229479313,
"learning_rate": 9.400542350548064e-06,
"loss": 0.0,
"step": 1190
},
{
"epoch": 1.610738255033557,
"grad_norm": 0.000724705052562058,
"learning_rate": 9.39046574695496e-06,
"loss": 0.0,
"step": 1200
},
{
"epoch": 1.610738255033557,
"eval_loss": 2.2967349650571123e-05,
"eval_runtime": 35.3562,
"eval_samples_per_second": 59.509,
"eval_steps_per_second": 3.733,
"step": 1200
},
{
"epoch": 1.6241610738255035,
"grad_norm": 0.0012911584926769137,
"learning_rate": 9.380310650156539e-06,
"loss": 0.0,
"step": 1210
},
{
"epoch": 1.6375838926174495,
"grad_norm": 0.0004712361260317266,
"learning_rate": 9.370077241706685e-06,
"loss": 0.0,
"step": 1220
},
{
"epoch": 1.651006711409396,
"grad_norm": 0.021958833560347557,
"learning_rate": 9.359765704559345e-06,
"loss": 0.0,
"step": 1230
},
{
"epoch": 1.6644295302013423,
"grad_norm": 0.0022053795401006937,
"learning_rate": 9.349376223065254e-06,
"loss": 0.0,
"step": 1240
},
{
"epoch": 1.6778523489932886,
"grad_norm": 0.0005478787934407592,
"learning_rate": 9.338908982968648e-06,
"loss": 0.0,
"step": 1250
},
{
"epoch": 1.691275167785235,
"grad_norm": 0.0007460885099135339,
"learning_rate": 9.328364171403942e-06,
"loss": 0.0,
"step": 1260
},
{
"epoch": 1.7046979865771812,
"grad_norm": 0.0019455490401014686,
"learning_rate": 9.317741976892378e-06,
"loss": 0.0,
"step": 1270
},
{
"epoch": 1.7181208053691275,
"grad_norm": 0.00035590690094977617,
"learning_rate": 9.307042589338656e-06,
"loss": 0.0,
"step": 1280
},
{
"epoch": 1.7315436241610738,
"grad_norm": 0.012004991061985493,
"learning_rate": 9.296266200027547e-06,
"loss": 0.0,
"step": 1290
},
{
"epoch": 1.7449664429530203,
"grad_norm": 0.0004085991531610489,
"learning_rate": 9.285413001620465e-06,
"loss": 0.0,
"step": 1300
},
{
"epoch": 1.7583892617449663,
"grad_norm": 0.00010755215043900535,
"learning_rate": 9.274483188152024e-06,
"loss": 0.0,
"step": 1310
},
{
"epoch": 1.7718120805369129,
"grad_norm": 0.00267704832367599,
"learning_rate": 9.263476955026571e-06,
"loss": 0.0,
"step": 1320
},
{
"epoch": 1.785234899328859,
"grad_norm": 0.0034030245151370764,
"learning_rate": 9.252394499014694e-06,
"loss": 0.0,
"step": 1330
},
{
"epoch": 1.7986577181208054,
"grad_norm": 0.00013984985707793385,
"learning_rate": 9.241236018249697e-06,
"loss": 0.0,
"step": 1340
},
{
"epoch": 1.8120805369127517,
"grad_norm": 0.0002011173201026395,
"learning_rate": 9.230001712224065e-06,
"loss": 0.0,
"step": 1350
},
{
"epoch": 1.825503355704698,
"grad_norm": 0.00010617657972034067,
"learning_rate": 9.218691781785895e-06,
"loss": 0.0007,
"step": 1360
},
{
"epoch": 1.8389261744966443,
"grad_norm": 0.0009955656714737415,
"learning_rate": 9.207306429135308e-06,
"loss": 0.0,
"step": 1370
},
{
"epoch": 1.8523489932885906,
"grad_norm": 0.0036702740471810102,
"learning_rate": 9.195845857820824e-06,
"loss": 0.0,
"step": 1380
},
{
"epoch": 1.8657718120805369,
"grad_norm": 0.0002426176652079448,
"learning_rate": 9.184310272735734e-06,
"loss": 0.0001,
"step": 1390
},
{
"epoch": 1.8791946308724832,
"grad_norm": 0.00634851586073637,
"learning_rate": 9.172699880114439e-06,
"loss": 0.0002,
"step": 1400
},
{
"epoch": 1.8791946308724832,
"eval_loss": 0.00027104900800623,
"eval_runtime": 35.3598,
"eval_samples_per_second": 59.503,
"eval_steps_per_second": 3.733,
"step": 1400
},
{
"epoch": 1.8926174496644297,
"grad_norm": 0.0036746342666447163,
"learning_rate": 9.161014887528745e-06,
"loss": 0.0,
"step": 1410
},
{
"epoch": 1.9060402684563758,
"grad_norm": 0.000249032280407846,
"learning_rate": 9.149255503884173e-06,
"loss": 0.0027,
"step": 1420
},
{
"epoch": 1.9194630872483223,
"grad_norm": 0.000549475138541311,
"learning_rate": 9.137421939416213e-06,
"loss": 0.0,
"step": 1430
},
{
"epoch": 1.9328859060402683,
"grad_norm": 0.0003771043266169727,
"learning_rate": 9.125514405686565e-06,
"loss": 0.0,
"step": 1440
},
{
"epoch": 1.9463087248322148,
"grad_norm": 0.0006280411034822464,
"learning_rate": 9.113533115579362e-06,
"loss": 0.0,
"step": 1450
},
{
"epoch": 1.959731543624161,
"grad_norm": 0.0007881259662099183,
"learning_rate": 9.10147828329736e-06,
"loss": 0.0001,
"step": 1460
},
{
"epoch": 1.9731543624161074,
"grad_norm": 0.0020082280971109867,
"learning_rate": 9.089350124358112e-06,
"loss": 0.0,
"step": 1470
},
{
"epoch": 1.9865771812080537,
"grad_norm": 0.0006154579459689558,
"learning_rate": 9.077148855590107e-06,
"loss": 0.0,
"step": 1480
},
{
"epoch": 2.0,
"grad_norm": 0.00037393253296613693,
"learning_rate": 9.064874695128905e-06,
"loss": 0.0,
"step": 1490
},
{
"epoch": 2.0134228187919465,
"grad_norm": 0.00029199194977991283,
"learning_rate": 9.052527862413227e-06,
"loss": 0.0,
"step": 1500
},
{
"epoch": 2.0268456375838926,
"grad_norm": 0.000314797624014318,
"learning_rate": 9.040108578181043e-06,
"loss": 0.0,
"step": 1510
},
{
"epoch": 2.040268456375839,
"grad_norm": 0.0012662105727940798,
"learning_rate": 9.027617064465609e-06,
"loss": 0.0,
"step": 1520
},
{
"epoch": 2.053691275167785,
"grad_norm": 0.003268664237111807,
"learning_rate": 9.015053544591515e-06,
"loss": 0.0,
"step": 1530
},
{
"epoch": 2.0671140939597317,
"grad_norm": 0.0001988365693250671,
"learning_rate": 9.00241824317068e-06,
"loss": 0.0,
"step": 1540
},
{
"epoch": 2.0805369127516777,
"grad_norm": 0.0001061362199834548,
"learning_rate": 8.989711386098342e-06,
"loss": 0.0,
"step": 1550
},
{
"epoch": 2.0939597315436242,
"grad_norm": 0.0002688623790163547,
"learning_rate": 8.976933200549025e-06,
"loss": 0.0,
"step": 1560
},
{
"epoch": 2.1073825503355703,
"grad_norm": 0.00019378861179575324,
"learning_rate": 8.964083914972458e-06,
"loss": 0.0,
"step": 1570
},
{
"epoch": 2.120805369127517,
"grad_norm": 0.0033799654338508844,
"learning_rate": 8.951163759089518e-06,
"loss": 0.0,
"step": 1580
},
{
"epoch": 2.134228187919463,
"grad_norm": 0.00018397756502963603,
"learning_rate": 8.938172963888095e-06,
"loss": 0.0,
"step": 1590
},
{
"epoch": 2.1476510067114094,
"grad_norm": 0.04040246829390526,
"learning_rate": 8.925111761618987e-06,
"loss": 0.0,
"step": 1600
},
{
"epoch": 2.1476510067114094,
"eval_loss": 2.1961919628665783e-05,
"eval_runtime": 35.3554,
"eval_samples_per_second": 59.51,
"eval_steps_per_second": 3.734,
"step": 1600
},
{
"epoch": 2.1610738255033555,
"grad_norm": 0.00038172732456587255,
"learning_rate": 8.911980385791731e-06,
"loss": 0.0,
"step": 1610
},
{
"epoch": 2.174496644295302,
"grad_norm": 0.0001361399336019531,
"learning_rate": 8.898779071170435e-06,
"loss": 0.0,
"step": 1620
},
{
"epoch": 2.1879194630872485,
"grad_norm": 0.0005550897913053632,
"learning_rate": 8.885508053769586e-06,
"loss": 0.0,
"step": 1630
},
{
"epoch": 2.2013422818791946,
"grad_norm": 0.004139598459005356,
"learning_rate": 8.872167570849814e-06,
"loss": 0.0,
"step": 1640
},
{
"epoch": 2.214765100671141,
"grad_norm": 0.0013187492731958628,
"learning_rate": 8.858757860913669e-06,
"loss": 0.0,
"step": 1650
},
{
"epoch": 2.228187919463087,
"grad_norm": 0.0012508869403973222,
"learning_rate": 8.845279163701344e-06,
"loss": 0.0,
"step": 1660
},
{
"epoch": 2.2416107382550337,
"grad_norm": 0.0005907061859034002,
"learning_rate": 8.831731720186398e-06,
"loss": 0.0,
"step": 1670
},
{
"epoch": 2.2550335570469797,
"grad_norm": 0.0005804875981993973,
"learning_rate": 8.818115772571444e-06,
"loss": 0.0,
"step": 1680
},
{
"epoch": 2.2684563758389262,
"grad_norm": 0.0011968908365815878,
"learning_rate": 8.804431564283808e-06,
"loss": 0.0,
"step": 1690
},
{
"epoch": 2.2818791946308723,
"grad_norm": 0.0004881023778580129,
"learning_rate": 8.790679339971205e-06,
"loss": 0.0,
"step": 1700
},
{
"epoch": 2.295302013422819,
"grad_norm": 0.0005363011150620878,
"learning_rate": 8.776859345497331e-06,
"loss": 0.0,
"step": 1710
},
{
"epoch": 2.3087248322147653,
"grad_norm": 0.0028747557662427425,
"learning_rate": 8.762971827937494e-06,
"loss": 0.0,
"step": 1720
},
{
"epoch": 2.3221476510067114,
"grad_norm": 0.0003347527817822993,
"learning_rate": 8.749017035574183e-06,
"loss": 0.0,
"step": 1730
},
{
"epoch": 2.335570469798658,
"grad_norm": 0.00023599617998115718,
"learning_rate": 8.734995217892636e-06,
"loss": 0.0,
"step": 1740
},
{
"epoch": 2.348993288590604,
"grad_norm": 0.0033915615640580654,
"learning_rate": 8.72090662557637e-06,
"loss": 0.0,
"step": 1750
},
{
"epoch": 2.3624161073825505,
"grad_norm": 9.387471800437197e-05,
"learning_rate": 8.706751510502716e-06,
"loss": 0.0,
"step": 1760
},
{
"epoch": 2.3758389261744965,
"grad_norm": 0.0018768429290503263,
"learning_rate": 8.692530125738294e-06,
"loss": 0.0,
"step": 1770
},
{
"epoch": 2.389261744966443,
"grad_norm": 0.006376422941684723,
"learning_rate": 8.678242725534512e-06,
"loss": 0.0,
"step": 1780
},
{
"epoch": 2.402684563758389,
"grad_norm": 0.0060360003262758255,
"learning_rate": 8.663889565322998e-06,
"loss": 0.0,
"step": 1790
},
{
"epoch": 2.4161073825503356,
"grad_norm": 9.72438501776196e-05,
"learning_rate": 8.649470901711056e-06,
"loss": 0.0,
"step": 1800
},
{
"epoch": 2.4161073825503356,
"eval_loss": 2.182549360441044e-05,
"eval_runtime": 35.3454,
"eval_samples_per_second": 59.527,
"eval_steps_per_second": 3.735,
"step": 1800
},
{
"epoch": 2.4161073825503356,
"step": 1800,
"total_flos": 4.781788253483172e+17,
"train_loss": 0.028248545922963077,
"train_runtime": 1989.9374,
"train_samples_per_second": 59.896,
"train_steps_per_second": 3.744
}
],
"logging_steps": 10,
"max_steps": 7450,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 1000,
"total_flos": 4.781788253483172e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}