Safetensors
ParagonLight's picture
update loras
60bd5ed
Raw
History Blame Contribute Delete
20.3 kB
{
"best_metric": 0.0001896605535876006,
"best_model_checkpoint": "ckpt/llama3_8b_fuze27_no_sys/tracking_shuffled_objects_no_sys/checkpoint-700",
"epoch": 2.8011204481792715,
"eval_steps": 100,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.028011204481792718,
"grad_norm": 11.68239974975586,
"learning_rate": 2.5e-05,
"loss": 3.5808,
"step": 10
},
{
"epoch": 0.056022408963585436,
"grad_norm": 2.8469760417938232,
"learning_rate": 5e-05,
"loss": 1.4653,
"step": 20
},
{
"epoch": 0.08403361344537816,
"grad_norm": 2.9564781188964844,
"learning_rate": 4.9996039875197146e-05,
"loss": 0.4603,
"step": 30
},
{
"epoch": 0.11204481792717087,
"grad_norm": 1.9116700887680054,
"learning_rate": 4.9984160755395636e-05,
"loss": 0.4233,
"step": 40
},
{
"epoch": 0.1400560224089636,
"grad_norm": 1.8749676942825317,
"learning_rate": 4.9964366404019245e-05,
"loss": 0.4279,
"step": 50
},
{
"epoch": 0.16806722689075632,
"grad_norm": 2.9393470287323,
"learning_rate": 4.9936663092116105e-05,
"loss": 0.4078,
"step": 60
},
{
"epoch": 0.19607843137254902,
"grad_norm": 1.5631835460662842,
"learning_rate": 4.9901059596372036e-05,
"loss": 0.3969,
"step": 70
},
{
"epoch": 0.22408963585434175,
"grad_norm": 2.325085401535034,
"learning_rate": 4.985756719632996e-05,
"loss": 0.4476,
"step": 80
},
{
"epoch": 0.25210084033613445,
"grad_norm": 1.209677815437317,
"learning_rate": 4.9806199670816445e-05,
"loss": 0.4109,
"step": 90
},
{
"epoch": 0.2801120448179272,
"grad_norm": 1.1088253259658813,
"learning_rate": 4.974697329357644e-05,
"loss": 0.4079,
"step": 100
},
{
"epoch": 0.2801120448179272,
"eval_loss": 0.408916711807251,
"eval_runtime": 2.8461,
"eval_samples_per_second": 52.704,
"eval_steps_per_second": 6.676,
"step": 100
},
{
"epoch": 0.3081232492997199,
"grad_norm": 1.0425214767456055,
"learning_rate": 4.967990682811758e-05,
"loss": 0.4324,
"step": 110
},
{
"epoch": 0.33613445378151263,
"grad_norm": 1.5861892700195312,
"learning_rate": 4.960502152176574e-05,
"loss": 0.4116,
"step": 120
},
{
"epoch": 0.3641456582633053,
"grad_norm": 1.4320331811904907,
"learning_rate": 4.9522341098933635e-05,
"loss": 0.4096,
"step": 130
},
{
"epoch": 0.39215686274509803,
"grad_norm": 1.3361800909042358,
"learning_rate": 4.943189175360472e-05,
"loss": 0.4016,
"step": 140
},
{
"epoch": 0.42016806722689076,
"grad_norm": 1.3678736686706543,
"learning_rate": 4.933370214103467e-05,
"loss": 0.4113,
"step": 150
},
{
"epoch": 0.4481792717086835,
"grad_norm": 1.5625993013381958,
"learning_rate": 4.922780336867309e-05,
"loss": 0.4015,
"step": 160
},
{
"epoch": 0.47619047619047616,
"grad_norm": 1.4297890663146973,
"learning_rate": 4.9114228986308374e-05,
"loss": 0.3892,
"step": 170
},
{
"epoch": 0.5042016806722689,
"grad_norm": 2.283721446990967,
"learning_rate": 4.8993014975438814e-05,
"loss": 0.3936,
"step": 180
},
{
"epoch": 0.5322128851540616,
"grad_norm": 3.531468629837036,
"learning_rate": 4.8864199737873287e-05,
"loss": 0.3261,
"step": 190
},
{
"epoch": 0.5602240896358543,
"grad_norm": 2.091176748275757,
"learning_rate": 4.872782408356517e-05,
"loss": 0.3343,
"step": 200
},
{
"epoch": 0.5602240896358543,
"eval_loss": 0.3214447498321533,
"eval_runtime": 2.8697,
"eval_samples_per_second": 52.27,
"eval_steps_per_second": 6.621,
"step": 200
},
{
"epoch": 0.5882352941176471,
"grad_norm": 2.5533387660980225,
"learning_rate": 4.858393121768335e-05,
"loss": 0.3283,
"step": 210
},
{
"epoch": 0.6162464985994398,
"grad_norm": 8.215011596679688,
"learning_rate": 4.843256672692441e-05,
"loss": 0.3155,
"step": 220
},
{
"epoch": 0.6442577030812325,
"grad_norm": 6.319694519042969,
"learning_rate": 4.827377856507026e-05,
"loss": 0.2806,
"step": 230
},
{
"epoch": 0.6722689075630253,
"grad_norm": 4.542545318603516,
"learning_rate": 4.8107617037795965e-05,
"loss": 0.2884,
"step": 240
},
{
"epoch": 0.7002801120448179,
"grad_norm": 17.7308292388916,
"learning_rate": 4.7934134786732365e-05,
"loss": 0.286,
"step": 250
},
{
"epoch": 0.7282913165266106,
"grad_norm": 2.3095180988311768,
"learning_rate": 4.775338677278867e-05,
"loss": 0.2215,
"step": 260
},
{
"epoch": 0.7563025210084033,
"grad_norm": 5.083682060241699,
"learning_rate": 4.756543025874034e-05,
"loss": 0.2529,
"step": 270
},
{
"epoch": 0.7843137254901961,
"grad_norm": 10.334514617919922,
"learning_rate": 4.7370324791087616e-05,
"loss": 0.1804,
"step": 280
},
{
"epoch": 0.8123249299719888,
"grad_norm": 3.9857237339019775,
"learning_rate": 4.716813218119064e-05,
"loss": 0.1956,
"step": 290
},
{
"epoch": 0.8403361344537815,
"grad_norm": 6.7719855308532715,
"learning_rate": 4.6958916485686956e-05,
"loss": 0.1914,
"step": 300
},
{
"epoch": 0.8403361344537815,
"eval_loss": 0.1493147313594818,
"eval_runtime": 2.8736,
"eval_samples_per_second": 52.198,
"eval_steps_per_second": 6.612,
"step": 300
},
{
"epoch": 0.8683473389355743,
"grad_norm": 4.405186176300049,
"learning_rate": 4.6742743986197757e-05,
"loss": 0.1808,
"step": 310
},
{
"epoch": 0.896358543417367,
"grad_norm": 6.499341011047363,
"learning_rate": 4.65196831683292e-05,
"loss": 0.154,
"step": 320
},
{
"epoch": 0.9243697478991597,
"grad_norm": 3.253216505050659,
"learning_rate": 4.628980469997547e-05,
"loss": 0.1339,
"step": 330
},
{
"epoch": 0.9523809523809523,
"grad_norm": 8.81497573852539,
"learning_rate": 4.60531814089305e-05,
"loss": 0.109,
"step": 340
},
{
"epoch": 0.9803921568627451,
"grad_norm": 15.7227144241333,
"learning_rate": 4.580988825981541e-05,
"loss": 0.092,
"step": 350
},
{
"epoch": 1.0084033613445378,
"grad_norm": 9.170595169067383,
"learning_rate": 4.556000233032892e-05,
"loss": 0.1479,
"step": 360
},
{
"epoch": 1.0364145658263306,
"grad_norm": 14.895033836364746,
"learning_rate": 4.530360278682842e-05,
"loss": 0.0871,
"step": 370
},
{
"epoch": 1.0644257703081232,
"grad_norm": 0.1763153076171875,
"learning_rate": 4.504077085924922e-05,
"loss": 0.0982,
"step": 380
},
{
"epoch": 1.092436974789916,
"grad_norm": 9.751165390014648,
"learning_rate": 4.477158981537017e-05,
"loss": 0.0851,
"step": 390
},
{
"epoch": 1.1204481792717087,
"grad_norm": 0.1843680888414383,
"learning_rate": 4.449614493443354e-05,
"loss": 0.034,
"step": 400
},
{
"epoch": 1.1204481792717087,
"eval_loss": 0.04679349809885025,
"eval_runtime": 2.873,
"eval_samples_per_second": 52.21,
"eval_steps_per_second": 6.613,
"step": 400
},
{
"epoch": 1.1484593837535013,
"grad_norm": 6.5383501052856445,
"learning_rate": 4.421452348012771e-05,
"loss": 0.0584,
"step": 410
},
{
"epoch": 1.1764705882352942,
"grad_norm": 0.003353311913087964,
"learning_rate": 4.392681467294117e-05,
"loss": 0.0344,
"step": 420
},
{
"epoch": 1.2044817927170868,
"grad_norm": 0.0053819697350263596,
"learning_rate": 4.3633109661896595e-05,
"loss": 0.0111,
"step": 430
},
{
"epoch": 1.2324929971988796,
"grad_norm": 32.45022201538086,
"learning_rate": 4.33335014956739e-05,
"loss": 0.1152,
"step": 440
},
{
"epoch": 1.2605042016806722,
"grad_norm": 7.157898902893066,
"learning_rate": 4.30280850931315e-05,
"loss": 0.0524,
"step": 450
},
{
"epoch": 1.2885154061624648,
"grad_norm": 0.7617452144622803,
"learning_rate": 4.271695721323506e-05,
"loss": 0.0121,
"step": 460
},
{
"epoch": 1.3165266106442577,
"grad_norm": 23.683460235595703,
"learning_rate": 4.240021642440333e-05,
"loss": 0.0947,
"step": 470
},
{
"epoch": 1.3445378151260505,
"grad_norm": 0.007763392757624388,
"learning_rate": 4.207796307328059e-05,
"loss": 0.0011,
"step": 480
},
{
"epoch": 1.3725490196078431,
"grad_norm": 0.14272698760032654,
"learning_rate": 4.175029925294595e-05,
"loss": 0.0433,
"step": 490
},
{
"epoch": 1.4005602240896358,
"grad_norm": 0.22110269963741302,
"learning_rate": 4.141732877056915e-05,
"loss": 0.0276,
"step": 500
},
{
"epoch": 1.4005602240896358,
"eval_loss": 0.008394874632358551,
"eval_runtime": 2.8698,
"eval_samples_per_second": 52.269,
"eval_steps_per_second": 6.621,
"step": 500
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.014582260511815548,
"learning_rate": 4.107915711452347e-05,
"loss": 0.0156,
"step": 510
},
{
"epoch": 1.4565826330532212,
"grad_norm": 0.0064322990365326405,
"learning_rate": 4.073589142096592e-05,
"loss": 0.0092,
"step": 520
},
{
"epoch": 1.484593837535014,
"grad_norm": 0.006550009828060865,
"learning_rate": 4.038764043989548e-05,
"loss": 0.0056,
"step": 530
},
{
"epoch": 1.5126050420168067,
"grad_norm": 0.00899260863661766,
"learning_rate": 4.003451450069994e-05,
"loss": 0.0001,
"step": 540
},
{
"epoch": 1.5406162464985993,
"grad_norm": 0.0009019902790896595,
"learning_rate": 3.9676625477202554e-05,
"loss": 0.0081,
"step": 550
},
{
"epoch": 1.5686274509803921,
"grad_norm": 0.005392414517700672,
"learning_rate": 3.9314086752219195e-05,
"loss": 0.0259,
"step": 560
},
{
"epoch": 1.596638655462185,
"grad_norm": 0.0008008493459783494,
"learning_rate": 3.8947013181637624e-05,
"loss": 0.0008,
"step": 570
},
{
"epoch": 1.6246498599439776,
"grad_norm": 0.014637362211942673,
"learning_rate": 3.857552105802994e-05,
"loss": 0.0006,
"step": 580
},
{
"epoch": 1.6526610644257702,
"grad_norm": 0.0004757639835588634,
"learning_rate": 3.819972807380995e-05,
"loss": 0.0053,
"step": 590
},
{
"epoch": 1.680672268907563,
"grad_norm": 0.0002963497245218605,
"learning_rate": 3.781975328394708e-05,
"loss": 0.0001,
"step": 600
},
{
"epoch": 1.680672268907563,
"eval_loss": 0.01559663750231266,
"eval_runtime": 2.8686,
"eval_samples_per_second": 52.29,
"eval_steps_per_second": 6.623,
"step": 600
},
{
"epoch": 1.708683473389356,
"grad_norm": 3.8546576499938965,
"learning_rate": 3.74357170682485e-05,
"loss": 0.0094,
"step": 610
},
{
"epoch": 1.7366946778711485,
"grad_norm": 0.38633355498313904,
"learning_rate": 3.704774109322166e-05,
"loss": 0.034,
"step": 620
},
{
"epoch": 1.7647058823529411,
"grad_norm": 0.0008682355983182788,
"learning_rate": 3.665594827352908e-05,
"loss": 0.0004,
"step": 630
},
{
"epoch": 1.7927170868347337,
"grad_norm": 0.01699518784880638,
"learning_rate": 3.626046273304779e-05,
"loss": 0.0146,
"step": 640
},
{
"epoch": 1.8207282913165266,
"grad_norm": 0.0713791772723198,
"learning_rate": 3.586140976554564e-05,
"loss": 0.0001,
"step": 650
},
{
"epoch": 1.8487394957983194,
"grad_norm": 0.0003395811072550714,
"learning_rate": 3.545891579498695e-05,
"loss": 0.0001,
"step": 660
},
{
"epoch": 1.876750700280112,
"grad_norm": 0.0010548827704042196,
"learning_rate": 3.5053108335480206e-05,
"loss": 0.0022,
"step": 670
},
{
"epoch": 1.9047619047619047,
"grad_norm": 9.065557242138311e-05,
"learning_rate": 3.4644115950880254e-05,
"loss": 0.0389,
"step": 680
},
{
"epoch": 1.9327731092436975,
"grad_norm": 0.010628440417349339,
"learning_rate": 3.423206821405799e-05,
"loss": 0.0002,
"step": 690
},
{
"epoch": 1.9607843137254903,
"grad_norm": 0.0003508552326820791,
"learning_rate": 3.381709566585044e-05,
"loss": 0.0,
"step": 700
},
{
"epoch": 1.9607843137254903,
"eval_loss": 0.0001896605535876006,
"eval_runtime": 2.8723,
"eval_samples_per_second": 52.223,
"eval_steps_per_second": 6.615,
"step": 700
},
{
"epoch": 1.988795518207283,
"grad_norm": 0.00045208673691377044,
"learning_rate": 3.339932977370404e-05,
"loss": 0.0548,
"step": 710
},
{
"epoch": 2.0168067226890756,
"grad_norm": 0.0002967917826026678,
"learning_rate": 3.297890289002451e-05,
"loss": 0.0669,
"step": 720
},
{
"epoch": 2.044817927170868,
"grad_norm": 0.0014003561809659004,
"learning_rate": 3.255594821024622e-05,
"loss": 0.0137,
"step": 730
},
{
"epoch": 2.0728291316526612,
"grad_norm": 0.029797283932566643,
"learning_rate": 3.2130599730634606e-05,
"loss": 0.005,
"step": 740
},
{
"epoch": 2.100840336134454,
"grad_norm": 0.0008940272382460535,
"learning_rate": 3.170299220583479e-05,
"loss": 0.0006,
"step": 750
},
{
"epoch": 2.1288515406162465,
"grad_norm": 0.0002603277680464089,
"learning_rate": 3.127326110617996e-05,
"loss": 0.0002,
"step": 760
},
{
"epoch": 2.156862745098039,
"grad_norm": 0.000504830852150917,
"learning_rate": 3.084154257477301e-05,
"loss": 0.0,
"step": 770
},
{
"epoch": 2.184873949579832,
"grad_norm": 0.0018955356208607554,
"learning_rate": 3.0407973384355088e-05,
"loss": 0.0165,
"step": 780
},
{
"epoch": 2.212885154061625,
"grad_norm": 0.0010648163734003901,
"learning_rate": 2.997269089397455e-05,
"loss": 0.0,
"step": 790
},
{
"epoch": 2.2408963585434174,
"grad_norm": 0.0006610855343751609,
"learning_rate": 2.9535833005470315e-05,
"loss": 0.0022,
"step": 800
},
{
"epoch": 2.2408963585434174,
"eval_loss": 0.012090143747627735,
"eval_runtime": 2.8741,
"eval_samples_per_second": 52.189,
"eval_steps_per_second": 6.611,
"step": 800
},
{
"epoch": 2.26890756302521,
"grad_norm": 0.0001721924199955538,
"learning_rate": 2.9097538119783152e-05,
"loss": 0.0,
"step": 810
},
{
"epoch": 2.2969187675070026,
"grad_norm": 0.0006904829642735422,
"learning_rate": 2.8657945093108886e-05,
"loss": 0.0161,
"step": 820
},
{
"epoch": 2.3249299719887957,
"grad_norm": 31.687515258789062,
"learning_rate": 2.821719319290736e-05,
"loss": 0.0684,
"step": 830
},
{
"epoch": 2.3529411764705883,
"grad_norm": 0.002737673930823803,
"learning_rate": 2.777542205378113e-05,
"loss": 0.0001,
"step": 840
},
{
"epoch": 2.380952380952381,
"grad_norm": 0.005815234035253525,
"learning_rate": 2.733277163323782e-05,
"loss": 0.0038,
"step": 850
},
{
"epoch": 2.4089635854341735,
"grad_norm": 0.0005296830786392093,
"learning_rate": 2.6889382167350154e-05,
"loss": 0.0001,
"step": 860
},
{
"epoch": 2.4369747899159666,
"grad_norm": 0.001167680835351348,
"learning_rate": 2.6445394126327865e-05,
"loss": 0.0,
"step": 870
},
{
"epoch": 2.4649859943977592,
"grad_norm": 0.0011337065370753407,
"learning_rate": 2.6000948170015205e-05,
"loss": 0.016,
"step": 880
},
{
"epoch": 2.492997198879552,
"grad_norm": 0.002113680588081479,
"learning_rate": 2.555618510332859e-05,
"loss": 0.0,
"step": 890
},
{
"epoch": 2.5210084033613445,
"grad_norm": 0.00770913390442729,
"learning_rate": 2.511124583164816e-05,
"loss": 0.0,
"step": 900
},
{
"epoch": 2.5210084033613445,
"eval_loss": 0.005274456925690174,
"eval_runtime": 2.873,
"eval_samples_per_second": 52.21,
"eval_steps_per_second": 6.613,
"step": 900
},
{
"epoch": 2.549019607843137,
"grad_norm": 0.0025718784891068935,
"learning_rate": 2.4666271316177557e-05,
"loss": 0.0001,
"step": 910
},
{
"epoch": 2.5770308123249297,
"grad_norm": 0.00034481892362236977,
"learning_rate": 2.422140252928601e-05,
"loss": 0.0002,
"step": 920
},
{
"epoch": 2.6050420168067228,
"grad_norm": 0.00020677850989159197,
"learning_rate": 2.3776780409846888e-05,
"loss": 0.0001,
"step": 930
},
{
"epoch": 2.6330532212885154,
"grad_norm": 0.0001574026100570336,
"learning_rate": 2.3332545818586827e-05,
"loss": 0.0,
"step": 940
},
{
"epoch": 2.661064425770308,
"grad_norm": 0.017475171014666557,
"learning_rate": 2.2888839493459684e-05,
"loss": 0.0,
"step": 950
},
{
"epoch": 2.689075630252101,
"grad_norm": 0.006330742035061121,
"learning_rate": 2.2445802005059328e-05,
"loss": 0.0,
"step": 960
},
{
"epoch": 2.7170868347338937,
"grad_norm": 0.0004552874306682497,
"learning_rate": 2.2003573712085457e-05,
"loss": 0.0,
"step": 970
},
{
"epoch": 2.7450980392156863,
"grad_norm": 0.0009258923237212002,
"learning_rate": 2.1562294716876596e-05,
"loss": 0.0,
"step": 980
},
{
"epoch": 2.773109243697479,
"grad_norm": 0.0004848680691793561,
"learning_rate": 2.112210482102428e-05,
"loss": 0.0,
"step": 990
},
{
"epoch": 2.8011204481792715,
"grad_norm": 0.0008731464040465653,
"learning_rate": 2.0683143481082452e-05,
"loss": 0.0,
"step": 1000
},
{
"epoch": 2.8011204481792715,
"eval_loss": 0.005379769951105118,
"eval_runtime": 2.8678,
"eval_samples_per_second": 52.304,
"eval_steps_per_second": 6.625,
"step": 1000
},
{
"epoch": 2.8011204481792715,
"step": 1000,
"total_flos": 8.23229487073198e+16,
"train_loss": 0.1688887168551737,
"train_runtime": 530.2932,
"train_samples_per_second": 26.872,
"train_steps_per_second": 3.366
}
],
"logging_steps": 10,
"max_steps": 1785,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"total_flos": 8.23229487073198e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}