flamiinngo's picture
Add LoRA adapter weights (Llama-3.3-70B, math and code)
c4d4a33 verified
Raw
History Blame Contribute Delete
13 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 12,
"global_step": 63,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.047619047619047616,
"grad_norm": 0.5501871705055237,
"learning_rate": 0.0,
"loss": 1.21484375,
"step": 1
},
{
"epoch": 0.09523809523809523,
"grad_norm": 0.5486732721328735,
"learning_rate": 5e-05,
"loss": 1.0947265625,
"step": 2
},
{
"epoch": 0.14285714285714285,
"grad_norm": 0.3428894877433777,
"learning_rate": 0.0001,
"loss": 1.06201171875,
"step": 3
},
{
"epoch": 0.19047619047619047,
"grad_norm": 0.19505959749221802,
"learning_rate": 9.994033404481737e-05,
"loss": 0.837890625,
"step": 4
},
{
"epoch": 0.23809523809523808,
"grad_norm": 0.15906307101249695,
"learning_rate": 9.97614944026565e-05,
"loss": 0.849853515625,
"step": 5
},
{
"epoch": 0.2857142857142857,
"grad_norm": 0.2227369248867035,
"learning_rate": 9.946395532409847e-05,
"loss": 0.915283203125,
"step": 6
},
{
"epoch": 0.3333333333333333,
"grad_norm": 0.20231562852859497,
"learning_rate": 9.904850582929111e-05,
"loss": 0.831298828125,
"step": 7
},
{
"epoch": 0.38095238095238093,
"grad_norm": 0.18000583350658417,
"learning_rate": 9.851624761560943e-05,
"loss": 0.87841796875,
"step": 8
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.1295953094959259,
"learning_rate": 9.786859213615221e-05,
"loss": 0.92822265625,
"step": 9
},
{
"epoch": 0.47619047619047616,
"grad_norm": 0.099913589656353,
"learning_rate": 9.710725685682222e-05,
"loss": 0.813232421875,
"step": 10
},
{
"epoch": 0.5238095238095238,
"grad_norm": 0.11362982541322708,
"learning_rate": 9.623426070191522e-05,
"loss": 0.723876953125,
"step": 11
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.09283869713544846,
"learning_rate": 9.525191870029581e-05,
"loss": 0.687744140625,
"step": 12
},
{
"epoch": 0.6190476190476191,
"grad_norm": 0.10829943418502808,
"learning_rate": 9.4162835846357e-05,
"loss": 0.802490234375,
"step": 13
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.10302653908729553,
"learning_rate": 9.296990019204335e-05,
"loss": 0.8428955078125,
"step": 14
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.08654075115919113,
"learning_rate": 9.167627518825651e-05,
"loss": 0.7138671875,
"step": 15
},
{
"epoch": 0.7142857142857143,
"eval_loss": 0.8271484375,
"eval_runtime": 6.4521,
"eval_samples_per_second": 0.62,
"eval_steps_per_second": 0.155,
"step": 15
},
{
"epoch": 0.7619047619047619,
"grad_norm": 0.11643221974372864,
"learning_rate": 9.028539129595199e-05,
"loss": 0.80078125,
"step": 16
},
{
"epoch": 0.8095238095238095,
"grad_norm": 0.09286683052778244,
"learning_rate": 8.88009368891734e-05,
"loss": 0.841796875,
"step": 17
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.08940571546554565,
"learning_rate": 8.72268484741477e-05,
"loss": 0.78759765625,
"step": 18
},
{
"epoch": 0.9047619047619048,
"grad_norm": 0.09568110853433609,
"learning_rate": 8.556730025037819e-05,
"loss": 0.740478515625,
"step": 19
},
{
"epoch": 0.9523809523809523,
"grad_norm": 0.07992596179246902,
"learning_rate": 8.38266930414179e-05,
"loss": 0.6640625,
"step": 20
},
{
"epoch": 1.0,
"grad_norm": 0.08235524594783783,
"learning_rate": 8.200964262467657e-05,
"loss": 0.8515625,
"step": 21
},
{
"epoch": 1.0476190476190477,
"grad_norm": 0.08874722570180893,
"learning_rate": 8.01209674912089e-05,
"loss": 0.845703125,
"step": 22
},
{
"epoch": 1.0952380952380953,
"grad_norm": 0.08876466751098633,
"learning_rate": 7.81656760679424e-05,
"loss": 0.732421875,
"step": 23
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.08666371554136276,
"learning_rate": 7.614895343622941e-05,
"loss": 0.7750244140625,
"step": 24
},
{
"epoch": 1.1904761904761905,
"grad_norm": 0.08446256816387177,
"learning_rate": 7.407614758194375e-05,
"loss": 0.6376953125,
"step": 25
},
{
"epoch": 1.2380952380952381,
"grad_norm": 0.10976085066795349,
"learning_rate": 7.195275521358334e-05,
"loss": 0.68212890625,
"step": 26
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.09492490440607071,
"learning_rate": 6.978440718598757e-05,
"loss": 0.75390625,
"step": 27
},
{
"epoch": 1.2857142857142856,
"eval_loss": 0.787109375,
"eval_runtime": 6.4306,
"eval_samples_per_second": 0.622,
"eval_steps_per_second": 0.156,
"step": 27
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.07493570446968079,
"learning_rate": 6.757685356832243e-05,
"loss": 0.6959228515625,
"step": 28
},
{
"epoch": 1.380952380952381,
"grad_norm": 0.08283965289592743,
"learning_rate": 6.533594839593081e-05,
"loss": 0.747314453125,
"step": 29
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.08391156792640686,
"learning_rate": 6.306763414648311e-05,
"loss": 0.807373046875,
"step": 30
},
{
"epoch": 1.4761904761904763,
"grad_norm": 0.6904768943786621,
"learning_rate": 6.07779259815948e-05,
"loss": 0.702392578125,
"step": 31
},
{
"epoch": 1.5238095238095237,
"grad_norm": 0.08848796039819717,
"learning_rate": 5.84728957956991e-05,
"loss": 0.6214599609375,
"step": 32
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.06401556730270386,
"learning_rate": 5.61586561144745e-05,
"loss": 0.6064453125,
"step": 33
},
{
"epoch": 1.619047619047619,
"grad_norm": 0.07748808711767197,
"learning_rate": 5.384134388552552e-05,
"loss": 0.7080078125,
"step": 34
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.0812332034111023,
"learning_rate": 5.152710420430091e-05,
"loss": 0.7474365234375,
"step": 35
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.0721367672085762,
"learning_rate": 4.9222074018405206e-05,
"loss": 0.63818359375,
"step": 36
},
{
"epoch": 1.7619047619047619,
"grad_norm": 0.16443495452404022,
"learning_rate": 4.693236585351691e-05,
"loss": 0.716552734375,
"step": 37
},
{
"epoch": 1.8095238095238095,
"grad_norm": 0.09385030716657639,
"learning_rate": 4.4664051604069214e-05,
"loss": 0.75634765625,
"step": 38
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.09399207681417465,
"learning_rate": 4.2423146431677585e-05,
"loss": 0.70263671875,
"step": 39
},
{
"epoch": 1.8571428571428572,
"eval_loss": 0.76708984375,
"eval_runtime": 6.4268,
"eval_samples_per_second": 0.622,
"eval_steps_per_second": 0.156,
"step": 39
},
{
"epoch": 1.9047619047619047,
"grad_norm": 0.08889850974082947,
"learning_rate": 4.021559281401244e-05,
"loss": 0.66162109375,
"step": 40
},
{
"epoch": 1.9523809523809523,
"grad_norm": 0.07356970012187958,
"learning_rate": 3.804724478641667e-05,
"loss": 0.6004638671875,
"step": 41
},
{
"epoch": 2.0,
"grad_norm": 0.08257210999727249,
"learning_rate": 3.592385241805628e-05,
"loss": 0.773681640625,
"step": 42
},
{
"epoch": 2.0476190476190474,
"grad_norm": 0.08057400584220886,
"learning_rate": 3.385104656377062e-05,
"loss": 0.76123046875,
"step": 43
},
{
"epoch": 2.0952380952380953,
"grad_norm": 0.07585829496383667,
"learning_rate": 3.183432393205763e-05,
"loss": 0.663818359375,
"step": 44
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.09801910817623138,
"learning_rate": 2.9879032508791093e-05,
"loss": 0.7042236328125,
"step": 45
},
{
"epoch": 2.1904761904761907,
"grad_norm": 0.09920642524957657,
"learning_rate": 2.799035737532344e-05,
"loss": 0.577880859375,
"step": 46
},
{
"epoch": 2.238095238095238,
"grad_norm": 0.07839144766330719,
"learning_rate": 2.6173306958582123e-05,
"loss": 0.623291015625,
"step": 47
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.09373270720243454,
"learning_rate": 2.443269974962181e-05,
"loss": 0.688720703125,
"step": 48
},
{
"epoch": 2.3333333333333335,
"grad_norm": 0.07642136514186859,
"learning_rate": 2.277315152585231e-05,
"loss": 0.6412353515625,
"step": 49
},
{
"epoch": 2.380952380952381,
"grad_norm": 0.09019405394792557,
"learning_rate": 2.1199063110826618e-05,
"loss": 0.689453125,
"step": 50
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.08128011226654053,
"learning_rate": 1.9714608704048037e-05,
"loss": 0.75537109375,
"step": 51
},
{
"epoch": 2.4285714285714284,
"eval_loss": 0.75732421875,
"eval_runtime": 6.4255,
"eval_samples_per_second": 0.623,
"eval_steps_per_second": 0.156,
"step": 51
},
{
"epoch": 2.4761904761904763,
"grad_norm": 0.09704925864934921,
"learning_rate": 1.8323724811743496e-05,
"loss": 0.6483154296875,
"step": 52
},
{
"epoch": 2.5238095238095237,
"grad_norm": 0.08347293734550476,
"learning_rate": 1.703009980795665e-05,
"loss": 0.577392578125,
"step": 53
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.07354769110679626,
"learning_rate": 1.5837164153643015e-05,
"loss": 0.568115234375,
"step": 54
},
{
"epoch": 2.619047619047619,
"grad_norm": 0.0844465047121048,
"learning_rate": 1.474808129970421e-05,
"loss": 0.66259765625,
"step": 55
},
{
"epoch": 2.6666666666666665,
"grad_norm": 0.08416235446929932,
"learning_rate": 1.3765739298084793e-05,
"loss": 0.701171875,
"step": 56
},
{
"epoch": 2.7142857142857144,
"grad_norm": 0.07910469174385071,
"learning_rate": 1.2892743143177793e-05,
"loss": 0.602294921875,
"step": 57
},
{
"epoch": 2.761904761904762,
"grad_norm": 0.08816498517990112,
"learning_rate": 1.2131407863847787e-05,
"loss": 0.6751708984375,
"step": 58
},
{
"epoch": 2.8095238095238093,
"grad_norm": 0.09950327128171921,
"learning_rate": 1.1483752384390584e-05,
"loss": 0.71337890625,
"step": 59
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.09992720931768417,
"learning_rate": 1.09514941707089e-05,
"loss": 0.6630859375,
"step": 60
},
{
"epoch": 2.9047619047619047,
"grad_norm": 0.0930309146642685,
"learning_rate": 1.0536044675901534e-05,
"loss": 0.626220703125,
"step": 61
},
{
"epoch": 2.9523809523809526,
"grad_norm": 0.07868897914886475,
"learning_rate": 1.0238505597343493e-05,
"loss": 0.572509765625,
"step": 62
},
{
"epoch": 3.0,
"grad_norm": 0.08437960594892502,
"learning_rate": 1.0059665955182628e-05,
"loss": 0.737060546875,
"step": 63
},
{
"epoch": 3.0,
"eval_loss": 0.751953125,
"eval_runtime": 6.4346,
"eval_samples_per_second": 0.622,
"eval_steps_per_second": 0.155,
"step": 63
}
],
"logging_steps": 1.0,
"max_steps": 63,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.221367681340408e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}