vitaleantonio's picture
Upload checkpoint DeepSeek-Coder-CONTROL-MCEVALHARD-1.3B-Base-5 at epoch 5
2beb7d1 verified
Raw
History Blame Contribute Delete
13.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 360,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.070298769771529,
"grad_norm": 0.041015625,
"learning_rate": 4.972222222222223e-05,
"loss": 0.6872987270355224,
"step": 5
},
{
"epoch": 0.140597539543058,
"grad_norm": 0.036376953125,
"learning_rate": 4.937500000000001e-05,
"loss": 0.6830456733703614,
"step": 10
},
{
"epoch": 0.210896309314587,
"grad_norm": 0.038330078125,
"learning_rate": 4.902777777777778e-05,
"loss": 0.7479233264923095,
"step": 15
},
{
"epoch": 0.281195079086116,
"grad_norm": 0.0380859375,
"learning_rate": 4.8680555555555554e-05,
"loss": 0.7160741329193115,
"step": 20
},
{
"epoch": 0.351493848857645,
"grad_norm": 0.03955078125,
"learning_rate": 4.8333333333333334e-05,
"loss": 0.6858582973480225,
"step": 25
},
{
"epoch": 0.421792618629174,
"grad_norm": 0.038818359375,
"learning_rate": 4.7986111111111113e-05,
"loss": 0.6775042533874511,
"step": 30
},
{
"epoch": 0.492091388400703,
"grad_norm": 0.03271484375,
"learning_rate": 4.7638888888888887e-05,
"loss": 0.6517538070678711,
"step": 35
},
{
"epoch": 0.562390158172232,
"grad_norm": 0.039306640625,
"learning_rate": 4.7291666666666666e-05,
"loss": 0.7560918807983399,
"step": 40
},
{
"epoch": 0.632688927943761,
"grad_norm": 0.037109375,
"learning_rate": 4.6944444444444446e-05,
"loss": 0.7019021511077881,
"step": 45
},
{
"epoch": 0.70298769771529,
"grad_norm": 0.03369140625,
"learning_rate": 4.6597222222222226e-05,
"loss": 0.6687473297119141,
"step": 50
},
{
"epoch": 0.773286467486819,
"grad_norm": 0.03369140625,
"learning_rate": 4.6250000000000006e-05,
"loss": 0.6842537879943847,
"step": 55
},
{
"epoch": 0.843585237258348,
"grad_norm": 0.03173828125,
"learning_rate": 4.590277777777778e-05,
"loss": 0.6241245269775391,
"step": 60
},
{
"epoch": 0.9138840070298769,
"grad_norm": 0.038818359375,
"learning_rate": 4.555555555555556e-05,
"loss": 0.6967287063598633,
"step": 65
},
{
"epoch": 0.984182776801406,
"grad_norm": 0.036376953125,
"learning_rate": 4.520833333333334e-05,
"loss": 0.6635632038116455,
"step": 70
},
{
"epoch": 1.0421792618629173,
"grad_norm": 0.032958984375,
"learning_rate": 4.486111111111111e-05,
"loss": 0.6175796985626221,
"step": 75
},
{
"epoch": 1.1124780316344465,
"grad_norm": 0.033203125,
"learning_rate": 4.4513888888888885e-05,
"loss": 0.5492826938629151,
"step": 80
},
{
"epoch": 1.1827768014059754,
"grad_norm": 0.047119140625,
"learning_rate": 4.4166666666666665e-05,
"loss": 0.5715642452239991,
"step": 85
},
{
"epoch": 1.2530755711775043,
"grad_norm": 0.03857421875,
"learning_rate": 4.3819444444444445e-05,
"loss": 0.6231389522552491,
"step": 90
},
{
"epoch": 1.3233743409490333,
"grad_norm": 0.040283203125,
"learning_rate": 4.3472222222222225e-05,
"loss": 0.5583981513977051,
"step": 95
},
{
"epoch": 1.3936731107205624,
"grad_norm": 0.04736328125,
"learning_rate": 4.3125000000000005e-05,
"loss": 0.5893191814422607,
"step": 100
},
{
"epoch": 1.4639718804920914,
"grad_norm": 0.041015625,
"learning_rate": 4.277777777777778e-05,
"loss": 0.5815530776977539,
"step": 105
},
{
"epoch": 1.5342706502636205,
"grad_norm": 0.0361328125,
"learning_rate": 4.243055555555556e-05,
"loss": 0.5973546504974365,
"step": 110
},
{
"epoch": 1.6045694200351495,
"grad_norm": 0.041259765625,
"learning_rate": 4.208333333333334e-05,
"loss": 0.5985394954681397,
"step": 115
},
{
"epoch": 1.6748681898066784,
"grad_norm": 0.0311279296875,
"learning_rate": 4.173611111111112e-05,
"loss": 0.5578798294067383,
"step": 120
},
{
"epoch": 1.7451669595782073,
"grad_norm": 0.036376953125,
"learning_rate": 4.138888888888889e-05,
"loss": 0.5978553295135498,
"step": 125
},
{
"epoch": 1.8154657293497363,
"grad_norm": 0.041748046875,
"learning_rate": 4.104166666666667e-05,
"loss": 0.6134780406951904,
"step": 130
},
{
"epoch": 1.8857644991212654,
"grad_norm": 0.041748046875,
"learning_rate": 4.0694444444444444e-05,
"loss": 0.5452652454376221,
"step": 135
},
{
"epoch": 1.9560632688927944,
"grad_norm": 0.03759765625,
"learning_rate": 4.0347222222222223e-05,
"loss": 0.5957761287689209,
"step": 140
},
{
"epoch": 2.0140597539543057,
"grad_norm": 0.04248046875,
"learning_rate": 4e-05,
"loss": 0.5168804168701172,
"step": 145
},
{
"epoch": 2.0843585237258346,
"grad_norm": 0.037353515625,
"learning_rate": 3.9652777777777776e-05,
"loss": 0.5173678398132324,
"step": 150
},
{
"epoch": 2.1546572934973636,
"grad_norm": 0.049072265625,
"learning_rate": 3.9305555555555556e-05,
"loss": 0.4964570999145508,
"step": 155
},
{
"epoch": 2.224956063268893,
"grad_norm": 0.03759765625,
"learning_rate": 3.8958333333333336e-05,
"loss": 0.5181522846221924,
"step": 160
},
{
"epoch": 2.295254833040422,
"grad_norm": 0.040283203125,
"learning_rate": 3.8611111111111116e-05,
"loss": 0.5013093948364258,
"step": 165
},
{
"epoch": 2.365553602811951,
"grad_norm": 0.042236328125,
"learning_rate": 3.826388888888889e-05,
"loss": 0.4920492649078369,
"step": 170
},
{
"epoch": 2.4358523725834798,
"grad_norm": 0.04638671875,
"learning_rate": 3.791666666666667e-05,
"loss": 0.5080994129180908,
"step": 175
},
{
"epoch": 2.5061511423550087,
"grad_norm": 0.052001953125,
"learning_rate": 3.756944444444445e-05,
"loss": 0.4756940364837646,
"step": 180
},
{
"epoch": 2.5764499121265376,
"grad_norm": 0.03662109375,
"learning_rate": 3.722222222222222e-05,
"loss": 0.5371941566467285,
"step": 185
},
{
"epoch": 2.6467486818980666,
"grad_norm": 0.0439453125,
"learning_rate": 3.6875e-05,
"loss": 0.5158291816711426,
"step": 190
},
{
"epoch": 2.717047451669596,
"grad_norm": 0.04150390625,
"learning_rate": 3.6527777777777775e-05,
"loss": 0.4983774185180664,
"step": 195
},
{
"epoch": 2.787346221441125,
"grad_norm": 0.039794921875,
"learning_rate": 3.6180555555555555e-05,
"loss": 0.4556784152984619,
"step": 200
},
{
"epoch": 2.857644991212654,
"grad_norm": 0.048828125,
"learning_rate": 3.5833333333333335e-05,
"loss": 0.5201966762542725,
"step": 205
},
{
"epoch": 2.9279437609841827,
"grad_norm": 0.047607421875,
"learning_rate": 3.5486111111111115e-05,
"loss": 0.5155319690704345,
"step": 210
},
{
"epoch": 2.9982425307557117,
"grad_norm": 0.043212890625,
"learning_rate": 3.513888888888889e-05,
"loss": 0.5122783660888672,
"step": 215
},
{
"epoch": 3.0562390158172232,
"grad_norm": 0.055419921875,
"learning_rate": 3.479166666666667e-05,
"loss": 0.4267068386077881,
"step": 220
},
{
"epoch": 3.126537785588752,
"grad_norm": 0.047119140625,
"learning_rate": 3.444444444444445e-05,
"loss": 0.412123966217041,
"step": 225
},
{
"epoch": 3.196836555360281,
"grad_norm": 0.045654296875,
"learning_rate": 3.409722222222223e-05,
"loss": 0.4540102958679199,
"step": 230
},
{
"epoch": 3.26713532513181,
"grad_norm": 0.04443359375,
"learning_rate": 3.375000000000001e-05,
"loss": 0.42369518280029295,
"step": 235
},
{
"epoch": 3.3374340949033394,
"grad_norm": 0.04833984375,
"learning_rate": 3.340277777777778e-05,
"loss": 0.4314465045928955,
"step": 240
},
{
"epoch": 3.4077328646748684,
"grad_norm": 0.046142578125,
"learning_rate": 3.3055555555555553e-05,
"loss": 0.38359851837158204,
"step": 245
},
{
"epoch": 3.4780316344463973,
"grad_norm": 0.05712890625,
"learning_rate": 3.270833333333333e-05,
"loss": 0.45005264282226565,
"step": 250
},
{
"epoch": 3.5483304042179262,
"grad_norm": 0.046142578125,
"learning_rate": 3.236111111111111e-05,
"loss": 0.4752476692199707,
"step": 255
},
{
"epoch": 3.618629173989455,
"grad_norm": 0.060546875,
"learning_rate": 3.2013888888888886e-05,
"loss": 0.3875174045562744,
"step": 260
},
{
"epoch": 3.688927943760984,
"grad_norm": 0.0546875,
"learning_rate": 3.1666666666666666e-05,
"loss": 0.40928921699523924,
"step": 265
},
{
"epoch": 3.759226713532513,
"grad_norm": 0.044189453125,
"learning_rate": 3.1319444444444446e-05,
"loss": 0.4359605312347412,
"step": 270
},
{
"epoch": 3.8295254833040424,
"grad_norm": 0.044921875,
"learning_rate": 3.0972222222222226e-05,
"loss": 0.3749080657958984,
"step": 275
},
{
"epoch": 3.899824253075571,
"grad_norm": 0.04443359375,
"learning_rate": 3.0625000000000006e-05,
"loss": 0.47571258544921874,
"step": 280
},
{
"epoch": 3.9701230228471003,
"grad_norm": 0.052734375,
"learning_rate": 3.0277777777777776e-05,
"loss": 0.4136314868927002,
"step": 285
},
{
"epoch": 4.028119507908611,
"grad_norm": 0.068359375,
"learning_rate": 2.9930555555555555e-05,
"loss": 0.38009254932403563,
"step": 290
},
{
"epoch": 4.098418277680141,
"grad_norm": 0.053466796875,
"learning_rate": 2.9583333333333335e-05,
"loss": 0.3919001817703247,
"step": 295
},
{
"epoch": 4.168717047451669,
"grad_norm": 0.051513671875,
"learning_rate": 2.9236111111111115e-05,
"loss": 0.3375861167907715,
"step": 300
},
{
"epoch": 4.239015817223199,
"grad_norm": 0.049560546875,
"learning_rate": 2.8888888888888888e-05,
"loss": 0.34033329486846925,
"step": 305
},
{
"epoch": 4.309314586994727,
"grad_norm": 0.0537109375,
"learning_rate": 2.8541666666666668e-05,
"loss": 0.38448970317840575,
"step": 310
},
{
"epoch": 4.3796133567662565,
"grad_norm": 0.05810546875,
"learning_rate": 2.8194444444444445e-05,
"loss": 0.3189067840576172,
"step": 315
},
{
"epoch": 4.449912126537786,
"grad_norm": 0.0537109375,
"learning_rate": 2.7847222222222224e-05,
"loss": 0.31183125972747805,
"step": 320
},
{
"epoch": 4.520210896309314,
"grad_norm": 0.053466796875,
"learning_rate": 2.7500000000000004e-05,
"loss": 0.36228208541870116,
"step": 325
},
{
"epoch": 4.590509666080844,
"grad_norm": 0.07275390625,
"learning_rate": 2.7152777777777777e-05,
"loss": 0.3445222616195679,
"step": 330
},
{
"epoch": 4.660808435852372,
"grad_norm": 0.064453125,
"learning_rate": 2.6805555555555557e-05,
"loss": 0.3464776039123535,
"step": 335
},
{
"epoch": 4.731107205623902,
"grad_norm": 0.06005859375,
"learning_rate": 2.6458333333333334e-05,
"loss": 0.36103522777557373,
"step": 340
},
{
"epoch": 4.801405975395431,
"grad_norm": 0.04443359375,
"learning_rate": 2.6111111111111114e-05,
"loss": 0.35750935077667234,
"step": 345
},
{
"epoch": 4.8717047451669595,
"grad_norm": 0.0751953125,
"learning_rate": 2.5763888888888887e-05,
"loss": 0.37065398693084717,
"step": 350
},
{
"epoch": 4.942003514938489,
"grad_norm": 0.04736328125,
"learning_rate": 2.5416666666666667e-05,
"loss": 0.3531635284423828,
"step": 355
},
{
"epoch": 5.0,
"grad_norm": 0.0869140625,
"learning_rate": 2.5069444444444447e-05,
"loss": 0.3129526853561401,
"step": 360
}
],
"logging_steps": 5,
"max_steps": 720,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.78970818510848e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}