random_model_test / last-checkpoint /trainer_state.json
CodeIsAbstract's picture
Training in progress, step 6000, checkpoint
1423f5f verified
Raw
History Blame
12.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12,
"eval_steps": 1000,
"global_step": 6000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002,
"grad_norm": 1.2400550842285156,
"learning_rate": 7.920000000000001e-05,
"loss": 8.362694702148438,
"step": 100
},
{
"epoch": 0.004,
"grad_norm": 2.1569149494171143,
"learning_rate": 0.00015920000000000002,
"loss": 6.592593383789063,
"step": 200
},
{
"epoch": 0.006,
"grad_norm": 4.070979595184326,
"learning_rate": 0.00023920000000000001,
"loss": 6.208985595703125,
"step": 300
},
{
"epoch": 0.008,
"grad_norm": 4.392622470855713,
"learning_rate": 0.0003192,
"loss": 5.921519775390625,
"step": 400
},
{
"epoch": 0.01,
"grad_norm": 4.653286457061768,
"learning_rate": 0.0003992,
"loss": 5.658856201171875,
"step": 500
},
{
"epoch": 0.012,
"grad_norm": 2.6610119342803955,
"learning_rate": 0.00047920000000000005,
"loss": 5.450134887695312,
"step": 600
},
{
"epoch": 0.014,
"grad_norm": 2.6298203468322754,
"learning_rate": 0.0005592,
"loss": 5.260469360351562,
"step": 700
},
{
"epoch": 0.016,
"grad_norm": 1.681970238685608,
"learning_rate": 0.0006392,
"loss": 5.112535095214843,
"step": 800
},
{
"epoch": 0.018,
"grad_norm": 1.5673184394836426,
"learning_rate": 0.0007191999999999999,
"loss": 5.0076907348632815,
"step": 900
},
{
"epoch": 0.02,
"grad_norm": 1.6654455661773682,
"learning_rate": 0.0007992,
"loss": 4.9159228515625,
"step": 1000
},
{
"epoch": 0.02,
"eval_accuracy": 0.2274637964774951,
"eval_loss": 4.8702616691589355,
"eval_runtime": 5.1375,
"eval_samples_per_second": 194.646,
"eval_steps_per_second": 1.557,
"step": 1000
},
{
"epoch": 0.022,
"grad_norm": 1.3562606573104858,
"learning_rate": 0.0008792,
"loss": 4.811459045410157,
"step": 1100
},
{
"epoch": 0.024,
"grad_norm": 1.1230770349502563,
"learning_rate": 0.0009592000000000001,
"loss": 4.759424438476563,
"step": 1200
},
{
"epoch": 0.026,
"grad_norm": 0.9026045203208923,
"learning_rate": 0.0010391999999999999,
"loss": 4.691336669921875,
"step": 1300
},
{
"epoch": 0.028,
"grad_norm": 0.8914104104042053,
"learning_rate": 0.0011192,
"loss": 4.6415283203125,
"step": 1400
},
{
"epoch": 0.03,
"grad_norm": 0.8752658367156982,
"learning_rate": 0.0011992,
"loss": 4.560531311035156,
"step": 1500
},
{
"epoch": 0.032,
"grad_norm": 0.7435582280158997,
"learning_rate": 0.0012791999999999999,
"loss": 4.516304016113281,
"step": 1600
},
{
"epoch": 0.034,
"grad_norm": 0.7041499018669128,
"learning_rate": 0.0013592,
"loss": 4.48115234375,
"step": 1700
},
{
"epoch": 0.036,
"grad_norm": 0.5327283143997192,
"learning_rate": 0.0014392,
"loss": 4.429443969726562,
"step": 1800
},
{
"epoch": 0.038,
"grad_norm": 0.45207348465919495,
"learning_rate": 0.0015192,
"loss": 4.37362060546875,
"step": 1900
},
{
"epoch": 0.04,
"grad_norm": 0.5152547359466553,
"learning_rate": 0.0015992,
"loss": 4.377236938476562,
"step": 2000
},
{
"epoch": 0.04,
"eval_accuracy": 0.2694227005870842,
"eval_loss": 4.3582682609558105,
"eval_runtime": 5.3878,
"eval_samples_per_second": 185.606,
"eval_steps_per_second": 1.485,
"step": 2000
},
{
"epoch": 0.042,
"grad_norm": 0.45765218138694763,
"learning_rate": 0.0016792,
"loss": 4.341053161621094,
"step": 2100
},
{
"epoch": 0.044,
"grad_norm": 0.3776390254497528,
"learning_rate": 0.0017592,
"loss": 4.304255676269531,
"step": 2200
},
{
"epoch": 0.046,
"grad_norm": 0.48194995522499084,
"learning_rate": 0.0018392,
"loss": 4.308780822753906,
"step": 2300
},
{
"epoch": 0.048,
"grad_norm": 0.40603286027908325,
"learning_rate": 0.0019192,
"loss": 4.272806396484375,
"step": 2400
},
{
"epoch": 0.05,
"grad_norm": 0.41386568546295166,
"learning_rate": 0.0019992,
"loss": 4.267073974609375,
"step": 2500
},
{
"epoch": 0.052,
"grad_norm": 0.4916844666004181,
"learning_rate": 0.001999978563623903,
"loss": 4.220490417480469,
"step": 2600
},
{
"epoch": 0.054,
"grad_norm": 0.37477609515190125,
"learning_rate": 0.0019999133871331223,
"loss": 4.224794006347656,
"step": 2700
},
{
"epoch": 0.056,
"grad_norm": 0.405086874961853,
"learning_rate": 0.0019998044711915177,
"loss": 4.185610961914063,
"step": 2800
},
{
"epoch": 0.058,
"grad_norm": 0.334581196308136,
"learning_rate": 0.0019996518205634257,
"loss": 4.165193176269531,
"step": 2900
},
{
"epoch": 0.06,
"grad_norm": 0.3760662376880646,
"learning_rate": 0.0019994554419262797,
"loss": 4.161107177734375,
"step": 3000
},
{
"epoch": 0.06,
"eval_accuracy": 0.28686888454011744,
"eval_loss": 4.15764856338501,
"eval_runtime": 5.1036,
"eval_samples_per_second": 195.938,
"eval_steps_per_second": 1.568,
"step": 3000
},
{
"epoch": 0.062,
"grad_norm": 0.38909581303596497,
"learning_rate": 0.001999215343870317,
"loss": 4.1489105224609375,
"step": 3100
},
{
"epoch": 0.064,
"grad_norm": 0.4108506143093109,
"learning_rate": 0.0019989315368982054,
"loss": 4.123897705078125,
"step": 3200
},
{
"epoch": 0.066,
"grad_norm": 0.27484413981437683,
"learning_rate": 0.0019986040334245797,
"loss": 4.101358032226562,
"step": 3300
},
{
"epoch": 0.068,
"grad_norm": 0.29958581924438477,
"learning_rate": 0.001998232847775504,
"loss": 4.10423583984375,
"step": 3400
},
{
"epoch": 0.07,
"grad_norm": 0.29483968019485474,
"learning_rate": 0.0019978179961878404,
"loss": 4.078011169433593,
"step": 3500
},
{
"epoch": 0.072,
"grad_norm": 0.36317598819732666,
"learning_rate": 0.001997359496808541,
"loss": 4.076428527832031,
"step": 3600
},
{
"epoch": 0.074,
"grad_norm": 0.34998658299446106,
"learning_rate": 0.001996857369693855,
"loss": 4.052371826171875,
"step": 3700
},
{
"epoch": 0.076,
"grad_norm": 0.31070172786712646,
"learning_rate": 0.0019963116368084486,
"loss": 4.059148559570312,
"step": 3800
},
{
"epoch": 0.078,
"grad_norm": 0.2655385732650757,
"learning_rate": 0.001995722322024446,
"loss": 4.039622802734375,
"step": 3900
},
{
"epoch": 0.08,
"grad_norm": 0.4650065302848816,
"learning_rate": 0.001995089451120385,
"loss": 4.011789855957031,
"step": 4000
},
{
"epoch": 0.08,
"eval_accuracy": 0.29829745596868884,
"eval_loss": 4.0341691970825195,
"eval_runtime": 5.1511,
"eval_samples_per_second": 194.133,
"eval_steps_per_second": 1.553,
"step": 4000
},
{
"epoch": 0.082,
"grad_norm": 0.43114492297172546,
"learning_rate": 0.0019944130517800893,
"loss": 4.0238558959960935,
"step": 4100
},
{
"epoch": 0.084,
"grad_norm": 0.26026225090026855,
"learning_rate": 0.001993693153591457,
"loss": 4.017567443847656,
"step": 4200
},
{
"epoch": 0.086,
"grad_norm": 0.23712828755378723,
"learning_rate": 0.0019929297880451674,
"loss": 3.9972265625,
"step": 4300
},
{
"epoch": 0.088,
"grad_norm": 0.44415482878685,
"learning_rate": 0.0019921229885333023,
"loss": 3.9874578857421876,
"step": 4400
},
{
"epoch": 0.09,
"grad_norm": 0.27471208572387695,
"learning_rate": 0.001991272790347886,
"loss": 3.998799133300781,
"step": 4500
},
{
"epoch": 0.092,
"grad_norm": 0.2248983383178711,
"learning_rate": 0.0019903792306793415,
"loss": 3.9638967895507813,
"step": 4600
},
{
"epoch": 0.094,
"grad_norm": 0.36029258370399475,
"learning_rate": 0.001989442348614863,
"loss": 3.972870178222656,
"step": 4700
},
{
"epoch": 0.096,
"grad_norm": 0.26471713185310364,
"learning_rate": 0.0019884621851367075,
"loss": 3.959658508300781,
"step": 4800
},
{
"epoch": 0.098,
"grad_norm": 0.23001010715961456,
"learning_rate": 0.001987438783120401,
"loss": 3.9595660400390624,
"step": 4900
},
{
"epoch": 0.1,
"grad_norm": 0.23091939091682434,
"learning_rate": 0.001986372187332862,
"loss": 3.9660198974609373,
"step": 5000
},
{
"epoch": 0.1,
"eval_accuracy": 0.3069041095890411,
"eval_loss": 3.95263409614563,
"eval_runtime": 5.269,
"eval_samples_per_second": 189.788,
"eval_steps_per_second": 1.518,
"step": 5000
},
{
"epoch": 0.102,
"grad_norm": 0.28329843282699585,
"learning_rate": 0.0019852624444304467,
"loss": 3.9279766845703126,
"step": 5100
},
{
"epoch": 0.104,
"grad_norm": 0.4390493333339691,
"learning_rate": 0.0019841096029569044,
"loss": 3.940526123046875,
"step": 5200
},
{
"epoch": 0.106,
"grad_norm": 0.22625097632408142,
"learning_rate": 0.0019829137133412556,
"loss": 3.9342303466796875,
"step": 5300
},
{
"epoch": 0.108,
"grad_norm": 0.21681281924247742,
"learning_rate": 0.001981674827895587,
"loss": 3.9172735595703125,
"step": 5400
},
{
"epoch": 0.11,
"grad_norm": 0.3054690957069397,
"learning_rate": 0.00198039300081276,
"loss": 3.920041198730469,
"step": 5500
},
{
"epoch": 0.112,
"grad_norm": 0.24492567777633667,
"learning_rate": 0.0019790682881640448,
"loss": 3.918515319824219,
"step": 5600
},
{
"epoch": 0.114,
"grad_norm": 0.20615942776203156,
"learning_rate": 0.001977700747896664,
"loss": 3.902435302734375,
"step": 5700
},
{
"epoch": 0.116,
"grad_norm": 0.2998456358909607,
"learning_rate": 0.001976290439831259,
"loss": 3.9016647338867188,
"step": 5800
},
{
"epoch": 0.118,
"grad_norm": 0.22004957497119904,
"learning_rate": 0.0019748374256592736,
"loss": 3.897244567871094,
"step": 5900
},
{
"epoch": 0.12,
"grad_norm": 0.2709659934043884,
"learning_rate": 0.0019733417689402543,
"loss": 3.892081604003906,
"step": 6000
},
{
"epoch": 0.12,
"eval_accuracy": 0.31208414872798435,
"eval_loss": 3.8932552337646484,
"eval_runtime": 5.3089,
"eval_samples_per_second": 188.362,
"eval_steps_per_second": 1.507,
"step": 6000
}
],
"logging_steps": 100,
"max_steps": 50000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 2000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 128,
"trial_name": null,
"trial_params": null
}