FormlessAI's picture
Upload folder using huggingface_hub
31b3e8d verified
Raw
History Blame Contribute Delete
20.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.0004804814424052901,
"eval_steps": 6,
"global_step": 60,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 8.008024040088168e-06,
"grad_norm": 282.1022644042969,
"learning_rate": 0.0,
"loss": 7.5794,
"num_input_tokens_seen": 406,
"step": 1,
"train_runtime": 5.5308,
"train_tokens_per_second": 73.407
},
{
"epoch": 1.6016048080176336e-05,
"grad_norm": 367.8074645996094,
"learning_rate": 4.000000000000001e-06,
"loss": 7.2589,
"num_input_tokens_seen": 798,
"step": 2,
"train_runtime": 6.2015,
"train_tokens_per_second": 128.678
},
{
"epoch": 2.4024072120264505e-05,
"grad_norm": 183.4268035888672,
"learning_rate": 8.000000000000001e-06,
"loss": 7.2901,
"num_input_tokens_seen": 1236,
"step": 3,
"train_runtime": 6.8675,
"train_tokens_per_second": 179.978
},
{
"epoch": 3.203209616035267e-05,
"grad_norm": 157.8712158203125,
"learning_rate": 1.2e-05,
"loss": 4.8904,
"num_input_tokens_seen": 1676,
"step": 4,
"train_runtime": 7.5348,
"train_tokens_per_second": 222.434
},
{
"epoch": 4.0040120200440844e-05,
"grad_norm": 153.35537719726562,
"learning_rate": 1.6000000000000003e-05,
"loss": 4.4882,
"num_input_tokens_seen": 2068,
"step": 5,
"train_runtime": 8.1988,
"train_tokens_per_second": 252.231
},
{
"epoch": 4.804814424052901e-05,
"grad_norm": 154.29891967773438,
"learning_rate": 2e-05,
"loss": 4.2164,
"num_input_tokens_seen": 2496,
"step": 6,
"train_runtime": 8.8628,
"train_tokens_per_second": 281.628
},
{
"epoch": 4.804814424052901e-05,
"eval_loss": 3.4333748817443848,
"eval_runtime": 17.1905,
"eval_samples_per_second": 58.172,
"eval_steps_per_second": 29.086,
"num_input_tokens_seen": 2496,
"step": 6
},
{
"epoch": 5.605616828061718e-05,
"grad_norm": 43.233089447021484,
"learning_rate": 1.963636363636364e-05,
"loss": 2.0546,
"num_input_tokens_seen": 3238,
"step": 7,
"train_runtime": 26.7603,
"train_tokens_per_second": 121.0
},
{
"epoch": 6.406419232070534e-05,
"grad_norm": 41.88556671142578,
"learning_rate": 1.9272727272727275e-05,
"loss": 2.372,
"num_input_tokens_seen": 3828,
"step": 8,
"train_runtime": 27.4263,
"train_tokens_per_second": 139.574
},
{
"epoch": 7.207221636079351e-05,
"grad_norm": 48.73846435546875,
"learning_rate": 1.8909090909090912e-05,
"loss": 2.7182,
"num_input_tokens_seen": 4280,
"step": 9,
"train_runtime": 28.0921,
"train_tokens_per_second": 152.356
},
{
"epoch": 8.008024040088169e-05,
"grad_norm": 46.16472244262695,
"learning_rate": 1.8545454545454545e-05,
"loss": 2.7735,
"num_input_tokens_seen": 4702,
"step": 10,
"train_runtime": 28.7563,
"train_tokens_per_second": 163.512
},
{
"epoch": 8.808826444096985e-05,
"grad_norm": 25.96290397644043,
"learning_rate": 1.8181818181818182e-05,
"loss": 1.8736,
"num_input_tokens_seen": 5366,
"step": 11,
"train_runtime": 29.4216,
"train_tokens_per_second": 182.383
},
{
"epoch": 9.609628848105802e-05,
"grad_norm": 35.26546096801758,
"learning_rate": 1.781818181818182e-05,
"loss": 2.4054,
"num_input_tokens_seen": 5898,
"step": 12,
"train_runtime": 30.0864,
"train_tokens_per_second": 196.036
},
{
"epoch": 9.609628848105802e-05,
"eval_loss": 2.551903486251831,
"eval_runtime": 16.1332,
"eval_samples_per_second": 61.984,
"eval_steps_per_second": 30.992,
"num_input_tokens_seen": 5898,
"step": 12
},
{
"epoch": 0.00010410431252114619,
"grad_norm": 45.30570983886719,
"learning_rate": 1.7454545454545456e-05,
"loss": 2.6956,
"num_input_tokens_seen": 6368,
"step": 13,
"train_runtime": 46.917,
"train_tokens_per_second": 135.729
},
{
"epoch": 0.00011211233656123435,
"grad_norm": 25.79911231994629,
"learning_rate": 1.7090909090909092e-05,
"loss": 1.9536,
"num_input_tokens_seen": 7166,
"step": 14,
"train_runtime": 47.6787,
"train_tokens_per_second": 150.298
},
{
"epoch": 0.00012012036060132252,
"grad_norm": 35.28297805786133,
"learning_rate": 1.672727272727273e-05,
"loss": 1.8325,
"num_input_tokens_seen": 7580,
"step": 15,
"train_runtime": 48.3409,
"train_tokens_per_second": 156.803
},
{
"epoch": 0.00012812838464141069,
"grad_norm": 33.03861618041992,
"learning_rate": 1.6363636363636366e-05,
"loss": 2.3691,
"num_input_tokens_seen": 8078,
"step": 16,
"train_runtime": 49.006,
"train_tokens_per_second": 164.837
},
{
"epoch": 0.00013613640868149885,
"grad_norm": 45.185157775878906,
"learning_rate": 1.6000000000000003e-05,
"loss": 2.3737,
"num_input_tokens_seen": 8448,
"step": 17,
"train_runtime": 49.6695,
"train_tokens_per_second": 170.084
},
{
"epoch": 0.00014414443272158702,
"grad_norm": 31.473684310913086,
"learning_rate": 1.563636363636364e-05,
"loss": 2.427,
"num_input_tokens_seen": 8936,
"step": 18,
"train_runtime": 50.3334,
"train_tokens_per_second": 177.536
},
{
"epoch": 0.00014414443272158702,
"eval_loss": 2.4002556800842285,
"eval_runtime": 15.9406,
"eval_samples_per_second": 62.733,
"eval_steps_per_second": 31.366,
"num_input_tokens_seen": 8936,
"step": 18
},
{
"epoch": 0.0001521524567616752,
"grad_norm": 33.58867263793945,
"learning_rate": 1.5272727272727276e-05,
"loss": 2.1379,
"num_input_tokens_seen": 9360,
"step": 19,
"train_runtime": 66.9757,
"train_tokens_per_second": 139.752
},
{
"epoch": 0.00016016048080176338,
"grad_norm": 33.38470458984375,
"learning_rate": 1.4909090909090911e-05,
"loss": 2.8262,
"num_input_tokens_seen": 9786,
"step": 20,
"train_runtime": 67.641,
"train_tokens_per_second": 144.676
},
{
"epoch": 0.00016816850484185154,
"grad_norm": 33.72075271606445,
"learning_rate": 1.4545454545454546e-05,
"loss": 2.515,
"num_input_tokens_seen": 10198,
"step": 21,
"train_runtime": 68.304,
"train_tokens_per_second": 149.303
},
{
"epoch": 0.0001761765288819397,
"grad_norm": 35.71574401855469,
"learning_rate": 1.4181818181818183e-05,
"loss": 2.4477,
"num_input_tokens_seen": 10644,
"step": 22,
"train_runtime": 68.9749,
"train_tokens_per_second": 154.317
},
{
"epoch": 0.00018418455292202788,
"grad_norm": 33.68728256225586,
"learning_rate": 1.381818181818182e-05,
"loss": 2.4155,
"num_input_tokens_seen": 11096,
"step": 23,
"train_runtime": 69.64,
"train_tokens_per_second": 159.334
},
{
"epoch": 0.00019219257696211604,
"grad_norm": 35.62799072265625,
"learning_rate": 1.3454545454545455e-05,
"loss": 2.4388,
"num_input_tokens_seen": 11546,
"step": 24,
"train_runtime": 70.3069,
"train_tokens_per_second": 164.223
},
{
"epoch": 0.00019219257696211604,
"eval_loss": 2.3586089611053467,
"eval_runtime": 15.9544,
"eval_samples_per_second": 62.679,
"eval_steps_per_second": 31.339,
"num_input_tokens_seen": 11546,
"step": 24
},
{
"epoch": 0.0002002006010022042,
"grad_norm": 33.08585739135742,
"learning_rate": 1.3090909090909092e-05,
"loss": 2.0016,
"num_input_tokens_seen": 12020,
"step": 25,
"train_runtime": 86.9671,
"train_tokens_per_second": 138.213
},
{
"epoch": 0.00020820862504229237,
"grad_norm": 37.98166275024414,
"learning_rate": 1.2727272727272728e-05,
"loss": 2.5803,
"num_input_tokens_seen": 12430,
"step": 26,
"train_runtime": 87.6331,
"train_tokens_per_second": 141.841
},
{
"epoch": 0.00021621664908238054,
"grad_norm": 36.4505729675293,
"learning_rate": 1.2363636363636364e-05,
"loss": 3.0606,
"num_input_tokens_seen": 12860,
"step": 27,
"train_runtime": 88.295,
"train_tokens_per_second": 145.648
},
{
"epoch": 0.0002242246731224687,
"grad_norm": 34.81946563720703,
"learning_rate": 1.2e-05,
"loss": 1.7622,
"num_input_tokens_seen": 13302,
"step": 28,
"train_runtime": 88.9585,
"train_tokens_per_second": 149.53
},
{
"epoch": 0.00023223269716255687,
"grad_norm": 31.250852584838867,
"learning_rate": 1.1636363636363637e-05,
"loss": 2.3633,
"num_input_tokens_seen": 13796,
"step": 29,
"train_runtime": 89.6239,
"train_tokens_per_second": 153.932
},
{
"epoch": 0.00024024072120264504,
"grad_norm": 32.98413848876953,
"learning_rate": 1.1272727272727272e-05,
"loss": 2.5788,
"num_input_tokens_seen": 14286,
"step": 30,
"train_runtime": 90.2907,
"train_tokens_per_second": 158.222
},
{
"epoch": 0.00024024072120264504,
"eval_loss": 2.321453332901001,
"eval_runtime": 15.9524,
"eval_samples_per_second": 62.686,
"eval_steps_per_second": 31.343,
"num_input_tokens_seen": 14286,
"step": 30
},
{
"epoch": 0.0002482487452427332,
"grad_norm": 36.93943405151367,
"learning_rate": 1.0909090909090909e-05,
"loss": 2.5933,
"num_input_tokens_seen": 14690,
"step": 31,
"train_runtime": 125.5173,
"train_tokens_per_second": 117.036
},
{
"epoch": 0.00025625676928282137,
"grad_norm": 29.403127670288086,
"learning_rate": 1.0545454545454546e-05,
"loss": 1.8715,
"num_input_tokens_seen": 15182,
"step": 32,
"train_runtime": 126.1813,
"train_tokens_per_second": 120.319
},
{
"epoch": 0.00026426479332290954,
"grad_norm": 26.887046813964844,
"learning_rate": 1.0181818181818182e-05,
"loss": 2.3258,
"num_input_tokens_seen": 15742,
"step": 33,
"train_runtime": 126.8482,
"train_tokens_per_second": 124.101
},
{
"epoch": 0.0002722728173629977,
"grad_norm": 35.79985046386719,
"learning_rate": 9.81818181818182e-06,
"loss": 2.6422,
"num_input_tokens_seen": 16170,
"step": 34,
"train_runtime": 127.5112,
"train_tokens_per_second": 126.812
},
{
"epoch": 0.00028028084140308587,
"grad_norm": 29.967466354370117,
"learning_rate": 9.454545454545456e-06,
"loss": 2.1683,
"num_input_tokens_seen": 16602,
"step": 35,
"train_runtime": 128.1746,
"train_tokens_per_second": 129.526
},
{
"epoch": 0.00028828886544317404,
"grad_norm": 23.023691177368164,
"learning_rate": 9.090909090909091e-06,
"loss": 2.2433,
"num_input_tokens_seen": 17328,
"step": 36,
"train_runtime": 128.8377,
"train_tokens_per_second": 134.495
},
{
"epoch": 0.00028828886544317404,
"eval_loss": 2.3060390949249268,
"eval_runtime": 15.9837,
"eval_samples_per_second": 62.564,
"eval_steps_per_second": 31.282,
"num_input_tokens_seen": 17328,
"step": 36
},
{
"epoch": 0.0002962968894832622,
"grad_norm": 36.571800231933594,
"learning_rate": 8.727272727272728e-06,
"loss": 2.2402,
"num_input_tokens_seen": 17764,
"step": 37,
"train_runtime": 145.5214,
"train_tokens_per_second": 122.071
},
{
"epoch": 0.0003043049135233504,
"grad_norm": 33.204383850097656,
"learning_rate": 8.363636363636365e-06,
"loss": 2.469,
"num_input_tokens_seen": 18190,
"step": 38,
"train_runtime": 146.1828,
"train_tokens_per_second": 124.433
},
{
"epoch": 0.0003123129375634386,
"grad_norm": 42.04680252075195,
"learning_rate": 8.000000000000001e-06,
"loss": 2.7519,
"num_input_tokens_seen": 18618,
"step": 39,
"train_runtime": 146.8516,
"train_tokens_per_second": 126.781
},
{
"epoch": 0.00032032096160352676,
"grad_norm": 30.66261100769043,
"learning_rate": 7.636363636363638e-06,
"loss": 2.5034,
"num_input_tokens_seen": 19024,
"step": 40,
"train_runtime": 147.5219,
"train_tokens_per_second": 128.957
},
{
"epoch": 0.0003283289856436149,
"grad_norm": 30.992774963378906,
"learning_rate": 7.272727272727273e-06,
"loss": 1.8883,
"num_input_tokens_seen": 19492,
"step": 41,
"train_runtime": 148.1868,
"train_tokens_per_second": 131.537
},
{
"epoch": 0.0003363370096837031,
"grad_norm": 33.176795959472656,
"learning_rate": 6.90909090909091e-06,
"loss": 2.329,
"num_input_tokens_seen": 19906,
"step": 42,
"train_runtime": 148.8521,
"train_tokens_per_second": 133.73
},
{
"epoch": 0.0003363370096837031,
"eval_loss": 2.2987871170043945,
"eval_runtime": 15.9526,
"eval_samples_per_second": 62.686,
"eval_steps_per_second": 31.343,
"num_input_tokens_seen": 19906,
"step": 42
},
{
"epoch": 0.00034434503372379125,
"grad_norm": 36.44293975830078,
"learning_rate": 6.545454545454546e-06,
"loss": 2.4833,
"num_input_tokens_seen": 20328,
"step": 43,
"train_runtime": 165.5052,
"train_tokens_per_second": 122.824
},
{
"epoch": 0.0003523530577638794,
"grad_norm": 32.9749870300293,
"learning_rate": 6.181818181818182e-06,
"loss": 2.1394,
"num_input_tokens_seen": 20756,
"step": 44,
"train_runtime": 166.1716,
"train_tokens_per_second": 124.907
},
{
"epoch": 0.0003603610818039676,
"grad_norm": 28.772348403930664,
"learning_rate": 5.8181818181818185e-06,
"loss": 2.0539,
"num_input_tokens_seen": 21202,
"step": 45,
"train_runtime": 166.8343,
"train_tokens_per_second": 127.084
},
{
"epoch": 0.00036836910584405575,
"grad_norm": 28.623464584350586,
"learning_rate": 5.4545454545454545e-06,
"loss": 2.2397,
"num_input_tokens_seen": 21836,
"step": 46,
"train_runtime": 167.5037,
"train_tokens_per_second": 130.361
},
{
"epoch": 0.0003763771298841439,
"grad_norm": 24.052433013916016,
"learning_rate": 5.090909090909091e-06,
"loss": 2.3161,
"num_input_tokens_seen": 22416,
"step": 47,
"train_runtime": 168.1683,
"train_tokens_per_second": 133.295
},
{
"epoch": 0.0003843851539242321,
"grad_norm": 27.369709014892578,
"learning_rate": 4.727272727272728e-06,
"loss": 1.9488,
"num_input_tokens_seen": 23096,
"step": 48,
"train_runtime": 168.8317,
"train_tokens_per_second": 136.799
},
{
"epoch": 0.0003843851539242321,
"eval_loss": 2.295372486114502,
"eval_runtime": 15.9296,
"eval_samples_per_second": 62.776,
"eval_steps_per_second": 31.388,
"num_input_tokens_seen": 23096,
"step": 48
},
{
"epoch": 0.00039239317796432025,
"grad_norm": 21.76813507080078,
"learning_rate": 4.363636363636364e-06,
"loss": 2.3741,
"num_input_tokens_seen": 23970,
"step": 49,
"train_runtime": 185.4643,
"train_tokens_per_second": 129.243
},
{
"epoch": 0.0004004012020044084,
"grad_norm": 28.296794891357422,
"learning_rate": 4.000000000000001e-06,
"loss": 1.7647,
"num_input_tokens_seen": 24458,
"step": 50,
"train_runtime": 186.1284,
"train_tokens_per_second": 131.404
},
{
"epoch": 0.0004084092260444966,
"grad_norm": 34.54985427856445,
"learning_rate": 3.6363636363636366e-06,
"loss": 2.2798,
"num_input_tokens_seen": 24884,
"step": 51,
"train_runtime": 186.7918,
"train_tokens_per_second": 133.218
},
{
"epoch": 0.00041641725008458475,
"grad_norm": 25.983028411865234,
"learning_rate": 3.272727272727273e-06,
"loss": 1.8212,
"num_input_tokens_seen": 25394,
"step": 52,
"train_runtime": 187.454,
"train_tokens_per_second": 135.468
},
{
"epoch": 0.0004244252741246729,
"grad_norm": 33.13299560546875,
"learning_rate": 2.9090909090909093e-06,
"loss": 2.4243,
"num_input_tokens_seen": 25814,
"step": 53,
"train_runtime": 188.1191,
"train_tokens_per_second": 137.222
},
{
"epoch": 0.0004324332981647611,
"grad_norm": 32.00737380981445,
"learning_rate": 2.5454545454545456e-06,
"loss": 2.0507,
"num_input_tokens_seen": 26232,
"step": 54,
"train_runtime": 188.7874,
"train_tokens_per_second": 138.95
},
{
"epoch": 0.0004324332981647611,
"eval_loss": 2.2933812141418457,
"eval_runtime": 15.8975,
"eval_samples_per_second": 62.903,
"eval_steps_per_second": 31.451,
"num_input_tokens_seen": 26232,
"step": 54
},
{
"epoch": 0.00044044132220484925,
"grad_norm": 29.870973587036133,
"learning_rate": 2.181818181818182e-06,
"loss": 2.7572,
"num_input_tokens_seen": 26724,
"step": 55,
"train_runtime": 205.3777,
"train_tokens_per_second": 130.121
},
{
"epoch": 0.0004484493462449374,
"grad_norm": 32.467864990234375,
"learning_rate": 1.8181818181818183e-06,
"loss": 2.5342,
"num_input_tokens_seen": 27188,
"step": 56,
"train_runtime": 206.0422,
"train_tokens_per_second": 131.954
},
{
"epoch": 0.0004564573702850256,
"grad_norm": 23.056095123291016,
"learning_rate": 1.4545454545454546e-06,
"loss": 1.8859,
"num_input_tokens_seen": 27760,
"step": 57,
"train_runtime": 206.7074,
"train_tokens_per_second": 134.296
},
{
"epoch": 0.00046446539432511375,
"grad_norm": 28.30994415283203,
"learning_rate": 1.090909090909091e-06,
"loss": 2.0119,
"num_input_tokens_seen": 28288,
"step": 58,
"train_runtime": 207.3729,
"train_tokens_per_second": 136.411
},
{
"epoch": 0.0004724734183652019,
"grad_norm": 32.38734817504883,
"learning_rate": 7.272727272727273e-07,
"loss": 2.3612,
"num_input_tokens_seen": 28672,
"step": 59,
"train_runtime": 208.0357,
"train_tokens_per_second": 137.822
},
{
"epoch": 0.0004804814424052901,
"grad_norm": 25.652999877929688,
"learning_rate": 3.6363636363636366e-07,
"loss": 1.8457,
"num_input_tokens_seen": 29110,
"step": 60,
"train_runtime": 208.6978,
"train_tokens_per_second": 139.484
},
{
"epoch": 0.0004804814424052901,
"eval_loss": 2.2931265830993652,
"eval_runtime": 15.8795,
"eval_samples_per_second": 62.974,
"eval_steps_per_second": 31.487,
"num_input_tokens_seen": 29110,
"step": 60
}
],
"logging_steps": 1,
"max_steps": 60,
"num_input_tokens_seen": 29110,
"num_train_epochs": 1,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 484641984921600.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}