Safetensors
ParagonLight's picture
update loras
60bd5ed
Raw
History Blame Contribute Delete
9.91 kB
{
"best_metric": 0.2948146462440491,
"best_model_checkpoint": "ckpt/llama3_8b_other/object_counting_no_sys/checkpoint-400",
"epoch": 6.0,
"eval_steps": 200,
"global_step": 510,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.11764705882352941,
"grad_norm": 23.17191505432129,
"learning_rate": 2.5e-05,
"loss": 7.0189,
"step": 10
},
{
"epoch": 0.23529411764705882,
"grad_norm": 8.94247055053711,
"learning_rate": 5e-05,
"loss": 3.2984,
"step": 20
},
{
"epoch": 0.35294117647058826,
"grad_norm": 9.85525894165039,
"learning_rate": 4.994863481875841e-05,
"loss": 0.7046,
"step": 30
},
{
"epoch": 0.47058823529411764,
"grad_norm": 5.321958065032959,
"learning_rate": 4.979475034558115e-05,
"loss": 0.5767,
"step": 40
},
{
"epoch": 0.5882352941176471,
"grad_norm": 8.481945037841797,
"learning_rate": 4.9538978924776634e-05,
"loss": 0.5266,
"step": 50
},
{
"epoch": 0.7058823529411765,
"grad_norm": 18.951034545898438,
"learning_rate": 4.9182371575975736e-05,
"loss": 0.5439,
"step": 60
},
{
"epoch": 0.8235294117647058,
"grad_norm": 8.39922046661377,
"learning_rate": 4.8726393675266716e-05,
"loss": 0.4045,
"step": 70
},
{
"epoch": 0.9411764705882353,
"grad_norm": 7.662684917449951,
"learning_rate": 4.817291893365055e-05,
"loss": 0.3646,
"step": 80
},
{
"epoch": 1.0588235294117647,
"grad_norm": 5.594130992889404,
"learning_rate": 4.752422169756048e-05,
"loss": 0.4374,
"step": 90
},
{
"epoch": 1.1764705882352942,
"grad_norm": 14.85095500946045,
"learning_rate": 4.678296760308474e-05,
"loss": 0.3521,
"step": 100
},
{
"epoch": 1.2941176470588236,
"grad_norm": 7.1303606033325195,
"learning_rate": 4.595220262229601e-05,
"loss": 0.3584,
"step": 110
},
{
"epoch": 1.4117647058823528,
"grad_norm": 9.753626823425293,
"learning_rate": 4.503534054669892e-05,
"loss": 0.4017,
"step": 120
},
{
"epoch": 1.5294117647058822,
"grad_norm": 8.411559104919434,
"learning_rate": 4.4036148959228365e-05,
"loss": 0.4192,
"step": 130
},
{
"epoch": 1.6470588235294117,
"grad_norm": 10.687651634216309,
"learning_rate": 4.2958733752443195e-05,
"loss": 0.3832,
"step": 140
},
{
"epoch": 1.7647058823529411,
"grad_norm": 15.22123908996582,
"learning_rate": 4.180752225653292e-05,
"loss": 0.2871,
"step": 150
},
{
"epoch": 1.8823529411764706,
"grad_norm": 7.608785629272461,
"learning_rate": 4.058724504646834e-05,
"loss": 0.2344,
"step": 160
},
{
"epoch": 2.0,
"grad_norm": 2.1389312744140625,
"learning_rate": 3.9302916503054246e-05,
"loss": 0.2686,
"step": 170
},
{
"epoch": 2.1176470588235294,
"grad_norm": 25.7930908203125,
"learning_rate": 3.7959814207763135e-05,
"loss": 0.3129,
"step": 180
},
{
"epoch": 2.235294117647059,
"grad_norm": 4.136214733123779,
"learning_rate": 3.656345725602089e-05,
"loss": 0.2146,
"step": 190
},
{
"epoch": 2.3529411764705883,
"grad_norm": 3.397460699081421,
"learning_rate": 3.5119583578059846e-05,
"loss": 0.1766,
"step": 200
},
{
"epoch": 2.3529411764705883,
"eval_loss": 0.4584803879261017,
"eval_runtime": 0.7658,
"eval_samples_per_second": 156.69,
"eval_steps_per_second": 19.586,
"step": 200
},
{
"epoch": 2.4705882352941178,
"grad_norm": 15.182618141174316,
"learning_rate": 3.363412636053269e-05,
"loss": 0.1984,
"step": 210
},
{
"epoch": 2.588235294117647,
"grad_norm": 7.012846946716309,
"learning_rate": 3.211318966577581e-05,
"loss": 0.1822,
"step": 220
},
{
"epoch": 2.7058823529411766,
"grad_norm": 10.27369499206543,
"learning_rate": 3.056302334890786e-05,
"loss": 0.2768,
"step": 230
},
{
"epoch": 2.8235294117647056,
"grad_norm": 7.723974704742432,
"learning_rate": 2.8989997375834482e-05,
"loss": 0.1146,
"step": 240
},
{
"epoch": 2.9411764705882355,
"grad_norm": 16.098949432373047,
"learning_rate": 2.7400575647692046e-05,
"loss": 0.2341,
"step": 250
},
{
"epoch": 3.0588235294117645,
"grad_norm": 3.3051462173461914,
"learning_rate": 2.5801289439291388e-05,
"loss": 0.2811,
"step": 260
},
{
"epoch": 3.176470588235294,
"grad_norm": 14.433158874511719,
"learning_rate": 2.419871056070862e-05,
"loss": 0.1915,
"step": 270
},
{
"epoch": 3.2941176470588234,
"grad_norm": 3.7534849643707275,
"learning_rate": 2.2599424352307957e-05,
"loss": 0.1292,
"step": 280
},
{
"epoch": 3.411764705882353,
"grad_norm": 15.175636291503906,
"learning_rate": 2.1010002624165527e-05,
"loss": 0.1015,
"step": 290
},
{
"epoch": 3.5294117647058822,
"grad_norm": 11.786360740661621,
"learning_rate": 1.9436976651092144e-05,
"loss": 0.1129,
"step": 300
},
{
"epoch": 3.6470588235294117,
"grad_norm": 13.687607765197754,
"learning_rate": 1.7886810334224192e-05,
"loss": 0.1072,
"step": 310
},
{
"epoch": 3.764705882352941,
"grad_norm": 6.054112434387207,
"learning_rate": 1.6365873639467315e-05,
"loss": 0.1333,
"step": 320
},
{
"epoch": 3.8823529411764706,
"grad_norm": 12.263951301574707,
"learning_rate": 1.4880416421940155e-05,
"loss": 0.1509,
"step": 330
},
{
"epoch": 4.0,
"grad_norm": 0.6237934827804565,
"learning_rate": 1.3436542743979125e-05,
"loss": 0.0754,
"step": 340
},
{
"epoch": 4.117647058823529,
"grad_norm": 2.395211935043335,
"learning_rate": 1.2040185792236874e-05,
"loss": 0.0869,
"step": 350
},
{
"epoch": 4.235294117647059,
"grad_norm": 7.990754127502441,
"learning_rate": 1.0697083496945765e-05,
"loss": 0.1263,
"step": 360
},
{
"epoch": 4.352941176470588,
"grad_norm": 5.7818779945373535,
"learning_rate": 9.412754953531663e-06,
"loss": 0.0479,
"step": 370
},
{
"epoch": 4.470588235294118,
"grad_norm": 8.458385467529297,
"learning_rate": 8.192477743467078e-06,
"loss": 0.0401,
"step": 380
},
{
"epoch": 4.588235294117647,
"grad_norm": 4.223268032073975,
"learning_rate": 7.041266247556813e-06,
"loss": 0.0774,
"step": 390
},
{
"epoch": 4.705882352941177,
"grad_norm": 2.8907740116119385,
"learning_rate": 5.9638510407716394e-06,
"loss": 0.0726,
"step": 400
},
{
"epoch": 4.705882352941177,
"eval_loss": 0.2948146462440491,
"eval_runtime": 0.7657,
"eval_samples_per_second": 156.723,
"eval_steps_per_second": 19.59,
"step": 400
},
{
"epoch": 4.823529411764706,
"grad_norm": 7.116231441497803,
"learning_rate": 4.9646594533010875e-06,
"loss": 0.0701,
"step": 410
},
{
"epoch": 4.9411764705882355,
"grad_norm": 15.119770050048828,
"learning_rate": 4.047797377703985e-06,
"loss": 0.0393,
"step": 420
},
{
"epoch": 5.0588235294117645,
"grad_norm": 11.085099220275879,
"learning_rate": 3.217032396915265e-06,
"loss": 0.0839,
"step": 430
},
{
"epoch": 5.176470588235294,
"grad_norm": 4.78342342376709,
"learning_rate": 2.475778302439524e-06,
"loss": 0.0348,
"step": 440
},
{
"epoch": 5.294117647058823,
"grad_norm": 0.49753427505493164,
"learning_rate": 1.827081066349459e-06,
"loss": 0.0429,
"step": 450
},
{
"epoch": 5.411764705882353,
"grad_norm": 4.4141693115234375,
"learning_rate": 1.273606324733284e-06,
"loss": 0.0493,
"step": 460
},
{
"epoch": 5.529411764705882,
"grad_norm": 5.7931413650512695,
"learning_rate": 8.176284240242638e-07,
"loss": 0.0158,
"step": 470
},
{
"epoch": 5.647058823529412,
"grad_norm": 6.445806980133057,
"learning_rate": 4.6102107522336403e-07,
"loss": 0.026,
"step": 480
},
{
"epoch": 5.764705882352941,
"grad_norm": 0.24533455073833466,
"learning_rate": 2.052496544188487e-07,
"loss": 0.0267,
"step": 490
},
{
"epoch": 5.882352941176471,
"grad_norm": 13.630054473876953,
"learning_rate": 5.136518124159162e-08,
"loss": 0.0317,
"step": 500
},
{
"epoch": 6.0,
"grad_norm": 1.213211178779602,
"learning_rate": 0.0,
"loss": 0.0259,
"step": 510
},
{
"epoch": 6.0,
"step": 510,
"total_flos": 1.0415358657691648e+16,
"train_loss": 0.4013917989882768,
"train_runtime": 114.995,
"train_samples_per_second": 35.48,
"train_steps_per_second": 4.435
}
],
"logging_steps": 10,
"max_steps": 510,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 200,
"total_flos": 1.0415358657691648e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}