Math_Version_4_8 / last-checkpoint /trainer_state.json
anhdai312's picture
Training in progress, step 300, checkpoint
71bdcbc verified
Raw
History Blame Contribute Delete
58 kB
{
"best_global_step": 300,
"best_metric": 0.7383912801742554,
"best_model_checkpoint": "/tmp/checkpoints_/job_8b281c2d-af65-4c30-a93e-8abb644cc0e7/checkpoint-300",
"epoch": 3.0,
"eval_steps": 10,
"global_step": 300,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01,
"grad_norm": 2.1171627044677734,
"learning_rate": 0.0,
"loss": 3.163031816482544,
"step": 1
},
{
"epoch": 0.02,
"grad_norm": 1.9782500267028809,
"learning_rate": 1e-05,
"loss": 2.690840721130371,
"step": 2
},
{
"epoch": 0.03,
"grad_norm": 1.7205469608306885,
"learning_rate": 2e-05,
"loss": 3.156268358230591,
"step": 3
},
{
"epoch": 0.04,
"grad_norm": 1.8276387453079224,
"learning_rate": 3e-05,
"loss": 3.074211597442627,
"step": 4
},
{
"epoch": 0.05,
"grad_norm": 1.7527276277542114,
"learning_rate": 4e-05,
"loss": 2.780440092086792,
"step": 5
},
{
"epoch": 0.06,
"grad_norm": 1.8743016719818115,
"learning_rate": 5e-05,
"loss": 2.3848981857299805,
"step": 6
},
{
"epoch": 0.07,
"grad_norm": 2.280088186264038,
"learning_rate": 4.9830508474576276e-05,
"loss": 2.09112811088562,
"step": 7
},
{
"epoch": 0.08,
"grad_norm": 2.055898666381836,
"learning_rate": 4.966101694915254e-05,
"loss": 2.1616554260253906,
"step": 8
},
{
"epoch": 0.09,
"grad_norm": 2.0772104263305664,
"learning_rate": 4.9491525423728815e-05,
"loss": 2.3726091384887695,
"step": 9
},
{
"epoch": 0.1,
"grad_norm": 2.2309956550598145,
"learning_rate": 4.932203389830509e-05,
"loss": 2.658926486968994,
"step": 10
},
{
"epoch": 0.1,
"eval_loss": 2.389467716217041,
"eval_runtime": 10.9457,
"eval_samples_per_second": 4.568,
"eval_steps_per_second": 1.188,
"step": 10
},
{
"epoch": 0.11,
"grad_norm": 2.152456760406494,
"learning_rate": 4.915254237288136e-05,
"loss": 1.8962513208389282,
"step": 11
},
{
"epoch": 0.12,
"grad_norm": 2.2132649421691895,
"learning_rate": 4.898305084745763e-05,
"loss": 2.985776662826538,
"step": 12
},
{
"epoch": 0.13,
"grad_norm": 1.8200664520263672,
"learning_rate": 4.88135593220339e-05,
"loss": 2.1511483192443848,
"step": 13
},
{
"epoch": 0.14,
"grad_norm": 2.626648426055908,
"learning_rate": 4.8644067796610174e-05,
"loss": 2.184636354446411,
"step": 14
},
{
"epoch": 0.15,
"grad_norm": 2.5309805870056152,
"learning_rate": 4.847457627118645e-05,
"loss": 3.544036388397217,
"step": 15
},
{
"epoch": 0.16,
"grad_norm": 2.7937726974487305,
"learning_rate": 4.8305084745762714e-05,
"loss": 3.399052381515503,
"step": 16
},
{
"epoch": 0.17,
"grad_norm": 2.5645394325256348,
"learning_rate": 4.813559322033899e-05,
"loss": 2.2496414184570312,
"step": 17
},
{
"epoch": 0.18,
"grad_norm": 2.5270442962646484,
"learning_rate": 4.796610169491525e-05,
"loss": 2.7234156131744385,
"step": 18
},
{
"epoch": 0.19,
"grad_norm": 2.020771026611328,
"learning_rate": 4.7796610169491526e-05,
"loss": 1.8619742393493652,
"step": 19
},
{
"epoch": 0.2,
"grad_norm": 1.8679395914077759,
"learning_rate": 4.76271186440678e-05,
"loss": 1.6869091987609863,
"step": 20
},
{
"epoch": 0.2,
"eval_loss": 1.9450862407684326,
"eval_runtime": 10.4791,
"eval_samples_per_second": 4.771,
"eval_steps_per_second": 1.241,
"step": 20
},
{
"epoch": 0.21,
"grad_norm": 2.3372979164123535,
"learning_rate": 4.745762711864407e-05,
"loss": 1.9245836734771729,
"step": 21
},
{
"epoch": 0.22,
"grad_norm": 2.6716468334198,
"learning_rate": 4.728813559322034e-05,
"loss": 1.685462236404419,
"step": 22
},
{
"epoch": 0.23,
"grad_norm": 2.3861260414123535,
"learning_rate": 4.711864406779661e-05,
"loss": 1.748580813407898,
"step": 23
},
{
"epoch": 0.24,
"grad_norm": 2.3886051177978516,
"learning_rate": 4.694915254237288e-05,
"loss": 1.5720112323760986,
"step": 24
},
{
"epoch": 0.25,
"grad_norm": 2.5959010124206543,
"learning_rate": 4.677966101694916e-05,
"loss": 2.1875998973846436,
"step": 25
},
{
"epoch": 0.26,
"grad_norm": 2.578433036804199,
"learning_rate": 4.6610169491525425e-05,
"loss": 2.187379837036133,
"step": 26
},
{
"epoch": 0.27,
"grad_norm": 2.176563024520874,
"learning_rate": 4.64406779661017e-05,
"loss": 1.5643824338912964,
"step": 27
},
{
"epoch": 0.28,
"grad_norm": 2.8972346782684326,
"learning_rate": 4.6271186440677964e-05,
"loss": 1.740110158920288,
"step": 28
},
{
"epoch": 0.29,
"grad_norm": 2.2841579914093018,
"learning_rate": 4.610169491525424e-05,
"loss": 1.702327847480774,
"step": 29
},
{
"epoch": 0.3,
"grad_norm": 2.897881031036377,
"learning_rate": 4.593220338983051e-05,
"loss": 1.9617106914520264,
"step": 30
},
{
"epoch": 0.3,
"eval_loss": 1.6606335639953613,
"eval_runtime": 10.5603,
"eval_samples_per_second": 4.735,
"eval_steps_per_second": 1.231,
"step": 30
},
{
"epoch": 0.31,
"grad_norm": 2.8905649185180664,
"learning_rate": 4.5762711864406784e-05,
"loss": 1.5631475448608398,
"step": 31
},
{
"epoch": 0.32,
"grad_norm": 2.1999728679656982,
"learning_rate": 4.559322033898305e-05,
"loss": 1.4476122856140137,
"step": 32
},
{
"epoch": 0.33,
"grad_norm": 2.8038437366485596,
"learning_rate": 4.542372881355932e-05,
"loss": 2.3526129722595215,
"step": 33
},
{
"epoch": 0.34,
"grad_norm": 2.9093363285064697,
"learning_rate": 4.5254237288135596e-05,
"loss": 1.6957886219024658,
"step": 34
},
{
"epoch": 0.35,
"grad_norm": 2.621096611022949,
"learning_rate": 4.508474576271187e-05,
"loss": 1.1552718877792358,
"step": 35
},
{
"epoch": 0.36,
"grad_norm": 2.4918246269226074,
"learning_rate": 4.491525423728814e-05,
"loss": 1.016581654548645,
"step": 36
},
{
"epoch": 0.37,
"grad_norm": 2.866511583328247,
"learning_rate": 4.474576271186441e-05,
"loss": 1.2580273151397705,
"step": 37
},
{
"epoch": 0.38,
"grad_norm": 2.876396894454956,
"learning_rate": 4.457627118644068e-05,
"loss": 1.3279141187667847,
"step": 38
},
{
"epoch": 0.39,
"grad_norm": 2.620054006576538,
"learning_rate": 4.440677966101695e-05,
"loss": 1.4667302370071411,
"step": 39
},
{
"epoch": 0.4,
"grad_norm": 2.378932237625122,
"learning_rate": 4.423728813559322e-05,
"loss": 1.418715476989746,
"step": 40
},
{
"epoch": 0.4,
"eval_loss": 1.4890578985214233,
"eval_runtime": 10.4677,
"eval_samples_per_second": 4.777,
"eval_steps_per_second": 1.242,
"step": 40
},
{
"epoch": 0.41,
"grad_norm": 2.823331356048584,
"learning_rate": 4.4067796610169495e-05,
"loss": 1.6411733627319336,
"step": 41
},
{
"epoch": 0.42,
"grad_norm": 2.4005231857299805,
"learning_rate": 4.389830508474577e-05,
"loss": 0.819839596748352,
"step": 42
},
{
"epoch": 0.43,
"grad_norm": 3.5857410430908203,
"learning_rate": 4.3728813559322035e-05,
"loss": 1.4614059925079346,
"step": 43
},
{
"epoch": 0.44,
"grad_norm": 2.7029807567596436,
"learning_rate": 4.355932203389831e-05,
"loss": 1.3982230424880981,
"step": 44
},
{
"epoch": 0.45,
"grad_norm": 3.2241618633270264,
"learning_rate": 4.3389830508474574e-05,
"loss": 1.3324111700057983,
"step": 45
},
{
"epoch": 0.46,
"grad_norm": 3.5156137943267822,
"learning_rate": 4.3220338983050854e-05,
"loss": 1.9475518465042114,
"step": 46
},
{
"epoch": 0.47,
"grad_norm": 3.7227654457092285,
"learning_rate": 4.305084745762712e-05,
"loss": 2.122896909713745,
"step": 47
},
{
"epoch": 0.48,
"grad_norm": 2.723672866821289,
"learning_rate": 4.2881355932203394e-05,
"loss": 0.9358270168304443,
"step": 48
},
{
"epoch": 0.49,
"grad_norm": 4.422077655792236,
"learning_rate": 4.271186440677966e-05,
"loss": 1.5106054544448853,
"step": 49
},
{
"epoch": 0.5,
"grad_norm": 3.0784265995025635,
"learning_rate": 4.254237288135593e-05,
"loss": 1.746118426322937,
"step": 50
},
{
"epoch": 0.5,
"eval_loss": 1.372035264968872,
"eval_runtime": 10.5392,
"eval_samples_per_second": 4.744,
"eval_steps_per_second": 1.233,
"step": 50
},
{
"epoch": 0.51,
"grad_norm": 2.966223955154419,
"learning_rate": 4.2372881355932206e-05,
"loss": 0.9564155340194702,
"step": 51
},
{
"epoch": 0.52,
"grad_norm": 3.184781074523926,
"learning_rate": 4.220338983050848e-05,
"loss": 1.1802464723587036,
"step": 52
},
{
"epoch": 0.53,
"grad_norm": 2.6954610347747803,
"learning_rate": 4.2033898305084746e-05,
"loss": 0.9538143873214722,
"step": 53
},
{
"epoch": 0.54,
"grad_norm": 3.050103187561035,
"learning_rate": 4.186440677966102e-05,
"loss": 1.1515997648239136,
"step": 54
},
{
"epoch": 0.55,
"grad_norm": 3.0747792720794678,
"learning_rate": 4.1694915254237285e-05,
"loss": 1.5690269470214844,
"step": 55
},
{
"epoch": 0.56,
"grad_norm": 3.2304141521453857,
"learning_rate": 4.152542372881356e-05,
"loss": 1.5042673349380493,
"step": 56
},
{
"epoch": 0.57,
"grad_norm": 3.42105770111084,
"learning_rate": 4.135593220338983e-05,
"loss": 1.8882123231887817,
"step": 57
},
{
"epoch": 0.58,
"grad_norm": 3.3997886180877686,
"learning_rate": 4.1186440677966105e-05,
"loss": 1.1486238241195679,
"step": 58
},
{
"epoch": 0.59,
"grad_norm": 3.787210464477539,
"learning_rate": 4.101694915254237e-05,
"loss": 1.3464231491088867,
"step": 59
},
{
"epoch": 0.6,
"grad_norm": 3.7182939052581787,
"learning_rate": 4.0847457627118644e-05,
"loss": 1.3997166156768799,
"step": 60
},
{
"epoch": 0.6,
"eval_loss": 1.265113353729248,
"eval_runtime": 10.5316,
"eval_samples_per_second": 4.748,
"eval_steps_per_second": 1.234,
"step": 60
},
{
"epoch": 0.61,
"grad_norm": 4.223500728607178,
"learning_rate": 4.067796610169492e-05,
"loss": 1.6583908796310425,
"step": 61
},
{
"epoch": 0.62,
"grad_norm": 4.040110111236572,
"learning_rate": 4.050847457627119e-05,
"loss": 1.6607671976089478,
"step": 62
},
{
"epoch": 0.63,
"grad_norm": 3.2832658290863037,
"learning_rate": 4.0338983050847464e-05,
"loss": 1.5942728519439697,
"step": 63
},
{
"epoch": 0.64,
"grad_norm": 3.3892154693603516,
"learning_rate": 4.016949152542373e-05,
"loss": 1.8012514114379883,
"step": 64
},
{
"epoch": 0.65,
"grad_norm": 3.494037389755249,
"learning_rate": 4e-05,
"loss": 1.42776358127594,
"step": 65
},
{
"epoch": 0.66,
"grad_norm": 3.8074331283569336,
"learning_rate": 3.983050847457627e-05,
"loss": 1.7506017684936523,
"step": 66
},
{
"epoch": 0.67,
"grad_norm": 3.606250524520874,
"learning_rate": 3.966101694915255e-05,
"loss": 1.4590402841567993,
"step": 67
},
{
"epoch": 0.68,
"grad_norm": 2.9817044734954834,
"learning_rate": 3.9491525423728816e-05,
"loss": 1.3031854629516602,
"step": 68
},
{
"epoch": 0.69,
"grad_norm": 3.005952835083008,
"learning_rate": 3.932203389830509e-05,
"loss": 0.9142398834228516,
"step": 69
},
{
"epoch": 0.7,
"grad_norm": 3.937074899673462,
"learning_rate": 3.9152542372881355e-05,
"loss": 1.8572261333465576,
"step": 70
},
{
"epoch": 0.7,
"eval_loss": 1.1609348058700562,
"eval_runtime": 10.4859,
"eval_samples_per_second": 4.768,
"eval_steps_per_second": 1.24,
"step": 70
},
{
"epoch": 0.71,
"grad_norm": 3.771090507507324,
"learning_rate": 3.898305084745763e-05,
"loss": 1.3024649620056152,
"step": 71
},
{
"epoch": 0.72,
"grad_norm": 3.8426034450531006,
"learning_rate": 3.88135593220339e-05,
"loss": 1.8733025789260864,
"step": 72
},
{
"epoch": 0.73,
"grad_norm": 3.7026591300964355,
"learning_rate": 3.8644067796610175e-05,
"loss": 1.6303346157073975,
"step": 73
},
{
"epoch": 0.74,
"grad_norm": 3.816459894180298,
"learning_rate": 3.847457627118644e-05,
"loss": 1.123533844947815,
"step": 74
},
{
"epoch": 0.75,
"grad_norm": 3.8943076133728027,
"learning_rate": 3.8305084745762714e-05,
"loss": 1.3744488954544067,
"step": 75
},
{
"epoch": 0.76,
"grad_norm": 2.7549402713775635,
"learning_rate": 3.813559322033898e-05,
"loss": 1.2576571702957153,
"step": 76
},
{
"epoch": 0.77,
"grad_norm": 3.604092836380005,
"learning_rate": 3.7966101694915254e-05,
"loss": 1.6060692071914673,
"step": 77
},
{
"epoch": 0.78,
"grad_norm": 3.0456180572509766,
"learning_rate": 3.779661016949153e-05,
"loss": 1.0820971727371216,
"step": 78
},
{
"epoch": 0.79,
"grad_norm": 3.1909260749816895,
"learning_rate": 3.76271186440678e-05,
"loss": 1.3404126167297363,
"step": 79
},
{
"epoch": 0.8,
"grad_norm": 3.0137782096862793,
"learning_rate": 3.745762711864407e-05,
"loss": 1.0073747634887695,
"step": 80
},
{
"epoch": 0.8,
"eval_loss": 1.0794806480407715,
"eval_runtime": 10.5406,
"eval_samples_per_second": 4.744,
"eval_steps_per_second": 1.233,
"step": 80
},
{
"epoch": 0.81,
"grad_norm": 3.5976083278656006,
"learning_rate": 3.728813559322034e-05,
"loss": 1.1961290836334229,
"step": 81
},
{
"epoch": 0.82,
"grad_norm": 3.1002819538116455,
"learning_rate": 3.711864406779661e-05,
"loss": 1.2835028171539307,
"step": 82
},
{
"epoch": 0.83,
"grad_norm": 3.405048370361328,
"learning_rate": 3.6949152542372886e-05,
"loss": 0.9098812341690063,
"step": 83
},
{
"epoch": 0.84,
"grad_norm": 3.7394673824310303,
"learning_rate": 3.677966101694915e-05,
"loss": 1.3626973628997803,
"step": 84
},
{
"epoch": 0.85,
"grad_norm": 3.348489999771118,
"learning_rate": 3.6610169491525426e-05,
"loss": 1.6384360790252686,
"step": 85
},
{
"epoch": 0.86,
"grad_norm": 4.451590538024902,
"learning_rate": 3.644067796610169e-05,
"loss": 1.5231339931488037,
"step": 86
},
{
"epoch": 0.87,
"grad_norm": 4.138722896575928,
"learning_rate": 3.6271186440677965e-05,
"loss": 1.4858205318450928,
"step": 87
},
{
"epoch": 0.88,
"grad_norm": 2.902799367904663,
"learning_rate": 3.610169491525424e-05,
"loss": 0.7662581205368042,
"step": 88
},
{
"epoch": 0.89,
"grad_norm": 3.366891622543335,
"learning_rate": 3.593220338983051e-05,
"loss": 1.5692062377929688,
"step": 89
},
{
"epoch": 0.9,
"grad_norm": 4.165596008300781,
"learning_rate": 3.5762711864406785e-05,
"loss": 1.4523687362670898,
"step": 90
},
{
"epoch": 0.9,
"eval_loss": 1.0074013471603394,
"eval_runtime": 10.4515,
"eval_samples_per_second": 4.784,
"eval_steps_per_second": 1.244,
"step": 90
},
{
"epoch": 0.91,
"grad_norm": 3.5729291439056396,
"learning_rate": 3.559322033898305e-05,
"loss": 1.0966107845306396,
"step": 91
},
{
"epoch": 0.92,
"grad_norm": 3.3289918899536133,
"learning_rate": 3.5423728813559324e-05,
"loss": 1.1545674800872803,
"step": 92
},
{
"epoch": 0.93,
"grad_norm": 4.362941741943359,
"learning_rate": 3.52542372881356e-05,
"loss": 1.2741059064865112,
"step": 93
},
{
"epoch": 0.94,
"grad_norm": 3.5573689937591553,
"learning_rate": 3.508474576271187e-05,
"loss": 0.9319970607757568,
"step": 94
},
{
"epoch": 0.95,
"grad_norm": 3.827359676361084,
"learning_rate": 3.491525423728814e-05,
"loss": 1.2421356439590454,
"step": 95
},
{
"epoch": 0.96,
"grad_norm": 3.559703826904297,
"learning_rate": 3.474576271186441e-05,
"loss": 1.0851140022277832,
"step": 96
},
{
"epoch": 0.97,
"grad_norm": 3.9937121868133545,
"learning_rate": 3.4576271186440676e-05,
"loss": 1.0016624927520752,
"step": 97
},
{
"epoch": 0.98,
"grad_norm": 4.665326118469238,
"learning_rate": 3.440677966101695e-05,
"loss": 1.5379905700683594,
"step": 98
},
{
"epoch": 0.99,
"grad_norm": 3.3989341259002686,
"learning_rate": 3.423728813559322e-05,
"loss": 0.8277304172515869,
"step": 99
},
{
"epoch": 1.0,
"grad_norm": 2.450385332107544,
"learning_rate": 3.4067796610169496e-05,
"loss": 0.4340943694114685,
"step": 100
},
{
"epoch": 1.0,
"eval_loss": 0.9603031873703003,
"eval_runtime": 10.5342,
"eval_samples_per_second": 4.746,
"eval_steps_per_second": 1.234,
"step": 100
},
{
"epoch": 1.01,
"grad_norm": 3.2275028228759766,
"learning_rate": 3.389830508474576e-05,
"loss": 0.8044828176498413,
"step": 101
},
{
"epoch": 1.02,
"grad_norm": 3.3535656929016113,
"learning_rate": 3.3728813559322035e-05,
"loss": 0.6838231682777405,
"step": 102
},
{
"epoch": 1.03,
"grad_norm": 3.0697569847106934,
"learning_rate": 3.35593220338983e-05,
"loss": 0.7821201086044312,
"step": 103
},
{
"epoch": 1.04,
"grad_norm": 4.019687175750732,
"learning_rate": 3.338983050847458e-05,
"loss": 1.3350794315338135,
"step": 104
},
{
"epoch": 1.05,
"grad_norm": 3.0399889945983887,
"learning_rate": 3.322033898305085e-05,
"loss": 0.5365303754806519,
"step": 105
},
{
"epoch": 1.06,
"grad_norm": 3.9897522926330566,
"learning_rate": 3.305084745762712e-05,
"loss": 1.3743857145309448,
"step": 106
},
{
"epoch": 1.07,
"grad_norm": 4.174384593963623,
"learning_rate": 3.288135593220339e-05,
"loss": 1.1578922271728516,
"step": 107
},
{
"epoch": 1.08,
"grad_norm": 4.128077983856201,
"learning_rate": 3.271186440677966e-05,
"loss": 0.9716495275497437,
"step": 108
},
{
"epoch": 1.09,
"grad_norm": 3.240725517272949,
"learning_rate": 3.2542372881355934e-05,
"loss": 0.7094882130622864,
"step": 109
},
{
"epoch": 1.1,
"grad_norm": 3.711085319519043,
"learning_rate": 3.237288135593221e-05,
"loss": 1.0737030506134033,
"step": 110
},
{
"epoch": 1.1,
"eval_loss": 0.9216090440750122,
"eval_runtime": 10.5583,
"eval_samples_per_second": 4.736,
"eval_steps_per_second": 1.231,
"step": 110
},
{
"epoch": 1.11,
"grad_norm": 3.3787126541137695,
"learning_rate": 3.2203389830508473e-05,
"loss": 0.9874815344810486,
"step": 111
},
{
"epoch": 1.12,
"grad_norm": 3.603147268295288,
"learning_rate": 3.203389830508475e-05,
"loss": 0.9284617304801941,
"step": 112
},
{
"epoch": 1.13,
"grad_norm": 3.6517977714538574,
"learning_rate": 3.186440677966101e-05,
"loss": 1.145089030265808,
"step": 113
},
{
"epoch": 1.1400000000000001,
"grad_norm": 3.917050838470459,
"learning_rate": 3.169491525423729e-05,
"loss": 0.945578932762146,
"step": 114
},
{
"epoch": 1.15,
"grad_norm": 3.7230169773101807,
"learning_rate": 3.1525423728813566e-05,
"loss": 0.9082507491111755,
"step": 115
},
{
"epoch": 1.16,
"grad_norm": 3.416461229324341,
"learning_rate": 3.135593220338983e-05,
"loss": 0.7597788572311401,
"step": 116
},
{
"epoch": 1.17,
"grad_norm": 3.628636598587036,
"learning_rate": 3.1186440677966106e-05,
"loss": 0.8996987342834473,
"step": 117
},
{
"epoch": 1.18,
"grad_norm": 3.9265754222869873,
"learning_rate": 3.101694915254237e-05,
"loss": 0.8976044654846191,
"step": 118
},
{
"epoch": 1.19,
"grad_norm": 5.527978420257568,
"learning_rate": 3.0847457627118645e-05,
"loss": 0.836651086807251,
"step": 119
},
{
"epoch": 1.2,
"grad_norm": 3.867248296737671,
"learning_rate": 3.067796610169492e-05,
"loss": 0.9870142936706543,
"step": 120
},
{
"epoch": 1.2,
"eval_loss": 0.8799838423728943,
"eval_runtime": 10.4561,
"eval_samples_per_second": 4.782,
"eval_steps_per_second": 1.243,
"step": 120
},
{
"epoch": 1.21,
"grad_norm": 4.393030166625977,
"learning_rate": 3.050847457627119e-05,
"loss": 0.7543111443519592,
"step": 121
},
{
"epoch": 1.22,
"grad_norm": 3.5715770721435547,
"learning_rate": 3.0338983050847458e-05,
"loss": 0.8172724843025208,
"step": 122
},
{
"epoch": 1.23,
"grad_norm": 3.895054578781128,
"learning_rate": 3.016949152542373e-05,
"loss": 0.725540041923523,
"step": 123
},
{
"epoch": 1.24,
"grad_norm": 4.0182037353515625,
"learning_rate": 3e-05,
"loss": 0.6634839773178101,
"step": 124
},
{
"epoch": 1.25,
"grad_norm": 4.3785400390625,
"learning_rate": 2.9830508474576274e-05,
"loss": 1.1542022228240967,
"step": 125
},
{
"epoch": 1.26,
"grad_norm": 3.6438024044036865,
"learning_rate": 2.9661016949152544e-05,
"loss": 1.1196527481079102,
"step": 126
},
{
"epoch": 1.27,
"grad_norm": 3.7208170890808105,
"learning_rate": 2.9491525423728817e-05,
"loss": 0.5093207359313965,
"step": 127
},
{
"epoch": 1.28,
"grad_norm": 3.393688201904297,
"learning_rate": 2.9322033898305083e-05,
"loss": 0.7229101657867432,
"step": 128
},
{
"epoch": 1.29,
"grad_norm": 4.267416477203369,
"learning_rate": 2.915254237288136e-05,
"loss": 0.6298890113830566,
"step": 129
},
{
"epoch": 1.3,
"grad_norm": 3.9886133670806885,
"learning_rate": 2.8983050847457626e-05,
"loss": 0.8225182294845581,
"step": 130
},
{
"epoch": 1.3,
"eval_loss": 0.8524377346038818,
"eval_runtime": 10.5416,
"eval_samples_per_second": 4.743,
"eval_steps_per_second": 1.233,
"step": 130
},
{
"epoch": 1.31,
"grad_norm": 3.5783166885375977,
"learning_rate": 2.88135593220339e-05,
"loss": 0.8295838236808777,
"step": 131
},
{
"epoch": 1.32,
"grad_norm": 4.101043224334717,
"learning_rate": 2.864406779661017e-05,
"loss": 0.8590331077575684,
"step": 132
},
{
"epoch": 1.33,
"grad_norm": 4.2215399742126465,
"learning_rate": 2.8474576271186442e-05,
"loss": 0.8797506093978882,
"step": 133
},
{
"epoch": 1.34,
"grad_norm": 4.126857280731201,
"learning_rate": 2.8305084745762712e-05,
"loss": 0.7865480184555054,
"step": 134
},
{
"epoch": 1.35,
"grad_norm": 3.466843843460083,
"learning_rate": 2.8135593220338985e-05,
"loss": 0.7326760292053223,
"step": 135
},
{
"epoch": 1.3599999999999999,
"grad_norm": 3.718252420425415,
"learning_rate": 2.7966101694915255e-05,
"loss": 0.982783854007721,
"step": 136
},
{
"epoch": 1.37,
"grad_norm": 4.233240127563477,
"learning_rate": 2.7796610169491528e-05,
"loss": 0.9292647242546082,
"step": 137
},
{
"epoch": 1.38,
"grad_norm": 3.9506657123565674,
"learning_rate": 2.7627118644067794e-05,
"loss": 0.8919114470481873,
"step": 138
},
{
"epoch": 1.3900000000000001,
"grad_norm": 3.758995532989502,
"learning_rate": 2.7457627118644068e-05,
"loss": 0.6703253388404846,
"step": 139
},
{
"epoch": 1.4,
"grad_norm": 3.243623971939087,
"learning_rate": 2.7288135593220337e-05,
"loss": 0.44369328022003174,
"step": 140
},
{
"epoch": 1.4,
"eval_loss": 0.8387397527694702,
"eval_runtime": 10.5162,
"eval_samples_per_second": 4.755,
"eval_steps_per_second": 1.236,
"step": 140
},
{
"epoch": 1.41,
"grad_norm": 4.434927940368652,
"learning_rate": 2.711864406779661e-05,
"loss": 0.8561539649963379,
"step": 141
},
{
"epoch": 1.42,
"grad_norm": 3.989983320236206,
"learning_rate": 2.6949152542372884e-05,
"loss": 0.993414044380188,
"step": 142
},
{
"epoch": 1.43,
"grad_norm": 3.8418526649475098,
"learning_rate": 2.6779661016949153e-05,
"loss": 0.942582368850708,
"step": 143
},
{
"epoch": 1.44,
"grad_norm": 2.85524320602417,
"learning_rate": 2.6610169491525427e-05,
"loss": 0.5124800801277161,
"step": 144
},
{
"epoch": 1.45,
"grad_norm": 3.4714572429656982,
"learning_rate": 2.6440677966101696e-05,
"loss": 0.6047594547271729,
"step": 145
},
{
"epoch": 1.46,
"grad_norm": 3.624368906021118,
"learning_rate": 2.627118644067797e-05,
"loss": 0.7598530054092407,
"step": 146
},
{
"epoch": 1.47,
"grad_norm": 5.084875583648682,
"learning_rate": 2.610169491525424e-05,
"loss": 1.0318595170974731,
"step": 147
},
{
"epoch": 1.48,
"grad_norm": 3.9624974727630615,
"learning_rate": 2.5932203389830512e-05,
"loss": 0.7060834169387817,
"step": 148
},
{
"epoch": 1.49,
"grad_norm": 4.911516189575195,
"learning_rate": 2.576271186440678e-05,
"loss": 1.1196662187576294,
"step": 149
},
{
"epoch": 1.5,
"grad_norm": 2.5147690773010254,
"learning_rate": 2.5593220338983055e-05,
"loss": 0.2616414427757263,
"step": 150
},
{
"epoch": 1.5,
"eval_loss": 0.8156461119651794,
"eval_runtime": 10.5129,
"eval_samples_per_second": 4.756,
"eval_steps_per_second": 1.237,
"step": 150
},
{
"epoch": 1.51,
"grad_norm": 4.180668354034424,
"learning_rate": 2.5423728813559322e-05,
"loss": 0.842714250087738,
"step": 151
},
{
"epoch": 1.52,
"grad_norm": 4.8802103996276855,
"learning_rate": 2.5254237288135595e-05,
"loss": 1.141731858253479,
"step": 152
},
{
"epoch": 1.53,
"grad_norm": 3.1533806324005127,
"learning_rate": 2.5084745762711865e-05,
"loss": 0.5060231685638428,
"step": 153
},
{
"epoch": 1.54,
"grad_norm": 5.071037769317627,
"learning_rate": 2.4915254237288138e-05,
"loss": 0.5417395234107971,
"step": 154
},
{
"epoch": 1.55,
"grad_norm": 4.2996296882629395,
"learning_rate": 2.4745762711864408e-05,
"loss": 1.0686790943145752,
"step": 155
},
{
"epoch": 1.56,
"grad_norm": 4.177626609802246,
"learning_rate": 2.457627118644068e-05,
"loss": 0.40025004744529724,
"step": 156
},
{
"epoch": 1.5699999999999998,
"grad_norm": 4.179652690887451,
"learning_rate": 2.440677966101695e-05,
"loss": 0.8294581174850464,
"step": 157
},
{
"epoch": 1.58,
"grad_norm": 5.060283184051514,
"learning_rate": 2.4237288135593224e-05,
"loss": 0.8051419258117676,
"step": 158
},
{
"epoch": 1.5899999999999999,
"grad_norm": 4.751528263092041,
"learning_rate": 2.4067796610169493e-05,
"loss": 1.007561206817627,
"step": 159
},
{
"epoch": 1.6,
"grad_norm": 3.640712022781372,
"learning_rate": 2.3898305084745763e-05,
"loss": 0.4512104094028473,
"step": 160
},
{
"epoch": 1.6,
"eval_loss": 0.8037059307098389,
"eval_runtime": 10.5326,
"eval_samples_per_second": 4.747,
"eval_steps_per_second": 1.234,
"step": 160
},
{
"epoch": 1.6099999999999999,
"grad_norm": 2.612628936767578,
"learning_rate": 2.3728813559322036e-05,
"loss": 0.2284245789051056,
"step": 161
},
{
"epoch": 1.62,
"grad_norm": 3.961155414581299,
"learning_rate": 2.3559322033898306e-05,
"loss": 0.8284071683883667,
"step": 162
},
{
"epoch": 1.63,
"grad_norm": 4.136373519897461,
"learning_rate": 2.338983050847458e-05,
"loss": 0.8011317849159241,
"step": 163
},
{
"epoch": 1.6400000000000001,
"grad_norm": 3.620248317718506,
"learning_rate": 2.322033898305085e-05,
"loss": 0.46224790811538696,
"step": 164
},
{
"epoch": 1.65,
"grad_norm": 4.864706516265869,
"learning_rate": 2.305084745762712e-05,
"loss": 0.7747316956520081,
"step": 165
},
{
"epoch": 1.6600000000000001,
"grad_norm": 4.4413933753967285,
"learning_rate": 2.2881355932203392e-05,
"loss": 0.7252891659736633,
"step": 166
},
{
"epoch": 1.67,
"grad_norm": 4.290167331695557,
"learning_rate": 2.271186440677966e-05,
"loss": 1.06046724319458,
"step": 167
},
{
"epoch": 1.6800000000000002,
"grad_norm": 4.6208415031433105,
"learning_rate": 2.2542372881355935e-05,
"loss": 0.8763378858566284,
"step": 168
},
{
"epoch": 1.69,
"grad_norm": 3.328064203262329,
"learning_rate": 2.2372881355932205e-05,
"loss": 0.38741162419319153,
"step": 169
},
{
"epoch": 1.7,
"grad_norm": 4.8324127197265625,
"learning_rate": 2.2203389830508474e-05,
"loss": 0.6983806490898132,
"step": 170
},
{
"epoch": 1.7,
"eval_loss": 0.783511757850647,
"eval_runtime": 10.4627,
"eval_samples_per_second": 4.779,
"eval_steps_per_second": 1.243,
"step": 170
},
{
"epoch": 1.71,
"grad_norm": 5.955052375793457,
"learning_rate": 2.2033898305084748e-05,
"loss": 0.7046060562133789,
"step": 171
},
{
"epoch": 1.72,
"grad_norm": 3.2024405002593994,
"learning_rate": 2.1864406779661017e-05,
"loss": 0.3926011025905609,
"step": 172
},
{
"epoch": 1.73,
"grad_norm": 4.408883094787598,
"learning_rate": 2.1694915254237287e-05,
"loss": 0.7221513986587524,
"step": 173
},
{
"epoch": 1.74,
"grad_norm": 4.005696773529053,
"learning_rate": 2.152542372881356e-05,
"loss": 0.4904850721359253,
"step": 174
},
{
"epoch": 1.75,
"grad_norm": 4.627394676208496,
"learning_rate": 2.135593220338983e-05,
"loss": 0.8846985697746277,
"step": 175
},
{
"epoch": 1.76,
"grad_norm": 4.043165683746338,
"learning_rate": 2.1186440677966103e-05,
"loss": 0.5595154762268066,
"step": 176
},
{
"epoch": 1.77,
"grad_norm": 4.143712043762207,
"learning_rate": 2.1016949152542373e-05,
"loss": 0.5446280241012573,
"step": 177
},
{
"epoch": 1.78,
"grad_norm": 4.060466289520264,
"learning_rate": 2.0847457627118643e-05,
"loss": 1.0036275386810303,
"step": 178
},
{
"epoch": 1.79,
"grad_norm": 4.95820951461792,
"learning_rate": 2.0677966101694916e-05,
"loss": 0.7362010478973389,
"step": 179
},
{
"epoch": 1.8,
"grad_norm": 5.336428642272949,
"learning_rate": 2.0508474576271186e-05,
"loss": 0.9676293134689331,
"step": 180
},
{
"epoch": 1.8,
"eval_loss": 0.7665973901748657,
"eval_runtime": 10.57,
"eval_samples_per_second": 4.73,
"eval_steps_per_second": 1.23,
"step": 180
},
{
"epoch": 1.81,
"grad_norm": 4.624020576477051,
"learning_rate": 2.033898305084746e-05,
"loss": 0.7884280681610107,
"step": 181
},
{
"epoch": 1.8199999999999998,
"grad_norm": 4.080319881439209,
"learning_rate": 2.0169491525423732e-05,
"loss": 0.7528167366981506,
"step": 182
},
{
"epoch": 1.83,
"grad_norm": 3.8621630668640137,
"learning_rate": 2e-05,
"loss": 0.359611839056015,
"step": 183
},
{
"epoch": 1.8399999999999999,
"grad_norm": 4.3126044273376465,
"learning_rate": 1.9830508474576275e-05,
"loss": 0.7799245119094849,
"step": 184
},
{
"epoch": 1.85,
"grad_norm": 5.139199733734131,
"learning_rate": 1.9661016949152545e-05,
"loss": 0.7583558559417725,
"step": 185
},
{
"epoch": 1.8599999999999999,
"grad_norm": 6.716911792755127,
"learning_rate": 1.9491525423728814e-05,
"loss": 0.8812576532363892,
"step": 186
},
{
"epoch": 1.87,
"grad_norm": 3.618638753890991,
"learning_rate": 1.9322033898305087e-05,
"loss": 0.5522023439407349,
"step": 187
},
{
"epoch": 1.88,
"grad_norm": 4.608384609222412,
"learning_rate": 1.9152542372881357e-05,
"loss": 0.7934961915016174,
"step": 188
},
{
"epoch": 1.8900000000000001,
"grad_norm": 3.8429253101348877,
"learning_rate": 1.8983050847457627e-05,
"loss": 0.7566116452217102,
"step": 189
},
{
"epoch": 1.9,
"grad_norm": 4.350630760192871,
"learning_rate": 1.88135593220339e-05,
"loss": 1.1161444187164307,
"step": 190
},
{
"epoch": 1.9,
"eval_loss": 0.7596007585525513,
"eval_runtime": 10.4304,
"eval_samples_per_second": 4.794,
"eval_steps_per_second": 1.246,
"step": 190
},
{
"epoch": 1.9100000000000001,
"grad_norm": 6.2052693367004395,
"learning_rate": 1.864406779661017e-05,
"loss": 1.0721242427825928,
"step": 191
},
{
"epoch": 1.92,
"grad_norm": 4.214809894561768,
"learning_rate": 1.8474576271186443e-05,
"loss": 0.6916230320930481,
"step": 192
},
{
"epoch": 1.9300000000000002,
"grad_norm": 4.563894748687744,
"learning_rate": 1.8305084745762713e-05,
"loss": 0.723818302154541,
"step": 193
},
{
"epoch": 1.94,
"grad_norm": 4.349660396575928,
"learning_rate": 1.8135593220338983e-05,
"loss": 0.5308845043182373,
"step": 194
},
{
"epoch": 1.95,
"grad_norm": 3.686095952987671,
"learning_rate": 1.7966101694915256e-05,
"loss": 0.6355664134025574,
"step": 195
},
{
"epoch": 1.96,
"grad_norm": 4.236448764801025,
"learning_rate": 1.7796610169491526e-05,
"loss": 0.9110107421875,
"step": 196
},
{
"epoch": 1.97,
"grad_norm": 5.191247940063477,
"learning_rate": 1.76271186440678e-05,
"loss": 0.67449951171875,
"step": 197
},
{
"epoch": 1.98,
"grad_norm": 4.529877185821533,
"learning_rate": 1.745762711864407e-05,
"loss": 0.7508682012557983,
"step": 198
},
{
"epoch": 1.99,
"grad_norm": 4.2237114906311035,
"learning_rate": 1.7288135593220338e-05,
"loss": 0.754319429397583,
"step": 199
},
{
"epoch": 2.0,
"grad_norm": 3.1518990993499756,
"learning_rate": 1.711864406779661e-05,
"loss": 0.38771724700927734,
"step": 200
},
{
"epoch": 2.0,
"eval_loss": 0.748096227645874,
"eval_runtime": 10.5764,
"eval_samples_per_second": 4.728,
"eval_steps_per_second": 1.229,
"step": 200
},
{
"epoch": 2.01,
"grad_norm": 4.756067276000977,
"learning_rate": 1.694915254237288e-05,
"loss": 0.8442893028259277,
"step": 201
},
{
"epoch": 2.02,
"grad_norm": 2.407986879348755,
"learning_rate": 1.677966101694915e-05,
"loss": 0.2591170072555542,
"step": 202
},
{
"epoch": 2.03,
"grad_norm": 3.7906224727630615,
"learning_rate": 1.6610169491525424e-05,
"loss": 0.615460991859436,
"step": 203
},
{
"epoch": 2.04,
"grad_norm": 2.9201526641845703,
"learning_rate": 1.6440677966101694e-05,
"loss": 0.3375573456287384,
"step": 204
},
{
"epoch": 2.05,
"grad_norm": 4.151691436767578,
"learning_rate": 1.6271186440677967e-05,
"loss": 0.5159956216812134,
"step": 205
},
{
"epoch": 2.06,
"grad_norm": 3.190227746963501,
"learning_rate": 1.6101694915254237e-05,
"loss": 0.5736207365989685,
"step": 206
},
{
"epoch": 2.07,
"grad_norm": 3.9260635375976562,
"learning_rate": 1.5932203389830507e-05,
"loss": 0.5822122097015381,
"step": 207
},
{
"epoch": 2.08,
"grad_norm": 3.801342248916626,
"learning_rate": 1.5762711864406783e-05,
"loss": 0.7866559028625488,
"step": 208
},
{
"epoch": 2.09,
"grad_norm": 2.5395450592041016,
"learning_rate": 1.5593220338983053e-05,
"loss": 0.16854310035705566,
"step": 209
},
{
"epoch": 2.1,
"grad_norm": 3.6041147708892822,
"learning_rate": 1.5423728813559323e-05,
"loss": 0.6555718183517456,
"step": 210
},
{
"epoch": 2.1,
"eval_loss": 0.7462721467018127,
"eval_runtime": 10.4751,
"eval_samples_per_second": 4.773,
"eval_steps_per_second": 1.241,
"step": 210
},
{
"epoch": 2.11,
"grad_norm": 4.59889554977417,
"learning_rate": 1.5254237288135596e-05,
"loss": 0.7171648740768433,
"step": 211
},
{
"epoch": 2.12,
"grad_norm": 4.827288627624512,
"learning_rate": 1.5084745762711865e-05,
"loss": 0.6859066486358643,
"step": 212
},
{
"epoch": 2.13,
"grad_norm": 3.9007222652435303,
"learning_rate": 1.4915254237288137e-05,
"loss": 0.3966018557548523,
"step": 213
},
{
"epoch": 2.14,
"grad_norm": 3.4077553749084473,
"learning_rate": 1.4745762711864408e-05,
"loss": 0.4559192955493927,
"step": 214
},
{
"epoch": 2.15,
"grad_norm": 2.9389071464538574,
"learning_rate": 1.457627118644068e-05,
"loss": 0.2492818832397461,
"step": 215
},
{
"epoch": 2.16,
"grad_norm": 3.6455228328704834,
"learning_rate": 1.440677966101695e-05,
"loss": 0.36154627799987793,
"step": 216
},
{
"epoch": 2.17,
"grad_norm": 4.362058162689209,
"learning_rate": 1.4237288135593221e-05,
"loss": 0.6034772992134094,
"step": 217
},
{
"epoch": 2.18,
"grad_norm": 3.315302610397339,
"learning_rate": 1.4067796610169493e-05,
"loss": 0.36897361278533936,
"step": 218
},
{
"epoch": 2.19,
"grad_norm": 4.22495698928833,
"learning_rate": 1.3898305084745764e-05,
"loss": 0.5540156364440918,
"step": 219
},
{
"epoch": 2.2,
"grad_norm": 3.7783079147338867,
"learning_rate": 1.3728813559322034e-05,
"loss": 0.42492803931236267,
"step": 220
},
{
"epoch": 2.2,
"eval_loss": 0.7445352673530579,
"eval_runtime": 10.5387,
"eval_samples_per_second": 4.744,
"eval_steps_per_second": 1.234,
"step": 220
},
{
"epoch": 2.21,
"grad_norm": 4.768266677856445,
"learning_rate": 1.3559322033898305e-05,
"loss": 0.8314548134803772,
"step": 221
},
{
"epoch": 2.22,
"grad_norm": 4.823266983032227,
"learning_rate": 1.3389830508474577e-05,
"loss": 0.8914871215820312,
"step": 222
},
{
"epoch": 2.23,
"grad_norm": 4.467077732086182,
"learning_rate": 1.3220338983050848e-05,
"loss": 0.6289864778518677,
"step": 223
},
{
"epoch": 2.24,
"grad_norm": 3.564117670059204,
"learning_rate": 1.305084745762712e-05,
"loss": 0.4313690662384033,
"step": 224
},
{
"epoch": 2.25,
"grad_norm": 4.569112777709961,
"learning_rate": 1.288135593220339e-05,
"loss": 0.7361366748809814,
"step": 225
},
{
"epoch": 2.26,
"grad_norm": 3.224374771118164,
"learning_rate": 1.2711864406779661e-05,
"loss": 0.3516356945037842,
"step": 226
},
{
"epoch": 2.27,
"grad_norm": 3.3676211833953857,
"learning_rate": 1.2542372881355932e-05,
"loss": 0.34025299549102783,
"step": 227
},
{
"epoch": 2.2800000000000002,
"grad_norm": 3.8791003227233887,
"learning_rate": 1.2372881355932204e-05,
"loss": 0.5088775753974915,
"step": 228
},
{
"epoch": 2.29,
"grad_norm": 4.541592121124268,
"learning_rate": 1.2203389830508475e-05,
"loss": 0.601324737071991,
"step": 229
},
{
"epoch": 2.3,
"grad_norm": 3.3689284324645996,
"learning_rate": 1.2033898305084747e-05,
"loss": 0.41244012117385864,
"step": 230
},
{
"epoch": 2.3,
"eval_loss": 0.7424150705337524,
"eval_runtime": 10.4698,
"eval_samples_per_second": 4.776,
"eval_steps_per_second": 1.242,
"step": 230
},
{
"epoch": 2.31,
"grad_norm": 4.8993401527404785,
"learning_rate": 1.1864406779661018e-05,
"loss": 0.5075249671936035,
"step": 231
},
{
"epoch": 2.32,
"grad_norm": 4.3737335205078125,
"learning_rate": 1.169491525423729e-05,
"loss": 0.7778846025466919,
"step": 232
},
{
"epoch": 2.33,
"grad_norm": 4.243771076202393,
"learning_rate": 1.152542372881356e-05,
"loss": 0.603270947933197,
"step": 233
},
{
"epoch": 2.34,
"grad_norm": 4.146023273468018,
"learning_rate": 1.135593220338983e-05,
"loss": 0.3626275062561035,
"step": 234
},
{
"epoch": 2.35,
"grad_norm": 3.925482749938965,
"learning_rate": 1.1186440677966102e-05,
"loss": 0.39122286438941956,
"step": 235
},
{
"epoch": 2.36,
"grad_norm": 4.391947269439697,
"learning_rate": 1.1016949152542374e-05,
"loss": 0.4967750608921051,
"step": 236
},
{
"epoch": 2.37,
"grad_norm": 4.018784523010254,
"learning_rate": 1.0847457627118644e-05,
"loss": 0.5598036050796509,
"step": 237
},
{
"epoch": 2.38,
"grad_norm": 5.207327365875244,
"learning_rate": 1.0677966101694915e-05,
"loss": 0.7488052248954773,
"step": 238
},
{
"epoch": 2.39,
"grad_norm": 4.637012958526611,
"learning_rate": 1.0508474576271186e-05,
"loss": 0.4916081428527832,
"step": 239
},
{
"epoch": 2.4,
"grad_norm": 3.2030515670776367,
"learning_rate": 1.0338983050847458e-05,
"loss": 0.29091301560401917,
"step": 240
},
{
"epoch": 2.4,
"eval_loss": 0.7452782988548279,
"eval_runtime": 10.5475,
"eval_samples_per_second": 4.74,
"eval_steps_per_second": 1.233,
"step": 240
},
{
"epoch": 2.41,
"grad_norm": 3.7656896114349365,
"learning_rate": 1.016949152542373e-05,
"loss": 0.4640662670135498,
"step": 241
},
{
"epoch": 2.42,
"grad_norm": 4.198912620544434,
"learning_rate": 1e-05,
"loss": 0.4760119616985321,
"step": 242
},
{
"epoch": 2.43,
"grad_norm": 3.9374730587005615,
"learning_rate": 9.830508474576272e-06,
"loss": 0.5041056871414185,
"step": 243
},
{
"epoch": 2.44,
"grad_norm": 4.505242347717285,
"learning_rate": 9.661016949152544e-06,
"loss": 0.4311569929122925,
"step": 244
},
{
"epoch": 2.45,
"grad_norm": 4.849708557128906,
"learning_rate": 9.491525423728814e-06,
"loss": 0.548703670501709,
"step": 245
},
{
"epoch": 2.46,
"grad_norm": 4.121421813964844,
"learning_rate": 9.322033898305085e-06,
"loss": 0.45375338196754456,
"step": 246
},
{
"epoch": 2.4699999999999998,
"grad_norm": 3.7727108001708984,
"learning_rate": 9.152542372881356e-06,
"loss": 0.4455665647983551,
"step": 247
},
{
"epoch": 2.48,
"grad_norm": 2.721365451812744,
"learning_rate": 8.983050847457628e-06,
"loss": 0.16414612531661987,
"step": 248
},
{
"epoch": 2.49,
"grad_norm": 3.936626672744751,
"learning_rate": 8.8135593220339e-06,
"loss": 0.3845076858997345,
"step": 249
},
{
"epoch": 2.5,
"grad_norm": 3.884049892425537,
"learning_rate": 8.644067796610169e-06,
"loss": 0.3058445453643799,
"step": 250
},
{
"epoch": 2.5,
"eval_loss": 0.7490795254707336,
"eval_runtime": 10.5494,
"eval_samples_per_second": 4.74,
"eval_steps_per_second": 1.232,
"step": 250
},
{
"epoch": 2.51,
"grad_norm": 4.518977642059326,
"learning_rate": 8.47457627118644e-06,
"loss": 0.4311170279979706,
"step": 251
},
{
"epoch": 2.52,
"grad_norm": 3.1348767280578613,
"learning_rate": 8.305084745762712e-06,
"loss": 0.1400333195924759,
"step": 252
},
{
"epoch": 2.5300000000000002,
"grad_norm": 3.7422611713409424,
"learning_rate": 8.135593220338983e-06,
"loss": 0.30716025829315186,
"step": 253
},
{
"epoch": 2.54,
"grad_norm": 3.4168741703033447,
"learning_rate": 7.966101694915253e-06,
"loss": 0.3157922327518463,
"step": 254
},
{
"epoch": 2.55,
"grad_norm": 6.298641681671143,
"learning_rate": 7.796610169491526e-06,
"loss": 0.5035271644592285,
"step": 255
},
{
"epoch": 2.56,
"grad_norm": 5.411360263824463,
"learning_rate": 7.627118644067798e-06,
"loss": 0.5631099939346313,
"step": 256
},
{
"epoch": 2.57,
"grad_norm": 5.717187881469727,
"learning_rate": 7.4576271186440685e-06,
"loss": 0.8222908973693848,
"step": 257
},
{
"epoch": 2.58,
"grad_norm": 2.9918878078460693,
"learning_rate": 7.28813559322034e-06,
"loss": 0.3001285493373871,
"step": 258
},
{
"epoch": 2.59,
"grad_norm": 4.3396477699279785,
"learning_rate": 7.1186440677966106e-06,
"loss": 0.6768161058425903,
"step": 259
},
{
"epoch": 2.6,
"grad_norm": 4.240561485290527,
"learning_rate": 6.949152542372882e-06,
"loss": 0.4941096603870392,
"step": 260
},
{
"epoch": 2.6,
"eval_loss": 0.7449108958244324,
"eval_runtime": 10.4773,
"eval_samples_per_second": 4.772,
"eval_steps_per_second": 1.241,
"step": 260
},
{
"epoch": 2.61,
"grad_norm": 4.376451015472412,
"learning_rate": 6.779661016949153e-06,
"loss": 0.5374529361724854,
"step": 261
},
{
"epoch": 2.62,
"grad_norm": 4.466104507446289,
"learning_rate": 6.610169491525424e-06,
"loss": 0.46696433424949646,
"step": 262
},
{
"epoch": 2.63,
"grad_norm": 5.163613796234131,
"learning_rate": 6.440677966101695e-06,
"loss": 0.8027138710021973,
"step": 263
},
{
"epoch": 2.64,
"grad_norm": 5.427565574645996,
"learning_rate": 6.271186440677966e-06,
"loss": 0.6850484609603882,
"step": 264
},
{
"epoch": 2.65,
"grad_norm": 4.712081432342529,
"learning_rate": 6.101694915254238e-06,
"loss": 0.7560044527053833,
"step": 265
},
{
"epoch": 2.66,
"grad_norm": 4.958877086639404,
"learning_rate": 5.932203389830509e-06,
"loss": 0.5031318664550781,
"step": 266
},
{
"epoch": 2.67,
"grad_norm": 3.9471256732940674,
"learning_rate": 5.76271186440678e-06,
"loss": 0.4162135124206543,
"step": 267
},
{
"epoch": 2.68,
"grad_norm": 4.522920608520508,
"learning_rate": 5.593220338983051e-06,
"loss": 0.6205202341079712,
"step": 268
},
{
"epoch": 2.69,
"grad_norm": 4.621407985687256,
"learning_rate": 5.423728813559322e-06,
"loss": 0.6124860048294067,
"step": 269
},
{
"epoch": 2.7,
"grad_norm": 4.203001022338867,
"learning_rate": 5.254237288135593e-06,
"loss": 0.3314371705055237,
"step": 270
},
{
"epoch": 2.7,
"eval_loss": 0.7436569333076477,
"eval_runtime": 10.5589,
"eval_samples_per_second": 4.735,
"eval_steps_per_second": 1.231,
"step": 270
},
{
"epoch": 2.71,
"grad_norm": 4.5933146476745605,
"learning_rate": 5.084745762711865e-06,
"loss": 0.6096494197845459,
"step": 271
},
{
"epoch": 2.7199999999999998,
"grad_norm": 4.2127556800842285,
"learning_rate": 4.915254237288136e-06,
"loss": 0.3488788306713104,
"step": 272
},
{
"epoch": 2.73,
"grad_norm": 4.75225830078125,
"learning_rate": 4.745762711864407e-06,
"loss": 0.5169786810874939,
"step": 273
},
{
"epoch": 2.74,
"grad_norm": 4.652107238769531,
"learning_rate": 4.576271186440678e-06,
"loss": 0.5631539225578308,
"step": 274
},
{
"epoch": 2.75,
"grad_norm": 3.953155040740967,
"learning_rate": 4.40677966101695e-06,
"loss": 0.4040937125682831,
"step": 275
},
{
"epoch": 2.76,
"grad_norm": 4.4784321784973145,
"learning_rate": 4.23728813559322e-06,
"loss": 0.5270670652389526,
"step": 276
},
{
"epoch": 2.77,
"grad_norm": 3.3616812229156494,
"learning_rate": 4.067796610169492e-06,
"loss": 0.13670852780342102,
"step": 277
},
{
"epoch": 2.7800000000000002,
"grad_norm": 5.350213527679443,
"learning_rate": 3.898305084745763e-06,
"loss": 0.47367870807647705,
"step": 278
},
{
"epoch": 2.79,
"grad_norm": 5.012064456939697,
"learning_rate": 3.7288135593220342e-06,
"loss": 0.5406288504600525,
"step": 279
},
{
"epoch": 2.8,
"grad_norm": 4.971132755279541,
"learning_rate": 3.5593220338983053e-06,
"loss": 0.42528069019317627,
"step": 280
},
{
"epoch": 2.8,
"eval_loss": 0.7403196692466736,
"eval_runtime": 10.4741,
"eval_samples_per_second": 4.774,
"eval_steps_per_second": 1.241,
"step": 280
},
{
"epoch": 2.81,
"grad_norm": 3.396833896636963,
"learning_rate": 3.3898305084745763e-06,
"loss": 0.39383459091186523,
"step": 281
},
{
"epoch": 2.82,
"grad_norm": 4.54819393157959,
"learning_rate": 3.2203389830508473e-06,
"loss": 0.4831952750682831,
"step": 282
},
{
"epoch": 2.83,
"grad_norm": 4.474612712860107,
"learning_rate": 3.050847457627119e-06,
"loss": 0.3103906512260437,
"step": 283
},
{
"epoch": 2.84,
"grad_norm": 4.079206943511963,
"learning_rate": 2.88135593220339e-06,
"loss": 0.27305999398231506,
"step": 284
},
{
"epoch": 2.85,
"grad_norm": 4.2237162590026855,
"learning_rate": 2.711864406779661e-06,
"loss": 0.3555063009262085,
"step": 285
},
{
"epoch": 2.86,
"grad_norm": 4.291693210601807,
"learning_rate": 2.5423728813559323e-06,
"loss": 0.3443983495235443,
"step": 286
},
{
"epoch": 2.87,
"grad_norm": 3.238297939300537,
"learning_rate": 2.3728813559322034e-06,
"loss": 0.19806131720542908,
"step": 287
},
{
"epoch": 2.88,
"grad_norm": 3.869232416152954,
"learning_rate": 2.203389830508475e-06,
"loss": 0.4080967307090759,
"step": 288
},
{
"epoch": 2.89,
"grad_norm": 4.259891033172607,
"learning_rate": 2.033898305084746e-06,
"loss": 0.4458335041999817,
"step": 289
},
{
"epoch": 2.9,
"grad_norm": 4.1766557693481445,
"learning_rate": 1.8644067796610171e-06,
"loss": 0.5159390568733215,
"step": 290
},
{
"epoch": 2.9,
"eval_loss": 0.7389218211174011,
"eval_runtime": 10.5626,
"eval_samples_per_second": 4.734,
"eval_steps_per_second": 1.231,
"step": 290
},
{
"epoch": 2.91,
"grad_norm": 3.719733476638794,
"learning_rate": 1.6949152542372882e-06,
"loss": 0.2699396014213562,
"step": 291
},
{
"epoch": 2.92,
"grad_norm": 4.313116550445557,
"learning_rate": 1.5254237288135594e-06,
"loss": 0.4564172327518463,
"step": 292
},
{
"epoch": 2.93,
"grad_norm": 4.104086399078369,
"learning_rate": 1.3559322033898304e-06,
"loss": 0.3594495356082916,
"step": 293
},
{
"epoch": 2.94,
"grad_norm": 5.0959153175354,
"learning_rate": 1.1864406779661017e-06,
"loss": 0.7568333148956299,
"step": 294
},
{
"epoch": 2.95,
"grad_norm": 4.795676231384277,
"learning_rate": 1.016949152542373e-06,
"loss": 0.4190475344657898,
"step": 295
},
{
"epoch": 2.96,
"grad_norm": 4.589761734008789,
"learning_rate": 8.474576271186441e-07,
"loss": 0.6360308527946472,
"step": 296
},
{
"epoch": 2.9699999999999998,
"grad_norm": 5.352736949920654,
"learning_rate": 6.779661016949152e-07,
"loss": 0.6757811307907104,
"step": 297
},
{
"epoch": 2.98,
"grad_norm": 3.8393356800079346,
"learning_rate": 5.084745762711865e-07,
"loss": 0.48068177700042725,
"step": 298
},
{
"epoch": 2.99,
"grad_norm": 4.459935665130615,
"learning_rate": 3.389830508474576e-07,
"loss": 0.5616963505744934,
"step": 299
},
{
"epoch": 3.0,
"grad_norm": 5.2715349197387695,
"learning_rate": 1.694915254237288e-07,
"loss": 0.5508431792259216,
"step": 300
},
{
"epoch": 3.0,
"eval_loss": 0.7383912801742554,
"eval_runtime": 10.5176,
"eval_samples_per_second": 4.754,
"eval_steps_per_second": 1.236,
"step": 300
}
],
"logging_steps": 1,
"max_steps": 300,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 10,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 8255986589039616.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}