gemma_4_lora_E4b / checkpoint-700 /trainer_state.json
HoangVuSnape's picture
Training in progress, step 700, checkpoint
860d110 verified
Raw
History Blame Contribute Delete
15.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.5599553820412715,
"eval_steps": 100,
"global_step": 700,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.022308979364194088,
"grad_norm": 4.709710597991943,
"learning_rate": 0.00019999446787180336,
"loss": 3.676974868774414,
"step": 10
},
{
"epoch": 0.044617958728388175,
"grad_norm": 1.4567488431930542,
"learning_rate": 0.00019989613595281384,
"loss": 0.9999975204467774,
"step": 20
},
{
"epoch": 0.06692693809258227,
"grad_norm": 1.1962672472000122,
"learning_rate": 0.00019967500698688952,
"loss": 0.6824670314788819,
"step": 30
},
{
"epoch": 0.08923591745677635,
"grad_norm": 0.8628137707710266,
"learning_rate": 0.0001993313527961959,
"loss": 0.5993218421936035,
"step": 40
},
{
"epoch": 0.11154489682097044,
"grad_norm": 1.0308934450149536,
"learning_rate": 0.00019886559581668999,
"loss": 0.542162561416626,
"step": 50
},
{
"epoch": 0.13385387618516453,
"grad_norm": 0.9261613488197327,
"learning_rate": 0.00019827830857884173,
"loss": 0.44734554290771483,
"step": 60
},
{
"epoch": 0.1561628555493586,
"grad_norm": 0.9318423867225647,
"learning_rate": 0.00019757021300385286,
"loss": 0.44412760734558104,
"step": 70
},
{
"epoch": 0.1784718349135527,
"grad_norm": 0.5784896612167358,
"learning_rate": 0.00019674217951623707,
"loss": 0.40378632545471194,
"step": 80
},
{
"epoch": 0.2007808142777468,
"grad_norm": 0.7836484909057617,
"learning_rate": 0.00019579522597385315,
"loss": 0.3856403350830078,
"step": 90
},
{
"epoch": 0.22308979364194087,
"grad_norm": 0.6503493189811707,
"learning_rate": 0.00019473051641670606,
"loss": 0.3800614356994629,
"step": 100
},
{
"epoch": 0.22308979364194087,
"eval_loss": 8.158984184265137,
"eval_runtime": 248.821,
"eval_samples_per_second": 1.813,
"eval_steps_per_second": 1.813,
"step": 100
},
{
"epoch": 0.24539877300613497,
"grad_norm": 0.582433819770813,
"learning_rate": 0.00019354935963605393,
"loss": 0.34090685844421387,
"step": 110
},
{
"epoch": 0.26770775237032907,
"grad_norm": 0.6219270825386047,
"learning_rate": 0.00019225320756558023,
"loss": 0.3560009956359863,
"step": 120
},
{
"epoch": 0.29001673173452314,
"grad_norm": 0.5081164836883545,
"learning_rate": 0.0001908436534966081,
"loss": 0.32209837436676025,
"step": 130
},
{
"epoch": 0.3123257110987172,
"grad_norm": 1.0672804117202759,
"learning_rate": 0.00018932243011955154,
"loss": 0.4280549049377441,
"step": 140
},
{
"epoch": 0.33463469046291133,
"grad_norm": 0.5716775059700012,
"learning_rate": 0.00018769140739401062,
"loss": 0.29103860855102537,
"step": 150
},
{
"epoch": 0.3569436698271054,
"grad_norm": 0.6793851256370544,
"learning_rate": 0.00018595259025012877,
"loss": 0.3713259696960449,
"step": 160
},
{
"epoch": 0.3792526491912995,
"grad_norm": 0.6091159582138062,
"learning_rate": 0.0001841081161240379,
"loss": 0.3802988529205322,
"step": 170
},
{
"epoch": 0.4015616285554936,
"grad_norm": 0.7563126087188721,
"learning_rate": 0.0001821602523304211,
"loss": 0.3028958082199097,
"step": 180
},
{
"epoch": 0.42387060791968767,
"grad_norm": 0.5827437043190002,
"learning_rate": 0.00018011139327542237,
"loss": 0.3516202211380005,
"step": 190
},
{
"epoch": 0.44617958728388174,
"grad_norm": 0.6265884041786194,
"learning_rate": 0.0001779640575133296,
"loss": 0.3505818843841553,
"step": 200
},
{
"epoch": 0.44617958728388174,
"eval_loss": 6.77685546875,
"eval_runtime": 246.6844,
"eval_samples_per_second": 1.828,
"eval_steps_per_second": 1.828,
"step": 200
},
{
"epoch": 0.46848856664807587,
"grad_norm": 0.4515160024166107,
"learning_rate": 0.00017572088465064848,
"loss": 0.30297350883483887,
"step": 210
},
{
"epoch": 0.49079754601226994,
"grad_norm": 0.47408005595207214,
"learning_rate": 0.0001733846321013738,
"loss": 0.30213174819946287,
"step": 220
},
{
"epoch": 0.5131065253764641,
"grad_norm": 0.43776413798332214,
"learning_rate": 0.00017095817169744595,
"loss": 0.2981758117675781,
"step": 230
},
{
"epoch": 0.5354155047406581,
"grad_norm": 0.5996765494346619,
"learning_rate": 0.00016844448615855933,
"loss": 0.2770395278930664,
"step": 240
},
{
"epoch": 0.5577244841048522,
"grad_norm": 1.4966278076171875,
"learning_rate": 0.0001658466654256627,
"loss": 0.3032949924468994,
"step": 250
},
{
"epoch": 0.5800334634690463,
"grad_norm": 0.5301216840744019,
"learning_rate": 0.00016316790286265763,
"loss": 0.3215930700302124,
"step": 260
},
{
"epoch": 0.6023424428332403,
"grad_norm": 0.5374172925949097,
"learning_rate": 0.00016041149133096512,
"loss": 0.29086947441101074,
"step": 270
},
{
"epoch": 0.6246514221974344,
"grad_norm": 0.5407304167747498,
"learning_rate": 0.00015758081914178456,
"loss": 0.26963791847229,
"step": 280
},
{
"epoch": 0.6469604015616286,
"grad_norm": 0.40757226943969727,
"learning_rate": 0.00015467936589102176,
"loss": 0.3320644378662109,
"step": 290
},
{
"epoch": 0.6692693809258227,
"grad_norm": 0.36359116435050964,
"learning_rate": 0.00015171069818200548,
"loss": 0.28259494304656985,
"step": 300
},
{
"epoch": 0.6692693809258227,
"eval_loss": 6.212057590484619,
"eval_runtime": 246.7095,
"eval_samples_per_second": 1.828,
"eval_steps_per_second": 1.828,
"step": 300
},
{
"epoch": 0.6915783602900167,
"grad_norm": 0.508072018623352,
"learning_rate": 0.00014867846524125,
"loss": 0.29235794544219973,
"step": 310
},
{
"epoch": 0.7138873396542108,
"grad_norm": 0.7422248125076294,
"learning_rate": 0.0001455863944326538,
"loss": 0.3195211887359619,
"step": 320
},
{
"epoch": 0.7361963190184049,
"grad_norm": 0.6975764632225037,
"learning_rate": 0.00014243828667564768,
"loss": 0.30194265842437745,
"step": 330
},
{
"epoch": 0.758505298382599,
"grad_norm": 0.607437014579773,
"learning_rate": 0.00013923801177292527,
"loss": 0.2903664350509644,
"step": 340
},
{
"epoch": 0.7808142777467931,
"grad_norm": 0.5284196734428406,
"learning_rate": 0.00013598950365349883,
"loss": 0.2615989923477173,
"step": 350
},
{
"epoch": 0.8031232571109872,
"grad_norm": 0.44667983055114746,
"learning_rate": 0.00013269675553692785,
"loss": 0.32799758911132815,
"step": 360
},
{
"epoch": 0.8254322364751813,
"grad_norm": 0.440305233001709,
"learning_rate": 0.00012936381502466523,
"loss": 0.28976309299468994,
"step": 370
},
{
"epoch": 0.8477412158393753,
"grad_norm": 0.5174661874771118,
"learning_rate": 0.00012599477912455425,
"loss": 0.2578805685043335,
"step": 380
},
{
"epoch": 0.8700501952035694,
"grad_norm": 0.33937904238700867,
"learning_rate": 0.0001225937892145932,
"loss": 0.27044386863708497,
"step": 390
},
{
"epoch": 0.8923591745677635,
"grad_norm": 0.5235030651092529,
"learning_rate": 0.000119165025952158,
"loss": 0.2892023801803589,
"step": 400
},
{
"epoch": 0.8923591745677635,
"eval_loss": 5.747542381286621,
"eval_runtime": 249.1726,
"eval_samples_per_second": 1.81,
"eval_steps_per_second": 1.81,
"step": 400
},
{
"epoch": 0.9146681539319577,
"grad_norm": 0.4365766942501068,
"learning_rate": 0.00011571270413494082,
"loss": 0.28197059631347654,
"step": 410
},
{
"epoch": 0.9369771332961517,
"grad_norm": 0.42031630873680115,
"learning_rate": 0.00011224106751992163,
"loss": 0.2776280641555786,
"step": 420
},
{
"epoch": 0.9592861126603458,
"grad_norm": 0.41079336404800415,
"learning_rate": 0.0001087543836067418,
"loss": 0.23740179538726808,
"step": 430
},
{
"epoch": 0.9815950920245399,
"grad_norm": 0.6885762810707092,
"learning_rate": 0.00010525693839189214,
"loss": 0.2687765836715698,
"step": 440
},
{
"epoch": 1.0022308979364194,
"grad_norm": 0.4392392337322235,
"learning_rate": 0.00010175303110016343,
"loss": 0.3171211004257202,
"step": 450
},
{
"epoch": 1.0245398773006136,
"grad_norm": 0.3510143756866455,
"learning_rate": 9.824696889983662e-05,
"loss": 0.23552191257476807,
"step": 460
},
{
"epoch": 1.0468488566648075,
"grad_norm": 0.3384598195552826,
"learning_rate": 9.474306160810791e-05,
"loss": 0.23134019374847412,
"step": 470
},
{
"epoch": 1.0691578360290017,
"grad_norm": 0.40072542428970337,
"learning_rate": 9.124561639325822e-05,
"loss": 0.23302733898162842,
"step": 480
},
{
"epoch": 1.0914668153931957,
"grad_norm": 0.45970481634140015,
"learning_rate": 8.775893248007839e-05,
"loss": 0.2210915803909302,
"step": 490
},
{
"epoch": 1.1137757947573899,
"grad_norm": 0.4819018840789795,
"learning_rate": 8.42872958650592e-05,
"loss": 0.22845861911773682,
"step": 500
},
{
"epoch": 1.1137757947573899,
"eval_loss": 5.7599334716796875,
"eval_runtime": 243.806,
"eval_samples_per_second": 1.85,
"eval_steps_per_second": 1.85,
"step": 500
},
{
"epoch": 1.136084774121584,
"grad_norm": 0.3909103572368622,
"learning_rate": 8.083497404784201e-05,
"loss": 0.253029990196228,
"step": 510
},
{
"epoch": 1.158393753485778,
"grad_norm": 0.49080875515937805,
"learning_rate": 7.740621078540684e-05,
"loss": 0.22022719383239747,
"step": 520
},
{
"epoch": 1.1807027328499722,
"grad_norm": 0.3979121446609497,
"learning_rate": 7.400522087544582e-05,
"loss": 0.24559009075164795,
"step": 530
},
{
"epoch": 1.2030117122141661,
"grad_norm": 0.6220426559448242,
"learning_rate": 7.063618497533479e-05,
"loss": 0.23752431869506835,
"step": 540
},
{
"epoch": 1.2253206915783603,
"grad_norm": 0.3583706319332123,
"learning_rate": 6.730324446307217e-05,
"loss": 0.23795950412750244,
"step": 550
},
{
"epoch": 1.2476296709425543,
"grad_norm": 0.42460814118385315,
"learning_rate": 6.401049634650118e-05,
"loss": 0.22870173454284667,
"step": 560
},
{
"epoch": 1.2699386503067485,
"grad_norm": 0.4157378077507019,
"learning_rate": 6.076198822707475e-05,
"loss": 0.2094573736190796,
"step": 570
},
{
"epoch": 1.2922476296709426,
"grad_norm": 0.3690703511238098,
"learning_rate": 5.7561713324352365e-05,
"loss": 0.21153016090393068,
"step": 580
},
{
"epoch": 1.3145566090351366,
"grad_norm": 0.3393983542919159,
"learning_rate": 5.44136055673462e-05,
"loss": 0.23398885726928711,
"step": 590
},
{
"epoch": 1.3368655883993308,
"grad_norm": 0.4122086465358734,
"learning_rate": 5.1321534758750037e-05,
"loss": 0.2347275733947754,
"step": 600
},
{
"epoch": 1.3368655883993308,
"eval_loss": 5.804348468780518,
"eval_runtime": 244.347,
"eval_samples_per_second": 1.846,
"eval_steps_per_second": 1.846,
"step": 600
},
{
"epoch": 1.3591745677635247,
"grad_norm": 0.4437583386898041,
"learning_rate": 4.828930181799457e-05,
"loss": 0.2153022050857544,
"step": 610
},
{
"epoch": 1.381483547127719,
"grad_norm": 0.4642995595932007,
"learning_rate": 4.532063410897829e-05,
"loss": 0.22439846992492676,
"step": 620
},
{
"epoch": 1.4037925264919129,
"grad_norm": 0.7296940088272095,
"learning_rate": 4.241918085821547e-05,
"loss": 0.2058631181716919,
"step": 630
},
{
"epoch": 1.426101505856107,
"grad_norm": 0.5185000896453857,
"learning_rate": 3.9588508669034886e-05,
"loss": 0.21068837642669677,
"step": 640
},
{
"epoch": 1.4484104852203012,
"grad_norm": 0.41563302278518677,
"learning_rate": 3.683209713734237e-05,
"loss": 0.22028052806854248,
"step": 650
},
{
"epoch": 1.4707194645844952,
"grad_norm": 0.2550966739654541,
"learning_rate": 3.415333457433733e-05,
"loss": 0.2142402172088623,
"step": 660
},
{
"epoch": 1.4930284439486894,
"grad_norm": 0.5091217160224915,
"learning_rate": 3.155551384144069e-05,
"loss": 0.19590476751327515,
"step": 670
},
{
"epoch": 1.5153374233128836,
"grad_norm": 0.38000059127807617,
"learning_rate": 2.9041828302554074e-05,
"loss": 0.2405090570449829,
"step": 680
},
{
"epoch": 1.5376464026770775,
"grad_norm": 0.39434534311294556,
"learning_rate": 2.661536789862622e-05,
"loss": 0.25410382747650145,
"step": 690
},
{
"epoch": 1.5599553820412715,
"grad_norm": 0.449735552072525,
"learning_rate": 2.4279115349351543e-05,
"loss": 0.21624345779418946,
"step": 700
},
{
"epoch": 1.5599553820412715,
"eval_loss": 5.754471302032471,
"eval_runtime": 244.0702,
"eval_samples_per_second": 1.848,
"eval_steps_per_second": 1.848,
"step": 700
}
],
"logging_steps": 10,
"max_steps": 898,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.132487571153363e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}