main-v2-checkpoints / checkpoint-2000 /trainer_state.json
leafxyz's picture
Upload folder using huggingface_hub
19c8304 verified
Raw
History Blame Contribute Delete
21.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.18707323917313629,
"eval_steps": 200,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0023384154896642037,
"grad_norm": 1.9981695413589478,
"learning_rate": 4.4859813084112145e-06,
"loss": 0.47716766357421875,
"step": 25
},
{
"epoch": 0.004676830979328407,
"grad_norm": 1.9483280181884766,
"learning_rate": 9.158878504672897e-06,
"loss": 0.4592530059814453,
"step": 50
},
{
"epoch": 0.0070152464689926105,
"grad_norm": 2.1290855407714844,
"learning_rate": 1.3831775700934579e-05,
"loss": 0.394501838684082,
"step": 75
},
{
"epoch": 0.009353661958656815,
"grad_norm": 2.8394205570220947,
"learning_rate": 1.8504672897196264e-05,
"loss": 0.3752219009399414,
"step": 100
},
{
"epoch": 0.011692077448321018,
"grad_norm": 2.5833706855773926,
"learning_rate": 2.3177570093457944e-05,
"loss": 0.40475303649902344,
"step": 125
},
{
"epoch": 0.014030492937985221,
"grad_norm": 2.622011661529541,
"learning_rate": 2.7850467289719627e-05,
"loss": 0.45625301361083986,
"step": 150
},
{
"epoch": 0.016368908427649424,
"grad_norm": 2.9406535625457764,
"learning_rate": 3.2523364485981314e-05,
"loss": 0.34918937683105467,
"step": 175
},
{
"epoch": 0.01870732391731363,
"grad_norm": 3.8391785621643066,
"learning_rate": 3.7196261682242994e-05,
"loss": 0.41711517333984377,
"step": 200
},
{
"epoch": 0.01870732391731363,
"eval_pairs_with_negatives_loss": 0.3914637565612793,
"eval_pairs_with_negatives_runtime": 44.0353,
"eval_pairs_with_negatives_samples_per_second": 28.523,
"eval_pairs_with_negatives_steps_per_second": 3.565,
"step": 200
},
{
"epoch": 0.01870732391731363,
"eval_positives_loss": 0.1480681300163269,
"eval_positives_runtime": 51.7193,
"eval_positives_samples_per_second": 42.537,
"eval_positives_steps_per_second": 5.317,
"step": 200
},
{
"epoch": 0.02104573940697783,
"grad_norm": 2.3628170490264893,
"learning_rate": 4.186915887850468e-05,
"loss": 0.4296648406982422,
"step": 225
},
{
"epoch": 0.023384154896642036,
"grad_norm": 2.698835611343384,
"learning_rate": 4.6542056074766354e-05,
"loss": 0.43652393341064455,
"step": 250
},
{
"epoch": 0.02572257038630624,
"grad_norm": 4.1166558265686035,
"learning_rate": 5.121495327102804e-05,
"loss": 0.4344004440307617,
"step": 275
},
{
"epoch": 0.028060985875970442,
"grad_norm": 4.551556587219238,
"learning_rate": 5.588785046728973e-05,
"loss": 0.41842262268066405,
"step": 300
},
{
"epoch": 0.030399401365634647,
"grad_norm": 2.3925657272338867,
"learning_rate": 6.056074766355141e-05,
"loss": 0.4197782897949219,
"step": 325
},
{
"epoch": 0.03273781685529885,
"grad_norm": 3.1023190021514893,
"learning_rate": 6.52336448598131e-05,
"loss": 0.4292975616455078,
"step": 350
},
{
"epoch": 0.03507623234496305,
"grad_norm": 4.1481032371521,
"learning_rate": 6.990654205607478e-05,
"loss": 0.4758753204345703,
"step": 375
},
{
"epoch": 0.03741464783462726,
"grad_norm": 3.8799962997436523,
"learning_rate": 7.457943925233644e-05,
"loss": 0.3311753845214844,
"step": 400
},
{
"epoch": 0.03741464783462726,
"eval_pairs_with_negatives_loss": 0.3694910407066345,
"eval_pairs_with_negatives_runtime": 44.2166,
"eval_pairs_with_negatives_samples_per_second": 28.406,
"eval_pairs_with_negatives_steps_per_second": 3.551,
"step": 400
},
{
"epoch": 0.03741464783462726,
"eval_positives_loss": 0.11797073483467102,
"eval_positives_runtime": 51.3355,
"eval_positives_samples_per_second": 42.855,
"eval_positives_steps_per_second": 5.357,
"step": 400
},
{
"epoch": 0.03975306332429146,
"grad_norm": 3.7068564891815186,
"learning_rate": 7.925233644859813e-05,
"loss": 0.388726806640625,
"step": 425
},
{
"epoch": 0.04209147881395566,
"grad_norm": 2.3407328128814697,
"learning_rate": 8.392523364485981e-05,
"loss": 0.4401784133911133,
"step": 450
},
{
"epoch": 0.04442989430361987,
"grad_norm": 3.0923948287963867,
"learning_rate": 8.85981308411215e-05,
"loss": 0.41050430297851564,
"step": 475
},
{
"epoch": 0.04676830979328407,
"grad_norm": 2.626753568649292,
"learning_rate": 9.327102803738317e-05,
"loss": 0.3923164749145508,
"step": 500
},
{
"epoch": 0.04910672528294827,
"grad_norm": 2.729557991027832,
"learning_rate": 9.794392523364486e-05,
"loss": 0.3163204765319824,
"step": 525
},
{
"epoch": 0.05144514077261248,
"grad_norm": 3.1612608432769775,
"learning_rate": 9.986215045293424e-05,
"loss": 0.35652976989746094,
"step": 550
},
{
"epoch": 0.05378355626227668,
"grad_norm": 2.224350690841675,
"learning_rate": 9.961599054745964e-05,
"loss": 0.37072269439697264,
"step": 575
},
{
"epoch": 0.056121971751940884,
"grad_norm": 3.207382917404175,
"learning_rate": 9.936983064198503e-05,
"loss": 0.3007513427734375,
"step": 600
},
{
"epoch": 0.056121971751940884,
"eval_pairs_with_negatives_loss": 0.3388254940509796,
"eval_pairs_with_negatives_runtime": 43.9558,
"eval_pairs_with_negatives_samples_per_second": 28.574,
"eval_pairs_with_negatives_steps_per_second": 3.572,
"step": 600
},
{
"epoch": 0.056121971751940884,
"eval_positives_loss": 0.10862970352172852,
"eval_positives_runtime": 51.7355,
"eval_positives_samples_per_second": 42.524,
"eval_positives_steps_per_second": 5.315,
"step": 600
},
{
"epoch": 0.058460387241605086,
"grad_norm": 4.494985103607178,
"learning_rate": 9.912367073651045e-05,
"loss": 0.35943916320800784,
"step": 625
},
{
"epoch": 0.060798802731269294,
"grad_norm": 3.7057838439941406,
"learning_rate": 9.887751083103585e-05,
"loss": 0.39355968475341796,
"step": 650
},
{
"epoch": 0.06313721822093349,
"grad_norm": 1.6454180479049683,
"learning_rate": 9.863135092556125e-05,
"loss": 0.32073760986328126,
"step": 675
},
{
"epoch": 0.0654756337105977,
"grad_norm": 3.901522636413574,
"learning_rate": 9.838519102008666e-05,
"loss": 0.3371485900878906,
"step": 700
},
{
"epoch": 0.0678140492002619,
"grad_norm": 2.2362253665924072,
"learning_rate": 9.813903111461206e-05,
"loss": 0.3385154724121094,
"step": 725
},
{
"epoch": 0.0701524646899261,
"grad_norm": 2.490204334259033,
"learning_rate": 9.789287120913746e-05,
"loss": 0.2718297004699707,
"step": 750
},
{
"epoch": 0.07249088017959031,
"grad_norm": 2.2875030040740967,
"learning_rate": 9.764671130366287e-05,
"loss": 0.44294830322265627,
"step": 775
},
{
"epoch": 0.07482929566925452,
"grad_norm": 1.40684175491333,
"learning_rate": 9.740055139818827e-05,
"loss": 0.2684394645690918,
"step": 800
},
{
"epoch": 0.07482929566925452,
"eval_pairs_with_negatives_loss": 0.34527480602264404,
"eval_pairs_with_negatives_runtime": 44.0724,
"eval_pairs_with_negatives_samples_per_second": 28.499,
"eval_pairs_with_negatives_steps_per_second": 3.562,
"step": 800
},
{
"epoch": 0.07482929566925452,
"eval_positives_loss": 0.10431129485368729,
"eval_positives_runtime": 51.6255,
"eval_positives_samples_per_second": 42.615,
"eval_positives_steps_per_second": 5.327,
"step": 800
},
{
"epoch": 0.07716771115891871,
"grad_norm": 2.8712947368621826,
"learning_rate": 9.715439149271367e-05,
"loss": 0.25394817352294924,
"step": 825
},
{
"epoch": 0.07950612664858292,
"grad_norm": 1.8017457723617554,
"learning_rate": 9.690823158723908e-05,
"loss": 0.32388198852539063,
"step": 850
},
{
"epoch": 0.08184454213824713,
"grad_norm": 2.945971727371216,
"learning_rate": 9.666207168176448e-05,
"loss": 0.29435272216796876,
"step": 875
},
{
"epoch": 0.08418295762791132,
"grad_norm": 2.1370229721069336,
"learning_rate": 9.641591177628988e-05,
"loss": 0.30667646408081056,
"step": 900
},
{
"epoch": 0.08652137311757553,
"grad_norm": 3.4880053997039795,
"learning_rate": 9.616975187081529e-05,
"loss": 0.3113353729248047,
"step": 925
},
{
"epoch": 0.08885978860723974,
"grad_norm": 1.221985101699829,
"learning_rate": 9.592359196534069e-05,
"loss": 0.33869354248046873,
"step": 950
},
{
"epoch": 0.09119820409690393,
"grad_norm": 2.5686190128326416,
"learning_rate": 9.567743205986609e-05,
"loss": 0.2734596633911133,
"step": 975
},
{
"epoch": 0.09353661958656814,
"grad_norm": 1.7126892805099487,
"learning_rate": 9.54312721543915e-05,
"loss": 0.2984904098510742,
"step": 1000
},
{
"epoch": 0.09353661958656814,
"eval_pairs_with_negatives_loss": 0.3210560381412506,
"eval_pairs_with_negatives_runtime": 44.9784,
"eval_pairs_with_negatives_samples_per_second": 27.925,
"eval_pairs_with_negatives_steps_per_second": 3.491,
"step": 1000
},
{
"epoch": 0.09353661958656814,
"eval_positives_loss": 0.08913413435220718,
"eval_positives_runtime": 52.3889,
"eval_positives_samples_per_second": 41.994,
"eval_positives_steps_per_second": 5.249,
"step": 1000
},
{
"epoch": 0.09587503507623235,
"grad_norm": 1.6900842189788818,
"learning_rate": 9.51851122489169e-05,
"loss": 0.355332145690918,
"step": 1025
},
{
"epoch": 0.09821345056589655,
"grad_norm": 0.7989633083343506,
"learning_rate": 9.49389523434423e-05,
"loss": 0.25679166793823244,
"step": 1050
},
{
"epoch": 0.10055186605556075,
"grad_norm": 1.7311954498291016,
"learning_rate": 9.469279243796771e-05,
"loss": 0.344718017578125,
"step": 1075
},
{
"epoch": 0.10289028154522496,
"grad_norm": 1.9694781303405762,
"learning_rate": 9.444663253249311e-05,
"loss": 0.3239378356933594,
"step": 1100
},
{
"epoch": 0.10522869703488916,
"grad_norm": 2.0283656120300293,
"learning_rate": 9.420047262701852e-05,
"loss": 0.3015079879760742,
"step": 1125
},
{
"epoch": 0.10756711252455337,
"grad_norm": 2.0422067642211914,
"learning_rate": 9.395431272154392e-05,
"loss": 0.3864572906494141,
"step": 1150
},
{
"epoch": 0.10990552801421756,
"grad_norm": 2.2227938175201416,
"learning_rate": 9.370815281606933e-05,
"loss": 0.2981968116760254,
"step": 1175
},
{
"epoch": 0.11224394350388177,
"grad_norm": 1.9632631540298462,
"learning_rate": 9.346199291059473e-05,
"loss": 0.3105415725708008,
"step": 1200
},
{
"epoch": 0.11224394350388177,
"eval_pairs_with_negatives_loss": 0.3232487738132477,
"eval_pairs_with_negatives_runtime": 44.5297,
"eval_pairs_with_negatives_samples_per_second": 28.206,
"eval_pairs_with_negatives_steps_per_second": 3.526,
"step": 1200
},
{
"epoch": 0.11224394350388177,
"eval_positives_loss": 0.08286190032958984,
"eval_positives_runtime": 52.0911,
"eval_positives_samples_per_second": 42.234,
"eval_positives_steps_per_second": 5.279,
"step": 1200
},
{
"epoch": 0.11458235899354598,
"grad_norm": 0.5930349826812744,
"learning_rate": 9.321583300512013e-05,
"loss": 0.29635957717895506,
"step": 1225
},
{
"epoch": 0.11692077448321017,
"grad_norm": 1.5982012748718262,
"learning_rate": 9.296967309964554e-05,
"loss": 0.24172809600830078,
"step": 1250
},
{
"epoch": 0.11925918997287438,
"grad_norm": 0.5673118829727173,
"learning_rate": 9.272351319417094e-05,
"loss": 0.26859012603759763,
"step": 1275
},
{
"epoch": 0.12159760546253859,
"grad_norm": 1.4948972463607788,
"learning_rate": 9.247735328869634e-05,
"loss": 0.2932207489013672,
"step": 1300
},
{
"epoch": 0.12393602095220278,
"grad_norm": 1.545386791229248,
"learning_rate": 9.223119338322175e-05,
"loss": 0.2383422088623047,
"step": 1325
},
{
"epoch": 0.12627443644186698,
"grad_norm": 2.5136566162109375,
"learning_rate": 9.198503347774715e-05,
"loss": 0.31081596374511716,
"step": 1350
},
{
"epoch": 0.12861285193153119,
"grad_norm": 1.8467180728912354,
"learning_rate": 9.173887357227255e-05,
"loss": 0.321625862121582,
"step": 1375
},
{
"epoch": 0.1309512674211954,
"grad_norm": 1.3382201194763184,
"learning_rate": 9.149271366679796e-05,
"loss": 0.2083415222167969,
"step": 1400
},
{
"epoch": 0.1309512674211954,
"eval_pairs_with_negatives_loss": 0.3091065585613251,
"eval_pairs_with_negatives_runtime": 44.3305,
"eval_pairs_with_negatives_samples_per_second": 28.333,
"eval_pairs_with_negatives_steps_per_second": 3.542,
"step": 1400
},
{
"epoch": 0.1309512674211954,
"eval_positives_loss": 0.08935973793268204,
"eval_positives_runtime": 51.7119,
"eval_positives_samples_per_second": 42.543,
"eval_positives_steps_per_second": 5.318,
"step": 1400
},
{
"epoch": 0.1332896829108596,
"grad_norm": 1.0311458110809326,
"learning_rate": 9.124655376132336e-05,
"loss": 0.2932785987854004,
"step": 1425
},
{
"epoch": 0.1356280984005238,
"grad_norm": 2.180497884750366,
"learning_rate": 9.100039385584876e-05,
"loss": 0.2038213348388672,
"step": 1450
},
{
"epoch": 0.13796651389018802,
"grad_norm": 2.1046860218048096,
"learning_rate": 9.075423395037416e-05,
"loss": 0.2514521217346191,
"step": 1475
},
{
"epoch": 0.1403049293798522,
"grad_norm": 2.4484400749206543,
"learning_rate": 9.050807404489957e-05,
"loss": 0.26426057815551757,
"step": 1500
},
{
"epoch": 0.1426433448695164,
"grad_norm": 0.5209934711456299,
"learning_rate": 9.026191413942497e-05,
"loss": 0.2484210968017578,
"step": 1525
},
{
"epoch": 0.14498176035918062,
"grad_norm": 2.0274691581726074,
"learning_rate": 9.001575423395037e-05,
"loss": 0.32157943725585936,
"step": 1550
},
{
"epoch": 0.14732017584884483,
"grad_norm": 2.850849151611328,
"learning_rate": 8.976959432847578e-05,
"loss": 0.32649993896484375,
"step": 1575
},
{
"epoch": 0.14965859133850903,
"grad_norm": 3.255429267883301,
"learning_rate": 8.952343442300118e-05,
"loss": 0.26256885528564455,
"step": 1600
},
{
"epoch": 0.14965859133850903,
"eval_pairs_with_negatives_loss": 0.3166193962097168,
"eval_pairs_with_negatives_runtime": 44.3277,
"eval_pairs_with_negatives_samples_per_second": 28.334,
"eval_pairs_with_negatives_steps_per_second": 3.542,
"step": 1600
},
{
"epoch": 0.14965859133850903,
"eval_positives_loss": 0.077468141913414,
"eval_positives_runtime": 51.8074,
"eval_positives_samples_per_second": 42.465,
"eval_positives_steps_per_second": 5.308,
"step": 1600
},
{
"epoch": 0.15199700682817324,
"grad_norm": 2.324928045272827,
"learning_rate": 8.927727451752658e-05,
"loss": 0.28111976623535156,
"step": 1625
},
{
"epoch": 0.15433542231783742,
"grad_norm": 1.722293496131897,
"learning_rate": 8.9031114612052e-05,
"loss": 0.27923690795898437,
"step": 1650
},
{
"epoch": 0.15667383780750163,
"grad_norm": 2.5481624603271484,
"learning_rate": 8.87849547065774e-05,
"loss": 0.2887708282470703,
"step": 1675
},
{
"epoch": 0.15901225329716584,
"grad_norm": 1.4688785076141357,
"learning_rate": 8.853879480110279e-05,
"loss": 0.32429874420166016,
"step": 1700
},
{
"epoch": 0.16135066878683005,
"grad_norm": 0.970000684261322,
"learning_rate": 8.82926348956282e-05,
"loss": 0.23183115005493163,
"step": 1725
},
{
"epoch": 0.16368908427649426,
"grad_norm": 2.141195297241211,
"learning_rate": 8.80464749901536e-05,
"loss": 0.2943249702453613,
"step": 1750
},
{
"epoch": 0.16602749976615844,
"grad_norm": 0.9625000357627869,
"learning_rate": 8.7800315084679e-05,
"loss": 0.24936399459838868,
"step": 1775
},
{
"epoch": 0.16836591525582265,
"grad_norm": 2.191002368927002,
"learning_rate": 8.755415517920442e-05,
"loss": 0.3477742004394531,
"step": 1800
},
{
"epoch": 0.16836591525582265,
"eval_pairs_with_negatives_loss": 0.311288446187973,
"eval_pairs_with_negatives_runtime": 44.4068,
"eval_pairs_with_negatives_samples_per_second": 28.284,
"eval_pairs_with_negatives_steps_per_second": 3.535,
"step": 1800
},
{
"epoch": 0.16836591525582265,
"eval_positives_loss": 0.07508163899183273,
"eval_positives_runtime": 51.7306,
"eval_positives_samples_per_second": 42.528,
"eval_positives_steps_per_second": 5.316,
"step": 1800
},
{
"epoch": 0.17070433074548685,
"grad_norm": 2.958533525466919,
"learning_rate": 8.730799527372981e-05,
"loss": 0.3265147018432617,
"step": 1825
},
{
"epoch": 0.17304274623515106,
"grad_norm": 2.005192756652832,
"learning_rate": 8.706183536825521e-05,
"loss": 0.29331169128417967,
"step": 1850
},
{
"epoch": 0.17538116172481527,
"grad_norm": 2.02463960647583,
"learning_rate": 8.681567546278063e-05,
"loss": 0.2671446990966797,
"step": 1875
},
{
"epoch": 0.17771957721447948,
"grad_norm": 2.153892755508423,
"learning_rate": 8.656951555730604e-05,
"loss": 0.29273582458496095,
"step": 1900
},
{
"epoch": 0.18005799270414366,
"grad_norm": 2.7679359912872314,
"learning_rate": 8.632335565183144e-05,
"loss": 0.29389562606811526,
"step": 1925
},
{
"epoch": 0.18239640819380787,
"grad_norm": 2.963479995727539,
"learning_rate": 8.607719574635684e-05,
"loss": 0.2356496810913086,
"step": 1950
},
{
"epoch": 0.18473482368347208,
"grad_norm": 2.6095352172851562,
"learning_rate": 8.583103584088225e-05,
"loss": 0.24131065368652344,
"step": 1975
},
{
"epoch": 0.18707323917313629,
"grad_norm": 2.1474149227142334,
"learning_rate": 8.558487593540765e-05,
"loss": 0.20256967544555665,
"step": 2000
},
{
"epoch": 0.18707323917313629,
"eval_pairs_with_negatives_loss": 0.2920902371406555,
"eval_pairs_with_negatives_runtime": 44.1734,
"eval_pairs_with_negatives_samples_per_second": 28.433,
"eval_pairs_with_negatives_steps_per_second": 3.554,
"step": 2000
},
{
"epoch": 0.18707323917313629,
"eval_positives_loss": 0.06497267633676529,
"eval_positives_runtime": 51.883,
"eval_positives_samples_per_second": 42.403,
"eval_positives_steps_per_second": 5.3,
"step": 2000
}
],
"logging_steps": 25,
"max_steps": 10691,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}