main-v2-checkpoints / checkpoint-5000 /trainer_state.json
leafxyz's picture
Upload folder using huggingface_hub
7775c00 verified
Raw
History Blame Contribute Delete
52 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.4676830979328407,
"eval_steps": 200,
"global_step": 5000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0023384154896642037,
"grad_norm": 1.9981695413589478,
"learning_rate": 4.4859813084112145e-06,
"loss": 0.47716766357421875,
"step": 25
},
{
"epoch": 0.004676830979328407,
"grad_norm": 1.9483280181884766,
"learning_rate": 9.158878504672897e-06,
"loss": 0.4592530059814453,
"step": 50
},
{
"epoch": 0.0070152464689926105,
"grad_norm": 2.1290855407714844,
"learning_rate": 1.3831775700934579e-05,
"loss": 0.394501838684082,
"step": 75
},
{
"epoch": 0.009353661958656815,
"grad_norm": 2.8394205570220947,
"learning_rate": 1.8504672897196264e-05,
"loss": 0.3752219009399414,
"step": 100
},
{
"epoch": 0.011692077448321018,
"grad_norm": 2.5833706855773926,
"learning_rate": 2.3177570093457944e-05,
"loss": 0.40475303649902344,
"step": 125
},
{
"epoch": 0.014030492937985221,
"grad_norm": 2.622011661529541,
"learning_rate": 2.7850467289719627e-05,
"loss": 0.45625301361083986,
"step": 150
},
{
"epoch": 0.016368908427649424,
"grad_norm": 2.9406535625457764,
"learning_rate": 3.2523364485981314e-05,
"loss": 0.34918937683105467,
"step": 175
},
{
"epoch": 0.01870732391731363,
"grad_norm": 3.8391785621643066,
"learning_rate": 3.7196261682242994e-05,
"loss": 0.41711517333984377,
"step": 200
},
{
"epoch": 0.01870732391731363,
"eval_pairs_with_negatives_loss": 0.3914637565612793,
"eval_pairs_with_negatives_runtime": 44.0353,
"eval_pairs_with_negatives_samples_per_second": 28.523,
"eval_pairs_with_negatives_steps_per_second": 3.565,
"step": 200
},
{
"epoch": 0.01870732391731363,
"eval_positives_loss": 0.1480681300163269,
"eval_positives_runtime": 51.7193,
"eval_positives_samples_per_second": 42.537,
"eval_positives_steps_per_second": 5.317,
"step": 200
},
{
"epoch": 0.02104573940697783,
"grad_norm": 2.3628170490264893,
"learning_rate": 4.186915887850468e-05,
"loss": 0.4296648406982422,
"step": 225
},
{
"epoch": 0.023384154896642036,
"grad_norm": 2.698835611343384,
"learning_rate": 4.6542056074766354e-05,
"loss": 0.43652393341064455,
"step": 250
},
{
"epoch": 0.02572257038630624,
"grad_norm": 4.1166558265686035,
"learning_rate": 5.121495327102804e-05,
"loss": 0.4344004440307617,
"step": 275
},
{
"epoch": 0.028060985875970442,
"grad_norm": 4.551556587219238,
"learning_rate": 5.588785046728973e-05,
"loss": 0.41842262268066405,
"step": 300
},
{
"epoch": 0.030399401365634647,
"grad_norm": 2.3925657272338867,
"learning_rate": 6.056074766355141e-05,
"loss": 0.4197782897949219,
"step": 325
},
{
"epoch": 0.03273781685529885,
"grad_norm": 3.1023190021514893,
"learning_rate": 6.52336448598131e-05,
"loss": 0.4292975616455078,
"step": 350
},
{
"epoch": 0.03507623234496305,
"grad_norm": 4.1481032371521,
"learning_rate": 6.990654205607478e-05,
"loss": 0.4758753204345703,
"step": 375
},
{
"epoch": 0.03741464783462726,
"grad_norm": 3.8799962997436523,
"learning_rate": 7.457943925233644e-05,
"loss": 0.3311753845214844,
"step": 400
},
{
"epoch": 0.03741464783462726,
"eval_pairs_with_negatives_loss": 0.3694910407066345,
"eval_pairs_with_negatives_runtime": 44.2166,
"eval_pairs_with_negatives_samples_per_second": 28.406,
"eval_pairs_with_negatives_steps_per_second": 3.551,
"step": 400
},
{
"epoch": 0.03741464783462726,
"eval_positives_loss": 0.11797073483467102,
"eval_positives_runtime": 51.3355,
"eval_positives_samples_per_second": 42.855,
"eval_positives_steps_per_second": 5.357,
"step": 400
},
{
"epoch": 0.03975306332429146,
"grad_norm": 3.7068564891815186,
"learning_rate": 7.925233644859813e-05,
"loss": 0.388726806640625,
"step": 425
},
{
"epoch": 0.04209147881395566,
"grad_norm": 2.3407328128814697,
"learning_rate": 8.392523364485981e-05,
"loss": 0.4401784133911133,
"step": 450
},
{
"epoch": 0.04442989430361987,
"grad_norm": 3.0923948287963867,
"learning_rate": 8.85981308411215e-05,
"loss": 0.41050430297851564,
"step": 475
},
{
"epoch": 0.04676830979328407,
"grad_norm": 2.626753568649292,
"learning_rate": 9.327102803738317e-05,
"loss": 0.3923164749145508,
"step": 500
},
{
"epoch": 0.04910672528294827,
"grad_norm": 2.729557991027832,
"learning_rate": 9.794392523364486e-05,
"loss": 0.3163204765319824,
"step": 525
},
{
"epoch": 0.05144514077261248,
"grad_norm": 3.1612608432769775,
"learning_rate": 9.986215045293424e-05,
"loss": 0.35652976989746094,
"step": 550
},
{
"epoch": 0.05378355626227668,
"grad_norm": 2.224350690841675,
"learning_rate": 9.961599054745964e-05,
"loss": 0.37072269439697264,
"step": 575
},
{
"epoch": 0.056121971751940884,
"grad_norm": 3.207382917404175,
"learning_rate": 9.936983064198503e-05,
"loss": 0.3007513427734375,
"step": 600
},
{
"epoch": 0.056121971751940884,
"eval_pairs_with_negatives_loss": 0.3388254940509796,
"eval_pairs_with_negatives_runtime": 43.9558,
"eval_pairs_with_negatives_samples_per_second": 28.574,
"eval_pairs_with_negatives_steps_per_second": 3.572,
"step": 600
},
{
"epoch": 0.056121971751940884,
"eval_positives_loss": 0.10862970352172852,
"eval_positives_runtime": 51.7355,
"eval_positives_samples_per_second": 42.524,
"eval_positives_steps_per_second": 5.315,
"step": 600
},
{
"epoch": 0.058460387241605086,
"grad_norm": 4.494985103607178,
"learning_rate": 9.912367073651045e-05,
"loss": 0.35943916320800784,
"step": 625
},
{
"epoch": 0.060798802731269294,
"grad_norm": 3.7057838439941406,
"learning_rate": 9.887751083103585e-05,
"loss": 0.39355968475341796,
"step": 650
},
{
"epoch": 0.06313721822093349,
"grad_norm": 1.6454180479049683,
"learning_rate": 9.863135092556125e-05,
"loss": 0.32073760986328126,
"step": 675
},
{
"epoch": 0.0654756337105977,
"grad_norm": 3.901522636413574,
"learning_rate": 9.838519102008666e-05,
"loss": 0.3371485900878906,
"step": 700
},
{
"epoch": 0.0678140492002619,
"grad_norm": 2.2362253665924072,
"learning_rate": 9.813903111461206e-05,
"loss": 0.3385154724121094,
"step": 725
},
{
"epoch": 0.0701524646899261,
"grad_norm": 2.490204334259033,
"learning_rate": 9.789287120913746e-05,
"loss": 0.2718297004699707,
"step": 750
},
{
"epoch": 0.07249088017959031,
"grad_norm": 2.2875030040740967,
"learning_rate": 9.764671130366287e-05,
"loss": 0.44294830322265627,
"step": 775
},
{
"epoch": 0.07482929566925452,
"grad_norm": 1.40684175491333,
"learning_rate": 9.740055139818827e-05,
"loss": 0.2684394645690918,
"step": 800
},
{
"epoch": 0.07482929566925452,
"eval_pairs_with_negatives_loss": 0.34527480602264404,
"eval_pairs_with_negatives_runtime": 44.0724,
"eval_pairs_with_negatives_samples_per_second": 28.499,
"eval_pairs_with_negatives_steps_per_second": 3.562,
"step": 800
},
{
"epoch": 0.07482929566925452,
"eval_positives_loss": 0.10431129485368729,
"eval_positives_runtime": 51.6255,
"eval_positives_samples_per_second": 42.615,
"eval_positives_steps_per_second": 5.327,
"step": 800
},
{
"epoch": 0.07716771115891871,
"grad_norm": 2.8712947368621826,
"learning_rate": 9.715439149271367e-05,
"loss": 0.25394817352294924,
"step": 825
},
{
"epoch": 0.07950612664858292,
"grad_norm": 1.8017457723617554,
"learning_rate": 9.690823158723908e-05,
"loss": 0.32388198852539063,
"step": 850
},
{
"epoch": 0.08184454213824713,
"grad_norm": 2.945971727371216,
"learning_rate": 9.666207168176448e-05,
"loss": 0.29435272216796876,
"step": 875
},
{
"epoch": 0.08418295762791132,
"grad_norm": 2.1370229721069336,
"learning_rate": 9.641591177628988e-05,
"loss": 0.30667646408081056,
"step": 900
},
{
"epoch": 0.08652137311757553,
"grad_norm": 3.4880053997039795,
"learning_rate": 9.616975187081529e-05,
"loss": 0.3113353729248047,
"step": 925
},
{
"epoch": 0.08885978860723974,
"grad_norm": 1.221985101699829,
"learning_rate": 9.592359196534069e-05,
"loss": 0.33869354248046873,
"step": 950
},
{
"epoch": 0.09119820409690393,
"grad_norm": 2.5686190128326416,
"learning_rate": 9.567743205986609e-05,
"loss": 0.2734596633911133,
"step": 975
},
{
"epoch": 0.09353661958656814,
"grad_norm": 1.7126892805099487,
"learning_rate": 9.54312721543915e-05,
"loss": 0.2984904098510742,
"step": 1000
},
{
"epoch": 0.09353661958656814,
"eval_pairs_with_negatives_loss": 0.3210560381412506,
"eval_pairs_with_negatives_runtime": 44.9784,
"eval_pairs_with_negatives_samples_per_second": 27.925,
"eval_pairs_with_negatives_steps_per_second": 3.491,
"step": 1000
},
{
"epoch": 0.09353661958656814,
"eval_positives_loss": 0.08913413435220718,
"eval_positives_runtime": 52.3889,
"eval_positives_samples_per_second": 41.994,
"eval_positives_steps_per_second": 5.249,
"step": 1000
},
{
"epoch": 0.09587503507623235,
"grad_norm": 1.6900842189788818,
"learning_rate": 9.51851122489169e-05,
"loss": 0.355332145690918,
"step": 1025
},
{
"epoch": 0.09821345056589655,
"grad_norm": 0.7989633083343506,
"learning_rate": 9.49389523434423e-05,
"loss": 0.25679166793823244,
"step": 1050
},
{
"epoch": 0.10055186605556075,
"grad_norm": 1.7311954498291016,
"learning_rate": 9.469279243796771e-05,
"loss": 0.344718017578125,
"step": 1075
},
{
"epoch": 0.10289028154522496,
"grad_norm": 1.9694781303405762,
"learning_rate": 9.444663253249311e-05,
"loss": 0.3239378356933594,
"step": 1100
},
{
"epoch": 0.10522869703488916,
"grad_norm": 2.0283656120300293,
"learning_rate": 9.420047262701852e-05,
"loss": 0.3015079879760742,
"step": 1125
},
{
"epoch": 0.10756711252455337,
"grad_norm": 2.0422067642211914,
"learning_rate": 9.395431272154392e-05,
"loss": 0.3864572906494141,
"step": 1150
},
{
"epoch": 0.10990552801421756,
"grad_norm": 2.2227938175201416,
"learning_rate": 9.370815281606933e-05,
"loss": 0.2981968116760254,
"step": 1175
},
{
"epoch": 0.11224394350388177,
"grad_norm": 1.9632631540298462,
"learning_rate": 9.346199291059473e-05,
"loss": 0.3105415725708008,
"step": 1200
},
{
"epoch": 0.11224394350388177,
"eval_pairs_with_negatives_loss": 0.3232487738132477,
"eval_pairs_with_negatives_runtime": 44.5297,
"eval_pairs_with_negatives_samples_per_second": 28.206,
"eval_pairs_with_negatives_steps_per_second": 3.526,
"step": 1200
},
{
"epoch": 0.11224394350388177,
"eval_positives_loss": 0.08286190032958984,
"eval_positives_runtime": 52.0911,
"eval_positives_samples_per_second": 42.234,
"eval_positives_steps_per_second": 5.279,
"step": 1200
},
{
"epoch": 0.11458235899354598,
"grad_norm": 0.5930349826812744,
"learning_rate": 9.321583300512013e-05,
"loss": 0.29635957717895506,
"step": 1225
},
{
"epoch": 0.11692077448321017,
"grad_norm": 1.5982012748718262,
"learning_rate": 9.296967309964554e-05,
"loss": 0.24172809600830078,
"step": 1250
},
{
"epoch": 0.11925918997287438,
"grad_norm": 0.5673118829727173,
"learning_rate": 9.272351319417094e-05,
"loss": 0.26859012603759763,
"step": 1275
},
{
"epoch": 0.12159760546253859,
"grad_norm": 1.4948972463607788,
"learning_rate": 9.247735328869634e-05,
"loss": 0.2932207489013672,
"step": 1300
},
{
"epoch": 0.12393602095220278,
"grad_norm": 1.545386791229248,
"learning_rate": 9.223119338322175e-05,
"loss": 0.2383422088623047,
"step": 1325
},
{
"epoch": 0.12627443644186698,
"grad_norm": 2.5136566162109375,
"learning_rate": 9.198503347774715e-05,
"loss": 0.31081596374511716,
"step": 1350
},
{
"epoch": 0.12861285193153119,
"grad_norm": 1.8467180728912354,
"learning_rate": 9.173887357227255e-05,
"loss": 0.321625862121582,
"step": 1375
},
{
"epoch": 0.1309512674211954,
"grad_norm": 1.3382201194763184,
"learning_rate": 9.149271366679796e-05,
"loss": 0.2083415222167969,
"step": 1400
},
{
"epoch": 0.1309512674211954,
"eval_pairs_with_negatives_loss": 0.3091065585613251,
"eval_pairs_with_negatives_runtime": 44.3305,
"eval_pairs_with_negatives_samples_per_second": 28.333,
"eval_pairs_with_negatives_steps_per_second": 3.542,
"step": 1400
},
{
"epoch": 0.1309512674211954,
"eval_positives_loss": 0.08935973793268204,
"eval_positives_runtime": 51.7119,
"eval_positives_samples_per_second": 42.543,
"eval_positives_steps_per_second": 5.318,
"step": 1400
},
{
"epoch": 0.1332896829108596,
"grad_norm": 1.0311458110809326,
"learning_rate": 9.124655376132336e-05,
"loss": 0.2932785987854004,
"step": 1425
},
{
"epoch": 0.1356280984005238,
"grad_norm": 2.180497884750366,
"learning_rate": 9.100039385584876e-05,
"loss": 0.2038213348388672,
"step": 1450
},
{
"epoch": 0.13796651389018802,
"grad_norm": 2.1046860218048096,
"learning_rate": 9.075423395037416e-05,
"loss": 0.2514521217346191,
"step": 1475
},
{
"epoch": 0.1403049293798522,
"grad_norm": 2.4484400749206543,
"learning_rate": 9.050807404489957e-05,
"loss": 0.26426057815551757,
"step": 1500
},
{
"epoch": 0.1426433448695164,
"grad_norm": 0.5209934711456299,
"learning_rate": 9.026191413942497e-05,
"loss": 0.2484210968017578,
"step": 1525
},
{
"epoch": 0.14498176035918062,
"grad_norm": 2.0274691581726074,
"learning_rate": 9.001575423395037e-05,
"loss": 0.32157943725585936,
"step": 1550
},
{
"epoch": 0.14732017584884483,
"grad_norm": 2.850849151611328,
"learning_rate": 8.976959432847578e-05,
"loss": 0.32649993896484375,
"step": 1575
},
{
"epoch": 0.14965859133850903,
"grad_norm": 3.255429267883301,
"learning_rate": 8.952343442300118e-05,
"loss": 0.26256885528564455,
"step": 1600
},
{
"epoch": 0.14965859133850903,
"eval_pairs_with_negatives_loss": 0.3166193962097168,
"eval_pairs_with_negatives_runtime": 44.3277,
"eval_pairs_with_negatives_samples_per_second": 28.334,
"eval_pairs_with_negatives_steps_per_second": 3.542,
"step": 1600
},
{
"epoch": 0.14965859133850903,
"eval_positives_loss": 0.077468141913414,
"eval_positives_runtime": 51.8074,
"eval_positives_samples_per_second": 42.465,
"eval_positives_steps_per_second": 5.308,
"step": 1600
},
{
"epoch": 0.15199700682817324,
"grad_norm": 2.324928045272827,
"learning_rate": 8.927727451752658e-05,
"loss": 0.28111976623535156,
"step": 1625
},
{
"epoch": 0.15433542231783742,
"grad_norm": 1.722293496131897,
"learning_rate": 8.9031114612052e-05,
"loss": 0.27923690795898437,
"step": 1650
},
{
"epoch": 0.15667383780750163,
"grad_norm": 2.5481624603271484,
"learning_rate": 8.87849547065774e-05,
"loss": 0.2887708282470703,
"step": 1675
},
{
"epoch": 0.15901225329716584,
"grad_norm": 1.4688785076141357,
"learning_rate": 8.853879480110279e-05,
"loss": 0.32429874420166016,
"step": 1700
},
{
"epoch": 0.16135066878683005,
"grad_norm": 0.970000684261322,
"learning_rate": 8.82926348956282e-05,
"loss": 0.23183115005493163,
"step": 1725
},
{
"epoch": 0.16368908427649426,
"grad_norm": 2.141195297241211,
"learning_rate": 8.80464749901536e-05,
"loss": 0.2943249702453613,
"step": 1750
},
{
"epoch": 0.16602749976615844,
"grad_norm": 0.9625000357627869,
"learning_rate": 8.7800315084679e-05,
"loss": 0.24936399459838868,
"step": 1775
},
{
"epoch": 0.16836591525582265,
"grad_norm": 2.191002368927002,
"learning_rate": 8.755415517920442e-05,
"loss": 0.3477742004394531,
"step": 1800
},
{
"epoch": 0.16836591525582265,
"eval_pairs_with_negatives_loss": 0.311288446187973,
"eval_pairs_with_negatives_runtime": 44.4068,
"eval_pairs_with_negatives_samples_per_second": 28.284,
"eval_pairs_with_negatives_steps_per_second": 3.535,
"step": 1800
},
{
"epoch": 0.16836591525582265,
"eval_positives_loss": 0.07508163899183273,
"eval_positives_runtime": 51.7306,
"eval_positives_samples_per_second": 42.528,
"eval_positives_steps_per_second": 5.316,
"step": 1800
},
{
"epoch": 0.17070433074548685,
"grad_norm": 2.958533525466919,
"learning_rate": 8.730799527372981e-05,
"loss": 0.3265147018432617,
"step": 1825
},
{
"epoch": 0.17304274623515106,
"grad_norm": 2.005192756652832,
"learning_rate": 8.706183536825521e-05,
"loss": 0.29331169128417967,
"step": 1850
},
{
"epoch": 0.17538116172481527,
"grad_norm": 2.02463960647583,
"learning_rate": 8.681567546278063e-05,
"loss": 0.2671446990966797,
"step": 1875
},
{
"epoch": 0.17771957721447948,
"grad_norm": 2.153892755508423,
"learning_rate": 8.656951555730604e-05,
"loss": 0.29273582458496095,
"step": 1900
},
{
"epoch": 0.18005799270414366,
"grad_norm": 2.7679359912872314,
"learning_rate": 8.632335565183144e-05,
"loss": 0.29389562606811526,
"step": 1925
},
{
"epoch": 0.18239640819380787,
"grad_norm": 2.963479995727539,
"learning_rate": 8.607719574635684e-05,
"loss": 0.2356496810913086,
"step": 1950
},
{
"epoch": 0.18473482368347208,
"grad_norm": 2.6095352172851562,
"learning_rate": 8.583103584088225e-05,
"loss": 0.24131065368652344,
"step": 1975
},
{
"epoch": 0.18707323917313629,
"grad_norm": 2.1474149227142334,
"learning_rate": 8.558487593540765e-05,
"loss": 0.20256967544555665,
"step": 2000
},
{
"epoch": 0.18707323917313629,
"eval_pairs_with_negatives_loss": 0.2920902371406555,
"eval_pairs_with_negatives_runtime": 44.1734,
"eval_pairs_with_negatives_samples_per_second": 28.433,
"eval_pairs_with_negatives_steps_per_second": 3.554,
"step": 2000
},
{
"epoch": 0.18707323917313629,
"eval_positives_loss": 0.06497267633676529,
"eval_positives_runtime": 51.883,
"eval_positives_samples_per_second": 42.403,
"eval_positives_steps_per_second": 5.3,
"step": 2000
},
{
"epoch": 0.1894116546628005,
"grad_norm": 1.4445933103561401,
"learning_rate": 8.533871602993305e-05,
"loss": 0.2663409423828125,
"step": 2025
},
{
"epoch": 0.1917500701524647,
"grad_norm": 2.1832194328308105,
"learning_rate": 8.509255612445846e-05,
"loss": 0.24383123397827147,
"step": 2050
},
{
"epoch": 0.19408848564212888,
"grad_norm": 1.7301610708236694,
"learning_rate": 8.484639621898386e-05,
"loss": 0.23211950302124024,
"step": 2075
},
{
"epoch": 0.1964269011317931,
"grad_norm": 1.9371556043624878,
"learning_rate": 8.460023631350926e-05,
"loss": 0.24819377899169923,
"step": 2100
},
{
"epoch": 0.1987653166214573,
"grad_norm": 2.9007513523101807,
"learning_rate": 8.435407640803467e-05,
"loss": 0.3000238037109375,
"step": 2125
},
{
"epoch": 0.2011037321111215,
"grad_norm": 2.155949115753174,
"learning_rate": 8.410791650256007e-05,
"loss": 0.19902172088623046,
"step": 2150
},
{
"epoch": 0.20344214760078572,
"grad_norm": 1.1646662950515747,
"learning_rate": 8.386175659708547e-05,
"loss": 0.2393128204345703,
"step": 2175
},
{
"epoch": 0.20578056309044993,
"grad_norm": 0.6050031185150146,
"learning_rate": 8.361559669161088e-05,
"loss": 0.23696456909179686,
"step": 2200
},
{
"epoch": 0.20578056309044993,
"eval_pairs_with_negatives_loss": 0.2844306230545044,
"eval_pairs_with_negatives_runtime": 43.6185,
"eval_pairs_with_negatives_samples_per_second": 28.795,
"eval_pairs_with_negatives_steps_per_second": 3.599,
"step": 2200
},
{
"epoch": 0.20578056309044993,
"eval_positives_loss": 0.06695789843797684,
"eval_positives_runtime": 51.2178,
"eval_positives_samples_per_second": 42.954,
"eval_positives_steps_per_second": 5.369,
"step": 2200
},
{
"epoch": 0.2081189785801141,
"grad_norm": 1.7829246520996094,
"learning_rate": 8.336943678613628e-05,
"loss": 0.21305316925048828,
"step": 2225
},
{
"epoch": 0.21045739406977831,
"grad_norm": 1.9647576808929443,
"learning_rate": 8.312327688066168e-05,
"loss": 0.2547788429260254,
"step": 2250
},
{
"epoch": 0.21279580955944252,
"grad_norm": 0.9661738276481628,
"learning_rate": 8.287711697518709e-05,
"loss": 0.30158185958862305,
"step": 2275
},
{
"epoch": 0.21513422504910673,
"grad_norm": 0.4944344162940979,
"learning_rate": 8.263095706971249e-05,
"loss": 0.1959225845336914,
"step": 2300
},
{
"epoch": 0.21747264053877094,
"grad_norm": 2.383636474609375,
"learning_rate": 8.238479716423789e-05,
"loss": 0.260382194519043,
"step": 2325
},
{
"epoch": 0.21981105602843512,
"grad_norm": 2.4864633083343506,
"learning_rate": 8.21386372587633e-05,
"loss": 0.3141353225708008,
"step": 2350
},
{
"epoch": 0.22214947151809933,
"grad_norm": 1.3516175746917725,
"learning_rate": 8.18924773532887e-05,
"loss": 0.2728991889953613,
"step": 2375
},
{
"epoch": 0.22448788700776354,
"grad_norm": 3.200805902481079,
"learning_rate": 8.16463174478141e-05,
"loss": 0.24915071487426757,
"step": 2400
},
{
"epoch": 0.22448788700776354,
"eval_pairs_with_negatives_loss": 0.2853996157646179,
"eval_pairs_with_negatives_runtime": 44.3715,
"eval_pairs_with_negatives_samples_per_second": 28.306,
"eval_pairs_with_negatives_steps_per_second": 3.538,
"step": 2400
},
{
"epoch": 0.22448788700776354,
"eval_positives_loss": 0.06402233988046646,
"eval_positives_runtime": 51.541,
"eval_positives_samples_per_second": 42.684,
"eval_positives_steps_per_second": 5.336,
"step": 2400
},
{
"epoch": 0.22682630249742775,
"grad_norm": 2.3375115394592285,
"learning_rate": 8.140015754233951e-05,
"loss": 0.23255537033081056,
"step": 2425
},
{
"epoch": 0.22916471798709195,
"grad_norm": 1.075677752494812,
"learning_rate": 8.115399763686491e-05,
"loss": 0.2849599456787109,
"step": 2450
},
{
"epoch": 0.23150313347675616,
"grad_norm": 1.7264649868011475,
"learning_rate": 8.090783773139031e-05,
"loss": 0.23932256698608398,
"step": 2475
},
{
"epoch": 0.23384154896642034,
"grad_norm": 2.3798885345458984,
"learning_rate": 8.066167782591572e-05,
"loss": 0.27479507446289064,
"step": 2500
},
{
"epoch": 0.23617996445608455,
"grad_norm": 1.7838364839553833,
"learning_rate": 8.041551792044112e-05,
"loss": 0.22890100479125977,
"step": 2525
},
{
"epoch": 0.23851837994574876,
"grad_norm": 0.8337921500205994,
"learning_rate": 8.016935801496652e-05,
"loss": 0.24863414764404296,
"step": 2550
},
{
"epoch": 0.24085679543541297,
"grad_norm": 3.2835209369659424,
"learning_rate": 7.992319810949192e-05,
"loss": 0.2846149635314941,
"step": 2575
},
{
"epoch": 0.24319521092507718,
"grad_norm": 1.3565106391906738,
"learning_rate": 7.967703820401733e-05,
"loss": 0.2026744842529297,
"step": 2600
},
{
"epoch": 0.24319521092507718,
"eval_pairs_with_negatives_loss": 0.27976956963539124,
"eval_pairs_with_negatives_runtime": 44.1274,
"eval_pairs_with_negatives_samples_per_second": 28.463,
"eval_pairs_with_negatives_steps_per_second": 3.558,
"step": 2600
},
{
"epoch": 0.24319521092507718,
"eval_positives_loss": 0.05857069417834282,
"eval_positives_runtime": 51.6223,
"eval_positives_samples_per_second": 42.617,
"eval_positives_steps_per_second": 5.327,
"step": 2600
},
{
"epoch": 0.24553362641474138,
"grad_norm": 1.8603383302688599,
"learning_rate": 7.943087829854273e-05,
"loss": 0.23360692977905273,
"step": 2625
},
{
"epoch": 0.24787204190440557,
"grad_norm": 2.318513870239258,
"learning_rate": 7.918471839306813e-05,
"loss": 0.2207220458984375,
"step": 2650
},
{
"epoch": 0.2502104573940698,
"grad_norm": 1.7352806329727173,
"learning_rate": 7.893855848759354e-05,
"loss": 0.23572732925415038,
"step": 2675
},
{
"epoch": 0.25254887288373395,
"grad_norm": 2.457981824874878,
"learning_rate": 7.869239858211895e-05,
"loss": 0.21319828033447266,
"step": 2700
},
{
"epoch": 0.2548872883733982,
"grad_norm": 1.7361868619918823,
"learning_rate": 7.844623867664435e-05,
"loss": 0.21519132614135741,
"step": 2725
},
{
"epoch": 0.25722570386306237,
"grad_norm": 2.6403586864471436,
"learning_rate": 7.820007877116977e-05,
"loss": 0.2046283531188965,
"step": 2750
},
{
"epoch": 0.2595641193527266,
"grad_norm": 2.263866424560547,
"learning_rate": 7.795391886569517e-05,
"loss": 0.18240520477294922,
"step": 2775
},
{
"epoch": 0.2619025348423908,
"grad_norm": 2.069082736968994,
"learning_rate": 7.770775896022056e-05,
"loss": 0.2405707359313965,
"step": 2800
},
{
"epoch": 0.2619025348423908,
"eval_pairs_with_negatives_loss": 0.2774912714958191,
"eval_pairs_with_negatives_runtime": 44.1229,
"eval_pairs_with_negatives_samples_per_second": 28.466,
"eval_pairs_with_negatives_steps_per_second": 3.558,
"step": 2800
},
{
"epoch": 0.2619025348423908,
"eval_positives_loss": 0.06239576265215874,
"eval_positives_runtime": 51.4606,
"eval_positives_samples_per_second": 42.751,
"eval_positives_steps_per_second": 5.344,
"step": 2800
},
{
"epoch": 0.264240950332055,
"grad_norm": 1.5124787092208862,
"learning_rate": 7.746159905474598e-05,
"loss": 0.2240062713623047,
"step": 2825
},
{
"epoch": 0.2665793658217192,
"grad_norm": 2.6289567947387695,
"learning_rate": 7.721543914927138e-05,
"loss": 0.2537799644470215,
"step": 2850
},
{
"epoch": 0.2689177813113834,
"grad_norm": 1.4767881631851196,
"learning_rate": 7.696927924379677e-05,
"loss": 0.19011005401611328,
"step": 2875
},
{
"epoch": 0.2712561968010476,
"grad_norm": 1.8631181716918945,
"learning_rate": 7.672311933832217e-05,
"loss": 0.27923820495605467,
"step": 2900
},
{
"epoch": 0.2735946122907118,
"grad_norm": 1.699515461921692,
"learning_rate": 7.647695943284759e-05,
"loss": 0.24893655776977539,
"step": 2925
},
{
"epoch": 0.27593302778037604,
"grad_norm": 1.1183840036392212,
"learning_rate": 7.623079952737299e-05,
"loss": 0.23708009719848633,
"step": 2950
},
{
"epoch": 0.2782714432700402,
"grad_norm": 1.764267921447754,
"learning_rate": 7.598463962189838e-05,
"loss": 0.2170231056213379,
"step": 2975
},
{
"epoch": 0.2806098587597044,
"grad_norm": 1.3701727390289307,
"learning_rate": 7.57384797164238e-05,
"loss": 0.2408245849609375,
"step": 3000
},
{
"epoch": 0.2806098587597044,
"eval_pairs_with_negatives_loss": 0.27622753381729126,
"eval_pairs_with_negatives_runtime": 44.0716,
"eval_pairs_with_negatives_samples_per_second": 28.499,
"eval_pairs_with_negatives_steps_per_second": 3.562,
"step": 3000
},
{
"epoch": 0.2806098587597044,
"eval_positives_loss": 0.05702820420265198,
"eval_positives_runtime": 51.7038,
"eval_positives_samples_per_second": 42.55,
"eval_positives_steps_per_second": 5.319,
"step": 3000
},
{
"epoch": 0.28294827424936864,
"grad_norm": 0.21540337800979614,
"learning_rate": 7.54923198109492e-05,
"loss": 0.15430140495300293,
"step": 3025
},
{
"epoch": 0.2852866897390328,
"grad_norm": 1.8154865503311157,
"learning_rate": 7.52461599054746e-05,
"loss": 0.2857963180541992,
"step": 3050
},
{
"epoch": 0.28762510522869705,
"grad_norm": 1.347398042678833,
"learning_rate": 7.500000000000001e-05,
"loss": 0.22897544860839844,
"step": 3075
},
{
"epoch": 0.28996352071836123,
"grad_norm": 1.910434603691101,
"learning_rate": 7.47538400945254e-05,
"loss": 0.3003374099731445,
"step": 3100
},
{
"epoch": 0.2923019362080254,
"grad_norm": 2.536224365234375,
"learning_rate": 7.45076801890508e-05,
"loss": 0.21426973342895508,
"step": 3125
},
{
"epoch": 0.29464035169768965,
"grad_norm": 1.4936145544052124,
"learning_rate": 7.426152028357622e-05,
"loss": 0.248642578125,
"step": 3150
},
{
"epoch": 0.29697876718735383,
"grad_norm": 1.5778441429138184,
"learning_rate": 7.401536037810162e-05,
"loss": 0.24121809005737305,
"step": 3175
},
{
"epoch": 0.29931718267701807,
"grad_norm": 2.0866878032684326,
"learning_rate": 7.376920047262702e-05,
"loss": 0.2682598304748535,
"step": 3200
},
{
"epoch": 0.29931718267701807,
"eval_pairs_with_negatives_loss": 0.27552473545074463,
"eval_pairs_with_negatives_runtime": 44.3024,
"eval_pairs_with_negatives_samples_per_second": 28.351,
"eval_pairs_with_negatives_steps_per_second": 3.544,
"step": 3200
},
{
"epoch": 0.29931718267701807,
"eval_positives_loss": 0.06003187596797943,
"eval_positives_runtime": 52.079,
"eval_positives_samples_per_second": 42.244,
"eval_positives_steps_per_second": 5.28,
"step": 3200
},
{
"epoch": 0.30165559816668225,
"grad_norm": 1.81517493724823,
"learning_rate": 7.352304056715243e-05,
"loss": 0.28049240112304685,
"step": 3225
},
{
"epoch": 0.3039940136563465,
"grad_norm": 2.179776191711426,
"learning_rate": 7.327688066167783e-05,
"loss": 0.1677359962463379,
"step": 3250
},
{
"epoch": 0.30633242914601067,
"grad_norm": 2.7418649196624756,
"learning_rate": 7.303072075620323e-05,
"loss": 0.2120669364929199,
"step": 3275
},
{
"epoch": 0.30867084463567485,
"grad_norm": 3.016566514968872,
"learning_rate": 7.278456085072864e-05,
"loss": 0.19796632766723632,
"step": 3300
},
{
"epoch": 0.3110092601253391,
"grad_norm": 1.5679301023483276,
"learning_rate": 7.253840094525404e-05,
"loss": 0.2684922981262207,
"step": 3325
},
{
"epoch": 0.31334767561500326,
"grad_norm": 1.8379592895507812,
"learning_rate": 7.229224103977944e-05,
"loss": 0.25131099700927734,
"step": 3350
},
{
"epoch": 0.3156860911046675,
"grad_norm": 1.8164836168289185,
"learning_rate": 7.204608113430485e-05,
"loss": 0.22370563507080077,
"step": 3375
},
{
"epoch": 0.3180245065943317,
"grad_norm": 1.9795681238174438,
"learning_rate": 7.179992122883025e-05,
"loss": 0.23445991516113282,
"step": 3400
},
{
"epoch": 0.3180245065943317,
"eval_pairs_with_negatives_loss": 0.27237948775291443,
"eval_pairs_with_negatives_runtime": 43.9691,
"eval_pairs_with_negatives_samples_per_second": 28.566,
"eval_pairs_with_negatives_steps_per_second": 3.571,
"step": 3400
},
{
"epoch": 0.3180245065943317,
"eval_positives_loss": 0.059769779443740845,
"eval_positives_runtime": 51.6246,
"eval_positives_samples_per_second": 42.615,
"eval_positives_steps_per_second": 5.327,
"step": 3400
},
{
"epoch": 0.32036292208399586,
"grad_norm": 1.8819149732589722,
"learning_rate": 7.155376132335565e-05,
"loss": 0.19615522384643555,
"step": 3425
},
{
"epoch": 0.3227013375736601,
"grad_norm": 2.305645704269409,
"learning_rate": 7.130760141788106e-05,
"loss": 0.28631683349609377,
"step": 3450
},
{
"epoch": 0.3250397530633243,
"grad_norm": 1.6570643186569214,
"learning_rate": 7.106144151240647e-05,
"loss": 0.20692520141601561,
"step": 3475
},
{
"epoch": 0.3273781685529885,
"grad_norm": 2.9196584224700928,
"learning_rate": 7.081528160693187e-05,
"loss": 0.2614221000671387,
"step": 3500
},
{
"epoch": 0.3297165840426527,
"grad_norm": 1.714736819267273,
"learning_rate": 7.056912170145727e-05,
"loss": 0.2608006858825684,
"step": 3525
},
{
"epoch": 0.3320549995323169,
"grad_norm": 0.9146888852119446,
"learning_rate": 7.032296179598268e-05,
"loss": 0.17190082550048827,
"step": 3550
},
{
"epoch": 0.3343934150219811,
"grad_norm": 0.9113110303878784,
"learning_rate": 7.007680189050808e-05,
"loss": 0.1922085952758789,
"step": 3575
},
{
"epoch": 0.3367318305116453,
"grad_norm": 3.187330722808838,
"learning_rate": 6.983064198503348e-05,
"loss": 0.21484535217285156,
"step": 3600
},
{
"epoch": 0.3367318305116453,
"eval_pairs_with_negatives_loss": 0.2832874357700348,
"eval_pairs_with_negatives_runtime": 43.8993,
"eval_pairs_with_negatives_samples_per_second": 28.611,
"eval_pairs_with_negatives_steps_per_second": 3.576,
"step": 3600
},
{
"epoch": 0.3367318305116453,
"eval_positives_loss": 0.05738348141312599,
"eval_positives_runtime": 52.1582,
"eval_positives_samples_per_second": 42.179,
"eval_positives_steps_per_second": 5.272,
"step": 3600
},
{
"epoch": 0.3390702460013095,
"grad_norm": 1.554630160331726,
"learning_rate": 6.958448207955889e-05,
"loss": 0.2505316162109375,
"step": 3625
},
{
"epoch": 0.3414086614909737,
"grad_norm": 0.6170446276664734,
"learning_rate": 6.933832217408429e-05,
"loss": 0.27857002258300784,
"step": 3650
},
{
"epoch": 0.34374707698063794,
"grad_norm": 1.3156086206436157,
"learning_rate": 6.909216226860969e-05,
"loss": 0.24620241165161133,
"step": 3675
},
{
"epoch": 0.3460854924703021,
"grad_norm": 2.0060641765594482,
"learning_rate": 6.88460023631351e-05,
"loss": 0.23187232971191407,
"step": 3700
},
{
"epoch": 0.3484239079599663,
"grad_norm": 1.6845611333847046,
"learning_rate": 6.85998424576605e-05,
"loss": 0.24146879196166993,
"step": 3725
},
{
"epoch": 0.35076232344963054,
"grad_norm": 1.279873013496399,
"learning_rate": 6.83536825521859e-05,
"loss": 0.23632186889648438,
"step": 3750
},
{
"epoch": 0.3531007389392947,
"grad_norm": 0.7759600877761841,
"learning_rate": 6.810752264671131e-05,
"loss": 0.18325338363647461,
"step": 3775
},
{
"epoch": 0.35543915442895896,
"grad_norm": 2.35200834274292,
"learning_rate": 6.786136274123671e-05,
"loss": 0.22662141799926758,
"step": 3800
},
{
"epoch": 0.35543915442895896,
"eval_pairs_with_negatives_loss": 0.27636027336120605,
"eval_pairs_with_negatives_runtime": 44.3556,
"eval_pairs_with_negatives_samples_per_second": 28.317,
"eval_pairs_with_negatives_steps_per_second": 3.54,
"step": 3800
},
{
"epoch": 0.35543915442895896,
"eval_positives_loss": 0.05580952763557434,
"eval_positives_runtime": 51.8653,
"eval_positives_samples_per_second": 42.418,
"eval_positives_steps_per_second": 5.302,
"step": 3800
},
{
"epoch": 0.35777756991862314,
"grad_norm": 1.5299983024597168,
"learning_rate": 6.761520283576211e-05,
"loss": 0.1910099220275879,
"step": 3825
},
{
"epoch": 0.3601159854082873,
"grad_norm": 0.11183751374483109,
"learning_rate": 6.736904293028752e-05,
"loss": 0.28833539962768556,
"step": 3850
},
{
"epoch": 0.36245440089795156,
"grad_norm": 0.6836090683937073,
"learning_rate": 6.712288302481292e-05,
"loss": 0.18666194915771483,
"step": 3875
},
{
"epoch": 0.36479281638761574,
"grad_norm": 2.2268402576446533,
"learning_rate": 6.687672311933832e-05,
"loss": 0.22112154006958007,
"step": 3900
},
{
"epoch": 0.36713123187728,
"grad_norm": 2.553718328475952,
"learning_rate": 6.663056321386373e-05,
"loss": 0.2308146858215332,
"step": 3925
},
{
"epoch": 0.36946964736694415,
"grad_norm": 2.780961275100708,
"learning_rate": 6.638440330838913e-05,
"loss": 0.23387022018432618,
"step": 3950
},
{
"epoch": 0.37180806285660833,
"grad_norm": 2.0844075679779053,
"learning_rate": 6.613824340291453e-05,
"loss": 0.22896940231323243,
"step": 3975
},
{
"epoch": 0.37414647834627257,
"grad_norm": 2.054213762283325,
"learning_rate": 6.589208349743993e-05,
"loss": 0.2557160186767578,
"step": 4000
},
{
"epoch": 0.37414647834627257,
"eval_pairs_with_negatives_loss": 0.2681486904621124,
"eval_pairs_with_negatives_runtime": 44.1809,
"eval_pairs_with_negatives_samples_per_second": 28.429,
"eval_pairs_with_negatives_steps_per_second": 3.554,
"step": 4000
},
{
"epoch": 0.37414647834627257,
"eval_positives_loss": 0.05567891150712967,
"eval_positives_runtime": 52.0655,
"eval_positives_samples_per_second": 42.254,
"eval_positives_steps_per_second": 5.282,
"step": 4000
},
{
"epoch": 0.37648489383593675,
"grad_norm": 2.3532962799072266,
"learning_rate": 6.564592359196534e-05,
"loss": 0.21579030990600587,
"step": 4025
},
{
"epoch": 0.378823309325601,
"grad_norm": 2.108341693878174,
"learning_rate": 6.539976368649074e-05,
"loss": 0.22786386489868163,
"step": 4050
},
{
"epoch": 0.38116172481526517,
"grad_norm": 2.600250244140625,
"learning_rate": 6.515360378101614e-05,
"loss": 0.23480154037475587,
"step": 4075
},
{
"epoch": 0.3835001403049294,
"grad_norm": 1.9608969688415527,
"learning_rate": 6.490744387554155e-05,
"loss": 0.32279632568359373,
"step": 4100
},
{
"epoch": 0.3858385557945936,
"grad_norm": 1.2891011238098145,
"learning_rate": 6.466128397006695e-05,
"loss": 0.20148227691650392,
"step": 4125
},
{
"epoch": 0.38817697128425777,
"grad_norm": 2.1007683277130127,
"learning_rate": 6.441512406459235e-05,
"loss": 0.17734472274780275,
"step": 4150
},
{
"epoch": 0.390515386773922,
"grad_norm": 2.133220672607422,
"learning_rate": 6.416896415911776e-05,
"loss": 0.21942649841308592,
"step": 4175
},
{
"epoch": 0.3928538022635862,
"grad_norm": 1.508278489112854,
"learning_rate": 6.392280425364316e-05,
"loss": 0.2076035499572754,
"step": 4200
},
{
"epoch": 0.3928538022635862,
"eval_pairs_with_negatives_loss": 0.260955810546875,
"eval_pairs_with_negatives_runtime": 44.262,
"eval_pairs_with_negatives_samples_per_second": 28.377,
"eval_pairs_with_negatives_steps_per_second": 3.547,
"step": 4200
},
{
"epoch": 0.3928538022635862,
"eval_positives_loss": 0.05449853464961052,
"eval_positives_runtime": 51.8122,
"eval_positives_samples_per_second": 42.461,
"eval_positives_steps_per_second": 5.308,
"step": 4200
},
{
"epoch": 0.3951922177532504,
"grad_norm": 1.8336026668548584,
"learning_rate": 6.367664434816856e-05,
"loss": 0.24127521514892578,
"step": 4225
},
{
"epoch": 0.3975306332429146,
"grad_norm": 0.6785283088684082,
"learning_rate": 6.343048444269398e-05,
"loss": 0.21064716339111328,
"step": 4250
},
{
"epoch": 0.3998690487325788,
"grad_norm": 2.412092685699463,
"learning_rate": 6.318432453721939e-05,
"loss": 0.20108203887939452,
"step": 4275
},
{
"epoch": 0.402207464222243,
"grad_norm": 1.3605124950408936,
"learning_rate": 6.293816463174479e-05,
"loss": 0.2751664733886719,
"step": 4300
},
{
"epoch": 0.4045458797119072,
"grad_norm": 1.950619101524353,
"learning_rate": 6.26920047262702e-05,
"loss": 0.21901239395141603,
"step": 4325
},
{
"epoch": 0.40688429520157143,
"grad_norm": 1.6900594234466553,
"learning_rate": 6.24458448207956e-05,
"loss": 0.22335056304931641,
"step": 4350
},
{
"epoch": 0.4092227106912356,
"grad_norm": 2.273475170135498,
"learning_rate": 6.2199684915321e-05,
"loss": 0.26476852416992186,
"step": 4375
},
{
"epoch": 0.41156112618089985,
"grad_norm": 0.957051157951355,
"learning_rate": 6.19535250098464e-05,
"loss": 0.23246747970581055,
"step": 4400
},
{
"epoch": 0.41156112618089985,
"eval_pairs_with_negatives_loss": 0.25503063201904297,
"eval_pairs_with_negatives_runtime": 45.0565,
"eval_pairs_with_negatives_samples_per_second": 27.876,
"eval_pairs_with_negatives_steps_per_second": 3.485,
"step": 4400
},
{
"epoch": 0.41156112618089985,
"eval_positives_loss": 0.05083151161670685,
"eval_positives_runtime": 52.0733,
"eval_positives_samples_per_second": 42.248,
"eval_positives_steps_per_second": 5.281,
"step": 4400
},
{
"epoch": 0.41389954167056403,
"grad_norm": 1.8713246583938599,
"learning_rate": 6.170736510437181e-05,
"loss": 0.30198251724243164,
"step": 4425
},
{
"epoch": 0.4162379571602282,
"grad_norm": 3.0338542461395264,
"learning_rate": 6.146120519889721e-05,
"loss": 0.23007225036621093,
"step": 4450
},
{
"epoch": 0.41857637264989245,
"grad_norm": 2.191865921020508,
"learning_rate": 6.12150452934226e-05,
"loss": 0.199759521484375,
"step": 4475
},
{
"epoch": 0.42091478813955663,
"grad_norm": 2.360621452331543,
"learning_rate": 6.096888538794802e-05,
"loss": 0.2532151412963867,
"step": 4500
},
{
"epoch": 0.42325320362922086,
"grad_norm": 1.3209141492843628,
"learning_rate": 6.072272548247342e-05,
"loss": 0.20021892547607423,
"step": 4525
},
{
"epoch": 0.42559161911888505,
"grad_norm": 1.3700189590454102,
"learning_rate": 6.0476565576998824e-05,
"loss": 0.22432531356811525,
"step": 4550
},
{
"epoch": 0.4279300346085492,
"grad_norm": 0.8751669526100159,
"learning_rate": 6.023040567152422e-05,
"loss": 0.22744199752807617,
"step": 4575
},
{
"epoch": 0.43026845009821346,
"grad_norm": 0.6762781143188477,
"learning_rate": 5.998424576604963e-05,
"loss": 0.18776168823242187,
"step": 4600
},
{
"epoch": 0.43026845009821346,
"eval_pairs_with_negatives_loss": 0.25706836581230164,
"eval_pairs_with_negatives_runtime": 44.6857,
"eval_pairs_with_negatives_samples_per_second": 28.107,
"eval_pairs_with_negatives_steps_per_second": 3.513,
"step": 4600
},
{
"epoch": 0.43026845009821346,
"eval_positives_loss": 0.04761563614010811,
"eval_positives_runtime": 52.7137,
"eval_positives_samples_per_second": 41.735,
"eval_positives_steps_per_second": 5.217,
"step": 4600
},
{
"epoch": 0.43260686558787764,
"grad_norm": 1.4734338521957397,
"learning_rate": 5.9738085860575034e-05,
"loss": 0.23244962692260743,
"step": 4625
},
{
"epoch": 0.4349452810775419,
"grad_norm": 1.2065322399139404,
"learning_rate": 5.949192595510043e-05,
"loss": 0.1930523109436035,
"step": 4650
},
{
"epoch": 0.43728369656720606,
"grad_norm": 2.4672422409057617,
"learning_rate": 5.924576604962584e-05,
"loss": 0.2419593620300293,
"step": 4675
},
{
"epoch": 0.43962211205687024,
"grad_norm": 2.3826215267181396,
"learning_rate": 5.8999606144151245e-05,
"loss": 0.27065000534057615,
"step": 4700
},
{
"epoch": 0.4419605275465345,
"grad_norm": 1.9834275245666504,
"learning_rate": 5.8753446238676644e-05,
"loss": 0.21747297286987305,
"step": 4725
},
{
"epoch": 0.44429894303619866,
"grad_norm": 1.5482553243637085,
"learning_rate": 5.850728633320205e-05,
"loss": 0.22796871185302733,
"step": 4750
},
{
"epoch": 0.4466373585258629,
"grad_norm": 2.7519659996032715,
"learning_rate": 5.8261126427727455e-05,
"loss": 0.21714401245117188,
"step": 4775
},
{
"epoch": 0.4489757740155271,
"grad_norm": 2.4831058979034424,
"learning_rate": 5.8014966522252854e-05,
"loss": 0.23129558563232422,
"step": 4800
},
{
"epoch": 0.4489757740155271,
"eval_pairs_with_negatives_loss": 0.2441239058971405,
"eval_pairs_with_negatives_runtime": 45.0394,
"eval_pairs_with_negatives_samples_per_second": 27.887,
"eval_pairs_with_negatives_steps_per_second": 3.486,
"step": 4800
},
{
"epoch": 0.4489757740155271,
"eval_positives_loss": 0.050484515726566315,
"eval_positives_runtime": 52.0702,
"eval_positives_samples_per_second": 42.251,
"eval_positives_steps_per_second": 5.281,
"step": 4800
},
{
"epoch": 0.4513141895051913,
"grad_norm": 2.1840813159942627,
"learning_rate": 5.776880661677826e-05,
"loss": 0.20479650497436525,
"step": 4825
},
{
"epoch": 0.4536526049948555,
"grad_norm": 2.1629340648651123,
"learning_rate": 5.7522646711303666e-05,
"loss": 0.2170286750793457,
"step": 4850
},
{
"epoch": 0.45599102048451967,
"grad_norm": 0.20162469148635864,
"learning_rate": 5.7276486805829065e-05,
"loss": 0.2318229866027832,
"step": 4875
},
{
"epoch": 0.4583294359741839,
"grad_norm": 1.4626463651657104,
"learning_rate": 5.703032690035447e-05,
"loss": 0.21925630569458007,
"step": 4900
},
{
"epoch": 0.4606678514638481,
"grad_norm": 3.6034932136535645,
"learning_rate": 5.678416699487987e-05,
"loss": 0.23375102996826172,
"step": 4925
},
{
"epoch": 0.4630062669535123,
"grad_norm": 0.8324385285377502,
"learning_rate": 5.6538007089405275e-05,
"loss": 0.22733007431030272,
"step": 4950
},
{
"epoch": 0.4653446824431765,
"grad_norm": 2.4419448375701904,
"learning_rate": 5.629184718393068e-05,
"loss": 0.2223438262939453,
"step": 4975
},
{
"epoch": 0.4676830979328407,
"grad_norm": 1.6555243730545044,
"learning_rate": 5.604568727845608e-05,
"loss": 0.22205371856689454,
"step": 5000
},
{
"epoch": 0.4676830979328407,
"eval_pairs_with_negatives_loss": 0.2421402484178543,
"eval_pairs_with_negatives_runtime": 44.4946,
"eval_pairs_with_negatives_samples_per_second": 28.228,
"eval_pairs_with_negatives_steps_per_second": 3.529,
"step": 5000
},
{
"epoch": 0.4676830979328407,
"eval_positives_loss": 0.0468609519302845,
"eval_positives_runtime": 52.2416,
"eval_positives_samples_per_second": 42.112,
"eval_positives_steps_per_second": 5.264,
"step": 5000
}
],
"logging_steps": 25,
"max_steps": 10691,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}