{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4676830979328407, "eval_steps": 200, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0023384154896642037, "grad_norm": 1.9981695413589478, "learning_rate": 4.4859813084112145e-06, "loss": 0.47716766357421875, "step": 25 }, { "epoch": 0.004676830979328407, "grad_norm": 1.9483280181884766, "learning_rate": 9.158878504672897e-06, "loss": 0.4592530059814453, "step": 50 }, { "epoch": 0.0070152464689926105, "grad_norm": 2.1290855407714844, "learning_rate": 1.3831775700934579e-05, "loss": 0.394501838684082, "step": 75 }, { "epoch": 0.009353661958656815, "grad_norm": 2.8394205570220947, "learning_rate": 1.8504672897196264e-05, "loss": 0.3752219009399414, "step": 100 }, { "epoch": 0.011692077448321018, "grad_norm": 2.5833706855773926, "learning_rate": 2.3177570093457944e-05, "loss": 0.40475303649902344, "step": 125 }, { "epoch": 0.014030492937985221, "grad_norm": 2.622011661529541, "learning_rate": 2.7850467289719627e-05, "loss": 0.45625301361083986, "step": 150 }, { "epoch": 0.016368908427649424, "grad_norm": 2.9406535625457764, "learning_rate": 3.2523364485981314e-05, "loss": 0.34918937683105467, "step": 175 }, { "epoch": 0.01870732391731363, "grad_norm": 3.8391785621643066, "learning_rate": 3.7196261682242994e-05, "loss": 0.41711517333984377, "step": 200 }, { "epoch": 0.01870732391731363, "eval_pairs_with_negatives_loss": 0.3914637565612793, "eval_pairs_with_negatives_runtime": 44.0353, "eval_pairs_with_negatives_samples_per_second": 28.523, "eval_pairs_with_negatives_steps_per_second": 3.565, "step": 200 }, { "epoch": 0.01870732391731363, "eval_positives_loss": 0.1480681300163269, "eval_positives_runtime": 51.7193, "eval_positives_samples_per_second": 42.537, "eval_positives_steps_per_second": 5.317, "step": 200 }, { "epoch": 0.02104573940697783, "grad_norm": 2.3628170490264893, "learning_rate": 4.186915887850468e-05, "loss": 0.4296648406982422, "step": 225 }, { "epoch": 0.023384154896642036, "grad_norm": 2.698835611343384, "learning_rate": 4.6542056074766354e-05, "loss": 0.43652393341064455, "step": 250 }, { "epoch": 0.02572257038630624, "grad_norm": 4.1166558265686035, "learning_rate": 5.121495327102804e-05, "loss": 0.4344004440307617, "step": 275 }, { "epoch": 0.028060985875970442, "grad_norm": 4.551556587219238, "learning_rate": 5.588785046728973e-05, "loss": 0.41842262268066405, "step": 300 }, { "epoch": 0.030399401365634647, "grad_norm": 2.3925657272338867, "learning_rate": 6.056074766355141e-05, "loss": 0.4197782897949219, "step": 325 }, { "epoch": 0.03273781685529885, "grad_norm": 3.1023190021514893, "learning_rate": 6.52336448598131e-05, "loss": 0.4292975616455078, "step": 350 }, { "epoch": 0.03507623234496305, "grad_norm": 4.1481032371521, "learning_rate": 6.990654205607478e-05, "loss": 0.4758753204345703, "step": 375 }, { "epoch": 0.03741464783462726, "grad_norm": 3.8799962997436523, "learning_rate": 7.457943925233644e-05, "loss": 0.3311753845214844, "step": 400 }, { "epoch": 0.03741464783462726, "eval_pairs_with_negatives_loss": 0.3694910407066345, "eval_pairs_with_negatives_runtime": 44.2166, "eval_pairs_with_negatives_samples_per_second": 28.406, "eval_pairs_with_negatives_steps_per_second": 3.551, "step": 400 }, { "epoch": 0.03741464783462726, "eval_positives_loss": 0.11797073483467102, "eval_positives_runtime": 51.3355, "eval_positives_samples_per_second": 42.855, "eval_positives_steps_per_second": 5.357, "step": 400 }, { "epoch": 0.03975306332429146, "grad_norm": 3.7068564891815186, "learning_rate": 7.925233644859813e-05, "loss": 0.388726806640625, "step": 425 }, { "epoch": 0.04209147881395566, "grad_norm": 2.3407328128814697, "learning_rate": 8.392523364485981e-05, "loss": 0.4401784133911133, "step": 450 }, { "epoch": 0.04442989430361987, "grad_norm": 3.0923948287963867, "learning_rate": 8.85981308411215e-05, "loss": 0.41050430297851564, "step": 475 }, { "epoch": 0.04676830979328407, "grad_norm": 2.626753568649292, "learning_rate": 9.327102803738317e-05, "loss": 0.3923164749145508, "step": 500 }, { "epoch": 0.04910672528294827, "grad_norm": 2.729557991027832, "learning_rate": 9.794392523364486e-05, "loss": 0.3163204765319824, "step": 525 }, { "epoch": 0.05144514077261248, "grad_norm": 3.1612608432769775, "learning_rate": 9.986215045293424e-05, "loss": 0.35652976989746094, "step": 550 }, { "epoch": 0.05378355626227668, "grad_norm": 2.224350690841675, "learning_rate": 9.961599054745964e-05, "loss": 0.37072269439697264, "step": 575 }, { "epoch": 0.056121971751940884, "grad_norm": 3.207382917404175, "learning_rate": 9.936983064198503e-05, "loss": 0.3007513427734375, "step": 600 }, { "epoch": 0.056121971751940884, "eval_pairs_with_negatives_loss": 0.3388254940509796, "eval_pairs_with_negatives_runtime": 43.9558, "eval_pairs_with_negatives_samples_per_second": 28.574, "eval_pairs_with_negatives_steps_per_second": 3.572, "step": 600 }, { "epoch": 0.056121971751940884, "eval_positives_loss": 0.10862970352172852, "eval_positives_runtime": 51.7355, "eval_positives_samples_per_second": 42.524, "eval_positives_steps_per_second": 5.315, "step": 600 }, { "epoch": 0.058460387241605086, "grad_norm": 4.494985103607178, "learning_rate": 9.912367073651045e-05, "loss": 0.35943916320800784, "step": 625 }, { "epoch": 0.060798802731269294, "grad_norm": 3.7057838439941406, "learning_rate": 9.887751083103585e-05, "loss": 0.39355968475341796, "step": 650 }, { "epoch": 0.06313721822093349, "grad_norm": 1.6454180479049683, "learning_rate": 9.863135092556125e-05, "loss": 0.32073760986328126, "step": 675 }, { "epoch": 0.0654756337105977, "grad_norm": 3.901522636413574, "learning_rate": 9.838519102008666e-05, "loss": 0.3371485900878906, "step": 700 }, { "epoch": 0.0678140492002619, "grad_norm": 2.2362253665924072, "learning_rate": 9.813903111461206e-05, "loss": 0.3385154724121094, "step": 725 }, { "epoch": 0.0701524646899261, "grad_norm": 2.490204334259033, "learning_rate": 9.789287120913746e-05, "loss": 0.2718297004699707, "step": 750 }, { "epoch": 0.07249088017959031, "grad_norm": 2.2875030040740967, "learning_rate": 9.764671130366287e-05, "loss": 0.44294830322265627, "step": 775 }, { "epoch": 0.07482929566925452, "grad_norm": 1.40684175491333, "learning_rate": 9.740055139818827e-05, "loss": 0.2684394645690918, "step": 800 }, { "epoch": 0.07482929566925452, "eval_pairs_with_negatives_loss": 0.34527480602264404, "eval_pairs_with_negatives_runtime": 44.0724, "eval_pairs_with_negatives_samples_per_second": 28.499, "eval_pairs_with_negatives_steps_per_second": 3.562, "step": 800 }, { "epoch": 0.07482929566925452, "eval_positives_loss": 0.10431129485368729, "eval_positives_runtime": 51.6255, "eval_positives_samples_per_second": 42.615, "eval_positives_steps_per_second": 5.327, "step": 800 }, { "epoch": 0.07716771115891871, "grad_norm": 2.8712947368621826, "learning_rate": 9.715439149271367e-05, "loss": 0.25394817352294924, "step": 825 }, { "epoch": 0.07950612664858292, "grad_norm": 1.8017457723617554, "learning_rate": 9.690823158723908e-05, "loss": 0.32388198852539063, "step": 850 }, { "epoch": 0.08184454213824713, "grad_norm": 2.945971727371216, "learning_rate": 9.666207168176448e-05, "loss": 0.29435272216796876, "step": 875 }, { "epoch": 0.08418295762791132, "grad_norm": 2.1370229721069336, "learning_rate": 9.641591177628988e-05, "loss": 0.30667646408081056, "step": 900 }, { "epoch": 0.08652137311757553, "grad_norm": 3.4880053997039795, "learning_rate": 9.616975187081529e-05, "loss": 0.3113353729248047, "step": 925 }, { "epoch": 0.08885978860723974, "grad_norm": 1.221985101699829, "learning_rate": 9.592359196534069e-05, "loss": 0.33869354248046873, "step": 950 }, { "epoch": 0.09119820409690393, "grad_norm": 2.5686190128326416, "learning_rate": 9.567743205986609e-05, "loss": 0.2734596633911133, "step": 975 }, { "epoch": 0.09353661958656814, "grad_norm": 1.7126892805099487, "learning_rate": 9.54312721543915e-05, "loss": 0.2984904098510742, "step": 1000 }, { "epoch": 0.09353661958656814, "eval_pairs_with_negatives_loss": 0.3210560381412506, "eval_pairs_with_negatives_runtime": 44.9784, "eval_pairs_with_negatives_samples_per_second": 27.925, "eval_pairs_with_negatives_steps_per_second": 3.491, "step": 1000 }, { "epoch": 0.09353661958656814, "eval_positives_loss": 0.08913413435220718, "eval_positives_runtime": 52.3889, "eval_positives_samples_per_second": 41.994, "eval_positives_steps_per_second": 5.249, "step": 1000 }, { "epoch": 0.09587503507623235, "grad_norm": 1.6900842189788818, "learning_rate": 9.51851122489169e-05, "loss": 0.355332145690918, "step": 1025 }, { "epoch": 0.09821345056589655, "grad_norm": 0.7989633083343506, "learning_rate": 9.49389523434423e-05, "loss": 0.25679166793823244, "step": 1050 }, { "epoch": 0.10055186605556075, "grad_norm": 1.7311954498291016, "learning_rate": 9.469279243796771e-05, "loss": 0.344718017578125, "step": 1075 }, { "epoch": 0.10289028154522496, "grad_norm": 1.9694781303405762, "learning_rate": 9.444663253249311e-05, "loss": 0.3239378356933594, "step": 1100 }, { "epoch": 0.10522869703488916, "grad_norm": 2.0283656120300293, "learning_rate": 9.420047262701852e-05, "loss": 0.3015079879760742, "step": 1125 }, { "epoch": 0.10756711252455337, "grad_norm": 2.0422067642211914, "learning_rate": 9.395431272154392e-05, "loss": 0.3864572906494141, "step": 1150 }, { "epoch": 0.10990552801421756, "grad_norm": 2.2227938175201416, "learning_rate": 9.370815281606933e-05, "loss": 0.2981968116760254, "step": 1175 }, { "epoch": 0.11224394350388177, "grad_norm": 1.9632631540298462, "learning_rate": 9.346199291059473e-05, "loss": 0.3105415725708008, "step": 1200 }, { "epoch": 0.11224394350388177, "eval_pairs_with_negatives_loss": 0.3232487738132477, "eval_pairs_with_negatives_runtime": 44.5297, "eval_pairs_with_negatives_samples_per_second": 28.206, "eval_pairs_with_negatives_steps_per_second": 3.526, "step": 1200 }, { "epoch": 0.11224394350388177, "eval_positives_loss": 0.08286190032958984, "eval_positives_runtime": 52.0911, "eval_positives_samples_per_second": 42.234, "eval_positives_steps_per_second": 5.279, "step": 1200 }, { "epoch": 0.11458235899354598, "grad_norm": 0.5930349826812744, "learning_rate": 9.321583300512013e-05, "loss": 0.29635957717895506, "step": 1225 }, { "epoch": 0.11692077448321017, "grad_norm": 1.5982012748718262, "learning_rate": 9.296967309964554e-05, "loss": 0.24172809600830078, "step": 1250 }, { "epoch": 0.11925918997287438, "grad_norm": 0.5673118829727173, "learning_rate": 9.272351319417094e-05, "loss": 0.26859012603759763, "step": 1275 }, { "epoch": 0.12159760546253859, "grad_norm": 1.4948972463607788, "learning_rate": 9.247735328869634e-05, "loss": 0.2932207489013672, "step": 1300 }, { "epoch": 0.12393602095220278, "grad_norm": 1.545386791229248, "learning_rate": 9.223119338322175e-05, "loss": 0.2383422088623047, "step": 1325 }, { "epoch": 0.12627443644186698, "grad_norm": 2.5136566162109375, "learning_rate": 9.198503347774715e-05, "loss": 0.31081596374511716, "step": 1350 }, { "epoch": 0.12861285193153119, "grad_norm": 1.8467180728912354, "learning_rate": 9.173887357227255e-05, "loss": 0.321625862121582, "step": 1375 }, { "epoch": 0.1309512674211954, "grad_norm": 1.3382201194763184, "learning_rate": 9.149271366679796e-05, "loss": 0.2083415222167969, "step": 1400 }, { "epoch": 0.1309512674211954, "eval_pairs_with_negatives_loss": 0.3091065585613251, "eval_pairs_with_negatives_runtime": 44.3305, "eval_pairs_with_negatives_samples_per_second": 28.333, "eval_pairs_with_negatives_steps_per_second": 3.542, "step": 1400 }, { "epoch": 0.1309512674211954, "eval_positives_loss": 0.08935973793268204, "eval_positives_runtime": 51.7119, "eval_positives_samples_per_second": 42.543, "eval_positives_steps_per_second": 5.318, "step": 1400 }, { "epoch": 0.1332896829108596, "grad_norm": 1.0311458110809326, "learning_rate": 9.124655376132336e-05, "loss": 0.2932785987854004, "step": 1425 }, { "epoch": 0.1356280984005238, "grad_norm": 2.180497884750366, "learning_rate": 9.100039385584876e-05, "loss": 0.2038213348388672, "step": 1450 }, { "epoch": 0.13796651389018802, "grad_norm": 2.1046860218048096, "learning_rate": 9.075423395037416e-05, "loss": 0.2514521217346191, "step": 1475 }, { "epoch": 0.1403049293798522, "grad_norm": 2.4484400749206543, "learning_rate": 9.050807404489957e-05, "loss": 0.26426057815551757, "step": 1500 }, { "epoch": 0.1426433448695164, "grad_norm": 0.5209934711456299, "learning_rate": 9.026191413942497e-05, "loss": 0.2484210968017578, "step": 1525 }, { "epoch": 0.14498176035918062, "grad_norm": 2.0274691581726074, "learning_rate": 9.001575423395037e-05, "loss": 0.32157943725585936, "step": 1550 }, { "epoch": 0.14732017584884483, "grad_norm": 2.850849151611328, "learning_rate": 8.976959432847578e-05, "loss": 0.32649993896484375, "step": 1575 }, { "epoch": 0.14965859133850903, "grad_norm": 3.255429267883301, "learning_rate": 8.952343442300118e-05, "loss": 0.26256885528564455, "step": 1600 }, { "epoch": 0.14965859133850903, "eval_pairs_with_negatives_loss": 0.3166193962097168, "eval_pairs_with_negatives_runtime": 44.3277, "eval_pairs_with_negatives_samples_per_second": 28.334, "eval_pairs_with_negatives_steps_per_second": 3.542, "step": 1600 }, { "epoch": 0.14965859133850903, "eval_positives_loss": 0.077468141913414, "eval_positives_runtime": 51.8074, "eval_positives_samples_per_second": 42.465, "eval_positives_steps_per_second": 5.308, "step": 1600 }, { "epoch": 0.15199700682817324, "grad_norm": 2.324928045272827, "learning_rate": 8.927727451752658e-05, "loss": 0.28111976623535156, "step": 1625 }, { "epoch": 0.15433542231783742, "grad_norm": 1.722293496131897, "learning_rate": 8.9031114612052e-05, "loss": 0.27923690795898437, "step": 1650 }, { "epoch": 0.15667383780750163, "grad_norm": 2.5481624603271484, "learning_rate": 8.87849547065774e-05, "loss": 0.2887708282470703, "step": 1675 }, { "epoch": 0.15901225329716584, "grad_norm": 1.4688785076141357, "learning_rate": 8.853879480110279e-05, "loss": 0.32429874420166016, "step": 1700 }, { "epoch": 0.16135066878683005, "grad_norm": 0.970000684261322, "learning_rate": 8.82926348956282e-05, "loss": 0.23183115005493163, "step": 1725 }, { "epoch": 0.16368908427649426, "grad_norm": 2.141195297241211, "learning_rate": 8.80464749901536e-05, "loss": 0.2943249702453613, "step": 1750 }, { "epoch": 0.16602749976615844, "grad_norm": 0.9625000357627869, "learning_rate": 8.7800315084679e-05, "loss": 0.24936399459838868, "step": 1775 }, { "epoch": 0.16836591525582265, "grad_norm": 2.191002368927002, "learning_rate": 8.755415517920442e-05, "loss": 0.3477742004394531, "step": 1800 }, { "epoch": 0.16836591525582265, "eval_pairs_with_negatives_loss": 0.311288446187973, "eval_pairs_with_negatives_runtime": 44.4068, "eval_pairs_with_negatives_samples_per_second": 28.284, "eval_pairs_with_negatives_steps_per_second": 3.535, "step": 1800 }, { "epoch": 0.16836591525582265, "eval_positives_loss": 0.07508163899183273, "eval_positives_runtime": 51.7306, "eval_positives_samples_per_second": 42.528, "eval_positives_steps_per_second": 5.316, "step": 1800 }, { "epoch": 0.17070433074548685, "grad_norm": 2.958533525466919, "learning_rate": 8.730799527372981e-05, "loss": 0.3265147018432617, "step": 1825 }, { "epoch": 0.17304274623515106, "grad_norm": 2.005192756652832, "learning_rate": 8.706183536825521e-05, "loss": 0.29331169128417967, "step": 1850 }, { "epoch": 0.17538116172481527, "grad_norm": 2.02463960647583, "learning_rate": 8.681567546278063e-05, "loss": 0.2671446990966797, "step": 1875 }, { "epoch": 0.17771957721447948, "grad_norm": 2.153892755508423, "learning_rate": 8.656951555730604e-05, "loss": 0.29273582458496095, "step": 1900 }, { "epoch": 0.18005799270414366, "grad_norm": 2.7679359912872314, "learning_rate": 8.632335565183144e-05, "loss": 0.29389562606811526, "step": 1925 }, { "epoch": 0.18239640819380787, "grad_norm": 2.963479995727539, "learning_rate": 8.607719574635684e-05, "loss": 0.2356496810913086, "step": 1950 }, { "epoch": 0.18473482368347208, "grad_norm": 2.6095352172851562, "learning_rate": 8.583103584088225e-05, "loss": 0.24131065368652344, "step": 1975 }, { "epoch": 0.18707323917313629, "grad_norm": 2.1474149227142334, "learning_rate": 8.558487593540765e-05, "loss": 0.20256967544555665, "step": 2000 }, { "epoch": 0.18707323917313629, "eval_pairs_with_negatives_loss": 0.2920902371406555, "eval_pairs_with_negatives_runtime": 44.1734, "eval_pairs_with_negatives_samples_per_second": 28.433, "eval_pairs_with_negatives_steps_per_second": 3.554, "step": 2000 }, { "epoch": 0.18707323917313629, "eval_positives_loss": 0.06497267633676529, "eval_positives_runtime": 51.883, "eval_positives_samples_per_second": 42.403, "eval_positives_steps_per_second": 5.3, "step": 2000 }, { "epoch": 0.1894116546628005, "grad_norm": 1.4445933103561401, "learning_rate": 8.533871602993305e-05, "loss": 0.2663409423828125, "step": 2025 }, { "epoch": 0.1917500701524647, "grad_norm": 2.1832194328308105, "learning_rate": 8.509255612445846e-05, "loss": 0.24383123397827147, "step": 2050 }, { "epoch": 0.19408848564212888, "grad_norm": 1.7301610708236694, "learning_rate": 8.484639621898386e-05, "loss": 0.23211950302124024, "step": 2075 }, { "epoch": 0.1964269011317931, "grad_norm": 1.9371556043624878, "learning_rate": 8.460023631350926e-05, "loss": 0.24819377899169923, "step": 2100 }, { "epoch": 0.1987653166214573, "grad_norm": 2.9007513523101807, "learning_rate": 8.435407640803467e-05, "loss": 0.3000238037109375, "step": 2125 }, { "epoch": 0.2011037321111215, "grad_norm": 2.155949115753174, "learning_rate": 8.410791650256007e-05, "loss": 0.19902172088623046, "step": 2150 }, { "epoch": 0.20344214760078572, "grad_norm": 1.1646662950515747, "learning_rate": 8.386175659708547e-05, "loss": 0.2393128204345703, "step": 2175 }, { "epoch": 0.20578056309044993, "grad_norm": 0.6050031185150146, "learning_rate": 8.361559669161088e-05, "loss": 0.23696456909179686, "step": 2200 }, { "epoch": 0.20578056309044993, "eval_pairs_with_negatives_loss": 0.2844306230545044, "eval_pairs_with_negatives_runtime": 43.6185, "eval_pairs_with_negatives_samples_per_second": 28.795, "eval_pairs_with_negatives_steps_per_second": 3.599, "step": 2200 }, { "epoch": 0.20578056309044993, "eval_positives_loss": 0.06695789843797684, "eval_positives_runtime": 51.2178, "eval_positives_samples_per_second": 42.954, "eval_positives_steps_per_second": 5.369, "step": 2200 }, { "epoch": 0.2081189785801141, "grad_norm": 1.7829246520996094, "learning_rate": 8.336943678613628e-05, "loss": 0.21305316925048828, "step": 2225 }, { "epoch": 0.21045739406977831, "grad_norm": 1.9647576808929443, "learning_rate": 8.312327688066168e-05, "loss": 0.2547788429260254, "step": 2250 }, { "epoch": 0.21279580955944252, "grad_norm": 0.9661738276481628, "learning_rate": 8.287711697518709e-05, "loss": 0.30158185958862305, "step": 2275 }, { "epoch": 0.21513422504910673, "grad_norm": 0.4944344162940979, "learning_rate": 8.263095706971249e-05, "loss": 0.1959225845336914, "step": 2300 }, { "epoch": 0.21747264053877094, "grad_norm": 2.383636474609375, "learning_rate": 8.238479716423789e-05, "loss": 0.260382194519043, "step": 2325 }, { "epoch": 0.21981105602843512, "grad_norm": 2.4864633083343506, "learning_rate": 8.21386372587633e-05, "loss": 0.3141353225708008, "step": 2350 }, { "epoch": 0.22214947151809933, "grad_norm": 1.3516175746917725, "learning_rate": 8.18924773532887e-05, "loss": 0.2728991889953613, "step": 2375 }, { "epoch": 0.22448788700776354, "grad_norm": 3.200805902481079, "learning_rate": 8.16463174478141e-05, "loss": 0.24915071487426757, "step": 2400 }, { "epoch": 0.22448788700776354, "eval_pairs_with_negatives_loss": 0.2853996157646179, "eval_pairs_with_negatives_runtime": 44.3715, "eval_pairs_with_negatives_samples_per_second": 28.306, "eval_pairs_with_negatives_steps_per_second": 3.538, "step": 2400 }, { "epoch": 0.22448788700776354, "eval_positives_loss": 0.06402233988046646, "eval_positives_runtime": 51.541, "eval_positives_samples_per_second": 42.684, "eval_positives_steps_per_second": 5.336, "step": 2400 }, { "epoch": 0.22682630249742775, "grad_norm": 2.3375115394592285, "learning_rate": 8.140015754233951e-05, "loss": 0.23255537033081056, "step": 2425 }, { "epoch": 0.22916471798709195, "grad_norm": 1.075677752494812, "learning_rate": 8.115399763686491e-05, "loss": 0.2849599456787109, "step": 2450 }, { "epoch": 0.23150313347675616, "grad_norm": 1.7264649868011475, "learning_rate": 8.090783773139031e-05, "loss": 0.23932256698608398, "step": 2475 }, { "epoch": 0.23384154896642034, "grad_norm": 2.3798885345458984, "learning_rate": 8.066167782591572e-05, "loss": 0.27479507446289064, "step": 2500 }, { "epoch": 0.23617996445608455, "grad_norm": 1.7838364839553833, "learning_rate": 8.041551792044112e-05, "loss": 0.22890100479125977, "step": 2525 }, { "epoch": 0.23851837994574876, "grad_norm": 0.8337921500205994, "learning_rate": 8.016935801496652e-05, "loss": 0.24863414764404296, "step": 2550 }, { "epoch": 0.24085679543541297, "grad_norm": 3.2835209369659424, "learning_rate": 7.992319810949192e-05, "loss": 0.2846149635314941, "step": 2575 }, { "epoch": 0.24319521092507718, "grad_norm": 1.3565106391906738, "learning_rate": 7.967703820401733e-05, "loss": 0.2026744842529297, "step": 2600 }, { "epoch": 0.24319521092507718, "eval_pairs_with_negatives_loss": 0.27976956963539124, "eval_pairs_with_negatives_runtime": 44.1274, "eval_pairs_with_negatives_samples_per_second": 28.463, "eval_pairs_with_negatives_steps_per_second": 3.558, "step": 2600 }, { "epoch": 0.24319521092507718, "eval_positives_loss": 0.05857069417834282, "eval_positives_runtime": 51.6223, "eval_positives_samples_per_second": 42.617, "eval_positives_steps_per_second": 5.327, "step": 2600 }, { "epoch": 0.24553362641474138, "grad_norm": 1.8603383302688599, "learning_rate": 7.943087829854273e-05, "loss": 0.23360692977905273, "step": 2625 }, { "epoch": 0.24787204190440557, "grad_norm": 2.318513870239258, "learning_rate": 7.918471839306813e-05, "loss": 0.2207220458984375, "step": 2650 }, { "epoch": 0.2502104573940698, "grad_norm": 1.7352806329727173, "learning_rate": 7.893855848759354e-05, "loss": 0.23572732925415038, "step": 2675 }, { "epoch": 0.25254887288373395, "grad_norm": 2.457981824874878, "learning_rate": 7.869239858211895e-05, "loss": 0.21319828033447266, "step": 2700 }, { "epoch": 0.2548872883733982, "grad_norm": 1.7361868619918823, "learning_rate": 7.844623867664435e-05, "loss": 0.21519132614135741, "step": 2725 }, { "epoch": 0.25722570386306237, "grad_norm": 2.6403586864471436, "learning_rate": 7.820007877116977e-05, "loss": 0.2046283531188965, "step": 2750 }, { "epoch": 0.2595641193527266, "grad_norm": 2.263866424560547, "learning_rate": 7.795391886569517e-05, "loss": 0.18240520477294922, "step": 2775 }, { "epoch": 0.2619025348423908, "grad_norm": 2.069082736968994, "learning_rate": 7.770775896022056e-05, "loss": 0.2405707359313965, "step": 2800 }, { "epoch": 0.2619025348423908, "eval_pairs_with_negatives_loss": 0.2774912714958191, "eval_pairs_with_negatives_runtime": 44.1229, "eval_pairs_with_negatives_samples_per_second": 28.466, "eval_pairs_with_negatives_steps_per_second": 3.558, "step": 2800 }, { "epoch": 0.2619025348423908, "eval_positives_loss": 0.06239576265215874, "eval_positives_runtime": 51.4606, "eval_positives_samples_per_second": 42.751, "eval_positives_steps_per_second": 5.344, "step": 2800 }, { "epoch": 0.264240950332055, "grad_norm": 1.5124787092208862, "learning_rate": 7.746159905474598e-05, "loss": 0.2240062713623047, "step": 2825 }, { "epoch": 0.2665793658217192, "grad_norm": 2.6289567947387695, "learning_rate": 7.721543914927138e-05, "loss": 0.2537799644470215, "step": 2850 }, { "epoch": 0.2689177813113834, "grad_norm": 1.4767881631851196, "learning_rate": 7.696927924379677e-05, "loss": 0.19011005401611328, "step": 2875 }, { "epoch": 0.2712561968010476, "grad_norm": 1.8631181716918945, "learning_rate": 7.672311933832217e-05, "loss": 0.27923820495605467, "step": 2900 }, { "epoch": 0.2735946122907118, "grad_norm": 1.699515461921692, "learning_rate": 7.647695943284759e-05, "loss": 0.24893655776977539, "step": 2925 }, { "epoch": 0.27593302778037604, "grad_norm": 1.1183840036392212, "learning_rate": 7.623079952737299e-05, "loss": 0.23708009719848633, "step": 2950 }, { "epoch": 0.2782714432700402, "grad_norm": 1.764267921447754, "learning_rate": 7.598463962189838e-05, "loss": 0.2170231056213379, "step": 2975 }, { "epoch": 0.2806098587597044, "grad_norm": 1.3701727390289307, "learning_rate": 7.57384797164238e-05, "loss": 0.2408245849609375, "step": 3000 }, { "epoch": 0.2806098587597044, "eval_pairs_with_negatives_loss": 0.27622753381729126, "eval_pairs_with_negatives_runtime": 44.0716, "eval_pairs_with_negatives_samples_per_second": 28.499, "eval_pairs_with_negatives_steps_per_second": 3.562, "step": 3000 }, { "epoch": 0.2806098587597044, "eval_positives_loss": 0.05702820420265198, "eval_positives_runtime": 51.7038, "eval_positives_samples_per_second": 42.55, "eval_positives_steps_per_second": 5.319, "step": 3000 }, { "epoch": 0.28294827424936864, "grad_norm": 0.21540337800979614, "learning_rate": 7.54923198109492e-05, "loss": 0.15430140495300293, "step": 3025 }, { "epoch": 0.2852866897390328, "grad_norm": 1.8154865503311157, "learning_rate": 7.52461599054746e-05, "loss": 0.2857963180541992, "step": 3050 }, { "epoch": 0.28762510522869705, "grad_norm": 1.347398042678833, "learning_rate": 7.500000000000001e-05, "loss": 0.22897544860839844, "step": 3075 }, { "epoch": 0.28996352071836123, "grad_norm": 1.910434603691101, "learning_rate": 7.47538400945254e-05, "loss": 0.3003374099731445, "step": 3100 }, { "epoch": 0.2923019362080254, "grad_norm": 2.536224365234375, "learning_rate": 7.45076801890508e-05, "loss": 0.21426973342895508, "step": 3125 }, { "epoch": 0.29464035169768965, "grad_norm": 1.4936145544052124, "learning_rate": 7.426152028357622e-05, "loss": 0.248642578125, "step": 3150 }, { "epoch": 0.29697876718735383, "grad_norm": 1.5778441429138184, "learning_rate": 7.401536037810162e-05, "loss": 0.24121809005737305, "step": 3175 }, { "epoch": 0.29931718267701807, "grad_norm": 2.0866878032684326, "learning_rate": 7.376920047262702e-05, "loss": 0.2682598304748535, "step": 3200 }, { "epoch": 0.29931718267701807, "eval_pairs_with_negatives_loss": 0.27552473545074463, "eval_pairs_with_negatives_runtime": 44.3024, "eval_pairs_with_negatives_samples_per_second": 28.351, "eval_pairs_with_negatives_steps_per_second": 3.544, "step": 3200 }, { "epoch": 0.29931718267701807, "eval_positives_loss": 0.06003187596797943, "eval_positives_runtime": 52.079, "eval_positives_samples_per_second": 42.244, "eval_positives_steps_per_second": 5.28, "step": 3200 }, { "epoch": 0.30165559816668225, "grad_norm": 1.81517493724823, "learning_rate": 7.352304056715243e-05, "loss": 0.28049240112304685, "step": 3225 }, { "epoch": 0.3039940136563465, "grad_norm": 2.179776191711426, "learning_rate": 7.327688066167783e-05, "loss": 0.1677359962463379, "step": 3250 }, { "epoch": 0.30633242914601067, "grad_norm": 2.7418649196624756, "learning_rate": 7.303072075620323e-05, "loss": 0.2120669364929199, "step": 3275 }, { "epoch": 0.30867084463567485, "grad_norm": 3.016566514968872, "learning_rate": 7.278456085072864e-05, "loss": 0.19796632766723632, "step": 3300 }, { "epoch": 0.3110092601253391, "grad_norm": 1.5679301023483276, "learning_rate": 7.253840094525404e-05, "loss": 0.2684922981262207, "step": 3325 }, { "epoch": 0.31334767561500326, "grad_norm": 1.8379592895507812, "learning_rate": 7.229224103977944e-05, "loss": 0.25131099700927734, "step": 3350 }, { "epoch": 0.3156860911046675, "grad_norm": 1.8164836168289185, "learning_rate": 7.204608113430485e-05, "loss": 0.22370563507080077, "step": 3375 }, { "epoch": 0.3180245065943317, "grad_norm": 1.9795681238174438, "learning_rate": 7.179992122883025e-05, "loss": 0.23445991516113282, "step": 3400 }, { "epoch": 0.3180245065943317, "eval_pairs_with_negatives_loss": 0.27237948775291443, "eval_pairs_with_negatives_runtime": 43.9691, "eval_pairs_with_negatives_samples_per_second": 28.566, "eval_pairs_with_negatives_steps_per_second": 3.571, "step": 3400 }, { "epoch": 0.3180245065943317, "eval_positives_loss": 0.059769779443740845, "eval_positives_runtime": 51.6246, "eval_positives_samples_per_second": 42.615, "eval_positives_steps_per_second": 5.327, "step": 3400 }, { "epoch": 0.32036292208399586, "grad_norm": 1.8819149732589722, "learning_rate": 7.155376132335565e-05, "loss": 0.19615522384643555, "step": 3425 }, { "epoch": 0.3227013375736601, "grad_norm": 2.305645704269409, "learning_rate": 7.130760141788106e-05, "loss": 0.28631683349609377, "step": 3450 }, { "epoch": 0.3250397530633243, "grad_norm": 1.6570643186569214, "learning_rate": 7.106144151240647e-05, "loss": 0.20692520141601561, "step": 3475 }, { "epoch": 0.3273781685529885, "grad_norm": 2.9196584224700928, "learning_rate": 7.081528160693187e-05, "loss": 0.2614221000671387, "step": 3500 }, { "epoch": 0.3297165840426527, "grad_norm": 1.714736819267273, "learning_rate": 7.056912170145727e-05, "loss": 0.2608006858825684, "step": 3525 }, { "epoch": 0.3320549995323169, "grad_norm": 0.9146888852119446, "learning_rate": 7.032296179598268e-05, "loss": 0.17190082550048827, "step": 3550 }, { "epoch": 0.3343934150219811, "grad_norm": 0.9113110303878784, "learning_rate": 7.007680189050808e-05, "loss": 0.1922085952758789, "step": 3575 }, { "epoch": 0.3367318305116453, "grad_norm": 3.187330722808838, "learning_rate": 6.983064198503348e-05, "loss": 0.21484535217285156, "step": 3600 }, { "epoch": 0.3367318305116453, "eval_pairs_with_negatives_loss": 0.2832874357700348, "eval_pairs_with_negatives_runtime": 43.8993, "eval_pairs_with_negatives_samples_per_second": 28.611, "eval_pairs_with_negatives_steps_per_second": 3.576, "step": 3600 }, { "epoch": 0.3367318305116453, "eval_positives_loss": 0.05738348141312599, "eval_positives_runtime": 52.1582, "eval_positives_samples_per_second": 42.179, "eval_positives_steps_per_second": 5.272, "step": 3600 }, { "epoch": 0.3390702460013095, "grad_norm": 1.554630160331726, "learning_rate": 6.958448207955889e-05, "loss": 0.2505316162109375, "step": 3625 }, { "epoch": 0.3414086614909737, "grad_norm": 0.6170446276664734, "learning_rate": 6.933832217408429e-05, "loss": 0.27857002258300784, "step": 3650 }, { "epoch": 0.34374707698063794, "grad_norm": 1.3156086206436157, "learning_rate": 6.909216226860969e-05, "loss": 0.24620241165161133, "step": 3675 }, { "epoch": 0.3460854924703021, "grad_norm": 2.0060641765594482, "learning_rate": 6.88460023631351e-05, "loss": 0.23187232971191407, "step": 3700 }, { "epoch": 0.3484239079599663, "grad_norm": 1.6845611333847046, "learning_rate": 6.85998424576605e-05, "loss": 0.24146879196166993, "step": 3725 }, { "epoch": 0.35076232344963054, "grad_norm": 1.279873013496399, "learning_rate": 6.83536825521859e-05, "loss": 0.23632186889648438, "step": 3750 }, { "epoch": 0.3531007389392947, "grad_norm": 0.7759600877761841, "learning_rate": 6.810752264671131e-05, "loss": 0.18325338363647461, "step": 3775 }, { "epoch": 0.35543915442895896, "grad_norm": 2.35200834274292, "learning_rate": 6.786136274123671e-05, "loss": 0.22662141799926758, "step": 3800 }, { "epoch": 0.35543915442895896, "eval_pairs_with_negatives_loss": 0.27636027336120605, "eval_pairs_with_negatives_runtime": 44.3556, "eval_pairs_with_negatives_samples_per_second": 28.317, "eval_pairs_with_negatives_steps_per_second": 3.54, "step": 3800 }, { "epoch": 0.35543915442895896, "eval_positives_loss": 0.05580952763557434, "eval_positives_runtime": 51.8653, "eval_positives_samples_per_second": 42.418, "eval_positives_steps_per_second": 5.302, "step": 3800 }, { "epoch": 0.35777756991862314, "grad_norm": 1.5299983024597168, "learning_rate": 6.761520283576211e-05, "loss": 0.1910099220275879, "step": 3825 }, { "epoch": 0.3601159854082873, "grad_norm": 0.11183751374483109, "learning_rate": 6.736904293028752e-05, "loss": 0.28833539962768556, "step": 3850 }, { "epoch": 0.36245440089795156, "grad_norm": 0.6836090683937073, "learning_rate": 6.712288302481292e-05, "loss": 0.18666194915771483, "step": 3875 }, { "epoch": 0.36479281638761574, "grad_norm": 2.2268402576446533, "learning_rate": 6.687672311933832e-05, "loss": 0.22112154006958007, "step": 3900 }, { "epoch": 0.36713123187728, "grad_norm": 2.553718328475952, "learning_rate": 6.663056321386373e-05, "loss": 0.2308146858215332, "step": 3925 }, { "epoch": 0.36946964736694415, "grad_norm": 2.780961275100708, "learning_rate": 6.638440330838913e-05, "loss": 0.23387022018432618, "step": 3950 }, { "epoch": 0.37180806285660833, "grad_norm": 2.0844075679779053, "learning_rate": 6.613824340291453e-05, "loss": 0.22896940231323243, "step": 3975 }, { "epoch": 0.37414647834627257, "grad_norm": 2.054213762283325, "learning_rate": 6.589208349743993e-05, "loss": 0.2557160186767578, "step": 4000 }, { "epoch": 0.37414647834627257, "eval_pairs_with_negatives_loss": 0.2681486904621124, "eval_pairs_with_negatives_runtime": 44.1809, "eval_pairs_with_negatives_samples_per_second": 28.429, "eval_pairs_with_negatives_steps_per_second": 3.554, "step": 4000 }, { "epoch": 0.37414647834627257, "eval_positives_loss": 0.05567891150712967, "eval_positives_runtime": 52.0655, "eval_positives_samples_per_second": 42.254, "eval_positives_steps_per_second": 5.282, "step": 4000 }, { "epoch": 0.37648489383593675, "grad_norm": 2.3532962799072266, "learning_rate": 6.564592359196534e-05, "loss": 0.21579030990600587, "step": 4025 }, { "epoch": 0.378823309325601, "grad_norm": 2.108341693878174, "learning_rate": 6.539976368649074e-05, "loss": 0.22786386489868163, "step": 4050 }, { "epoch": 0.38116172481526517, "grad_norm": 2.600250244140625, "learning_rate": 6.515360378101614e-05, "loss": 0.23480154037475587, "step": 4075 }, { "epoch": 0.3835001403049294, "grad_norm": 1.9608969688415527, "learning_rate": 6.490744387554155e-05, "loss": 0.32279632568359373, "step": 4100 }, { "epoch": 0.3858385557945936, "grad_norm": 1.2891011238098145, "learning_rate": 6.466128397006695e-05, "loss": 0.20148227691650392, "step": 4125 }, { "epoch": 0.38817697128425777, "grad_norm": 2.1007683277130127, "learning_rate": 6.441512406459235e-05, "loss": 0.17734472274780275, "step": 4150 }, { "epoch": 0.390515386773922, "grad_norm": 2.133220672607422, "learning_rate": 6.416896415911776e-05, "loss": 0.21942649841308592, "step": 4175 }, { "epoch": 0.3928538022635862, "grad_norm": 1.508278489112854, "learning_rate": 6.392280425364316e-05, "loss": 0.2076035499572754, "step": 4200 }, { "epoch": 0.3928538022635862, "eval_pairs_with_negatives_loss": 0.260955810546875, "eval_pairs_with_negatives_runtime": 44.262, "eval_pairs_with_negatives_samples_per_second": 28.377, "eval_pairs_with_negatives_steps_per_second": 3.547, "step": 4200 }, { "epoch": 0.3928538022635862, "eval_positives_loss": 0.05449853464961052, "eval_positives_runtime": 51.8122, "eval_positives_samples_per_second": 42.461, "eval_positives_steps_per_second": 5.308, "step": 4200 }, { "epoch": 0.3951922177532504, "grad_norm": 1.8336026668548584, "learning_rate": 6.367664434816856e-05, "loss": 0.24127521514892578, "step": 4225 }, { "epoch": 0.3975306332429146, "grad_norm": 0.6785283088684082, "learning_rate": 6.343048444269398e-05, "loss": 0.21064716339111328, "step": 4250 }, { "epoch": 0.3998690487325788, "grad_norm": 2.412092685699463, "learning_rate": 6.318432453721939e-05, "loss": 0.20108203887939452, "step": 4275 }, { "epoch": 0.402207464222243, "grad_norm": 1.3605124950408936, "learning_rate": 6.293816463174479e-05, "loss": 0.2751664733886719, "step": 4300 }, { "epoch": 0.4045458797119072, "grad_norm": 1.950619101524353, "learning_rate": 6.26920047262702e-05, "loss": 0.21901239395141603, "step": 4325 }, { "epoch": 0.40688429520157143, "grad_norm": 1.6900594234466553, "learning_rate": 6.24458448207956e-05, "loss": 0.22335056304931641, "step": 4350 }, { "epoch": 0.4092227106912356, "grad_norm": 2.273475170135498, "learning_rate": 6.2199684915321e-05, "loss": 0.26476852416992186, "step": 4375 }, { "epoch": 0.41156112618089985, "grad_norm": 0.957051157951355, "learning_rate": 6.19535250098464e-05, "loss": 0.23246747970581055, "step": 4400 }, { "epoch": 0.41156112618089985, "eval_pairs_with_negatives_loss": 0.25503063201904297, "eval_pairs_with_negatives_runtime": 45.0565, "eval_pairs_with_negatives_samples_per_second": 27.876, "eval_pairs_with_negatives_steps_per_second": 3.485, "step": 4400 }, { "epoch": 0.41156112618089985, "eval_positives_loss": 0.05083151161670685, "eval_positives_runtime": 52.0733, "eval_positives_samples_per_second": 42.248, "eval_positives_steps_per_second": 5.281, "step": 4400 }, { "epoch": 0.41389954167056403, "grad_norm": 1.8713246583938599, "learning_rate": 6.170736510437181e-05, "loss": 0.30198251724243164, "step": 4425 }, { "epoch": 0.4162379571602282, "grad_norm": 3.0338542461395264, "learning_rate": 6.146120519889721e-05, "loss": 0.23007225036621093, "step": 4450 }, { "epoch": 0.41857637264989245, "grad_norm": 2.191865921020508, "learning_rate": 6.12150452934226e-05, "loss": 0.199759521484375, "step": 4475 }, { "epoch": 0.42091478813955663, "grad_norm": 2.360621452331543, "learning_rate": 6.096888538794802e-05, "loss": 0.2532151412963867, "step": 4500 }, { "epoch": 0.42325320362922086, "grad_norm": 1.3209141492843628, "learning_rate": 6.072272548247342e-05, "loss": 0.20021892547607423, "step": 4525 }, { "epoch": 0.42559161911888505, "grad_norm": 1.3700189590454102, "learning_rate": 6.0476565576998824e-05, "loss": 0.22432531356811525, "step": 4550 }, { "epoch": 0.4279300346085492, "grad_norm": 0.8751669526100159, "learning_rate": 6.023040567152422e-05, "loss": 0.22744199752807617, "step": 4575 }, { "epoch": 0.43026845009821346, "grad_norm": 0.6762781143188477, "learning_rate": 5.998424576604963e-05, "loss": 0.18776168823242187, "step": 4600 }, { "epoch": 0.43026845009821346, "eval_pairs_with_negatives_loss": 0.25706836581230164, "eval_pairs_with_negatives_runtime": 44.6857, "eval_pairs_with_negatives_samples_per_second": 28.107, "eval_pairs_with_negatives_steps_per_second": 3.513, "step": 4600 }, { "epoch": 0.43026845009821346, "eval_positives_loss": 0.04761563614010811, "eval_positives_runtime": 52.7137, "eval_positives_samples_per_second": 41.735, "eval_positives_steps_per_second": 5.217, "step": 4600 }, { "epoch": 0.43260686558787764, "grad_norm": 1.4734338521957397, "learning_rate": 5.9738085860575034e-05, "loss": 0.23244962692260743, "step": 4625 }, { "epoch": 0.4349452810775419, "grad_norm": 1.2065322399139404, "learning_rate": 5.949192595510043e-05, "loss": 0.1930523109436035, "step": 4650 }, { "epoch": 0.43728369656720606, "grad_norm": 2.4672422409057617, "learning_rate": 5.924576604962584e-05, "loss": 0.2419593620300293, "step": 4675 }, { "epoch": 0.43962211205687024, "grad_norm": 2.3826215267181396, "learning_rate": 5.8999606144151245e-05, "loss": 0.27065000534057615, "step": 4700 }, { "epoch": 0.4419605275465345, "grad_norm": 1.9834275245666504, "learning_rate": 5.8753446238676644e-05, "loss": 0.21747297286987305, "step": 4725 }, { "epoch": 0.44429894303619866, "grad_norm": 1.5482553243637085, "learning_rate": 5.850728633320205e-05, "loss": 0.22796871185302733, "step": 4750 }, { "epoch": 0.4466373585258629, "grad_norm": 2.7519659996032715, "learning_rate": 5.8261126427727455e-05, "loss": 0.21714401245117188, "step": 4775 }, { "epoch": 0.4489757740155271, "grad_norm": 2.4831058979034424, "learning_rate": 5.8014966522252854e-05, "loss": 0.23129558563232422, "step": 4800 }, { "epoch": 0.4489757740155271, "eval_pairs_with_negatives_loss": 0.2441239058971405, "eval_pairs_with_negatives_runtime": 45.0394, "eval_pairs_with_negatives_samples_per_second": 27.887, "eval_pairs_with_negatives_steps_per_second": 3.486, "step": 4800 }, { "epoch": 0.4489757740155271, "eval_positives_loss": 0.050484515726566315, "eval_positives_runtime": 52.0702, "eval_positives_samples_per_second": 42.251, "eval_positives_steps_per_second": 5.281, "step": 4800 }, { "epoch": 0.4513141895051913, "grad_norm": 2.1840813159942627, "learning_rate": 5.776880661677826e-05, "loss": 0.20479650497436525, "step": 4825 }, { "epoch": 0.4536526049948555, "grad_norm": 2.1629340648651123, "learning_rate": 5.7522646711303666e-05, "loss": 0.2170286750793457, "step": 4850 }, { "epoch": 0.45599102048451967, "grad_norm": 0.20162469148635864, "learning_rate": 5.7276486805829065e-05, "loss": 0.2318229866027832, "step": 4875 }, { "epoch": 0.4583294359741839, "grad_norm": 1.4626463651657104, "learning_rate": 5.703032690035447e-05, "loss": 0.21925630569458007, "step": 4900 }, { "epoch": 0.4606678514638481, "grad_norm": 3.6034932136535645, "learning_rate": 5.678416699487987e-05, "loss": 0.23375102996826172, "step": 4925 }, { "epoch": 0.4630062669535123, "grad_norm": 0.8324385285377502, "learning_rate": 5.6538007089405275e-05, "loss": 0.22733007431030272, "step": 4950 }, { "epoch": 0.4653446824431765, "grad_norm": 2.4419448375701904, "learning_rate": 5.629184718393068e-05, "loss": 0.2223438262939453, "step": 4975 }, { "epoch": 0.4676830979328407, "grad_norm": 1.6555243730545044, "learning_rate": 5.604568727845608e-05, "loss": 0.22205371856689454, "step": 5000 }, { "epoch": 0.4676830979328407, "eval_pairs_with_negatives_loss": 0.2421402484178543, "eval_pairs_with_negatives_runtime": 44.4946, "eval_pairs_with_negatives_samples_per_second": 28.228, "eval_pairs_with_negatives_steps_per_second": 3.529, "step": 5000 }, { "epoch": 0.4676830979328407, "eval_positives_loss": 0.0468609519302845, "eval_positives_runtime": 52.2416, "eval_positives_samples_per_second": 42.112, "eval_positives_steps_per_second": 5.264, "step": 5000 } ], "logging_steps": 25, "max_steps": 10691, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }