ReSearch-MedQA-DPO / trainer_state.json
RAG-Gym's picture
Upload 8 files
a220d23 verified
Raw
History Blame Contribute Delete
178 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 387,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002583979328165375,
"grad_norm": 338.2884826660156,
"learning_rate": 1.9948320413436692e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.7265625,
"logps/chosen": -133.0,
"logps/rejected": -119.0,
"loss": 0.6914,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.00516795865633075,
"grad_norm": 304.6211242675781,
"learning_rate": 1.989664082687338e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.7421875,
"logps/chosen": -144.0,
"logps/rejected": -126.5,
"loss": 0.6891,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.00156402587890625,
"rewards/margins": 0.007049560546875,
"rewards/rejected": -0.005462646484375,
"step": 2
},
{
"epoch": 0.007751937984496124,
"grad_norm": 301.52911376953125,
"learning_rate": 1.9844961240310075e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.7421875,
"logps/chosen": -133.0,
"logps/rejected": -134.0,
"loss": 0.694,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.000782012939453125,
"rewards/margins": 0.006256103515625,
"rewards/rejected": -0.007049560546875,
"step": 3
},
{
"epoch": 0.0103359173126615,
"grad_norm": 294.886962890625,
"learning_rate": 1.979328165374677e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.72265625,
"logps/chosen": -130.0,
"logps/rejected": -115.0,
"loss": 0.7021,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0164794921875,
"rewards/margins": -0.0133056640625,
"rewards/rejected": -0.0031280517578125,
"step": 4
},
{
"epoch": 0.012919896640826873,
"grad_norm": 300.3182067871094,
"learning_rate": 1.974160206718346e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.77734375,
"logps/chosen": -125.0,
"logps/rejected": -127.5,
"loss": 0.6931,
"rewards/accuracies": 0.34375,
"rewards/chosen": -0.00390625,
"rewards/margins": -7.62939453125e-06,
"rewards/rejected": -0.00390625,
"step": 5
},
{
"epoch": 0.015503875968992248,
"grad_norm": 331.87506103515625,
"learning_rate": 1.9689922480620155e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.74609375,
"logps/chosen": -152.0,
"logps/rejected": -145.0,
"loss": 0.6958,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.026611328125,
"rewards/margins": -0.00390625,
"rewards/rejected": -0.022705078125,
"step": 6
},
{
"epoch": 0.01808785529715762,
"grad_norm": 289.2641296386719,
"learning_rate": 1.963824289405685e-06,
"logits/chosen": -0.703125,
"logits/rejected": -0.73828125,
"logps/chosen": -121.5,
"logps/rejected": -134.0,
"loss": 0.6771,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.001556396484375,
"rewards/margins": 0.035888671875,
"rewards/rejected": -0.034423828125,
"step": 7
},
{
"epoch": 0.020671834625323,
"grad_norm": 313.3421325683594,
"learning_rate": 1.958656330749354e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.73828125,
"logps/chosen": -124.5,
"logps/rejected": -130.0,
"loss": 0.6836,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.0093994140625,
"rewards/margins": 0.0179443359375,
"rewards/rejected": -0.02734375,
"step": 8
},
{
"epoch": 0.023255813953488372,
"grad_norm": 316.9752502441406,
"learning_rate": 1.953488372093023e-06,
"logits/chosen": -0.703125,
"logits/rejected": -0.7421875,
"logps/chosen": -124.0,
"logps/rejected": -139.0,
"loss": 0.6954,
"rewards/accuracies": 0.28125,
"rewards/chosen": -0.01251220703125,
"rewards/margins": -0.00078582763671875,
"rewards/rejected": -0.01171875,
"step": 9
},
{
"epoch": 0.025839793281653745,
"grad_norm": 302.2852478027344,
"learning_rate": 1.9483204134366924e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.73828125,
"logps/chosen": -121.5,
"logps/rejected": -136.0,
"loss": 0.6868,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.00390625,
"rewards/margins": 0.015625,
"rewards/rejected": -0.01953125,
"step": 10
},
{
"epoch": 0.028423772609819122,
"grad_norm": 322.8475341796875,
"learning_rate": 1.9431524547803617e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.70703125,
"logps/chosen": -127.0,
"logps/rejected": -124.5,
"loss": 0.6805,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.000782012939453125,
"rewards/margins": 0.02734375,
"rewards/rejected": -0.026611328125,
"step": 11
},
{
"epoch": 0.031007751937984496,
"grad_norm": 342.7738342285156,
"learning_rate": 1.9379844961240306e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.78515625,
"logps/chosen": -156.0,
"logps/rejected": -137.0,
"loss": 0.7083,
"rewards/accuracies": 0.25,
"rewards/chosen": -0.03515625,
"rewards/margins": -0.0242919921875,
"rewards/rejected": -0.01092529296875,
"step": 12
},
{
"epoch": 0.03359173126614987,
"grad_norm": 317.3365783691406,
"learning_rate": 1.9328165374677e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.74609375,
"logps/chosen": -147.0,
"logps/rejected": -116.5,
"loss": 0.7069,
"rewards/accuracies": 0.34375,
"rewards/chosen": -0.0289306640625,
"rewards/margins": -0.015625,
"rewards/rejected": -0.0133056640625,
"step": 13
},
{
"epoch": 0.03617571059431524,
"grad_norm": 317.24713134765625,
"learning_rate": 1.9276485788113693e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.734375,
"logps/chosen": -127.0,
"logps/rejected": -140.0,
"loss": 0.694,
"rewards/accuracies": 0.34375,
"rewards/chosen": -0.0172119140625,
"rewards/margins": -0.00154876708984375,
"rewards/rejected": -0.015625,
"step": 14
},
{
"epoch": 0.03875968992248062,
"grad_norm": 313.6627502441406,
"learning_rate": 1.9224806201550386e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.76953125,
"logps/chosen": -166.0,
"logps/rejected": -132.0,
"loss": 0.6729,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.0172119140625,
"rewards/margins": 0.044677734375,
"rewards/rejected": -0.02734375,
"step": 15
},
{
"epoch": 0.041343669250646,
"grad_norm": 319.21343994140625,
"learning_rate": 1.917312661498708e-06,
"logits/chosen": -0.7109375,
"logits/rejected": -0.73046875,
"logps/chosen": -130.0,
"logps/rejected": -143.0,
"loss": 0.6761,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.000782012939453125,
"rewards/margins": 0.03515625,
"rewards/rejected": -0.035888671875,
"step": 16
},
{
"epoch": 0.04392764857881137,
"grad_norm": 296.3052978515625,
"learning_rate": 1.9121447028423773e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.734375,
"logps/chosen": -133.0,
"logps/rejected": -120.0,
"loss": 0.6858,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.01953125,
"rewards/margins": 0.014892578125,
"rewards/rejected": -0.034423828125,
"step": 17
},
{
"epoch": 0.046511627906976744,
"grad_norm": 312.5535583496094,
"learning_rate": 1.9069767441860464e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.7578125,
"logps/chosen": -139.0,
"logps/rejected": -138.0,
"loss": 0.6709,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.00469970703125,
"rewards/margins": 0.047607421875,
"rewards/rejected": -0.052490234375,
"step": 18
},
{
"epoch": 0.04909560723514212,
"grad_norm": 316.44586181640625,
"learning_rate": 1.9018087855297155e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.73046875,
"logps/chosen": -133.0,
"logps/rejected": -139.0,
"loss": 0.658,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.026611328125,
"rewards/margins": 0.078125,
"rewards/rejected": -0.051513671875,
"step": 19
},
{
"epoch": 0.05167958656330749,
"grad_norm": 335.7342834472656,
"learning_rate": 1.8966408268733848e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.703125,
"logps/chosen": -121.5,
"logps/rejected": -134.0,
"loss": 0.6833,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0093994140625,
"rewards/margins": 0.0211181640625,
"rewards/rejected": -0.030517578125,
"step": 20
},
{
"epoch": 0.05426356589147287,
"grad_norm": 295.4714660644531,
"learning_rate": 1.8914728682170542e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.78125,
"logps/chosen": -142.0,
"logps/rejected": -133.0,
"loss": 0.6769,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0015716552734375,
"rewards/margins": 0.036865234375,
"rewards/rejected": -0.03515625,
"step": 21
},
{
"epoch": 0.056847545219638244,
"grad_norm": 331.2699279785156,
"learning_rate": 1.8863049095607235e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.734375,
"logps/chosen": -143.0,
"logps/rejected": -139.0,
"loss": 0.6814,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.015625,
"rewards/margins": 0.02734375,
"rewards/rejected": -0.01171875,
"step": 22
},
{
"epoch": 0.059431524547803614,
"grad_norm": 334.4768371582031,
"learning_rate": 1.8811369509043926e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.72265625,
"logps/chosen": -160.0,
"logps/rejected": -133.0,
"loss": 0.6635,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0172119140625,
"rewards/margins": 0.057861328125,
"rewards/rejected": -0.040771484375,
"step": 23
},
{
"epoch": 0.06201550387596899,
"grad_norm": 301.87762451171875,
"learning_rate": 1.875968992248062e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.76171875,
"logps/chosen": -132.0,
"logps/rejected": -128.0,
"loss": 0.6582,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.02978515625,
"rewards/margins": 0.07666015625,
"rewards/rejected": -0.046875,
"step": 24
},
{
"epoch": 0.06459948320413436,
"grad_norm": 337.253173828125,
"learning_rate": 1.8708010335917313e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.75,
"logps/chosen": -122.0,
"logps/rejected": -146.0,
"loss": 0.7,
"rewards/accuracies": 0.3125,
"rewards/chosen": -0.03759765625,
"rewards/margins": -0.0062255859375,
"rewards/rejected": -0.03125,
"step": 25
},
{
"epoch": 0.06718346253229975,
"grad_norm": 512.7426147460938,
"learning_rate": 1.8656330749354004e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.73828125,
"logps/chosen": -120.5,
"logps/rejected": -112.5,
"loss": 0.6704,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.006256103515625,
"rewards/margins": 0.0478515625,
"rewards/rejected": -0.04150390625,
"step": 26
},
{
"epoch": 0.06976744186046512,
"grad_norm": 322.4765319824219,
"learning_rate": 1.8604651162790697e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.76953125,
"logps/chosen": -123.0,
"logps/rejected": -148.0,
"loss": 0.673,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0093994140625,
"rewards/margins": 0.04541015625,
"rewards/rejected": -0.035888671875,
"step": 27
},
{
"epoch": 0.07235142118863049,
"grad_norm": 310.0760498046875,
"learning_rate": 1.855297157622739e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.734375,
"logps/chosen": -145.0,
"logps/rejected": -115.5,
"loss": 0.6896,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.00701904296875,
"rewards/margins": 0.0133056640625,
"rewards/rejected": -0.0203857421875,
"step": 28
},
{
"epoch": 0.07493540051679587,
"grad_norm": 306.0886535644531,
"learning_rate": 1.8501291989664084e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.7734375,
"logps/chosen": -132.0,
"logps/rejected": -130.0,
"loss": 0.6647,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.018798828125,
"rewards/margins": 0.06103515625,
"rewards/rejected": -0.042236328125,
"step": 29
},
{
"epoch": 0.07751937984496124,
"grad_norm": 299.5661315917969,
"learning_rate": 1.8449612403100773e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.76171875,
"logps/chosen": -135.0,
"logps/rejected": -133.0,
"loss": 0.6514,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0234375,
"rewards/margins": 0.09619140625,
"rewards/rejected": -0.07275390625,
"step": 30
},
{
"epoch": 0.08010335917312661,
"grad_norm": 333.64215087890625,
"learning_rate": 1.8397932816537466e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.74609375,
"logps/chosen": -158.0,
"logps/rejected": -141.0,
"loss": 0.6697,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.031982421875,
"rewards/margins": 0.053955078125,
"rewards/rejected": -0.0218505859375,
"step": 31
},
{
"epoch": 0.082687338501292,
"grad_norm": 326.3154602050781,
"learning_rate": 1.834625322997416e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.75,
"logps/chosen": -128.0,
"logps/rejected": -148.0,
"loss": 0.6885,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0242919921875,
"rewards/margins": 0.01092529296875,
"rewards/rejected": -0.03515625,
"step": 32
},
{
"epoch": 0.08527131782945736,
"grad_norm": 321.0740051269531,
"learning_rate": 1.829457364341085e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.7109375,
"logps/chosen": -135.0,
"logps/rejected": -122.5,
"loss": 0.6741,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.031982421875,
"rewards/margins": 0.044677734375,
"rewards/rejected": -0.01251220703125,
"step": 33
},
{
"epoch": 0.08785529715762273,
"grad_norm": 330.2655029296875,
"learning_rate": 1.8242894056847544e-06,
"logits/chosen": -0.765625,
"logits/rejected": -0.7734375,
"logps/chosen": -134.0,
"logps/rejected": -131.0,
"loss": 0.7,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.00390625,
"rewards/margins": -0.0101318359375,
"rewards/rejected": 0.006256103515625,
"step": 34
},
{
"epoch": 0.09043927648578812,
"grad_norm": 318.2413330078125,
"learning_rate": 1.8191214470284237e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.76171875,
"logps/chosen": -128.0,
"logps/rejected": -137.0,
"loss": 0.6689,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.003143310546875,
"rewards/margins": 0.05322265625,
"rewards/rejected": -0.050048828125,
"step": 35
},
{
"epoch": 0.09302325581395349,
"grad_norm": 344.4376220703125,
"learning_rate": 1.8139534883720929e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.82421875,
"logps/chosen": -128.0,
"logps/rejected": -155.0,
"loss": 0.6613,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.02587890625,
"rewards/margins": 0.08056640625,
"rewards/rejected": -0.0546875,
"step": 36
},
{
"epoch": 0.09560723514211886,
"grad_norm": 355.41925048828125,
"learning_rate": 1.8087855297157622e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.72265625,
"logps/chosen": -146.0,
"logps/rejected": -173.0,
"loss": 0.6913,
"rewards/accuracies": 0.34375,
"rewards/chosen": -0.01251220703125,
"rewards/margins": 0.007080078125,
"rewards/rejected": -0.01953125,
"step": 37
},
{
"epoch": 0.09819121447028424,
"grad_norm": 302.00238037109375,
"learning_rate": 1.8036175710594315e-06,
"logits/chosen": -0.69140625,
"logits/rejected": -0.70703125,
"logps/chosen": -136.0,
"logps/rejected": -144.0,
"loss": 0.6833,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.01251220703125,
"rewards/margins": 0.026611328125,
"rewards/rejected": -0.0140380859375,
"step": 38
},
{
"epoch": 0.10077519379844961,
"grad_norm": 310.81036376953125,
"learning_rate": 1.7984496124031008e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.76953125,
"logps/chosen": -135.0,
"logps/rejected": -123.0,
"loss": 0.6858,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.026611328125,
"rewards/margins": 0.01806640625,
"rewards/rejected": -0.044677734375,
"step": 39
},
{
"epoch": 0.10335917312661498,
"grad_norm": 313.59796142578125,
"learning_rate": 1.79328165374677e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.7890625,
"logps/chosen": -137.0,
"logps/rejected": -129.0,
"loss": 0.6804,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.015625,
"rewards/margins": 0.03515625,
"rewards/rejected": -0.05078125,
"step": 40
},
{
"epoch": 0.10594315245478036,
"grad_norm": 327.0791320800781,
"learning_rate": 1.7881136950904393e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.734375,
"logps/chosen": -147.0,
"logps/rejected": -141.0,
"loss": 0.6917,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.0218505859375,
"rewards/margins": 0.00860595703125,
"rewards/rejected": -0.030517578125,
"step": 41
},
{
"epoch": 0.10852713178294573,
"grad_norm": 325.0856018066406,
"learning_rate": 1.7829457364341084e-06,
"logits/chosen": -0.765625,
"logits/rejected": -0.73828125,
"logps/chosen": -122.5,
"logps/rejected": -142.0,
"loss": 0.6915,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.00156402587890625,
"rewards/margins": 0.0108642578125,
"rewards/rejected": -0.0093994140625,
"step": 42
},
{
"epoch": 0.1111111111111111,
"grad_norm": 336.544677734375,
"learning_rate": 1.7777777777777775e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.74609375,
"logps/chosen": -133.0,
"logps/rejected": -127.0,
"loss": 0.668,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.0062255859375,
"rewards/margins": 0.061767578125,
"rewards/rejected": -0.06787109375,
"step": 43
},
{
"epoch": 0.11369509043927649,
"grad_norm": 308.3078918457031,
"learning_rate": 1.7726098191214469e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.765625,
"logps/chosen": -126.0,
"logps/rejected": -124.0,
"loss": 0.6384,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0595703125,
"rewards/margins": 0.119140625,
"rewards/rejected": -0.059326171875,
"step": 44
},
{
"epoch": 0.11627906976744186,
"grad_norm": 330.3432312011719,
"learning_rate": 1.7674418604651162e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.7734375,
"logps/chosen": -173.0,
"logps/rejected": -164.0,
"loss": 0.6664,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.03271484375,
"rewards/margins": 0.06396484375,
"rewards/rejected": -0.03125,
"step": 45
},
{
"epoch": 0.11886304909560723,
"grad_norm": 314.838623046875,
"learning_rate": 1.7622739018087855e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.73046875,
"logps/chosen": -138.0,
"logps/rejected": -139.0,
"loss": 0.6594,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.03369140625,
"rewards/margins": 0.07666015625,
"rewards/rejected": -0.04296875,
"step": 46
},
{
"epoch": 0.12144702842377261,
"grad_norm": 312.06280517578125,
"learning_rate": 1.7571059431524546e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.7578125,
"logps/chosen": -142.0,
"logps/rejected": -131.0,
"loss": 0.6566,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0133056640625,
"rewards/margins": 0.083984375,
"rewards/rejected": -0.0703125,
"step": 47
},
{
"epoch": 0.12403100775193798,
"grad_norm": 327.1083984375,
"learning_rate": 1.751937984496124e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.75390625,
"logps/chosen": -137.0,
"logps/rejected": -127.5,
"loss": 0.6713,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.007080078125,
"rewards/margins": 0.0517578125,
"rewards/rejected": -0.044677734375,
"step": 48
},
{
"epoch": 0.12661498708010335,
"grad_norm": 327.7143249511719,
"learning_rate": 1.7467700258397933e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.7578125,
"logps/chosen": -138.0,
"logps/rejected": -138.0,
"loss": 0.6564,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01953125,
"rewards/margins": 0.087890625,
"rewards/rejected": -0.06787109375,
"step": 49
},
{
"epoch": 0.12919896640826872,
"grad_norm": 287.09173583984375,
"learning_rate": 1.7416020671834624e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.73046875,
"logps/chosen": -133.0,
"logps/rejected": -115.0,
"loss": 0.6604,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0296630859375,
"rewards/margins": 0.07177734375,
"rewards/rejected": -0.042236328125,
"step": 50
},
{
"epoch": 0.13178294573643412,
"grad_norm": 303.8511047363281,
"learning_rate": 1.7364341085271318e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.76171875,
"logps/chosen": -132.0,
"logps/rejected": -125.5,
"loss": 0.65,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.010986328125,
"rewards/margins": 0.09521484375,
"rewards/rejected": -0.08447265625,
"step": 51
},
{
"epoch": 0.1343669250645995,
"grad_norm": 345.98455810546875,
"learning_rate": 1.731266149870801e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.76953125,
"logps/chosen": -138.0,
"logps/rejected": -132.0,
"loss": 0.671,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.00628662109375,
"rewards/margins": 0.0517578125,
"rewards/rejected": -0.04541015625,
"step": 52
},
{
"epoch": 0.13695090439276486,
"grad_norm": 314.14788818359375,
"learning_rate": 1.7260981912144704e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.78515625,
"logps/chosen": -137.0,
"logps/rejected": -146.0,
"loss": 0.6191,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0546875,
"rewards/margins": 0.166015625,
"rewards/rejected": -0.11083984375,
"step": 53
},
{
"epoch": 0.13953488372093023,
"grad_norm": 324.44732666015625,
"learning_rate": 1.7209302325581393e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.78515625,
"logps/chosen": -128.0,
"logps/rejected": -132.0,
"loss": 0.6681,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.010986328125,
"rewards/margins": 0.057861328125,
"rewards/rejected": -0.046875,
"step": 54
},
{
"epoch": 0.1421188630490956,
"grad_norm": 323.485107421875,
"learning_rate": 1.7157622739018087e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.75,
"logps/chosen": -149.0,
"logps/rejected": -124.0,
"loss": 0.6381,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0625,
"rewards/margins": 0.125,
"rewards/rejected": -0.0625,
"step": 55
},
{
"epoch": 0.14470284237726097,
"grad_norm": 314.7582702636719,
"learning_rate": 1.710594315245478e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.72265625,
"logps/chosen": -124.0,
"logps/rejected": -122.0,
"loss": 0.6747,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.015625,
"rewards/margins": 0.040771484375,
"rewards/rejected": -0.0250244140625,
"step": 56
},
{
"epoch": 0.14728682170542637,
"grad_norm": 324.26568603515625,
"learning_rate": 1.705426356589147e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.76953125,
"logps/chosen": -134.0,
"logps/rejected": -141.0,
"loss": 0.6624,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.030517578125,
"rewards/margins": 0.0751953125,
"rewards/rejected": -0.044677734375,
"step": 57
},
{
"epoch": 0.14987080103359174,
"grad_norm": 358.5406799316406,
"learning_rate": 1.7002583979328164e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.76953125,
"logps/chosen": -140.0,
"logps/rejected": -153.0,
"loss": 0.6931,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.026611328125,
"rewards/margins": 0.0164794921875,
"rewards/rejected": -0.04296875,
"step": 58
},
{
"epoch": 0.1524547803617571,
"grad_norm": 316.290771484375,
"learning_rate": 1.6950904392764858e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.73046875,
"logps/chosen": -150.0,
"logps/rejected": -135.0,
"loss": 0.6688,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.0078125,
"rewards/margins": 0.0595703125,
"rewards/rejected": -0.0517578125,
"step": 59
},
{
"epoch": 0.15503875968992248,
"grad_norm": 315.859619140625,
"learning_rate": 1.6899224806201549e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.77734375,
"logps/chosen": -133.0,
"logps/rejected": -148.0,
"loss": 0.6675,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.01104736328125,
"rewards/margins": 0.05810546875,
"rewards/rejected": -0.046875,
"step": 60
},
{
"epoch": 0.15762273901808785,
"grad_norm": 311.5282897949219,
"learning_rate": 1.6847545219638242e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.7578125,
"logps/chosen": -124.5,
"logps/rejected": -123.0,
"loss": 0.6408,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06494140625,
"rewards/margins": 0.1181640625,
"rewards/rejected": -0.05322265625,
"step": 61
},
{
"epoch": 0.16020671834625322,
"grad_norm": 339.14593505859375,
"learning_rate": 1.6795865633074935e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.72265625,
"logps/chosen": -128.0,
"logps/rejected": -141.0,
"loss": 0.6611,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.04150390625,
"rewards/margins": 0.0830078125,
"rewards/rejected": -0.04150390625,
"step": 62
},
{
"epoch": 0.16279069767441862,
"grad_norm": 341.363525390625,
"learning_rate": 1.6744186046511629e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.7734375,
"logps/chosen": -134.0,
"logps/rejected": -139.0,
"loss": 0.6646,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.05322265625,
"rewards/margins": 0.06640625,
"rewards/rejected": -0.0133056640625,
"step": 63
},
{
"epoch": 0.165374677002584,
"grad_norm": 391.70458984375,
"learning_rate": 1.669250645994832e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.80859375,
"logps/chosen": -142.0,
"logps/rejected": -150.0,
"loss": 0.652,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0211181640625,
"rewards/margins": 0.09716796875,
"rewards/rejected": -0.07568359375,
"step": 64
},
{
"epoch": 0.16795865633074936,
"grad_norm": 363.4455871582031,
"learning_rate": 1.6640826873385011e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7734375,
"logps/chosen": -145.0,
"logps/rejected": -124.0,
"loss": 0.6282,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0986328125,
"rewards/margins": 0.1533203125,
"rewards/rejected": -0.0546875,
"step": 65
},
{
"epoch": 0.17054263565891473,
"grad_norm": 331.4794921875,
"learning_rate": 1.6589147286821704e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.75390625,
"logps/chosen": -143.0,
"logps/rejected": -137.0,
"loss": 0.6577,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.038330078125,
"rewards/margins": 0.08447265625,
"rewards/rejected": -0.046142578125,
"step": 66
},
{
"epoch": 0.1731266149870801,
"grad_norm": 321.7209777832031,
"learning_rate": 1.6537467700258396e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7734375,
"logps/chosen": -131.0,
"logps/rejected": -147.0,
"loss": 0.6727,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.0478515625,
"rewards/margins": 0.060302734375,
"rewards/rejected": -0.01251220703125,
"step": 67
},
{
"epoch": 0.17571059431524547,
"grad_norm": 321.1003723144531,
"learning_rate": 1.648578811369509e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.80859375,
"logps/chosen": -136.0,
"logps/rejected": -136.0,
"loss": 0.6719,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.022705078125,
"rewards/margins": 0.05419921875,
"rewards/rejected": -0.03125,
"step": 68
},
{
"epoch": 0.17829457364341086,
"grad_norm": 344.49249267578125,
"learning_rate": 1.6434108527131782e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.765625,
"logps/chosen": -150.0,
"logps/rejected": -147.0,
"loss": 0.6658,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.03759765625,
"rewards/margins": 0.0634765625,
"rewards/rejected": -0.0257568359375,
"step": 69
},
{
"epoch": 0.18087855297157623,
"grad_norm": 354.41680908203125,
"learning_rate": 1.6382428940568476e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.78515625,
"logps/chosen": -144.0,
"logps/rejected": -125.5,
"loss": 0.6664,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0390625,
"rewards/margins": 0.06884765625,
"rewards/rejected": -0.0296630859375,
"step": 70
},
{
"epoch": 0.1834625322997416,
"grad_norm": 339.7203674316406,
"learning_rate": 1.6330749354005167e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.7734375,
"logps/chosen": -142.0,
"logps/rejected": -143.0,
"loss": 0.6459,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0211181640625,
"rewards/margins": 0.115234375,
"rewards/rejected": -0.09375,
"step": 71
},
{
"epoch": 0.18604651162790697,
"grad_norm": 330.1705627441406,
"learning_rate": 1.627906976744186e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.75,
"logps/chosen": -130.0,
"logps/rejected": -137.0,
"loss": 0.6672,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0712890625,
"rewards/margins": 0.06103515625,
"rewards/rejected": 0.01019287109375,
"step": 72
},
{
"epoch": 0.18863049095607234,
"grad_norm": 342.0517272949219,
"learning_rate": 1.6227390180878553e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.72265625,
"logps/chosen": -137.0,
"logps/rejected": -145.0,
"loss": 0.6422,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10888671875,
"rewards/margins": 0.1181640625,
"rewards/rejected": -0.0093994140625,
"step": 73
},
{
"epoch": 0.19121447028423771,
"grad_norm": 320.803955078125,
"learning_rate": 1.6175710594315245e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.77734375,
"logps/chosen": -113.5,
"logps/rejected": -129.0,
"loss": 0.6492,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09375,
"rewards/margins": 0.10400390625,
"rewards/rejected": -0.01019287109375,
"step": 74
},
{
"epoch": 0.1937984496124031,
"grad_norm": 300.7449645996094,
"learning_rate": 1.6124031007751938e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.78125,
"logps/chosen": -120.0,
"logps/rejected": -122.0,
"loss": 0.6638,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0296630859375,
"rewards/margins": 0.0693359375,
"rewards/rejected": -0.039794921875,
"step": 75
},
{
"epoch": 0.19638242894056848,
"grad_norm": 346.23590087890625,
"learning_rate": 1.6072351421188631e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.78125,
"logps/chosen": -137.0,
"logps/rejected": -146.0,
"loss": 0.6446,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.08935546875,
"rewards/margins": 0.11328125,
"rewards/rejected": -0.0242919921875,
"step": 76
},
{
"epoch": 0.19896640826873385,
"grad_norm": 337.37921142578125,
"learning_rate": 1.6020671834625322e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7734375,
"logps/chosen": -125.0,
"logps/rejected": -152.0,
"loss": 0.6844,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.04296875,
"rewards/margins": 0.0242919921875,
"rewards/rejected": 0.018798828125,
"step": 77
},
{
"epoch": 0.20155038759689922,
"grad_norm": 371.3411865234375,
"learning_rate": 1.5968992248062014e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.78515625,
"logps/chosen": -142.0,
"logps/rejected": -149.0,
"loss": 0.6985,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.044677734375,
"rewards/margins": -0.00555419921875,
"rewards/rejected": 0.050048828125,
"step": 78
},
{
"epoch": 0.2041343669250646,
"grad_norm": 308.72271728515625,
"learning_rate": 1.5917312661498707e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.7734375,
"logps/chosen": -124.0,
"logps/rejected": -131.0,
"loss": 0.6581,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.103515625,
"rewards/margins": 0.0830078125,
"rewards/rejected": 0.0203857421875,
"step": 79
},
{
"epoch": 0.20671834625322996,
"grad_norm": 351.33538818359375,
"learning_rate": 1.58656330749354e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.84765625,
"logps/chosen": -137.0,
"logps/rejected": -134.0,
"loss": 0.6524,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.06982421875,
"rewards/margins": 0.08837890625,
"rewards/rejected": -0.018798828125,
"step": 80
},
{
"epoch": 0.20930232558139536,
"grad_norm": 288.8226623535156,
"learning_rate": 1.5813953488372091e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.765625,
"logps/chosen": -122.5,
"logps/rejected": -127.0,
"loss": 0.636,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.109375,
"rewards/margins": 0.1298828125,
"rewards/rejected": -0.020263671875,
"step": 81
},
{
"epoch": 0.21188630490956073,
"grad_norm": 336.23724365234375,
"learning_rate": 1.5762273901808785e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.76953125,
"logps/chosen": -131.0,
"logps/rejected": -141.0,
"loss": 0.6503,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10693359375,
"rewards/margins": 0.09765625,
"rewards/rejected": 0.0093994140625,
"step": 82
},
{
"epoch": 0.2144702842377261,
"grad_norm": 343.7184753417969,
"learning_rate": 1.5710594315245478e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.76953125,
"logps/chosen": -142.0,
"logps/rejected": -127.0,
"loss": 0.6636,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.08935546875,
"rewards/margins": 0.07421875,
"rewards/rejected": 0.014892578125,
"step": 83
},
{
"epoch": 0.21705426356589147,
"grad_norm": 315.254638671875,
"learning_rate": 1.565891472868217e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.81640625,
"logps/chosen": -141.0,
"logps/rejected": -131.0,
"loss": 0.6119,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.125,
"rewards/margins": 0.1845703125,
"rewards/rejected": -0.0595703125,
"step": 84
},
{
"epoch": 0.21963824289405684,
"grad_norm": 338.00396728515625,
"learning_rate": 1.5607235142118862e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.83984375,
"logps/chosen": -144.0,
"logps/rejected": -146.0,
"loss": 0.6229,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09521484375,
"rewards/margins": 0.1591796875,
"rewards/rejected": -0.0634765625,
"step": 85
},
{
"epoch": 0.2222222222222222,
"grad_norm": 346.4078063964844,
"learning_rate": 1.5555555555555556e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.7890625,
"logps/chosen": -141.0,
"logps/rejected": -132.0,
"loss": 0.6398,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.050048828125,
"rewards/margins": 0.12353515625,
"rewards/rejected": -0.07373046875,
"step": 86
},
{
"epoch": 0.2248062015503876,
"grad_norm": 299.9973449707031,
"learning_rate": 1.550387596899225e-06,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8125,
"logps/chosen": -133.0,
"logps/rejected": -127.5,
"loss": 0.6176,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.138671875,
"rewards/margins": 0.173828125,
"rewards/rejected": -0.034423828125,
"step": 87
},
{
"epoch": 0.22739018087855298,
"grad_norm": 342.8509521484375,
"learning_rate": 1.5452196382428938e-06,
"logits/chosen": -0.765625,
"logits/rejected": -0.76953125,
"logps/chosen": -124.5,
"logps/rejected": -143.0,
"loss": 0.6304,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11572265625,
"rewards/margins": 0.1376953125,
"rewards/rejected": -0.0218505859375,
"step": 88
},
{
"epoch": 0.22997416020671835,
"grad_norm": 345.9960021972656,
"learning_rate": 1.5400516795865631e-06,
"logits/chosen": -0.80078125,
"logits/rejected": -0.828125,
"logps/chosen": -144.0,
"logps/rejected": -150.0,
"loss": 0.603,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1474609375,
"rewards/margins": 0.203125,
"rewards/rejected": -0.056396484375,
"step": 89
},
{
"epoch": 0.23255813953488372,
"grad_norm": 305.83319091796875,
"learning_rate": 1.5348837209302325e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.8125,
"logps/chosen": -119.0,
"logps/rejected": -128.0,
"loss": 0.6355,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.142578125,
"rewards/margins": 0.1328125,
"rewards/rejected": 0.00933837890625,
"step": 90
},
{
"epoch": 0.2351421188630491,
"grad_norm": 323.9646301269531,
"learning_rate": 1.5297157622739016e-06,
"logits/chosen": -0.80078125,
"logits/rejected": -0.77734375,
"logps/chosen": -119.0,
"logps/rejected": -130.0,
"loss": 0.6248,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10498046875,
"rewards/margins": 0.1552734375,
"rewards/rejected": -0.050048828125,
"step": 91
},
{
"epoch": 0.23772609819121446,
"grad_norm": 340.4587097167969,
"learning_rate": 1.524547803617571e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.75390625,
"logps/chosen": -146.0,
"logps/rejected": -123.0,
"loss": 0.6505,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.06787109375,
"rewards/margins": 0.0986328125,
"rewards/rejected": -0.030517578125,
"step": 92
},
{
"epoch": 0.24031007751937986,
"grad_norm": 323.98846435546875,
"learning_rate": 1.5193798449612403e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.78125,
"logps/chosen": -135.0,
"logps/rejected": -139.0,
"loss": 0.6501,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09619140625,
"rewards/margins": 0.1064453125,
"rewards/rejected": -0.0101318359375,
"step": 93
},
{
"epoch": 0.24289405684754523,
"grad_norm": 304.8097229003906,
"learning_rate": 1.5142118863049096e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.76953125,
"logps/chosen": -136.0,
"logps/rejected": -137.0,
"loss": 0.6373,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09228515625,
"rewards/margins": 0.126953125,
"rewards/rejected": -0.03515625,
"step": 94
},
{
"epoch": 0.2454780361757106,
"grad_norm": 346.1623229980469,
"learning_rate": 1.5090439276485787e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.79296875,
"logps/chosen": -131.0,
"logps/rejected": -151.0,
"loss": 0.6099,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12255859375,
"rewards/margins": 0.19140625,
"rewards/rejected": -0.06884765625,
"step": 95
},
{
"epoch": 0.24806201550387597,
"grad_norm": 325.57989501953125,
"learning_rate": 1.503875968992248e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.80859375,
"logps/chosen": -131.0,
"logps/rejected": -139.0,
"loss": 0.6143,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1103515625,
"rewards/margins": 0.18359375,
"rewards/rejected": -0.07373046875,
"step": 96
},
{
"epoch": 0.25064599483204136,
"grad_norm": 334.1916198730469,
"learning_rate": 1.4987080103359174e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.8046875,
"logps/chosen": -108.0,
"logps/rejected": -128.0,
"loss": 0.6396,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10107421875,
"rewards/margins": 0.1279296875,
"rewards/rejected": -0.026611328125,
"step": 97
},
{
"epoch": 0.2532299741602067,
"grad_norm": 347.5135192871094,
"learning_rate": 1.4935400516795865e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.78125,
"logps/chosen": -141.0,
"logps/rejected": -134.0,
"loss": 0.6435,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1015625,
"rewards/margins": 0.12255859375,
"rewards/rejected": -0.0211181640625,
"step": 98
},
{
"epoch": 0.2558139534883721,
"grad_norm": 389.5239562988281,
"learning_rate": 1.4883720930232558e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.81640625,
"logps/chosen": -144.0,
"logps/rejected": -148.0,
"loss": 0.6166,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1259765625,
"rewards/margins": 0.169921875,
"rewards/rejected": -0.043701171875,
"step": 99
},
{
"epoch": 0.25839793281653745,
"grad_norm": 354.7499694824219,
"learning_rate": 1.483204134366925e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.80078125,
"logps/chosen": -124.5,
"logps/rejected": -143.0,
"loss": 0.6376,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.08056640625,
"rewards/margins": 0.1357421875,
"rewards/rejected": -0.055419921875,
"step": 100
},
{
"epoch": 0.26098191214470284,
"grad_norm": 324.9789123535156,
"learning_rate": 1.4780361757105943e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.765625,
"logps/chosen": -129.0,
"logps/rejected": -140.0,
"loss": 0.6321,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.08447265625,
"rewards/margins": 0.146484375,
"rewards/rejected": -0.061767578125,
"step": 101
},
{
"epoch": 0.26356589147286824,
"grad_norm": 337.2759704589844,
"learning_rate": 1.4728682170542634e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.80078125,
"logps/chosen": -141.0,
"logps/rejected": -139.0,
"loss": 0.6442,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.06494140625,
"rewards/margins": 0.11669921875,
"rewards/rejected": -0.0517578125,
"step": 102
},
{
"epoch": 0.2661498708010336,
"grad_norm": 329.3245849609375,
"learning_rate": 1.4677002583979327e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.80078125,
"logps/chosen": -123.5,
"logps/rejected": -135.0,
"loss": 0.6653,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.036865234375,
"rewards/margins": 0.078125,
"rewards/rejected": -0.04150390625,
"step": 103
},
{
"epoch": 0.268733850129199,
"grad_norm": 357.8585510253906,
"learning_rate": 1.462532299741602e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.78125,
"logps/chosen": -151.0,
"logps/rejected": -147.0,
"loss": 0.6343,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.12060546875,
"rewards/margins": 0.1396484375,
"rewards/rejected": -0.018798828125,
"step": 104
},
{
"epoch": 0.2713178294573643,
"grad_norm": 344.8572998046875,
"learning_rate": 1.4573643410852712e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.79296875,
"logps/chosen": -130.0,
"logps/rejected": -137.0,
"loss": 0.6506,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05859375,
"rewards/margins": 0.09375,
"rewards/rejected": -0.03515625,
"step": 105
},
{
"epoch": 0.2739018087855297,
"grad_norm": 335.1913146972656,
"learning_rate": 1.4521963824289405e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.79296875,
"logps/chosen": -135.0,
"logps/rejected": -140.0,
"loss": 0.632,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.10498046875,
"rewards/margins": 0.146484375,
"rewards/rejected": -0.042236328125,
"step": 106
},
{
"epoch": 0.27648578811369506,
"grad_norm": 335.07769775390625,
"learning_rate": 1.4470284237726098e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.80078125,
"logps/chosen": -138.0,
"logps/rejected": -141.0,
"loss": 0.6209,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.07275390625,
"rewards/margins": 0.1640625,
"rewards/rejected": -0.09130859375,
"step": 107
},
{
"epoch": 0.27906976744186046,
"grad_norm": 356.36468505859375,
"learning_rate": 1.441860465116279e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.76953125,
"logps/chosen": -173.0,
"logps/rejected": -141.0,
"loss": 0.6124,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11474609375,
"rewards/margins": 0.1904296875,
"rewards/rejected": -0.07568359375,
"step": 108
},
{
"epoch": 0.28165374677002586,
"grad_norm": 321.2911071777344,
"learning_rate": 1.4366925064599483e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.78125,
"logps/chosen": -130.0,
"logps/rejected": -142.0,
"loss": 0.6199,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08447265625,
"rewards/margins": 0.171875,
"rewards/rejected": -0.0869140625,
"step": 109
},
{
"epoch": 0.2842377260981912,
"grad_norm": 338.142822265625,
"learning_rate": 1.4315245478036176e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.76171875,
"logps/chosen": -120.0,
"logps/rejected": -128.0,
"loss": 0.6328,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0556640625,
"rewards/margins": 0.1376953125,
"rewards/rejected": -0.08203125,
"step": 110
},
{
"epoch": 0.2868217054263566,
"grad_norm": 336.5170593261719,
"learning_rate": 1.426356589147287e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.765625,
"logps/chosen": -139.0,
"logps/rejected": -136.0,
"loss": 0.6069,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09228515625,
"rewards/margins": 0.1904296875,
"rewards/rejected": -0.09765625,
"step": 111
},
{
"epoch": 0.28940568475452194,
"grad_norm": 335.60601806640625,
"learning_rate": 1.4211886304909558e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.76953125,
"logps/chosen": -122.5,
"logps/rejected": -124.5,
"loss": 0.6148,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.08447265625,
"rewards/margins": 0.1796875,
"rewards/rejected": -0.0947265625,
"step": 112
},
{
"epoch": 0.29198966408268734,
"grad_norm": 344.4601135253906,
"learning_rate": 1.4160206718346252e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.765625,
"logps/chosen": -155.0,
"logps/rejected": -147.0,
"loss": 0.6178,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1025390625,
"rewards/margins": 0.1767578125,
"rewards/rejected": -0.07421875,
"step": 113
},
{
"epoch": 0.29457364341085274,
"grad_norm": 344.459716796875,
"learning_rate": 1.4108527131782945e-06,
"logits/chosen": -0.84765625,
"logits/rejected": -0.83203125,
"logps/chosen": -130.0,
"logps/rejected": -125.0,
"loss": 0.6079,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0791015625,
"rewards/margins": 0.1904296875,
"rewards/rejected": -0.11083984375,
"step": 114
},
{
"epoch": 0.2971576227390181,
"grad_norm": 318.5380554199219,
"learning_rate": 1.4056847545219636e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.796875,
"logps/chosen": -122.5,
"logps/rejected": -130.0,
"loss": 0.6321,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06494140625,
"rewards/margins": 0.138671875,
"rewards/rejected": -0.07373046875,
"step": 115
},
{
"epoch": 0.2997416020671835,
"grad_norm": 329.6904296875,
"learning_rate": 1.400516795865633e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.81640625,
"logps/chosen": -118.5,
"logps/rejected": -139.0,
"loss": 0.6331,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.07666015625,
"rewards/margins": 0.1455078125,
"rewards/rejected": -0.06884765625,
"step": 116
},
{
"epoch": 0.3023255813953488,
"grad_norm": 342.3974304199219,
"learning_rate": 1.3953488372093023e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.80859375,
"logps/chosen": -156.0,
"logps/rejected": -146.0,
"loss": 0.6286,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0625,
"rewards/margins": 0.1513671875,
"rewards/rejected": -0.0888671875,
"step": 117
},
{
"epoch": 0.3049095607235142,
"grad_norm": 312.7485656738281,
"learning_rate": 1.3901808785529716e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.76953125,
"logps/chosen": -124.0,
"logps/rejected": -133.0,
"loss": 0.6155,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.08544921875,
"rewards/margins": 0.1787109375,
"rewards/rejected": -0.09375,
"step": 118
},
{
"epoch": 0.30749354005167956,
"grad_norm": 337.5772705078125,
"learning_rate": 1.3850129198966407e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.80859375,
"logps/chosen": -139.0,
"logps/rejected": -135.0,
"loss": 0.6246,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.08984375,
"rewards/margins": 0.154296875,
"rewards/rejected": -0.06396484375,
"step": 119
},
{
"epoch": 0.31007751937984496,
"grad_norm": 323.82647705078125,
"learning_rate": 1.37984496124031e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.79296875,
"logps/chosen": -134.0,
"logps/rejected": -144.0,
"loss": 0.6328,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.057861328125,
"rewards/margins": 0.1533203125,
"rewards/rejected": -0.09521484375,
"step": 120
},
{
"epoch": 0.31266149870801035,
"grad_norm": 348.8138122558594,
"learning_rate": 1.3746770025839794e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.83984375,
"logps/chosen": -159.0,
"logps/rejected": -162.0,
"loss": 0.6141,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08447265625,
"rewards/margins": 0.1845703125,
"rewards/rejected": -0.10009765625,
"step": 121
},
{
"epoch": 0.3152454780361757,
"grad_norm": 349.4007568359375,
"learning_rate": 1.3695090439276485e-06,
"logits/chosen": -0.80078125,
"logits/rejected": -0.78125,
"logps/chosen": -133.0,
"logps/rejected": -150.0,
"loss": 0.6328,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.07958984375,
"rewards/margins": 0.162109375,
"rewards/rejected": -0.08203125,
"step": 122
},
{
"epoch": 0.3178294573643411,
"grad_norm": 332.4546813964844,
"learning_rate": 1.3643410852713179e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.828125,
"logps/chosen": -142.0,
"logps/rejected": -142.0,
"loss": 0.6021,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.076171875,
"rewards/margins": 0.2412109375,
"rewards/rejected": -0.166015625,
"step": 123
},
{
"epoch": 0.32041343669250644,
"grad_norm": 341.52081298828125,
"learning_rate": 1.359173126614987e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.82421875,
"logps/chosen": -148.0,
"logps/rejected": -139.0,
"loss": 0.6187,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.044677734375,
"rewards/margins": 0.1748046875,
"rewards/rejected": -0.1298828125,
"step": 124
},
{
"epoch": 0.32299741602067183,
"grad_norm": 331.70928955078125,
"learning_rate": 1.3540051679586563e-06,
"logits/chosen": -0.83984375,
"logits/rejected": -0.84765625,
"logps/chosen": -128.0,
"logps/rejected": -146.0,
"loss": 0.6024,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09228515625,
"rewards/margins": 0.20703125,
"rewards/rejected": -0.115234375,
"step": 125
},
{
"epoch": 0.32558139534883723,
"grad_norm": 329.70867919921875,
"learning_rate": 1.3488372093023254e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.80078125,
"logps/chosen": -137.0,
"logps/rejected": -138.0,
"loss": 0.6265,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0869140625,
"rewards/margins": 0.166015625,
"rewards/rejected": -0.0791015625,
"step": 126
},
{
"epoch": 0.3281653746770026,
"grad_norm": 359.75567626953125,
"learning_rate": 1.3436692506459948e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.828125,
"logps/chosen": -147.0,
"logps/rejected": -129.0,
"loss": 0.6324,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.02734375,
"rewards/margins": 0.14453125,
"rewards/rejected": -0.1171875,
"step": 127
},
{
"epoch": 0.330749354005168,
"grad_norm": 328.73541259765625,
"learning_rate": 1.338501291989664e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.79296875,
"logps/chosen": -140.0,
"logps/rejected": -160.0,
"loss": 0.6026,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1376953125,
"rewards/margins": 0.23828125,
"rewards/rejected": -0.10107421875,
"step": 128
},
{
"epoch": 0.3333333333333333,
"grad_norm": 348.1528625488281,
"learning_rate": 1.3333333333333332e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.82421875,
"logps/chosen": -147.0,
"logps/rejected": -138.0,
"loss": 0.6233,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08837890625,
"rewards/margins": 0.1787109375,
"rewards/rejected": -0.0908203125,
"step": 129
},
{
"epoch": 0.3359173126614987,
"grad_norm": 340.9327087402344,
"learning_rate": 1.3281653746770025e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.8203125,
"logps/chosen": -121.5,
"logps/rejected": -144.0,
"loss": 0.6133,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0654296875,
"rewards/margins": 0.1982421875,
"rewards/rejected": -0.1328125,
"step": 130
},
{
"epoch": 0.3385012919896641,
"grad_norm": 352.50140380859375,
"learning_rate": 1.3229974160206719e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.78515625,
"logps/chosen": -133.0,
"logps/rejected": -134.0,
"loss": 0.6362,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09912109375,
"rewards/margins": 0.130859375,
"rewards/rejected": -0.03125,
"step": 131
},
{
"epoch": 0.34108527131782945,
"grad_norm": 334.6105651855469,
"learning_rate": 1.317829457364341e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.8203125,
"logps/chosen": -137.0,
"logps/rejected": -125.5,
"loss": 0.6101,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.119140625,
"rewards/margins": 0.2021484375,
"rewards/rejected": -0.0830078125,
"step": 132
},
{
"epoch": 0.34366925064599485,
"grad_norm": 353.9385986328125,
"learning_rate": 1.3126614987080103e-06,
"logits/chosen": -0.83203125,
"logits/rejected": -0.82421875,
"logps/chosen": -135.0,
"logps/rejected": -135.0,
"loss": 0.6122,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.07666015625,
"rewards/margins": 0.19140625,
"rewards/rejected": -0.11474609375,
"step": 133
},
{
"epoch": 0.3462532299741602,
"grad_norm": 328.07965087890625,
"learning_rate": 1.3074935400516796e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.8203125,
"logps/chosen": -152.0,
"logps/rejected": -133.0,
"loss": 0.6092,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.134765625,
"rewards/margins": 0.216796875,
"rewards/rejected": -0.08203125,
"step": 134
},
{
"epoch": 0.3488372093023256,
"grad_norm": 359.8808288574219,
"learning_rate": 1.302325581395349e-06,
"logits/chosen": -0.8671875,
"logits/rejected": -0.83984375,
"logps/chosen": -149.0,
"logps/rejected": -139.0,
"loss": 0.6028,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0966796875,
"rewards/margins": 0.2080078125,
"rewards/rejected": -0.111328125,
"step": 135
},
{
"epoch": 0.35142118863049093,
"grad_norm": 352.7024230957031,
"learning_rate": 1.2971576227390179e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.8203125,
"logps/chosen": -131.0,
"logps/rejected": -141.0,
"loss": 0.5861,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1337890625,
"rewards/margins": 0.248046875,
"rewards/rejected": -0.11474609375,
"step": 136
},
{
"epoch": 0.35400516795865633,
"grad_norm": 345.4299621582031,
"learning_rate": 1.2919896640826872e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.8046875,
"logps/chosen": -125.5,
"logps/rejected": -133.0,
"loss": 0.5975,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0927734375,
"rewards/margins": 0.2255859375,
"rewards/rejected": -0.1328125,
"step": 137
},
{
"epoch": 0.35658914728682173,
"grad_norm": 308.36920166015625,
"learning_rate": 1.2868217054263565e-06,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8203125,
"logps/chosen": -117.5,
"logps/rejected": -119.5,
"loss": 0.5941,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10498046875,
"rewards/margins": 0.2373046875,
"rewards/rejected": -0.1318359375,
"step": 138
},
{
"epoch": 0.35917312661498707,
"grad_norm": 358.83782958984375,
"learning_rate": 1.2816537467700257e-06,
"logits/chosen": -0.8359375,
"logits/rejected": -0.8203125,
"logps/chosen": -155.0,
"logps/rejected": -147.0,
"loss": 0.6258,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1064453125,
"rewards/margins": 0.1650390625,
"rewards/rejected": -0.05859375,
"step": 139
},
{
"epoch": 0.36175710594315247,
"grad_norm": 371.83404541015625,
"learning_rate": 1.276485788113695e-06,
"logits/chosen": -0.82421875,
"logits/rejected": -0.81640625,
"logps/chosen": -135.0,
"logps/rejected": -148.0,
"loss": 0.6403,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.11572265625,
"rewards/margins": 0.1494140625,
"rewards/rejected": -0.03369140625,
"step": 140
},
{
"epoch": 0.3643410852713178,
"grad_norm": 351.14495849609375,
"learning_rate": 1.2713178294573643e-06,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8203125,
"logps/chosen": -124.5,
"logps/rejected": -146.0,
"loss": 0.6221,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.064453125,
"rewards/margins": 0.1728515625,
"rewards/rejected": -0.10888671875,
"step": 141
},
{
"epoch": 0.3669250645994832,
"grad_norm": 356.72637939453125,
"learning_rate": 1.2661498708010337e-06,
"logits/chosen": -0.84375,
"logits/rejected": -0.8203125,
"logps/chosen": -139.0,
"logps/rejected": -124.5,
"loss": 0.5872,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08056640625,
"rewards/margins": 0.248046875,
"rewards/rejected": -0.16796875,
"step": 142
},
{
"epoch": 0.3695090439276486,
"grad_norm": 345.7752380371094,
"learning_rate": 1.2609819121447028e-06,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8359375,
"logps/chosen": -138.0,
"logps/rejected": -145.0,
"loss": 0.5862,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1640625,
"rewards/margins": 0.263671875,
"rewards/rejected": -0.0986328125,
"step": 143
},
{
"epoch": 0.37209302325581395,
"grad_norm": 349.9151611328125,
"learning_rate": 1.255813953488372e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.796875,
"logps/chosen": -146.0,
"logps/rejected": -134.0,
"loss": 0.6083,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.078125,
"rewards/margins": 0.19140625,
"rewards/rejected": -0.11328125,
"step": 144
},
{
"epoch": 0.37467700258397935,
"grad_norm": 384.64776611328125,
"learning_rate": 1.2506459948320414e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.78515625,
"logps/chosen": -121.0,
"logps/rejected": -115.0,
"loss": 0.6302,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1025390625,
"rewards/margins": 0.1689453125,
"rewards/rejected": -0.0673828125,
"step": 145
},
{
"epoch": 0.3772609819121447,
"grad_norm": 364.6282043457031,
"learning_rate": 1.2454780361757106e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.8046875,
"logps/chosen": -134.0,
"logps/rejected": -143.0,
"loss": 0.6237,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11865234375,
"rewards/margins": 0.1552734375,
"rewards/rejected": -0.0361328125,
"step": 146
},
{
"epoch": 0.3798449612403101,
"grad_norm": 327.8299255371094,
"learning_rate": 1.2403100775193797e-06,
"logits/chosen": -0.84375,
"logits/rejected": -0.82421875,
"logps/chosen": -126.5,
"logps/rejected": -139.0,
"loss": 0.5947,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.13671875,
"rewards/margins": 0.2412109375,
"rewards/rejected": -0.10400390625,
"step": 147
},
{
"epoch": 0.38242894056847543,
"grad_norm": 385.03558349609375,
"learning_rate": 1.235142118863049e-06,
"logits/chosen": -0.86328125,
"logits/rejected": -0.85546875,
"logps/chosen": -152.0,
"logps/rejected": -141.0,
"loss": 0.662,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0361328125,
"rewards/margins": 0.0947265625,
"rewards/rejected": -0.05859375,
"step": 148
},
{
"epoch": 0.3850129198966408,
"grad_norm": 361.1077880859375,
"learning_rate": 1.2299741602067181e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.85546875,
"logps/chosen": -134.0,
"logps/rejected": -159.0,
"loss": 0.6172,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0556640625,
"rewards/margins": 0.1943359375,
"rewards/rejected": -0.138671875,
"step": 149
},
{
"epoch": 0.3875968992248062,
"grad_norm": 365.97283935546875,
"learning_rate": 1.2248062015503875e-06,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8359375,
"logps/chosen": -134.0,
"logps/rejected": -133.0,
"loss": 0.6337,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.050048828125,
"rewards/margins": 0.1640625,
"rewards/rejected": -0.1142578125,
"step": 150
},
{
"epoch": 0.39018087855297157,
"grad_norm": 355.6282958984375,
"learning_rate": 1.2196382428940568e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.80078125,
"logps/chosen": -153.0,
"logps/rejected": -137.0,
"loss": 0.6195,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10302734375,
"rewards/margins": 0.193359375,
"rewards/rejected": -0.08984375,
"step": 151
},
{
"epoch": 0.39276485788113696,
"grad_norm": 351.19390869140625,
"learning_rate": 1.2144702842377261e-06,
"logits/chosen": -0.86328125,
"logits/rejected": -0.83203125,
"logps/chosen": -144.0,
"logps/rejected": -139.0,
"loss": 0.565,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.154296875,
"rewards/margins": 0.3125,
"rewards/rejected": -0.1572265625,
"step": 152
},
{
"epoch": 0.3953488372093023,
"grad_norm": 371.5525207519531,
"learning_rate": 1.2093023255813952e-06,
"logits/chosen": -0.8359375,
"logits/rejected": -0.8515625,
"logps/chosen": -133.0,
"logps/rejected": -134.0,
"loss": 0.6111,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0390625,
"rewards/margins": 0.19921875,
"rewards/rejected": -0.16015625,
"step": 153
},
{
"epoch": 0.3979328165374677,
"grad_norm": 320.109130859375,
"learning_rate": 1.2041343669250646e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.796875,
"logps/chosen": -135.0,
"logps/rejected": -121.5,
"loss": 0.5984,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0830078125,
"rewards/margins": 0.2392578125,
"rewards/rejected": -0.15625,
"step": 154
},
{
"epoch": 0.4005167958656331,
"grad_norm": 356.4275817871094,
"learning_rate": 1.198966408268734e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8359375,
"logps/chosen": -149.0,
"logps/rejected": -130.0,
"loss": 0.6063,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10546875,
"rewards/margins": 0.2041015625,
"rewards/rejected": -0.0986328125,
"step": 155
},
{
"epoch": 0.40310077519379844,
"grad_norm": 348.66217041015625,
"learning_rate": 1.193798449612403e-06,
"logits/chosen": -0.87890625,
"logits/rejected": -0.84375,
"logps/chosen": -134.0,
"logps/rejected": -145.0,
"loss": 0.6041,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1162109375,
"rewards/margins": 0.2060546875,
"rewards/rejected": -0.08984375,
"step": 156
},
{
"epoch": 0.40568475452196384,
"grad_norm": 345.34661865234375,
"learning_rate": 1.1886304909560723e-06,
"logits/chosen": -0.859375,
"logits/rejected": -0.83203125,
"logps/chosen": -138.0,
"logps/rejected": -121.0,
"loss": 0.6521,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.01416015625,
"rewards/margins": 0.123046875,
"rewards/rejected": -0.10888671875,
"step": 157
},
{
"epoch": 0.4082687338501292,
"grad_norm": 350.15313720703125,
"learning_rate": 1.1834625322997417e-06,
"logits/chosen": -0.8359375,
"logits/rejected": -0.83984375,
"logps/chosen": -153.0,
"logps/rejected": -142.0,
"loss": 0.6064,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0947265625,
"rewards/margins": 0.2119140625,
"rewards/rejected": -0.1171875,
"step": 158
},
{
"epoch": 0.4108527131782946,
"grad_norm": 379.19287109375,
"learning_rate": 1.1782945736434108e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.828125,
"logps/chosen": -119.5,
"logps/rejected": -138.0,
"loss": 0.6129,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.10400390625,
"rewards/margins": 0.2021484375,
"rewards/rejected": -0.09765625,
"step": 159
},
{
"epoch": 0.4134366925064599,
"grad_norm": 355.0957336425781,
"learning_rate": 1.17312661498708e-06,
"logits/chosen": -0.859375,
"logits/rejected": -0.828125,
"logps/chosen": -145.0,
"logps/rejected": -132.0,
"loss": 0.5751,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1015625,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.1787109375,
"step": 160
},
{
"epoch": 0.4160206718346253,
"grad_norm": 367.7550964355469,
"learning_rate": 1.1679586563307492e-06,
"logits/chosen": -0.82421875,
"logits/rejected": -0.83984375,
"logps/chosen": -136.0,
"logps/rejected": -138.0,
"loss": 0.6216,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1103515625,
"rewards/margins": 0.1884765625,
"rewards/rejected": -0.0791015625,
"step": 161
},
{
"epoch": 0.4186046511627907,
"grad_norm": 385.49310302734375,
"learning_rate": 1.1627906976744186e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8359375,
"logps/chosen": -151.0,
"logps/rejected": -140.0,
"loss": 0.6404,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.06982421875,
"rewards/margins": 0.162109375,
"rewards/rejected": -0.09228515625,
"step": 162
},
{
"epoch": 0.42118863049095606,
"grad_norm": 422.4086608886719,
"learning_rate": 1.1576227390180877e-06,
"logits/chosen": -0.875,
"logits/rejected": -0.859375,
"logps/chosen": -144.0,
"logps/rejected": -135.0,
"loss": 0.594,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.078125,
"rewards/margins": 0.25,
"rewards/rejected": -0.171875,
"step": 163
},
{
"epoch": 0.42377260981912146,
"grad_norm": 346.9455261230469,
"learning_rate": 1.152454780361757e-06,
"logits/chosen": -0.8515625,
"logits/rejected": -0.859375,
"logps/chosen": -146.0,
"logps/rejected": -132.0,
"loss": 0.59,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11181640625,
"rewards/margins": 0.255859375,
"rewards/rejected": -0.14453125,
"step": 164
},
{
"epoch": 0.4263565891472868,
"grad_norm": 384.1201477050781,
"learning_rate": 1.1472868217054264e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8125,
"logps/chosen": -136.0,
"logps/rejected": -198.0,
"loss": 0.6001,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.00860595703125,
"rewards/margins": 0.216796875,
"rewards/rejected": -0.208984375,
"step": 165
},
{
"epoch": 0.4289405684754522,
"grad_norm": 384.46002197265625,
"learning_rate": 1.1421188630490957e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.8359375,
"logps/chosen": -146.0,
"logps/rejected": -142.0,
"loss": 0.6613,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.078125,
"rewards/margins": 0.09326171875,
"rewards/rejected": -0.014892578125,
"step": 166
},
{
"epoch": 0.4315245478036176,
"grad_norm": 333.75518798828125,
"learning_rate": 1.1369509043927648e-06,
"logits/chosen": -0.83984375,
"logits/rejected": -0.84765625,
"logps/chosen": -134.0,
"logps/rejected": -140.0,
"loss": 0.5698,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1552734375,
"rewards/margins": 0.298828125,
"rewards/rejected": -0.14453125,
"step": 167
},
{
"epoch": 0.43410852713178294,
"grad_norm": 369.3163757324219,
"learning_rate": 1.1317829457364341e-06,
"logits/chosen": -0.875,
"logits/rejected": -0.84765625,
"logps/chosen": -154.0,
"logps/rejected": -151.0,
"loss": 0.633,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0234375,
"rewards/margins": 0.166015625,
"rewards/rejected": -0.142578125,
"step": 168
},
{
"epoch": 0.43669250645994834,
"grad_norm": 356.31121826171875,
"learning_rate": 1.1266149870801035e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.83203125,
"logps/chosen": -138.0,
"logps/rejected": -131.0,
"loss": 0.6216,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.08203125,
"rewards/margins": 0.1806640625,
"rewards/rejected": -0.0986328125,
"step": 169
},
{
"epoch": 0.4392764857881137,
"grad_norm": 378.68572998046875,
"learning_rate": 1.1214470284237724e-06,
"logits/chosen": -0.86328125,
"logits/rejected": -0.87109375,
"logps/chosen": -126.5,
"logps/rejected": -140.0,
"loss": 0.6583,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0341796875,
"rewards/margins": 0.09912109375,
"rewards/rejected": -0.06494140625,
"step": 170
},
{
"epoch": 0.4418604651162791,
"grad_norm": 371.9620056152344,
"learning_rate": 1.1162790697674417e-06,
"logits/chosen": -0.83984375,
"logits/rejected": -0.87109375,
"logps/chosen": -162.0,
"logps/rejected": -153.0,
"loss": 0.6076,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.1435546875,
"rewards/margins": 0.240234375,
"rewards/rejected": -0.09619140625,
"step": 171
},
{
"epoch": 0.4444444444444444,
"grad_norm": 378.2386474609375,
"learning_rate": 1.111111111111111e-06,
"logits/chosen": -0.83203125,
"logits/rejected": -0.80078125,
"logps/chosen": -127.0,
"logps/rejected": -136.0,
"loss": 0.646,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0257568359375,
"rewards/margins": 0.130859375,
"rewards/rejected": -0.10546875,
"step": 172
},
{
"epoch": 0.4470284237726098,
"grad_norm": 342.5321044921875,
"learning_rate": 1.1059431524547802e-06,
"logits/chosen": -0.86328125,
"logits/rejected": -0.875,
"logps/chosen": -133.0,
"logps/rejected": -142.0,
"loss": 0.603,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.06640625,
"rewards/margins": 0.2177734375,
"rewards/rejected": -0.1513671875,
"step": 173
},
{
"epoch": 0.4496124031007752,
"grad_norm": 353.12591552734375,
"learning_rate": 1.1007751937984495e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.79296875,
"logps/chosen": -125.5,
"logps/rejected": -136.0,
"loss": 0.615,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.00628662109375,
"rewards/margins": 0.197265625,
"rewards/rejected": -0.1904296875,
"step": 174
},
{
"epoch": 0.45219638242894056,
"grad_norm": 361.20269775390625,
"learning_rate": 1.0956072351421188e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.8046875,
"logps/chosen": -147.0,
"logps/rejected": -124.5,
"loss": 0.6301,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.06640625,
"rewards/margins": 0.1611328125,
"rewards/rejected": -0.0947265625,
"step": 175
},
{
"epoch": 0.45478036175710596,
"grad_norm": 350.6606750488281,
"learning_rate": 1.0904392764857881e-06,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8125,
"logps/chosen": -139.0,
"logps/rejected": -129.0,
"loss": 0.5934,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.01953125,
"rewards/margins": 0.24609375,
"rewards/rejected": -0.2255859375,
"step": 176
},
{
"epoch": 0.4573643410852713,
"grad_norm": 326.9544677734375,
"learning_rate": 1.0852713178294573e-06,
"logits/chosen": -0.84765625,
"logits/rejected": -0.84375,
"logps/chosen": -143.0,
"logps/rejected": -135.0,
"loss": 0.5634,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0986328125,
"rewards/margins": 0.31640625,
"rewards/rejected": -0.2177734375,
"step": 177
},
{
"epoch": 0.4599483204134367,
"grad_norm": 339.9979248046875,
"learning_rate": 1.0801033591731266e-06,
"logits/chosen": -0.859375,
"logits/rejected": -0.87109375,
"logps/chosen": -125.5,
"logps/rejected": -119.5,
"loss": 0.6461,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.00390625,
"rewards/margins": 0.130859375,
"rewards/rejected": -0.126953125,
"step": 178
},
{
"epoch": 0.4625322997416021,
"grad_norm": 327.41778564453125,
"learning_rate": 1.074935400516796e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.79296875,
"logps/chosen": -129.0,
"logps/rejected": -127.0,
"loss": 0.5596,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12353515625,
"rewards/margins": 0.326171875,
"rewards/rejected": -0.203125,
"step": 179
},
{
"epoch": 0.46511627906976744,
"grad_norm": 364.97479248046875,
"learning_rate": 1.069767441860465e-06,
"logits/chosen": -0.85546875,
"logits/rejected": -0.859375,
"logps/chosen": -135.0,
"logps/rejected": -154.0,
"loss": 0.6108,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.053955078125,
"rewards/margins": 0.2099609375,
"rewards/rejected": -0.15625,
"step": 180
},
{
"epoch": 0.46770025839793283,
"grad_norm": 326.265869140625,
"learning_rate": 1.0645994832041344e-06,
"logits/chosen": -0.8515625,
"logits/rejected": -0.82421875,
"logps/chosen": -129.0,
"logps/rejected": -127.0,
"loss": 0.6075,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0771484375,
"rewards/margins": 0.2177734375,
"rewards/rejected": -0.1396484375,
"step": 181
},
{
"epoch": 0.4702842377260982,
"grad_norm": 368.4969177246094,
"learning_rate": 1.0594315245478035e-06,
"logits/chosen": -0.859375,
"logits/rejected": -0.8671875,
"logps/chosen": -131.0,
"logps/rejected": -125.0,
"loss": 0.6359,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.00154876708984375,
"rewards/margins": 0.154296875,
"rewards/rejected": -0.15234375,
"step": 182
},
{
"epoch": 0.4728682170542636,
"grad_norm": 380.64892578125,
"learning_rate": 1.0542635658914728e-06,
"logits/chosen": -0.88671875,
"logits/rejected": -0.86328125,
"logps/chosen": -162.0,
"logps/rejected": -159.0,
"loss": 0.5272,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1982421875,
"rewards/margins": 0.40234375,
"rewards/rejected": -0.203125,
"step": 183
},
{
"epoch": 0.4754521963824289,
"grad_norm": 370.6021728515625,
"learning_rate": 1.049095607235142e-06,
"logits/chosen": -0.859375,
"logits/rejected": -0.84765625,
"logps/chosen": -124.0,
"logps/rejected": -137.0,
"loss": 0.6156,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07763671875,
"rewards/margins": 0.1875,
"rewards/rejected": -0.1103515625,
"step": 184
},
{
"epoch": 0.4780361757105943,
"grad_norm": 383.2211608886719,
"learning_rate": 1.0439276485788113e-06,
"logits/chosen": -0.859375,
"logits/rejected": -0.87109375,
"logps/chosen": -145.0,
"logps/rejected": -144.0,
"loss": 0.6074,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06103515625,
"rewards/margins": 0.2138671875,
"rewards/rejected": -0.1533203125,
"step": 185
},
{
"epoch": 0.4806201550387597,
"grad_norm": 377.28411865234375,
"learning_rate": 1.0387596899224806e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.81640625,
"logps/chosen": -126.5,
"logps/rejected": -134.0,
"loss": 0.6229,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.095703125,
"rewards/margins": 0.1923828125,
"rewards/rejected": -0.0966796875,
"step": 186
},
{
"epoch": 0.48320413436692505,
"grad_norm": 355.7249450683594,
"learning_rate": 1.0335917312661497e-06,
"logits/chosen": -0.8671875,
"logits/rejected": -0.8671875,
"logps/chosen": -152.0,
"logps/rejected": -143.0,
"loss": 0.5508,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1171875,
"rewards/margins": 0.369140625,
"rewards/rejected": -0.251953125,
"step": 187
},
{
"epoch": 0.48578811369509045,
"grad_norm": 371.69903564453125,
"learning_rate": 1.028423772609819e-06,
"logits/chosen": -0.85546875,
"logits/rejected": -0.859375,
"logps/chosen": -144.0,
"logps/rejected": -161.0,
"loss": 0.5718,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1328125,
"rewards/margins": 0.294921875,
"rewards/rejected": -0.1630859375,
"step": 188
},
{
"epoch": 0.4883720930232558,
"grad_norm": 366.8398132324219,
"learning_rate": 1.0232558139534884e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.84375,
"logps/chosen": -126.0,
"logps/rejected": -133.0,
"loss": 0.5823,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10009765625,
"rewards/margins": 0.267578125,
"rewards/rejected": -0.1669921875,
"step": 189
},
{
"epoch": 0.4909560723514212,
"grad_norm": 408.7562561035156,
"learning_rate": 1.0180878552971577e-06,
"logits/chosen": -0.81640625,
"logits/rejected": -0.87109375,
"logps/chosen": -134.0,
"logps/rejected": -134.0,
"loss": 0.6008,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09130859375,
"rewards/margins": 0.23828125,
"rewards/rejected": -0.1474609375,
"step": 190
},
{
"epoch": 0.4935400516795866,
"grad_norm": 382.720458984375,
"learning_rate": 1.0129198966408268e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.83984375,
"logps/chosen": -149.0,
"logps/rejected": -139.0,
"loss": 0.5869,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07177734375,
"rewards/margins": 0.271484375,
"rewards/rejected": -0.2001953125,
"step": 191
},
{
"epoch": 0.49612403100775193,
"grad_norm": 385.51629638671875,
"learning_rate": 1.0077519379844962e-06,
"logits/chosen": -0.8515625,
"logits/rejected": -0.8671875,
"logps/chosen": -147.0,
"logps/rejected": -150.0,
"loss": 0.6169,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09228515625,
"rewards/margins": 0.2138671875,
"rewards/rejected": -0.1220703125,
"step": 192
},
{
"epoch": 0.49870801033591733,
"grad_norm": 335.9141540527344,
"learning_rate": 1.0025839793281655e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.828125,
"logps/chosen": -112.0,
"logps/rejected": -128.0,
"loss": 0.6129,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.02197265625,
"rewards/margins": 0.201171875,
"rewards/rejected": -0.1796875,
"step": 193
},
{
"epoch": 0.5012919896640827,
"grad_norm": 351.80316162109375,
"learning_rate": 9.974160206718346e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.84375,
"logps/chosen": -144.0,
"logps/rejected": -145.0,
"loss": 0.6016,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09228515625,
"rewards/margins": 0.2421875,
"rewards/rejected": -0.150390625,
"step": 194
},
{
"epoch": 0.5038759689922481,
"grad_norm": 338.88427734375,
"learning_rate": 9.922480620155037e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.84375,
"logps/chosen": -117.0,
"logps/rejected": -111.5,
"loss": 0.6527,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.0303955078125,
"rewards/margins": 0.109375,
"rewards/rejected": -0.1396484375,
"step": 195
},
{
"epoch": 0.5064599483204134,
"grad_norm": 370.98345947265625,
"learning_rate": 9.87080103359173e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.8515625,
"logps/chosen": -155.0,
"logps/rejected": -156.0,
"loss": 0.5913,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.03369140625,
"rewards/margins": 0.267578125,
"rewards/rejected": -0.2333984375,
"step": 196
},
{
"epoch": 0.5090439276485789,
"grad_norm": 360.0625,
"learning_rate": 9.819121447028424e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8359375,
"logps/chosen": -112.0,
"logps/rejected": -136.0,
"loss": 0.6224,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.008544921875,
"rewards/margins": 0.173828125,
"rewards/rejected": -0.181640625,
"step": 197
},
{
"epoch": 0.5116279069767442,
"grad_norm": 333.0406188964844,
"learning_rate": 9.767441860465115e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.84375,
"logps/chosen": -137.0,
"logps/rejected": -137.0,
"loss": 0.5659,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.09912109375,
"rewards/margins": 0.328125,
"rewards/rejected": -0.2294921875,
"step": 198
},
{
"epoch": 0.5142118863049095,
"grad_norm": 357.7864685058594,
"learning_rate": 9.715762273901809e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.859375,
"logps/chosen": -145.0,
"logps/rejected": -155.0,
"loss": 0.5864,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.076171875,
"rewards/margins": 0.2734375,
"rewards/rejected": -0.197265625,
"step": 199
},
{
"epoch": 0.5167958656330749,
"grad_norm": 360.8147277832031,
"learning_rate": 9.6640826873385e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.87109375,
"logps/chosen": -136.0,
"logps/rejected": -137.0,
"loss": 0.6389,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.01409912109375,
"rewards/margins": 0.150390625,
"rewards/rejected": -0.1357421875,
"step": 200
},
{
"epoch": 0.5193798449612403,
"grad_norm": 353.4968566894531,
"learning_rate": 9.612403100775193e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.828125,
"logps/chosen": -138.0,
"logps/rejected": -146.0,
"loss": 0.5942,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.030517578125,
"rewards/margins": 0.2470703125,
"rewards/rejected": -0.27734375,
"step": 201
},
{
"epoch": 0.5219638242894057,
"grad_norm": 364.1571960449219,
"learning_rate": 9.560723514211886e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.890625,
"logps/chosen": -140.0,
"logps/rejected": -155.0,
"loss": 0.5748,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.050048828125,
"rewards/margins": 0.3125,
"rewards/rejected": -0.26171875,
"step": 202
},
{
"epoch": 0.524547803617571,
"grad_norm": 349.590087890625,
"learning_rate": 9.509043927648578e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.85546875,
"logps/chosen": -137.0,
"logps/rejected": -148.0,
"loss": 0.6078,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.042236328125,
"rewards/margins": 0.2197265625,
"rewards/rejected": -0.177734375,
"step": 203
},
{
"epoch": 0.5271317829457365,
"grad_norm": 326.5566711425781,
"learning_rate": 9.457364341085271e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8203125,
"logps/chosen": -137.0,
"logps/rejected": -126.0,
"loss": 0.577,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03515625,
"rewards/margins": 0.27734375,
"rewards/rejected": -0.2412109375,
"step": 204
},
{
"epoch": 0.5297157622739018,
"grad_norm": 361.8912658691406,
"learning_rate": 9.405684754521963e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.859375,
"logps/chosen": -146.0,
"logps/rejected": -145.0,
"loss": 0.5764,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0108642578125,
"rewards/margins": 0.3046875,
"rewards/rejected": -0.29296875,
"step": 205
},
{
"epoch": 0.5322997416020672,
"grad_norm": 393.8551940917969,
"learning_rate": 9.354005167958656e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.796875,
"logps/chosen": -131.0,
"logps/rejected": -154.0,
"loss": 0.5933,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.08349609375,
"rewards/margins": 0.240234375,
"rewards/rejected": -0.15625,
"step": 206
},
{
"epoch": 0.5348837209302325,
"grad_norm": 394.2397766113281,
"learning_rate": 9.302325581395349e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.7890625,
"logps/chosen": -158.0,
"logps/rejected": -125.5,
"loss": 0.5694,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0859375,
"rewards/margins": 0.32421875,
"rewards/rejected": -0.2392578125,
"step": 207
},
{
"epoch": 0.537467700258398,
"grad_norm": 412.0761413574219,
"learning_rate": 9.250645994832042e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.84765625,
"logps/chosen": -130.0,
"logps/rejected": -133.0,
"loss": 0.6389,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0084228515625,
"rewards/margins": 0.15625,
"rewards/rejected": -0.1640625,
"step": 208
},
{
"epoch": 0.5400516795865633,
"grad_norm": 327.9852294921875,
"learning_rate": 9.198966408268733e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.8203125,
"logps/chosen": -130.0,
"logps/rejected": -139.0,
"loss": 0.5293,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1171875,
"rewards/margins": 0.408203125,
"rewards/rejected": -0.291015625,
"step": 209
},
{
"epoch": 0.5426356589147286,
"grad_norm": 356.892333984375,
"learning_rate": 9.147286821705425e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.859375,
"logps/chosen": -149.0,
"logps/rejected": -134.0,
"loss": 0.512,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09228515625,
"rewards/margins": 0.44140625,
"rewards/rejected": -0.349609375,
"step": 210
},
{
"epoch": 0.5452196382428941,
"grad_norm": 369.5984191894531,
"learning_rate": 9.095607235142119e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.86328125,
"logps/chosen": -139.0,
"logps/rejected": -145.0,
"loss": 0.6122,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.04931640625,
"rewards/margins": 0.2177734375,
"rewards/rejected": -0.1689453125,
"step": 211
},
{
"epoch": 0.5478036175710594,
"grad_norm": 357.82122802734375,
"learning_rate": 9.043927648578811e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.76953125,
"logps/chosen": -138.0,
"logps/rejected": -128.0,
"loss": 0.5928,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08154296875,
"rewards/margins": 0.259765625,
"rewards/rejected": -0.1787109375,
"step": 212
},
{
"epoch": 0.5503875968992248,
"grad_norm": 366.8385314941406,
"learning_rate": 8.992248062015504e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.83984375,
"logps/chosen": -143.0,
"logps/rejected": -160.0,
"loss": 0.5735,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.061767578125,
"rewards/margins": 0.294921875,
"rewards/rejected": -0.2333984375,
"step": 213
},
{
"epoch": 0.5529715762273901,
"grad_norm": 337.5374450683594,
"learning_rate": 8.940568475452196e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.80078125,
"logps/chosen": -139.0,
"logps/rejected": -132.0,
"loss": 0.6036,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0186767578125,
"rewards/margins": 0.2216796875,
"rewards/rejected": -0.203125,
"step": 214
},
{
"epoch": 0.5555555555555556,
"grad_norm": 388.3349914550781,
"learning_rate": 8.888888888888888e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.8515625,
"logps/chosen": -143.0,
"logps/rejected": -144.0,
"loss": 0.6125,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.04052734375,
"rewards/margins": 0.19921875,
"rewards/rejected": -0.240234375,
"step": 215
},
{
"epoch": 0.5581395348837209,
"grad_norm": 391.5953063964844,
"learning_rate": 8.837209302325581e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8359375,
"logps/chosen": -138.0,
"logps/rejected": -151.0,
"loss": 0.6274,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.023681640625,
"rewards/margins": 0.18359375,
"rewards/rejected": -0.1591796875,
"step": 216
},
{
"epoch": 0.5607235142118863,
"grad_norm": 408.422607421875,
"learning_rate": 8.785529715762273e-07,
"logits/chosen": -0.80078125,
"logits/rejected": -0.83203125,
"logps/chosen": -121.5,
"logps/rejected": -152.0,
"loss": 0.6159,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.028076171875,
"rewards/margins": 0.2138671875,
"rewards/rejected": -0.2421875,
"step": 217
},
{
"epoch": 0.5633074935400517,
"grad_norm": 315.7479553222656,
"learning_rate": 8.733850129198967e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.8828125,
"logps/chosen": -138.0,
"logps/rejected": -137.0,
"loss": 0.5319,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.078125,
"rewards/margins": 0.388671875,
"rewards/rejected": -0.310546875,
"step": 218
},
{
"epoch": 0.5658914728682171,
"grad_norm": 338.3675231933594,
"learning_rate": 8.682170542635659e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.875,
"logps/chosen": -160.0,
"logps/rejected": -137.0,
"loss": 0.5379,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1640625,
"rewards/margins": 0.375,
"rewards/rejected": -0.2109375,
"step": 219
},
{
"epoch": 0.5684754521963824,
"grad_norm": 367.66473388671875,
"learning_rate": 8.630490956072352e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.82421875,
"logps/chosen": -132.0,
"logps/rejected": -135.0,
"loss": 0.5655,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0625,
"rewards/margins": 0.306640625,
"rewards/rejected": -0.2451171875,
"step": 220
},
{
"epoch": 0.5710594315245479,
"grad_norm": 350.5587158203125,
"learning_rate": 8.578811369509043e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.85546875,
"logps/chosen": -122.0,
"logps/rejected": -132.0,
"loss": 0.5753,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.02734375,
"rewards/margins": 0.30078125,
"rewards/rejected": -0.2734375,
"step": 221
},
{
"epoch": 0.5736434108527132,
"grad_norm": 361.6526184082031,
"learning_rate": 8.527131782945736e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.85546875,
"logps/chosen": -138.0,
"logps/rejected": -139.0,
"loss": 0.5745,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.06591796875,
"rewards/margins": 0.29296875,
"rewards/rejected": -0.2275390625,
"step": 222
},
{
"epoch": 0.5762273901808785,
"grad_norm": 361.86065673828125,
"learning_rate": 8.475452196382429e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.8515625,
"logps/chosen": -130.0,
"logps/rejected": -137.0,
"loss": 0.6071,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1025390625,
"rewards/margins": 0.2177734375,
"rewards/rejected": -0.11572265625,
"step": 223
},
{
"epoch": 0.5788113695090439,
"grad_norm": 364.85150146484375,
"learning_rate": 8.423772609819121e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.8359375,
"logps/chosen": -143.0,
"logps/rejected": -151.0,
"loss": 0.5748,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.03515625,
"rewards/margins": 0.302734375,
"rewards/rejected": -0.267578125,
"step": 224
},
{
"epoch": 0.5813953488372093,
"grad_norm": 378.9034423828125,
"learning_rate": 8.372093023255814e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8515625,
"logps/chosen": -152.0,
"logps/rejected": -130.0,
"loss": 0.5606,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.046142578125,
"rewards/margins": 0.341796875,
"rewards/rejected": -0.296875,
"step": 225
},
{
"epoch": 0.5839793281653747,
"grad_norm": 377.5055847167969,
"learning_rate": 8.320413436692506e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.86328125,
"logps/chosen": -132.0,
"logps/rejected": -150.0,
"loss": 0.5322,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.10693359375,
"rewards/margins": 0.37890625,
"rewards/rejected": -0.271484375,
"step": 226
},
{
"epoch": 0.58656330749354,
"grad_norm": 362.3092956542969,
"learning_rate": 8.268733850129198e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.86328125,
"logps/chosen": -135.0,
"logps/rejected": -136.0,
"loss": 0.5547,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.06787109375,
"rewards/margins": 0.353515625,
"rewards/rejected": -0.28515625,
"step": 227
},
{
"epoch": 0.5891472868217055,
"grad_norm": 356.24755859375,
"learning_rate": 8.217054263565891e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8203125,
"logps/chosen": -143.0,
"logps/rejected": -140.0,
"loss": 0.545,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09619140625,
"rewards/margins": 0.369140625,
"rewards/rejected": -0.271484375,
"step": 228
},
{
"epoch": 0.5917312661498708,
"grad_norm": 378.0314025878906,
"learning_rate": 8.165374677002583e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.90234375,
"logps/chosen": -150.0,
"logps/rejected": -136.0,
"loss": 0.5986,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.032958984375,
"rewards/margins": 0.25,
"rewards/rejected": -0.2177734375,
"step": 229
},
{
"epoch": 0.5943152454780362,
"grad_norm": 335.54901123046875,
"learning_rate": 8.113695090439277e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.796875,
"logps/chosen": -137.0,
"logps/rejected": -146.0,
"loss": 0.5579,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0546875,
"rewards/margins": 0.337890625,
"rewards/rejected": -0.283203125,
"step": 230
},
{
"epoch": 0.5968992248062015,
"grad_norm": 350.567626953125,
"learning_rate": 8.062015503875969e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.8671875,
"logps/chosen": -127.5,
"logps/rejected": -131.0,
"loss": 0.5854,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01953125,
"rewards/margins": 0.29296875,
"rewards/rejected": -0.2734375,
"step": 231
},
{
"epoch": 0.599483204134367,
"grad_norm": 325.7544860839844,
"learning_rate": 8.010335917312661e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.8671875,
"logps/chosen": -149.0,
"logps/rejected": -127.0,
"loss": 0.5523,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.07568359375,
"rewards/margins": 0.341796875,
"rewards/rejected": -0.265625,
"step": 232
},
{
"epoch": 0.6020671834625323,
"grad_norm": 349.6297607421875,
"learning_rate": 7.958656330749353e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.828125,
"logps/chosen": -145.0,
"logps/rejected": -131.0,
"loss": 0.5614,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0625,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.259765625,
"step": 233
},
{
"epoch": 0.6046511627906976,
"grad_norm": 377.7822265625,
"learning_rate": 7.906976744186046e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.8828125,
"logps/chosen": -158.0,
"logps/rejected": -147.0,
"loss": 0.5689,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.01953125,
"rewards/margins": 0.328125,
"rewards/rejected": -0.30859375,
"step": 234
},
{
"epoch": 0.6072351421188631,
"grad_norm": 361.43487548828125,
"learning_rate": 7.855297157622739e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.85546875,
"logps/chosen": -137.0,
"logps/rejected": -134.0,
"loss": 0.5818,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.002349853515625,
"rewards/margins": 0.28515625,
"rewards/rejected": -0.28125,
"step": 235
},
{
"epoch": 0.6098191214470284,
"grad_norm": 368.1749572753906,
"learning_rate": 7.803617571059431e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.88671875,
"logps/chosen": -141.0,
"logps/rejected": -158.0,
"loss": 0.5587,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.061767578125,
"rewards/margins": 0.328125,
"rewards/rejected": -0.265625,
"step": 236
},
{
"epoch": 0.6124031007751938,
"grad_norm": 392.1849060058594,
"learning_rate": 7.751937984496125e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.796875,
"logps/chosen": -140.0,
"logps/rejected": -134.0,
"loss": 0.598,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.004547119140625,
"rewards/margins": 0.2490234375,
"rewards/rejected": -0.25390625,
"step": 237
},
{
"epoch": 0.6149870801033591,
"grad_norm": 371.883056640625,
"learning_rate": 7.700258397932816e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.82421875,
"logps/chosen": -145.0,
"logps/rejected": -136.0,
"loss": 0.5367,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03515625,
"rewards/margins": 0.41796875,
"rewards/rejected": -0.3828125,
"step": 238
},
{
"epoch": 0.6175710594315246,
"grad_norm": 394.88043212890625,
"learning_rate": 7.648578811369508e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.8359375,
"logps/chosen": -143.0,
"logps/rejected": -136.0,
"loss": 0.5676,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1513671875,
"rewards/margins": 0.306640625,
"rewards/rejected": -0.154296875,
"step": 239
},
{
"epoch": 0.6201550387596899,
"grad_norm": 401.91900634765625,
"learning_rate": 7.596899224806201e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.85546875,
"logps/chosen": -146.0,
"logps/rejected": -147.0,
"loss": 0.6092,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0673828125,
"rewards/margins": 0.2314453125,
"rewards/rejected": -0.298828125,
"step": 240
},
{
"epoch": 0.6227390180878553,
"grad_norm": 392.7043151855469,
"learning_rate": 7.545219638242894e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.83203125,
"logps/chosen": -147.0,
"logps/rejected": -134.0,
"loss": 0.5666,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07421875,
"rewards/margins": 0.302734375,
"rewards/rejected": -0.228515625,
"step": 241
},
{
"epoch": 0.6253229974160207,
"grad_norm": 308.71868896484375,
"learning_rate": 7.493540051679587e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.83203125,
"logps/chosen": -127.0,
"logps/rejected": -133.0,
"loss": 0.5036,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08837890625,
"rewards/margins": 0.4765625,
"rewards/rejected": -0.38671875,
"step": 242
},
{
"epoch": 0.627906976744186,
"grad_norm": 391.1969909667969,
"learning_rate": 7.441860465116279e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.86328125,
"logps/chosen": -165.0,
"logps/rejected": -139.0,
"loss": 0.5482,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0281982421875,
"rewards/margins": 0.39453125,
"rewards/rejected": -0.365234375,
"step": 243
},
{
"epoch": 0.6304909560723514,
"grad_norm": 359.4422302246094,
"learning_rate": 7.390180878552971e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.83203125,
"logps/chosen": -127.5,
"logps/rejected": -143.0,
"loss": 0.5789,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.00860595703125,
"rewards/margins": 0.2890625,
"rewards/rejected": -0.296875,
"step": 244
},
{
"epoch": 0.6330749354005168,
"grad_norm": 336.4054260253906,
"learning_rate": 7.338501291989664e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.84375,
"logps/chosen": -144.0,
"logps/rejected": -140.0,
"loss": 0.5264,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.10498046875,
"rewards/margins": 0.447265625,
"rewards/rejected": -0.341796875,
"step": 245
},
{
"epoch": 0.6356589147286822,
"grad_norm": 370.9283447265625,
"learning_rate": 7.286821705426356e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.8125,
"logps/chosen": -133.0,
"logps/rejected": -134.0,
"loss": 0.5901,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.027587890625,
"rewards/margins": 0.26171875,
"rewards/rejected": -0.234375,
"step": 246
},
{
"epoch": 0.6382428940568475,
"grad_norm": 347.1625061035156,
"learning_rate": 7.235142118863049e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8359375,
"logps/chosen": -146.0,
"logps/rejected": -137.0,
"loss": 0.5607,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.00946044921875,
"rewards/margins": 0.369140625,
"rewards/rejected": -0.37890625,
"step": 247
},
{
"epoch": 0.6408268733850129,
"grad_norm": 403.0948791503906,
"learning_rate": 7.183462532299741e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.828125,
"logps/chosen": -119.5,
"logps/rejected": -120.0,
"loss": 0.6028,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.046142578125,
"rewards/margins": 0.220703125,
"rewards/rejected": -0.265625,
"step": 248
},
{
"epoch": 0.6434108527131783,
"grad_norm": 351.85125732421875,
"learning_rate": 7.131782945736435e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.84375,
"logps/chosen": -139.0,
"logps/rejected": -142.0,
"loss": 0.5043,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12060546875,
"rewards/margins": 0.466796875,
"rewards/rejected": -0.345703125,
"step": 249
},
{
"epoch": 0.6459948320413437,
"grad_norm": 362.1929626464844,
"learning_rate": 7.080103359173126e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.84375,
"logps/chosen": -137.0,
"logps/rejected": -143.0,
"loss": 0.6043,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0390625,
"rewards/margins": 0.23046875,
"rewards/rejected": -0.26953125,
"step": 250
},
{
"epoch": 0.648578811369509,
"grad_norm": 360.3114013671875,
"learning_rate": 7.028423772609818e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8828125,
"logps/chosen": -139.0,
"logps/rejected": -137.0,
"loss": 0.5684,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0673828125,
"rewards/margins": 0.3359375,
"rewards/rejected": -0.26953125,
"step": 251
},
{
"epoch": 0.6511627906976745,
"grad_norm": 370.75030517578125,
"learning_rate": 6.976744186046511e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.8984375,
"logps/chosen": -151.0,
"logps/rejected": -142.0,
"loss": 0.5256,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12890625,
"rewards/margins": 0.40234375,
"rewards/rejected": -0.2734375,
"step": 252
},
{
"epoch": 0.6537467700258398,
"grad_norm": 351.92132568359375,
"learning_rate": 6.925064599483204e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8671875,
"logps/chosen": -144.0,
"logps/rejected": -134.0,
"loss": 0.5125,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0703125,
"rewards/margins": 0.46484375,
"rewards/rejected": -0.39453125,
"step": 253
},
{
"epoch": 0.6563307493540051,
"grad_norm": 371.71484375,
"learning_rate": 6.873385012919897e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.88671875,
"logps/chosen": -155.0,
"logps/rejected": -146.0,
"loss": 0.5452,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.01953125,
"rewards/margins": 0.357421875,
"rewards/rejected": -0.337890625,
"step": 254
},
{
"epoch": 0.6589147286821705,
"grad_norm": 383.404052734375,
"learning_rate": 6.821705426356589e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.859375,
"logps/chosen": -162.0,
"logps/rejected": -148.0,
"loss": 0.5901,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.046875,
"rewards/margins": 0.265625,
"rewards/rejected": -0.3125,
"step": 255
},
{
"epoch": 0.661498708010336,
"grad_norm": 377.6560363769531,
"learning_rate": 6.770025839793282e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.84765625,
"logps/chosen": -144.0,
"logps/rejected": -129.0,
"loss": 0.5852,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.038330078125,
"rewards/margins": 0.29296875,
"rewards/rejected": -0.33203125,
"step": 256
},
{
"epoch": 0.6640826873385013,
"grad_norm": 344.1567687988281,
"learning_rate": 6.718346253229974e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.82421875,
"logps/chosen": -133.0,
"logps/rejected": -129.0,
"loss": 0.5424,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03515625,
"rewards/margins": 0.376953125,
"rewards/rejected": -0.33984375,
"step": 257
},
{
"epoch": 0.6666666666666666,
"grad_norm": 415.87835693359375,
"learning_rate": 6.666666666666666e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.83984375,
"logps/chosen": -138.0,
"logps/rejected": -134.0,
"loss": 0.5995,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0030517578125,
"rewards/margins": 0.27734375,
"rewards/rejected": -0.275390625,
"step": 258
},
{
"epoch": 0.6692506459948321,
"grad_norm": 374.7701721191406,
"learning_rate": 6.614987080103359e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.85546875,
"logps/chosen": -142.0,
"logps/rejected": -133.0,
"loss": 0.602,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0186767578125,
"rewards/margins": 0.26171875,
"rewards/rejected": -0.28125,
"step": 259
},
{
"epoch": 0.6718346253229974,
"grad_norm": 357.5523376464844,
"learning_rate": 6.563307493540052e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.8515625,
"logps/chosen": -133.0,
"logps/rejected": -141.0,
"loss": 0.6002,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.00299072265625,
"rewards/margins": 0.2470703125,
"rewards/rejected": -0.244140625,
"step": 260
},
{
"epoch": 0.6744186046511628,
"grad_norm": 395.4364929199219,
"learning_rate": 6.511627906976745e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.84765625,
"logps/chosen": -129.0,
"logps/rejected": -144.0,
"loss": 0.6077,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.022705078125,
"rewards/margins": 0.26171875,
"rewards/rejected": -0.28515625,
"step": 261
},
{
"epoch": 0.6770025839793282,
"grad_norm": 397.8664855957031,
"learning_rate": 6.459948320413436e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.87109375,
"logps/chosen": -142.0,
"logps/rejected": -146.0,
"loss": 0.5885,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.07568359375,
"rewards/margins": 0.255859375,
"rewards/rejected": -0.33203125,
"step": 262
},
{
"epoch": 0.6795865633074936,
"grad_norm": 370.6977233886719,
"learning_rate": 6.408268733850128e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.85546875,
"logps/chosen": -140.0,
"logps/rejected": -135.0,
"loss": 0.567,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04052734375,
"rewards/margins": 0.353515625,
"rewards/rejected": -0.3125,
"step": 263
},
{
"epoch": 0.6821705426356589,
"grad_norm": 344.52294921875,
"learning_rate": 6.356589147286822e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.87109375,
"logps/chosen": -132.0,
"logps/rejected": -141.0,
"loss": 0.5358,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0093994140625,
"rewards/margins": 0.3984375,
"rewards/rejected": -0.408203125,
"step": 264
},
{
"epoch": 0.6847545219638242,
"grad_norm": 373.7255554199219,
"learning_rate": 6.304909560723514e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.8515625,
"logps/chosen": -132.0,
"logps/rejected": -150.0,
"loss": 0.536,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.02587890625,
"rewards/margins": 0.416015625,
"rewards/rejected": -0.390625,
"step": 265
},
{
"epoch": 0.6873385012919897,
"grad_norm": 365.46527099609375,
"learning_rate": 6.253229974160207e-07,
"logits/chosen": -0.91796875,
"logits/rejected": -0.90625,
"logps/chosen": -132.0,
"logps/rejected": -136.0,
"loss": 0.5803,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0203857421875,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.34375,
"step": 266
},
{
"epoch": 0.689922480620155,
"grad_norm": 371.0267028808594,
"learning_rate": 6.201550387596898e-07,
"logits/chosen": -0.8984375,
"logits/rejected": -0.87890625,
"logps/chosen": -145.0,
"logps/rejected": -140.0,
"loss": 0.5389,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0703125,
"rewards/margins": 0.40234375,
"rewards/rejected": -0.33203125,
"step": 267
},
{
"epoch": 0.6925064599483204,
"grad_norm": 391.9967041015625,
"learning_rate": 6.149870801033591e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.88671875,
"logps/chosen": -147.0,
"logps/rejected": -153.0,
"loss": 0.5749,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.000827789306640625,
"rewards/margins": 0.291015625,
"rewards/rejected": -0.2890625,
"step": 268
},
{
"epoch": 0.6950904392764858,
"grad_norm": 388.2448425292969,
"learning_rate": 6.098191214470284e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.859375,
"logps/chosen": -147.0,
"logps/rejected": -135.0,
"loss": 0.5569,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.032958984375,
"rewards/margins": 0.3828125,
"rewards/rejected": -0.349609375,
"step": 269
},
{
"epoch": 0.6976744186046512,
"grad_norm": 397.50323486328125,
"learning_rate": 6.046511627906976e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.87890625,
"logps/chosen": -138.0,
"logps/rejected": -138.0,
"loss": 0.5377,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.006988525390625,
"rewards/margins": 0.41015625,
"rewards/rejected": -0.40234375,
"step": 270
},
{
"epoch": 0.7002583979328165,
"grad_norm": 407.18768310546875,
"learning_rate": 5.99483204134367e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.84765625,
"logps/chosen": -149.0,
"logps/rejected": -136.0,
"loss": 0.5713,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0203857421875,
"rewards/margins": 0.328125,
"rewards/rejected": -0.30859375,
"step": 271
},
{
"epoch": 0.7028423772609819,
"grad_norm": 377.3880920410156,
"learning_rate": 5.943152454780362e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.8984375,
"logps/chosen": -148.0,
"logps/rejected": -143.0,
"loss": 0.5552,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.006256103515625,
"rewards/margins": 0.35546875,
"rewards/rejected": -0.349609375,
"step": 272
},
{
"epoch": 0.7054263565891473,
"grad_norm": 419.07037353515625,
"learning_rate": 5.891472868217054e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.859375,
"logps/chosen": -118.0,
"logps/rejected": -139.0,
"loss": 0.5958,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0311279296875,
"rewards/margins": 0.26953125,
"rewards/rejected": -0.30078125,
"step": 273
},
{
"epoch": 0.7080103359173127,
"grad_norm": 386.485107421875,
"learning_rate": 5.839793281653746e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.85546875,
"logps/chosen": -138.0,
"logps/rejected": -144.0,
"loss": 0.6083,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.039794921875,
"rewards/margins": 0.265625,
"rewards/rejected": -0.3046875,
"step": 274
},
{
"epoch": 0.710594315245478,
"grad_norm": 348.43505859375,
"learning_rate": 5.788113695090438e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.87890625,
"logps/chosen": -132.0,
"logps/rejected": -131.0,
"loss": 0.526,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.00482177734375,
"rewards/margins": 0.416015625,
"rewards/rejected": -0.41015625,
"step": 275
},
{
"epoch": 0.7131782945736435,
"grad_norm": 409.5932922363281,
"learning_rate": 5.736434108527132e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.875,
"logps/chosen": -136.0,
"logps/rejected": -137.0,
"loss": 0.5934,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.02734375,
"rewards/margins": 0.2451171875,
"rewards/rejected": -0.2734375,
"step": 276
},
{
"epoch": 0.7157622739018088,
"grad_norm": 368.6764831542969,
"learning_rate": 5.684754521963824e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.875,
"logps/chosen": -137.0,
"logps/rejected": -150.0,
"loss": 0.5712,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.05078125,
"rewards/margins": 0.333984375,
"rewards/rejected": -0.384765625,
"step": 277
},
{
"epoch": 0.7183462532299741,
"grad_norm": 401.7375793457031,
"learning_rate": 5.633074935400517e-07,
"logits/chosen": -0.88671875,
"logits/rejected": -0.8671875,
"logps/chosen": -142.0,
"logps/rejected": -147.0,
"loss": 0.5649,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0172119140625,
"rewards/margins": 0.35546875,
"rewards/rejected": -0.373046875,
"step": 278
},
{
"epoch": 0.7209302325581395,
"grad_norm": 378.2952575683594,
"learning_rate": 5.581395348837209e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.8515625,
"logps/chosen": -133.0,
"logps/rejected": -144.0,
"loss": 0.5991,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0257568359375,
"rewards/margins": 0.2373046875,
"rewards/rejected": -0.263671875,
"step": 279
},
{
"epoch": 0.7235142118863049,
"grad_norm": 413.5380554199219,
"learning_rate": 5.529715762273901e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.85546875,
"logps/chosen": -152.0,
"logps/rejected": -157.0,
"loss": 0.5965,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.039794921875,
"rewards/margins": 0.2734375,
"rewards/rejected": -0.3125,
"step": 280
},
{
"epoch": 0.7260981912144703,
"grad_norm": 363.4127197265625,
"learning_rate": 5.478036175710594e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.8515625,
"logps/chosen": -135.0,
"logps/rejected": -149.0,
"loss": 0.5662,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.010986328125,
"rewards/margins": 0.3203125,
"rewards/rejected": -0.33203125,
"step": 281
},
{
"epoch": 0.7286821705426356,
"grad_norm": 378.63299560546875,
"learning_rate": 5.426356589147286e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.8671875,
"logps/chosen": -147.0,
"logps/rejected": -123.0,
"loss": 0.5472,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07958984375,
"rewards/margins": 0.3984375,
"rewards/rejected": -0.318359375,
"step": 282
},
{
"epoch": 0.7312661498708011,
"grad_norm": 395.1712951660156,
"learning_rate": 5.37467700258398e-07,
"logits/chosen": -0.8984375,
"logits/rejected": -0.86328125,
"logps/chosen": -136.0,
"logps/rejected": -121.5,
"loss": 0.5435,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0225830078125,
"rewards/margins": 0.3984375,
"rewards/rejected": -0.421875,
"step": 283
},
{
"epoch": 0.7338501291989664,
"grad_norm": 358.454345703125,
"learning_rate": 5.322997416020672e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.83984375,
"logps/chosen": -120.0,
"logps/rejected": -139.0,
"loss": 0.5327,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.115234375,
"rewards/margins": 0.427734375,
"rewards/rejected": -0.3125,
"step": 284
},
{
"epoch": 0.7364341085271318,
"grad_norm": 393.966796875,
"learning_rate": 5.271317829457364e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.89453125,
"logps/chosen": -121.5,
"logps/rejected": -136.0,
"loss": 0.627,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.042236328125,
"rewards/margins": 0.1923828125,
"rewards/rejected": -0.234375,
"step": 285
},
{
"epoch": 0.7390180878552972,
"grad_norm": 376.2955322265625,
"learning_rate": 5.219638242894056e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.87890625,
"logps/chosen": -138.0,
"logps/rejected": -160.0,
"loss": 0.5792,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.04931640625,
"rewards/margins": 0.330078125,
"rewards/rejected": -0.37890625,
"step": 286
},
{
"epoch": 0.7416020671834626,
"grad_norm": 409.2053527832031,
"learning_rate": 5.167958656330749e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.85546875,
"logps/chosen": -118.0,
"logps/rejected": -136.0,
"loss": 0.6108,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.130859375,
"rewards/margins": 0.2197265625,
"rewards/rejected": -0.349609375,
"step": 287
},
{
"epoch": 0.7441860465116279,
"grad_norm": 364.067626953125,
"learning_rate": 5.116279069767442e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.8671875,
"logps/chosen": -142.0,
"logps/rejected": -144.0,
"loss": 0.5334,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.042236328125,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.33984375,
"step": 288
},
{
"epoch": 0.7467700258397932,
"grad_norm": 436.3753356933594,
"learning_rate": 5.064599483204134e-07,
"logits/chosen": -0.9140625,
"logits/rejected": -0.85546875,
"logps/chosen": -148.0,
"logps/rejected": -131.0,
"loss": 0.6072,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.051513671875,
"rewards/margins": 0.25,
"rewards/rejected": -0.30078125,
"step": 289
},
{
"epoch": 0.7493540051679587,
"grad_norm": 420.2207336425781,
"learning_rate": 5.012919896640828e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.8671875,
"logps/chosen": -151.0,
"logps/rejected": -146.0,
"loss": 0.608,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.01318359375,
"rewards/margins": 0.2578125,
"rewards/rejected": -0.271484375,
"step": 290
},
{
"epoch": 0.751937984496124,
"grad_norm": 378.3236083984375,
"learning_rate": 4.961240310077519e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.8125,
"logps/chosen": -129.0,
"logps/rejected": -142.0,
"loss": 0.5271,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.11279296875,
"rewards/margins": 0.423828125,
"rewards/rejected": -0.310546875,
"step": 291
},
{
"epoch": 0.7545219638242894,
"grad_norm": 374.6150817871094,
"learning_rate": 4.909560723514212e-07,
"logits/chosen": -0.91015625,
"logits/rejected": -0.8671875,
"logps/chosen": -136.0,
"logps/rejected": -138.0,
"loss": 0.5492,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.037353515625,
"rewards/margins": 0.373046875,
"rewards/rejected": -0.41015625,
"step": 292
},
{
"epoch": 0.7571059431524548,
"grad_norm": 349.1102600097656,
"learning_rate": 4.857881136950904e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.87890625,
"logps/chosen": -139.0,
"logps/rejected": -121.5,
"loss": 0.54,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.05615234375,
"rewards/margins": 0.392578125,
"rewards/rejected": -0.3359375,
"step": 293
},
{
"epoch": 0.7596899224806202,
"grad_norm": 400.560302734375,
"learning_rate": 4.806201550387597e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.85546875,
"logps/chosen": -143.0,
"logps/rejected": -141.0,
"loss": 0.5764,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0079345703125,
"rewards/margins": 0.33203125,
"rewards/rejected": -0.32421875,
"step": 294
},
{
"epoch": 0.7622739018087855,
"grad_norm": 341.3611145019531,
"learning_rate": 4.754521963824289e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.87109375,
"logps/chosen": -127.5,
"logps/rejected": -134.0,
"loss": 0.5256,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03271484375,
"rewards/margins": 0.44921875,
"rewards/rejected": -0.41796875,
"step": 295
},
{
"epoch": 0.7648578811369509,
"grad_norm": 345.73077392578125,
"learning_rate": 4.7028423772609815e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.875,
"logps/chosen": -120.0,
"logps/rejected": -141.0,
"loss": 0.5225,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.02587890625,
"rewards/margins": 0.43359375,
"rewards/rejected": -0.408203125,
"step": 296
},
{
"epoch": 0.7674418604651163,
"grad_norm": 404.53668212890625,
"learning_rate": 4.6511627906976743e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.8515625,
"logps/chosen": -132.0,
"logps/rejected": -141.0,
"loss": 0.5674,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.003082275390625,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.326171875,
"step": 297
},
{
"epoch": 0.7700258397932817,
"grad_norm": 378.0136413574219,
"learning_rate": 4.5994832041343666e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.86328125,
"logps/chosen": -133.0,
"logps/rejected": -139.0,
"loss": 0.5527,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09912109375,
"rewards/margins": 0.37109375,
"rewards/rejected": -0.470703125,
"step": 298
},
{
"epoch": 0.772609819121447,
"grad_norm": 425.3061828613281,
"learning_rate": 4.5478036175710593e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.88671875,
"logps/chosen": -144.0,
"logps/rejected": -141.0,
"loss": 0.5983,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.056396484375,
"rewards/margins": 0.275390625,
"rewards/rejected": -0.21875,
"step": 299
},
{
"epoch": 0.7751937984496124,
"grad_norm": 370.2434387207031,
"learning_rate": 4.496124031007752e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.8515625,
"logps/chosen": -133.0,
"logps/rejected": -121.5,
"loss": 0.5974,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0203857421875,
"rewards/margins": 0.259765625,
"rewards/rejected": -0.28125,
"step": 300
},
{
"epoch": 0.7777777777777778,
"grad_norm": 380.1609802246094,
"learning_rate": 4.444444444444444e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.88671875,
"logps/chosen": -126.0,
"logps/rejected": -143.0,
"loss": 0.523,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0732421875,
"rewards/margins": 0.439453125,
"rewards/rejected": -0.365234375,
"step": 301
},
{
"epoch": 0.7803617571059431,
"grad_norm": 399.3497009277344,
"learning_rate": 4.3927648578811366e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.8671875,
"logps/chosen": -142.0,
"logps/rejected": -146.0,
"loss": 0.5543,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.05078125,
"rewards/margins": 0.375,
"rewards/rejected": -0.326171875,
"step": 302
},
{
"epoch": 0.7829457364341085,
"grad_norm": 399.6018981933594,
"learning_rate": 4.3410852713178294e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.875,
"logps/chosen": -146.0,
"logps/rejected": -172.0,
"loss": 0.5702,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0203857421875,
"rewards/margins": 0.3125,
"rewards/rejected": -0.29296875,
"step": 303
},
{
"epoch": 0.7855297157622739,
"grad_norm": 421.47235107421875,
"learning_rate": 4.2894056847545216e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.84765625,
"logps/chosen": -142.0,
"logps/rejected": -137.0,
"loss": 0.5662,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0703125,
"rewards/margins": 0.33984375,
"rewards/rejected": -0.41015625,
"step": 304
},
{
"epoch": 0.7881136950904393,
"grad_norm": 387.08172607421875,
"learning_rate": 4.2377260981912144e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.875,
"logps/chosen": -147.0,
"logps/rejected": -136.0,
"loss": 0.5011,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03125,
"rewards/margins": 0.498046875,
"rewards/rejected": -0.466796875,
"step": 305
},
{
"epoch": 0.7906976744186046,
"grad_norm": 339.8193664550781,
"learning_rate": 4.186046511627907e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.859375,
"logps/chosen": -136.0,
"logps/rejected": -133.0,
"loss": 0.5362,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09375,
"rewards/margins": 0.39453125,
"rewards/rejected": -0.30078125,
"step": 306
},
{
"epoch": 0.7932816537467701,
"grad_norm": 378.47100830078125,
"learning_rate": 4.134366925064599e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.875,
"logps/chosen": -129.0,
"logps/rejected": -143.0,
"loss": 0.5189,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0054931640625,
"rewards/margins": 0.4921875,
"rewards/rejected": -0.48828125,
"step": 307
},
{
"epoch": 0.7958656330749354,
"grad_norm": 377.9639587402344,
"learning_rate": 4.0826873385012917e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.83203125,
"logps/chosen": -142.0,
"logps/rejected": -121.5,
"loss": 0.5417,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0869140625,
"rewards/margins": 0.44921875,
"rewards/rejected": -0.36328125,
"step": 308
},
{
"epoch": 0.7984496124031008,
"grad_norm": 389.46624755859375,
"learning_rate": 4.0310077519379845e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.875,
"logps/chosen": -147.0,
"logps/rejected": -128.0,
"loss": 0.5643,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.068359375,
"rewards/margins": 0.369140625,
"rewards/rejected": -0.30078125,
"step": 309
},
{
"epoch": 0.8010335917312662,
"grad_norm": 360.7492980957031,
"learning_rate": 3.9793281653746767e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.875,
"logps/chosen": -138.0,
"logps/rejected": -134.0,
"loss": 0.496,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1591796875,
"rewards/margins": 0.5234375,
"rewards/rejected": -0.365234375,
"step": 310
},
{
"epoch": 0.8036175710594315,
"grad_norm": 438.1676940917969,
"learning_rate": 3.9276485788113695e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.88671875,
"logps/chosen": -130.0,
"logps/rejected": -132.0,
"loss": 0.6559,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.1640625,
"rewards/margins": 0.1279296875,
"rewards/rejected": -0.29296875,
"step": 311
},
{
"epoch": 0.8062015503875969,
"grad_norm": 379.49896240234375,
"learning_rate": 3.8759689922480623e-07,
"logits/chosen": -0.88671875,
"logits/rejected": -0.890625,
"logps/chosen": -140.0,
"logps/rejected": -129.0,
"loss": 0.5618,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0279541015625,
"rewards/margins": 0.337890625,
"rewards/rejected": -0.3671875,
"step": 312
},
{
"epoch": 0.8087855297157622,
"grad_norm": 381.6045227050781,
"learning_rate": 3.824289405684754e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8359375,
"logps/chosen": -141.0,
"logps/rejected": -134.0,
"loss": 0.5596,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0079345703125,
"rewards/margins": 0.34375,
"rewards/rejected": -0.3359375,
"step": 313
},
{
"epoch": 0.8113695090439277,
"grad_norm": 407.3009948730469,
"learning_rate": 3.772609819121447e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.87890625,
"logps/chosen": -141.0,
"logps/rejected": -139.0,
"loss": 0.5457,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.034423828125,
"rewards/margins": 0.392578125,
"rewards/rejected": -0.357421875,
"step": 314
},
{
"epoch": 0.813953488372093,
"grad_norm": 379.11956787109375,
"learning_rate": 3.7209302325581396e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.8671875,
"logps/chosen": -127.0,
"logps/rejected": -145.0,
"loss": 0.5155,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.00311279296875,
"rewards/margins": 0.462890625,
"rewards/rejected": -0.458984375,
"step": 315
},
{
"epoch": 0.8165374677002584,
"grad_norm": 391.218017578125,
"learning_rate": 3.669250645994832e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.890625,
"logps/chosen": -125.0,
"logps/rejected": -142.0,
"loss": 0.552,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0390625,
"rewards/margins": 0.388671875,
"rewards/rejected": -0.427734375,
"step": 316
},
{
"epoch": 0.8191214470284238,
"grad_norm": 426.7617492675781,
"learning_rate": 3.6175710594315246e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.8828125,
"logps/chosen": -144.0,
"logps/rejected": -143.0,
"loss": 0.6192,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.0830078125,
"rewards/margins": 0.2158203125,
"rewards/rejected": -0.298828125,
"step": 317
},
{
"epoch": 0.8217054263565892,
"grad_norm": 414.6080627441406,
"learning_rate": 3.5658914728682174e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.87109375,
"logps/chosen": -132.0,
"logps/rejected": -144.0,
"loss": 0.5533,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.06884765625,
"rewards/margins": 0.396484375,
"rewards/rejected": -0.466796875,
"step": 318
},
{
"epoch": 0.8242894056847545,
"grad_norm": 379.4181823730469,
"learning_rate": 3.514211886304909e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.8828125,
"logps/chosen": -141.0,
"logps/rejected": -156.0,
"loss": 0.5718,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.00075531005859375,
"rewards/margins": 0.357421875,
"rewards/rejected": -0.357421875,
"step": 319
},
{
"epoch": 0.8268733850129198,
"grad_norm": 407.3499755859375,
"learning_rate": 3.462532299741602e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.84375,
"logps/chosen": -147.0,
"logps/rejected": -140.0,
"loss": 0.5623,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0228271484375,
"rewards/margins": 0.349609375,
"rewards/rejected": -0.328125,
"step": 320
},
{
"epoch": 0.8294573643410853,
"grad_norm": 381.62030029296875,
"learning_rate": 3.4108527131782946e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.875,
"logps/chosen": -137.0,
"logps/rejected": -148.0,
"loss": 0.5624,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0849609375,
"rewards/margins": 0.341796875,
"rewards/rejected": -0.42578125,
"step": 321
},
{
"epoch": 0.8320413436692506,
"grad_norm": 403.3800964355469,
"learning_rate": 3.359173126614987e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.859375,
"logps/chosen": -142.0,
"logps/rejected": -145.0,
"loss": 0.5454,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.004730224609375,
"rewards/margins": 0.388671875,
"rewards/rejected": -0.392578125,
"step": 322
},
{
"epoch": 0.834625322997416,
"grad_norm": 373.6676025390625,
"learning_rate": 3.3074935400516797e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.86328125,
"logps/chosen": -134.0,
"logps/rejected": -132.0,
"loss": 0.5639,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.03125,
"rewards/margins": 0.36328125,
"rewards/rejected": -0.39453125,
"step": 323
},
{
"epoch": 0.8372093023255814,
"grad_norm": 407.47747802734375,
"learning_rate": 3.2558139534883724e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.8515625,
"logps/chosen": -124.0,
"logps/rejected": -130.0,
"loss": 0.5892,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0478515625,
"rewards/margins": 0.29296875,
"rewards/rejected": -0.33984375,
"step": 324
},
{
"epoch": 0.8397932816537468,
"grad_norm": 364.1658935546875,
"learning_rate": 3.204134366925064e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.828125,
"logps/chosen": -148.0,
"logps/rejected": -147.0,
"loss": 0.5142,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08447265625,
"rewards/margins": 0.474609375,
"rewards/rejected": -0.390625,
"step": 325
},
{
"epoch": 0.8423772609819121,
"grad_norm": 362.48040771484375,
"learning_rate": 3.152454780361757e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.875,
"logps/chosen": -137.0,
"logps/rejected": -141.0,
"loss": 0.5242,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.04150390625,
"rewards/margins": 0.447265625,
"rewards/rejected": -0.40625,
"step": 326
},
{
"epoch": 0.8449612403100775,
"grad_norm": 412.084716796875,
"learning_rate": 3.100775193798449e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.8984375,
"logps/chosen": -154.0,
"logps/rejected": -140.0,
"loss": 0.5799,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.03125,
"rewards/margins": 0.310546875,
"rewards/rejected": -0.27734375,
"step": 327
},
{
"epoch": 0.8475452196382429,
"grad_norm": 386.69219970703125,
"learning_rate": 3.049095607235142e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.89453125,
"logps/chosen": -139.0,
"logps/rejected": -148.0,
"loss": 0.5845,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.02734375,
"rewards/margins": 0.30859375,
"rewards/rejected": -0.3359375,
"step": 328
},
{
"epoch": 0.8501291989664083,
"grad_norm": 377.74664306640625,
"learning_rate": 2.997416020671835e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.84375,
"logps/chosen": -152.0,
"logps/rejected": -135.0,
"loss": 0.5349,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0732421875,
"rewards/margins": 0.416015625,
"rewards/rejected": -0.341796875,
"step": 329
},
{
"epoch": 0.8527131782945736,
"grad_norm": 392.24786376953125,
"learning_rate": 2.945736434108527e-07,
"logits/chosen": -0.88671875,
"logits/rejected": -0.890625,
"logps/chosen": -126.0,
"logps/rejected": -148.0,
"loss": 0.5776,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.09765625,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.376953125,
"step": 330
},
{
"epoch": 0.8552971576227391,
"grad_norm": 339.7447204589844,
"learning_rate": 2.894056847545219e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.875,
"logps/chosen": -132.0,
"logps/rejected": -137.0,
"loss": 0.5315,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.056884765625,
"rewards/margins": 0.43359375,
"rewards/rejected": -0.376953125,
"step": 331
},
{
"epoch": 0.8578811369509044,
"grad_norm": 377.9252624511719,
"learning_rate": 2.842377260981912e-07,
"logits/chosen": -0.91796875,
"logits/rejected": -0.875,
"logps/chosen": -152.0,
"logps/rejected": -150.0,
"loss": 0.4913,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.040771484375,
"rewards/margins": 0.49609375,
"rewards/rejected": -0.455078125,
"step": 332
},
{
"epoch": 0.8604651162790697,
"grad_norm": 396.7610778808594,
"learning_rate": 2.7906976744186043e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.86328125,
"logps/chosen": -141.0,
"logps/rejected": -145.0,
"loss": 0.5567,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.12060546875,
"rewards/margins": 0.41015625,
"rewards/rejected": -0.2890625,
"step": 333
},
{
"epoch": 0.8630490956072352,
"grad_norm": 367.93438720703125,
"learning_rate": 2.739018087855297e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.84765625,
"logps/chosen": -126.0,
"logps/rejected": -128.0,
"loss": 0.5735,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0296630859375,
"rewards/margins": 0.34765625,
"rewards/rejected": -0.318359375,
"step": 334
},
{
"epoch": 0.8656330749354005,
"grad_norm": 338.41644287109375,
"learning_rate": 2.68733850129199e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.84765625,
"logps/chosen": -131.0,
"logps/rejected": -122.5,
"loss": 0.5182,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.05078125,
"rewards/margins": 0.46484375,
"rewards/rejected": -0.4140625,
"step": 335
},
{
"epoch": 0.8682170542635659,
"grad_norm": 420.8653869628906,
"learning_rate": 2.635658914728682e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.89453125,
"logps/chosen": -127.0,
"logps/rejected": -121.0,
"loss": 0.6331,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.140625,
"rewards/margins": 0.1943359375,
"rewards/rejected": -0.3359375,
"step": 336
},
{
"epoch": 0.8708010335917312,
"grad_norm": 418.4413757324219,
"learning_rate": 2.5839793281653743e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.85546875,
"logps/chosen": -125.5,
"logps/rejected": -117.5,
"loss": 0.5797,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.046875,
"rewards/margins": 0.296875,
"rewards/rejected": -0.34375,
"step": 337
},
{
"epoch": 0.8733850129198967,
"grad_norm": 389.128662109375,
"learning_rate": 2.532299741602067e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.85546875,
"logps/chosen": -138.0,
"logps/rejected": -142.0,
"loss": 0.5772,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.042236328125,
"rewards/margins": 0.333984375,
"rewards/rejected": -0.375,
"step": 338
},
{
"epoch": 0.875968992248062,
"grad_norm": 380.782470703125,
"learning_rate": 2.4806201550387593e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.84375,
"logps/chosen": -145.0,
"logps/rejected": -145.0,
"loss": 0.5589,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05322265625,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.328125,
"step": 339
},
{
"epoch": 0.8785529715762274,
"grad_norm": 371.532958984375,
"learning_rate": 2.428940568475452e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.87890625,
"logps/chosen": -132.0,
"logps/rejected": -153.0,
"loss": 0.5039,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0203857421875,
"rewards/margins": 0.515625,
"rewards/rejected": -0.49609375,
"step": 340
},
{
"epoch": 0.8811369509043928,
"grad_norm": 376.73736572265625,
"learning_rate": 2.3772609819121444e-07,
"logits/chosen": -0.921875,
"logits/rejected": -0.87890625,
"logps/chosen": -139.0,
"logps/rejected": -132.0,
"loss": 0.5676,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0101318359375,
"rewards/margins": 0.30859375,
"rewards/rejected": -0.298828125,
"step": 341
},
{
"epoch": 0.8837209302325582,
"grad_norm": 366.2059020996094,
"learning_rate": 2.3255813953488372e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.8828125,
"logps/chosen": -134.0,
"logps/rejected": -133.0,
"loss": 0.523,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0203857421875,
"rewards/margins": 0.4375,
"rewards/rejected": -0.416015625,
"step": 342
},
{
"epoch": 0.8863049095607235,
"grad_norm": 467.3062744140625,
"learning_rate": 2.2739018087855297e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.84375,
"logps/chosen": -123.0,
"logps/rejected": -147.0,
"loss": 0.6332,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1748046875,
"rewards/margins": 0.15625,
"rewards/rejected": -0.33203125,
"step": 343
},
{
"epoch": 0.8888888888888888,
"grad_norm": 400.25677490234375,
"learning_rate": 2.222222222222222e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.8671875,
"logps/chosen": -135.0,
"logps/rejected": -129.0,
"loss": 0.5532,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.01239013671875,
"rewards/margins": 0.349609375,
"rewards/rejected": -0.337890625,
"step": 344
},
{
"epoch": 0.8914728682170543,
"grad_norm": 393.77587890625,
"learning_rate": 2.1705426356589147e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.87890625,
"logps/chosen": -130.0,
"logps/rejected": -136.0,
"loss": 0.567,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.040771484375,
"rewards/margins": 0.330078125,
"rewards/rejected": -0.37109375,
"step": 345
},
{
"epoch": 0.8940568475452196,
"grad_norm": 416.1154479980469,
"learning_rate": 2.1188630490956072e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.890625,
"logps/chosen": -126.5,
"logps/rejected": -140.0,
"loss": 0.5573,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.064453125,
"rewards/margins": 0.353515625,
"rewards/rejected": -0.41796875,
"step": 346
},
{
"epoch": 0.896640826873385,
"grad_norm": 406.4513244628906,
"learning_rate": 2.0671834625322995e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.8359375,
"logps/chosen": -144.0,
"logps/rejected": -146.0,
"loss": 0.5757,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.06884765625,
"rewards/margins": 0.3125,
"rewards/rejected": -0.380859375,
"step": 347
},
{
"epoch": 0.8992248062015504,
"grad_norm": 366.8443908691406,
"learning_rate": 2.0155038759689922e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.859375,
"logps/chosen": -122.0,
"logps/rejected": -139.0,
"loss": 0.511,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.006927490234375,
"rewards/margins": 0.498046875,
"rewards/rejected": -0.50390625,
"step": 348
},
{
"epoch": 0.9018087855297158,
"grad_norm": 379.0568542480469,
"learning_rate": 1.9638242894056847e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.859375,
"logps/chosen": -138.0,
"logps/rejected": -148.0,
"loss": 0.5513,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0244140625,
"rewards/margins": 0.369140625,
"rewards/rejected": -0.392578125,
"step": 349
},
{
"epoch": 0.9043927648578811,
"grad_norm": 404.06915283203125,
"learning_rate": 1.912144702842377e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.87109375,
"logps/chosen": -125.5,
"logps/rejected": -136.0,
"loss": 0.5874,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.04833984375,
"rewards/margins": 0.283203125,
"rewards/rejected": -0.33203125,
"step": 350
},
{
"epoch": 0.9069767441860465,
"grad_norm": 407.20172119140625,
"learning_rate": 1.8604651162790698e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.8671875,
"logps/chosen": -120.5,
"logps/rejected": -144.0,
"loss": 0.5469,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0537109375,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.326171875,
"step": 351
},
{
"epoch": 0.9095607235142119,
"grad_norm": 367.9174499511719,
"learning_rate": 1.8087855297157623e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.875,
"logps/chosen": -151.0,
"logps/rejected": -143.0,
"loss": 0.5195,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0186767578125,
"rewards/margins": 0.431640625,
"rewards/rejected": -0.451171875,
"step": 352
},
{
"epoch": 0.9121447028423773,
"grad_norm": 337.8936462402344,
"learning_rate": 1.7571059431524545e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.8515625,
"logps/chosen": -124.5,
"logps/rejected": -124.5,
"loss": 0.5336,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0712890625,
"rewards/margins": 0.41015625,
"rewards/rejected": -0.33984375,
"step": 353
},
{
"epoch": 0.9147286821705426,
"grad_norm": 359.1859436035156,
"learning_rate": 1.7054263565891473e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.85546875,
"logps/chosen": -134.0,
"logps/rejected": -135.0,
"loss": 0.5594,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03369140625,
"rewards/margins": 0.37890625,
"rewards/rejected": -0.34375,
"step": 354
},
{
"epoch": 0.917312661498708,
"grad_norm": 379.411865234375,
"learning_rate": 1.6537467700258398e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.86328125,
"logps/chosen": -132.0,
"logps/rejected": -162.0,
"loss": 0.4905,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0859375,
"rewards/margins": 0.5390625,
"rewards/rejected": -0.451171875,
"step": 355
},
{
"epoch": 0.9198966408268734,
"grad_norm": 424.71099853515625,
"learning_rate": 1.602067183462532e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.89453125,
"logps/chosen": -135.0,
"logps/rejected": -139.0,
"loss": 0.5555,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.03369140625,
"rewards/margins": 0.349609375,
"rewards/rejected": -0.3828125,
"step": 356
},
{
"epoch": 0.9224806201550387,
"grad_norm": 378.3841857910156,
"learning_rate": 1.5503875968992246e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.83984375,
"logps/chosen": -134.0,
"logps/rejected": -134.0,
"loss": 0.588,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.08447265625,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.36328125,
"step": 357
},
{
"epoch": 0.9250645994832042,
"grad_norm": 407.63934326171875,
"learning_rate": 1.4987080103359174e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.859375,
"logps/chosen": -141.0,
"logps/rejected": -121.0,
"loss": 0.5896,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.07470703125,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.353515625,
"step": 358
},
{
"epoch": 0.9276485788113695,
"grad_norm": 324.2749328613281,
"learning_rate": 1.4470284237726096e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.890625,
"logps/chosen": -127.0,
"logps/rejected": -120.5,
"loss": 0.5383,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.10302734375,
"rewards/margins": 0.43359375,
"rewards/rejected": -0.53515625,
"step": 359
},
{
"epoch": 0.9302325581395349,
"grad_norm": 368.79931640625,
"learning_rate": 1.3953488372093021e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.87890625,
"logps/chosen": -143.0,
"logps/rejected": -137.0,
"loss": 0.5193,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0162353515625,
"rewards/margins": 0.462890625,
"rewards/rejected": -0.478515625,
"step": 360
},
{
"epoch": 0.9328165374677002,
"grad_norm": 451.83233642578125,
"learning_rate": 1.343669250645995e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.88671875,
"logps/chosen": -136.0,
"logps/rejected": -165.0,
"loss": 0.5992,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0235595703125,
"rewards/margins": 0.3203125,
"rewards/rejected": -0.298828125,
"step": 361
},
{
"epoch": 0.9354005167958657,
"grad_norm": 417.2298583984375,
"learning_rate": 1.2919896640826872e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.86328125,
"logps/chosen": -154.0,
"logps/rejected": -135.0,
"loss": 0.5792,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0218505859375,
"rewards/margins": 0.310546875,
"rewards/rejected": -0.33203125,
"step": 362
},
{
"epoch": 0.937984496124031,
"grad_norm": 378.72222900390625,
"learning_rate": 1.2403100775193797e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.86328125,
"logps/chosen": -156.0,
"logps/rejected": -147.0,
"loss": 0.5247,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.078125,
"rewards/margins": 0.451171875,
"rewards/rejected": -0.373046875,
"step": 363
},
{
"epoch": 0.9405684754521964,
"grad_norm": 347.5020751953125,
"learning_rate": 1.1886304909560722e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.87890625,
"logps/chosen": -137.0,
"logps/rejected": -168.0,
"loss": 0.4286,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1181640625,
"rewards/margins": 0.7109375,
"rewards/rejected": -0.58984375,
"step": 364
},
{
"epoch": 0.9431524547803618,
"grad_norm": 357.3157043457031,
"learning_rate": 1.1369509043927648e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.87109375,
"logps/chosen": -134.0,
"logps/rejected": -128.0,
"loss": 0.4937,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.026611328125,
"rewards/margins": 0.49609375,
"rewards/rejected": -0.46875,
"step": 365
},
{
"epoch": 0.9457364341085271,
"grad_norm": 383.900390625,
"learning_rate": 1.0852713178294573e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.90625,
"logps/chosen": -143.0,
"logps/rejected": -153.0,
"loss": 0.4791,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0024566650390625,
"rewards/margins": 0.578125,
"rewards/rejected": -0.57421875,
"step": 366
},
{
"epoch": 0.9483204134366925,
"grad_norm": 399.00592041015625,
"learning_rate": 1.0335917312661497e-07,
"logits/chosen": -0.90234375,
"logits/rejected": -0.86328125,
"logps/chosen": -147.0,
"logps/rejected": -144.0,
"loss": 0.6084,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.09765625,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.376953125,
"step": 367
},
{
"epoch": 0.9509043927648578,
"grad_norm": 371.8937683105469,
"learning_rate": 9.819121447028424e-08,
"logits/chosen": -0.89453125,
"logits/rejected": -0.87890625,
"logps/chosen": -138.0,
"logps/rejected": -140.0,
"loss": 0.551,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.024169921875,
"rewards/margins": 0.375,
"rewards/rejected": -0.349609375,
"step": 368
},
{
"epoch": 0.9534883720930233,
"grad_norm": 375.73895263671875,
"learning_rate": 9.302325581395349e-08,
"logits/chosen": -0.875,
"logits/rejected": -0.84375,
"logps/chosen": -148.0,
"logps/rejected": -137.0,
"loss": 0.5354,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.003814697265625,
"rewards/margins": 0.404296875,
"rewards/rejected": -0.400390625,
"step": 369
},
{
"epoch": 0.9560723514211886,
"grad_norm": 477.898193359375,
"learning_rate": 8.785529715762273e-08,
"logits/chosen": -0.8125,
"logits/rejected": -0.83203125,
"logps/chosen": -118.0,
"logps/rejected": -147.0,
"loss": 0.5193,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09716796875,
"rewards/margins": 0.443359375,
"rewards/rejected": -0.345703125,
"step": 370
},
{
"epoch": 0.958656330749354,
"grad_norm": 379.3886413574219,
"learning_rate": 8.268733850129199e-08,
"logits/chosen": -0.890625,
"logits/rejected": -0.83984375,
"logps/chosen": -139.0,
"logps/rejected": -142.0,
"loss": 0.571,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.05224609375,
"rewards/margins": 0.373046875,
"rewards/rejected": -0.423828125,
"step": 371
},
{
"epoch": 0.9612403100775194,
"grad_norm": 385.4183654785156,
"learning_rate": 7.751937984496123e-08,
"logits/chosen": -0.87890625,
"logits/rejected": -0.859375,
"logps/chosen": -143.0,
"logps/rejected": -137.0,
"loss": 0.514,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0517578125,
"rewards/margins": 0.4609375,
"rewards/rejected": -0.51171875,
"step": 372
},
{
"epoch": 0.9638242894056848,
"grad_norm": 369.193115234375,
"learning_rate": 7.235142118863048e-08,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8515625,
"logps/chosen": -122.5,
"logps/rejected": -171.0,
"loss": 0.5537,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.010986328125,
"rewards/margins": 0.36328125,
"rewards/rejected": -0.3515625,
"step": 373
},
{
"epoch": 0.9664082687338501,
"grad_norm": 349.1363830566406,
"learning_rate": 6.718346253229975e-08,
"logits/chosen": -0.83203125,
"logits/rejected": -0.82421875,
"logps/chosen": -135.0,
"logps/rejected": -128.0,
"loss": 0.4849,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0869140625,
"rewards/margins": 0.5390625,
"rewards/rejected": -0.451171875,
"step": 374
},
{
"epoch": 0.9689922480620154,
"grad_norm": 421.71875,
"learning_rate": 6.201550387596898e-08,
"logits/chosen": -0.83984375,
"logits/rejected": -0.8671875,
"logps/chosen": -123.0,
"logps/rejected": -152.0,
"loss": 0.6088,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.046142578125,
"rewards/margins": 0.2333984375,
"rewards/rejected": -0.279296875,
"step": 375
},
{
"epoch": 0.9715762273901809,
"grad_norm": 405.0057373046875,
"learning_rate": 5.684754521963824e-08,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8359375,
"logps/chosen": -142.0,
"logps/rejected": -139.0,
"loss": 0.5885,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0986328125,
"rewards/margins": 0.275390625,
"rewards/rejected": -0.375,
"step": 376
},
{
"epoch": 0.9741602067183462,
"grad_norm": 392.13677978515625,
"learning_rate": 5.1679586563307486e-08,
"logits/chosen": -0.890625,
"logits/rejected": -0.88671875,
"logps/chosen": -154.0,
"logps/rejected": -155.0,
"loss": 0.5356,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.035888671875,
"rewards/margins": 0.40234375,
"rewards/rejected": -0.4375,
"step": 377
},
{
"epoch": 0.9767441860465116,
"grad_norm": 395.9448547363281,
"learning_rate": 4.6511627906976744e-08,
"logits/chosen": -0.86328125,
"logits/rejected": -0.83984375,
"logps/chosen": -157.0,
"logps/rejected": -137.0,
"loss": 0.597,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0830078125,
"rewards/margins": 0.29296875,
"rewards/rejected": -0.375,
"step": 378
},
{
"epoch": 0.979328165374677,
"grad_norm": 467.2771301269531,
"learning_rate": 4.1343669250645996e-08,
"logits/chosen": -0.859375,
"logits/rejected": -0.86328125,
"logps/chosen": -134.0,
"logps/rejected": -154.0,
"loss": 0.6342,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.11083984375,
"rewards/margins": 0.2294921875,
"rewards/rejected": -0.33984375,
"step": 379
},
{
"epoch": 0.9819121447028424,
"grad_norm": 372.8404235839844,
"learning_rate": 3.617571059431524e-08,
"logits/chosen": -0.87109375,
"logits/rejected": -0.890625,
"logps/chosen": -142.0,
"logps/rejected": -142.0,
"loss": 0.4995,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.11181640625,
"rewards/margins": 0.498046875,
"rewards/rejected": -0.384765625,
"step": 380
},
{
"epoch": 0.9844961240310077,
"grad_norm": 363.5488586425781,
"learning_rate": 3.100775193798449e-08,
"logits/chosen": -0.83203125,
"logits/rejected": -0.875,
"logps/chosen": -155.0,
"logps/rejected": -158.0,
"loss": 0.5378,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07763671875,
"rewards/margins": 0.443359375,
"rewards/rejected": -0.3671875,
"step": 381
},
{
"epoch": 0.9870801033591732,
"grad_norm": 368.29443359375,
"learning_rate": 2.5839793281653743e-08,
"logits/chosen": -0.89453125,
"logits/rejected": -0.87890625,
"logps/chosen": -150.0,
"logps/rejected": -142.0,
"loss": 0.5362,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.10546875,
"rewards/margins": 0.427734375,
"rewards/rejected": -0.53515625,
"step": 382
},
{
"epoch": 0.9896640826873385,
"grad_norm": 398.1756896972656,
"learning_rate": 2.0671834625322998e-08,
"logits/chosen": -0.83203125,
"logits/rejected": -0.84375,
"logps/chosen": -123.0,
"logps/rejected": -138.0,
"loss": 0.5559,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09130859375,
"rewards/margins": 0.369140625,
"rewards/rejected": -0.27734375,
"step": 383
},
{
"epoch": 0.9922480620155039,
"grad_norm": 347.91717529296875,
"learning_rate": 1.5503875968992246e-08,
"logits/chosen": -0.8828125,
"logits/rejected": -0.87109375,
"logps/chosen": -132.0,
"logps/rejected": -137.0,
"loss": 0.5034,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.01153564453125,
"rewards/margins": 0.4765625,
"rewards/rejected": -0.46484375,
"step": 384
},
{
"epoch": 0.9948320413436692,
"grad_norm": 362.68157958984375,
"learning_rate": 1.0335917312661499e-08,
"logits/chosen": -0.859375,
"logits/rejected": -0.85546875,
"logps/chosen": -129.0,
"logps/rejected": -137.0,
"loss": 0.5386,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0303955078125,
"rewards/margins": 0.400390625,
"rewards/rejected": -0.369140625,
"step": 385
},
{
"epoch": 0.9974160206718347,
"grad_norm": 347.4972229003906,
"learning_rate": 5.1679586563307495e-09,
"logits/chosen": -0.875,
"logits/rejected": -0.87109375,
"logps/chosen": -135.0,
"logps/rejected": -136.0,
"loss": 0.4995,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.02197265625,
"rewards/margins": 0.5078125,
"rewards/rejected": -0.53125,
"step": 386
},
{
"epoch": 1.0,
"grad_norm": 349.7977600097656,
"learning_rate": 0.0,
"logits/chosen": -0.87109375,
"logits/rejected": -0.89453125,
"logps/chosen": -141.0,
"logps/rejected": -136.0,
"loss": 0.5355,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0830078125,
"rewards/margins": 0.42578125,
"rewards/rejected": -0.5078125,
"step": 387
}
],
"logging_steps": 1,
"max_steps": 387,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}