{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 387, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002583979328165375, "grad_norm": 338.2884826660156, "learning_rate": 1.9948320413436692e-06, "logits/chosen": -0.734375, "logits/rejected": -0.7265625, "logps/chosen": -133.0, "logps/rejected": -119.0, "loss": 0.6914, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.00516795865633075, "grad_norm": 304.6211242675781, "learning_rate": 1.989664082687338e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.7421875, "logps/chosen": -144.0, "logps/rejected": -126.5, "loss": 0.6891, "rewards/accuracies": 0.40625, "rewards/chosen": 0.00156402587890625, "rewards/margins": 0.007049560546875, "rewards/rejected": -0.005462646484375, "step": 2 }, { "epoch": 0.007751937984496124, "grad_norm": 301.52911376953125, "learning_rate": 1.9844961240310075e-06, "logits/chosen": -0.734375, "logits/rejected": -0.7421875, "logps/chosen": -133.0, "logps/rejected": -134.0, "loss": 0.694, "rewards/accuracies": 0.375, "rewards/chosen": -0.000782012939453125, "rewards/margins": 0.006256103515625, "rewards/rejected": -0.007049560546875, "step": 3 }, { "epoch": 0.0103359173126615, "grad_norm": 294.886962890625, "learning_rate": 1.979328165374677e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.72265625, "logps/chosen": -130.0, "logps/rejected": -115.0, "loss": 0.7021, "rewards/accuracies": 0.375, "rewards/chosen": -0.0164794921875, "rewards/margins": -0.0133056640625, "rewards/rejected": -0.0031280517578125, "step": 4 }, { "epoch": 0.012919896640826873, "grad_norm": 300.3182067871094, "learning_rate": 1.974160206718346e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.77734375, "logps/chosen": -125.0, "logps/rejected": -127.5, "loss": 0.6931, "rewards/accuracies": 0.34375, "rewards/chosen": -0.00390625, "rewards/margins": -7.62939453125e-06, "rewards/rejected": -0.00390625, "step": 5 }, { "epoch": 0.015503875968992248, "grad_norm": 331.87506103515625, "learning_rate": 1.9689922480620155e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.74609375, "logps/chosen": -152.0, "logps/rejected": -145.0, "loss": 0.6958, "rewards/accuracies": 0.4375, "rewards/chosen": -0.026611328125, "rewards/margins": -0.00390625, "rewards/rejected": -0.022705078125, "step": 6 }, { "epoch": 0.01808785529715762, "grad_norm": 289.2641296386719, "learning_rate": 1.963824289405685e-06, "logits/chosen": -0.703125, "logits/rejected": -0.73828125, "logps/chosen": -121.5, "logps/rejected": -134.0, "loss": 0.6771, "rewards/accuracies": 0.59375, "rewards/chosen": 0.001556396484375, "rewards/margins": 0.035888671875, "rewards/rejected": -0.034423828125, "step": 7 }, { "epoch": 0.020671834625323, "grad_norm": 313.3421325683594, "learning_rate": 1.958656330749354e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.73828125, "logps/chosen": -124.5, "logps/rejected": -130.0, "loss": 0.6836, "rewards/accuracies": 0.5625, "rewards/chosen": -0.0093994140625, "rewards/margins": 0.0179443359375, "rewards/rejected": -0.02734375, "step": 8 }, { "epoch": 0.023255813953488372, "grad_norm": 316.9752502441406, "learning_rate": 1.953488372093023e-06, "logits/chosen": -0.703125, "logits/rejected": -0.7421875, "logps/chosen": -124.0, "logps/rejected": -139.0, "loss": 0.6954, "rewards/accuracies": 0.28125, "rewards/chosen": -0.01251220703125, "rewards/margins": -0.00078582763671875, "rewards/rejected": -0.01171875, "step": 9 }, { "epoch": 0.025839793281653745, "grad_norm": 302.2852478027344, "learning_rate": 1.9483204134366924e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.73828125, "logps/chosen": -121.5, "logps/rejected": -136.0, "loss": 0.6868, "rewards/accuracies": 0.46875, "rewards/chosen": -0.00390625, "rewards/margins": 0.015625, "rewards/rejected": -0.01953125, "step": 10 }, { "epoch": 0.028423772609819122, "grad_norm": 322.8475341796875, "learning_rate": 1.9431524547803617e-06, "logits/chosen": -0.6875, "logits/rejected": -0.70703125, "logps/chosen": -127.0, "logps/rejected": -124.5, "loss": 0.6805, "rewards/accuracies": 0.5, "rewards/chosen": 0.000782012939453125, "rewards/margins": 0.02734375, "rewards/rejected": -0.026611328125, "step": 11 }, { "epoch": 0.031007751937984496, "grad_norm": 342.7738342285156, "learning_rate": 1.9379844961240306e-06, "logits/chosen": -0.796875, "logits/rejected": -0.78515625, "logps/chosen": -156.0, "logps/rejected": -137.0, "loss": 0.7083, "rewards/accuracies": 0.25, "rewards/chosen": -0.03515625, "rewards/margins": -0.0242919921875, "rewards/rejected": -0.01092529296875, "step": 12 }, { "epoch": 0.03359173126614987, "grad_norm": 317.3365783691406, "learning_rate": 1.9328165374677e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.74609375, "logps/chosen": -147.0, "logps/rejected": -116.5, "loss": 0.7069, "rewards/accuracies": 0.34375, "rewards/chosen": -0.0289306640625, "rewards/margins": -0.015625, "rewards/rejected": -0.0133056640625, "step": 13 }, { "epoch": 0.03617571059431524, "grad_norm": 317.24713134765625, "learning_rate": 1.9276485788113693e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.734375, "logps/chosen": -127.0, "logps/rejected": -140.0, "loss": 0.694, "rewards/accuracies": 0.34375, "rewards/chosen": -0.0172119140625, "rewards/margins": -0.00154876708984375, "rewards/rejected": -0.015625, "step": 14 }, { "epoch": 0.03875968992248062, "grad_norm": 313.6627502441406, "learning_rate": 1.9224806201550386e-06, "logits/chosen": -0.78125, "logits/rejected": -0.76953125, "logps/chosen": -166.0, "logps/rejected": -132.0, "loss": 0.6729, "rewards/accuracies": 0.46875, "rewards/chosen": 0.0172119140625, "rewards/margins": 0.044677734375, "rewards/rejected": -0.02734375, "step": 15 }, { "epoch": 0.041343669250646, "grad_norm": 319.21343994140625, "learning_rate": 1.917312661498708e-06, "logits/chosen": -0.7109375, "logits/rejected": -0.73046875, "logps/chosen": -130.0, "logps/rejected": -143.0, "loss": 0.6761, "rewards/accuracies": 0.46875, "rewards/chosen": -0.000782012939453125, "rewards/margins": 0.03515625, "rewards/rejected": -0.035888671875, "step": 16 }, { "epoch": 0.04392764857881137, "grad_norm": 296.3052978515625, "learning_rate": 1.9121447028423773e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.734375, "logps/chosen": -133.0, "logps/rejected": -120.0, "loss": 0.6858, "rewards/accuracies": 0.4375, "rewards/chosen": -0.01953125, "rewards/margins": 0.014892578125, "rewards/rejected": -0.034423828125, "step": 17 }, { "epoch": 0.046511627906976744, "grad_norm": 312.5535583496094, "learning_rate": 1.9069767441860464e-06, "logits/chosen": -0.734375, "logits/rejected": -0.7578125, "logps/chosen": -139.0, "logps/rejected": -138.0, "loss": 0.6709, "rewards/accuracies": 0.5625, "rewards/chosen": -0.00469970703125, "rewards/margins": 0.047607421875, "rewards/rejected": -0.052490234375, "step": 18 }, { "epoch": 0.04909560723514212, "grad_norm": 316.44586181640625, "learning_rate": 1.9018087855297155e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.73046875, "logps/chosen": -133.0, "logps/rejected": -139.0, "loss": 0.658, "rewards/accuracies": 0.625, "rewards/chosen": 0.026611328125, "rewards/margins": 0.078125, "rewards/rejected": -0.051513671875, "step": 19 }, { "epoch": 0.05167958656330749, "grad_norm": 335.7342834472656, "learning_rate": 1.8966408268733848e-06, "logits/chosen": -0.734375, "logits/rejected": -0.703125, "logps/chosen": -121.5, "logps/rejected": -134.0, "loss": 0.6833, "rewards/accuracies": 0.5, "rewards/chosen": -0.0093994140625, "rewards/margins": 0.0211181640625, "rewards/rejected": -0.030517578125, "step": 20 }, { "epoch": 0.05426356589147287, "grad_norm": 295.4714660644531, "learning_rate": 1.8914728682170542e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.78125, "logps/chosen": -142.0, "logps/rejected": -133.0, "loss": 0.6769, "rewards/accuracies": 0.5, "rewards/chosen": 0.0015716552734375, "rewards/margins": 0.036865234375, "rewards/rejected": -0.03515625, "step": 21 }, { "epoch": 0.056847545219638244, "grad_norm": 331.2699279785156, "learning_rate": 1.8863049095607235e-06, "logits/chosen": -0.75, "logits/rejected": -0.734375, "logps/chosen": -143.0, "logps/rejected": -139.0, "loss": 0.6814, "rewards/accuracies": 0.46875, "rewards/chosen": 0.015625, "rewards/margins": 0.02734375, "rewards/rejected": -0.01171875, "step": 22 }, { "epoch": 0.059431524547803614, "grad_norm": 334.4768371582031, "learning_rate": 1.8811369509043926e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.72265625, "logps/chosen": -160.0, "logps/rejected": -133.0, "loss": 0.6635, "rewards/accuracies": 0.5, "rewards/chosen": 0.0172119140625, "rewards/margins": 0.057861328125, "rewards/rejected": -0.040771484375, "step": 23 }, { "epoch": 0.06201550387596899, "grad_norm": 301.87762451171875, "learning_rate": 1.875968992248062e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.76171875, "logps/chosen": -132.0, "logps/rejected": -128.0, "loss": 0.6582, "rewards/accuracies": 0.65625, "rewards/chosen": 0.02978515625, "rewards/margins": 0.07666015625, "rewards/rejected": -0.046875, "step": 24 }, { "epoch": 0.06459948320413436, "grad_norm": 337.253173828125, "learning_rate": 1.8708010335917313e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.75, "logps/chosen": -122.0, "logps/rejected": -146.0, "loss": 0.7, "rewards/accuracies": 0.3125, "rewards/chosen": -0.03759765625, "rewards/margins": -0.0062255859375, "rewards/rejected": -0.03125, "step": 25 }, { "epoch": 0.06718346253229975, "grad_norm": 512.7426147460938, "learning_rate": 1.8656330749354004e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.73828125, "logps/chosen": -120.5, "logps/rejected": -112.5, "loss": 0.6704, "rewards/accuracies": 0.5625, "rewards/chosen": 0.006256103515625, "rewards/margins": 0.0478515625, "rewards/rejected": -0.04150390625, "step": 26 }, { "epoch": 0.06976744186046512, "grad_norm": 322.4765319824219, "learning_rate": 1.8604651162790697e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.76953125, "logps/chosen": -123.0, "logps/rejected": -148.0, "loss": 0.673, "rewards/accuracies": 0.5, "rewards/chosen": 0.0093994140625, "rewards/margins": 0.04541015625, "rewards/rejected": -0.035888671875, "step": 27 }, { "epoch": 0.07235142118863049, "grad_norm": 310.0760498046875, "learning_rate": 1.855297157622739e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.734375, "logps/chosen": -145.0, "logps/rejected": -115.5, "loss": 0.6896, "rewards/accuracies": 0.4375, "rewards/chosen": -0.00701904296875, "rewards/margins": 0.0133056640625, "rewards/rejected": -0.0203857421875, "step": 28 }, { "epoch": 0.07493540051679587, "grad_norm": 306.0886535644531, "learning_rate": 1.8501291989664084e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.7734375, "logps/chosen": -132.0, "logps/rejected": -130.0, "loss": 0.6647, "rewards/accuracies": 0.53125, "rewards/chosen": 0.018798828125, "rewards/margins": 0.06103515625, "rewards/rejected": -0.042236328125, "step": 29 }, { "epoch": 0.07751937984496124, "grad_norm": 299.5661315917969, "learning_rate": 1.8449612403100773e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.76171875, "logps/chosen": -135.0, "logps/rejected": -133.0, "loss": 0.6514, "rewards/accuracies": 0.625, "rewards/chosen": 0.0234375, "rewards/margins": 0.09619140625, "rewards/rejected": -0.07275390625, "step": 30 }, { "epoch": 0.08010335917312661, "grad_norm": 333.64215087890625, "learning_rate": 1.8397932816537466e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.74609375, "logps/chosen": -158.0, "logps/rejected": -141.0, "loss": 0.6697, "rewards/accuracies": 0.5625, "rewards/chosen": 0.031982421875, "rewards/margins": 0.053955078125, "rewards/rejected": -0.0218505859375, "step": 31 }, { "epoch": 0.082687338501292, "grad_norm": 326.3154602050781, "learning_rate": 1.834625322997416e-06, "logits/chosen": -0.734375, "logits/rejected": -0.75, "logps/chosen": -128.0, "logps/rejected": -148.0, "loss": 0.6885, "rewards/accuracies": 0.5, "rewards/chosen": -0.0242919921875, "rewards/margins": 0.01092529296875, "rewards/rejected": -0.03515625, "step": 32 }, { "epoch": 0.08527131782945736, "grad_norm": 321.0740051269531, "learning_rate": 1.829457364341085e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.7109375, "logps/chosen": -135.0, "logps/rejected": -122.5, "loss": 0.6741, "rewards/accuracies": 0.53125, "rewards/chosen": 0.031982421875, "rewards/margins": 0.044677734375, "rewards/rejected": -0.01251220703125, "step": 33 }, { "epoch": 0.08785529715762273, "grad_norm": 330.2655029296875, "learning_rate": 1.8242894056847544e-06, "logits/chosen": -0.765625, "logits/rejected": -0.7734375, "logps/chosen": -134.0, "logps/rejected": -131.0, "loss": 0.7, "rewards/accuracies": 0.375, "rewards/chosen": -0.00390625, "rewards/margins": -0.0101318359375, "rewards/rejected": 0.006256103515625, "step": 34 }, { "epoch": 0.09043927648578812, "grad_norm": 318.2413330078125, "learning_rate": 1.8191214470284237e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.76171875, "logps/chosen": -128.0, "logps/rejected": -137.0, "loss": 0.6689, "rewards/accuracies": 0.625, "rewards/chosen": 0.003143310546875, "rewards/margins": 0.05322265625, "rewards/rejected": -0.050048828125, "step": 35 }, { "epoch": 0.09302325581395349, "grad_norm": 344.4376220703125, "learning_rate": 1.8139534883720929e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.82421875, "logps/chosen": -128.0, "logps/rejected": -155.0, "loss": 0.6613, "rewards/accuracies": 0.5625, "rewards/chosen": 0.02587890625, "rewards/margins": 0.08056640625, "rewards/rejected": -0.0546875, "step": 36 }, { "epoch": 0.09560723514211886, "grad_norm": 355.41925048828125, "learning_rate": 1.8087855297157622e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.72265625, "logps/chosen": -146.0, "logps/rejected": -173.0, "loss": 0.6913, "rewards/accuracies": 0.34375, "rewards/chosen": -0.01251220703125, "rewards/margins": 0.007080078125, "rewards/rejected": -0.01953125, "step": 37 }, { "epoch": 0.09819121447028424, "grad_norm": 302.00238037109375, "learning_rate": 1.8036175710594315e-06, "logits/chosen": -0.69140625, "logits/rejected": -0.70703125, "logps/chosen": -136.0, "logps/rejected": -144.0, "loss": 0.6833, "rewards/accuracies": 0.53125, "rewards/chosen": 0.01251220703125, "rewards/margins": 0.026611328125, "rewards/rejected": -0.0140380859375, "step": 38 }, { "epoch": 0.10077519379844961, "grad_norm": 310.81036376953125, "learning_rate": 1.7984496124031008e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.76953125, "logps/chosen": -135.0, "logps/rejected": -123.0, "loss": 0.6858, "rewards/accuracies": 0.375, "rewards/chosen": -0.026611328125, "rewards/margins": 0.01806640625, "rewards/rejected": -0.044677734375, "step": 39 }, { "epoch": 0.10335917312661498, "grad_norm": 313.59796142578125, "learning_rate": 1.79328165374677e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.7890625, "logps/chosen": -137.0, "logps/rejected": -129.0, "loss": 0.6804, "rewards/accuracies": 0.40625, "rewards/chosen": -0.015625, "rewards/margins": 0.03515625, "rewards/rejected": -0.05078125, "step": 40 }, { "epoch": 0.10594315245478036, "grad_norm": 327.0791320800781, "learning_rate": 1.7881136950904393e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.734375, "logps/chosen": -147.0, "logps/rejected": -141.0, "loss": 0.6917, "rewards/accuracies": 0.40625, "rewards/chosen": -0.0218505859375, "rewards/margins": 0.00860595703125, "rewards/rejected": -0.030517578125, "step": 41 }, { "epoch": 0.10852713178294573, "grad_norm": 325.0856018066406, "learning_rate": 1.7829457364341084e-06, "logits/chosen": -0.765625, "logits/rejected": -0.73828125, "logps/chosen": -122.5, "logps/rejected": -142.0, "loss": 0.6915, "rewards/accuracies": 0.53125, "rewards/chosen": 0.00156402587890625, "rewards/margins": 0.0108642578125, "rewards/rejected": -0.0093994140625, "step": 42 }, { "epoch": 0.1111111111111111, "grad_norm": 336.544677734375, "learning_rate": 1.7777777777777775e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.74609375, "logps/chosen": -133.0, "logps/rejected": -127.0, "loss": 0.668, "rewards/accuracies": 0.59375, "rewards/chosen": -0.0062255859375, "rewards/margins": 0.061767578125, "rewards/rejected": -0.06787109375, "step": 43 }, { "epoch": 0.11369509043927649, "grad_norm": 308.3078918457031, "learning_rate": 1.7726098191214469e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.765625, "logps/chosen": -126.0, "logps/rejected": -124.0, "loss": 0.6384, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0595703125, "rewards/margins": 0.119140625, "rewards/rejected": -0.059326171875, "step": 44 }, { "epoch": 0.11627906976744186, "grad_norm": 330.3432312011719, "learning_rate": 1.7674418604651162e-06, "logits/chosen": -0.78125, "logits/rejected": -0.7734375, "logps/chosen": -173.0, "logps/rejected": -164.0, "loss": 0.6664, "rewards/accuracies": 0.53125, "rewards/chosen": 0.03271484375, "rewards/margins": 0.06396484375, "rewards/rejected": -0.03125, "step": 45 }, { "epoch": 0.11886304909560723, "grad_norm": 314.838623046875, "learning_rate": 1.7622739018087855e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.73046875, "logps/chosen": -138.0, "logps/rejected": -139.0, "loss": 0.6594, "rewards/accuracies": 0.65625, "rewards/chosen": 0.03369140625, "rewards/margins": 0.07666015625, "rewards/rejected": -0.04296875, "step": 46 }, { "epoch": 0.12144702842377261, "grad_norm": 312.06280517578125, "learning_rate": 1.7571059431524546e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.7578125, "logps/chosen": -142.0, "logps/rejected": -131.0, "loss": 0.6566, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0133056640625, "rewards/margins": 0.083984375, "rewards/rejected": -0.0703125, "step": 47 }, { "epoch": 0.12403100775193798, "grad_norm": 327.1083984375, "learning_rate": 1.751937984496124e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.75390625, "logps/chosen": -137.0, "logps/rejected": -127.5, "loss": 0.6713, "rewards/accuracies": 0.59375, "rewards/chosen": 0.007080078125, "rewards/margins": 0.0517578125, "rewards/rejected": -0.044677734375, "step": 48 }, { "epoch": 0.12661498708010335, "grad_norm": 327.7143249511719, "learning_rate": 1.7467700258397933e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.7578125, "logps/chosen": -138.0, "logps/rejected": -138.0, "loss": 0.6564, "rewards/accuracies": 0.625, "rewards/chosen": 0.01953125, "rewards/margins": 0.087890625, "rewards/rejected": -0.06787109375, "step": 49 }, { "epoch": 0.12919896640826872, "grad_norm": 287.09173583984375, "learning_rate": 1.7416020671834624e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.73046875, "logps/chosen": -133.0, "logps/rejected": -115.0, "loss": 0.6604, "rewards/accuracies": 0.5625, "rewards/chosen": 0.0296630859375, "rewards/margins": 0.07177734375, "rewards/rejected": -0.042236328125, "step": 50 }, { "epoch": 0.13178294573643412, "grad_norm": 303.8511047363281, "learning_rate": 1.7364341085271318e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.76171875, "logps/chosen": -132.0, "logps/rejected": -125.5, "loss": 0.65, "rewards/accuracies": 0.65625, "rewards/chosen": 0.010986328125, "rewards/margins": 0.09521484375, "rewards/rejected": -0.08447265625, "step": 51 }, { "epoch": 0.1343669250645995, "grad_norm": 345.98455810546875, "learning_rate": 1.731266149870801e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.76953125, "logps/chosen": -138.0, "logps/rejected": -132.0, "loss": 0.671, "rewards/accuracies": 0.5, "rewards/chosen": 0.00628662109375, "rewards/margins": 0.0517578125, "rewards/rejected": -0.04541015625, "step": 52 }, { "epoch": 0.13695090439276486, "grad_norm": 314.14788818359375, "learning_rate": 1.7260981912144704e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.78515625, "logps/chosen": -137.0, "logps/rejected": -146.0, "loss": 0.6191, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0546875, "rewards/margins": 0.166015625, "rewards/rejected": -0.11083984375, "step": 53 }, { "epoch": 0.13953488372093023, "grad_norm": 324.44732666015625, "learning_rate": 1.7209302325581393e-06, "logits/chosen": -0.78125, "logits/rejected": -0.78515625, "logps/chosen": -128.0, "logps/rejected": -132.0, "loss": 0.6681, "rewards/accuracies": 0.5625, "rewards/chosen": 0.010986328125, "rewards/margins": 0.057861328125, "rewards/rejected": -0.046875, "step": 54 }, { "epoch": 0.1421188630490956, "grad_norm": 323.485107421875, "learning_rate": 1.7157622739018087e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.75, "logps/chosen": -149.0, "logps/rejected": -124.0, "loss": 0.6381, "rewards/accuracies": 0.625, "rewards/chosen": 0.0625, "rewards/margins": 0.125, "rewards/rejected": -0.0625, "step": 55 }, { "epoch": 0.14470284237726097, "grad_norm": 314.7582702636719, "learning_rate": 1.710594315245478e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.72265625, "logps/chosen": -124.0, "logps/rejected": -122.0, "loss": 0.6747, "rewards/accuracies": 0.59375, "rewards/chosen": 0.015625, "rewards/margins": 0.040771484375, "rewards/rejected": -0.0250244140625, "step": 56 }, { "epoch": 0.14728682170542637, "grad_norm": 324.26568603515625, "learning_rate": 1.705426356589147e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.76953125, "logps/chosen": -134.0, "logps/rejected": -141.0, "loss": 0.6624, "rewards/accuracies": 0.59375, "rewards/chosen": 0.030517578125, "rewards/margins": 0.0751953125, "rewards/rejected": -0.044677734375, "step": 57 }, { "epoch": 0.14987080103359174, "grad_norm": 358.5406799316406, "learning_rate": 1.7002583979328164e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.76953125, "logps/chosen": -140.0, "logps/rejected": -153.0, "loss": 0.6931, "rewards/accuracies": 0.4375, "rewards/chosen": -0.026611328125, "rewards/margins": 0.0164794921875, "rewards/rejected": -0.04296875, "step": 58 }, { "epoch": 0.1524547803617571, "grad_norm": 316.290771484375, "learning_rate": 1.6950904392764858e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.73046875, "logps/chosen": -150.0, "logps/rejected": -135.0, "loss": 0.6688, "rewards/accuracies": 0.4375, "rewards/chosen": 0.0078125, "rewards/margins": 0.0595703125, "rewards/rejected": -0.0517578125, "step": 59 }, { "epoch": 0.15503875968992248, "grad_norm": 315.859619140625, "learning_rate": 1.6899224806201549e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.77734375, "logps/chosen": -133.0, "logps/rejected": -148.0, "loss": 0.6675, "rewards/accuracies": 0.53125, "rewards/chosen": 0.01104736328125, "rewards/margins": 0.05810546875, "rewards/rejected": -0.046875, "step": 60 }, { "epoch": 0.15762273901808785, "grad_norm": 311.5282897949219, "learning_rate": 1.6847545219638242e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.7578125, "logps/chosen": -124.5, "logps/rejected": -123.0, "loss": 0.6408, "rewards/accuracies": 0.59375, "rewards/chosen": 0.06494140625, "rewards/margins": 0.1181640625, "rewards/rejected": -0.05322265625, "step": 61 }, { "epoch": 0.16020671834625322, "grad_norm": 339.14593505859375, "learning_rate": 1.6795865633074935e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.72265625, "logps/chosen": -128.0, "logps/rejected": -141.0, "loss": 0.6611, "rewards/accuracies": 0.625, "rewards/chosen": 0.04150390625, "rewards/margins": 0.0830078125, "rewards/rejected": -0.04150390625, "step": 62 }, { "epoch": 0.16279069767441862, "grad_norm": 341.363525390625, "learning_rate": 1.6744186046511629e-06, "logits/chosen": -0.78125, "logits/rejected": -0.7734375, "logps/chosen": -134.0, "logps/rejected": -139.0, "loss": 0.6646, "rewards/accuracies": 0.5625, "rewards/chosen": 0.05322265625, "rewards/margins": 0.06640625, "rewards/rejected": -0.0133056640625, "step": 63 }, { "epoch": 0.165374677002584, "grad_norm": 391.70458984375, "learning_rate": 1.669250645994832e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.80859375, "logps/chosen": -142.0, "logps/rejected": -150.0, "loss": 0.652, "rewards/accuracies": 0.59375, "rewards/chosen": 0.0211181640625, "rewards/margins": 0.09716796875, "rewards/rejected": -0.07568359375, "step": 64 }, { "epoch": 0.16795865633074936, "grad_norm": 363.4455871582031, "learning_rate": 1.6640826873385011e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7734375, "logps/chosen": -145.0, "logps/rejected": -124.0, "loss": 0.6282, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0986328125, "rewards/margins": 0.1533203125, "rewards/rejected": -0.0546875, "step": 65 }, { "epoch": 0.17054263565891473, "grad_norm": 331.4794921875, "learning_rate": 1.6589147286821704e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.75390625, "logps/chosen": -143.0, "logps/rejected": -137.0, "loss": 0.6577, "rewards/accuracies": 0.65625, "rewards/chosen": 0.038330078125, "rewards/margins": 0.08447265625, "rewards/rejected": -0.046142578125, "step": 66 }, { "epoch": 0.1731266149870801, "grad_norm": 321.7209777832031, "learning_rate": 1.6537467700258396e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7734375, "logps/chosen": -131.0, "logps/rejected": -147.0, "loss": 0.6727, "rewards/accuracies": 0.53125, "rewards/chosen": 0.0478515625, "rewards/margins": 0.060302734375, "rewards/rejected": -0.01251220703125, "step": 67 }, { "epoch": 0.17571059431524547, "grad_norm": 321.1003723144531, "learning_rate": 1.648578811369509e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.80859375, "logps/chosen": -136.0, "logps/rejected": -136.0, "loss": 0.6719, "rewards/accuracies": 0.5625, "rewards/chosen": 0.022705078125, "rewards/margins": 0.05419921875, "rewards/rejected": -0.03125, "step": 68 }, { "epoch": 0.17829457364341086, "grad_norm": 344.49249267578125, "learning_rate": 1.6434108527131782e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.765625, "logps/chosen": -150.0, "logps/rejected": -147.0, "loss": 0.6658, "rewards/accuracies": 0.5625, "rewards/chosen": 0.03759765625, "rewards/margins": 0.0634765625, "rewards/rejected": -0.0257568359375, "step": 69 }, { "epoch": 0.18087855297157623, "grad_norm": 354.41680908203125, "learning_rate": 1.6382428940568476e-06, "logits/chosen": -0.796875, "logits/rejected": -0.78515625, "logps/chosen": -144.0, "logps/rejected": -125.5, "loss": 0.6664, "rewards/accuracies": 0.59375, "rewards/chosen": 0.0390625, "rewards/margins": 0.06884765625, "rewards/rejected": -0.0296630859375, "step": 70 }, { "epoch": 0.1834625322997416, "grad_norm": 339.7203674316406, "learning_rate": 1.6330749354005167e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.7734375, "logps/chosen": -142.0, "logps/rejected": -143.0, "loss": 0.6459, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0211181640625, "rewards/margins": 0.115234375, "rewards/rejected": -0.09375, "step": 71 }, { "epoch": 0.18604651162790697, "grad_norm": 330.1705627441406, "learning_rate": 1.627906976744186e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.75, "logps/chosen": -130.0, "logps/rejected": -137.0, "loss": 0.6672, "rewards/accuracies": 0.5625, "rewards/chosen": 0.0712890625, "rewards/margins": 0.06103515625, "rewards/rejected": 0.01019287109375, "step": 72 }, { "epoch": 0.18863049095607234, "grad_norm": 342.0517272949219, "learning_rate": 1.6227390180878553e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.72265625, "logps/chosen": -137.0, "logps/rejected": -145.0, "loss": 0.6422, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10888671875, "rewards/margins": 0.1181640625, "rewards/rejected": -0.0093994140625, "step": 73 }, { "epoch": 0.19121447028423771, "grad_norm": 320.803955078125, "learning_rate": 1.6175710594315245e-06, "logits/chosen": -0.75, "logits/rejected": -0.77734375, "logps/chosen": -113.5, "logps/rejected": -129.0, "loss": 0.6492, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09375, "rewards/margins": 0.10400390625, "rewards/rejected": -0.01019287109375, "step": 74 }, { "epoch": 0.1937984496124031, "grad_norm": 300.7449645996094, "learning_rate": 1.6124031007751938e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.78125, "logps/chosen": -120.0, "logps/rejected": -122.0, "loss": 0.6638, "rewards/accuracies": 0.5, "rewards/chosen": 0.0296630859375, "rewards/margins": 0.0693359375, "rewards/rejected": -0.039794921875, "step": 75 }, { "epoch": 0.19638242894056848, "grad_norm": 346.23590087890625, "learning_rate": 1.6072351421188631e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.78125, "logps/chosen": -137.0, "logps/rejected": -146.0, "loss": 0.6446, "rewards/accuracies": 0.625, "rewards/chosen": 0.08935546875, "rewards/margins": 0.11328125, "rewards/rejected": -0.0242919921875, "step": 76 }, { "epoch": 0.19896640826873385, "grad_norm": 337.37921142578125, "learning_rate": 1.6020671834625322e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7734375, "logps/chosen": -125.0, "logps/rejected": -152.0, "loss": 0.6844, "rewards/accuracies": 0.5, "rewards/chosen": 0.04296875, "rewards/margins": 0.0242919921875, "rewards/rejected": 0.018798828125, "step": 77 }, { "epoch": 0.20155038759689922, "grad_norm": 371.3411865234375, "learning_rate": 1.5968992248062014e-06, "logits/chosen": -0.796875, "logits/rejected": -0.78515625, "logps/chosen": -142.0, "logps/rejected": -149.0, "loss": 0.6985, "rewards/accuracies": 0.4375, "rewards/chosen": 0.044677734375, "rewards/margins": -0.00555419921875, "rewards/rejected": 0.050048828125, "step": 78 }, { "epoch": 0.2041343669250646, "grad_norm": 308.72271728515625, "learning_rate": 1.5917312661498707e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.7734375, "logps/chosen": -124.0, "logps/rejected": -131.0, "loss": 0.6581, "rewards/accuracies": 0.625, "rewards/chosen": 0.103515625, "rewards/margins": 0.0830078125, "rewards/rejected": 0.0203857421875, "step": 79 }, { "epoch": 0.20671834625322996, "grad_norm": 351.33538818359375, "learning_rate": 1.58656330749354e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.84765625, "logps/chosen": -137.0, "logps/rejected": -134.0, "loss": 0.6524, "rewards/accuracies": 0.625, "rewards/chosen": 0.06982421875, "rewards/margins": 0.08837890625, "rewards/rejected": -0.018798828125, "step": 80 }, { "epoch": 0.20930232558139536, "grad_norm": 288.8226623535156, "learning_rate": 1.5813953488372091e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.765625, "logps/chosen": -122.5, "logps/rejected": -127.0, "loss": 0.636, "rewards/accuracies": 0.71875, "rewards/chosen": 0.109375, "rewards/margins": 0.1298828125, "rewards/rejected": -0.020263671875, "step": 81 }, { "epoch": 0.21188630490956073, "grad_norm": 336.23724365234375, "learning_rate": 1.5762273901808785e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.76953125, "logps/chosen": -131.0, "logps/rejected": -141.0, "loss": 0.6503, "rewards/accuracies": 0.6875, "rewards/chosen": 0.10693359375, "rewards/margins": 0.09765625, "rewards/rejected": 0.0093994140625, "step": 82 }, { "epoch": 0.2144702842377261, "grad_norm": 343.7184753417969, "learning_rate": 1.5710594315245478e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.76953125, "logps/chosen": -142.0, "logps/rejected": -127.0, "loss": 0.6636, "rewards/accuracies": 0.5, "rewards/chosen": 0.08935546875, "rewards/margins": 0.07421875, "rewards/rejected": 0.014892578125, "step": 83 }, { "epoch": 0.21705426356589147, "grad_norm": 315.254638671875, "learning_rate": 1.565891472868217e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.81640625, "logps/chosen": -141.0, "logps/rejected": -131.0, "loss": 0.6119, "rewards/accuracies": 0.71875, "rewards/chosen": 0.125, "rewards/margins": 0.1845703125, "rewards/rejected": -0.0595703125, "step": 84 }, { "epoch": 0.21963824289405684, "grad_norm": 338.00396728515625, "learning_rate": 1.5607235142118862e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.83984375, "logps/chosen": -144.0, "logps/rejected": -146.0, "loss": 0.6229, "rewards/accuracies": 0.75, "rewards/chosen": 0.09521484375, "rewards/margins": 0.1591796875, "rewards/rejected": -0.0634765625, "step": 85 }, { "epoch": 0.2222222222222222, "grad_norm": 346.4078063964844, "learning_rate": 1.5555555555555556e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.7890625, "logps/chosen": -141.0, "logps/rejected": -132.0, "loss": 0.6398, "rewards/accuracies": 0.625, "rewards/chosen": 0.050048828125, "rewards/margins": 0.12353515625, "rewards/rejected": -0.07373046875, "step": 86 }, { "epoch": 0.2248062015503876, "grad_norm": 299.9973449707031, "learning_rate": 1.550387596899225e-06, "logits/chosen": -0.82421875, "logits/rejected": -0.8125, "logps/chosen": -133.0, "logps/rejected": -127.5, "loss": 0.6176, "rewards/accuracies": 0.71875, "rewards/chosen": 0.138671875, "rewards/margins": 0.173828125, "rewards/rejected": -0.034423828125, "step": 87 }, { "epoch": 0.22739018087855298, "grad_norm": 342.8509521484375, "learning_rate": 1.5452196382428938e-06, "logits/chosen": -0.765625, "logits/rejected": -0.76953125, "logps/chosen": -124.5, "logps/rejected": -143.0, "loss": 0.6304, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11572265625, "rewards/margins": 0.1376953125, "rewards/rejected": -0.0218505859375, "step": 88 }, { "epoch": 0.22997416020671835, "grad_norm": 345.9960021972656, "learning_rate": 1.5400516795865631e-06, "logits/chosen": -0.80078125, "logits/rejected": -0.828125, "logps/chosen": -144.0, "logps/rejected": -150.0, "loss": 0.603, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1474609375, "rewards/margins": 0.203125, "rewards/rejected": -0.056396484375, "step": 89 }, { "epoch": 0.23255813953488372, "grad_norm": 305.83319091796875, "learning_rate": 1.5348837209302325e-06, "logits/chosen": -0.796875, "logits/rejected": -0.8125, "logps/chosen": -119.0, "logps/rejected": -128.0, "loss": 0.6355, "rewards/accuracies": 0.71875, "rewards/chosen": 0.142578125, "rewards/margins": 0.1328125, "rewards/rejected": 0.00933837890625, "step": 90 }, { "epoch": 0.2351421188630491, "grad_norm": 323.9646301269531, "learning_rate": 1.5297157622739016e-06, "logits/chosen": -0.80078125, "logits/rejected": -0.77734375, "logps/chosen": -119.0, "logps/rejected": -130.0, "loss": 0.6248, "rewards/accuracies": 0.6875, "rewards/chosen": 0.10498046875, "rewards/margins": 0.1552734375, "rewards/rejected": -0.050048828125, "step": 91 }, { "epoch": 0.23772609819121446, "grad_norm": 340.4587097167969, "learning_rate": 1.524547803617571e-06, "logits/chosen": -0.796875, "logits/rejected": -0.75390625, "logps/chosen": -146.0, "logps/rejected": -123.0, "loss": 0.6505, "rewards/accuracies": 0.5625, "rewards/chosen": 0.06787109375, "rewards/margins": 0.0986328125, "rewards/rejected": -0.030517578125, "step": 92 }, { "epoch": 0.24031007751937986, "grad_norm": 323.98846435546875, "learning_rate": 1.5193798449612403e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.78125, "logps/chosen": -135.0, "logps/rejected": -139.0, "loss": 0.6501, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09619140625, "rewards/margins": 0.1064453125, "rewards/rejected": -0.0101318359375, "step": 93 }, { "epoch": 0.24289405684754523, "grad_norm": 304.8097229003906, "learning_rate": 1.5142118863049096e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.76953125, "logps/chosen": -136.0, "logps/rejected": -137.0, "loss": 0.6373, "rewards/accuracies": 0.65625, "rewards/chosen": 0.09228515625, "rewards/margins": 0.126953125, "rewards/rejected": -0.03515625, "step": 94 }, { "epoch": 0.2454780361757106, "grad_norm": 346.1623229980469, "learning_rate": 1.5090439276485787e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.79296875, "logps/chosen": -131.0, "logps/rejected": -151.0, "loss": 0.6099, "rewards/accuracies": 0.75, "rewards/chosen": 0.12255859375, "rewards/margins": 0.19140625, "rewards/rejected": -0.06884765625, "step": 95 }, { "epoch": 0.24806201550387597, "grad_norm": 325.57989501953125, "learning_rate": 1.503875968992248e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.80859375, "logps/chosen": -131.0, "logps/rejected": -139.0, "loss": 0.6143, "rewards/accuracies": 0.6875, "rewards/chosen": 0.1103515625, "rewards/margins": 0.18359375, "rewards/rejected": -0.07373046875, "step": 96 }, { "epoch": 0.25064599483204136, "grad_norm": 334.1916198730469, "learning_rate": 1.4987080103359174e-06, "logits/chosen": -0.8125, "logits/rejected": -0.8046875, "logps/chosen": -108.0, "logps/rejected": -128.0, "loss": 0.6396, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10107421875, "rewards/margins": 0.1279296875, "rewards/rejected": -0.026611328125, "step": 97 }, { "epoch": 0.2532299741602067, "grad_norm": 347.5135192871094, "learning_rate": 1.4935400516795865e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.78125, "logps/chosen": -141.0, "logps/rejected": -134.0, "loss": 0.6435, "rewards/accuracies": 0.625, "rewards/chosen": 0.1015625, "rewards/margins": 0.12255859375, "rewards/rejected": -0.0211181640625, "step": 98 }, { "epoch": 0.2558139534883721, "grad_norm": 389.5239562988281, "learning_rate": 1.4883720930232558e-06, "logits/chosen": -0.8125, "logits/rejected": -0.81640625, "logps/chosen": -144.0, "logps/rejected": -148.0, "loss": 0.6166, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1259765625, "rewards/margins": 0.169921875, "rewards/rejected": -0.043701171875, "step": 99 }, { "epoch": 0.25839793281653745, "grad_norm": 354.7499694824219, "learning_rate": 1.483204134366925e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.80078125, "logps/chosen": -124.5, "logps/rejected": -143.0, "loss": 0.6376, "rewards/accuracies": 0.65625, "rewards/chosen": 0.08056640625, "rewards/margins": 0.1357421875, "rewards/rejected": -0.055419921875, "step": 100 }, { "epoch": 0.26098191214470284, "grad_norm": 324.9789123535156, "learning_rate": 1.4780361757105943e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.765625, "logps/chosen": -129.0, "logps/rejected": -140.0, "loss": 0.6321, "rewards/accuracies": 0.65625, "rewards/chosen": 0.08447265625, "rewards/margins": 0.146484375, "rewards/rejected": -0.061767578125, "step": 101 }, { "epoch": 0.26356589147286824, "grad_norm": 337.2759704589844, "learning_rate": 1.4728682170542634e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.80078125, "logps/chosen": -141.0, "logps/rejected": -139.0, "loss": 0.6442, "rewards/accuracies": 0.6875, "rewards/chosen": 0.06494140625, "rewards/margins": 0.11669921875, "rewards/rejected": -0.0517578125, "step": 102 }, { "epoch": 0.2661498708010336, "grad_norm": 329.3245849609375, "learning_rate": 1.4677002583979327e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.80078125, "logps/chosen": -123.5, "logps/rejected": -135.0, "loss": 0.6653, "rewards/accuracies": 0.53125, "rewards/chosen": 0.036865234375, "rewards/margins": 0.078125, "rewards/rejected": -0.04150390625, "step": 103 }, { "epoch": 0.268733850129199, "grad_norm": 357.8585510253906, "learning_rate": 1.462532299741602e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.78125, "logps/chosen": -151.0, "logps/rejected": -147.0, "loss": 0.6343, "rewards/accuracies": 0.625, "rewards/chosen": 0.12060546875, "rewards/margins": 0.1396484375, "rewards/rejected": -0.018798828125, "step": 104 }, { "epoch": 0.2713178294573643, "grad_norm": 344.8572998046875, "learning_rate": 1.4573643410852712e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.79296875, "logps/chosen": -130.0, "logps/rejected": -137.0, "loss": 0.6506, "rewards/accuracies": 0.625, "rewards/chosen": 0.05859375, "rewards/margins": 0.09375, "rewards/rejected": -0.03515625, "step": 105 }, { "epoch": 0.2739018087855297, "grad_norm": 335.1913146972656, "learning_rate": 1.4521963824289405e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.79296875, "logps/chosen": -135.0, "logps/rejected": -140.0, "loss": 0.632, "rewards/accuracies": 0.625, "rewards/chosen": 0.10498046875, "rewards/margins": 0.146484375, "rewards/rejected": -0.042236328125, "step": 106 }, { "epoch": 0.27648578811369506, "grad_norm": 335.07769775390625, "learning_rate": 1.4470284237726098e-06, "logits/chosen": -0.8125, "logits/rejected": -0.80078125, "logps/chosen": -138.0, "logps/rejected": -141.0, "loss": 0.6209, "rewards/accuracies": 0.5625, "rewards/chosen": 0.07275390625, "rewards/margins": 0.1640625, "rewards/rejected": -0.09130859375, "step": 107 }, { "epoch": 0.27906976744186046, "grad_norm": 356.36468505859375, "learning_rate": 1.441860465116279e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.76953125, "logps/chosen": -173.0, "logps/rejected": -141.0, "loss": 0.6124, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11474609375, "rewards/margins": 0.1904296875, "rewards/rejected": -0.07568359375, "step": 108 }, { "epoch": 0.28165374677002586, "grad_norm": 321.2911071777344, "learning_rate": 1.4366925064599483e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.78125, "logps/chosen": -130.0, "logps/rejected": -142.0, "loss": 0.6199, "rewards/accuracies": 0.75, "rewards/chosen": 0.08447265625, "rewards/margins": 0.171875, "rewards/rejected": -0.0869140625, "step": 109 }, { "epoch": 0.2842377260981912, "grad_norm": 338.142822265625, "learning_rate": 1.4315245478036176e-06, "logits/chosen": -0.75, "logits/rejected": -0.76171875, "logps/chosen": -120.0, "logps/rejected": -128.0, "loss": 0.6328, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0556640625, "rewards/margins": 0.1376953125, "rewards/rejected": -0.08203125, "step": 110 }, { "epoch": 0.2868217054263566, "grad_norm": 336.5170593261719, "learning_rate": 1.426356589147287e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.765625, "logps/chosen": -139.0, "logps/rejected": -136.0, "loss": 0.6069, "rewards/accuracies": 0.75, "rewards/chosen": 0.09228515625, "rewards/margins": 0.1904296875, "rewards/rejected": -0.09765625, "step": 111 }, { "epoch": 0.28940568475452194, "grad_norm": 335.60601806640625, "learning_rate": 1.4211886304909558e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.76953125, "logps/chosen": -122.5, "logps/rejected": -124.5, "loss": 0.6148, "rewards/accuracies": 0.65625, "rewards/chosen": 0.08447265625, "rewards/margins": 0.1796875, "rewards/rejected": -0.0947265625, "step": 112 }, { "epoch": 0.29198966408268734, "grad_norm": 344.4601135253906, "learning_rate": 1.4160206718346252e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.765625, "logps/chosen": -155.0, "logps/rejected": -147.0, "loss": 0.6178, "rewards/accuracies": 0.6875, "rewards/chosen": 0.1025390625, "rewards/margins": 0.1767578125, "rewards/rejected": -0.07421875, "step": 113 }, { "epoch": 0.29457364341085274, "grad_norm": 344.459716796875, "learning_rate": 1.4108527131782945e-06, "logits/chosen": -0.84765625, "logits/rejected": -0.83203125, "logps/chosen": -130.0, "logps/rejected": -125.0, "loss": 0.6079, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0791015625, "rewards/margins": 0.1904296875, "rewards/rejected": -0.11083984375, "step": 114 }, { "epoch": 0.2971576227390181, "grad_norm": 318.5380554199219, "learning_rate": 1.4056847545219636e-06, "logits/chosen": -0.828125, "logits/rejected": -0.796875, "logps/chosen": -122.5, "logps/rejected": -130.0, "loss": 0.6321, "rewards/accuracies": 0.59375, "rewards/chosen": 0.06494140625, "rewards/margins": 0.138671875, "rewards/rejected": -0.07373046875, "step": 115 }, { "epoch": 0.2997416020671835, "grad_norm": 329.6904296875, "learning_rate": 1.400516795865633e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.81640625, "logps/chosen": -118.5, "logps/rejected": -139.0, "loss": 0.6331, "rewards/accuracies": 0.65625, "rewards/chosen": 0.07666015625, "rewards/margins": 0.1455078125, "rewards/rejected": -0.06884765625, "step": 116 }, { "epoch": 0.3023255813953488, "grad_norm": 342.3974304199219, "learning_rate": 1.3953488372093023e-06, "logits/chosen": -0.8125, "logits/rejected": -0.80859375, "logps/chosen": -156.0, "logps/rejected": -146.0, "loss": 0.6286, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0625, "rewards/margins": 0.1513671875, "rewards/rejected": -0.0888671875, "step": 117 }, { "epoch": 0.3049095607235142, "grad_norm": 312.7485656738281, "learning_rate": 1.3901808785529716e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.76953125, "logps/chosen": -124.0, "logps/rejected": -133.0, "loss": 0.6155, "rewards/accuracies": 0.8125, "rewards/chosen": 0.08544921875, "rewards/margins": 0.1787109375, "rewards/rejected": -0.09375, "step": 118 }, { "epoch": 0.30749354005167956, "grad_norm": 337.5772705078125, "learning_rate": 1.3850129198966407e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.80859375, "logps/chosen": -139.0, "logps/rejected": -135.0, "loss": 0.6246, "rewards/accuracies": 0.65625, "rewards/chosen": 0.08984375, "rewards/margins": 0.154296875, "rewards/rejected": -0.06396484375, "step": 119 }, { "epoch": 0.31007751937984496, "grad_norm": 323.82647705078125, "learning_rate": 1.37984496124031e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.79296875, "logps/chosen": -134.0, "logps/rejected": -144.0, "loss": 0.6328, "rewards/accuracies": 0.6875, "rewards/chosen": 0.057861328125, "rewards/margins": 0.1533203125, "rewards/rejected": -0.09521484375, "step": 120 }, { "epoch": 0.31266149870801035, "grad_norm": 348.8138122558594, "learning_rate": 1.3746770025839794e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.83984375, "logps/chosen": -159.0, "logps/rejected": -162.0, "loss": 0.6141, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08447265625, "rewards/margins": 0.1845703125, "rewards/rejected": -0.10009765625, "step": 121 }, { "epoch": 0.3152454780361757, "grad_norm": 349.4007568359375, "learning_rate": 1.3695090439276485e-06, "logits/chosen": -0.80078125, "logits/rejected": -0.78125, "logps/chosen": -133.0, "logps/rejected": -150.0, "loss": 0.6328, "rewards/accuracies": 0.5625, "rewards/chosen": 0.07958984375, "rewards/margins": 0.162109375, "rewards/rejected": -0.08203125, "step": 122 }, { "epoch": 0.3178294573643411, "grad_norm": 332.4546813964844, "learning_rate": 1.3643410852713179e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.828125, "logps/chosen": -142.0, "logps/rejected": -142.0, "loss": 0.6021, "rewards/accuracies": 0.71875, "rewards/chosen": 0.076171875, "rewards/margins": 0.2412109375, "rewards/rejected": -0.166015625, "step": 123 }, { "epoch": 0.32041343669250644, "grad_norm": 341.52081298828125, "learning_rate": 1.359173126614987e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.82421875, "logps/chosen": -148.0, "logps/rejected": -139.0, "loss": 0.6187, "rewards/accuracies": 0.75, "rewards/chosen": 0.044677734375, "rewards/margins": 0.1748046875, "rewards/rejected": -0.1298828125, "step": 124 }, { "epoch": 0.32299741602067183, "grad_norm": 331.70928955078125, "learning_rate": 1.3540051679586563e-06, "logits/chosen": -0.83984375, "logits/rejected": -0.84765625, "logps/chosen": -128.0, "logps/rejected": -146.0, "loss": 0.6024, "rewards/accuracies": 0.75, "rewards/chosen": 0.09228515625, "rewards/margins": 0.20703125, "rewards/rejected": -0.115234375, "step": 125 }, { "epoch": 0.32558139534883723, "grad_norm": 329.70867919921875, "learning_rate": 1.3488372093023254e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.80078125, "logps/chosen": -137.0, "logps/rejected": -138.0, "loss": 0.6265, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0869140625, "rewards/margins": 0.166015625, "rewards/rejected": -0.0791015625, "step": 126 }, { "epoch": 0.3281653746770026, "grad_norm": 359.75567626953125, "learning_rate": 1.3436692506459948e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.828125, "logps/chosen": -147.0, "logps/rejected": -129.0, "loss": 0.6324, "rewards/accuracies": 0.71875, "rewards/chosen": 0.02734375, "rewards/margins": 0.14453125, "rewards/rejected": -0.1171875, "step": 127 }, { "epoch": 0.330749354005168, "grad_norm": 328.73541259765625, "learning_rate": 1.338501291989664e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.79296875, "logps/chosen": -140.0, "logps/rejected": -160.0, "loss": 0.6026, "rewards/accuracies": 0.75, "rewards/chosen": 0.1376953125, "rewards/margins": 0.23828125, "rewards/rejected": -0.10107421875, "step": 128 }, { "epoch": 0.3333333333333333, "grad_norm": 348.1528625488281, "learning_rate": 1.3333333333333332e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.82421875, "logps/chosen": -147.0, "logps/rejected": -138.0, "loss": 0.6233, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08837890625, "rewards/margins": 0.1787109375, "rewards/rejected": -0.0908203125, "step": 129 }, { "epoch": 0.3359173126614987, "grad_norm": 340.9327087402344, "learning_rate": 1.3281653746770025e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.8203125, "logps/chosen": -121.5, "logps/rejected": -144.0, "loss": 0.6133, "rewards/accuracies": 0.625, "rewards/chosen": 0.0654296875, "rewards/margins": 0.1982421875, "rewards/rejected": -0.1328125, "step": 130 }, { "epoch": 0.3385012919896641, "grad_norm": 352.50140380859375, "learning_rate": 1.3229974160206719e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.78515625, "logps/chosen": -133.0, "logps/rejected": -134.0, "loss": 0.6362, "rewards/accuracies": 0.65625, "rewards/chosen": 0.09912109375, "rewards/margins": 0.130859375, "rewards/rejected": -0.03125, "step": 131 }, { "epoch": 0.34108527131782945, "grad_norm": 334.6105651855469, "learning_rate": 1.317829457364341e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.8203125, "logps/chosen": -137.0, "logps/rejected": -125.5, "loss": 0.6101, "rewards/accuracies": 0.65625, "rewards/chosen": 0.119140625, "rewards/margins": 0.2021484375, "rewards/rejected": -0.0830078125, "step": 132 }, { "epoch": 0.34366925064599485, "grad_norm": 353.9385986328125, "learning_rate": 1.3126614987080103e-06, "logits/chosen": -0.83203125, "logits/rejected": -0.82421875, "logps/chosen": -135.0, "logps/rejected": -135.0, "loss": 0.6122, "rewards/accuracies": 0.65625, "rewards/chosen": 0.07666015625, "rewards/margins": 0.19140625, "rewards/rejected": -0.11474609375, "step": 133 }, { "epoch": 0.3462532299741602, "grad_norm": 328.07965087890625, "learning_rate": 1.3074935400516796e-06, "logits/chosen": -0.828125, "logits/rejected": -0.8203125, "logps/chosen": -152.0, "logps/rejected": -133.0, "loss": 0.6092, "rewards/accuracies": 0.75, "rewards/chosen": 0.134765625, "rewards/margins": 0.216796875, "rewards/rejected": -0.08203125, "step": 134 }, { "epoch": 0.3488372093023256, "grad_norm": 359.8808288574219, "learning_rate": 1.302325581395349e-06, "logits/chosen": -0.8671875, "logits/rejected": -0.83984375, "logps/chosen": -149.0, "logps/rejected": -139.0, "loss": 0.6028, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0966796875, "rewards/margins": 0.2080078125, "rewards/rejected": -0.111328125, "step": 135 }, { "epoch": 0.35142118863049093, "grad_norm": 352.7024230957031, "learning_rate": 1.2971576227390179e-06, "logits/chosen": -0.828125, "logits/rejected": -0.8203125, "logps/chosen": -131.0, "logps/rejected": -141.0, "loss": 0.5861, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1337890625, "rewards/margins": 0.248046875, "rewards/rejected": -0.11474609375, "step": 136 }, { "epoch": 0.35400516795865633, "grad_norm": 345.4299621582031, "learning_rate": 1.2919896640826872e-06, "logits/chosen": -0.828125, "logits/rejected": -0.8046875, "logps/chosen": -125.5, "logps/rejected": -133.0, "loss": 0.5975, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0927734375, "rewards/margins": 0.2255859375, "rewards/rejected": -0.1328125, "step": 137 }, { "epoch": 0.35658914728682173, "grad_norm": 308.36920166015625, "learning_rate": 1.2868217054263565e-06, "logits/chosen": -0.84765625, "logits/rejected": -0.8203125, "logps/chosen": -117.5, "logps/rejected": -119.5, "loss": 0.5941, "rewards/accuracies": 0.75, "rewards/chosen": 0.10498046875, "rewards/margins": 0.2373046875, "rewards/rejected": -0.1318359375, "step": 138 }, { "epoch": 0.35917312661498707, "grad_norm": 358.83782958984375, "learning_rate": 1.2816537467700257e-06, "logits/chosen": -0.8359375, "logits/rejected": -0.8203125, "logps/chosen": -155.0, "logps/rejected": -147.0, "loss": 0.6258, "rewards/accuracies": 0.625, "rewards/chosen": 0.1064453125, "rewards/margins": 0.1650390625, "rewards/rejected": -0.05859375, "step": 139 }, { "epoch": 0.36175710594315247, "grad_norm": 371.83404541015625, "learning_rate": 1.276485788113695e-06, "logits/chosen": -0.82421875, "logits/rejected": -0.81640625, "logps/chosen": -135.0, "logps/rejected": -148.0, "loss": 0.6403, "rewards/accuracies": 0.5625, "rewards/chosen": 0.11572265625, "rewards/margins": 0.1494140625, "rewards/rejected": -0.03369140625, "step": 140 }, { "epoch": 0.3643410852713178, "grad_norm": 351.14495849609375, "learning_rate": 1.2713178294573643e-06, "logits/chosen": -0.82421875, "logits/rejected": -0.8203125, "logps/chosen": -124.5, "logps/rejected": -146.0, "loss": 0.6221, "rewards/accuracies": 0.65625, "rewards/chosen": 0.064453125, "rewards/margins": 0.1728515625, "rewards/rejected": -0.10888671875, "step": 141 }, { "epoch": 0.3669250645994832, "grad_norm": 356.72637939453125, "learning_rate": 1.2661498708010337e-06, "logits/chosen": -0.84375, "logits/rejected": -0.8203125, "logps/chosen": -139.0, "logps/rejected": -124.5, "loss": 0.5872, "rewards/accuracies": 0.75, "rewards/chosen": 0.08056640625, "rewards/margins": 0.248046875, "rewards/rejected": -0.16796875, "step": 142 }, { "epoch": 0.3695090439276486, "grad_norm": 345.7752380371094, "learning_rate": 1.2609819121447028e-06, "logits/chosen": -0.84765625, "logits/rejected": -0.8359375, "logps/chosen": -138.0, "logps/rejected": -145.0, "loss": 0.5862, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1640625, "rewards/margins": 0.263671875, "rewards/rejected": -0.0986328125, "step": 143 }, { "epoch": 0.37209302325581395, "grad_norm": 349.9151611328125, "learning_rate": 1.255813953488372e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.796875, "logps/chosen": -146.0, "logps/rejected": -134.0, "loss": 0.6083, "rewards/accuracies": 0.6875, "rewards/chosen": 0.078125, "rewards/margins": 0.19140625, "rewards/rejected": -0.11328125, "step": 144 }, { "epoch": 0.37467700258397935, "grad_norm": 384.64776611328125, "learning_rate": 1.2506459948320414e-06, "logits/chosen": -0.828125, "logits/rejected": -0.78515625, "logps/chosen": -121.0, "logps/rejected": -115.0, "loss": 0.6302, "rewards/accuracies": 0.625, "rewards/chosen": 0.1025390625, "rewards/margins": 0.1689453125, "rewards/rejected": -0.0673828125, "step": 145 }, { "epoch": 0.3772609819121447, "grad_norm": 364.6282043457031, "learning_rate": 1.2454780361757106e-06, "logits/chosen": -0.8125, "logits/rejected": -0.8046875, "logps/chosen": -134.0, "logps/rejected": -143.0, "loss": 0.6237, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11865234375, "rewards/margins": 0.1552734375, "rewards/rejected": -0.0361328125, "step": 146 }, { "epoch": 0.3798449612403101, "grad_norm": 327.8299255371094, "learning_rate": 1.2403100775193797e-06, "logits/chosen": -0.84375, "logits/rejected": -0.82421875, "logps/chosen": -126.5, "logps/rejected": -139.0, "loss": 0.5947, "rewards/accuracies": 0.6875, "rewards/chosen": 0.13671875, "rewards/margins": 0.2412109375, "rewards/rejected": -0.10400390625, "step": 147 }, { "epoch": 0.38242894056847543, "grad_norm": 385.03558349609375, "learning_rate": 1.235142118863049e-06, "logits/chosen": -0.86328125, "logits/rejected": -0.85546875, "logps/chosen": -152.0, "logps/rejected": -141.0, "loss": 0.662, "rewards/accuracies": 0.5625, "rewards/chosen": 0.0361328125, "rewards/margins": 0.0947265625, "rewards/rejected": -0.05859375, "step": 148 }, { "epoch": 0.3850129198966408, "grad_norm": 361.1077880859375, "learning_rate": 1.2299741602067181e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.85546875, "logps/chosen": -134.0, "logps/rejected": -159.0, "loss": 0.6172, "rewards/accuracies": 0.75, "rewards/chosen": 0.0556640625, "rewards/margins": 0.1943359375, "rewards/rejected": -0.138671875, "step": 149 }, { "epoch": 0.3875968992248062, "grad_norm": 365.97283935546875, "learning_rate": 1.2248062015503875e-06, "logits/chosen": -0.83203125, "logits/rejected": -0.8359375, "logps/chosen": -134.0, "logps/rejected": -133.0, "loss": 0.6337, "rewards/accuracies": 0.5625, "rewards/chosen": 0.050048828125, "rewards/margins": 0.1640625, "rewards/rejected": -0.1142578125, "step": 150 }, { "epoch": 0.39018087855297157, "grad_norm": 355.6282958984375, "learning_rate": 1.2196382428940568e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.80078125, "logps/chosen": -153.0, "logps/rejected": -137.0, "loss": 0.6195, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10302734375, "rewards/margins": 0.193359375, "rewards/rejected": -0.08984375, "step": 151 }, { "epoch": 0.39276485788113696, "grad_norm": 351.19390869140625, "learning_rate": 1.2144702842377261e-06, "logits/chosen": -0.86328125, "logits/rejected": -0.83203125, "logps/chosen": -144.0, "logps/rejected": -139.0, "loss": 0.565, "rewards/accuracies": 0.78125, "rewards/chosen": 0.154296875, "rewards/margins": 0.3125, "rewards/rejected": -0.1572265625, "step": 152 }, { "epoch": 0.3953488372093023, "grad_norm": 371.5525207519531, "learning_rate": 1.2093023255813952e-06, "logits/chosen": -0.8359375, "logits/rejected": -0.8515625, "logps/chosen": -133.0, "logps/rejected": -134.0, "loss": 0.6111, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0390625, "rewards/margins": 0.19921875, "rewards/rejected": -0.16015625, "step": 153 }, { "epoch": 0.3979328165374677, "grad_norm": 320.109130859375, "learning_rate": 1.2041343669250646e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.796875, "logps/chosen": -135.0, "logps/rejected": -121.5, "loss": 0.5984, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0830078125, "rewards/margins": 0.2392578125, "rewards/rejected": -0.15625, "step": 154 }, { "epoch": 0.4005167958656331, "grad_norm": 356.4275817871094, "learning_rate": 1.198966408268734e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.8359375, "logps/chosen": -149.0, "logps/rejected": -130.0, "loss": 0.6063, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10546875, "rewards/margins": 0.2041015625, "rewards/rejected": -0.0986328125, "step": 155 }, { "epoch": 0.40310077519379844, "grad_norm": 348.66217041015625, "learning_rate": 1.193798449612403e-06, "logits/chosen": -0.87890625, "logits/rejected": -0.84375, "logps/chosen": -134.0, "logps/rejected": -145.0, "loss": 0.6041, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1162109375, "rewards/margins": 0.2060546875, "rewards/rejected": -0.08984375, "step": 156 }, { "epoch": 0.40568475452196384, "grad_norm": 345.34661865234375, "learning_rate": 1.1886304909560723e-06, "logits/chosen": -0.859375, "logits/rejected": -0.83203125, "logps/chosen": -138.0, "logps/rejected": -121.0, "loss": 0.6521, "rewards/accuracies": 0.5625, "rewards/chosen": 0.01416015625, "rewards/margins": 0.123046875, "rewards/rejected": -0.10888671875, "step": 157 }, { "epoch": 0.4082687338501292, "grad_norm": 350.15313720703125, "learning_rate": 1.1834625322997417e-06, "logits/chosen": -0.8359375, "logits/rejected": -0.83984375, "logps/chosen": -153.0, "logps/rejected": -142.0, "loss": 0.6064, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0947265625, "rewards/margins": 0.2119140625, "rewards/rejected": -0.1171875, "step": 158 }, { "epoch": 0.4108527131782946, "grad_norm": 379.19287109375, "learning_rate": 1.1782945736434108e-06, "logits/chosen": -0.828125, "logits/rejected": -0.828125, "logps/chosen": -119.5, "logps/rejected": -138.0, "loss": 0.6129, "rewards/accuracies": 0.78125, "rewards/chosen": 0.10400390625, "rewards/margins": 0.2021484375, "rewards/rejected": -0.09765625, "step": 159 }, { "epoch": 0.4134366925064599, "grad_norm": 355.0957336425781, "learning_rate": 1.17312661498708e-06, "logits/chosen": -0.859375, "logits/rejected": -0.828125, "logps/chosen": -145.0, "logps/rejected": -132.0, "loss": 0.5751, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1015625, "rewards/margins": 0.279296875, "rewards/rejected": -0.1787109375, "step": 160 }, { "epoch": 0.4160206718346253, "grad_norm": 367.7550964355469, "learning_rate": 1.1679586563307492e-06, "logits/chosen": -0.82421875, "logits/rejected": -0.83984375, "logps/chosen": -136.0, "logps/rejected": -138.0, "loss": 0.6216, "rewards/accuracies": 0.625, "rewards/chosen": 0.1103515625, "rewards/margins": 0.1884765625, "rewards/rejected": -0.0791015625, "step": 161 }, { "epoch": 0.4186046511627907, "grad_norm": 385.49310302734375, "learning_rate": 1.1627906976744186e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.8359375, "logps/chosen": -151.0, "logps/rejected": -140.0, "loss": 0.6404, "rewards/accuracies": 0.625, "rewards/chosen": 0.06982421875, "rewards/margins": 0.162109375, "rewards/rejected": -0.09228515625, "step": 162 }, { "epoch": 0.42118863049095606, "grad_norm": 422.4086608886719, "learning_rate": 1.1576227390180877e-06, "logits/chosen": -0.875, "logits/rejected": -0.859375, "logps/chosen": -144.0, "logps/rejected": -135.0, "loss": 0.594, "rewards/accuracies": 0.8125, "rewards/chosen": 0.078125, "rewards/margins": 0.25, "rewards/rejected": -0.171875, "step": 163 }, { "epoch": 0.42377260981912146, "grad_norm": 346.9455261230469, "learning_rate": 1.152454780361757e-06, "logits/chosen": -0.8515625, "logits/rejected": -0.859375, "logps/chosen": -146.0, "logps/rejected": -132.0, "loss": 0.59, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11181640625, "rewards/margins": 0.255859375, "rewards/rejected": -0.14453125, "step": 164 }, { "epoch": 0.4263565891472868, "grad_norm": 384.1201477050781, "learning_rate": 1.1472868217054264e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.8125, "logps/chosen": -136.0, "logps/rejected": -198.0, "loss": 0.6001, "rewards/accuracies": 0.6875, "rewards/chosen": 0.00860595703125, "rewards/margins": 0.216796875, "rewards/rejected": -0.208984375, "step": 165 }, { "epoch": 0.4289405684754522, "grad_norm": 384.46002197265625, "learning_rate": 1.1421188630490957e-06, "logits/chosen": -0.828125, "logits/rejected": -0.8359375, "logps/chosen": -146.0, "logps/rejected": -142.0, "loss": 0.6613, "rewards/accuracies": 0.65625, "rewards/chosen": 0.078125, "rewards/margins": 0.09326171875, "rewards/rejected": -0.014892578125, "step": 166 }, { "epoch": 0.4315245478036176, "grad_norm": 333.75518798828125, "learning_rate": 1.1369509043927648e-06, "logits/chosen": -0.83984375, "logits/rejected": -0.84765625, "logps/chosen": -134.0, "logps/rejected": -140.0, "loss": 0.5698, "rewards/accuracies": 0.75, "rewards/chosen": 0.1552734375, "rewards/margins": 0.298828125, "rewards/rejected": -0.14453125, "step": 167 }, { "epoch": 0.43410852713178294, "grad_norm": 369.3163757324219, "learning_rate": 1.1317829457364341e-06, "logits/chosen": -0.875, "logits/rejected": -0.84765625, "logps/chosen": -154.0, "logps/rejected": -151.0, "loss": 0.633, "rewards/accuracies": 0.625, "rewards/chosen": 0.0234375, "rewards/margins": 0.166015625, "rewards/rejected": -0.142578125, "step": 168 }, { "epoch": 0.43669250645994834, "grad_norm": 356.31121826171875, "learning_rate": 1.1266149870801035e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.83203125, "logps/chosen": -138.0, "logps/rejected": -131.0, "loss": 0.6216, "rewards/accuracies": 0.6875, "rewards/chosen": 0.08203125, "rewards/margins": 0.1806640625, "rewards/rejected": -0.0986328125, "step": 169 }, { "epoch": 0.4392764857881137, "grad_norm": 378.68572998046875, "learning_rate": 1.1214470284237724e-06, "logits/chosen": -0.86328125, "logits/rejected": -0.87109375, "logps/chosen": -126.5, "logps/rejected": -140.0, "loss": 0.6583, "rewards/accuracies": 0.59375, "rewards/chosen": 0.0341796875, "rewards/margins": 0.09912109375, "rewards/rejected": -0.06494140625, "step": 170 }, { "epoch": 0.4418604651162791, "grad_norm": 371.9620056152344, "learning_rate": 1.1162790697674417e-06, "logits/chosen": -0.83984375, "logits/rejected": -0.87109375, "logps/chosen": -162.0, "logps/rejected": -153.0, "loss": 0.6076, "rewards/accuracies": 0.65625, "rewards/chosen": 0.1435546875, "rewards/margins": 0.240234375, "rewards/rejected": -0.09619140625, "step": 171 }, { "epoch": 0.4444444444444444, "grad_norm": 378.2386474609375, "learning_rate": 1.111111111111111e-06, "logits/chosen": -0.83203125, "logits/rejected": -0.80078125, "logps/chosen": -127.0, "logps/rejected": -136.0, "loss": 0.646, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0257568359375, "rewards/margins": 0.130859375, "rewards/rejected": -0.10546875, "step": 172 }, { "epoch": 0.4470284237726098, "grad_norm": 342.5321044921875, "learning_rate": 1.1059431524547802e-06, "logits/chosen": -0.86328125, "logits/rejected": -0.875, "logps/chosen": -133.0, "logps/rejected": -142.0, "loss": 0.603, "rewards/accuracies": 0.71875, "rewards/chosen": 0.06640625, "rewards/margins": 0.2177734375, "rewards/rejected": -0.1513671875, "step": 173 }, { "epoch": 0.4496124031007752, "grad_norm": 353.12591552734375, "learning_rate": 1.1007751937984495e-06, "logits/chosen": -0.8125, "logits/rejected": -0.79296875, "logps/chosen": -125.5, "logps/rejected": -136.0, "loss": 0.615, "rewards/accuracies": 0.625, "rewards/chosen": 0.00628662109375, "rewards/margins": 0.197265625, "rewards/rejected": -0.1904296875, "step": 174 }, { "epoch": 0.45219638242894056, "grad_norm": 361.20269775390625, "learning_rate": 1.0956072351421188e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.8046875, "logps/chosen": -147.0, "logps/rejected": -124.5, "loss": 0.6301, "rewards/accuracies": 0.65625, "rewards/chosen": 0.06640625, "rewards/margins": 0.1611328125, "rewards/rejected": -0.0947265625, "step": 175 }, { "epoch": 0.45478036175710596, "grad_norm": 350.6606750488281, "learning_rate": 1.0904392764857881e-06, "logits/chosen": -0.83203125, "logits/rejected": -0.8125, "logps/chosen": -139.0, "logps/rejected": -129.0, "loss": 0.5934, "rewards/accuracies": 0.75, "rewards/chosen": 0.01953125, "rewards/margins": 0.24609375, "rewards/rejected": -0.2255859375, "step": 176 }, { "epoch": 0.4573643410852713, "grad_norm": 326.9544677734375, "learning_rate": 1.0852713178294573e-06, "logits/chosen": -0.84765625, "logits/rejected": -0.84375, "logps/chosen": -143.0, "logps/rejected": -135.0, "loss": 0.5634, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0986328125, "rewards/margins": 0.31640625, "rewards/rejected": -0.2177734375, "step": 177 }, { "epoch": 0.4599483204134367, "grad_norm": 339.9979248046875, "learning_rate": 1.0801033591731266e-06, "logits/chosen": -0.859375, "logits/rejected": -0.87109375, "logps/chosen": -125.5, "logps/rejected": -119.5, "loss": 0.6461, "rewards/accuracies": 0.5625, "rewards/chosen": 0.00390625, "rewards/margins": 0.130859375, "rewards/rejected": -0.126953125, "step": 178 }, { "epoch": 0.4625322997416021, "grad_norm": 327.41778564453125, "learning_rate": 1.074935400516796e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.79296875, "logps/chosen": -129.0, "logps/rejected": -127.0, "loss": 0.5596, "rewards/accuracies": 0.84375, "rewards/chosen": 0.12353515625, "rewards/margins": 0.326171875, "rewards/rejected": -0.203125, "step": 179 }, { "epoch": 0.46511627906976744, "grad_norm": 364.97479248046875, "learning_rate": 1.069767441860465e-06, "logits/chosen": -0.85546875, "logits/rejected": -0.859375, "logps/chosen": -135.0, "logps/rejected": -154.0, "loss": 0.6108, "rewards/accuracies": 0.65625, "rewards/chosen": 0.053955078125, "rewards/margins": 0.2099609375, "rewards/rejected": -0.15625, "step": 180 }, { "epoch": 0.46770025839793283, "grad_norm": 326.265869140625, "learning_rate": 1.0645994832041344e-06, "logits/chosen": -0.8515625, "logits/rejected": -0.82421875, "logps/chosen": -129.0, "logps/rejected": -127.0, "loss": 0.6075, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0771484375, "rewards/margins": 0.2177734375, "rewards/rejected": -0.1396484375, "step": 181 }, { "epoch": 0.4702842377260982, "grad_norm": 368.4969177246094, "learning_rate": 1.0594315245478035e-06, "logits/chosen": -0.859375, "logits/rejected": -0.8671875, "logps/chosen": -131.0, "logps/rejected": -125.0, "loss": 0.6359, "rewards/accuracies": 0.6875, "rewards/chosen": 0.00154876708984375, "rewards/margins": 0.154296875, "rewards/rejected": -0.15234375, "step": 182 }, { "epoch": 0.4728682170542636, "grad_norm": 380.64892578125, "learning_rate": 1.0542635658914728e-06, "logits/chosen": -0.88671875, "logits/rejected": -0.86328125, "logps/chosen": -162.0, "logps/rejected": -159.0, "loss": 0.5272, "rewards/accuracies": 0.875, "rewards/chosen": 0.1982421875, "rewards/margins": 0.40234375, "rewards/rejected": -0.203125, "step": 183 }, { "epoch": 0.4754521963824289, "grad_norm": 370.6021728515625, "learning_rate": 1.049095607235142e-06, "logits/chosen": -0.859375, "logits/rejected": -0.84765625, "logps/chosen": -124.0, "logps/rejected": -137.0, "loss": 0.6156, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07763671875, "rewards/margins": 0.1875, "rewards/rejected": -0.1103515625, "step": 184 }, { "epoch": 0.4780361757105943, "grad_norm": 383.2211608886719, "learning_rate": 1.0439276485788113e-06, "logits/chosen": -0.859375, "logits/rejected": -0.87109375, "logps/chosen": -145.0, "logps/rejected": -144.0, "loss": 0.6074, "rewards/accuracies": 0.59375, "rewards/chosen": 0.06103515625, "rewards/margins": 0.2138671875, "rewards/rejected": -0.1533203125, "step": 185 }, { "epoch": 0.4806201550387597, "grad_norm": 377.28411865234375, "learning_rate": 1.0387596899224806e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.81640625, "logps/chosen": -126.5, "logps/rejected": -134.0, "loss": 0.6229, "rewards/accuracies": 0.6875, "rewards/chosen": 0.095703125, "rewards/margins": 0.1923828125, "rewards/rejected": -0.0966796875, "step": 186 }, { "epoch": 0.48320413436692505, "grad_norm": 355.7249450683594, "learning_rate": 1.0335917312661497e-06, "logits/chosen": -0.8671875, "logits/rejected": -0.8671875, "logps/chosen": -152.0, "logps/rejected": -143.0, "loss": 0.5508, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1171875, "rewards/margins": 0.369140625, "rewards/rejected": -0.251953125, "step": 187 }, { "epoch": 0.48578811369509045, "grad_norm": 371.69903564453125, "learning_rate": 1.028423772609819e-06, "logits/chosen": -0.85546875, "logits/rejected": -0.859375, "logps/chosen": -144.0, "logps/rejected": -161.0, "loss": 0.5718, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1328125, "rewards/margins": 0.294921875, "rewards/rejected": -0.1630859375, "step": 188 }, { "epoch": 0.4883720930232558, "grad_norm": 366.8398132324219, "learning_rate": 1.0232558139534884e-06, "logits/chosen": -0.8125, "logits/rejected": -0.84375, "logps/chosen": -126.0, "logps/rejected": -133.0, "loss": 0.5823, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10009765625, "rewards/margins": 0.267578125, "rewards/rejected": -0.1669921875, "step": 189 }, { "epoch": 0.4909560723514212, "grad_norm": 408.7562561035156, "learning_rate": 1.0180878552971577e-06, "logits/chosen": -0.81640625, "logits/rejected": -0.87109375, "logps/chosen": -134.0, "logps/rejected": -134.0, "loss": 0.6008, "rewards/accuracies": 0.75, "rewards/chosen": 0.09130859375, "rewards/margins": 0.23828125, "rewards/rejected": -0.1474609375, "step": 190 }, { "epoch": 0.4935400516795866, "grad_norm": 382.720458984375, "learning_rate": 1.0129198966408268e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.83984375, "logps/chosen": -149.0, "logps/rejected": -139.0, "loss": 0.5869, "rewards/accuracies": 0.75, "rewards/chosen": 0.07177734375, "rewards/margins": 0.271484375, "rewards/rejected": -0.2001953125, "step": 191 }, { "epoch": 0.49612403100775193, "grad_norm": 385.51629638671875, "learning_rate": 1.0077519379844962e-06, "logits/chosen": -0.8515625, "logits/rejected": -0.8671875, "logps/chosen": -147.0, "logps/rejected": -150.0, "loss": 0.6169, "rewards/accuracies": 0.65625, "rewards/chosen": 0.09228515625, "rewards/margins": 0.2138671875, "rewards/rejected": -0.1220703125, "step": 192 }, { "epoch": 0.49870801033591733, "grad_norm": 335.9141540527344, "learning_rate": 1.0025839793281655e-06, "logits/chosen": -0.828125, "logits/rejected": -0.828125, "logps/chosen": -112.0, "logps/rejected": -128.0, "loss": 0.6129, "rewards/accuracies": 0.71875, "rewards/chosen": 0.02197265625, "rewards/margins": 0.201171875, "rewards/rejected": -0.1796875, "step": 193 }, { "epoch": 0.5012919896640827, "grad_norm": 351.80316162109375, "learning_rate": 9.974160206718346e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.84375, "logps/chosen": -144.0, "logps/rejected": -145.0, "loss": 0.6016, "rewards/accuracies": 0.65625, "rewards/chosen": 0.09228515625, "rewards/margins": 0.2421875, "rewards/rejected": -0.150390625, "step": 194 }, { "epoch": 0.5038759689922481, "grad_norm": 338.88427734375, "learning_rate": 9.922480620155037e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.84375, "logps/chosen": -117.0, "logps/rejected": -111.5, "loss": 0.6527, "rewards/accuracies": 0.5625, "rewards/chosen": -0.0303955078125, "rewards/margins": 0.109375, "rewards/rejected": -0.1396484375, "step": 195 }, { "epoch": 0.5064599483204134, "grad_norm": 370.98345947265625, "learning_rate": 9.87080103359173e-07, "logits/chosen": -0.828125, "logits/rejected": -0.8515625, "logps/chosen": -155.0, "logps/rejected": -156.0, "loss": 0.5913, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03369140625, "rewards/margins": 0.267578125, "rewards/rejected": -0.2333984375, "step": 196 }, { "epoch": 0.5090439276485789, "grad_norm": 360.0625, "learning_rate": 9.819121447028424e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.8359375, "logps/chosen": -112.0, "logps/rejected": -136.0, "loss": 0.6224, "rewards/accuracies": 0.59375, "rewards/chosen": -0.008544921875, "rewards/margins": 0.173828125, "rewards/rejected": -0.181640625, "step": 197 }, { "epoch": 0.5116279069767442, "grad_norm": 333.0406188964844, "learning_rate": 9.767441860465115e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.84375, "logps/chosen": -137.0, "logps/rejected": -137.0, "loss": 0.5659, "rewards/accuracies": 0.71875, "rewards/chosen": 0.09912109375, "rewards/margins": 0.328125, "rewards/rejected": -0.2294921875, "step": 198 }, { "epoch": 0.5142118863049095, "grad_norm": 357.7864685058594, "learning_rate": 9.715762273901809e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.859375, "logps/chosen": -145.0, "logps/rejected": -155.0, "loss": 0.5864, "rewards/accuracies": 0.78125, "rewards/chosen": 0.076171875, "rewards/margins": 0.2734375, "rewards/rejected": -0.197265625, "step": 199 }, { "epoch": 0.5167958656330749, "grad_norm": 360.8147277832031, "learning_rate": 9.6640826873385e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.87109375, "logps/chosen": -136.0, "logps/rejected": -137.0, "loss": 0.6389, "rewards/accuracies": 0.59375, "rewards/chosen": 0.01409912109375, "rewards/margins": 0.150390625, "rewards/rejected": -0.1357421875, "step": 200 }, { "epoch": 0.5193798449612403, "grad_norm": 353.4968566894531, "learning_rate": 9.612403100775193e-07, "logits/chosen": -0.828125, "logits/rejected": -0.828125, "logps/chosen": -138.0, "logps/rejected": -146.0, "loss": 0.5942, "rewards/accuracies": 0.65625, "rewards/chosen": -0.030517578125, "rewards/margins": 0.2470703125, "rewards/rejected": -0.27734375, "step": 201 }, { "epoch": 0.5219638242894057, "grad_norm": 364.1571960449219, "learning_rate": 9.560723514211886e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.890625, "logps/chosen": -140.0, "logps/rejected": -155.0, "loss": 0.5748, "rewards/accuracies": 0.71875, "rewards/chosen": 0.050048828125, "rewards/margins": 0.3125, "rewards/rejected": -0.26171875, "step": 202 }, { "epoch": 0.524547803617571, "grad_norm": 349.590087890625, "learning_rate": 9.509043927648578e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.85546875, "logps/chosen": -137.0, "logps/rejected": -148.0, "loss": 0.6078, "rewards/accuracies": 0.71875, "rewards/chosen": 0.042236328125, "rewards/margins": 0.2197265625, "rewards/rejected": -0.177734375, "step": 203 }, { "epoch": 0.5271317829457365, "grad_norm": 326.5566711425781, "learning_rate": 9.457364341085271e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.8203125, "logps/chosen": -137.0, "logps/rejected": -126.0, "loss": 0.577, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03515625, "rewards/margins": 0.27734375, "rewards/rejected": -0.2412109375, "step": 204 }, { "epoch": 0.5297157622739018, "grad_norm": 361.8912658691406, "learning_rate": 9.405684754521963e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.859375, "logps/chosen": -146.0, "logps/rejected": -145.0, "loss": 0.5764, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0108642578125, "rewards/margins": 0.3046875, "rewards/rejected": -0.29296875, "step": 205 }, { "epoch": 0.5322997416020672, "grad_norm": 393.8551940917969, "learning_rate": 9.354005167958656e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.796875, "logps/chosen": -131.0, "logps/rejected": -154.0, "loss": 0.5933, "rewards/accuracies": 0.6875, "rewards/chosen": 0.08349609375, "rewards/margins": 0.240234375, "rewards/rejected": -0.15625, "step": 206 }, { "epoch": 0.5348837209302325, "grad_norm": 394.2397766113281, "learning_rate": 9.302325581395349e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.7890625, "logps/chosen": -158.0, "logps/rejected": -125.5, "loss": 0.5694, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0859375, "rewards/margins": 0.32421875, "rewards/rejected": -0.2392578125, "step": 207 }, { "epoch": 0.537467700258398, "grad_norm": 412.0761413574219, "learning_rate": 9.250645994832042e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.84765625, "logps/chosen": -130.0, "logps/rejected": -133.0, "loss": 0.6389, "rewards/accuracies": 0.65625, "rewards/chosen": -0.0084228515625, "rewards/margins": 0.15625, "rewards/rejected": -0.1640625, "step": 208 }, { "epoch": 0.5400516795865633, "grad_norm": 327.9852294921875, "learning_rate": 9.198966408268733e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.8203125, "logps/chosen": -130.0, "logps/rejected": -139.0, "loss": 0.5293, "rewards/accuracies": 0.875, "rewards/chosen": 0.1171875, "rewards/margins": 0.408203125, "rewards/rejected": -0.291015625, "step": 209 }, { "epoch": 0.5426356589147286, "grad_norm": 356.892333984375, "learning_rate": 9.147286821705425e-07, "logits/chosen": -0.875, "logits/rejected": -0.859375, "logps/chosen": -149.0, "logps/rejected": -134.0, "loss": 0.512, "rewards/accuracies": 0.84375, "rewards/chosen": 0.09228515625, "rewards/margins": 0.44140625, "rewards/rejected": -0.349609375, "step": 210 }, { "epoch": 0.5452196382428941, "grad_norm": 369.5984191894531, "learning_rate": 9.095607235142119e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.86328125, "logps/chosen": -139.0, "logps/rejected": -145.0, "loss": 0.6122, "rewards/accuracies": 0.65625, "rewards/chosen": 0.04931640625, "rewards/margins": 0.2177734375, "rewards/rejected": -0.1689453125, "step": 211 }, { "epoch": 0.5478036175710594, "grad_norm": 357.82122802734375, "learning_rate": 9.043927648578811e-07, "logits/chosen": -0.828125, "logits/rejected": -0.76953125, "logps/chosen": -138.0, "logps/rejected": -128.0, "loss": 0.5928, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08154296875, "rewards/margins": 0.259765625, "rewards/rejected": -0.1787109375, "step": 212 }, { "epoch": 0.5503875968992248, "grad_norm": 366.8385314941406, "learning_rate": 8.992248062015504e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.83984375, "logps/chosen": -143.0, "logps/rejected": -160.0, "loss": 0.5735, "rewards/accuracies": 0.75, "rewards/chosen": 0.061767578125, "rewards/margins": 0.294921875, "rewards/rejected": -0.2333984375, "step": 213 }, { "epoch": 0.5529715762273901, "grad_norm": 337.5374450683594, "learning_rate": 8.940568475452196e-07, "logits/chosen": -0.8125, "logits/rejected": -0.80078125, "logps/chosen": -139.0, "logps/rejected": -132.0, "loss": 0.6036, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0186767578125, "rewards/margins": 0.2216796875, "rewards/rejected": -0.203125, "step": 214 }, { "epoch": 0.5555555555555556, "grad_norm": 388.3349914550781, "learning_rate": 8.888888888888888e-07, "logits/chosen": -0.828125, "logits/rejected": -0.8515625, "logps/chosen": -143.0, "logps/rejected": -144.0, "loss": 0.6125, "rewards/accuracies": 0.71875, "rewards/chosen": -0.04052734375, "rewards/margins": 0.19921875, "rewards/rejected": -0.240234375, "step": 215 }, { "epoch": 0.5581395348837209, "grad_norm": 391.5953063964844, "learning_rate": 8.837209302325581e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.8359375, "logps/chosen": -138.0, "logps/rejected": -151.0, "loss": 0.6274, "rewards/accuracies": 0.65625, "rewards/chosen": 0.023681640625, "rewards/margins": 0.18359375, "rewards/rejected": -0.1591796875, "step": 216 }, { "epoch": 0.5607235142118863, "grad_norm": 408.422607421875, "learning_rate": 8.785529715762273e-07, "logits/chosen": -0.80078125, "logits/rejected": -0.83203125, "logps/chosen": -121.5, "logps/rejected": -152.0, "loss": 0.6159, "rewards/accuracies": 0.71875, "rewards/chosen": -0.028076171875, "rewards/margins": 0.2138671875, "rewards/rejected": -0.2421875, "step": 217 }, { "epoch": 0.5633074935400517, "grad_norm": 315.7479553222656, "learning_rate": 8.733850129198967e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.8828125, "logps/chosen": -138.0, "logps/rejected": -137.0, "loss": 0.5319, "rewards/accuracies": 0.90625, "rewards/chosen": 0.078125, "rewards/margins": 0.388671875, "rewards/rejected": -0.310546875, "step": 218 }, { "epoch": 0.5658914728682171, "grad_norm": 338.3675231933594, "learning_rate": 8.682170542635659e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.875, "logps/chosen": -160.0, "logps/rejected": -137.0, "loss": 0.5379, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1640625, "rewards/margins": 0.375, "rewards/rejected": -0.2109375, "step": 219 }, { "epoch": 0.5684754521963824, "grad_norm": 367.66473388671875, "learning_rate": 8.630490956072352e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.82421875, "logps/chosen": -132.0, "logps/rejected": -135.0, "loss": 0.5655, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0625, "rewards/margins": 0.306640625, "rewards/rejected": -0.2451171875, "step": 220 }, { "epoch": 0.5710594315245479, "grad_norm": 350.5587158203125, "learning_rate": 8.578811369509043e-07, "logits/chosen": -0.859375, "logits/rejected": -0.85546875, "logps/chosen": -122.0, "logps/rejected": -132.0, "loss": 0.5753, "rewards/accuracies": 0.71875, "rewards/chosen": 0.02734375, "rewards/margins": 0.30078125, "rewards/rejected": -0.2734375, "step": 221 }, { "epoch": 0.5736434108527132, "grad_norm": 361.6526184082031, "learning_rate": 8.527131782945736e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.85546875, "logps/chosen": -138.0, "logps/rejected": -139.0, "loss": 0.5745, "rewards/accuracies": 0.71875, "rewards/chosen": 0.06591796875, "rewards/margins": 0.29296875, "rewards/rejected": -0.2275390625, "step": 222 }, { "epoch": 0.5762273901808785, "grad_norm": 361.86065673828125, "learning_rate": 8.475452196382429e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.8515625, "logps/chosen": -130.0, "logps/rejected": -137.0, "loss": 0.6071, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1025390625, "rewards/margins": 0.2177734375, "rewards/rejected": -0.11572265625, "step": 223 }, { "epoch": 0.5788113695090439, "grad_norm": 364.85150146484375, "learning_rate": 8.423772609819121e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.8359375, "logps/chosen": -143.0, "logps/rejected": -151.0, "loss": 0.5748, "rewards/accuracies": 0.65625, "rewards/chosen": 0.03515625, "rewards/margins": 0.302734375, "rewards/rejected": -0.267578125, "step": 224 }, { "epoch": 0.5813953488372093, "grad_norm": 378.9034423828125, "learning_rate": 8.372093023255814e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8515625, "logps/chosen": -152.0, "logps/rejected": -130.0, "loss": 0.5606, "rewards/accuracies": 0.65625, "rewards/chosen": 0.046142578125, "rewards/margins": 0.341796875, "rewards/rejected": -0.296875, "step": 225 }, { "epoch": 0.5839793281653747, "grad_norm": 377.5055847167969, "learning_rate": 8.320413436692506e-07, "logits/chosen": -0.859375, "logits/rejected": -0.86328125, "logps/chosen": -132.0, "logps/rejected": -150.0, "loss": 0.5322, "rewards/accuracies": 0.96875, "rewards/chosen": 0.10693359375, "rewards/margins": 0.37890625, "rewards/rejected": -0.271484375, "step": 226 }, { "epoch": 0.58656330749354, "grad_norm": 362.3092956542969, "learning_rate": 8.268733850129198e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.86328125, "logps/chosen": -135.0, "logps/rejected": -136.0, "loss": 0.5547, "rewards/accuracies": 0.6875, "rewards/chosen": 0.06787109375, "rewards/margins": 0.353515625, "rewards/rejected": -0.28515625, "step": 227 }, { "epoch": 0.5891472868217055, "grad_norm": 356.24755859375, "learning_rate": 8.217054263565891e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.8203125, "logps/chosen": -143.0, "logps/rejected": -140.0, "loss": 0.545, "rewards/accuracies": 0.875, "rewards/chosen": 0.09619140625, "rewards/margins": 0.369140625, "rewards/rejected": -0.271484375, "step": 228 }, { "epoch": 0.5917312661498708, "grad_norm": 378.0314025878906, "learning_rate": 8.165374677002583e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.90234375, "logps/chosen": -150.0, "logps/rejected": -136.0, "loss": 0.5986, "rewards/accuracies": 0.71875, "rewards/chosen": 0.032958984375, "rewards/margins": 0.25, "rewards/rejected": -0.2177734375, "step": 229 }, { "epoch": 0.5943152454780362, "grad_norm": 335.54901123046875, "learning_rate": 8.113695090439277e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.796875, "logps/chosen": -137.0, "logps/rejected": -146.0, "loss": 0.5579, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0546875, "rewards/margins": 0.337890625, "rewards/rejected": -0.283203125, "step": 230 }, { "epoch": 0.5968992248062015, "grad_norm": 350.567626953125, "learning_rate": 8.062015503875969e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.8671875, "logps/chosen": -127.5, "logps/rejected": -131.0, "loss": 0.5854, "rewards/accuracies": 0.625, "rewards/chosen": 0.01953125, "rewards/margins": 0.29296875, "rewards/rejected": -0.2734375, "step": 231 }, { "epoch": 0.599483204134367, "grad_norm": 325.7544860839844, "learning_rate": 8.010335917312661e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.8671875, "logps/chosen": -149.0, "logps/rejected": -127.0, "loss": 0.5523, "rewards/accuracies": 0.8125, "rewards/chosen": 0.07568359375, "rewards/margins": 0.341796875, "rewards/rejected": -0.265625, "step": 232 }, { "epoch": 0.6020671834625323, "grad_norm": 349.6297607421875, "learning_rate": 7.958656330749353e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.828125, "logps/chosen": -145.0, "logps/rejected": -131.0, "loss": 0.5614, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0625, "rewards/margins": 0.322265625, "rewards/rejected": -0.259765625, "step": 233 }, { "epoch": 0.6046511627906976, "grad_norm": 377.7822265625, "learning_rate": 7.906976744186046e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.8828125, "logps/chosen": -158.0, "logps/rejected": -147.0, "loss": 0.5689, "rewards/accuracies": 0.75, "rewards/chosen": 0.01953125, "rewards/margins": 0.328125, "rewards/rejected": -0.30859375, "step": 234 }, { "epoch": 0.6072351421188631, "grad_norm": 361.43487548828125, "learning_rate": 7.855297157622739e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.85546875, "logps/chosen": -137.0, "logps/rejected": -134.0, "loss": 0.5818, "rewards/accuracies": 0.65625, "rewards/chosen": 0.002349853515625, "rewards/margins": 0.28515625, "rewards/rejected": -0.28125, "step": 235 }, { "epoch": 0.6098191214470284, "grad_norm": 368.1749572753906, "learning_rate": 7.803617571059431e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.88671875, "logps/chosen": -141.0, "logps/rejected": -158.0, "loss": 0.5587, "rewards/accuracies": 0.75, "rewards/chosen": 0.061767578125, "rewards/margins": 0.328125, "rewards/rejected": -0.265625, "step": 236 }, { "epoch": 0.6124031007751938, "grad_norm": 392.1849060058594, "learning_rate": 7.751937984496125e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.796875, "logps/chosen": -140.0, "logps/rejected": -134.0, "loss": 0.598, "rewards/accuracies": 0.75, "rewards/chosen": -0.004547119140625, "rewards/margins": 0.2490234375, "rewards/rejected": -0.25390625, "step": 237 }, { "epoch": 0.6149870801033591, "grad_norm": 371.883056640625, "learning_rate": 7.700258397932816e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.82421875, "logps/chosen": -145.0, "logps/rejected": -136.0, "loss": 0.5367, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03515625, "rewards/margins": 0.41796875, "rewards/rejected": -0.3828125, "step": 238 }, { "epoch": 0.6175710594315246, "grad_norm": 394.88043212890625, "learning_rate": 7.648578811369508e-07, "logits/chosen": -0.859375, "logits/rejected": -0.8359375, "logps/chosen": -143.0, "logps/rejected": -136.0, "loss": 0.5676, "rewards/accuracies": 0.75, "rewards/chosen": 0.1513671875, "rewards/margins": 0.306640625, "rewards/rejected": -0.154296875, "step": 239 }, { "epoch": 0.6201550387596899, "grad_norm": 401.91900634765625, "learning_rate": 7.596899224806201e-07, "logits/chosen": -0.859375, "logits/rejected": -0.85546875, "logps/chosen": -146.0, "logps/rejected": -147.0, "loss": 0.6092, "rewards/accuracies": 0.625, "rewards/chosen": -0.0673828125, "rewards/margins": 0.2314453125, "rewards/rejected": -0.298828125, "step": 240 }, { "epoch": 0.6227390180878553, "grad_norm": 392.7043151855469, "learning_rate": 7.545219638242894e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.83203125, "logps/chosen": -147.0, "logps/rejected": -134.0, "loss": 0.5666, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07421875, "rewards/margins": 0.302734375, "rewards/rejected": -0.228515625, "step": 241 }, { "epoch": 0.6253229974160207, "grad_norm": 308.71868896484375, "learning_rate": 7.493540051679587e-07, "logits/chosen": -0.796875, "logits/rejected": -0.83203125, "logps/chosen": -127.0, "logps/rejected": -133.0, "loss": 0.5036, "rewards/accuracies": 0.875, "rewards/chosen": 0.08837890625, "rewards/margins": 0.4765625, "rewards/rejected": -0.38671875, "step": 242 }, { "epoch": 0.627906976744186, "grad_norm": 391.1969909667969, "learning_rate": 7.441860465116279e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.86328125, "logps/chosen": -165.0, "logps/rejected": -139.0, "loss": 0.5482, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0281982421875, "rewards/margins": 0.39453125, "rewards/rejected": -0.365234375, "step": 243 }, { "epoch": 0.6304909560723514, "grad_norm": 359.4422302246094, "learning_rate": 7.390180878552971e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.83203125, "logps/chosen": -127.5, "logps/rejected": -143.0, "loss": 0.5789, "rewards/accuracies": 0.75, "rewards/chosen": -0.00860595703125, "rewards/margins": 0.2890625, "rewards/rejected": -0.296875, "step": 244 }, { "epoch": 0.6330749354005168, "grad_norm": 336.4054260253906, "learning_rate": 7.338501291989664e-07, "logits/chosen": -0.84375, "logits/rejected": -0.84375, "logps/chosen": -144.0, "logps/rejected": -140.0, "loss": 0.5264, "rewards/accuracies": 0.78125, "rewards/chosen": 0.10498046875, "rewards/margins": 0.447265625, "rewards/rejected": -0.341796875, "step": 245 }, { "epoch": 0.6356589147286822, "grad_norm": 370.9283447265625, "learning_rate": 7.286821705426356e-07, "logits/chosen": -0.859375, "logits/rejected": -0.8125, "logps/chosen": -133.0, "logps/rejected": -134.0, "loss": 0.5901, "rewards/accuracies": 0.625, "rewards/chosen": 0.027587890625, "rewards/margins": 0.26171875, "rewards/rejected": -0.234375, "step": 246 }, { "epoch": 0.6382428940568475, "grad_norm": 347.1625061035156, "learning_rate": 7.235142118863049e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.8359375, "logps/chosen": -146.0, "logps/rejected": -137.0, "loss": 0.5607, "rewards/accuracies": 0.78125, "rewards/chosen": -0.00946044921875, "rewards/margins": 0.369140625, "rewards/rejected": -0.37890625, "step": 247 }, { "epoch": 0.6408268733850129, "grad_norm": 403.0948791503906, "learning_rate": 7.183462532299741e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.828125, "logps/chosen": -119.5, "logps/rejected": -120.0, "loss": 0.6028, "rewards/accuracies": 0.71875, "rewards/chosen": -0.046142578125, "rewards/margins": 0.220703125, "rewards/rejected": -0.265625, "step": 248 }, { "epoch": 0.6434108527131783, "grad_norm": 351.85125732421875, "learning_rate": 7.131782945736435e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.84375, "logps/chosen": -139.0, "logps/rejected": -142.0, "loss": 0.5043, "rewards/accuracies": 0.875, "rewards/chosen": 0.12060546875, "rewards/margins": 0.466796875, "rewards/rejected": -0.345703125, "step": 249 }, { "epoch": 0.6459948320413437, "grad_norm": 362.1929626464844, "learning_rate": 7.080103359173126e-07, "logits/chosen": -0.84375, "logits/rejected": -0.84375, "logps/chosen": -137.0, "logps/rejected": -143.0, "loss": 0.6043, "rewards/accuracies": 0.625, "rewards/chosen": -0.0390625, "rewards/margins": 0.23046875, "rewards/rejected": -0.26953125, "step": 250 }, { "epoch": 0.648578811369509, "grad_norm": 360.3114013671875, "learning_rate": 7.028423772609818e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.8828125, "logps/chosen": -139.0, "logps/rejected": -137.0, "loss": 0.5684, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0673828125, "rewards/margins": 0.3359375, "rewards/rejected": -0.26953125, "step": 251 }, { "epoch": 0.6511627906976745, "grad_norm": 370.75030517578125, "learning_rate": 6.976744186046511e-07, "logits/chosen": -0.890625, "logits/rejected": -0.8984375, "logps/chosen": -151.0, "logps/rejected": -142.0, "loss": 0.5256, "rewards/accuracies": 0.875, "rewards/chosen": 0.12890625, "rewards/margins": 0.40234375, "rewards/rejected": -0.2734375, "step": 252 }, { "epoch": 0.6537467700258398, "grad_norm": 351.92132568359375, "learning_rate": 6.925064599483204e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.8671875, "logps/chosen": -144.0, "logps/rejected": -134.0, "loss": 0.5125, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0703125, "rewards/margins": 0.46484375, "rewards/rejected": -0.39453125, "step": 253 }, { "epoch": 0.6563307493540051, "grad_norm": 371.71484375, "learning_rate": 6.873385012919897e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.88671875, "logps/chosen": -155.0, "logps/rejected": -146.0, "loss": 0.5452, "rewards/accuracies": 0.75, "rewards/chosen": 0.01953125, "rewards/margins": 0.357421875, "rewards/rejected": -0.337890625, "step": 254 }, { "epoch": 0.6589147286821705, "grad_norm": 383.404052734375, "learning_rate": 6.821705426356589e-07, "logits/chosen": -0.859375, "logits/rejected": -0.859375, "logps/chosen": -162.0, "logps/rejected": -148.0, "loss": 0.5901, "rewards/accuracies": 0.71875, "rewards/chosen": -0.046875, "rewards/margins": 0.265625, "rewards/rejected": -0.3125, "step": 255 }, { "epoch": 0.661498708010336, "grad_norm": 377.6560363769531, "learning_rate": 6.770025839793282e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.84765625, "logps/chosen": -144.0, "logps/rejected": -129.0, "loss": 0.5852, "rewards/accuracies": 0.75, "rewards/chosen": -0.038330078125, "rewards/margins": 0.29296875, "rewards/rejected": -0.33203125, "step": 256 }, { "epoch": 0.6640826873385013, "grad_norm": 344.1567687988281, "learning_rate": 6.718346253229974e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.82421875, "logps/chosen": -133.0, "logps/rejected": -129.0, "loss": 0.5424, "rewards/accuracies": 0.75, "rewards/chosen": 0.03515625, "rewards/margins": 0.376953125, "rewards/rejected": -0.33984375, "step": 257 }, { "epoch": 0.6666666666666666, "grad_norm": 415.87835693359375, "learning_rate": 6.666666666666666e-07, "logits/chosen": -0.828125, "logits/rejected": -0.83984375, "logps/chosen": -138.0, "logps/rejected": -134.0, "loss": 0.5995, "rewards/accuracies": 0.75, "rewards/chosen": 0.0030517578125, "rewards/margins": 0.27734375, "rewards/rejected": -0.275390625, "step": 258 }, { "epoch": 0.6692506459948321, "grad_norm": 374.7701721191406, "learning_rate": 6.614987080103359e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.85546875, "logps/chosen": -142.0, "logps/rejected": -133.0, "loss": 0.602, "rewards/accuracies": 0.75, "rewards/chosen": -0.0186767578125, "rewards/margins": 0.26171875, "rewards/rejected": -0.28125, "step": 259 }, { "epoch": 0.6718346253229974, "grad_norm": 357.5523376464844, "learning_rate": 6.563307493540052e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.8515625, "logps/chosen": -133.0, "logps/rejected": -141.0, "loss": 0.6002, "rewards/accuracies": 0.71875, "rewards/chosen": 0.00299072265625, "rewards/margins": 0.2470703125, "rewards/rejected": -0.244140625, "step": 260 }, { "epoch": 0.6744186046511628, "grad_norm": 395.4364929199219, "learning_rate": 6.511627906976745e-07, "logits/chosen": -0.84375, "logits/rejected": -0.84765625, "logps/chosen": -129.0, "logps/rejected": -144.0, "loss": 0.6077, "rewards/accuracies": 0.6875, "rewards/chosen": -0.022705078125, "rewards/margins": 0.26171875, "rewards/rejected": -0.28515625, "step": 261 }, { "epoch": 0.6770025839793282, "grad_norm": 397.8664855957031, "learning_rate": 6.459948320413436e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.87109375, "logps/chosen": -142.0, "logps/rejected": -146.0, "loss": 0.5885, "rewards/accuracies": 0.6875, "rewards/chosen": -0.07568359375, "rewards/margins": 0.255859375, "rewards/rejected": -0.33203125, "step": 262 }, { "epoch": 0.6795865633074936, "grad_norm": 370.6977233886719, "learning_rate": 6.408268733850128e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.85546875, "logps/chosen": -140.0, "logps/rejected": -135.0, "loss": 0.567, "rewards/accuracies": 0.84375, "rewards/chosen": 0.04052734375, "rewards/margins": 0.353515625, "rewards/rejected": -0.3125, "step": 263 }, { "epoch": 0.6821705426356589, "grad_norm": 344.52294921875, "learning_rate": 6.356589147286822e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.87109375, "logps/chosen": -132.0, "logps/rejected": -141.0, "loss": 0.5358, "rewards/accuracies": 0.75, "rewards/chosen": -0.0093994140625, "rewards/margins": 0.3984375, "rewards/rejected": -0.408203125, "step": 264 }, { "epoch": 0.6847545219638242, "grad_norm": 373.7255554199219, "learning_rate": 6.304909560723514e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.8515625, "logps/chosen": -132.0, "logps/rejected": -150.0, "loss": 0.536, "rewards/accuracies": 0.84375, "rewards/chosen": 0.02587890625, "rewards/margins": 0.416015625, "rewards/rejected": -0.390625, "step": 265 }, { "epoch": 0.6873385012919897, "grad_norm": 365.46527099609375, "learning_rate": 6.253229974160207e-07, "logits/chosen": -0.91796875, "logits/rejected": -0.90625, "logps/chosen": -132.0, "logps/rejected": -136.0, "loss": 0.5803, "rewards/accuracies": 0.625, "rewards/chosen": -0.0203857421875, "rewards/margins": 0.322265625, "rewards/rejected": -0.34375, "step": 266 }, { "epoch": 0.689922480620155, "grad_norm": 371.0267028808594, "learning_rate": 6.201550387596898e-07, "logits/chosen": -0.8984375, "logits/rejected": -0.87890625, "logps/chosen": -145.0, "logps/rejected": -140.0, "loss": 0.5389, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0703125, "rewards/margins": 0.40234375, "rewards/rejected": -0.33203125, "step": 267 }, { "epoch": 0.6925064599483204, "grad_norm": 391.9967041015625, "learning_rate": 6.149870801033591e-07, "logits/chosen": -0.890625, "logits/rejected": -0.88671875, "logps/chosen": -147.0, "logps/rejected": -153.0, "loss": 0.5749, "rewards/accuracies": 0.78125, "rewards/chosen": 0.000827789306640625, "rewards/margins": 0.291015625, "rewards/rejected": -0.2890625, "step": 268 }, { "epoch": 0.6950904392764858, "grad_norm": 388.2448425292969, "learning_rate": 6.098191214470284e-07, "logits/chosen": -0.875, "logits/rejected": -0.859375, "logps/chosen": -147.0, "logps/rejected": -135.0, "loss": 0.5569, "rewards/accuracies": 0.71875, "rewards/chosen": 0.032958984375, "rewards/margins": 0.3828125, "rewards/rejected": -0.349609375, "step": 269 }, { "epoch": 0.6976744186046512, "grad_norm": 397.50323486328125, "learning_rate": 6.046511627906976e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.87890625, "logps/chosen": -138.0, "logps/rejected": -138.0, "loss": 0.5377, "rewards/accuracies": 0.78125, "rewards/chosen": 0.006988525390625, "rewards/margins": 0.41015625, "rewards/rejected": -0.40234375, "step": 270 }, { "epoch": 0.7002583979328165, "grad_norm": 407.18768310546875, "learning_rate": 5.99483204134367e-07, "logits/chosen": -0.84375, "logits/rejected": -0.84765625, "logps/chosen": -149.0, "logps/rejected": -136.0, "loss": 0.5713, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.328125, "rewards/rejected": -0.30859375, "step": 271 }, { "epoch": 0.7028423772609819, "grad_norm": 377.3880920410156, "learning_rate": 5.943152454780362e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.8984375, "logps/chosen": -148.0, "logps/rejected": -143.0, "loss": 0.5552, "rewards/accuracies": 0.6875, "rewards/chosen": 0.006256103515625, "rewards/margins": 0.35546875, "rewards/rejected": -0.349609375, "step": 272 }, { "epoch": 0.7054263565891473, "grad_norm": 419.07037353515625, "learning_rate": 5.891472868217054e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.859375, "logps/chosen": -118.0, "logps/rejected": -139.0, "loss": 0.5958, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0311279296875, "rewards/margins": 0.26953125, "rewards/rejected": -0.30078125, "step": 273 }, { "epoch": 0.7080103359173127, "grad_norm": 386.485107421875, "learning_rate": 5.839793281653746e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.85546875, "logps/chosen": -138.0, "logps/rejected": -144.0, "loss": 0.6083, "rewards/accuracies": 0.59375, "rewards/chosen": -0.039794921875, "rewards/margins": 0.265625, "rewards/rejected": -0.3046875, "step": 274 }, { "epoch": 0.710594315245478, "grad_norm": 348.43505859375, "learning_rate": 5.788113695090438e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.87890625, "logps/chosen": -132.0, "logps/rejected": -131.0, "loss": 0.526, "rewards/accuracies": 0.875, "rewards/chosen": 0.00482177734375, "rewards/margins": 0.416015625, "rewards/rejected": -0.41015625, "step": 275 }, { "epoch": 0.7131782945736435, "grad_norm": 409.5932922363281, "learning_rate": 5.736434108527132e-07, "logits/chosen": -0.859375, "logits/rejected": -0.875, "logps/chosen": -136.0, "logps/rejected": -137.0, "loss": 0.5934, "rewards/accuracies": 0.6875, "rewards/chosen": -0.02734375, "rewards/margins": 0.2451171875, "rewards/rejected": -0.2734375, "step": 276 }, { "epoch": 0.7157622739018088, "grad_norm": 368.6764831542969, "learning_rate": 5.684754521963824e-07, "logits/chosen": -0.859375, "logits/rejected": -0.875, "logps/chosen": -137.0, "logps/rejected": -150.0, "loss": 0.5712, "rewards/accuracies": 0.78125, "rewards/chosen": -0.05078125, "rewards/margins": 0.333984375, "rewards/rejected": -0.384765625, "step": 277 }, { "epoch": 0.7183462532299741, "grad_norm": 401.7375793457031, "learning_rate": 5.633074935400517e-07, "logits/chosen": -0.88671875, "logits/rejected": -0.8671875, "logps/chosen": -142.0, "logps/rejected": -147.0, "loss": 0.5649, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0172119140625, "rewards/margins": 0.35546875, "rewards/rejected": -0.373046875, "step": 278 }, { "epoch": 0.7209302325581395, "grad_norm": 378.2952575683594, "learning_rate": 5.581395348837209e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.8515625, "logps/chosen": -133.0, "logps/rejected": -144.0, "loss": 0.5991, "rewards/accuracies": 0.625, "rewards/chosen": -0.0257568359375, "rewards/margins": 0.2373046875, "rewards/rejected": -0.263671875, "step": 279 }, { "epoch": 0.7235142118863049, "grad_norm": 413.5380554199219, "learning_rate": 5.529715762273901e-07, "logits/chosen": -0.90625, "logits/rejected": -0.85546875, "logps/chosen": -152.0, "logps/rejected": -157.0, "loss": 0.5965, "rewards/accuracies": 0.78125, "rewards/chosen": -0.039794921875, "rewards/margins": 0.2734375, "rewards/rejected": -0.3125, "step": 280 }, { "epoch": 0.7260981912144703, "grad_norm": 363.4127197265625, "learning_rate": 5.478036175710594e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.8515625, "logps/chosen": -135.0, "logps/rejected": -149.0, "loss": 0.5662, "rewards/accuracies": 0.75, "rewards/chosen": -0.010986328125, "rewards/margins": 0.3203125, "rewards/rejected": -0.33203125, "step": 281 }, { "epoch": 0.7286821705426356, "grad_norm": 378.63299560546875, "learning_rate": 5.426356589147286e-07, "logits/chosen": -0.859375, "logits/rejected": -0.8671875, "logps/chosen": -147.0, "logps/rejected": -123.0, "loss": 0.5472, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07958984375, "rewards/margins": 0.3984375, "rewards/rejected": -0.318359375, "step": 282 }, { "epoch": 0.7312661498708011, "grad_norm": 395.1712951660156, "learning_rate": 5.37467700258398e-07, "logits/chosen": -0.8984375, "logits/rejected": -0.86328125, "logps/chosen": -136.0, "logps/rejected": -121.5, "loss": 0.5435, "rewards/accuracies": 0.75, "rewards/chosen": -0.0225830078125, "rewards/margins": 0.3984375, "rewards/rejected": -0.421875, "step": 283 }, { "epoch": 0.7338501291989664, "grad_norm": 358.454345703125, "learning_rate": 5.322997416020672e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.83984375, "logps/chosen": -120.0, "logps/rejected": -139.0, "loss": 0.5327, "rewards/accuracies": 0.71875, "rewards/chosen": 0.115234375, "rewards/margins": 0.427734375, "rewards/rejected": -0.3125, "step": 284 }, { "epoch": 0.7364341085271318, "grad_norm": 393.966796875, "learning_rate": 5.271317829457364e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.89453125, "logps/chosen": -121.5, "logps/rejected": -136.0, "loss": 0.627, "rewards/accuracies": 0.6875, "rewards/chosen": -0.042236328125, "rewards/margins": 0.1923828125, "rewards/rejected": -0.234375, "step": 285 }, { "epoch": 0.7390180878552972, "grad_norm": 376.2955322265625, "learning_rate": 5.219638242894056e-07, "logits/chosen": -0.890625, "logits/rejected": -0.87890625, "logps/chosen": -138.0, "logps/rejected": -160.0, "loss": 0.5792, "rewards/accuracies": 0.65625, "rewards/chosen": -0.04931640625, "rewards/margins": 0.330078125, "rewards/rejected": -0.37890625, "step": 286 }, { "epoch": 0.7416020671834626, "grad_norm": 409.2053527832031, "learning_rate": 5.167958656330749e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.85546875, "logps/chosen": -118.0, "logps/rejected": -136.0, "loss": 0.6108, "rewards/accuracies": 0.65625, "rewards/chosen": -0.130859375, "rewards/margins": 0.2197265625, "rewards/rejected": -0.349609375, "step": 287 }, { "epoch": 0.7441860465116279, "grad_norm": 364.067626953125, "learning_rate": 5.116279069767442e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.8671875, "logps/chosen": -142.0, "logps/rejected": -144.0, "loss": 0.5334, "rewards/accuracies": 0.875, "rewards/chosen": 0.042236328125, "rewards/margins": 0.380859375, "rewards/rejected": -0.33984375, "step": 288 }, { "epoch": 0.7467700258397932, "grad_norm": 436.3753356933594, "learning_rate": 5.064599483204134e-07, "logits/chosen": -0.9140625, "logits/rejected": -0.85546875, "logps/chosen": -148.0, "logps/rejected": -131.0, "loss": 0.6072, "rewards/accuracies": 0.75, "rewards/chosen": -0.051513671875, "rewards/margins": 0.25, "rewards/rejected": -0.30078125, "step": 289 }, { "epoch": 0.7493540051679587, "grad_norm": 420.2207336425781, "learning_rate": 5.012919896640828e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.8671875, "logps/chosen": -151.0, "logps/rejected": -146.0, "loss": 0.608, "rewards/accuracies": 0.625, "rewards/chosen": -0.01318359375, "rewards/margins": 0.2578125, "rewards/rejected": -0.271484375, "step": 290 }, { "epoch": 0.751937984496124, "grad_norm": 378.3236083984375, "learning_rate": 4.961240310077519e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.8125, "logps/chosen": -129.0, "logps/rejected": -142.0, "loss": 0.5271, "rewards/accuracies": 0.8125, "rewards/chosen": 0.11279296875, "rewards/margins": 0.423828125, "rewards/rejected": -0.310546875, "step": 291 }, { "epoch": 0.7545219638242894, "grad_norm": 374.6150817871094, "learning_rate": 4.909560723514212e-07, "logits/chosen": -0.91015625, "logits/rejected": -0.8671875, "logps/chosen": -136.0, "logps/rejected": -138.0, "loss": 0.5492, "rewards/accuracies": 0.78125, "rewards/chosen": -0.037353515625, "rewards/margins": 0.373046875, "rewards/rejected": -0.41015625, "step": 292 }, { "epoch": 0.7571059431524548, "grad_norm": 349.1102600097656, "learning_rate": 4.857881136950904e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.87890625, "logps/chosen": -139.0, "logps/rejected": -121.5, "loss": 0.54, "rewards/accuracies": 0.8125, "rewards/chosen": 0.05615234375, "rewards/margins": 0.392578125, "rewards/rejected": -0.3359375, "step": 293 }, { "epoch": 0.7596899224806202, "grad_norm": 400.560302734375, "learning_rate": 4.806201550387597e-07, "logits/chosen": -0.875, "logits/rejected": -0.85546875, "logps/chosen": -143.0, "logps/rejected": -141.0, "loss": 0.5764, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0079345703125, "rewards/margins": 0.33203125, "rewards/rejected": -0.32421875, "step": 294 }, { "epoch": 0.7622739018087855, "grad_norm": 341.3611145019531, "learning_rate": 4.754521963824289e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.87109375, "logps/chosen": -127.5, "logps/rejected": -134.0, "loss": 0.5256, "rewards/accuracies": 0.75, "rewards/chosen": 0.03271484375, "rewards/margins": 0.44921875, "rewards/rejected": -0.41796875, "step": 295 }, { "epoch": 0.7648578811369509, "grad_norm": 345.73077392578125, "learning_rate": 4.7028423772609815e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.875, "logps/chosen": -120.0, "logps/rejected": -141.0, "loss": 0.5225, "rewards/accuracies": 0.875, "rewards/chosen": 0.02587890625, "rewards/margins": 0.43359375, "rewards/rejected": -0.408203125, "step": 296 }, { "epoch": 0.7674418604651163, "grad_norm": 404.53668212890625, "learning_rate": 4.6511627906976743e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.8515625, "logps/chosen": -132.0, "logps/rejected": -141.0, "loss": 0.5674, "rewards/accuracies": 0.71875, "rewards/chosen": -0.003082275390625, "rewards/margins": 0.322265625, "rewards/rejected": -0.326171875, "step": 297 }, { "epoch": 0.7700258397932817, "grad_norm": 378.0136413574219, "learning_rate": 4.5994832041343666e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.86328125, "logps/chosen": -133.0, "logps/rejected": -139.0, "loss": 0.5527, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09912109375, "rewards/margins": 0.37109375, "rewards/rejected": -0.470703125, "step": 298 }, { "epoch": 0.772609819121447, "grad_norm": 425.3061828613281, "learning_rate": 4.5478036175710593e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.88671875, "logps/chosen": -144.0, "logps/rejected": -141.0, "loss": 0.5983, "rewards/accuracies": 0.53125, "rewards/chosen": 0.056396484375, "rewards/margins": 0.275390625, "rewards/rejected": -0.21875, "step": 299 }, { "epoch": 0.7751937984496124, "grad_norm": 370.2434387207031, "learning_rate": 4.496124031007752e-07, "logits/chosen": -0.828125, "logits/rejected": -0.8515625, "logps/chosen": -133.0, "logps/rejected": -121.5, "loss": 0.5974, "rewards/accuracies": 0.65625, "rewards/chosen": -0.0203857421875, "rewards/margins": 0.259765625, "rewards/rejected": -0.28125, "step": 300 }, { "epoch": 0.7777777777777778, "grad_norm": 380.1609802246094, "learning_rate": 4.444444444444444e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.88671875, "logps/chosen": -126.0, "logps/rejected": -143.0, "loss": 0.523, "rewards/accuracies": 0.75, "rewards/chosen": 0.0732421875, "rewards/margins": 0.439453125, "rewards/rejected": -0.365234375, "step": 301 }, { "epoch": 0.7803617571059431, "grad_norm": 399.3497009277344, "learning_rate": 4.3927648578811366e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.8671875, "logps/chosen": -142.0, "logps/rejected": -146.0, "loss": 0.5543, "rewards/accuracies": 0.65625, "rewards/chosen": 0.05078125, "rewards/margins": 0.375, "rewards/rejected": -0.326171875, "step": 302 }, { "epoch": 0.7829457364341085, "grad_norm": 399.6018981933594, "learning_rate": 4.3410852713178294e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.875, "logps/chosen": -146.0, "logps/rejected": -172.0, "loss": 0.5702, "rewards/accuracies": 0.75, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.3125, "rewards/rejected": -0.29296875, "step": 303 }, { "epoch": 0.7855297157622739, "grad_norm": 421.47235107421875, "learning_rate": 4.2894056847545216e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.84765625, "logps/chosen": -142.0, "logps/rejected": -137.0, "loss": 0.5662, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0703125, "rewards/margins": 0.33984375, "rewards/rejected": -0.41015625, "step": 304 }, { "epoch": 0.7881136950904393, "grad_norm": 387.08172607421875, "learning_rate": 4.2377260981912144e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.875, "logps/chosen": -147.0, "logps/rejected": -136.0, "loss": 0.5011, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03125, "rewards/margins": 0.498046875, "rewards/rejected": -0.466796875, "step": 305 }, { "epoch": 0.7906976744186046, "grad_norm": 339.8193664550781, "learning_rate": 4.186046511627907e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.859375, "logps/chosen": -136.0, "logps/rejected": -133.0, "loss": 0.5362, "rewards/accuracies": 0.84375, "rewards/chosen": 0.09375, "rewards/margins": 0.39453125, "rewards/rejected": -0.30078125, "step": 306 }, { "epoch": 0.7932816537467701, "grad_norm": 378.47100830078125, "learning_rate": 4.134366925064599e-07, "logits/chosen": -0.890625, "logits/rejected": -0.875, "logps/chosen": -129.0, "logps/rejected": -143.0, "loss": 0.5189, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0054931640625, "rewards/margins": 0.4921875, "rewards/rejected": -0.48828125, "step": 307 }, { "epoch": 0.7958656330749354, "grad_norm": 377.9639587402344, "learning_rate": 4.0826873385012917e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.83203125, "logps/chosen": -142.0, "logps/rejected": -121.5, "loss": 0.5417, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0869140625, "rewards/margins": 0.44921875, "rewards/rejected": -0.36328125, "step": 308 }, { "epoch": 0.7984496124031008, "grad_norm": 389.46624755859375, "learning_rate": 4.0310077519379845e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.875, "logps/chosen": -147.0, "logps/rejected": -128.0, "loss": 0.5643, "rewards/accuracies": 0.75, "rewards/chosen": 0.068359375, "rewards/margins": 0.369140625, "rewards/rejected": -0.30078125, "step": 309 }, { "epoch": 0.8010335917312662, "grad_norm": 360.7492980957031, "learning_rate": 3.9793281653746767e-07, "logits/chosen": -0.875, "logits/rejected": -0.875, "logps/chosen": -138.0, "logps/rejected": -134.0, "loss": 0.496, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1591796875, "rewards/margins": 0.5234375, "rewards/rejected": -0.365234375, "step": 310 }, { "epoch": 0.8036175710594315, "grad_norm": 438.1676940917969, "learning_rate": 3.9276485788113695e-07, "logits/chosen": -0.859375, "logits/rejected": -0.88671875, "logps/chosen": -130.0, "logps/rejected": -132.0, "loss": 0.6559, "rewards/accuracies": 0.59375, "rewards/chosen": -0.1640625, "rewards/margins": 0.1279296875, "rewards/rejected": -0.29296875, "step": 311 }, { "epoch": 0.8062015503875969, "grad_norm": 379.49896240234375, "learning_rate": 3.8759689922480623e-07, "logits/chosen": -0.88671875, "logits/rejected": -0.890625, "logps/chosen": -140.0, "logps/rejected": -129.0, "loss": 0.5618, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0279541015625, "rewards/margins": 0.337890625, "rewards/rejected": -0.3671875, "step": 312 }, { "epoch": 0.8087855297157622, "grad_norm": 381.6045227050781, "learning_rate": 3.824289405684754e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8359375, "logps/chosen": -141.0, "logps/rejected": -134.0, "loss": 0.5596, "rewards/accuracies": 0.75, "rewards/chosen": 0.0079345703125, "rewards/margins": 0.34375, "rewards/rejected": -0.3359375, "step": 313 }, { "epoch": 0.8113695090439277, "grad_norm": 407.3009948730469, "learning_rate": 3.772609819121447e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.87890625, "logps/chosen": -141.0, "logps/rejected": -139.0, "loss": 0.5457, "rewards/accuracies": 0.78125, "rewards/chosen": 0.034423828125, "rewards/margins": 0.392578125, "rewards/rejected": -0.357421875, "step": 314 }, { "epoch": 0.813953488372093, "grad_norm": 379.11956787109375, "learning_rate": 3.7209302325581396e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.8671875, "logps/chosen": -127.0, "logps/rejected": -145.0, "loss": 0.5155, "rewards/accuracies": 0.84375, "rewards/chosen": 0.00311279296875, "rewards/margins": 0.462890625, "rewards/rejected": -0.458984375, "step": 315 }, { "epoch": 0.8165374677002584, "grad_norm": 391.218017578125, "learning_rate": 3.669250645994832e-07, "logits/chosen": -0.859375, "logits/rejected": -0.890625, "logps/chosen": -125.0, "logps/rejected": -142.0, "loss": 0.552, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0390625, "rewards/margins": 0.388671875, "rewards/rejected": -0.427734375, "step": 316 }, { "epoch": 0.8191214470284238, "grad_norm": 426.7617492675781, "learning_rate": 3.6175710594315246e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.8828125, "logps/chosen": -144.0, "logps/rejected": -143.0, "loss": 0.6192, "rewards/accuracies": 0.59375, "rewards/chosen": -0.0830078125, "rewards/margins": 0.2158203125, "rewards/rejected": -0.298828125, "step": 317 }, { "epoch": 0.8217054263565892, "grad_norm": 414.6080627441406, "learning_rate": 3.5658914728682174e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.87109375, "logps/chosen": -132.0, "logps/rejected": -144.0, "loss": 0.5533, "rewards/accuracies": 0.75, "rewards/chosen": -0.06884765625, "rewards/margins": 0.396484375, "rewards/rejected": -0.466796875, "step": 318 }, { "epoch": 0.8242894056847545, "grad_norm": 379.4181823730469, "learning_rate": 3.514211886304909e-07, "logits/chosen": -0.859375, "logits/rejected": -0.8828125, "logps/chosen": -141.0, "logps/rejected": -156.0, "loss": 0.5718, "rewards/accuracies": 0.75, "rewards/chosen": -0.00075531005859375, "rewards/margins": 0.357421875, "rewards/rejected": -0.357421875, "step": 319 }, { "epoch": 0.8268733850129198, "grad_norm": 407.3499755859375, "learning_rate": 3.462532299741602e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.84375, "logps/chosen": -147.0, "logps/rejected": -140.0, "loss": 0.5623, "rewards/accuracies": 0.75, "rewards/chosen": 0.0228271484375, "rewards/margins": 0.349609375, "rewards/rejected": -0.328125, "step": 320 }, { "epoch": 0.8294573643410853, "grad_norm": 381.62030029296875, "learning_rate": 3.4108527131782946e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.875, "logps/chosen": -137.0, "logps/rejected": -148.0, "loss": 0.5624, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0849609375, "rewards/margins": 0.341796875, "rewards/rejected": -0.42578125, "step": 321 }, { "epoch": 0.8320413436692506, "grad_norm": 403.3800964355469, "learning_rate": 3.359173126614987e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.859375, "logps/chosen": -142.0, "logps/rejected": -145.0, "loss": 0.5454, "rewards/accuracies": 0.8125, "rewards/chosen": -0.004730224609375, "rewards/margins": 0.388671875, "rewards/rejected": -0.392578125, "step": 322 }, { "epoch": 0.834625322997416, "grad_norm": 373.6676025390625, "learning_rate": 3.3074935400516797e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.86328125, "logps/chosen": -134.0, "logps/rejected": -132.0, "loss": 0.5639, "rewards/accuracies": 0.71875, "rewards/chosen": -0.03125, "rewards/margins": 0.36328125, "rewards/rejected": -0.39453125, "step": 323 }, { "epoch": 0.8372093023255814, "grad_norm": 407.47747802734375, "learning_rate": 3.2558139534883724e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.8515625, "logps/chosen": -124.0, "logps/rejected": -130.0, "loss": 0.5892, "rewards/accuracies": 0.75, "rewards/chosen": -0.0478515625, "rewards/margins": 0.29296875, "rewards/rejected": -0.33984375, "step": 324 }, { "epoch": 0.8397932816537468, "grad_norm": 364.1658935546875, "learning_rate": 3.204134366925064e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.828125, "logps/chosen": -148.0, "logps/rejected": -147.0, "loss": 0.5142, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08447265625, "rewards/margins": 0.474609375, "rewards/rejected": -0.390625, "step": 325 }, { "epoch": 0.8423772609819121, "grad_norm": 362.48040771484375, "learning_rate": 3.152454780361757e-07, "logits/chosen": -0.875, "logits/rejected": -0.875, "logps/chosen": -137.0, "logps/rejected": -141.0, "loss": 0.5242, "rewards/accuracies": 0.8125, "rewards/chosen": 0.04150390625, "rewards/margins": 0.447265625, "rewards/rejected": -0.40625, "step": 326 }, { "epoch": 0.8449612403100775, "grad_norm": 412.084716796875, "learning_rate": 3.100775193798449e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.8984375, "logps/chosen": -154.0, "logps/rejected": -140.0, "loss": 0.5799, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03125, "rewards/margins": 0.310546875, "rewards/rejected": -0.27734375, "step": 327 }, { "epoch": 0.8475452196382429, "grad_norm": 386.69219970703125, "learning_rate": 3.049095607235142e-07, "logits/chosen": -0.90625, "logits/rejected": -0.89453125, "logps/chosen": -139.0, "logps/rejected": -148.0, "loss": 0.5845, "rewards/accuracies": 0.75, "rewards/chosen": -0.02734375, "rewards/margins": 0.30859375, "rewards/rejected": -0.3359375, "step": 328 }, { "epoch": 0.8501291989664083, "grad_norm": 377.74664306640625, "learning_rate": 2.997416020671835e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.84375, "logps/chosen": -152.0, "logps/rejected": -135.0, "loss": 0.5349, "rewards/accuracies": 0.75, "rewards/chosen": 0.0732421875, "rewards/margins": 0.416015625, "rewards/rejected": -0.341796875, "step": 329 }, { "epoch": 0.8527131782945736, "grad_norm": 392.24786376953125, "learning_rate": 2.945736434108527e-07, "logits/chosen": -0.88671875, "logits/rejected": -0.890625, "logps/chosen": -126.0, "logps/rejected": -148.0, "loss": 0.5776, "rewards/accuracies": 0.75, "rewards/chosen": -0.09765625, "rewards/margins": 0.279296875, "rewards/rejected": -0.376953125, "step": 330 }, { "epoch": 0.8552971576227391, "grad_norm": 339.7447204589844, "learning_rate": 2.894056847545219e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.875, "logps/chosen": -132.0, "logps/rejected": -137.0, "loss": 0.5315, "rewards/accuracies": 0.78125, "rewards/chosen": 0.056884765625, "rewards/margins": 0.43359375, "rewards/rejected": -0.376953125, "step": 331 }, { "epoch": 0.8578811369509044, "grad_norm": 377.9252624511719, "learning_rate": 2.842377260981912e-07, "logits/chosen": -0.91796875, "logits/rejected": -0.875, "logps/chosen": -152.0, "logps/rejected": -150.0, "loss": 0.4913, "rewards/accuracies": 0.875, "rewards/chosen": 0.040771484375, "rewards/margins": 0.49609375, "rewards/rejected": -0.455078125, "step": 332 }, { "epoch": 0.8604651162790697, "grad_norm": 396.7610778808594, "learning_rate": 2.7906976744186043e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.86328125, "logps/chosen": -141.0, "logps/rejected": -145.0, "loss": 0.5567, "rewards/accuracies": 0.71875, "rewards/chosen": 0.12060546875, "rewards/margins": 0.41015625, "rewards/rejected": -0.2890625, "step": 333 }, { "epoch": 0.8630490956072352, "grad_norm": 367.93438720703125, "learning_rate": 2.739018087855297e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.84765625, "logps/chosen": -126.0, "logps/rejected": -128.0, "loss": 0.5735, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0296630859375, "rewards/margins": 0.34765625, "rewards/rejected": -0.318359375, "step": 334 }, { "epoch": 0.8656330749354005, "grad_norm": 338.41644287109375, "learning_rate": 2.68733850129199e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.84765625, "logps/chosen": -131.0, "logps/rejected": -122.5, "loss": 0.5182, "rewards/accuracies": 0.8125, "rewards/chosen": 0.05078125, "rewards/margins": 0.46484375, "rewards/rejected": -0.4140625, "step": 335 }, { "epoch": 0.8682170542635659, "grad_norm": 420.8653869628906, "learning_rate": 2.635658914728682e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.89453125, "logps/chosen": -127.0, "logps/rejected": -121.0, "loss": 0.6331, "rewards/accuracies": 0.59375, "rewards/chosen": -0.140625, "rewards/margins": 0.1943359375, "rewards/rejected": -0.3359375, "step": 336 }, { "epoch": 0.8708010335917312, "grad_norm": 418.4413757324219, "learning_rate": 2.5839793281653743e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.85546875, "logps/chosen": -125.5, "logps/rejected": -117.5, "loss": 0.5797, "rewards/accuracies": 0.6875, "rewards/chosen": -0.046875, "rewards/margins": 0.296875, "rewards/rejected": -0.34375, "step": 337 }, { "epoch": 0.8733850129198967, "grad_norm": 389.128662109375, "learning_rate": 2.532299741602067e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.85546875, "logps/chosen": -138.0, "logps/rejected": -142.0, "loss": 0.5772, "rewards/accuracies": 0.71875, "rewards/chosen": -0.042236328125, "rewards/margins": 0.333984375, "rewards/rejected": -0.375, "step": 338 }, { "epoch": 0.875968992248062, "grad_norm": 380.782470703125, "learning_rate": 2.4806201550387593e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.84375, "logps/chosen": -145.0, "logps/rejected": -145.0, "loss": 0.5589, "rewards/accuracies": 0.75, "rewards/chosen": 0.05322265625, "rewards/margins": 0.380859375, "rewards/rejected": -0.328125, "step": 339 }, { "epoch": 0.8785529715762274, "grad_norm": 371.532958984375, "learning_rate": 2.428940568475452e-07, "logits/chosen": -0.890625, "logits/rejected": -0.87890625, "logps/chosen": -132.0, "logps/rejected": -153.0, "loss": 0.5039, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.515625, "rewards/rejected": -0.49609375, "step": 340 }, { "epoch": 0.8811369509043928, "grad_norm": 376.73736572265625, "learning_rate": 2.3772609819121444e-07, "logits/chosen": -0.921875, "logits/rejected": -0.87890625, "logps/chosen": -139.0, "logps/rejected": -132.0, "loss": 0.5676, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0101318359375, "rewards/margins": 0.30859375, "rewards/rejected": -0.298828125, "step": 341 }, { "epoch": 0.8837209302325582, "grad_norm": 366.2059020996094, "learning_rate": 2.3255813953488372e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.8828125, "logps/chosen": -134.0, "logps/rejected": -133.0, "loss": 0.523, "rewards/accuracies": 0.875, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.4375, "rewards/rejected": -0.416015625, "step": 342 }, { "epoch": 0.8863049095607235, "grad_norm": 467.3062744140625, "learning_rate": 2.2739018087855297e-07, "logits/chosen": -0.828125, "logits/rejected": -0.84375, "logps/chosen": -123.0, "logps/rejected": -147.0, "loss": 0.6332, "rewards/accuracies": 0.65625, "rewards/chosen": -0.1748046875, "rewards/margins": 0.15625, "rewards/rejected": -0.33203125, "step": 343 }, { "epoch": 0.8888888888888888, "grad_norm": 400.25677490234375, "learning_rate": 2.222222222222222e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.8671875, "logps/chosen": -135.0, "logps/rejected": -129.0, "loss": 0.5532, "rewards/accuracies": 0.8125, "rewards/chosen": 0.01239013671875, "rewards/margins": 0.349609375, "rewards/rejected": -0.337890625, "step": 344 }, { "epoch": 0.8914728682170543, "grad_norm": 393.77587890625, "learning_rate": 2.1705426356589147e-07, "logits/chosen": -0.859375, "logits/rejected": -0.87890625, "logps/chosen": -130.0, "logps/rejected": -136.0, "loss": 0.567, "rewards/accuracies": 0.78125, "rewards/chosen": -0.040771484375, "rewards/margins": 0.330078125, "rewards/rejected": -0.37109375, "step": 345 }, { "epoch": 0.8940568475452196, "grad_norm": 416.1154479980469, "learning_rate": 2.1188630490956072e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.890625, "logps/chosen": -126.5, "logps/rejected": -140.0, "loss": 0.5573, "rewards/accuracies": 0.78125, "rewards/chosen": -0.064453125, "rewards/margins": 0.353515625, "rewards/rejected": -0.41796875, "step": 346 }, { "epoch": 0.896640826873385, "grad_norm": 406.4513244628906, "learning_rate": 2.0671834625322995e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.8359375, "logps/chosen": -144.0, "logps/rejected": -146.0, "loss": 0.5757, "rewards/accuracies": 0.65625, "rewards/chosen": -0.06884765625, "rewards/margins": 0.3125, "rewards/rejected": -0.380859375, "step": 347 }, { "epoch": 0.8992248062015504, "grad_norm": 366.8443908691406, "learning_rate": 2.0155038759689922e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.859375, "logps/chosen": -122.0, "logps/rejected": -139.0, "loss": 0.511, "rewards/accuracies": 0.8125, "rewards/chosen": -0.006927490234375, "rewards/margins": 0.498046875, "rewards/rejected": -0.50390625, "step": 348 }, { "epoch": 0.9018087855297158, "grad_norm": 379.0568542480469, "learning_rate": 1.9638242894056847e-07, "logits/chosen": -0.875, "logits/rejected": -0.859375, "logps/chosen": -138.0, "logps/rejected": -148.0, "loss": 0.5513, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0244140625, "rewards/margins": 0.369140625, "rewards/rejected": -0.392578125, "step": 349 }, { "epoch": 0.9043927648578811, "grad_norm": 404.06915283203125, "learning_rate": 1.912144702842377e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.87109375, "logps/chosen": -125.5, "logps/rejected": -136.0, "loss": 0.5874, "rewards/accuracies": 0.65625, "rewards/chosen": -0.04833984375, "rewards/margins": 0.283203125, "rewards/rejected": -0.33203125, "step": 350 }, { "epoch": 0.9069767441860465, "grad_norm": 407.20172119140625, "learning_rate": 1.8604651162790698e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.8671875, "logps/chosen": -120.5, "logps/rejected": -144.0, "loss": 0.5469, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0537109375, "rewards/margins": 0.380859375, "rewards/rejected": -0.326171875, "step": 351 }, { "epoch": 0.9095607235142119, "grad_norm": 367.9174499511719, "learning_rate": 1.8087855297157623e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.875, "logps/chosen": -151.0, "logps/rejected": -143.0, "loss": 0.5195, "rewards/accuracies": 0.90625, "rewards/chosen": -0.0186767578125, "rewards/margins": 0.431640625, "rewards/rejected": -0.451171875, "step": 352 }, { "epoch": 0.9121447028423773, "grad_norm": 337.8936462402344, "learning_rate": 1.7571059431524545e-07, "logits/chosen": -0.875, "logits/rejected": -0.8515625, "logps/chosen": -124.5, "logps/rejected": -124.5, "loss": 0.5336, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0712890625, "rewards/margins": 0.41015625, "rewards/rejected": -0.33984375, "step": 353 }, { "epoch": 0.9147286821705426, "grad_norm": 359.1859436035156, "learning_rate": 1.7054263565891473e-07, "logits/chosen": -0.890625, "logits/rejected": -0.85546875, "logps/chosen": -134.0, "logps/rejected": -135.0, "loss": 0.5594, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03369140625, "rewards/margins": 0.37890625, "rewards/rejected": -0.34375, "step": 354 }, { "epoch": 0.917312661498708, "grad_norm": 379.411865234375, "learning_rate": 1.6537467700258398e-07, "logits/chosen": -0.859375, "logits/rejected": -0.86328125, "logps/chosen": -132.0, "logps/rejected": -162.0, "loss": 0.4905, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0859375, "rewards/margins": 0.5390625, "rewards/rejected": -0.451171875, "step": 355 }, { "epoch": 0.9198966408268734, "grad_norm": 424.71099853515625, "learning_rate": 1.602067183462532e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.89453125, "logps/chosen": -135.0, "logps/rejected": -139.0, "loss": 0.5555, "rewards/accuracies": 0.75, "rewards/chosen": -0.03369140625, "rewards/margins": 0.349609375, "rewards/rejected": -0.3828125, "step": 356 }, { "epoch": 0.9224806201550387, "grad_norm": 378.3841857910156, "learning_rate": 1.5503875968992246e-07, "logits/chosen": -0.859375, "logits/rejected": -0.83984375, "logps/chosen": -134.0, "logps/rejected": -134.0, "loss": 0.588, "rewards/accuracies": 0.75, "rewards/chosen": -0.08447265625, "rewards/margins": 0.279296875, "rewards/rejected": -0.36328125, "step": 357 }, { "epoch": 0.9250645994832042, "grad_norm": 407.63934326171875, "learning_rate": 1.4987080103359174e-07, "logits/chosen": -0.890625, "logits/rejected": -0.859375, "logps/chosen": -141.0, "logps/rejected": -121.0, "loss": 0.5896, "rewards/accuracies": 0.65625, "rewards/chosen": -0.07470703125, "rewards/margins": 0.279296875, "rewards/rejected": -0.353515625, "step": 358 }, { "epoch": 0.9276485788113695, "grad_norm": 324.2749328613281, "learning_rate": 1.4470284237726096e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.890625, "logps/chosen": -127.0, "logps/rejected": -120.5, "loss": 0.5383, "rewards/accuracies": 0.71875, "rewards/chosen": -0.10302734375, "rewards/margins": 0.43359375, "rewards/rejected": -0.53515625, "step": 359 }, { "epoch": 0.9302325581395349, "grad_norm": 368.79931640625, "learning_rate": 1.3953488372093021e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.87890625, "logps/chosen": -143.0, "logps/rejected": -137.0, "loss": 0.5193, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0162353515625, "rewards/margins": 0.462890625, "rewards/rejected": -0.478515625, "step": 360 }, { "epoch": 0.9328165374677002, "grad_norm": 451.83233642578125, "learning_rate": 1.343669250645995e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.88671875, "logps/chosen": -136.0, "logps/rejected": -165.0, "loss": 0.5992, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0235595703125, "rewards/margins": 0.3203125, "rewards/rejected": -0.298828125, "step": 361 }, { "epoch": 0.9354005167958657, "grad_norm": 417.2298583984375, "learning_rate": 1.2919896640826872e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.86328125, "logps/chosen": -154.0, "logps/rejected": -135.0, "loss": 0.5792, "rewards/accuracies": 0.75, "rewards/chosen": -0.0218505859375, "rewards/margins": 0.310546875, "rewards/rejected": -0.33203125, "step": 362 }, { "epoch": 0.937984496124031, "grad_norm": 378.72222900390625, "learning_rate": 1.2403100775193797e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.86328125, "logps/chosen": -156.0, "logps/rejected": -147.0, "loss": 0.5247, "rewards/accuracies": 0.75, "rewards/chosen": 0.078125, "rewards/margins": 0.451171875, "rewards/rejected": -0.373046875, "step": 363 }, { "epoch": 0.9405684754521964, "grad_norm": 347.5020751953125, "learning_rate": 1.1886304909560722e-07, "logits/chosen": -0.90625, "logits/rejected": -0.87890625, "logps/chosen": -137.0, "logps/rejected": -168.0, "loss": 0.4286, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1181640625, "rewards/margins": 0.7109375, "rewards/rejected": -0.58984375, "step": 364 }, { "epoch": 0.9431524547803618, "grad_norm": 357.3157043457031, "learning_rate": 1.1369509043927648e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.87109375, "logps/chosen": -134.0, "logps/rejected": -128.0, "loss": 0.4937, "rewards/accuracies": 0.90625, "rewards/chosen": 0.026611328125, "rewards/margins": 0.49609375, "rewards/rejected": -0.46875, "step": 365 }, { "epoch": 0.9457364341085271, "grad_norm": 383.900390625, "learning_rate": 1.0852713178294573e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.90625, "logps/chosen": -143.0, "logps/rejected": -153.0, "loss": 0.4791, "rewards/accuracies": 0.75, "rewards/chosen": 0.0024566650390625, "rewards/margins": 0.578125, "rewards/rejected": -0.57421875, "step": 366 }, { "epoch": 0.9483204134366925, "grad_norm": 399.00592041015625, "learning_rate": 1.0335917312661497e-07, "logits/chosen": -0.90234375, "logits/rejected": -0.86328125, "logps/chosen": -147.0, "logps/rejected": -144.0, "loss": 0.6084, "rewards/accuracies": 0.5, "rewards/chosen": -0.09765625, "rewards/margins": 0.279296875, "rewards/rejected": -0.376953125, "step": 367 }, { "epoch": 0.9509043927648578, "grad_norm": 371.8937683105469, "learning_rate": 9.819121447028424e-08, "logits/chosen": -0.89453125, "logits/rejected": -0.87890625, "logps/chosen": -138.0, "logps/rejected": -140.0, "loss": 0.551, "rewards/accuracies": 0.8125, "rewards/chosen": 0.024169921875, "rewards/margins": 0.375, "rewards/rejected": -0.349609375, "step": 368 }, { "epoch": 0.9534883720930233, "grad_norm": 375.73895263671875, "learning_rate": 9.302325581395349e-08, "logits/chosen": -0.875, "logits/rejected": -0.84375, "logps/chosen": -148.0, "logps/rejected": -137.0, "loss": 0.5354, "rewards/accuracies": 0.875, "rewards/chosen": 0.003814697265625, "rewards/margins": 0.404296875, "rewards/rejected": -0.400390625, "step": 369 }, { "epoch": 0.9560723514211886, "grad_norm": 477.898193359375, "learning_rate": 8.785529715762273e-08, "logits/chosen": -0.8125, "logits/rejected": -0.83203125, "logps/chosen": -118.0, "logps/rejected": -147.0, "loss": 0.5193, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09716796875, "rewards/margins": 0.443359375, "rewards/rejected": -0.345703125, "step": 370 }, { "epoch": 0.958656330749354, "grad_norm": 379.3886413574219, "learning_rate": 8.268733850129199e-08, "logits/chosen": -0.890625, "logits/rejected": -0.83984375, "logps/chosen": -139.0, "logps/rejected": -142.0, "loss": 0.571, "rewards/accuracies": 0.65625, "rewards/chosen": -0.05224609375, "rewards/margins": 0.373046875, "rewards/rejected": -0.423828125, "step": 371 }, { "epoch": 0.9612403100775194, "grad_norm": 385.4183654785156, "learning_rate": 7.751937984496123e-08, "logits/chosen": -0.87890625, "logits/rejected": -0.859375, "logps/chosen": -143.0, "logps/rejected": -137.0, "loss": 0.514, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0517578125, "rewards/margins": 0.4609375, "rewards/rejected": -0.51171875, "step": 372 }, { "epoch": 0.9638242894056848, "grad_norm": 369.193115234375, "learning_rate": 7.235142118863048e-08, "logits/chosen": -0.84765625, "logits/rejected": -0.8515625, "logps/chosen": -122.5, "logps/rejected": -171.0, "loss": 0.5537, "rewards/accuracies": 0.75, "rewards/chosen": 0.010986328125, "rewards/margins": 0.36328125, "rewards/rejected": -0.3515625, "step": 373 }, { "epoch": 0.9664082687338501, "grad_norm": 349.1363830566406, "learning_rate": 6.718346253229975e-08, "logits/chosen": -0.83203125, "logits/rejected": -0.82421875, "logps/chosen": -135.0, "logps/rejected": -128.0, "loss": 0.4849, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0869140625, "rewards/margins": 0.5390625, "rewards/rejected": -0.451171875, "step": 374 }, { "epoch": 0.9689922480620154, "grad_norm": 421.71875, "learning_rate": 6.201550387596898e-08, "logits/chosen": -0.83984375, "logits/rejected": -0.8671875, "logps/chosen": -123.0, "logps/rejected": -152.0, "loss": 0.6088, "rewards/accuracies": 0.6875, "rewards/chosen": -0.046142578125, "rewards/margins": 0.2333984375, "rewards/rejected": -0.279296875, "step": 375 }, { "epoch": 0.9715762273901809, "grad_norm": 405.0057373046875, "learning_rate": 5.684754521963824e-08, "logits/chosen": -0.82421875, "logits/rejected": -0.8359375, "logps/chosen": -142.0, "logps/rejected": -139.0, "loss": 0.5885, "rewards/accuracies": 0.75, "rewards/chosen": -0.0986328125, "rewards/margins": 0.275390625, "rewards/rejected": -0.375, "step": 376 }, { "epoch": 0.9741602067183462, "grad_norm": 392.13677978515625, "learning_rate": 5.1679586563307486e-08, "logits/chosen": -0.890625, "logits/rejected": -0.88671875, "logps/chosen": -154.0, "logps/rejected": -155.0, "loss": 0.5356, "rewards/accuracies": 0.8125, "rewards/chosen": -0.035888671875, "rewards/margins": 0.40234375, "rewards/rejected": -0.4375, "step": 377 }, { "epoch": 0.9767441860465116, "grad_norm": 395.9448547363281, "learning_rate": 4.6511627906976744e-08, "logits/chosen": -0.86328125, "logits/rejected": -0.83984375, "logps/chosen": -157.0, "logps/rejected": -137.0, "loss": 0.597, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0830078125, "rewards/margins": 0.29296875, "rewards/rejected": -0.375, "step": 378 }, { "epoch": 0.979328165374677, "grad_norm": 467.2771301269531, "learning_rate": 4.1343669250645996e-08, "logits/chosen": -0.859375, "logits/rejected": -0.86328125, "logps/chosen": -134.0, "logps/rejected": -154.0, "loss": 0.6342, "rewards/accuracies": 0.65625, "rewards/chosen": -0.11083984375, "rewards/margins": 0.2294921875, "rewards/rejected": -0.33984375, "step": 379 }, { "epoch": 0.9819121447028424, "grad_norm": 372.8404235839844, "learning_rate": 3.617571059431524e-08, "logits/chosen": -0.87109375, "logits/rejected": -0.890625, "logps/chosen": -142.0, "logps/rejected": -142.0, "loss": 0.4995, "rewards/accuracies": 0.8125, "rewards/chosen": 0.11181640625, "rewards/margins": 0.498046875, "rewards/rejected": -0.384765625, "step": 380 }, { "epoch": 0.9844961240310077, "grad_norm": 363.5488586425781, "learning_rate": 3.100775193798449e-08, "logits/chosen": -0.83203125, "logits/rejected": -0.875, "logps/chosen": -155.0, "logps/rejected": -158.0, "loss": 0.5378, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07763671875, "rewards/margins": 0.443359375, "rewards/rejected": -0.3671875, "step": 381 }, { "epoch": 0.9870801033591732, "grad_norm": 368.29443359375, "learning_rate": 2.5839793281653743e-08, "logits/chosen": -0.89453125, "logits/rejected": -0.87890625, "logps/chosen": -150.0, "logps/rejected": -142.0, "loss": 0.5362, "rewards/accuracies": 0.84375, "rewards/chosen": -0.10546875, "rewards/margins": 0.427734375, "rewards/rejected": -0.53515625, "step": 382 }, { "epoch": 0.9896640826873385, "grad_norm": 398.1756896972656, "learning_rate": 2.0671834625322998e-08, "logits/chosen": -0.83203125, "logits/rejected": -0.84375, "logps/chosen": -123.0, "logps/rejected": -138.0, "loss": 0.5559, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09130859375, "rewards/margins": 0.369140625, "rewards/rejected": -0.27734375, "step": 383 }, { "epoch": 0.9922480620155039, "grad_norm": 347.91717529296875, "learning_rate": 1.5503875968992246e-08, "logits/chosen": -0.8828125, "logits/rejected": -0.87109375, "logps/chosen": -132.0, "logps/rejected": -137.0, "loss": 0.5034, "rewards/accuracies": 0.875, "rewards/chosen": 0.01153564453125, "rewards/margins": 0.4765625, "rewards/rejected": -0.46484375, "step": 384 }, { "epoch": 0.9948320413436692, "grad_norm": 362.68157958984375, "learning_rate": 1.0335917312661499e-08, "logits/chosen": -0.859375, "logits/rejected": -0.85546875, "logps/chosen": -129.0, "logps/rejected": -137.0, "loss": 0.5386, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0303955078125, "rewards/margins": 0.400390625, "rewards/rejected": -0.369140625, "step": 385 }, { "epoch": 0.9974160206718347, "grad_norm": 347.4972229003906, "learning_rate": 5.1679586563307495e-09, "logits/chosen": -0.875, "logits/rejected": -0.87109375, "logps/chosen": -135.0, "logps/rejected": -136.0, "loss": 0.4995, "rewards/accuracies": 0.875, "rewards/chosen": -0.02197265625, "rewards/margins": 0.5078125, "rewards/rejected": -0.53125, "step": 386 }, { "epoch": 1.0, "grad_norm": 349.7977600097656, "learning_rate": 0.0, "logits/chosen": -0.87109375, "logits/rejected": -0.89453125, "logps/chosen": -141.0, "logps/rejected": -136.0, "loss": 0.5355, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0830078125, "rewards/margins": 0.42578125, "rewards/rejected": -0.5078125, "step": 387 } ], "logging_steps": 1, "max_steps": 387, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }