Text Generation
PEFT
Safetensors
rag-gym
retrieval-augmented-generation
agent
lora
process-supervision
search-agent
conversational
Instructions to use RAG-Gym/ReSearch-MedQA-DPO with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use RAG-Gym/ReSearch-MedQA-DPO with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Meta-Llama-3.1-8B-Instruct") model = PeftModel.from_pretrained(base_model, "RAG-Gym/ReSearch-MedQA-DPO") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 387, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002583979328165375, | |
| "grad_norm": 338.2884826660156, | |
| "learning_rate": 1.9948320413436692e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.7265625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -119.0, | |
| "loss": 0.6914, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00516795865633075, | |
| "grad_norm": 304.6211242675781, | |
| "learning_rate": 1.989664082687338e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -126.5, | |
| "loss": 0.6891, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": 0.00156402587890625, | |
| "rewards/margins": 0.007049560546875, | |
| "rewards/rejected": -0.005462646484375, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.007751937984496124, | |
| "grad_norm": 301.52911376953125, | |
| "learning_rate": 1.9844961240310075e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.694, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.000782012939453125, | |
| "rewards/margins": 0.006256103515625, | |
| "rewards/rejected": -0.007049560546875, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.0103359173126615, | |
| "grad_norm": 294.886962890625, | |
| "learning_rate": 1.979328165374677e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -115.0, | |
| "loss": 0.7021, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.0164794921875, | |
| "rewards/margins": -0.0133056640625, | |
| "rewards/rejected": -0.0031280517578125, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.012919896640826873, | |
| "grad_norm": 300.3182067871094, | |
| "learning_rate": 1.974160206718346e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -127.5, | |
| "loss": 0.6931, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.00390625, | |
| "rewards/margins": -7.62939453125e-06, | |
| "rewards/rejected": -0.00390625, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.015503875968992248, | |
| "grad_norm": 331.87506103515625, | |
| "learning_rate": 1.9689922480620155e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.6958, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.026611328125, | |
| "rewards/margins": -0.00390625, | |
| "rewards/rejected": -0.022705078125, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.01808785529715762, | |
| "grad_norm": 289.2641296386719, | |
| "learning_rate": 1.963824289405685e-06, | |
| "logits/chosen": -0.703125, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6771, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.001556396484375, | |
| "rewards/margins": 0.035888671875, | |
| "rewards/rejected": -0.034423828125, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.020671834625323, | |
| "grad_norm": 313.3421325683594, | |
| "learning_rate": 1.958656330749354e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -130.0, | |
| "loss": 0.6836, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.0093994140625, | |
| "rewards/margins": 0.0179443359375, | |
| "rewards/rejected": -0.02734375, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.023255813953488372, | |
| "grad_norm": 316.9752502441406, | |
| "learning_rate": 1.953488372093023e-06, | |
| "logits/chosen": -0.703125, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6954, | |
| "rewards/accuracies": 0.28125, | |
| "rewards/chosen": -0.01251220703125, | |
| "rewards/margins": -0.00078582763671875, | |
| "rewards/rejected": -0.01171875, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.025839793281653745, | |
| "grad_norm": 302.2852478027344, | |
| "learning_rate": 1.9483204134366924e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -136.0, | |
| "loss": 0.6868, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.00390625, | |
| "rewards/margins": 0.015625, | |
| "rewards/rejected": -0.01953125, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.028423772609819122, | |
| "grad_norm": 322.8475341796875, | |
| "learning_rate": 1.9431524547803617e-06, | |
| "logits/chosen": -0.6875, | |
| "logits/rejected": -0.70703125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -124.5, | |
| "loss": 0.6805, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.000782012939453125, | |
| "rewards/margins": 0.02734375, | |
| "rewards/rejected": -0.026611328125, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.031007751937984496, | |
| "grad_norm": 342.7738342285156, | |
| "learning_rate": 1.9379844961240306e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -156.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.7083, | |
| "rewards/accuracies": 0.25, | |
| "rewards/chosen": -0.03515625, | |
| "rewards/margins": -0.0242919921875, | |
| "rewards/rejected": -0.01092529296875, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.03359173126614987, | |
| "grad_norm": 317.3365783691406, | |
| "learning_rate": 1.9328165374677e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -116.5, | |
| "loss": 0.7069, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.0289306640625, | |
| "rewards/margins": -0.015625, | |
| "rewards/rejected": -0.0133056640625, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.03617571059431524, | |
| "grad_norm": 317.24713134765625, | |
| "learning_rate": 1.9276485788113693e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.694, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.0172119140625, | |
| "rewards/margins": -0.00154876708984375, | |
| "rewards/rejected": -0.015625, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.03875968992248062, | |
| "grad_norm": 313.6627502441406, | |
| "learning_rate": 1.9224806201550386e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -166.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.6729, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.0172119140625, | |
| "rewards/margins": 0.044677734375, | |
| "rewards/rejected": -0.02734375, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.041343669250646, | |
| "grad_norm": 319.21343994140625, | |
| "learning_rate": 1.917312661498708e-06, | |
| "logits/chosen": -0.7109375, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6761, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.000782012939453125, | |
| "rewards/margins": 0.03515625, | |
| "rewards/rejected": -0.035888671875, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.04392764857881137, | |
| "grad_norm": 296.3052978515625, | |
| "learning_rate": 1.9121447028423773e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -120.0, | |
| "loss": 0.6858, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.01953125, | |
| "rewards/margins": 0.014892578125, | |
| "rewards/rejected": -0.034423828125, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.046511627906976744, | |
| "grad_norm": 312.5535583496094, | |
| "learning_rate": 1.9069767441860464e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.6709, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.00469970703125, | |
| "rewards/margins": 0.047607421875, | |
| "rewards/rejected": -0.052490234375, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.04909560723514212, | |
| "grad_norm": 316.44586181640625, | |
| "learning_rate": 1.9018087855297155e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.658, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.026611328125, | |
| "rewards/margins": 0.078125, | |
| "rewards/rejected": -0.051513671875, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.05167958656330749, | |
| "grad_norm": 335.7342834472656, | |
| "learning_rate": 1.8966408268733848e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.703125, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6833, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.0093994140625, | |
| "rewards/margins": 0.0211181640625, | |
| "rewards/rejected": -0.030517578125, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.05426356589147287, | |
| "grad_norm": 295.4714660644531, | |
| "learning_rate": 1.8914728682170542e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6769, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0015716552734375, | |
| "rewards/margins": 0.036865234375, | |
| "rewards/rejected": -0.03515625, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.056847545219638244, | |
| "grad_norm": 331.2699279785156, | |
| "learning_rate": 1.8863049095607235e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6814, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.015625, | |
| "rewards/margins": 0.02734375, | |
| "rewards/rejected": -0.01171875, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.059431524547803614, | |
| "grad_norm": 334.4768371582031, | |
| "learning_rate": 1.8811369509043926e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -160.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6635, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0172119140625, | |
| "rewards/margins": 0.057861328125, | |
| "rewards/rejected": -0.040771484375, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.06201550387596899, | |
| "grad_norm": 301.87762451171875, | |
| "learning_rate": 1.875968992248062e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.6582, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.02978515625, | |
| "rewards/margins": 0.07666015625, | |
| "rewards/rejected": -0.046875, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.06459948320413436, | |
| "grad_norm": 337.253173828125, | |
| "learning_rate": 1.8708010335917313e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.7, | |
| "rewards/accuracies": 0.3125, | |
| "rewards/chosen": -0.03759765625, | |
| "rewards/margins": -0.0062255859375, | |
| "rewards/rejected": -0.03125, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.06718346253229975, | |
| "grad_norm": 512.7426147460938, | |
| "learning_rate": 1.8656330749354004e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -120.5, | |
| "logps/rejected": -112.5, | |
| "loss": 0.6704, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.006256103515625, | |
| "rewards/margins": 0.0478515625, | |
| "rewards/rejected": -0.04150390625, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.06976744186046512, | |
| "grad_norm": 322.4765319824219, | |
| "learning_rate": 1.8604651162790697e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.673, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0093994140625, | |
| "rewards/margins": 0.04541015625, | |
| "rewards/rejected": -0.035888671875, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.07235142118863049, | |
| "grad_norm": 310.0760498046875, | |
| "learning_rate": 1.855297157622739e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -115.5, | |
| "loss": 0.6896, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.00701904296875, | |
| "rewards/margins": 0.0133056640625, | |
| "rewards/rejected": -0.0203857421875, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.07493540051679587, | |
| "grad_norm": 306.0886535644531, | |
| "learning_rate": 1.8501291989664084e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -130.0, | |
| "loss": 0.6647, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.018798828125, | |
| "rewards/margins": 0.06103515625, | |
| "rewards/rejected": -0.042236328125, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.07751937984496124, | |
| "grad_norm": 299.5661315917969, | |
| "learning_rate": 1.8449612403100773e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6514, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0234375, | |
| "rewards/margins": 0.09619140625, | |
| "rewards/rejected": -0.07275390625, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.08010335917312661, | |
| "grad_norm": 333.64215087890625, | |
| "learning_rate": 1.8397932816537466e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -158.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6697, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.031982421875, | |
| "rewards/margins": 0.053955078125, | |
| "rewards/rejected": -0.0218505859375, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.082687338501292, | |
| "grad_norm": 326.3154602050781, | |
| "learning_rate": 1.834625322997416e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.6885, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.0242919921875, | |
| "rewards/margins": 0.01092529296875, | |
| "rewards/rejected": -0.03515625, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.08527131782945736, | |
| "grad_norm": 321.0740051269531, | |
| "learning_rate": 1.829457364341085e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.7109375, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -122.5, | |
| "loss": 0.6741, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.031982421875, | |
| "rewards/margins": 0.044677734375, | |
| "rewards/rejected": -0.01251220703125, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.08785529715762273, | |
| "grad_norm": 330.2655029296875, | |
| "learning_rate": 1.8242894056847544e-06, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.7, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.00390625, | |
| "rewards/margins": -0.0101318359375, | |
| "rewards/rejected": 0.006256103515625, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.09043927648578812, | |
| "grad_norm": 318.2413330078125, | |
| "learning_rate": 1.8191214470284237e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6689, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.003143310546875, | |
| "rewards/margins": 0.05322265625, | |
| "rewards/rejected": -0.050048828125, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.09302325581395349, | |
| "grad_norm": 344.4376220703125, | |
| "learning_rate": 1.8139534883720929e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -155.0, | |
| "loss": 0.6613, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.02587890625, | |
| "rewards/margins": 0.08056640625, | |
| "rewards/rejected": -0.0546875, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.09560723514211886, | |
| "grad_norm": 355.41925048828125, | |
| "learning_rate": 1.8087855297157622e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -173.0, | |
| "loss": 0.6913, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.01251220703125, | |
| "rewards/margins": 0.007080078125, | |
| "rewards/rejected": -0.01953125, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.09819121447028424, | |
| "grad_norm": 302.00238037109375, | |
| "learning_rate": 1.8036175710594315e-06, | |
| "logits/chosen": -0.69140625, | |
| "logits/rejected": -0.70703125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6833, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.01251220703125, | |
| "rewards/margins": 0.026611328125, | |
| "rewards/rejected": -0.0140380859375, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.10077519379844961, | |
| "grad_norm": 310.81036376953125, | |
| "learning_rate": 1.7984496124031008e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -123.0, | |
| "loss": 0.6858, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.026611328125, | |
| "rewards/margins": 0.01806640625, | |
| "rewards/rejected": -0.044677734375, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.10335917312661498, | |
| "grad_norm": 313.59796142578125, | |
| "learning_rate": 1.79328165374677e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.6804, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.015625, | |
| "rewards/margins": 0.03515625, | |
| "rewards/rejected": -0.05078125, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.10594315245478036, | |
| "grad_norm": 327.0791320800781, | |
| "learning_rate": 1.7881136950904393e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6917, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.0218505859375, | |
| "rewards/margins": 0.00860595703125, | |
| "rewards/rejected": -0.030517578125, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.10852713178294573, | |
| "grad_norm": 325.0856018066406, | |
| "learning_rate": 1.7829457364341084e-06, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -142.0, | |
| "loss": 0.6915, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.00156402587890625, | |
| "rewards/margins": 0.0108642578125, | |
| "rewards/rejected": -0.0093994140625, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.1111111111111111, | |
| "grad_norm": 336.544677734375, | |
| "learning_rate": 1.7777777777777775e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -127.0, | |
| "loss": 0.668, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.0062255859375, | |
| "rewards/margins": 0.061767578125, | |
| "rewards/rejected": -0.06787109375, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.11369509043927649, | |
| "grad_norm": 308.3078918457031, | |
| "learning_rate": 1.7726098191214469e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -124.0, | |
| "loss": 0.6384, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0595703125, | |
| "rewards/margins": 0.119140625, | |
| "rewards/rejected": -0.059326171875, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.11627906976744186, | |
| "grad_norm": 330.3432312011719, | |
| "learning_rate": 1.7674418604651162e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -173.0, | |
| "logps/rejected": -164.0, | |
| "loss": 0.6664, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.03271484375, | |
| "rewards/margins": 0.06396484375, | |
| "rewards/rejected": -0.03125, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.11886304909560723, | |
| "grad_norm": 314.838623046875, | |
| "learning_rate": 1.7622739018087855e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6594, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.03369140625, | |
| "rewards/margins": 0.07666015625, | |
| "rewards/rejected": -0.04296875, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.12144702842377261, | |
| "grad_norm": 312.06280517578125, | |
| "learning_rate": 1.7571059431524546e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.6566, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0133056640625, | |
| "rewards/margins": 0.083984375, | |
| "rewards/rejected": -0.0703125, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.12403100775193798, | |
| "grad_norm": 327.1083984375, | |
| "learning_rate": 1.751937984496124e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -127.5, | |
| "loss": 0.6713, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.007080078125, | |
| "rewards/margins": 0.0517578125, | |
| "rewards/rejected": -0.044677734375, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.12661498708010335, | |
| "grad_norm": 327.7143249511719, | |
| "learning_rate": 1.7467700258397933e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.6564, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.01953125, | |
| "rewards/margins": 0.087890625, | |
| "rewards/rejected": -0.06787109375, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.12919896640826872, | |
| "grad_norm": 287.09173583984375, | |
| "learning_rate": 1.7416020671834624e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -115.0, | |
| "loss": 0.6604, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0296630859375, | |
| "rewards/margins": 0.07177734375, | |
| "rewards/rejected": -0.042236328125, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.13178294573643412, | |
| "grad_norm": 303.8511047363281, | |
| "learning_rate": 1.7364341085271318e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -125.5, | |
| "loss": 0.65, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.010986328125, | |
| "rewards/margins": 0.09521484375, | |
| "rewards/rejected": -0.08447265625, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.1343669250645995, | |
| "grad_norm": 345.98455810546875, | |
| "learning_rate": 1.731266149870801e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.671, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.00628662109375, | |
| "rewards/margins": 0.0517578125, | |
| "rewards/rejected": -0.04541015625, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.13695090439276486, | |
| "grad_norm": 314.14788818359375, | |
| "learning_rate": 1.7260981912144704e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.6191, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0546875, | |
| "rewards/margins": 0.166015625, | |
| "rewards/rejected": -0.11083984375, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.13953488372093023, | |
| "grad_norm": 324.44732666015625, | |
| "learning_rate": 1.7209302325581393e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.6681, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.010986328125, | |
| "rewards/margins": 0.057861328125, | |
| "rewards/rejected": -0.046875, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.1421188630490956, | |
| "grad_norm": 323.485107421875, | |
| "learning_rate": 1.7157622739018087e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -124.0, | |
| "loss": 0.6381, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.125, | |
| "rewards/rejected": -0.0625, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.14470284237726097, | |
| "grad_norm": 314.7582702636719, | |
| "learning_rate": 1.710594315245478e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -122.0, | |
| "loss": 0.6747, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.015625, | |
| "rewards/margins": 0.040771484375, | |
| "rewards/rejected": -0.0250244140625, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.14728682170542637, | |
| "grad_norm": 324.26568603515625, | |
| "learning_rate": 1.705426356589147e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6624, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.030517578125, | |
| "rewards/margins": 0.0751953125, | |
| "rewards/rejected": -0.044677734375, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.14987080103359174, | |
| "grad_norm": 358.5406799316406, | |
| "learning_rate": 1.7002583979328164e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -153.0, | |
| "loss": 0.6931, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.026611328125, | |
| "rewards/margins": 0.0164794921875, | |
| "rewards/rejected": -0.04296875, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.1524547803617571, | |
| "grad_norm": 316.290771484375, | |
| "learning_rate": 1.6950904392764858e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.6688, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.0078125, | |
| "rewards/margins": 0.0595703125, | |
| "rewards/rejected": -0.0517578125, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.15503875968992248, | |
| "grad_norm": 315.859619140625, | |
| "learning_rate": 1.6899224806201549e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.6675, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.01104736328125, | |
| "rewards/margins": 0.05810546875, | |
| "rewards/rejected": -0.046875, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.15762273901808785, | |
| "grad_norm": 311.5282897949219, | |
| "learning_rate": 1.6847545219638242e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -123.0, | |
| "loss": 0.6408, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06494140625, | |
| "rewards/margins": 0.1181640625, | |
| "rewards/rejected": -0.05322265625, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.16020671834625322, | |
| "grad_norm": 339.14593505859375, | |
| "learning_rate": 1.6795865633074935e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6611, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.04150390625, | |
| "rewards/margins": 0.0830078125, | |
| "rewards/rejected": -0.04150390625, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.16279069767441862, | |
| "grad_norm": 341.363525390625, | |
| "learning_rate": 1.6744186046511629e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6646, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.05322265625, | |
| "rewards/margins": 0.06640625, | |
| "rewards/rejected": -0.0133056640625, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.165374677002584, | |
| "grad_norm": 391.70458984375, | |
| "learning_rate": 1.669250645994832e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.652, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.0211181640625, | |
| "rewards/margins": 0.09716796875, | |
| "rewards/rejected": -0.07568359375, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.16795865633074936, | |
| "grad_norm": 363.4455871582031, | |
| "learning_rate": 1.6640826873385011e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -124.0, | |
| "loss": 0.6282, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0986328125, | |
| "rewards/margins": 0.1533203125, | |
| "rewards/rejected": -0.0546875, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.17054263565891473, | |
| "grad_norm": 331.4794921875, | |
| "learning_rate": 1.6589147286821704e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6577, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.038330078125, | |
| "rewards/margins": 0.08447265625, | |
| "rewards/rejected": -0.046142578125, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.1731266149870801, | |
| "grad_norm": 321.7209777832031, | |
| "learning_rate": 1.6537467700258396e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6727, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.0478515625, | |
| "rewards/margins": 0.060302734375, | |
| "rewards/rejected": -0.01251220703125, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.17571059431524547, | |
| "grad_norm": 321.1003723144531, | |
| "learning_rate": 1.648578811369509e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.6719, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.022705078125, | |
| "rewards/margins": 0.05419921875, | |
| "rewards/rejected": -0.03125, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.17829457364341086, | |
| "grad_norm": 344.49249267578125, | |
| "learning_rate": 1.6434108527131782e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6658, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.03759765625, | |
| "rewards/margins": 0.0634765625, | |
| "rewards/rejected": -0.0257568359375, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.18087855297157623, | |
| "grad_norm": 354.41680908203125, | |
| "learning_rate": 1.6382428940568476e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -125.5, | |
| "loss": 0.6664, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.0390625, | |
| "rewards/margins": 0.06884765625, | |
| "rewards/rejected": -0.0296630859375, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.1834625322997416, | |
| "grad_norm": 339.7203674316406, | |
| "learning_rate": 1.6330749354005167e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6459, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0211181640625, | |
| "rewards/margins": 0.115234375, | |
| "rewards/rejected": -0.09375, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.18604651162790697, | |
| "grad_norm": 330.1705627441406, | |
| "learning_rate": 1.627906976744186e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6672, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0712890625, | |
| "rewards/margins": 0.06103515625, | |
| "rewards/rejected": 0.01019287109375, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.18863049095607234, | |
| "grad_norm": 342.0517272949219, | |
| "learning_rate": 1.6227390180878553e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.6422, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10888671875, | |
| "rewards/margins": 0.1181640625, | |
| "rewards/rejected": -0.0093994140625, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.19121447028423771, | |
| "grad_norm": 320.803955078125, | |
| "learning_rate": 1.6175710594315245e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -113.5, | |
| "logps/rejected": -129.0, | |
| "loss": 0.6492, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09375, | |
| "rewards/margins": 0.10400390625, | |
| "rewards/rejected": -0.01019287109375, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.1937984496124031, | |
| "grad_norm": 300.7449645996094, | |
| "learning_rate": 1.6124031007751938e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -122.0, | |
| "loss": 0.6638, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0296630859375, | |
| "rewards/margins": 0.0693359375, | |
| "rewards/rejected": -0.039794921875, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.19638242894056848, | |
| "grad_norm": 346.23590087890625, | |
| "learning_rate": 1.6072351421188631e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.6446, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.08935546875, | |
| "rewards/margins": 0.11328125, | |
| "rewards/rejected": -0.0242919921875, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.19896640826873385, | |
| "grad_norm": 337.37921142578125, | |
| "learning_rate": 1.6020671834625322e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -152.0, | |
| "loss": 0.6844, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.04296875, | |
| "rewards/margins": 0.0242919921875, | |
| "rewards/rejected": 0.018798828125, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.20155038759689922, | |
| "grad_norm": 371.3411865234375, | |
| "learning_rate": 1.5968992248062014e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -149.0, | |
| "loss": 0.6985, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.044677734375, | |
| "rewards/margins": -0.00555419921875, | |
| "rewards/rejected": 0.050048828125, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.2041343669250646, | |
| "grad_norm": 308.72271728515625, | |
| "learning_rate": 1.5917312661498707e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.6581, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.103515625, | |
| "rewards/margins": 0.0830078125, | |
| "rewards/rejected": 0.0203857421875, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.20671834625322996, | |
| "grad_norm": 351.33538818359375, | |
| "learning_rate": 1.58656330749354e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6524, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.06982421875, | |
| "rewards/margins": 0.08837890625, | |
| "rewards/rejected": -0.018798828125, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.20930232558139536, | |
| "grad_norm": 288.8226623535156, | |
| "learning_rate": 1.5813953488372091e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -127.0, | |
| "loss": 0.636, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.109375, | |
| "rewards/margins": 0.1298828125, | |
| "rewards/rejected": -0.020263671875, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.21188630490956073, | |
| "grad_norm": 336.23724365234375, | |
| "learning_rate": 1.5762273901808785e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6503, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.10693359375, | |
| "rewards/margins": 0.09765625, | |
| "rewards/rejected": 0.0093994140625, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.2144702842377261, | |
| "grad_norm": 343.7184753417969, | |
| "learning_rate": 1.5710594315245478e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -127.0, | |
| "loss": 0.6636, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.08935546875, | |
| "rewards/margins": 0.07421875, | |
| "rewards/rejected": 0.014892578125, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.21705426356589147, | |
| "grad_norm": 315.254638671875, | |
| "learning_rate": 1.565891472868217e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.6119, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.125, | |
| "rewards/margins": 0.1845703125, | |
| "rewards/rejected": -0.0595703125, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.21963824289405684, | |
| "grad_norm": 338.00396728515625, | |
| "learning_rate": 1.5607235142118862e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.6229, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09521484375, | |
| "rewards/margins": 0.1591796875, | |
| "rewards/rejected": -0.0634765625, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.2222222222222222, | |
| "grad_norm": 346.4078063964844, | |
| "learning_rate": 1.5555555555555556e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.6398, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.050048828125, | |
| "rewards/margins": 0.12353515625, | |
| "rewards/rejected": -0.07373046875, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.2248062015503876, | |
| "grad_norm": 299.9973449707031, | |
| "learning_rate": 1.550387596899225e-06, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -127.5, | |
| "loss": 0.6176, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.138671875, | |
| "rewards/margins": 0.173828125, | |
| "rewards/rejected": -0.034423828125, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.22739018087855298, | |
| "grad_norm": 342.8509521484375, | |
| "learning_rate": 1.5452196382428938e-06, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6304, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11572265625, | |
| "rewards/margins": 0.1376953125, | |
| "rewards/rejected": -0.0218505859375, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.22997416020671835, | |
| "grad_norm": 345.9960021972656, | |
| "learning_rate": 1.5400516795865631e-06, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.603, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1474609375, | |
| "rewards/margins": 0.203125, | |
| "rewards/rejected": -0.056396484375, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.23255813953488372, | |
| "grad_norm": 305.83319091796875, | |
| "learning_rate": 1.5348837209302325e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -119.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.6355, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.142578125, | |
| "rewards/margins": 0.1328125, | |
| "rewards/rejected": 0.00933837890625, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.2351421188630491, | |
| "grad_norm": 323.9646301269531, | |
| "learning_rate": 1.5297157622739016e-06, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -119.0, | |
| "logps/rejected": -130.0, | |
| "loss": 0.6248, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.10498046875, | |
| "rewards/margins": 0.1552734375, | |
| "rewards/rejected": -0.050048828125, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.23772609819121446, | |
| "grad_norm": 340.4587097167969, | |
| "learning_rate": 1.524547803617571e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -123.0, | |
| "loss": 0.6505, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.06787109375, | |
| "rewards/margins": 0.0986328125, | |
| "rewards/rejected": -0.030517578125, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.24031007751937986, | |
| "grad_norm": 323.98846435546875, | |
| "learning_rate": 1.5193798449612403e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6501, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09619140625, | |
| "rewards/margins": 0.1064453125, | |
| "rewards/rejected": -0.0101318359375, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.24289405684754523, | |
| "grad_norm": 304.8097229003906, | |
| "learning_rate": 1.5142118863049096e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6373, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09228515625, | |
| "rewards/margins": 0.126953125, | |
| "rewards/rejected": -0.03515625, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.2454780361757106, | |
| "grad_norm": 346.1623229980469, | |
| "learning_rate": 1.5090439276485787e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -151.0, | |
| "loss": 0.6099, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.12255859375, | |
| "rewards/margins": 0.19140625, | |
| "rewards/rejected": -0.06884765625, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.24806201550387597, | |
| "grad_norm": 325.57989501953125, | |
| "learning_rate": 1.503875968992248e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6143, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1103515625, | |
| "rewards/margins": 0.18359375, | |
| "rewards/rejected": -0.07373046875, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.25064599483204136, | |
| "grad_norm": 334.1916198730469, | |
| "learning_rate": 1.4987080103359174e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -108.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.6396, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10107421875, | |
| "rewards/margins": 0.1279296875, | |
| "rewards/rejected": -0.026611328125, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.2532299741602067, | |
| "grad_norm": 347.5135192871094, | |
| "learning_rate": 1.4935400516795865e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6435, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1015625, | |
| "rewards/margins": 0.12255859375, | |
| "rewards/rejected": -0.0211181640625, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.2558139534883721, | |
| "grad_norm": 389.5239562988281, | |
| "learning_rate": 1.4883720930232558e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.6166, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1259765625, | |
| "rewards/margins": 0.169921875, | |
| "rewards/rejected": -0.043701171875, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.25839793281653745, | |
| "grad_norm": 354.7499694824219, | |
| "learning_rate": 1.483204134366925e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6376, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.08056640625, | |
| "rewards/margins": 0.1357421875, | |
| "rewards/rejected": -0.055419921875, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.26098191214470284, | |
| "grad_norm": 324.9789123535156, | |
| "learning_rate": 1.4780361757105943e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.6321, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.08447265625, | |
| "rewards/margins": 0.146484375, | |
| "rewards/rejected": -0.061767578125, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.26356589147286824, | |
| "grad_norm": 337.2759704589844, | |
| "learning_rate": 1.4728682170542634e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6442, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.06494140625, | |
| "rewards/margins": 0.11669921875, | |
| "rewards/rejected": -0.0517578125, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.2661498708010336, | |
| "grad_norm": 329.3245849609375, | |
| "learning_rate": 1.4677002583979327e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -123.5, | |
| "logps/rejected": -135.0, | |
| "loss": 0.6653, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.036865234375, | |
| "rewards/margins": 0.078125, | |
| "rewards/rejected": -0.04150390625, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.268733850129199, | |
| "grad_norm": 357.8585510253906, | |
| "learning_rate": 1.462532299741602e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -151.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6343, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.12060546875, | |
| "rewards/margins": 0.1396484375, | |
| "rewards/rejected": -0.018798828125, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.2713178294573643, | |
| "grad_norm": 344.8572998046875, | |
| "learning_rate": 1.4573643410852712e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6506, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.05859375, | |
| "rewards/margins": 0.09375, | |
| "rewards/rejected": -0.03515625, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.2739018087855297, | |
| "grad_norm": 335.1913146972656, | |
| "learning_rate": 1.4521963824289405e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.632, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.10498046875, | |
| "rewards/margins": 0.146484375, | |
| "rewards/rejected": -0.042236328125, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.27648578811369506, | |
| "grad_norm": 335.07769775390625, | |
| "learning_rate": 1.4470284237726098e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6209, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.07275390625, | |
| "rewards/margins": 0.1640625, | |
| "rewards/rejected": -0.09130859375, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.27906976744186046, | |
| "grad_norm": 356.36468505859375, | |
| "learning_rate": 1.441860465116279e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -173.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6124, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11474609375, | |
| "rewards/margins": 0.1904296875, | |
| "rewards/rejected": -0.07568359375, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.28165374677002586, | |
| "grad_norm": 321.2911071777344, | |
| "learning_rate": 1.4366925064599483e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.6199, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08447265625, | |
| "rewards/margins": 0.171875, | |
| "rewards/rejected": -0.0869140625, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.2842377260981912, | |
| "grad_norm": 338.142822265625, | |
| "learning_rate": 1.4315245478036176e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.6328, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0556640625, | |
| "rewards/margins": 0.1376953125, | |
| "rewards/rejected": -0.08203125, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.2868217054263566, | |
| "grad_norm": 336.5170593261719, | |
| "learning_rate": 1.426356589147287e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.6069, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09228515625, | |
| "rewards/margins": 0.1904296875, | |
| "rewards/rejected": -0.09765625, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.28940568475452194, | |
| "grad_norm": 335.60601806640625, | |
| "learning_rate": 1.4211886304909558e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -124.5, | |
| "loss": 0.6148, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.08447265625, | |
| "rewards/margins": 0.1796875, | |
| "rewards/rejected": -0.0947265625, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.29198966408268734, | |
| "grad_norm": 344.4601135253906, | |
| "learning_rate": 1.4160206718346252e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6178, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1025390625, | |
| "rewards/margins": 0.1767578125, | |
| "rewards/rejected": -0.07421875, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.29457364341085274, | |
| "grad_norm": 344.459716796875, | |
| "learning_rate": 1.4108527131782945e-06, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -125.0, | |
| "loss": 0.6079, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0791015625, | |
| "rewards/margins": 0.1904296875, | |
| "rewards/rejected": -0.11083984375, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.2971576227390181, | |
| "grad_norm": 318.5380554199219, | |
| "learning_rate": 1.4056847545219636e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -130.0, | |
| "loss": 0.6321, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06494140625, | |
| "rewards/margins": 0.138671875, | |
| "rewards/rejected": -0.07373046875, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.2997416020671835, | |
| "grad_norm": 329.6904296875, | |
| "learning_rate": 1.400516795865633e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -118.5, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6331, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.07666015625, | |
| "rewards/margins": 0.1455078125, | |
| "rewards/rejected": -0.06884765625, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.3023255813953488, | |
| "grad_norm": 342.3974304199219, | |
| "learning_rate": 1.3953488372093023e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -156.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.6286, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.1513671875, | |
| "rewards/rejected": -0.0888671875, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.3049095607235142, | |
| "grad_norm": 312.7485656738281, | |
| "learning_rate": 1.3901808785529716e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6155, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.08544921875, | |
| "rewards/margins": 0.1787109375, | |
| "rewards/rejected": -0.09375, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.30749354005167956, | |
| "grad_norm": 337.5772705078125, | |
| "learning_rate": 1.3850129198966407e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.6246, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.08984375, | |
| "rewards/margins": 0.154296875, | |
| "rewards/rejected": -0.06396484375, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.31007751937984496, | |
| "grad_norm": 323.82647705078125, | |
| "learning_rate": 1.37984496124031e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6328, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.057861328125, | |
| "rewards/margins": 0.1533203125, | |
| "rewards/rejected": -0.09521484375, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.31266149870801035, | |
| "grad_norm": 348.8138122558594, | |
| "learning_rate": 1.3746770025839794e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -159.0, | |
| "logps/rejected": -162.0, | |
| "loss": 0.6141, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08447265625, | |
| "rewards/margins": 0.1845703125, | |
| "rewards/rejected": -0.10009765625, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.3152454780361757, | |
| "grad_norm": 349.4007568359375, | |
| "learning_rate": 1.3695090439276485e-06, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.6328, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.07958984375, | |
| "rewards/margins": 0.162109375, | |
| "rewards/rejected": -0.08203125, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.3178294573643411, | |
| "grad_norm": 332.4546813964844, | |
| "learning_rate": 1.3643410852713179e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.6021, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.076171875, | |
| "rewards/margins": 0.2412109375, | |
| "rewards/rejected": -0.166015625, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.32041343669250644, | |
| "grad_norm": 341.52081298828125, | |
| "learning_rate": 1.359173126614987e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6187, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.044677734375, | |
| "rewards/margins": 0.1748046875, | |
| "rewards/rejected": -0.1298828125, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.32299741602067183, | |
| "grad_norm": 331.70928955078125, | |
| "learning_rate": 1.3540051679586563e-06, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.6024, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09228515625, | |
| "rewards/margins": 0.20703125, | |
| "rewards/rejected": -0.115234375, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.32558139534883723, | |
| "grad_norm": 329.70867919921875, | |
| "learning_rate": 1.3488372093023254e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.6265, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0869140625, | |
| "rewards/margins": 0.166015625, | |
| "rewards/rejected": -0.0791015625, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.3281653746770026, | |
| "grad_norm": 359.75567626953125, | |
| "learning_rate": 1.3436692506459948e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.6324, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.02734375, | |
| "rewards/margins": 0.14453125, | |
| "rewards/rejected": -0.1171875, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.330749354005168, | |
| "grad_norm": 328.73541259765625, | |
| "learning_rate": 1.338501291989664e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -160.0, | |
| "loss": 0.6026, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1376953125, | |
| "rewards/margins": 0.23828125, | |
| "rewards/rejected": -0.10107421875, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 348.1528625488281, | |
| "learning_rate": 1.3333333333333332e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.6233, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08837890625, | |
| "rewards/margins": 0.1787109375, | |
| "rewards/rejected": -0.0908203125, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.3359173126614987, | |
| "grad_norm": 340.9327087402344, | |
| "learning_rate": 1.3281653746770025e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6133, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0654296875, | |
| "rewards/margins": 0.1982421875, | |
| "rewards/rejected": -0.1328125, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.3385012919896641, | |
| "grad_norm": 352.50140380859375, | |
| "learning_rate": 1.3229974160206719e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6362, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09912109375, | |
| "rewards/margins": 0.130859375, | |
| "rewards/rejected": -0.03125, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.34108527131782945, | |
| "grad_norm": 334.6105651855469, | |
| "learning_rate": 1.317829457364341e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -125.5, | |
| "loss": 0.6101, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.119140625, | |
| "rewards/margins": 0.2021484375, | |
| "rewards/rejected": -0.0830078125, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.34366925064599485, | |
| "grad_norm": 353.9385986328125, | |
| "learning_rate": 1.3126614987080103e-06, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.6122, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.07666015625, | |
| "rewards/margins": 0.19140625, | |
| "rewards/rejected": -0.11474609375, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.3462532299741602, | |
| "grad_norm": 328.07965087890625, | |
| "learning_rate": 1.3074935400516796e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6092, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.134765625, | |
| "rewards/margins": 0.216796875, | |
| "rewards/rejected": -0.08203125, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.3488372093023256, | |
| "grad_norm": 359.8808288574219, | |
| "learning_rate": 1.302325581395349e-06, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.6028, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0966796875, | |
| "rewards/margins": 0.2080078125, | |
| "rewards/rejected": -0.111328125, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.35142118863049093, | |
| "grad_norm": 352.7024230957031, | |
| "learning_rate": 1.2971576227390179e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5861, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1337890625, | |
| "rewards/margins": 0.248046875, | |
| "rewards/rejected": -0.11474609375, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.35400516795865633, | |
| "grad_norm": 345.4299621582031, | |
| "learning_rate": 1.2919896640826872e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -133.0, | |
| "loss": 0.5975, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0927734375, | |
| "rewards/margins": 0.2255859375, | |
| "rewards/rejected": -0.1328125, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.35658914728682173, | |
| "grad_norm": 308.36920166015625, | |
| "learning_rate": 1.2868217054263565e-06, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -117.5, | |
| "logps/rejected": -119.5, | |
| "loss": 0.5941, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.10498046875, | |
| "rewards/margins": 0.2373046875, | |
| "rewards/rejected": -0.1318359375, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.35917312661498707, | |
| "grad_norm": 358.83782958984375, | |
| "learning_rate": 1.2816537467700257e-06, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6258, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1064453125, | |
| "rewards/margins": 0.1650390625, | |
| "rewards/rejected": -0.05859375, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.36175710594315247, | |
| "grad_norm": 371.83404541015625, | |
| "learning_rate": 1.276485788113695e-06, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.6403, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.11572265625, | |
| "rewards/margins": 0.1494140625, | |
| "rewards/rejected": -0.03369140625, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.3643410852713178, | |
| "grad_norm": 351.14495849609375, | |
| "learning_rate": 1.2713178294573643e-06, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -146.0, | |
| "loss": 0.6221, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.064453125, | |
| "rewards/margins": 0.1728515625, | |
| "rewards/rejected": -0.10888671875, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.3669250645994832, | |
| "grad_norm": 356.72637939453125, | |
| "learning_rate": 1.2661498708010337e-06, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -124.5, | |
| "loss": 0.5872, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08056640625, | |
| "rewards/margins": 0.248046875, | |
| "rewards/rejected": -0.16796875, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.3695090439276486, | |
| "grad_norm": 345.7752380371094, | |
| "learning_rate": 1.2609819121447028e-06, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.5862, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1640625, | |
| "rewards/margins": 0.263671875, | |
| "rewards/rejected": -0.0986328125, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.37209302325581395, | |
| "grad_norm": 349.9151611328125, | |
| "learning_rate": 1.255813953488372e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6083, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.078125, | |
| "rewards/margins": 0.19140625, | |
| "rewards/rejected": -0.11328125, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.37467700258397935, | |
| "grad_norm": 384.64776611328125, | |
| "learning_rate": 1.2506459948320414e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -121.0, | |
| "logps/rejected": -115.0, | |
| "loss": 0.6302, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1025390625, | |
| "rewards/margins": 0.1689453125, | |
| "rewards/rejected": -0.0673828125, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.3772609819121447, | |
| "grad_norm": 364.6282043457031, | |
| "learning_rate": 1.2454780361757106e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6237, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11865234375, | |
| "rewards/margins": 0.1552734375, | |
| "rewards/rejected": -0.0361328125, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.3798449612403101, | |
| "grad_norm": 327.8299255371094, | |
| "learning_rate": 1.2403100775193797e-06, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5947, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.13671875, | |
| "rewards/margins": 0.2412109375, | |
| "rewards/rejected": -0.10400390625, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.38242894056847543, | |
| "grad_norm": 385.03558349609375, | |
| "learning_rate": 1.235142118863049e-06, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.662, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0361328125, | |
| "rewards/margins": 0.0947265625, | |
| "rewards/rejected": -0.05859375, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.3850129198966408, | |
| "grad_norm": 361.1077880859375, | |
| "learning_rate": 1.2299741602067181e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -159.0, | |
| "loss": 0.6172, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0556640625, | |
| "rewards/margins": 0.1943359375, | |
| "rewards/rejected": -0.138671875, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.3875968992248062, | |
| "grad_norm": 365.97283935546875, | |
| "learning_rate": 1.2248062015503875e-06, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6337, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.050048828125, | |
| "rewards/margins": 0.1640625, | |
| "rewards/rejected": -0.1142578125, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.39018087855297157, | |
| "grad_norm": 355.6282958984375, | |
| "learning_rate": 1.2196382428940568e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -153.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6195, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10302734375, | |
| "rewards/margins": 0.193359375, | |
| "rewards/rejected": -0.08984375, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.39276485788113696, | |
| "grad_norm": 351.19390869140625, | |
| "learning_rate": 1.2144702842377261e-06, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.565, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.154296875, | |
| "rewards/margins": 0.3125, | |
| "rewards/rejected": -0.1572265625, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.3953488372093023, | |
| "grad_norm": 371.5525207519531, | |
| "learning_rate": 1.2093023255813952e-06, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6111, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0390625, | |
| "rewards/margins": 0.19921875, | |
| "rewards/rejected": -0.16015625, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.3979328165374677, | |
| "grad_norm": 320.109130859375, | |
| "learning_rate": 1.2041343669250646e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -121.5, | |
| "loss": 0.5984, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0830078125, | |
| "rewards/margins": 0.2392578125, | |
| "rewards/rejected": -0.15625, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.4005167958656331, | |
| "grad_norm": 356.4275817871094, | |
| "learning_rate": 1.198966408268734e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -130.0, | |
| "loss": 0.6063, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.10546875, | |
| "rewards/margins": 0.2041015625, | |
| "rewards/rejected": -0.0986328125, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.40310077519379844, | |
| "grad_norm": 348.66217041015625, | |
| "learning_rate": 1.193798449612403e-06, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.6041, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1162109375, | |
| "rewards/margins": 0.2060546875, | |
| "rewards/rejected": -0.08984375, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.40568475452196384, | |
| "grad_norm": 345.34661865234375, | |
| "learning_rate": 1.1886304909560723e-06, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -121.0, | |
| "loss": 0.6521, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.01416015625, | |
| "rewards/margins": 0.123046875, | |
| "rewards/rejected": -0.10888671875, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.4082687338501292, | |
| "grad_norm": 350.15313720703125, | |
| "learning_rate": 1.1834625322997417e-06, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -153.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.6064, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0947265625, | |
| "rewards/margins": 0.2119140625, | |
| "rewards/rejected": -0.1171875, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.4108527131782946, | |
| "grad_norm": 379.19287109375, | |
| "learning_rate": 1.1782945736434108e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -119.5, | |
| "logps/rejected": -138.0, | |
| "loss": 0.6129, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.10400390625, | |
| "rewards/margins": 0.2021484375, | |
| "rewards/rejected": -0.09765625, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.4134366925064599, | |
| "grad_norm": 355.0957336425781, | |
| "learning_rate": 1.17312661498708e-06, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.5751, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1015625, | |
| "rewards/margins": 0.279296875, | |
| "rewards/rejected": -0.1787109375, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.4160206718346253, | |
| "grad_norm": 367.7550964355469, | |
| "learning_rate": 1.1679586563307492e-06, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.6216, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1103515625, | |
| "rewards/margins": 0.1884765625, | |
| "rewards/rejected": -0.0791015625, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.4186046511627907, | |
| "grad_norm": 385.49310302734375, | |
| "learning_rate": 1.1627906976744186e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -151.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.6404, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.06982421875, | |
| "rewards/margins": 0.162109375, | |
| "rewards/rejected": -0.09228515625, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.42118863049095606, | |
| "grad_norm": 422.4086608886719, | |
| "learning_rate": 1.1576227390180877e-06, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.594, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.078125, | |
| "rewards/margins": 0.25, | |
| "rewards/rejected": -0.171875, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.42377260981912146, | |
| "grad_norm": 346.9455261230469, | |
| "learning_rate": 1.152454780361757e-06, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.59, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11181640625, | |
| "rewards/margins": 0.255859375, | |
| "rewards/rejected": -0.14453125, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.4263565891472868, | |
| "grad_norm": 384.1201477050781, | |
| "learning_rate": 1.1472868217054264e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -198.0, | |
| "loss": 0.6001, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.00860595703125, | |
| "rewards/margins": 0.216796875, | |
| "rewards/rejected": -0.208984375, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.4289405684754522, | |
| "grad_norm": 384.46002197265625, | |
| "learning_rate": 1.1421188630490957e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.6613, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.078125, | |
| "rewards/margins": 0.09326171875, | |
| "rewards/rejected": -0.014892578125, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.4315245478036176, | |
| "grad_norm": 333.75518798828125, | |
| "learning_rate": 1.1369509043927648e-06, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.5698, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1552734375, | |
| "rewards/margins": 0.298828125, | |
| "rewards/rejected": -0.14453125, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.43410852713178294, | |
| "grad_norm": 369.3163757324219, | |
| "learning_rate": 1.1317829457364341e-06, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -154.0, | |
| "logps/rejected": -151.0, | |
| "loss": 0.633, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0234375, | |
| "rewards/margins": 0.166015625, | |
| "rewards/rejected": -0.142578125, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.43669250645994834, | |
| "grad_norm": 356.31121826171875, | |
| "learning_rate": 1.1266149870801035e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.6216, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08203125, | |
| "rewards/margins": 0.1806640625, | |
| "rewards/rejected": -0.0986328125, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.4392764857881137, | |
| "grad_norm": 378.68572998046875, | |
| "learning_rate": 1.1214470284237724e-06, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -140.0, | |
| "loss": 0.6583, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.0341796875, | |
| "rewards/margins": 0.09912109375, | |
| "rewards/rejected": -0.06494140625, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.4418604651162791, | |
| "grad_norm": 371.9620056152344, | |
| "learning_rate": 1.1162790697674417e-06, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -162.0, | |
| "logps/rejected": -153.0, | |
| "loss": 0.6076, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.1435546875, | |
| "rewards/margins": 0.240234375, | |
| "rewards/rejected": -0.09619140625, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.4444444444444444, | |
| "grad_norm": 378.2386474609375, | |
| "learning_rate": 1.111111111111111e-06, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.646, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0257568359375, | |
| "rewards/margins": 0.130859375, | |
| "rewards/rejected": -0.10546875, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.4470284237726098, | |
| "grad_norm": 342.5321044921875, | |
| "learning_rate": 1.1059431524547802e-06, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.603, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.06640625, | |
| "rewards/margins": 0.2177734375, | |
| "rewards/rejected": -0.1513671875, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.4496124031007752, | |
| "grad_norm": 353.12591552734375, | |
| "learning_rate": 1.1007751937984495e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -136.0, | |
| "loss": 0.615, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.00628662109375, | |
| "rewards/margins": 0.197265625, | |
| "rewards/rejected": -0.1904296875, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.45219638242894056, | |
| "grad_norm": 361.20269775390625, | |
| "learning_rate": 1.0956072351421188e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -124.5, | |
| "loss": 0.6301, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.06640625, | |
| "rewards/margins": 0.1611328125, | |
| "rewards/rejected": -0.0947265625, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.45478036175710596, | |
| "grad_norm": 350.6606750488281, | |
| "learning_rate": 1.0904392764857881e-06, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.5934, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.01953125, | |
| "rewards/margins": 0.24609375, | |
| "rewards/rejected": -0.2255859375, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.4573643410852713, | |
| "grad_norm": 326.9544677734375, | |
| "learning_rate": 1.0852713178294573e-06, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.5634, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0986328125, | |
| "rewards/margins": 0.31640625, | |
| "rewards/rejected": -0.2177734375, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.4599483204134367, | |
| "grad_norm": 339.9979248046875, | |
| "learning_rate": 1.0801033591731266e-06, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -119.5, | |
| "loss": 0.6461, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.00390625, | |
| "rewards/margins": 0.130859375, | |
| "rewards/rejected": -0.126953125, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.4625322997416021, | |
| "grad_norm": 327.41778564453125, | |
| "learning_rate": 1.074935400516796e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -127.0, | |
| "loss": 0.5596, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.12353515625, | |
| "rewards/margins": 0.326171875, | |
| "rewards/rejected": -0.203125, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.46511627906976744, | |
| "grad_norm": 364.97479248046875, | |
| "learning_rate": 1.069767441860465e-06, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -154.0, | |
| "loss": 0.6108, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.053955078125, | |
| "rewards/margins": 0.2099609375, | |
| "rewards/rejected": -0.15625, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.46770025839793283, | |
| "grad_norm": 326.265869140625, | |
| "learning_rate": 1.0645994832041344e-06, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -127.0, | |
| "loss": 0.6075, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0771484375, | |
| "rewards/margins": 0.2177734375, | |
| "rewards/rejected": -0.1396484375, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.4702842377260982, | |
| "grad_norm": 368.4969177246094, | |
| "learning_rate": 1.0594315245478035e-06, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -125.0, | |
| "loss": 0.6359, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.00154876708984375, | |
| "rewards/margins": 0.154296875, | |
| "rewards/rejected": -0.15234375, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.4728682170542636, | |
| "grad_norm": 380.64892578125, | |
| "learning_rate": 1.0542635658914728e-06, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -162.0, | |
| "logps/rejected": -159.0, | |
| "loss": 0.5272, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1982421875, | |
| "rewards/margins": 0.40234375, | |
| "rewards/rejected": -0.203125, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.4754521963824289, | |
| "grad_norm": 370.6021728515625, | |
| "learning_rate": 1.049095607235142e-06, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6156, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07763671875, | |
| "rewards/margins": 0.1875, | |
| "rewards/rejected": -0.1103515625, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.4780361757105943, | |
| "grad_norm": 383.2211608886719, | |
| "learning_rate": 1.0439276485788113e-06, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6074, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06103515625, | |
| "rewards/margins": 0.2138671875, | |
| "rewards/rejected": -0.1533203125, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.4806201550387597, | |
| "grad_norm": 377.28411865234375, | |
| "learning_rate": 1.0387596899224806e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6229, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.095703125, | |
| "rewards/margins": 0.1923828125, | |
| "rewards/rejected": -0.0966796875, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.48320413436692505, | |
| "grad_norm": 355.7249450683594, | |
| "learning_rate": 1.0335917312661497e-06, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.5508, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1171875, | |
| "rewards/margins": 0.369140625, | |
| "rewards/rejected": -0.251953125, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.48578811369509045, | |
| "grad_norm": 371.69903564453125, | |
| "learning_rate": 1.028423772609819e-06, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -161.0, | |
| "loss": 0.5718, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1328125, | |
| "rewards/margins": 0.294921875, | |
| "rewards/rejected": -0.1630859375, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.4883720930232558, | |
| "grad_norm": 366.8398132324219, | |
| "learning_rate": 1.0232558139534884e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.5823, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.10009765625, | |
| "rewards/margins": 0.267578125, | |
| "rewards/rejected": -0.1669921875, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.4909560723514212, | |
| "grad_norm": 408.7562561035156, | |
| "learning_rate": 1.0180878552971577e-06, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.6008, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09130859375, | |
| "rewards/margins": 0.23828125, | |
| "rewards/rejected": -0.1474609375, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.4935400516795866, | |
| "grad_norm": 382.720458984375, | |
| "learning_rate": 1.0129198966408268e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5869, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07177734375, | |
| "rewards/margins": 0.271484375, | |
| "rewards/rejected": -0.2001953125, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.49612403100775193, | |
| "grad_norm": 385.51629638671875, | |
| "learning_rate": 1.0077519379844962e-06, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.6169, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09228515625, | |
| "rewards/margins": 0.2138671875, | |
| "rewards/rejected": -0.1220703125, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.49870801033591733, | |
| "grad_norm": 335.9141540527344, | |
| "learning_rate": 1.0025839793281655e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -112.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.6129, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.02197265625, | |
| "rewards/margins": 0.201171875, | |
| "rewards/rejected": -0.1796875, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.5012919896640827, | |
| "grad_norm": 351.80316162109375, | |
| "learning_rate": 9.974160206718346e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.6016, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09228515625, | |
| "rewards/margins": 0.2421875, | |
| "rewards/rejected": -0.150390625, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.5038759689922481, | |
| "grad_norm": 338.88427734375, | |
| "learning_rate": 9.922480620155037e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -111.5, | |
| "loss": 0.6527, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.0303955078125, | |
| "rewards/margins": 0.109375, | |
| "rewards/rejected": -0.1396484375, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.5064599483204134, | |
| "grad_norm": 370.98345947265625, | |
| "learning_rate": 9.87080103359173e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -156.0, | |
| "loss": 0.5913, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03369140625, | |
| "rewards/margins": 0.267578125, | |
| "rewards/rejected": -0.2333984375, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.5090439276485789, | |
| "grad_norm": 360.0625, | |
| "learning_rate": 9.819121447028424e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -112.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.6224, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.008544921875, | |
| "rewards/margins": 0.173828125, | |
| "rewards/rejected": -0.181640625, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.5116279069767442, | |
| "grad_norm": 333.0406188964844, | |
| "learning_rate": 9.767441860465115e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5659, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.09912109375, | |
| "rewards/margins": 0.328125, | |
| "rewards/rejected": -0.2294921875, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.5142118863049095, | |
| "grad_norm": 357.7864685058594, | |
| "learning_rate": 9.715762273901809e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -155.0, | |
| "loss": 0.5864, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.076171875, | |
| "rewards/margins": 0.2734375, | |
| "rewards/rejected": -0.197265625, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 0.5167958656330749, | |
| "grad_norm": 360.8147277832031, | |
| "learning_rate": 9.6640826873385e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6389, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.01409912109375, | |
| "rewards/margins": 0.150390625, | |
| "rewards/rejected": -0.1357421875, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5193798449612403, | |
| "grad_norm": 353.4968566894531, | |
| "learning_rate": 9.612403100775193e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.5942, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.030517578125, | |
| "rewards/margins": 0.2470703125, | |
| "rewards/rejected": -0.27734375, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 0.5219638242894057, | |
| "grad_norm": 364.1571960449219, | |
| "learning_rate": 9.560723514211886e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -155.0, | |
| "loss": 0.5748, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.050048828125, | |
| "rewards/margins": 0.3125, | |
| "rewards/rejected": -0.26171875, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 0.524547803617571, | |
| "grad_norm": 349.590087890625, | |
| "learning_rate": 9.509043927648578e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.6078, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.042236328125, | |
| "rewards/margins": 0.2197265625, | |
| "rewards/rejected": -0.177734375, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 0.5271317829457365, | |
| "grad_norm": 326.5566711425781, | |
| "learning_rate": 9.457364341085271e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -126.0, | |
| "loss": 0.577, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03515625, | |
| "rewards/margins": 0.27734375, | |
| "rewards/rejected": -0.2412109375, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.5297157622739018, | |
| "grad_norm": 361.8912658691406, | |
| "learning_rate": 9.405684754521963e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.5764, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0108642578125, | |
| "rewards/margins": 0.3046875, | |
| "rewards/rejected": -0.29296875, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.5322997416020672, | |
| "grad_norm": 393.8551940917969, | |
| "learning_rate": 9.354005167958656e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -154.0, | |
| "loss": 0.5933, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08349609375, | |
| "rewards/margins": 0.240234375, | |
| "rewards/rejected": -0.15625, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 0.5348837209302325, | |
| "grad_norm": 394.2397766113281, | |
| "learning_rate": 9.302325581395349e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -158.0, | |
| "logps/rejected": -125.5, | |
| "loss": 0.5694, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0859375, | |
| "rewards/margins": 0.32421875, | |
| "rewards/rejected": -0.2392578125, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 0.537467700258398, | |
| "grad_norm": 412.0761413574219, | |
| "learning_rate": 9.250645994832042e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.6389, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0084228515625, | |
| "rewards/margins": 0.15625, | |
| "rewards/rejected": -0.1640625, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.5400516795865633, | |
| "grad_norm": 327.9852294921875, | |
| "learning_rate": 9.198966408268733e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5293, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1171875, | |
| "rewards/margins": 0.408203125, | |
| "rewards/rejected": -0.291015625, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 0.5426356589147286, | |
| "grad_norm": 356.892333984375, | |
| "learning_rate": 9.147286821705425e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.512, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09228515625, | |
| "rewards/margins": 0.44140625, | |
| "rewards/rejected": -0.349609375, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.5452196382428941, | |
| "grad_norm": 369.5984191894531, | |
| "learning_rate": 9.095607235142119e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.6122, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.04931640625, | |
| "rewards/margins": 0.2177734375, | |
| "rewards/rejected": -0.1689453125, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 0.5478036175710594, | |
| "grad_norm": 357.82122802734375, | |
| "learning_rate": 9.043927648578811e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.5928, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08154296875, | |
| "rewards/margins": 0.259765625, | |
| "rewards/rejected": -0.1787109375, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.5503875968992248, | |
| "grad_norm": 366.8385314941406, | |
| "learning_rate": 8.992248062015504e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -160.0, | |
| "loss": 0.5735, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.061767578125, | |
| "rewards/margins": 0.294921875, | |
| "rewards/rejected": -0.2333984375, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.5529715762273901, | |
| "grad_norm": 337.5374450683594, | |
| "learning_rate": 8.940568475452196e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.6036, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0186767578125, | |
| "rewards/margins": 0.2216796875, | |
| "rewards/rejected": -0.203125, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 0.5555555555555556, | |
| "grad_norm": 388.3349914550781, | |
| "learning_rate": 8.888888888888888e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6125, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.04052734375, | |
| "rewards/margins": 0.19921875, | |
| "rewards/rejected": -0.240234375, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 0.5581395348837209, | |
| "grad_norm": 391.5953063964844, | |
| "learning_rate": 8.837209302325581e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -151.0, | |
| "loss": 0.6274, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.023681640625, | |
| "rewards/margins": 0.18359375, | |
| "rewards/rejected": -0.1591796875, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 0.5607235142118863, | |
| "grad_norm": 408.422607421875, | |
| "learning_rate": 8.785529715762273e-07, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -152.0, | |
| "loss": 0.6159, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.028076171875, | |
| "rewards/margins": 0.2138671875, | |
| "rewards/rejected": -0.2421875, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 0.5633074935400517, | |
| "grad_norm": 315.7479553222656, | |
| "learning_rate": 8.733850129198967e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5319, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.078125, | |
| "rewards/margins": 0.388671875, | |
| "rewards/rejected": -0.310546875, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 0.5658914728682171, | |
| "grad_norm": 338.3675231933594, | |
| "learning_rate": 8.682170542635659e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -160.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5379, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1640625, | |
| "rewards/margins": 0.375, | |
| "rewards/rejected": -0.2109375, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 0.5684754521963824, | |
| "grad_norm": 367.66473388671875, | |
| "learning_rate": 8.630490956072352e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.5655, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.306640625, | |
| "rewards/rejected": -0.2451171875, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.5710594315245479, | |
| "grad_norm": 350.5587158203125, | |
| "learning_rate": 8.578811369509043e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.5753, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.02734375, | |
| "rewards/margins": 0.30078125, | |
| "rewards/rejected": -0.2734375, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 0.5736434108527132, | |
| "grad_norm": 361.6526184082031, | |
| "learning_rate": 8.527131782945736e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5745, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.06591796875, | |
| "rewards/margins": 0.29296875, | |
| "rewards/rejected": -0.2275390625, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 0.5762273901808785, | |
| "grad_norm": 361.86065673828125, | |
| "learning_rate": 8.475452196382429e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.6071, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1025390625, | |
| "rewards/margins": 0.2177734375, | |
| "rewards/rejected": -0.11572265625, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 0.5788113695090439, | |
| "grad_norm": 364.85150146484375, | |
| "learning_rate": 8.423772609819121e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -151.0, | |
| "loss": 0.5748, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.03515625, | |
| "rewards/margins": 0.302734375, | |
| "rewards/rejected": -0.267578125, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 0.5813953488372093, | |
| "grad_norm": 378.9034423828125, | |
| "learning_rate": 8.372093023255814e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -130.0, | |
| "loss": 0.5606, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.046142578125, | |
| "rewards/margins": 0.341796875, | |
| "rewards/rejected": -0.296875, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.5839793281653747, | |
| "grad_norm": 377.5055847167969, | |
| "learning_rate": 8.320413436692506e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.5322, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.10693359375, | |
| "rewards/margins": 0.37890625, | |
| "rewards/rejected": -0.271484375, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 0.58656330749354, | |
| "grad_norm": 362.3092956542969, | |
| "learning_rate": 8.268733850129198e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5547, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.06787109375, | |
| "rewards/margins": 0.353515625, | |
| "rewards/rejected": -0.28515625, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 0.5891472868217055, | |
| "grad_norm": 356.24755859375, | |
| "learning_rate": 8.217054263565891e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.545, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09619140625, | |
| "rewards/margins": 0.369140625, | |
| "rewards/rejected": -0.271484375, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.5917312661498708, | |
| "grad_norm": 378.0314025878906, | |
| "learning_rate": 8.165374677002583e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.90234375, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5986, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.032958984375, | |
| "rewards/margins": 0.25, | |
| "rewards/rejected": -0.2177734375, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 0.5943152454780362, | |
| "grad_norm": 335.54901123046875, | |
| "learning_rate": 8.113695090439277e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.5579, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0546875, | |
| "rewards/margins": 0.337890625, | |
| "rewards/rejected": -0.283203125, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.5968992248062015, | |
| "grad_norm": 350.567626953125, | |
| "learning_rate": 8.062015503875969e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -131.0, | |
| "loss": 0.5854, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.01953125, | |
| "rewards/margins": 0.29296875, | |
| "rewards/rejected": -0.2734375, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 0.599483204134367, | |
| "grad_norm": 325.7544860839844, | |
| "learning_rate": 8.010335917312661e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -127.0, | |
| "loss": 0.5523, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.07568359375, | |
| "rewards/margins": 0.341796875, | |
| "rewards/rejected": -0.265625, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 0.6020671834625323, | |
| "grad_norm": 349.6297607421875, | |
| "learning_rate": 7.958656330749353e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.5614, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.322265625, | |
| "rewards/rejected": -0.259765625, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 0.6046511627906976, | |
| "grad_norm": 377.7822265625, | |
| "learning_rate": 7.906976744186046e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -158.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.5689, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.01953125, | |
| "rewards/margins": 0.328125, | |
| "rewards/rejected": -0.30859375, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.6072351421188631, | |
| "grad_norm": 361.43487548828125, | |
| "learning_rate": 7.855297157622739e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5818, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.002349853515625, | |
| "rewards/margins": 0.28515625, | |
| "rewards/rejected": -0.28125, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 0.6098191214470284, | |
| "grad_norm": 368.1749572753906, | |
| "learning_rate": 7.803617571059431e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -158.0, | |
| "loss": 0.5587, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.061767578125, | |
| "rewards/margins": 0.328125, | |
| "rewards/rejected": -0.265625, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 0.6124031007751938, | |
| "grad_norm": 392.1849060058594, | |
| "learning_rate": 7.751937984496125e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.598, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.004547119140625, | |
| "rewards/margins": 0.2490234375, | |
| "rewards/rejected": -0.25390625, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 0.6149870801033591, | |
| "grad_norm": 371.883056640625, | |
| "learning_rate": 7.700258397932816e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5367, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03515625, | |
| "rewards/margins": 0.41796875, | |
| "rewards/rejected": -0.3828125, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 0.6175710594315246, | |
| "grad_norm": 394.88043212890625, | |
| "learning_rate": 7.648578811369508e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5676, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1513671875, | |
| "rewards/margins": 0.306640625, | |
| "rewards/rejected": -0.154296875, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 0.6201550387596899, | |
| "grad_norm": 401.91900634765625, | |
| "learning_rate": 7.596899224806201e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6092, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0673828125, | |
| "rewards/margins": 0.2314453125, | |
| "rewards/rejected": -0.298828125, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.6227390180878553, | |
| "grad_norm": 392.7043151855469, | |
| "learning_rate": 7.545219638242894e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5666, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07421875, | |
| "rewards/margins": 0.302734375, | |
| "rewards/rejected": -0.228515625, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 0.6253229974160207, | |
| "grad_norm": 308.71868896484375, | |
| "learning_rate": 7.493540051679587e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.5036, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08837890625, | |
| "rewards/margins": 0.4765625, | |
| "rewards/rejected": -0.38671875, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 0.627906976744186, | |
| "grad_norm": 391.1969909667969, | |
| "learning_rate": 7.441860465116279e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -165.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5482, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0281982421875, | |
| "rewards/margins": 0.39453125, | |
| "rewards/rejected": -0.365234375, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 0.6304909560723514, | |
| "grad_norm": 359.4422302246094, | |
| "learning_rate": 7.390180878552971e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -143.0, | |
| "loss": 0.5789, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.00860595703125, | |
| "rewards/margins": 0.2890625, | |
| "rewards/rejected": -0.296875, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 0.6330749354005168, | |
| "grad_norm": 336.4054260253906, | |
| "learning_rate": 7.338501291989664e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.5264, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.10498046875, | |
| "rewards/margins": 0.447265625, | |
| "rewards/rejected": -0.341796875, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 0.6356589147286822, | |
| "grad_norm": 370.9283447265625, | |
| "learning_rate": 7.286821705426356e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5901, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.027587890625, | |
| "rewards/margins": 0.26171875, | |
| "rewards/rejected": -0.234375, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 0.6382428940568475, | |
| "grad_norm": 347.1625061035156, | |
| "learning_rate": 7.235142118863049e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5607, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.00946044921875, | |
| "rewards/margins": 0.369140625, | |
| "rewards/rejected": -0.37890625, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 0.6408268733850129, | |
| "grad_norm": 403.0948791503906, | |
| "learning_rate": 7.183462532299741e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -119.5, | |
| "logps/rejected": -120.0, | |
| "loss": 0.6028, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.046142578125, | |
| "rewards/margins": 0.220703125, | |
| "rewards/rejected": -0.265625, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 0.6434108527131783, | |
| "grad_norm": 351.85125732421875, | |
| "learning_rate": 7.131782945736435e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.5043, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12060546875, | |
| "rewards/margins": 0.466796875, | |
| "rewards/rejected": -0.345703125, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 0.6459948320413437, | |
| "grad_norm": 362.1929626464844, | |
| "learning_rate": 7.080103359173126e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6043, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0390625, | |
| "rewards/margins": 0.23046875, | |
| "rewards/rejected": -0.26953125, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.648578811369509, | |
| "grad_norm": 360.3114013671875, | |
| "learning_rate": 7.028423772609818e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5684, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0673828125, | |
| "rewards/margins": 0.3359375, | |
| "rewards/rejected": -0.26953125, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 0.6511627906976745, | |
| "grad_norm": 370.75030517578125, | |
| "learning_rate": 6.976744186046511e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -151.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.5256, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12890625, | |
| "rewards/margins": 0.40234375, | |
| "rewards/rejected": -0.2734375, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 0.6537467700258398, | |
| "grad_norm": 351.92132568359375, | |
| "learning_rate": 6.925064599483204e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5125, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0703125, | |
| "rewards/margins": 0.46484375, | |
| "rewards/rejected": -0.39453125, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 0.6563307493540051, | |
| "grad_norm": 371.71484375, | |
| "learning_rate": 6.873385012919897e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.5452, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.01953125, | |
| "rewards/margins": 0.357421875, | |
| "rewards/rejected": -0.337890625, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 0.6589147286821705, | |
| "grad_norm": 383.404052734375, | |
| "learning_rate": 6.821705426356589e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -162.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.5901, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.046875, | |
| "rewards/margins": 0.265625, | |
| "rewards/rejected": -0.3125, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 0.661498708010336, | |
| "grad_norm": 377.6560363769531, | |
| "learning_rate": 6.770025839793282e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.5852, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.038330078125, | |
| "rewards/margins": 0.29296875, | |
| "rewards/rejected": -0.33203125, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 0.6640826873385013, | |
| "grad_norm": 344.1567687988281, | |
| "learning_rate": 6.718346253229974e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.5424, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.03515625, | |
| "rewards/margins": 0.376953125, | |
| "rewards/rejected": -0.33984375, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 415.87835693359375, | |
| "learning_rate": 6.666666666666666e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5995, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0030517578125, | |
| "rewards/margins": 0.27734375, | |
| "rewards/rejected": -0.275390625, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 0.6692506459948321, | |
| "grad_norm": 374.7701721191406, | |
| "learning_rate": 6.614987080103359e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.602, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0186767578125, | |
| "rewards/margins": 0.26171875, | |
| "rewards/rejected": -0.28125, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 0.6718346253229974, | |
| "grad_norm": 357.5523376464844, | |
| "learning_rate": 6.563307493540052e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.6002, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.00299072265625, | |
| "rewards/margins": 0.2470703125, | |
| "rewards/rejected": -0.244140625, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.6744186046511628, | |
| "grad_norm": 395.4364929199219, | |
| "learning_rate": 6.511627906976745e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6077, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.022705078125, | |
| "rewards/margins": 0.26171875, | |
| "rewards/rejected": -0.28515625, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 0.6770025839793282, | |
| "grad_norm": 397.8664855957031, | |
| "learning_rate": 6.459948320413436e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.5885, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.07568359375, | |
| "rewards/margins": 0.255859375, | |
| "rewards/rejected": -0.33203125, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 0.6795865633074936, | |
| "grad_norm": 370.6977233886719, | |
| "learning_rate": 6.408268733850128e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.567, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04052734375, | |
| "rewards/margins": 0.353515625, | |
| "rewards/rejected": -0.3125, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 0.6821705426356589, | |
| "grad_norm": 344.52294921875, | |
| "learning_rate": 6.356589147286822e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5358, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0093994140625, | |
| "rewards/margins": 0.3984375, | |
| "rewards/rejected": -0.408203125, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 0.6847545219638242, | |
| "grad_norm": 373.7255554199219, | |
| "learning_rate": 6.304909560723514e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.536, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.02587890625, | |
| "rewards/margins": 0.416015625, | |
| "rewards/rejected": -0.390625, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 0.6873385012919897, | |
| "grad_norm": 365.46527099609375, | |
| "learning_rate": 6.253229974160207e-07, | |
| "logits/chosen": -0.91796875, | |
| "logits/rejected": -0.90625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5803, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0203857421875, | |
| "rewards/margins": 0.322265625, | |
| "rewards/rejected": -0.34375, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 0.689922480620155, | |
| "grad_norm": 371.0267028808594, | |
| "learning_rate": 6.201550387596898e-07, | |
| "logits/chosen": -0.8984375, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.5389, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0703125, | |
| "rewards/margins": 0.40234375, | |
| "rewards/rejected": -0.33203125, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 0.6925064599483204, | |
| "grad_norm": 391.9967041015625, | |
| "learning_rate": 6.149870801033591e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -153.0, | |
| "loss": 0.5749, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.000827789306640625, | |
| "rewards/margins": 0.291015625, | |
| "rewards/rejected": -0.2890625, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 0.6950904392764858, | |
| "grad_norm": 388.2448425292969, | |
| "learning_rate": 6.098191214470284e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.5569, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.032958984375, | |
| "rewards/margins": 0.3828125, | |
| "rewards/rejected": -0.349609375, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 0.6976744186046512, | |
| "grad_norm": 397.50323486328125, | |
| "learning_rate": 6.046511627906976e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.5377, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.006988525390625, | |
| "rewards/margins": 0.41015625, | |
| "rewards/rejected": -0.40234375, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.7002583979328165, | |
| "grad_norm": 407.18768310546875, | |
| "learning_rate": 5.99483204134367e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5713, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0203857421875, | |
| "rewards/margins": 0.328125, | |
| "rewards/rejected": -0.30859375, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 0.7028423772609819, | |
| "grad_norm": 377.3880920410156, | |
| "learning_rate": 5.943152454780362e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.5552, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.006256103515625, | |
| "rewards/margins": 0.35546875, | |
| "rewards/rejected": -0.349609375, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 0.7054263565891473, | |
| "grad_norm": 419.07037353515625, | |
| "learning_rate": 5.891472868217054e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -118.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5958, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0311279296875, | |
| "rewards/margins": 0.26953125, | |
| "rewards/rejected": -0.30078125, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 0.7080103359173127, | |
| "grad_norm": 386.485107421875, | |
| "learning_rate": 5.839793281653746e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6083, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.039794921875, | |
| "rewards/margins": 0.265625, | |
| "rewards/rejected": -0.3046875, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 0.710594315245478, | |
| "grad_norm": 348.43505859375, | |
| "learning_rate": 5.788113695090438e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.526, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.00482177734375, | |
| "rewards/margins": 0.416015625, | |
| "rewards/rejected": -0.41015625, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.7131782945736435, | |
| "grad_norm": 409.5932922363281, | |
| "learning_rate": 5.736434108527132e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5934, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.02734375, | |
| "rewards/margins": 0.2451171875, | |
| "rewards/rejected": -0.2734375, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 0.7157622739018088, | |
| "grad_norm": 368.6764831542969, | |
| "learning_rate": 5.684754521963824e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.5712, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.05078125, | |
| "rewards/margins": 0.333984375, | |
| "rewards/rejected": -0.384765625, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 0.7183462532299741, | |
| "grad_norm": 401.7375793457031, | |
| "learning_rate": 5.633074935400517e-07, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.5649, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0172119140625, | |
| "rewards/margins": 0.35546875, | |
| "rewards/rejected": -0.373046875, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 0.7209302325581395, | |
| "grad_norm": 378.2952575683594, | |
| "learning_rate": 5.581395348837209e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.5991, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0257568359375, | |
| "rewards/margins": 0.2373046875, | |
| "rewards/rejected": -0.263671875, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 0.7235142118863049, | |
| "grad_norm": 413.5380554199219, | |
| "learning_rate": 5.529715762273901e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -157.0, | |
| "loss": 0.5965, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.039794921875, | |
| "rewards/margins": 0.2734375, | |
| "rewards/rejected": -0.3125, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.7260981912144703, | |
| "grad_norm": 363.4127197265625, | |
| "learning_rate": 5.478036175710594e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -149.0, | |
| "loss": 0.5662, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.010986328125, | |
| "rewards/margins": 0.3203125, | |
| "rewards/rejected": -0.33203125, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 0.7286821705426356, | |
| "grad_norm": 378.63299560546875, | |
| "learning_rate": 5.426356589147286e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -123.0, | |
| "loss": 0.5472, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07958984375, | |
| "rewards/margins": 0.3984375, | |
| "rewards/rejected": -0.318359375, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 0.7312661498708011, | |
| "grad_norm": 395.1712951660156, | |
| "learning_rate": 5.37467700258398e-07, | |
| "logits/chosen": -0.8984375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -121.5, | |
| "loss": 0.5435, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0225830078125, | |
| "rewards/margins": 0.3984375, | |
| "rewards/rejected": -0.421875, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 0.7338501291989664, | |
| "grad_norm": 358.454345703125, | |
| "learning_rate": 5.322997416020672e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5327, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.115234375, | |
| "rewards/margins": 0.427734375, | |
| "rewards/rejected": -0.3125, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 0.7364341085271318, | |
| "grad_norm": 393.966796875, | |
| "learning_rate": 5.271317829457364e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -136.0, | |
| "loss": 0.627, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.042236328125, | |
| "rewards/margins": 0.1923828125, | |
| "rewards/rejected": -0.234375, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 0.7390180878552972, | |
| "grad_norm": 376.2955322265625, | |
| "learning_rate": 5.219638242894056e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -160.0, | |
| "loss": 0.5792, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.04931640625, | |
| "rewards/margins": 0.330078125, | |
| "rewards/rejected": -0.37890625, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 0.7416020671834626, | |
| "grad_norm": 409.2053527832031, | |
| "learning_rate": 5.167958656330749e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -118.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.6108, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.130859375, | |
| "rewards/margins": 0.2197265625, | |
| "rewards/rejected": -0.349609375, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 0.7441860465116279, | |
| "grad_norm": 364.067626953125, | |
| "learning_rate": 5.116279069767442e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.5334, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.042236328125, | |
| "rewards/margins": 0.380859375, | |
| "rewards/rejected": -0.33984375, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 0.7467700258397932, | |
| "grad_norm": 436.3753356933594, | |
| "learning_rate": 5.064599483204134e-07, | |
| "logits/chosen": -0.9140625, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -131.0, | |
| "loss": 0.6072, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.051513671875, | |
| "rewards/margins": 0.25, | |
| "rewards/rejected": -0.30078125, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 0.7493540051679587, | |
| "grad_norm": 420.2207336425781, | |
| "learning_rate": 5.012919896640828e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -151.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.608, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.01318359375, | |
| "rewards/margins": 0.2578125, | |
| "rewards/rejected": -0.271484375, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.751937984496124, | |
| "grad_norm": 378.3236083984375, | |
| "learning_rate": 4.961240310077519e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.5271, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.11279296875, | |
| "rewards/margins": 0.423828125, | |
| "rewards/rejected": -0.310546875, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 0.7545219638242894, | |
| "grad_norm": 374.6150817871094, | |
| "learning_rate": 4.909560723514212e-07, | |
| "logits/chosen": -0.91015625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.5492, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.037353515625, | |
| "rewards/margins": 0.373046875, | |
| "rewards/rejected": -0.41015625, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 0.7571059431524548, | |
| "grad_norm": 349.1102600097656, | |
| "learning_rate": 4.857881136950904e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -121.5, | |
| "loss": 0.54, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05615234375, | |
| "rewards/margins": 0.392578125, | |
| "rewards/rejected": -0.3359375, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 0.7596899224806202, | |
| "grad_norm": 400.560302734375, | |
| "learning_rate": 4.806201550387597e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5764, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0079345703125, | |
| "rewards/margins": 0.33203125, | |
| "rewards/rejected": -0.32421875, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 0.7622739018087855, | |
| "grad_norm": 341.3611145019531, | |
| "learning_rate": 4.754521963824289e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5256, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.03271484375, | |
| "rewards/margins": 0.44921875, | |
| "rewards/rejected": -0.41796875, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 0.7648578811369509, | |
| "grad_norm": 345.73077392578125, | |
| "learning_rate": 4.7028423772609815e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5225, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.02587890625, | |
| "rewards/margins": 0.43359375, | |
| "rewards/rejected": -0.408203125, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 0.7674418604651163, | |
| "grad_norm": 404.53668212890625, | |
| "learning_rate": 4.6511627906976743e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5674, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.003082275390625, | |
| "rewards/margins": 0.322265625, | |
| "rewards/rejected": -0.326171875, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 0.7700258397932817, | |
| "grad_norm": 378.0136413574219, | |
| "learning_rate": 4.5994832041343666e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5527, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09912109375, | |
| "rewards/margins": 0.37109375, | |
| "rewards/rejected": -0.470703125, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 0.772609819121447, | |
| "grad_norm": 425.3061828613281, | |
| "learning_rate": 4.5478036175710593e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5983, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.056396484375, | |
| "rewards/margins": 0.275390625, | |
| "rewards/rejected": -0.21875, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 0.7751937984496124, | |
| "grad_norm": 370.2434387207031, | |
| "learning_rate": 4.496124031007752e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -121.5, | |
| "loss": 0.5974, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0203857421875, | |
| "rewards/margins": 0.259765625, | |
| "rewards/rejected": -0.28125, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.7777777777777778, | |
| "grad_norm": 380.1609802246094, | |
| "learning_rate": 4.444444444444444e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.523, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0732421875, | |
| "rewards/margins": 0.439453125, | |
| "rewards/rejected": -0.365234375, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 0.7803617571059431, | |
| "grad_norm": 399.3497009277344, | |
| "learning_rate": 4.3927648578811366e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.5543, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.05078125, | |
| "rewards/margins": 0.375, | |
| "rewards/rejected": -0.326171875, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 0.7829457364341085, | |
| "grad_norm": 399.6018981933594, | |
| "learning_rate": 4.3410852713178294e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -172.0, | |
| "loss": 0.5702, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0203857421875, | |
| "rewards/margins": 0.3125, | |
| "rewards/rejected": -0.29296875, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 0.7855297157622739, | |
| "grad_norm": 421.47235107421875, | |
| "learning_rate": 4.2894056847545216e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5662, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0703125, | |
| "rewards/margins": 0.33984375, | |
| "rewards/rejected": -0.41015625, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 0.7881136950904393, | |
| "grad_norm": 387.08172607421875, | |
| "learning_rate": 4.2377260981912144e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5011, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03125, | |
| "rewards/margins": 0.498046875, | |
| "rewards/rejected": -0.466796875, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 0.7906976744186046, | |
| "grad_norm": 339.8193664550781, | |
| "learning_rate": 4.186046511627907e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.5362, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09375, | |
| "rewards/margins": 0.39453125, | |
| "rewards/rejected": -0.30078125, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 0.7932816537467701, | |
| "grad_norm": 378.47100830078125, | |
| "learning_rate": 4.134366925064599e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.5189, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0054931640625, | |
| "rewards/margins": 0.4921875, | |
| "rewards/rejected": -0.48828125, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 0.7958656330749354, | |
| "grad_norm": 377.9639587402344, | |
| "learning_rate": 4.0826873385012917e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -121.5, | |
| "loss": 0.5417, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0869140625, | |
| "rewards/margins": 0.44921875, | |
| "rewards/rejected": -0.36328125, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 0.7984496124031008, | |
| "grad_norm": 389.46624755859375, | |
| "learning_rate": 4.0310077519379845e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.5643, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.068359375, | |
| "rewards/margins": 0.369140625, | |
| "rewards/rejected": -0.30078125, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 0.8010335917312662, | |
| "grad_norm": 360.7492980957031, | |
| "learning_rate": 3.9793281653746767e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.496, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1591796875, | |
| "rewards/margins": 0.5234375, | |
| "rewards/rejected": -0.365234375, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.8036175710594315, | |
| "grad_norm": 438.1676940917969, | |
| "learning_rate": 3.9276485788113695e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.6559, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.1640625, | |
| "rewards/margins": 0.1279296875, | |
| "rewards/rejected": -0.29296875, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 0.8062015503875969, | |
| "grad_norm": 379.49896240234375, | |
| "learning_rate": 3.8759689922480623e-07, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.5618, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0279541015625, | |
| "rewards/margins": 0.337890625, | |
| "rewards/rejected": -0.3671875, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 0.8087855297157622, | |
| "grad_norm": 381.6045227050781, | |
| "learning_rate": 3.824289405684754e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.5596, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0079345703125, | |
| "rewards/margins": 0.34375, | |
| "rewards/rejected": -0.3359375, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 0.8113695090439277, | |
| "grad_norm": 407.3009948730469, | |
| "learning_rate": 3.772609819121447e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5457, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.034423828125, | |
| "rewards/margins": 0.392578125, | |
| "rewards/rejected": -0.357421875, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 0.813953488372093, | |
| "grad_norm": 379.11956787109375, | |
| "learning_rate": 3.7209302325581396e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.5155, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.00311279296875, | |
| "rewards/margins": 0.462890625, | |
| "rewards/rejected": -0.458984375, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 0.8165374677002584, | |
| "grad_norm": 391.218017578125, | |
| "learning_rate": 3.669250645994832e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.552, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0390625, | |
| "rewards/margins": 0.388671875, | |
| "rewards/rejected": -0.427734375, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 0.8191214470284238, | |
| "grad_norm": 426.7617492675781, | |
| "learning_rate": 3.6175710594315246e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.6192, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.0830078125, | |
| "rewards/margins": 0.2158203125, | |
| "rewards/rejected": -0.298828125, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 0.8217054263565892, | |
| "grad_norm": 414.6080627441406, | |
| "learning_rate": 3.5658914728682174e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.5533, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.06884765625, | |
| "rewards/margins": 0.396484375, | |
| "rewards/rejected": -0.466796875, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 0.8242894056847545, | |
| "grad_norm": 379.4181823730469, | |
| "learning_rate": 3.514211886304909e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -156.0, | |
| "loss": 0.5718, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.00075531005859375, | |
| "rewards/margins": 0.357421875, | |
| "rewards/rejected": -0.357421875, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 0.8268733850129198, | |
| "grad_norm": 407.3499755859375, | |
| "learning_rate": 3.462532299741602e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.5623, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0228271484375, | |
| "rewards/margins": 0.349609375, | |
| "rewards/rejected": -0.328125, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.8294573643410853, | |
| "grad_norm": 381.62030029296875, | |
| "learning_rate": 3.4108527131782946e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.5624, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0849609375, | |
| "rewards/margins": 0.341796875, | |
| "rewards/rejected": -0.42578125, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 0.8320413436692506, | |
| "grad_norm": 403.3800964355469, | |
| "learning_rate": 3.359173126614987e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.5454, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.004730224609375, | |
| "rewards/margins": 0.388671875, | |
| "rewards/rejected": -0.392578125, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 0.834625322997416, | |
| "grad_norm": 373.6676025390625, | |
| "learning_rate": 3.3074935400516797e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.5639, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.03125, | |
| "rewards/margins": 0.36328125, | |
| "rewards/rejected": -0.39453125, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 0.8372093023255814, | |
| "grad_norm": 407.47747802734375, | |
| "learning_rate": 3.2558139534883724e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -130.0, | |
| "loss": 0.5892, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0478515625, | |
| "rewards/margins": 0.29296875, | |
| "rewards/rejected": -0.33984375, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 0.8397932816537468, | |
| "grad_norm": 364.1658935546875, | |
| "learning_rate": 3.204134366925064e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.5142, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08447265625, | |
| "rewards/margins": 0.474609375, | |
| "rewards/rejected": -0.390625, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.8423772609819121, | |
| "grad_norm": 362.48040771484375, | |
| "learning_rate": 3.152454780361757e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -141.0, | |
| "loss": 0.5242, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.04150390625, | |
| "rewards/margins": 0.447265625, | |
| "rewards/rejected": -0.40625, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 0.8449612403100775, | |
| "grad_norm": 412.084716796875, | |
| "learning_rate": 3.100775193798449e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -154.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.5799, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03125, | |
| "rewards/margins": 0.310546875, | |
| "rewards/rejected": -0.27734375, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 0.8475452196382429, | |
| "grad_norm": 386.69219970703125, | |
| "learning_rate": 3.049095607235142e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.5845, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.02734375, | |
| "rewards/margins": 0.30859375, | |
| "rewards/rejected": -0.3359375, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 0.8501291989664083, | |
| "grad_norm": 377.74664306640625, | |
| "learning_rate": 2.997416020671835e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.5349, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0732421875, | |
| "rewards/margins": 0.416015625, | |
| "rewards/rejected": -0.341796875, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 0.8527131782945736, | |
| "grad_norm": 392.24786376953125, | |
| "learning_rate": 2.945736434108527e-07, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.5776, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.09765625, | |
| "rewards/margins": 0.279296875, | |
| "rewards/rejected": -0.376953125, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.8552971576227391, | |
| "grad_norm": 339.7447204589844, | |
| "learning_rate": 2.894056847545219e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5315, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.056884765625, | |
| "rewards/margins": 0.43359375, | |
| "rewards/rejected": -0.376953125, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 0.8578811369509044, | |
| "grad_norm": 377.9252624511719, | |
| "learning_rate": 2.842377260981912e-07, | |
| "logits/chosen": -0.91796875, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -150.0, | |
| "loss": 0.4913, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.040771484375, | |
| "rewards/margins": 0.49609375, | |
| "rewards/rejected": -0.455078125, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 0.8604651162790697, | |
| "grad_norm": 396.7610778808594, | |
| "learning_rate": 2.7906976744186043e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.5567, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.12060546875, | |
| "rewards/margins": 0.41015625, | |
| "rewards/rejected": -0.2890625, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 0.8630490956072352, | |
| "grad_norm": 367.93438720703125, | |
| "learning_rate": 2.739018087855297e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.5735, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0296630859375, | |
| "rewards/margins": 0.34765625, | |
| "rewards/rejected": -0.318359375, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 0.8656330749354005, | |
| "grad_norm": 338.41644287109375, | |
| "learning_rate": 2.68733850129199e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -122.5, | |
| "loss": 0.5182, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05078125, | |
| "rewards/margins": 0.46484375, | |
| "rewards/rejected": -0.4140625, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 0.8682170542635659, | |
| "grad_norm": 420.8653869628906, | |
| "learning_rate": 2.635658914728682e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -121.0, | |
| "loss": 0.6331, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.140625, | |
| "rewards/margins": 0.1943359375, | |
| "rewards/rejected": -0.3359375, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 0.8708010335917312, | |
| "grad_norm": 418.4413757324219, | |
| "learning_rate": 2.5839793281653743e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -117.5, | |
| "loss": 0.5797, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.046875, | |
| "rewards/margins": 0.296875, | |
| "rewards/rejected": -0.34375, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 0.8733850129198967, | |
| "grad_norm": 389.128662109375, | |
| "learning_rate": 2.532299741602067e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.5772, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.042236328125, | |
| "rewards/margins": 0.333984375, | |
| "rewards/rejected": -0.375, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 0.875968992248062, | |
| "grad_norm": 380.782470703125, | |
| "learning_rate": 2.4806201550387593e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -145.0, | |
| "loss": 0.5589, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.05322265625, | |
| "rewards/margins": 0.380859375, | |
| "rewards/rejected": -0.328125, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 0.8785529715762274, | |
| "grad_norm": 371.532958984375, | |
| "learning_rate": 2.428940568475452e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -153.0, | |
| "loss": 0.5039, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0203857421875, | |
| "rewards/margins": 0.515625, | |
| "rewards/rejected": -0.49609375, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.8811369509043928, | |
| "grad_norm": 376.73736572265625, | |
| "learning_rate": 2.3772609819121444e-07, | |
| "logits/chosen": -0.921875, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -132.0, | |
| "loss": 0.5676, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0101318359375, | |
| "rewards/margins": 0.30859375, | |
| "rewards/rejected": -0.298828125, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 0.8837209302325582, | |
| "grad_norm": 366.2059020996094, | |
| "learning_rate": 2.3255813953488372e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -133.0, | |
| "loss": 0.523, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0203857421875, | |
| "rewards/margins": 0.4375, | |
| "rewards/rejected": -0.416015625, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 0.8863049095607235, | |
| "grad_norm": 467.3062744140625, | |
| "learning_rate": 2.2739018087855297e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.6332, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.1748046875, | |
| "rewards/margins": 0.15625, | |
| "rewards/rejected": -0.33203125, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 400.25677490234375, | |
| "learning_rate": 2.222222222222222e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -129.0, | |
| "loss": 0.5532, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.01239013671875, | |
| "rewards/margins": 0.349609375, | |
| "rewards/rejected": -0.337890625, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 0.8914728682170543, | |
| "grad_norm": 393.77587890625, | |
| "learning_rate": 2.1705426356589147e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.567, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.040771484375, | |
| "rewards/margins": 0.330078125, | |
| "rewards/rejected": -0.37109375, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 0.8940568475452196, | |
| "grad_norm": 416.1154479980469, | |
| "learning_rate": 2.1188630490956072e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -140.0, | |
| "loss": 0.5573, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.064453125, | |
| "rewards/margins": 0.353515625, | |
| "rewards/rejected": -0.41796875, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 0.896640826873385, | |
| "grad_norm": 406.4513244628906, | |
| "learning_rate": 2.0671834625322995e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -146.0, | |
| "loss": 0.5757, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.06884765625, | |
| "rewards/margins": 0.3125, | |
| "rewards/rejected": -0.380859375, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 0.8992248062015504, | |
| "grad_norm": 366.8443908691406, | |
| "learning_rate": 2.0155038759689922e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.511, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.006927490234375, | |
| "rewards/margins": 0.498046875, | |
| "rewards/rejected": -0.50390625, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 0.9018087855297158, | |
| "grad_norm": 379.0568542480469, | |
| "learning_rate": 1.9638242894056847e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -148.0, | |
| "loss": 0.5513, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0244140625, | |
| "rewards/margins": 0.369140625, | |
| "rewards/rejected": -0.392578125, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 0.9043927648578811, | |
| "grad_norm": 404.06915283203125, | |
| "learning_rate": 1.912144702842377e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5874, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.04833984375, | |
| "rewards/margins": 0.283203125, | |
| "rewards/rejected": -0.33203125, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.9069767441860465, | |
| "grad_norm": 407.20172119140625, | |
| "learning_rate": 1.8604651162790698e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -120.5, | |
| "logps/rejected": -144.0, | |
| "loss": 0.5469, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0537109375, | |
| "rewards/margins": 0.380859375, | |
| "rewards/rejected": -0.326171875, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 0.9095607235142119, | |
| "grad_norm": 367.9174499511719, | |
| "learning_rate": 1.8087855297157623e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -151.0, | |
| "logps/rejected": -143.0, | |
| "loss": 0.5195, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0186767578125, | |
| "rewards/margins": 0.431640625, | |
| "rewards/rejected": -0.451171875, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 0.9121447028423773, | |
| "grad_norm": 337.8936462402344, | |
| "learning_rate": 1.7571059431524545e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -124.5, | |
| "loss": 0.5336, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0712890625, | |
| "rewards/margins": 0.41015625, | |
| "rewards/rejected": -0.33984375, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 0.9147286821705426, | |
| "grad_norm": 359.1859436035156, | |
| "learning_rate": 1.7054263565891473e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.5594, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03369140625, | |
| "rewards/margins": 0.37890625, | |
| "rewards/rejected": -0.34375, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 0.917312661498708, | |
| "grad_norm": 379.411865234375, | |
| "learning_rate": 1.6537467700258398e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -162.0, | |
| "loss": 0.4905, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0859375, | |
| "rewards/margins": 0.5390625, | |
| "rewards/rejected": -0.451171875, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 0.9198966408268734, | |
| "grad_norm": 424.71099853515625, | |
| "learning_rate": 1.602067183462532e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5555, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.03369140625, | |
| "rewards/margins": 0.349609375, | |
| "rewards/rejected": -0.3828125, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 0.9224806201550387, | |
| "grad_norm": 378.3841857910156, | |
| "learning_rate": 1.5503875968992246e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -134.0, | |
| "loss": 0.588, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.08447265625, | |
| "rewards/margins": 0.279296875, | |
| "rewards/rejected": -0.36328125, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 0.9250645994832042, | |
| "grad_norm": 407.63934326171875, | |
| "learning_rate": 1.4987080103359174e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -121.0, | |
| "loss": 0.5896, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.07470703125, | |
| "rewards/margins": 0.279296875, | |
| "rewards/rejected": -0.353515625, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 0.9276485788113695, | |
| "grad_norm": 324.2749328613281, | |
| "learning_rate": 1.4470284237726096e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -120.5, | |
| "loss": 0.5383, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.10302734375, | |
| "rewards/margins": 0.43359375, | |
| "rewards/rejected": -0.53515625, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 0.9302325581395349, | |
| "grad_norm": 368.79931640625, | |
| "learning_rate": 1.3953488372093021e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5193, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0162353515625, | |
| "rewards/margins": 0.462890625, | |
| "rewards/rejected": -0.478515625, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.9328165374677002, | |
| "grad_norm": 451.83233642578125, | |
| "learning_rate": 1.343669250645995e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -165.0, | |
| "loss": 0.5992, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0235595703125, | |
| "rewards/margins": 0.3203125, | |
| "rewards/rejected": -0.298828125, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 0.9354005167958657, | |
| "grad_norm": 417.2298583984375, | |
| "learning_rate": 1.2919896640826872e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -154.0, | |
| "logps/rejected": -135.0, | |
| "loss": 0.5792, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0218505859375, | |
| "rewards/margins": 0.310546875, | |
| "rewards/rejected": -0.33203125, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 0.937984496124031, | |
| "grad_norm": 378.72222900390625, | |
| "learning_rate": 1.2403100775193797e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -156.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.5247, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.078125, | |
| "rewards/margins": 0.451171875, | |
| "rewards/rejected": -0.373046875, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 0.9405684754521964, | |
| "grad_norm": 347.5020751953125, | |
| "learning_rate": 1.1886304909560722e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -168.0, | |
| "loss": 0.4286, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1181640625, | |
| "rewards/margins": 0.7109375, | |
| "rewards/rejected": -0.58984375, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 0.9431524547803618, | |
| "grad_norm": 357.3157043457031, | |
| "learning_rate": 1.1369509043927648e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.4937, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.026611328125, | |
| "rewards/margins": 0.49609375, | |
| "rewards/rejected": -0.46875, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 0.9457364341085271, | |
| "grad_norm": 383.900390625, | |
| "learning_rate": 1.0852713178294573e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.90625, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -153.0, | |
| "loss": 0.4791, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0024566650390625, | |
| "rewards/margins": 0.578125, | |
| "rewards/rejected": -0.57421875, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 0.9483204134366925, | |
| "grad_norm": 399.00592041015625, | |
| "learning_rate": 1.0335917312661497e-07, | |
| "logits/chosen": -0.90234375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -144.0, | |
| "loss": 0.6084, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.09765625, | |
| "rewards/margins": 0.279296875, | |
| "rewards/rejected": -0.376953125, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 0.9509043927648578, | |
| "grad_norm": 371.8937683105469, | |
| "learning_rate": 9.819121447028424e-08, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -140.0, | |
| "loss": 0.551, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.024169921875, | |
| "rewards/margins": 0.375, | |
| "rewards/rejected": -0.349609375, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 0.9534883720930233, | |
| "grad_norm": 375.73895263671875, | |
| "learning_rate": 9.302325581395349e-08, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5354, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.003814697265625, | |
| "rewards/margins": 0.404296875, | |
| "rewards/rejected": -0.400390625, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 0.9560723514211886, | |
| "grad_norm": 477.898193359375, | |
| "learning_rate": 8.785529715762273e-08, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -118.0, | |
| "logps/rejected": -147.0, | |
| "loss": 0.5193, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09716796875, | |
| "rewards/margins": 0.443359375, | |
| "rewards/rejected": -0.345703125, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.958656330749354, | |
| "grad_norm": 379.3886413574219, | |
| "learning_rate": 8.268733850129199e-08, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.571, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.05224609375, | |
| "rewards/margins": 0.373046875, | |
| "rewards/rejected": -0.423828125, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 0.9612403100775194, | |
| "grad_norm": 385.4183654785156, | |
| "learning_rate": 7.751937984496123e-08, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.514, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0517578125, | |
| "rewards/margins": 0.4609375, | |
| "rewards/rejected": -0.51171875, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 0.9638242894056848, | |
| "grad_norm": 369.193115234375, | |
| "learning_rate": 7.235142118863048e-08, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -171.0, | |
| "loss": 0.5537, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.010986328125, | |
| "rewards/margins": 0.36328125, | |
| "rewards/rejected": -0.3515625, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 0.9664082687338501, | |
| "grad_norm": 349.1363830566406, | |
| "learning_rate": 6.718346253229975e-08, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -128.0, | |
| "loss": 0.4849, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0869140625, | |
| "rewards/margins": 0.5390625, | |
| "rewards/rejected": -0.451171875, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 0.9689922480620154, | |
| "grad_norm": 421.71875, | |
| "learning_rate": 6.201550387596898e-08, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -152.0, | |
| "loss": 0.6088, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.046142578125, | |
| "rewards/margins": 0.2333984375, | |
| "rewards/rejected": -0.279296875, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.9715762273901809, | |
| "grad_norm": 405.0057373046875, | |
| "learning_rate": 5.684754521963824e-08, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -139.0, | |
| "loss": 0.5885, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0986328125, | |
| "rewards/margins": 0.275390625, | |
| "rewards/rejected": -0.375, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 0.9741602067183462, | |
| "grad_norm": 392.13677978515625, | |
| "learning_rate": 5.1679586563307486e-08, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -154.0, | |
| "logps/rejected": -155.0, | |
| "loss": 0.5356, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.035888671875, | |
| "rewards/margins": 0.40234375, | |
| "rewards/rejected": -0.4375, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 0.9767441860465116, | |
| "grad_norm": 395.9448547363281, | |
| "learning_rate": 4.6511627906976744e-08, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -157.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.597, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0830078125, | |
| "rewards/margins": 0.29296875, | |
| "rewards/rejected": -0.375, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 0.979328165374677, | |
| "grad_norm": 467.2771301269531, | |
| "learning_rate": 4.1343669250645996e-08, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -154.0, | |
| "loss": 0.6342, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.11083984375, | |
| "rewards/margins": 0.2294921875, | |
| "rewards/rejected": -0.33984375, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 0.9819121447028424, | |
| "grad_norm": 372.8404235839844, | |
| "learning_rate": 3.617571059431524e-08, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.4995, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.11181640625, | |
| "rewards/margins": 0.498046875, | |
| "rewards/rejected": -0.384765625, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.9844961240310077, | |
| "grad_norm": 363.5488586425781, | |
| "learning_rate": 3.100775193798449e-08, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -158.0, | |
| "loss": 0.5378, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07763671875, | |
| "rewards/margins": 0.443359375, | |
| "rewards/rejected": -0.3671875, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 0.9870801033591732, | |
| "grad_norm": 368.29443359375, | |
| "learning_rate": 2.5839793281653743e-08, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -142.0, | |
| "loss": 0.5362, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.10546875, | |
| "rewards/margins": 0.427734375, | |
| "rewards/rejected": -0.53515625, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 0.9896640826873385, | |
| "grad_norm": 398.1756896972656, | |
| "learning_rate": 2.0671834625322998e-08, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -138.0, | |
| "loss": 0.5559, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09130859375, | |
| "rewards/margins": 0.369140625, | |
| "rewards/rejected": -0.27734375, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 0.9922480620155039, | |
| "grad_norm": 347.91717529296875, | |
| "learning_rate": 1.5503875968992246e-08, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5034, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.01153564453125, | |
| "rewards/margins": 0.4765625, | |
| "rewards/rejected": -0.46484375, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 0.9948320413436692, | |
| "grad_norm": 362.68157958984375, | |
| "learning_rate": 1.0335917312661499e-08, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -137.0, | |
| "loss": 0.5386, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0303955078125, | |
| "rewards/margins": 0.400390625, | |
| "rewards/rejected": -0.369140625, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 0.9974160206718347, | |
| "grad_norm": 347.4972229003906, | |
| "learning_rate": 5.1679586563307495e-09, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.4995, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.02197265625, | |
| "rewards/margins": 0.5078125, | |
| "rewards/rejected": -0.53125, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 349.7977600097656, | |
| "learning_rate": 0.0, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -136.0, | |
| "loss": 0.5355, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0830078125, | |
| "rewards/margins": 0.42578125, | |
| "rewards/rejected": -0.5078125, | |
| "step": 387 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 387, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |