Instructions to use cragtmp/task1p with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/task1p with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/task1p") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 600, | |
| "best_metric": 0.24665305, | |
| "best_model_checkpoint": "/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105/checkpoint-600", | |
| "epoch": 1.210047967684928, | |
| "eval_steps": 300, | |
| "global_step": 600, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002019691996970462, | |
| "grad_norm": 12.761810302734375, | |
| "learning_rate": 4.000000000000001e-06, | |
| "logits/chosen": -0.5775864720344543, | |
| "logits/rejected": -0.7030954360961914, | |
| "logps/chosen": -6.236894130706787, | |
| "logps/rejected": -24.46524429321289, | |
| "loss": 1.2380319833755493, | |
| "memory(GiB)": 32.64, | |
| "nll_loss": 0.5448847413063049, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.0187 | |
| }, | |
| { | |
| "epoch": 0.004039383993940924, | |
| "grad_norm": 8.313699722290039, | |
| "learning_rate": 8.000000000000001e-06, | |
| "logits/chosen": -0.8238492012023926, | |
| "logits/rejected": -0.8350682258605957, | |
| "logps/chosen": -5.732274055480957, | |
| "logps/rejected": -11.927969932556152, | |
| "loss": 1.4877614974975586, | |
| "memory(GiB)": 32.64, | |
| "nll_loss": 0.7946141958236694, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.020044 | |
| }, | |
| { | |
| "epoch": 0.006059075990911386, | |
| "grad_norm": 21.77679443359375, | |
| "learning_rate": 1.2e-05, | |
| "logits/chosen": -0.6877153515815735, | |
| "logits/rejected": -0.7822633981704712, | |
| "logps/chosen": -7.046360015869141, | |
| "logps/rejected": -14.666805267333984, | |
| "loss": 1.5761629343032837, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.8832842707633972, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.0033746182452887297, | |
| "rewards/margins": 0.0006902526365593076, | |
| "rewards/rejected": 0.0026843654923141003, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.020481 | |
| }, | |
| { | |
| "epoch": 0.008078767987881848, | |
| "grad_norm": 12.999642372131348, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "logits/chosen": -0.7259287238121033, | |
| "logits/rejected": -0.8152387142181396, | |
| "logps/chosen": -4.8744587898254395, | |
| "logps/rejected": -14.308876991271973, | |
| "loss": 1.4366666078567505, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.7484119534492493, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0021331249736249447, | |
| "rewards/margins": 0.009978920221328735, | |
| "rewards/rejected": -0.007845795713365078, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.020724 | |
| }, | |
| { | |
| "epoch": 0.01009845998485231, | |
| "grad_norm": 12.841984748840332, | |
| "learning_rate": 2e-05, | |
| "logits/chosen": -0.681520402431488, | |
| "logits/rejected": -0.7851653695106506, | |
| "logps/chosen": -5.029726982116699, | |
| "logps/rejected": -16.70825958251953, | |
| "loss": 1.2887729406356812, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.6066412329673767, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.02295457012951374, | |
| "rewards/margins": 0.022426389157772064, | |
| "rewards/rejected": 0.0005281821941025555, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.020852 | |
| }, | |
| { | |
| "epoch": 0.012118151981822771, | |
| "grad_norm": 13.818325996398926, | |
| "learning_rate": 2.4e-05, | |
| "logits/chosen": -0.6980650424957275, | |
| "logits/rejected": -0.8158392310142517, | |
| "logps/chosen": -4.0964484214782715, | |
| "logps/rejected": -15.3903169631958, | |
| "loss": 1.3540700674057007, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.6896780133247375, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.06763897091150284, | |
| "rewards/margins": 0.06137145683169365, | |
| "rewards/rejected": 0.00626751035451889, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.020943 | |
| }, | |
| { | |
| "epoch": 0.014137843978793235, | |
| "grad_norm": 8.670878410339355, | |
| "learning_rate": 2.8000000000000003e-05, | |
| "logits/chosen": -0.6072264909744263, | |
| "logits/rejected": -0.7461887001991272, | |
| "logps/chosen": -6.871906757354736, | |
| "logps/rejected": -19.193540573120117, | |
| "loss": 1.1981984376907349, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.5265603065490723, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04815364256501198, | |
| "rewards/margins": 0.053483281284570694, | |
| "rewards/rejected": -0.005329643841832876, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.020996 | |
| }, | |
| { | |
| "epoch": 0.016157535975763696, | |
| "grad_norm": 4.796175003051758, | |
| "learning_rate": 3.2000000000000005e-05, | |
| "logits/chosen": -0.7197842597961426, | |
| "logits/rejected": -0.7792064547538757, | |
| "logps/chosen": -7.072351455688477, | |
| "logps/rejected": -14.618125915527344, | |
| "loss": 1.1894290447235107, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.4693164825439453, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.13033029437065125, | |
| "rewards/margins": -0.01030611153692007, | |
| "rewards/rejected": 0.1406363844871521, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.021046 | |
| }, | |
| { | |
| "epoch": 0.018177227972734158, | |
| "grad_norm": 6.6790852546691895, | |
| "learning_rate": 3.6e-05, | |
| "logits/chosen": -0.689906656742096, | |
| "logits/rejected": -0.8183166980743408, | |
| "logps/chosen": -1.6468329429626465, | |
| "logps/rejected": -13.756692886352539, | |
| "loss": 0.8348377346992493, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.2248959094285965, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1438780128955841, | |
| "rewards/margins": 0.22025901079177856, | |
| "rewards/rejected": -0.07638098299503326, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.021091 | |
| }, | |
| { | |
| "epoch": 0.02019691996970462, | |
| "grad_norm": 11.680863380432129, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.7386271953582764, | |
| "logits/rejected": -0.8098344206809998, | |
| "logps/chosen": -3.001471996307373, | |
| "logps/rejected": -16.38292694091797, | |
| "loss": 1.0789214372634888, | |
| "memory(GiB)": 35.3, | |
| "nll_loss": 0.5013705492019653, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18567466735839844, | |
| "rewards/margins": 0.40445780754089355, | |
| "rewards/rejected": -0.21878314018249512, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.021135 | |
| }, | |
| { | |
| "epoch": 0.02221661196667508, | |
| "grad_norm": 6.016479015350342, | |
| "learning_rate": 4.4000000000000006e-05, | |
| "logits/chosen": -0.6199511289596558, | |
| "logits/rejected": -0.7641665935516357, | |
| "logps/chosen": -1.786482810974121, | |
| "logps/rejected": -23.814146041870117, | |
| "loss": 0.6213081479072571, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.17753979563713074, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1519775092601776, | |
| "rewards/margins": 0.6798387169837952, | |
| "rewards/rejected": -0.5278611779212952, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.021205 | |
| }, | |
| { | |
| "epoch": 0.024236303963645543, | |
| "grad_norm": 19.226726531982422, | |
| "learning_rate": 4.8e-05, | |
| "logits/chosen": -0.7735041975975037, | |
| "logits/rejected": -0.8182462453842163, | |
| "logps/chosen": -6.024149417877197, | |
| "logps/rejected": -14.866905212402344, | |
| "loss": 1.467666506767273, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.8242200016975403, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.03484102711081505, | |
| "rewards/margins": 0.42743903398513794, | |
| "rewards/rejected": -0.4622800350189209, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 0.026255995960616008, | |
| "grad_norm": 3.4483253955841064, | |
| "learning_rate": 5.2000000000000004e-05, | |
| "logits/chosen": -0.754300594329834, | |
| "logits/rejected": -0.7772647738456726, | |
| "logps/chosen": -3.619762659072876, | |
| "logps/rejected": -17.524477005004883, | |
| "loss": 0.7115153074264526, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.2013324648141861, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10463516414165497, | |
| "rewards/margins": 0.7878110408782959, | |
| "rewards/rejected": -0.6831759214401245, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.021242 | |
| }, | |
| { | |
| "epoch": 0.02827568795758647, | |
| "grad_norm": 15.451835632324219, | |
| "learning_rate": 5.6000000000000006e-05, | |
| "logits/chosen": -0.7475101947784424, | |
| "logits/rejected": -0.8498263359069824, | |
| "logps/chosen": -3.9441192150115967, | |
| "logps/rejected": -21.486186981201172, | |
| "loss": 0.9213531613349915, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.5798130035400391, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09564964473247528, | |
| "rewards/margins": 1.039682149887085, | |
| "rewards/rejected": -0.9440325498580933, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.03029537995455693, | |
| "grad_norm": 3.8979263305664062, | |
| "learning_rate": 6e-05, | |
| "logits/chosen": -0.6522198915481567, | |
| "logits/rejected": -0.7548784017562866, | |
| "logps/chosen": -2.765364408493042, | |
| "logps/rejected": -21.602596282958984, | |
| "loss": 0.6480428576469421, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.23036827147006989, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13951444625854492, | |
| "rewards/margins": 0.8476398587226868, | |
| "rewards/rejected": -0.7081253528594971, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.021272 | |
| }, | |
| { | |
| "epoch": 0.03231507195152739, | |
| "grad_norm": 7.998473644256592, | |
| "learning_rate": 6.400000000000001e-05, | |
| "logits/chosen": -0.7795235514640808, | |
| "logits/rejected": -0.8571889400482178, | |
| "logps/chosen": -2.1100573539733887, | |
| "logps/rejected": -13.082208633422852, | |
| "loss": 0.8766142129898071, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.41500476002693176, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11589755117893219, | |
| "rewards/margins": 0.6957570910453796, | |
| "rewards/rejected": -0.5798596143722534, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.021293 | |
| }, | |
| { | |
| "epoch": 0.034334763948497854, | |
| "grad_norm": 2.908738613128662, | |
| "learning_rate": 6.800000000000001e-05, | |
| "logits/chosen": -0.7900448441505432, | |
| "logits/rejected": -0.8519578576087952, | |
| "logps/chosen": -3.0429553985595703, | |
| "logps/rejected": -13.749216079711914, | |
| "loss": 0.7060399651527405, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.27812597155570984, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40308868885040283, | |
| "rewards/margins": 0.7511462569236755, | |
| "rewards/rejected": -0.3480575382709503, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.021313 | |
| }, | |
| { | |
| "epoch": 0.036354455945468316, | |
| "grad_norm": 4.66619348526001, | |
| "learning_rate": 7.2e-05, | |
| "logits/chosen": -0.7611753344535828, | |
| "logits/rejected": -0.8464637398719788, | |
| "logps/chosen": -3.652045488357544, | |
| "logps/rejected": -19.29679298400879, | |
| "loss": 0.9751962423324585, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.4190734326839447, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.08509862422943115, | |
| "rewards/margins": 0.42228081822395325, | |
| "rewards/rejected": -0.3371821641921997, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.021323 | |
| }, | |
| { | |
| "epoch": 0.03837414794243878, | |
| "grad_norm": 4.54453706741333, | |
| "learning_rate": 7.6e-05, | |
| "logits/chosen": -0.7284001708030701, | |
| "logits/rejected": -0.7670996189117432, | |
| "logps/chosen": -6.018934726715088, | |
| "logps/rejected": -13.253512382507324, | |
| "loss": 1.2025885581970215, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.45651721954345703, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0025453297421336174, | |
| "rewards/margins": 0.006808534264564514, | |
| "rewards/rejected": -0.004263207316398621, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.021331 | |
| }, | |
| { | |
| "epoch": 0.04039383993940924, | |
| "grad_norm": 2.965843677520752, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.674504280090332, | |
| "logits/rejected": -0.7847579121589661, | |
| "logps/chosen": -3.122269630432129, | |
| "logps/rejected": -16.265222549438477, | |
| "loss": 0.9356863498687744, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.2812672257423401, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.12974591553211212, | |
| "rewards/margins": 0.18470463156700134, | |
| "rewards/rejected": -0.05495870113372803, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.021338 | |
| }, | |
| { | |
| "epoch": 0.0424135319363797, | |
| "grad_norm": 3.544822931289673, | |
| "learning_rate": 8.4e-05, | |
| "logits/chosen": -0.8259390592575073, | |
| "logits/rejected": -0.8455062508583069, | |
| "logps/chosen": -6.160022258758545, | |
| "logps/rejected": -8.875776290893555, | |
| "loss": 1.0958666801452637, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.4123613238334656, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.17430700361728668, | |
| "rewards/margins": 0.11852678656578064, | |
| "rewards/rejected": 0.05578019842505455, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.021349 | |
| }, | |
| { | |
| "epoch": 0.04443322393335016, | |
| "grad_norm": 2.8963093757629395, | |
| "learning_rate": 8.800000000000001e-05, | |
| "logits/chosen": -0.7398238778114319, | |
| "logits/rejected": -0.83761066198349, | |
| "logps/chosen": -2.3067612648010254, | |
| "logps/rejected": -13.408963203430176, | |
| "loss": 0.9400858879089355, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.26946064829826355, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1603003889322281, | |
| "rewards/margins": 0.15373794734477997, | |
| "rewards/rejected": 0.00656244158744812, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.021358 | |
| }, | |
| { | |
| "epoch": 0.046452915930320623, | |
| "grad_norm": 3.5623438358306885, | |
| "learning_rate": 9.200000000000001e-05, | |
| "logits/chosen": -0.6750966906547546, | |
| "logits/rejected": -0.7796332836151123, | |
| "logps/chosen": -3.6001622676849365, | |
| "logps/rejected": -14.151020050048828, | |
| "loss": 1.0653876066207886, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.4920450747013092, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2231697142124176, | |
| "rewards/margins": 0.34812790155410767, | |
| "rewards/rejected": -0.12495820969343185, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.021362 | |
| }, | |
| { | |
| "epoch": 0.048472607927291085, | |
| "grad_norm": 3.5425710678100586, | |
| "learning_rate": 9.6e-05, | |
| "logits/chosen": -0.7490979433059692, | |
| "logits/rejected": -0.8129041194915771, | |
| "logps/chosen": -2.327343463897705, | |
| "logps/rejected": -10.883130073547363, | |
| "loss": 0.921205461025238, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.2920321822166443, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09307915717363358, | |
| "rewards/margins": 0.1912679672241211, | |
| "rewards/rejected": -0.09818882495164871, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.021367 | |
| }, | |
| { | |
| "epoch": 0.05049229992426155, | |
| "grad_norm": 4.050752639770508, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.6667495965957642, | |
| "logits/rejected": -0.7579994201660156, | |
| "logps/chosen": -6.037406921386719, | |
| "logps/rejected": -19.315378189086914, | |
| "loss": 0.8225780725479126, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.3186819851398468, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3055117130279541, | |
| "rewards/margins": 0.4999930262565613, | |
| "rewards/rejected": -0.19448129832744598, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.021364 | |
| }, | |
| { | |
| "epoch": 0.052511991921232015, | |
| "grad_norm": 3.7214102745056152, | |
| "learning_rate": 0.00010400000000000001, | |
| "logits/chosen": -0.7550854086875916, | |
| "logits/rejected": -0.8332770466804504, | |
| "logps/chosen": -3.076296329498291, | |
| "logps/rejected": -13.947905540466309, | |
| "loss": 1.0035364627838135, | |
| "memory(GiB)": 38.2, | |
| "nll_loss": 0.3730461597442627, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03216666728258133, | |
| "rewards/margins": 0.19776780903339386, | |
| "rewards/rejected": -0.16560114920139313, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.02137 | |
| }, | |
| { | |
| "epoch": 0.05453168391820248, | |
| "grad_norm": 7.799258708953857, | |
| "learning_rate": 0.00010800000000000001, | |
| "logits/chosen": -0.6102021932601929, | |
| "logits/rejected": -0.7568979263305664, | |
| "logps/chosen": -5.391008377075195, | |
| "logps/rejected": -21.710432052612305, | |
| "loss": 1.2860000133514404, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.6317353844642639, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.007743582129478455, | |
| "rewards/margins": 0.258750855922699, | |
| "rewards/rejected": -0.2510072588920593, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.021361 | |
| }, | |
| { | |
| "epoch": 0.05655137591517294, | |
| "grad_norm": 3.4134862422943115, | |
| "learning_rate": 0.00011200000000000001, | |
| "logits/chosen": -0.681388795375824, | |
| "logits/rejected": -0.7808853983879089, | |
| "logps/chosen": -5.752387523651123, | |
| "logps/rejected": -19.651212692260742, | |
| "loss": 1.1130492687225342, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.4609695374965668, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.029274294152855873, | |
| "rewards/margins": 0.19754451513290405, | |
| "rewards/rejected": -0.16827021539211273, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.021358 | |
| }, | |
| { | |
| "epoch": 0.0585710679121434, | |
| "grad_norm": 2.6125388145446777, | |
| "learning_rate": 0.000116, | |
| "logits/chosen": -0.6846833229064941, | |
| "logits/rejected": -0.7732559442520142, | |
| "logps/chosen": -2.147914171218872, | |
| "logps/rejected": -14.99377727508545, | |
| "loss": 0.6967631578445435, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.18463140726089478, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3106439709663391, | |
| "rewards/margins": 0.524000346660614, | |
| "rewards/rejected": -0.2133564054965973, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.021362 | |
| }, | |
| { | |
| "epoch": 0.06059075990911386, | |
| "grad_norm": 3.1886954307556152, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.7671568393707275, | |
| "logits/rejected": -0.8747203946113586, | |
| "logps/chosen": -1.0704294443130493, | |
| "logps/rejected": -15.217928886413574, | |
| "loss": 0.6793683171272278, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.11626588553190231, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2649898827075958, | |
| "rewards/margins": 0.3756120800971985, | |
| "rewards/rejected": -0.11062214523553848, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.02137 | |
| }, | |
| { | |
| "epoch": 0.06261045190608432, | |
| "grad_norm": 3.672961711883545, | |
| "learning_rate": 0.000124, | |
| "logits/chosen": -0.6060948967933655, | |
| "logits/rejected": -0.7454618811607361, | |
| "logps/chosen": -3.801156997680664, | |
| "logps/rejected": -23.42005157470703, | |
| "loss": 1.0564124584197998, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.4279017746448517, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.18183766305446625, | |
| "rewards/margins": 0.23221838474273682, | |
| "rewards/rejected": -0.050380729138851166, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.021365 | |
| }, | |
| { | |
| "epoch": 0.06463014390305478, | |
| "grad_norm": 5.934133529663086, | |
| "learning_rate": 0.00012800000000000002, | |
| "logits/chosen": -0.7708523869514465, | |
| "logits/rejected": -0.81435227394104, | |
| "logps/chosen": -2.663968801498413, | |
| "logps/rejected": -11.808816909790039, | |
| "loss": 0.9843453168869019, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.37907925248146057, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.18125101923942566, | |
| "rewards/margins": 0.27721551060676575, | |
| "rewards/rejected": -0.0959644690155983, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.021371 | |
| }, | |
| { | |
| "epoch": 0.06664983590002524, | |
| "grad_norm": 3.0649428367614746, | |
| "learning_rate": 0.000132, | |
| "logits/chosen": -0.651940107345581, | |
| "logits/rejected": -0.7574964761734009, | |
| "logps/chosen": -1.5061438083648682, | |
| "logps/rejected": -21.272098541259766, | |
| "loss": 0.670626163482666, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.23393775522708893, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.312156617641449, | |
| "rewards/margins": 0.6968778967857361, | |
| "rewards/rejected": -0.38472118973731995, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.021373 | |
| }, | |
| { | |
| "epoch": 0.06866952789699571, | |
| "grad_norm": 3.6389997005462646, | |
| "learning_rate": 0.00013600000000000003, | |
| "logits/chosen": -0.6423748731613159, | |
| "logits/rejected": -0.6685101985931396, | |
| "logps/chosen": -6.548682689666748, | |
| "logps/rejected": -13.626079559326172, | |
| "loss": 1.1170402765274048, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.480682373046875, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.2068958729505539, | |
| "rewards/margins": 0.31287699937820435, | |
| "rewards/rejected": -0.10598116368055344, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.021372 | |
| }, | |
| { | |
| "epoch": 0.07068921989396618, | |
| "grad_norm": 2.625232219696045, | |
| "learning_rate": 0.00014, | |
| "logits/chosen": -0.5362560749053955, | |
| "logits/rejected": -0.7028357982635498, | |
| "logps/chosen": -3.359612464904785, | |
| "logps/rejected": -33.268436431884766, | |
| "loss": 0.8328565955162048, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.28516510128974915, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.05316687747836113, | |
| "rewards/margins": 0.685168981552124, | |
| "rewards/rejected": -0.6320021748542786, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.02137 | |
| }, | |
| { | |
| "epoch": 0.07270891189093663, | |
| "grad_norm": 2.7919955253601074, | |
| "learning_rate": 0.000144, | |
| "logits/chosen": -0.6247209906578064, | |
| "logits/rejected": -0.7358378767967224, | |
| "logps/chosen": -4.632122039794922, | |
| "logps/rejected": -18.708053588867188, | |
| "loss": 0.719286322593689, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.25582897663116455, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.32600465416908264, | |
| "rewards/margins": 0.7712743282318115, | |
| "rewards/rejected": -0.44526970386505127, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.021371 | |
| }, | |
| { | |
| "epoch": 0.0747286038879071, | |
| "grad_norm": 2.5269482135772705, | |
| "learning_rate": 0.000148, | |
| "logits/chosen": -0.6388774514198303, | |
| "logits/rejected": -0.7476755976676941, | |
| "logps/chosen": -1.6513766050338745, | |
| "logps/rejected": -20.447532653808594, | |
| "loss": 0.652652382850647, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.181876540184021, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2968735098838806, | |
| "rewards/margins": 0.7243574857711792, | |
| "rewards/rejected": -0.4274839758872986, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.021373 | |
| }, | |
| { | |
| "epoch": 0.07674829588487755, | |
| "grad_norm": 2.419584274291992, | |
| "learning_rate": 0.000152, | |
| "logits/chosen": -0.5964392423629761, | |
| "logits/rejected": -0.7218829393386841, | |
| "logps/chosen": -1.5039414167404175, | |
| "logps/rejected": -27.090576171875, | |
| "loss": 0.6621359586715698, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.14563477039337158, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.28821805119514465, | |
| "rewards/margins": 0.77447509765625, | |
| "rewards/rejected": -0.48625698685646057, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.021373 | |
| }, | |
| { | |
| "epoch": 0.07876798788184802, | |
| "grad_norm": 3.088440179824829, | |
| "learning_rate": 0.00015600000000000002, | |
| "logits/chosen": -0.7012370824813843, | |
| "logits/rejected": -0.8179476261138916, | |
| "logps/chosen": -1.9244059324264526, | |
| "logps/rejected": -21.519695281982422, | |
| "loss": 0.6807724237442017, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.244890034198761, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15054234862327576, | |
| "rewards/margins": 0.9000046849250793, | |
| "rewards/rejected": -0.749462366104126, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.021371 | |
| }, | |
| { | |
| "epoch": 0.08078767987881848, | |
| "grad_norm": 2.713752508163452, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.6608636379241943, | |
| "logits/rejected": -0.7343001365661621, | |
| "logps/chosen": -4.701538562774658, | |
| "logps/rejected": -27.00352668762207, | |
| "loss": 0.6774569749832153, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.2570435106754303, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13876499235630035, | |
| "rewards/margins": 1.0153288841247559, | |
| "rewards/rejected": -0.8765639066696167, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.021373 | |
| }, | |
| { | |
| "epoch": 0.08280737187578895, | |
| "grad_norm": 4.948164463043213, | |
| "learning_rate": 0.000164, | |
| "logits/chosen": -0.6391008496284485, | |
| "logits/rejected": -0.6671096682548523, | |
| "logps/chosen": -8.970189094543457, | |
| "logps/rejected": -14.413579940795898, | |
| "loss": 1.0303566455841064, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.41976141929626465, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0029628686606884003, | |
| "rewards/margins": 0.573236882686615, | |
| "rewards/rejected": -0.5761997699737549, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.021375 | |
| }, | |
| { | |
| "epoch": 0.0848270638727594, | |
| "grad_norm": 4.40416955947876, | |
| "learning_rate": 0.000168, | |
| "logits/chosen": -0.6820927858352661, | |
| "logits/rejected": -0.7476735711097717, | |
| "logps/chosen": -4.897199630737305, | |
| "logps/rejected": -17.570022583007812, | |
| "loss": 0.9847887754440308, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.42955508828163147, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.08176113665103912, | |
| "rewards/margins": 0.5534911155700684, | |
| "rewards/rejected": -0.47172996401786804, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.021376 | |
| }, | |
| { | |
| "epoch": 0.08684675586972987, | |
| "grad_norm": 5.150269508361816, | |
| "learning_rate": 0.000172, | |
| "logits/chosen": -0.7095463275909424, | |
| "logits/rejected": -0.7945126891136169, | |
| "logps/chosen": -4.1012396812438965, | |
| "logps/rejected": -20.216747283935547, | |
| "loss": 0.956037700176239, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.5109948515892029, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19462859630584717, | |
| "rewards/margins": 0.853682279586792, | |
| "rewards/rejected": -0.6590536832809448, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.021378 | |
| }, | |
| { | |
| "epoch": 0.08886644786670032, | |
| "grad_norm": 4.477358341217041, | |
| "learning_rate": 0.00017600000000000002, | |
| "logits/chosen": -0.7657253742218018, | |
| "logits/rejected": -0.8225359320640564, | |
| "logps/chosen": -2.71124267578125, | |
| "logps/rejected": -13.512589454650879, | |
| "loss": 0.8599216341972351, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.27771878242492676, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.13035942614078522, | |
| "rewards/margins": 0.38512665033340454, | |
| "rewards/rejected": -0.25476720929145813, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.021381 | |
| }, | |
| { | |
| "epoch": 0.09088613986367079, | |
| "grad_norm": 5.4391255378723145, | |
| "learning_rate": 0.00018, | |
| "logits/chosen": -0.6582808494567871, | |
| "logits/rejected": -0.7074710726737976, | |
| "logps/chosen": -5.520257472991943, | |
| "logps/rejected": -18.50946044921875, | |
| "loss": 0.8143137693405151, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.2541295886039734, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06929375976324081, | |
| "rewards/margins": 0.6602391004562378, | |
| "rewards/rejected": -0.590945303440094, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.02138 | |
| }, | |
| { | |
| "epoch": 0.09290583186064125, | |
| "grad_norm": 4.585366249084473, | |
| "learning_rate": 0.00018400000000000003, | |
| "logits/chosen": -0.722661018371582, | |
| "logits/rejected": -0.7770288586616516, | |
| "logps/chosen": -3.6351494789123535, | |
| "logps/rejected": -10.902822494506836, | |
| "loss": 1.1608294248580933, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.47840094566345215, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": 0.09331849962472916, | |
| "rewards/margins": 0.1440279632806778, | |
| "rewards/rejected": -0.05070946365594864, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.021384 | |
| }, | |
| { | |
| "epoch": 0.09492552385761172, | |
| "grad_norm": 4.578927040100098, | |
| "learning_rate": 0.000188, | |
| "logits/chosen": -0.6195976734161377, | |
| "logits/rejected": -0.7779173254966736, | |
| "logps/chosen": -0.9245270490646362, | |
| "logps/rejected": -30.03981590270996, | |
| "loss": 0.5132064819335938, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.10489758849143982, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2798718214035034, | |
| "rewards/margins": 0.944153904914856, | |
| "rewards/rejected": -0.6642820835113525, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.021382 | |
| }, | |
| { | |
| "epoch": 0.09694521585458217, | |
| "grad_norm": 6.127289772033691, | |
| "learning_rate": 0.000192, | |
| "logits/chosen": -0.6809214949607849, | |
| "logits/rejected": -0.7704883813858032, | |
| "logps/chosen": -1.4336328506469727, | |
| "logps/rejected": -16.669113159179688, | |
| "loss": 0.8413453102111816, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.27693358063697815, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1910504847764969, | |
| "rewards/margins": 0.4971596598625183, | |
| "rewards/rejected": -0.30610913038253784, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.021382 | |
| }, | |
| { | |
| "epoch": 0.09896490785155264, | |
| "grad_norm": 5.920216083526611, | |
| "learning_rate": 0.000196, | |
| "logits/chosen": -0.744787335395813, | |
| "logits/rejected": -0.7133767604827881, | |
| "logps/chosen": -8.577417373657227, | |
| "logps/rejected": -15.383255958557129, | |
| "loss": 1.23928964138031, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.5441281199455261, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.1016860231757164, | |
| "rewards/margins": 0.13402265310287476, | |
| "rewards/rejected": -0.23570865392684937, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.021382 | |
| }, | |
| { | |
| "epoch": 0.1009845998485231, | |
| "grad_norm": 5.736071586608887, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.7741532325744629, | |
| "logits/rejected": -0.8851832747459412, | |
| "logps/chosen": -4.090970039367676, | |
| "logps/rejected": -21.758840560913086, | |
| "loss": 1.0278420448303223, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.5550558567047119, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.15652738511562347, | |
| "rewards/margins": 0.8236760497093201, | |
| "rewards/rejected": -0.6671487092971802, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.021383 | |
| }, | |
| { | |
| "epoch": 0.10300429184549356, | |
| "grad_norm": 4.201787948608398, | |
| "learning_rate": 0.0001999994415122672, | |
| "logits/chosen": -0.8024938106536865, | |
| "logits/rejected": -0.8299172520637512, | |
| "logps/chosen": -6.9087419509887695, | |
| "logps/rejected": -10.72697639465332, | |
| "loss": 1.1162101030349731, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.4278947114944458, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.060360271483659744, | |
| "rewards/margins": 0.15178537368774414, | |
| "rewards/rejected": -0.0914250910282135, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.021239 | |
| }, | |
| { | |
| "epoch": 0.10502398384246403, | |
| "grad_norm": 3.155092477798462, | |
| "learning_rate": 0.0001999977660553069, | |
| "logits/chosen": -0.6624072790145874, | |
| "logits/rejected": -0.8125584125518799, | |
| "logps/chosen": -1.1845072507858276, | |
| "logps/rejected": -28.393592834472656, | |
| "loss": 0.5598468780517578, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.15286707878112793, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2649957835674286, | |
| "rewards/margins": 1.0407716035842896, | |
| "rewards/rejected": -0.7757757902145386, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.02124 | |
| }, | |
| { | |
| "epoch": 0.10704367583943449, | |
| "grad_norm": 3.9601948261260986, | |
| "learning_rate": 0.0001999949736478336, | |
| "logits/chosen": -0.8051952719688416, | |
| "logits/rejected": -0.8654646873474121, | |
| "logps/chosen": -3.793642997741699, | |
| "logps/rejected": -17.214599609375, | |
| "loss": 0.738736629486084, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.23666247725486755, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.17774169147014618, | |
| "rewards/margins": 0.6443970799446106, | |
| "rewards/rejected": -0.4666553735733032, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.021244 | |
| }, | |
| { | |
| "epoch": 0.10906336783640495, | |
| "grad_norm": 2.747492790222168, | |
| "learning_rate": 0.0001999910643210378, | |
| "logits/chosen": -0.7448392510414124, | |
| "logits/rejected": -0.9058634042739868, | |
| "logps/chosen": -1.6127703189849854, | |
| "logps/rejected": -30.806520462036133, | |
| "loss": 0.5075910091400146, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.17231889069080353, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.4633626639842987, | |
| "rewards/margins": 1.3208293914794922, | |
| "rewards/rejected": -0.8574665784835815, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.021246 | |
| }, | |
| { | |
| "epoch": 0.11108305983337541, | |
| "grad_norm": 3.485903739929199, | |
| "learning_rate": 0.00019998603811858571, | |
| "logits/chosen": -0.6839566230773926, | |
| "logits/rejected": -0.8555458784103394, | |
| "logps/chosen": -2.3723244667053223, | |
| "logps/rejected": -34.97600173950195, | |
| "loss": 0.7429671883583069, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.3656916618347168, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.24485386908054352, | |
| "rewards/margins": 1.4793577194213867, | |
| "rewards/rejected": -1.2345038652420044, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.021247 | |
| }, | |
| { | |
| "epoch": 0.11310275183034588, | |
| "grad_norm": 4.815752029418945, | |
| "learning_rate": 0.0001999798950966188, | |
| "logits/chosen": -0.7993583679199219, | |
| "logits/rejected": -0.8806532025337219, | |
| "logps/chosen": -5.939935207366943, | |
| "logps/rejected": -18.04892349243164, | |
| "loss": 1.1477632522583008, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.5634173154830933, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.026777414605021477, | |
| "rewards/margins": 0.612076461315155, | |
| "rewards/rejected": -0.5852990746498108, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.021251 | |
| }, | |
| { | |
| "epoch": 0.11512244382731633, | |
| "grad_norm": 2.9355173110961914, | |
| "learning_rate": 0.00019997263532375303, | |
| "logits/chosen": -0.7389899492263794, | |
| "logits/rejected": -0.8667410612106323, | |
| "logps/chosen": -2.2958154678344727, | |
| "logps/rejected": -32.464534759521484, | |
| "loss": 0.6630210876464844, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.3285917043685913, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1826460361480713, | |
| "rewards/margins": 1.4345746040344238, | |
| "rewards/rejected": -1.251928448677063, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.021253 | |
| }, | |
| { | |
| "epoch": 0.1171421358242868, | |
| "grad_norm": 4.644790172576904, | |
| "learning_rate": 0.0001999642588810784, | |
| "logits/chosen": -0.8502639532089233, | |
| "logits/rejected": -0.9041623473167419, | |
| "logps/chosen": -4.175015449523926, | |
| "logps/rejected": -20.228912353515625, | |
| "loss": 1.007567048072815, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.4676174223423004, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.053391821682453156, | |
| "rewards/margins": 0.8722233176231384, | |
| "rewards/rejected": -0.925615131855011, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.021258 | |
| }, | |
| { | |
| "epoch": 0.11916182782125725, | |
| "grad_norm": 4.834179878234863, | |
| "learning_rate": 0.00019995476586215762, | |
| "logits/chosen": -0.8684061169624329, | |
| "logits/rejected": -0.9059044718742371, | |
| "logps/chosen": -9.152887344360352, | |
| "logps/rejected": -15.517383575439453, | |
| "loss": 1.118729591369629, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.6267417073249817, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0668405294418335, | |
| "rewards/margins": 0.7597751021385193, | |
| "rewards/rejected": -0.6929346323013306, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.021264 | |
| }, | |
| { | |
| "epoch": 0.12118151981822772, | |
| "grad_norm": 3.052858591079712, | |
| "learning_rate": 0.00019994415637302547, | |
| "logits/chosen": -0.7785470485687256, | |
| "logits/rejected": -0.8464182019233704, | |
| "logps/chosen": -2.411245107650757, | |
| "logps/rejected": -17.925155639648438, | |
| "loss": 0.7822959423065186, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.25340673327445984, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.19467662274837494, | |
| "rewards/margins": 0.8461788892745972, | |
| "rewards/rejected": -0.6515023112297058, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.021268 | |
| }, | |
| { | |
| "epoch": 0.12320121181519818, | |
| "grad_norm": 3.3108043670654297, | |
| "learning_rate": 0.0001999324305321873, | |
| "logits/chosen": -0.762412428855896, | |
| "logits/rejected": -0.8276241421699524, | |
| "logps/chosen": -2.0741934776306152, | |
| "logps/rejected": -14.743797302246094, | |
| "loss": 0.8085264563560486, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.25528597831726074, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13805074989795685, | |
| "rewards/margins": 0.4351329803466797, | |
| "rewards/rejected": -0.29708221554756165, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.021273 | |
| }, | |
| { | |
| "epoch": 0.12522090381216863, | |
| "grad_norm": 3.6591594219207764, | |
| "learning_rate": 0.00019991958847061784, | |
| "logits/chosen": -0.6577974557876587, | |
| "logits/rejected": -0.7462488412857056, | |
| "logps/chosen": -5.370046138763428, | |
| "logps/rejected": -15.76892375946045, | |
| "loss": 0.9229806661605835, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.3679361343383789, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.14663854241371155, | |
| "rewards/margins": 0.4843655228614807, | |
| "rewards/rejected": -0.33772704005241394, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.1272405958091391, | |
| "grad_norm": 3.069516658782959, | |
| "learning_rate": 0.00019990563033175983, | |
| "logits/chosen": -0.6640661954879761, | |
| "logits/rejected": -0.7672103643417358, | |
| "logps/chosen": -2.8094382286071777, | |
| "logps/rejected": -18.480703353881836, | |
| "loss": 0.7683196663856506, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.2581484913825989, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2657431662082672, | |
| "rewards/margins": 0.5364934802055359, | |
| "rewards/rejected": -0.27075034379959106, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.12926028780610957, | |
| "grad_norm": 4.207716464996338, | |
| "learning_rate": 0.0001998905562715222, | |
| "logits/chosen": -0.7866019010543823, | |
| "logits/rejected": -0.8437267541885376, | |
| "logps/chosen": -6.750940799713135, | |
| "logps/rejected": -15.358600616455078, | |
| "loss": 1.2175216674804688, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.6082065105438232, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.004789266735315323, | |
| "rewards/margins": 0.4517655074596405, | |
| "rewards/rejected": -0.44697627425193787, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.021281 | |
| }, | |
| { | |
| "epoch": 0.13127997980308004, | |
| "grad_norm": 2.928544282913208, | |
| "learning_rate": 0.0001998743664582786, | |
| "logits/chosen": -0.7847710251808167, | |
| "logits/rejected": -0.8567973971366882, | |
| "logps/chosen": -2.9689300060272217, | |
| "logps/rejected": -19.40102767944336, | |
| "loss": 0.9175847768783569, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.4591127634048462, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08043977618217468, | |
| "rewards/margins": 0.8204008340835571, | |
| "rewards/rejected": -0.7399609088897705, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.13329967180005048, | |
| "grad_norm": 3.2160611152648926, | |
| "learning_rate": 0.00019985706107286514, | |
| "logits/chosen": -0.737562358379364, | |
| "logits/rejected": -0.8171918988227844, | |
| "logps/chosen": -1.0520405769348145, | |
| "logps/rejected": -13.78677749633789, | |
| "loss": 0.6010702252388, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.1751595437526703, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.34129399061203003, | |
| "rewards/margins": 0.7596877813339233, | |
| "rewards/rejected": -0.41839370131492615, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.021288 | |
| }, | |
| { | |
| "epoch": 0.13531936379702095, | |
| "grad_norm": 3.3036932945251465, | |
| "learning_rate": 0.00019983864030857882, | |
| "logits/chosen": -0.8425466418266296, | |
| "logits/rejected": -0.8621857762336731, | |
| "logps/chosen": -3.0595273971557617, | |
| "logps/rejected": -10.996197700500488, | |
| "loss": 0.8735880851745605, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.35458827018737793, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.18186795711517334, | |
| "rewards/margins": 0.6314299702644348, | |
| "rewards/rejected": -0.4495620131492615, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.021292 | |
| }, | |
| { | |
| "epoch": 0.13733905579399142, | |
| "grad_norm": 4.266996383666992, | |
| "learning_rate": 0.000199819104371175, | |
| "logits/chosen": -0.780097246170044, | |
| "logits/rejected": -0.8485308289527893, | |
| "logps/chosen": -2.523211717605591, | |
| "logps/rejected": -16.111953735351562, | |
| "loss": 0.8541173934936523, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.3557310998439789, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.15383680164813995, | |
| "rewards/margins": 0.7679665684700012, | |
| "rewards/rejected": -0.6141297817230225, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.021296 | |
| }, | |
| { | |
| "epoch": 0.13935874779096188, | |
| "grad_norm": 4.107142925262451, | |
| "learning_rate": 0.0001997984534788654, | |
| "logits/chosen": -0.8730877041816711, | |
| "logits/rejected": -0.9365532398223877, | |
| "logps/chosen": -3.6425538063049316, | |
| "logps/rejected": -14.239816665649414, | |
| "loss": 0.9654451608657837, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.5073843002319336, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.17483213543891907, | |
| "rewards/margins": 0.7276958227157593, | |
| "rewards/rejected": -0.5528636574745178, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.021301 | |
| }, | |
| { | |
| "epoch": 0.14137843978793235, | |
| "grad_norm": 6.40019416809082, | |
| "learning_rate": 0.00019977668786231534, | |
| "logits/chosen": -0.8017210960388184, | |
| "logits/rejected": -0.8579236268997192, | |
| "logps/chosen": -3.737541437149048, | |
| "logps/rejected": -21.258663177490234, | |
| "loss": 0.9284271001815796, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.45301198959350586, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.02088707685470581, | |
| "rewards/margins": 1.0906426906585693, | |
| "rewards/rejected": -1.0697555541992188, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.021303 | |
| }, | |
| { | |
| "epoch": 0.1433981317849028, | |
| "grad_norm": 2.583921432495117, | |
| "learning_rate": 0.0001997538077646414, | |
| "logits/chosen": -0.7329834699630737, | |
| "logits/rejected": -0.8454375863075256, | |
| "logps/chosen": -1.1047859191894531, | |
| "logps/rejected": -17.00843620300293, | |
| "loss": 0.5504162907600403, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.13712885975837708, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.37011057138442993, | |
| "rewards/margins": 0.8445523381233215, | |
| "rewards/rejected": -0.4744417369365692, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.021305 | |
| }, | |
| { | |
| "epoch": 0.14541782378187326, | |
| "grad_norm": 2.9413509368896484, | |
| "learning_rate": 0.00019972981344140874, | |
| "logits/chosen": -0.7188448309898376, | |
| "logits/rejected": -0.8286901116371155, | |
| "logps/chosen": -2.631627321243286, | |
| "logps/rejected": -22.459745407104492, | |
| "loss": 0.7896307706832886, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.3527805805206299, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.12620781362056732, | |
| "rewards/margins": 1.1612414121627808, | |
| "rewards/rejected": -1.0350335836410522, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.021307 | |
| }, | |
| { | |
| "epoch": 0.14743751577884373, | |
| "grad_norm": 3.0875403881073, | |
| "learning_rate": 0.000199704705160628, | |
| "logits/chosen": -0.7547197341918945, | |
| "logits/rejected": -0.8351807594299316, | |
| "logps/chosen": -5.00991153717041, | |
| "logps/rejected": -30.629638671875, | |
| "loss": 0.8512266874313354, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.39438357949256897, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1695525050163269, | |
| "rewards/margins": 1.1737316846847534, | |
| "rewards/rejected": -1.0041792392730713, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.021308 | |
| }, | |
| { | |
| "epoch": 0.1494572077758142, | |
| "grad_norm": 3.0828444957733154, | |
| "learning_rate": 0.0001996784832027525, | |
| "logits/chosen": -0.7492446899414062, | |
| "logits/rejected": -0.8275682926177979, | |
| "logps/chosen": -3.108285903930664, | |
| "logps/rejected": -18.224658966064453, | |
| "loss": 0.7956384420394897, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.2778869569301605, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1457613706588745, | |
| "rewards/margins": 0.7900225520133972, | |
| "rewards/rejected": -0.6442610621452332, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.021311 | |
| }, | |
| { | |
| "epoch": 0.15147689977278464, | |
| "grad_norm": 2.5818111896514893, | |
| "learning_rate": 0.00019965114786067516, | |
| "logits/chosen": -0.7824280858039856, | |
| "logits/rejected": -0.8512482643127441, | |
| "logps/chosen": -0.3878008723258972, | |
| "logps/rejected": -19.119585037231445, | |
| "loss": 0.3888098895549774, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.06809913367033005, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3290511965751648, | |
| "rewards/margins": 1.1828463077545166, | |
| "rewards/rejected": -0.853795051574707, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.021315 | |
| }, | |
| { | |
| "epoch": 0.1534965917697551, | |
| "grad_norm": 3.1177899837493896, | |
| "learning_rate": 0.000199622699439725, | |
| "logits/chosen": -0.7851688861846924, | |
| "logits/rejected": -0.8108853101730347, | |
| "logps/chosen": -1.9916081428527832, | |
| "logps/rejected": -18.17394256591797, | |
| "loss": 0.6110791563987732, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.25529026985168457, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.44155535101890564, | |
| "rewards/margins": 1.2954609394073486, | |
| "rewards/rejected": -0.8539055585861206, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.021318 | |
| }, | |
| { | |
| "epoch": 0.15551628376672558, | |
| "grad_norm": 4.25754976272583, | |
| "learning_rate": 0.00019959313825766386, | |
| "logits/chosen": -0.6911004185676575, | |
| "logits/rejected": -0.7695882320404053, | |
| "logps/chosen": -2.4477198123931885, | |
| "logps/rejected": -31.02164077758789, | |
| "loss": 0.7074019908905029, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.29494914412498474, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.19254879653453827, | |
| "rewards/margins": 1.7098207473754883, | |
| "rewards/rejected": -1.5172719955444336, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.02132 | |
| }, | |
| { | |
| "epoch": 0.15753597576369605, | |
| "grad_norm": 7.972916603088379, | |
| "learning_rate": 0.00019956246464468294, | |
| "logits/chosen": -0.6392947435379028, | |
| "logits/rejected": -0.7352097630500793, | |
| "logps/chosen": -4.085236549377441, | |
| "logps/rejected": -42.829315185546875, | |
| "loss": 0.8604206442832947, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.34664490818977356, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.04581055790185928, | |
| "rewards/margins": 1.8653144836425781, | |
| "rewards/rejected": -1.9111250638961792, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.021318 | |
| }, | |
| { | |
| "epoch": 0.1595556677606665, | |
| "grad_norm": 9.261566162109375, | |
| "learning_rate": 0.00019953067894339896, | |
| "logits/chosen": -0.7612121105194092, | |
| "logits/rejected": -0.7584162950515747, | |
| "logps/chosen": -22.329971313476562, | |
| "logps/rejected": -21.844179153442383, | |
| "loss": 1.6152374744415283, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.7144608497619629, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.5578466653823853, | |
| "rewards/margins": 0.5714378952980042, | |
| "rewards/rejected": -1.1292846202850342, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.02132 | |
| }, | |
| { | |
| "epoch": 0.16157535975763695, | |
| "grad_norm": 2.517524242401123, | |
| "learning_rate": 0.00019949778150885042, | |
| "logits/chosen": -0.7058742046356201, | |
| "logits/rejected": -0.8091444373130798, | |
| "logps/chosen": -2.800210952758789, | |
| "logps/rejected": -20.613197326660156, | |
| "loss": 0.5419849157333374, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.18958702683448792, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1262124478816986, | |
| "rewards/margins": 1.2596018314361572, | |
| "rewards/rejected": -1.1333893537521362, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.02132 | |
| }, | |
| { | |
| "epoch": 0.16359505175460742, | |
| "grad_norm": 2.3371551036834717, | |
| "learning_rate": 0.00019946377270849356, | |
| "logits/chosen": -0.6530874967575073, | |
| "logits/rejected": -0.7903028130531311, | |
| "logps/chosen": -1.8574573993682861, | |
| "logps/rejected": -34.57234573364258, | |
| "loss": 0.47842535376548767, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.20502685010433197, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21239632368087769, | |
| "rewards/margins": 1.7234400510787964, | |
| "rewards/rejected": -1.5110437870025635, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.021321 | |
| }, | |
| { | |
| "epoch": 0.1656147437515779, | |
| "grad_norm": 2.623552083969116, | |
| "learning_rate": 0.00019942865292219838, | |
| "logits/chosen": -0.5469449162483215, | |
| "logits/rejected": -0.7048972249031067, | |
| "logps/chosen": -4.390412330627441, | |
| "logps/rejected": -31.797592163085938, | |
| "loss": 0.6188596487045288, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.28328126668930054, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1721397191286087, | |
| "rewards/margins": 1.405639410018921, | |
| "rewards/rejected": -1.2334996461868286, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.02132 | |
| }, | |
| { | |
| "epoch": 0.16763443574854833, | |
| "grad_norm": 3.757638931274414, | |
| "learning_rate": 0.00019939242254224423, | |
| "logits/chosen": -0.7363824248313904, | |
| "logits/rejected": -0.8039526343345642, | |
| "logps/chosen": -4.921553134918213, | |
| "logps/rejected": -18.160133361816406, | |
| "loss": 1.017354965209961, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.4084692597389221, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.042609840631484985, | |
| "rewards/margins": 0.6757681965827942, | |
| "rewards/rejected": -0.7183780074119568, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.021321 | |
| }, | |
| { | |
| "epoch": 0.1696541277455188, | |
| "grad_norm": 2.6959855556488037, | |
| "learning_rate": 0.00019935508197331555, | |
| "logits/chosen": -0.601901650428772, | |
| "logits/rejected": -0.7518936395645142, | |
| "logps/chosen": -2.1843678951263428, | |
| "logps/rejected": -32.7392578125, | |
| "loss": 0.5553274154663086, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.21038973331451416, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22294606268405914, | |
| "rewards/margins": 1.4514588117599487, | |
| "rewards/rejected": -1.2285128831863403, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.02132 | |
| }, | |
| { | |
| "epoch": 0.17167381974248927, | |
| "grad_norm": 3.8080639839172363, | |
| "learning_rate": 0.00019931663163249742, | |
| "logits/chosen": -0.8070834875106812, | |
| "logits/rejected": -0.8214148283004761, | |
| "logps/chosen": -4.387559413909912, | |
| "logps/rejected": -13.731513977050781, | |
| "loss": 0.8594411611557007, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.2712303698062897, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08239315450191498, | |
| "rewards/margins": 0.5998476147651672, | |
| "rewards/rejected": -0.5174545049667358, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.021322 | |
| }, | |
| { | |
| "epoch": 0.17369351173945974, | |
| "grad_norm": 4.74073600769043, | |
| "learning_rate": 0.00019927707194927066, | |
| "logits/chosen": -0.770719051361084, | |
| "logits/rejected": -0.802936315536499, | |
| "logps/chosen": -3.8553550243377686, | |
| "logps/rejected": -22.488487243652344, | |
| "loss": 0.7815805077552795, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.432535856962204, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1827356368303299, | |
| "rewards/margins": 1.2188729047775269, | |
| "rewards/rejected": -1.0361372232437134, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.021324 | |
| }, | |
| { | |
| "epoch": 0.1757132037364302, | |
| "grad_norm": 6.638978481292725, | |
| "learning_rate": 0.0001992364033655072, | |
| "logits/chosen": -0.6007230281829834, | |
| "logits/rejected": -0.7821131944656372, | |
| "logps/chosen": -0.698825478553772, | |
| "logps/rejected": -31.5311279296875, | |
| "loss": 0.4713582396507263, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.09712451696395874, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.23644955456256866, | |
| "rewards/margins": 1.2481129169464111, | |
| "rewards/rejected": -1.0116633176803589, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.021324 | |
| }, | |
| { | |
| "epoch": 0.17773289573340065, | |
| "grad_norm": 5.0127739906311035, | |
| "learning_rate": 0.00019919462633546519, | |
| "logits/chosen": -0.7654692530632019, | |
| "logits/rejected": -0.8514058589935303, | |
| "logps/chosen": -4.281129837036133, | |
| "logps/rejected": -17.92319107055664, | |
| "loss": 1.0033936500549316, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.5217462182044983, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.14046959578990936, | |
| "rewards/margins": 0.7611122131347656, | |
| "rewards/rejected": -0.6206426620483398, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.021326 | |
| }, | |
| { | |
| "epoch": 0.17975258773037112, | |
| "grad_norm": 5.285451889038086, | |
| "learning_rate": 0.00019915174132578378, | |
| "logits/chosen": -0.6645584106445312, | |
| "logits/rejected": -0.789848804473877, | |
| "logps/chosen": -5.77445650100708, | |
| "logps/rejected": -37.78670883178711, | |
| "loss": 0.6340041160583496, | |
| "memory(GiB)": 41.88, | |
| "nll_loss": 0.26252368092536926, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07033467292785645, | |
| "rewards/margins": 1.5086185932159424, | |
| "rewards/rejected": -1.4382836818695068, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.021326 | |
| }, | |
| { | |
| "epoch": 0.18177227972734158, | |
| "grad_norm": 6.486772060394287, | |
| "learning_rate": 0.000199107748815478, | |
| "logits/chosen": -0.5895614624023438, | |
| "logits/rejected": -0.7669257521629333, | |
| "logps/chosen": -2.622659206390381, | |
| "logps/rejected": -42.33251953125, | |
| "loss": 0.7003304958343506, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30153194069862366, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2086510956287384, | |
| "rewards/margins": 1.978740930557251, | |
| "rewards/rejected": -1.770089864730835, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.021324 | |
| }, | |
| { | |
| "epoch": 0.18379197172431205, | |
| "grad_norm": 4.038703918457031, | |
| "learning_rate": 0.00019906264929593347, | |
| "logits/chosen": -0.6498143076896667, | |
| "logits/rejected": -0.7417197823524475, | |
| "logps/chosen": -6.643020153045654, | |
| "logps/rejected": -26.659536361694336, | |
| "loss": 0.5661642551422119, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23169369995594025, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.25588488578796387, | |
| "rewards/margins": 1.4719629287719727, | |
| "rewards/rejected": -1.2160780429840088, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.021323 | |
| }, | |
| { | |
| "epoch": 0.1858116637212825, | |
| "grad_norm": 2.8225672245025635, | |
| "learning_rate": 0.00019901644327090064, | |
| "logits/chosen": -0.7718486189842224, | |
| "logits/rejected": -0.8817813992500305, | |
| "logps/chosen": -2.4756038188934326, | |
| "logps/rejected": -29.404544830322266, | |
| "loss": 0.4890742599964142, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24528944492340088, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2983011305332184, | |
| "rewards/margins": 1.8501620292663574, | |
| "rewards/rejected": -1.5518608093261719, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.021325 | |
| }, | |
| { | |
| "epoch": 0.18783135571825296, | |
| "grad_norm": 7.307145595550537, | |
| "learning_rate": 0.00019896913125648955, | |
| "logits/chosen": -0.8246339559555054, | |
| "logits/rejected": -0.8683527708053589, | |
| "logps/chosen": -6.234779357910156, | |
| "logps/rejected": -18.237667083740234, | |
| "loss": 1.4174689054489136, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7513330578804016, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.1854678839445114, | |
| "rewards/margins": 0.6419495940208435, | |
| "rewards/rejected": -0.8274174332618713, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.021328 | |
| }, | |
| { | |
| "epoch": 0.18985104771522343, | |
| "grad_norm": 5.936891078948975, | |
| "learning_rate": 0.00019892071378116376, | |
| "logits/chosen": -0.7434009313583374, | |
| "logits/rejected": -0.8614495396614075, | |
| "logps/chosen": -4.436880111694336, | |
| "logps/rejected": -27.014469146728516, | |
| "loss": 0.9648631811141968, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.44619184732437134, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.08920584619045258, | |
| "rewards/margins": 1.2521498203277588, | |
| "rewards/rejected": -1.341355562210083, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.021331 | |
| }, | |
| { | |
| "epoch": 0.1918707397121939, | |
| "grad_norm": 11.764037132263184, | |
| "learning_rate": 0.0001988711913857346, | |
| "logits/chosen": -0.5709604024887085, | |
| "logits/rejected": -0.7604628801345825, | |
| "logps/chosen": -5.328193187713623, | |
| "logps/rejected": -44.60304260253906, | |
| "loss": 0.8271011114120483, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5297277569770813, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.0564165934920311, | |
| "rewards/margins": 2.2518301010131836, | |
| "rewards/rejected": -2.3082468509674072, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.021329 | |
| }, | |
| { | |
| "epoch": 0.19389043170916434, | |
| "grad_norm": 4.440858840942383, | |
| "learning_rate": 0.00019882056462335512, | |
| "logits/chosen": -0.716915488243103, | |
| "logits/rejected": -0.8559072017669678, | |
| "logps/chosen": -4.923259258270264, | |
| "logps/rejected": -22.751483917236328, | |
| "loss": 1.0631147623062134, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5847352743148804, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04070784151554108, | |
| "rewards/margins": 0.9810720086097717, | |
| "rewards/rejected": -0.9403641223907471, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.021331 | |
| }, | |
| { | |
| "epoch": 0.1959101237061348, | |
| "grad_norm": 4.534213542938232, | |
| "learning_rate": 0.00019876883405951377, | |
| "logits/chosen": -0.7735016345977783, | |
| "logits/rejected": -0.8521608114242554, | |
| "logps/chosen": -2.242138147354126, | |
| "logps/rejected": -16.696674346923828, | |
| "loss": 0.8221019506454468, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30803507566452026, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.23840653896331787, | |
| "rewards/margins": 0.7663496732711792, | |
| "rewards/rejected": -0.5279431939125061, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.021332 | |
| }, | |
| { | |
| "epoch": 0.19792981570310528, | |
| "grad_norm": 6.823293685913086, | |
| "learning_rate": 0.0001987160002720283, | |
| "logits/chosen": -0.7845535278320312, | |
| "logits/rejected": -0.8421120643615723, | |
| "logps/chosen": -8.860337257385254, | |
| "logps/rejected": -18.79197883605957, | |
| "loss": 0.9576016068458557, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.476947546005249, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1753305345773697, | |
| "rewards/margins": 1.0159931182861328, | |
| "rewards/rejected": -0.8406625986099243, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.021334 | |
| }, | |
| { | |
| "epoch": 0.19994950770007575, | |
| "grad_norm": 3.7400314807891846, | |
| "learning_rate": 0.00019866206385103915, | |
| "logits/chosen": -0.708592414855957, | |
| "logits/rejected": -0.7664063572883606, | |
| "logps/chosen": -5.081974983215332, | |
| "logps/rejected": -16.826196670532227, | |
| "loss": 1.022936224937439, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4172855615615845, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.049844808876514435, | |
| "rewards/margins": 0.2858249545097351, | |
| "rewards/rejected": -0.23598016798496246, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.021335 | |
| }, | |
| { | |
| "epoch": 0.2019691996970462, | |
| "grad_norm": 4.397147178649902, | |
| "learning_rate": 0.00019860702539900287, | |
| "logits/chosen": -0.5574980974197388, | |
| "logits/rejected": -0.7396320700645447, | |
| "logps/chosen": -2.61395001411438, | |
| "logps/rejected": -33.31013107299805, | |
| "loss": 0.8842970132827759, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3539983034133911, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.06448046863079071, | |
| "rewards/margins": 0.9230259656906128, | |
| "rewards/rejected": -0.8585454225540161, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.021334 | |
| }, | |
| { | |
| "epoch": 0.20398889169401666, | |
| "grad_norm": 3.6620795726776123, | |
| "learning_rate": 0.0001985508855306855, | |
| "logits/chosen": -0.7978264093399048, | |
| "logits/rejected": -0.8318206667900085, | |
| "logps/chosen": -3.0011239051818848, | |
| "logps/rejected": -13.4129638671875, | |
| "loss": 0.869354784488678, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.28029945492744446, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.17673368752002716, | |
| "rewards/margins": 0.44924402236938477, | |
| "rewards/rejected": -0.2725103795528412, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.021264 | |
| }, | |
| { | |
| "epoch": 0.20600858369098712, | |
| "grad_norm": 2.9251015186309814, | |
| "learning_rate": 0.00019849364487315558, | |
| "logits/chosen": -0.6999006271362305, | |
| "logits/rejected": -0.7932964563369751, | |
| "logps/chosen": -4.888404369354248, | |
| "logps/rejected": -15.926616668701172, | |
| "loss": 0.9600812792778015, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4099733531475067, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.16860802471637726, | |
| "rewards/margins": 0.5318610668182373, | |
| "rewards/rejected": -0.36325308680534363, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.2080282756879576, | |
| "grad_norm": 3.172440767288208, | |
| "learning_rate": 0.00019843530406577723, | |
| "logits/chosen": -0.7246884107589722, | |
| "logits/rejected": -0.7787467837333679, | |
| "logps/chosen": -3.1632981300354004, | |
| "logps/rejected": -21.545318603515625, | |
| "loss": 0.7317727208137512, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3409346342086792, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1461772322654724, | |
| "rewards/margins": 1.200048565864563, | |
| "rewards/rejected": -1.0538712739944458, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.021268 | |
| }, | |
| { | |
| "epoch": 0.21004796768492806, | |
| "grad_norm": 3.71928334236145, | |
| "learning_rate": 0.00019837586376020294, | |
| "logits/chosen": -0.6723949313163757, | |
| "logits/rejected": -0.7337789535522461, | |
| "logps/chosen": -9.011453628540039, | |
| "logps/rejected": -24.695667266845703, | |
| "loss": 0.8767037987709045, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.40366095304489136, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.017453588545322418, | |
| "rewards/margins": 1.022116780281067, | |
| "rewards/rejected": -1.0395703315734863, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.02127 | |
| }, | |
| { | |
| "epoch": 0.2120676596818985, | |
| "grad_norm": 2.393298625946045, | |
| "learning_rate": 0.00019831532462036636, | |
| "logits/chosen": -0.5787035226821899, | |
| "logits/rejected": -0.7247171998023987, | |
| "logps/chosen": -3.2338626384735107, | |
| "logps/rejected": -30.85213851928711, | |
| "loss": 0.5790133476257324, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23591873049736023, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.273136168718338, | |
| "rewards/margins": 1.4806981086730957, | |
| "rewards/rejected": -1.2075618505477905, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.02127 | |
| }, | |
| { | |
| "epoch": 0.21408735167886897, | |
| "grad_norm": 3.9807705879211426, | |
| "learning_rate": 0.0001982536873224748, | |
| "logits/chosen": -0.6726570129394531, | |
| "logits/rejected": -0.7844520807266235, | |
| "logps/chosen": -11.104076385498047, | |
| "logps/rejected": -29.71591567993164, | |
| "loss": 0.5819936990737915, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.16406820714473724, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07211651653051376, | |
| "rewards/margins": 1.3368288278579712, | |
| "rewards/rejected": -1.2647120952606201, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.02127 | |
| }, | |
| { | |
| "epoch": 0.21610704367583944, | |
| "grad_norm": 14.505188941955566, | |
| "learning_rate": 0.00019819095255500178, | |
| "logits/chosen": -0.6649254560470581, | |
| "logits/rejected": -0.7490218877792358, | |
| "logps/chosen": -6.695674896240234, | |
| "logps/rejected": -36.64976501464844, | |
| "loss": 0.9944093227386475, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5400701761245728, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.20841172337532043, | |
| "rewards/margins": 1.6346428394317627, | |
| "rewards/rejected": -1.4262311458587646, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.02127 | |
| }, | |
| { | |
| "epoch": 0.2181267356728099, | |
| "grad_norm": 5.73347282409668, | |
| "learning_rate": 0.00019812712101867922, | |
| "logits/chosen": -0.7590409517288208, | |
| "logits/rejected": -0.8766330480575562, | |
| "logps/chosen": -1.7668696641921997, | |
| "logps/rejected": -23.773542404174805, | |
| "loss": 0.6851338744163513, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.25430163741111755, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15534955263137817, | |
| "rewards/margins": 1.3926160335540771, | |
| "rewards/rejected": -1.2372663021087646, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.021273 | |
| }, | |
| { | |
| "epoch": 0.22014642766978035, | |
| "grad_norm": 2.351529121398926, | |
| "learning_rate": 0.00019806219342648977, | |
| "logits/chosen": -0.7287034392356873, | |
| "logits/rejected": -0.8862197995185852, | |
| "logps/chosen": -0.5065869688987732, | |
| "logps/rejected": -29.2410945892334, | |
| "loss": 0.35556384921073914, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.10009891539812088, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.37776732444763184, | |
| "rewards/margins": 1.7389698028564453, | |
| "rewards/rejected": -1.361202597618103, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.22216611966675082, | |
| "grad_norm": 4.292262077331543, | |
| "learning_rate": 0.0001979961705036587, | |
| "logits/chosen": -0.7477302551269531, | |
| "logits/rejected": -0.8113406300544739, | |
| "logps/chosen": -4.461059093475342, | |
| "logps/rejected": -25.79521942138672, | |
| "loss": 0.9549956321716309, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4869251251220703, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.08557192981243134, | |
| "rewards/margins": 1.1444835662841797, | |
| "rewards/rejected": -1.2300554513931274, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.22418581166372128, | |
| "grad_norm": 3.231773853302002, | |
| "learning_rate": 0.0001979290529876458, | |
| "logits/chosen": -0.6231730580329895, | |
| "logits/rejected": -0.8174745440483093, | |
| "logps/chosen": -0.6967498064041138, | |
| "logps/rejected": -34.312564849853516, | |
| "loss": 0.4151938259601593, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14568573236465454, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3004146218299866, | |
| "rewards/margins": 1.8394732475280762, | |
| "rewards/rejected": -1.5390586853027344, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.22620550366069175, | |
| "grad_norm": 17.476547241210938, | |
| "learning_rate": 0.00019786084162813733, | |
| "logits/chosen": -0.7515086531639099, | |
| "logits/rejected": -0.8278781771659851, | |
| "logps/chosen": -8.48164176940918, | |
| "logps/rejected": -27.406028747558594, | |
| "loss": 1.484164834022522, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8838226795196533, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.3509487807750702, | |
| "rewards/margins": 1.2049919366836548, | |
| "rewards/rejected": -1.5559407472610474, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.021279 | |
| }, | |
| { | |
| "epoch": 0.2282251956576622, | |
| "grad_norm": 4.023671627044678, | |
| "learning_rate": 0.00019779153718703745, | |
| "logits/chosen": -0.6617270708084106, | |
| "logits/rejected": -0.8029566407203674, | |
| "logps/chosen": -3.8847668170928955, | |
| "logps/rejected": -29.473770141601562, | |
| "loss": 0.8206814527511597, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.33473947644233704, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1446269452571869, | |
| "rewards/margins": 1.4900355339050293, | |
| "rewards/rejected": -1.3454086780548096, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.02128 | |
| }, | |
| { | |
| "epoch": 0.23024488765463266, | |
| "grad_norm": 1.5781970024108887, | |
| "learning_rate": 0.00019772114043845965, | |
| "logits/chosen": -0.7092657089233398, | |
| "logits/rejected": -0.8382660150527954, | |
| "logps/chosen": -0.47141486406326294, | |
| "logps/rejected": -40.95867919921875, | |
| "loss": 0.3395133912563324, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.10217627137899399, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.24633201956748962, | |
| "rewards/margins": 2.3744595050811768, | |
| "rewards/rejected": -2.1281275749206543, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.021281 | |
| }, | |
| { | |
| "epoch": 0.23226457965160313, | |
| "grad_norm": 3.4185638427734375, | |
| "learning_rate": 0.00019764965216871846, | |
| "logits/chosen": -0.6823985576629639, | |
| "logits/rejected": -0.8108518123626709, | |
| "logps/chosen": -3.519054412841797, | |
| "logps/rejected": -34.14986038208008, | |
| "loss": 0.6295965909957886, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34174439311027527, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1087992712855339, | |
| "rewards/margins": 1.8799338340759277, | |
| "rewards/rejected": -1.7711347341537476, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.021281 | |
| }, | |
| { | |
| "epoch": 0.2342842716485736, | |
| "grad_norm": 5.202569961547852, | |
| "learning_rate": 0.00019757707317632028, | |
| "logits/chosen": -0.7702198624610901, | |
| "logits/rejected": -0.7985497117042542, | |
| "logps/chosen": -8.110039710998535, | |
| "logps/rejected": -23.981826782226562, | |
| "loss": 0.9200264811515808, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.40714696049690247, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.011667863465845585, | |
| "rewards/margins": 1.2929402589797974, | |
| "rewards/rejected": -1.2812724113464355, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.23630396364554407, | |
| "grad_norm": 3.570646286010742, | |
| "learning_rate": 0.0001975034042719546, | |
| "logits/chosen": -0.6833267211914062, | |
| "logits/rejected": -0.832187294960022, | |
| "logps/chosen": -5.206616401672363, | |
| "logps/rejected": -43.44145965576172, | |
| "loss": 0.7497320175170898, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4067853093147278, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1555595099925995, | |
| "rewards/margins": 2.0963921546936035, | |
| "rewards/rejected": -1.940832495689392, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.2383236556425145, | |
| "grad_norm": 2.559943914413452, | |
| "learning_rate": 0.0001974286462784851, | |
| "logits/chosen": -0.7291467785835266, | |
| "logits/rejected": -0.8261964321136475, | |
| "logps/chosen": -1.4934219121932983, | |
| "logps/rejected": -20.029233932495117, | |
| "loss": 0.575518786907196, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24626033008098602, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.35854265093803406, | |
| "rewards/margins": 1.5817933082580566, | |
| "rewards/rejected": -1.2232506275177002, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.24034334763948498, | |
| "grad_norm": 8.765168190002441, | |
| "learning_rate": 0.00019735280003094015, | |
| "logits/chosen": -0.7664045095443726, | |
| "logits/rejected": -0.8301156759262085, | |
| "logps/chosen": -11.605274200439453, | |
| "logps/rejected": -33.71162414550781, | |
| "loss": 1.43560791015625, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 1.0074396133422852, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.5399270057678223, | |
| "rewards/margins": 1.4373902082443237, | |
| "rewards/rejected": -1.9773170948028564, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.24236303963645545, | |
| "grad_norm": 4.5908522605896, | |
| "learning_rate": 0.00019727586637650373, | |
| "logits/chosen": -0.6932565569877625, | |
| "logits/rejected": -0.7234666347503662, | |
| "logps/chosen": -17.431007385253906, | |
| "logps/rejected": -34.0074462890625, | |
| "loss": 1.0241637229919434, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6038533449172974, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.17532162368297577, | |
| "rewards/margins": 1.6745084524154663, | |
| "rewards/rejected": -1.849830150604248, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.24438273163342591, | |
| "grad_norm": 4.291138648986816, | |
| "learning_rate": 0.00019719784617450593, | |
| "logits/chosen": -0.655267596244812, | |
| "logits/rejected": -0.7929190993309021, | |
| "logps/chosen": -6.5861992835998535, | |
| "logps/rejected": -43.83182907104492, | |
| "loss": 0.696444571018219, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4287887215614319, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.015995100140571594, | |
| "rewards/margins": 2.3263349533081055, | |
| "rewards/rejected": -2.342329978942871, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.24640242363039636, | |
| "grad_norm": 3.7837073802948, | |
| "learning_rate": 0.0001971187402964132, | |
| "logits/chosen": -0.6419543027877808, | |
| "logits/rejected": -0.7936818599700928, | |
| "logps/chosen": -5.325220108032227, | |
| "logps/rejected": -35.03059768676758, | |
| "loss": 0.760798990726471, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4128337502479553, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.004157397896051407, | |
| "rewards/margins": 1.6647117137908936, | |
| "rewards/rejected": -1.6688693761825562, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.24842211562736682, | |
| "grad_norm": 3.332064390182495, | |
| "learning_rate": 0.00019703854962581884, | |
| "logits/chosen": -0.767221987247467, | |
| "logits/rejected": -0.8504694700241089, | |
| "logps/chosen": -1.6606477499008179, | |
| "logps/rejected": -30.287626266479492, | |
| "loss": 0.5448625087738037, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1951584815979004, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.18560823798179626, | |
| "rewards/margins": 1.3272532224655151, | |
| "rewards/rejected": -1.1416449546813965, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.021289 | |
| }, | |
| { | |
| "epoch": 0.25044180762433726, | |
| "grad_norm": 2.538031816482544, | |
| "learning_rate": 0.00019695727505843297, | |
| "logits/chosen": -0.8040828704833984, | |
| "logits/rejected": -0.8591914176940918, | |
| "logps/chosen": -2.396242618560791, | |
| "logps/rejected": -17.942195892333984, | |
| "loss": 0.6009309887886047, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1990574449300766, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.31234806776046753, | |
| "rewards/margins": 0.9391263723373413, | |
| "rewards/rejected": -0.6267784237861633, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.021291 | |
| }, | |
| { | |
| "epoch": 0.25246149962130776, | |
| "grad_norm": 2.4364805221557617, | |
| "learning_rate": 0.00019687491750207254, | |
| "logits/chosen": -0.8258935213088989, | |
| "logits/rejected": -0.8962618112564087, | |
| "logps/chosen": -1.0966453552246094, | |
| "logps/rejected": -16.684877395629883, | |
| "loss": 0.6394660472869873, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15617281198501587, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2913311719894409, | |
| "rewards/margins": 0.7776257395744324, | |
| "rewards/rejected": -0.48629459738731384, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.021292 | |
| }, | |
| { | |
| "epoch": 0.2544811916182782, | |
| "grad_norm": 4.309374809265137, | |
| "learning_rate": 0.00019679147787665126, | |
| "logits/chosen": -0.7291491627693176, | |
| "logits/rejected": -0.8647027611732483, | |
| "logps/chosen": -2.546858549118042, | |
| "logps/rejected": -25.51129150390625, | |
| "loss": 0.7438904047012329, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.29447755217552185, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24194566905498505, | |
| "rewards/margins": 0.7109313607215881, | |
| "rewards/rejected": -0.4689857065677643, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.021292 | |
| }, | |
| { | |
| "epoch": 0.2565008836152487, | |
| "grad_norm": 3.316589117050171, | |
| "learning_rate": 0.00019670695711416928, | |
| "logits/chosen": -0.7973051071166992, | |
| "logits/rejected": -0.9037990570068359, | |
| "logps/chosen": -1.6116214990615845, | |
| "logps/rejected": -24.904531478881836, | |
| "loss": 0.4576399624347687, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17375069856643677, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22464421391487122, | |
| "rewards/margins": 1.4565354585647583, | |
| "rewards/rejected": -1.2318912744522095, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.021294 | |
| }, | |
| { | |
| "epoch": 0.25852057561221914, | |
| "grad_norm": 4.841390132904053, | |
| "learning_rate": 0.00019662135615870275, | |
| "logits/chosen": -0.7546025514602661, | |
| "logits/rejected": -0.9116957187652588, | |
| "logps/chosen": -2.7441368103027344, | |
| "logps/rejected": -25.96759796142578, | |
| "loss": 0.8130377531051636, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3844357430934906, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1914481222629547, | |
| "rewards/margins": 1.4247140884399414, | |
| "rewards/rejected": -1.2332658767700195, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.021295 | |
| }, | |
| { | |
| "epoch": 0.2605402676091896, | |
| "grad_norm": 6.839901447296143, | |
| "learning_rate": 0.0001965346759663934, | |
| "logits/chosen": -0.6810730695724487, | |
| "logits/rejected": -0.8468779921531677, | |
| "logps/chosen": -5.32491397857666, | |
| "logps/rejected": -42.42945861816406, | |
| "loss": 1.0299216508865356, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6279267072677612, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.009131789207458496, | |
| "rewards/margins": 1.819998025894165, | |
| "rewards/rejected": -1.829129934310913, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.021294 | |
| }, | |
| { | |
| "epoch": 0.2625599596061601, | |
| "grad_norm": 2.0061724185943604, | |
| "learning_rate": 0.00019644691750543767, | |
| "logits/chosen": -0.8441457152366638, | |
| "logits/rejected": -0.9423956274986267, | |
| "logps/chosen": -0.5530110597610474, | |
| "logps/rejected": -32.842193603515625, | |
| "loss": 0.25913411378860474, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.05609491094946861, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27188676595687866, | |
| "rewards/margins": 2.330637216567993, | |
| "rewards/rejected": -2.0587503910064697, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.021295 | |
| }, | |
| { | |
| "epoch": 0.2645796516031305, | |
| "grad_norm": 4.784903526306152, | |
| "learning_rate": 0.00019635808175607605, | |
| "logits/chosen": -0.8365444540977478, | |
| "logits/rejected": -0.9138449430465698, | |
| "logps/chosen": -3.4112894535064697, | |
| "logps/rejected": -23.938806533813477, | |
| "loss": 0.7469592094421387, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31692469120025635, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09105291962623596, | |
| "rewards/margins": 1.37967050075531, | |
| "rewards/rejected": -1.288617730140686, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.021296 | |
| }, | |
| { | |
| "epoch": 0.26659934360010096, | |
| "grad_norm": 9.284527778625488, | |
| "learning_rate": 0.00019626816971058205, | |
| "logits/chosen": -0.8304141759872437, | |
| "logits/rejected": -0.9100163578987122, | |
| "logps/chosen": -3.7839527130126953, | |
| "logps/rejected": -18.869930267333984, | |
| "loss": 1.1523946523666382, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6580032706260681, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.240356907248497, | |
| "rewards/margins": 1.1313059329986572, | |
| "rewards/rejected": -0.890949010848999, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.021298 | |
| }, | |
| { | |
| "epoch": 0.26861903559707145, | |
| "grad_norm": 4.299342632293701, | |
| "learning_rate": 0.00019617718237325115, | |
| "logits/chosen": -0.6347696781158447, | |
| "logits/rejected": -0.7560770511627197, | |
| "logps/chosen": -3.5856218338012695, | |
| "logps/rejected": -30.4008846282959, | |
| "loss": 0.739059567451477, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.38467657566070557, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13314950466156006, | |
| "rewards/margins": 1.3657082319259644, | |
| "rewards/rejected": -1.2325587272644043, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.021298 | |
| }, | |
| { | |
| "epoch": 0.2706387275940419, | |
| "grad_norm": 4.246809482574463, | |
| "learning_rate": 0.00019608512076038962, | |
| "logits/chosen": -0.7022749781608582, | |
| "logits/rejected": -0.7915350794792175, | |
| "logps/chosen": -4.822379112243652, | |
| "logps/rejected": -24.07721710205078, | |
| "loss": 0.8055979609489441, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3307011127471924, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.11167091131210327, | |
| "rewards/margins": 1.3118420839309692, | |
| "rewards/rejected": -1.2001712322235107, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.021298 | |
| }, | |
| { | |
| "epoch": 0.2726584195910124, | |
| "grad_norm": 2.9997761249542236, | |
| "learning_rate": 0.0001959919859003031, | |
| "logits/chosen": -0.6153374910354614, | |
| "logits/rejected": -0.7747887969017029, | |
| "logps/chosen": -0.7465253472328186, | |
| "logps/rejected": -28.333953857421875, | |
| "loss": 0.5413554906845093, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14097237586975098, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.33766934275627136, | |
| "rewards/margins": 0.9080523252487183, | |
| "rewards/rejected": -0.5703830718994141, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.021296 | |
| }, | |
| { | |
| "epoch": 0.27467811158798283, | |
| "grad_norm": 3.5653076171875, | |
| "learning_rate": 0.00019589777883328505, | |
| "logits/chosen": -0.7418694496154785, | |
| "logits/rejected": -0.8762567043304443, | |
| "logps/chosen": -1.4205451011657715, | |
| "logps/rejected": -21.64703941345215, | |
| "loss": 0.6491340398788452, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.16818463802337646, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2140020728111267, | |
| "rewards/margins": 0.9494506120681763, | |
| "rewards/rejected": -0.7354484796524048, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.021298 | |
| }, | |
| { | |
| "epoch": 0.2766978035849533, | |
| "grad_norm": 2.6075761318206787, | |
| "learning_rate": 0.00019580250061160539, | |
| "logits/chosen": -0.5225172638893127, | |
| "logits/rejected": -0.7319562435150146, | |
| "logps/chosen": -2.6468346118927, | |
| "logps/rejected": -41.52344512939453, | |
| "loss": 0.5949529409408569, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19340890645980835, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2633662819862366, | |
| "rewards/margins": 1.1732457876205444, | |
| "rewards/rejected": -0.9098795056343079, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.021297 | |
| }, | |
| { | |
| "epoch": 0.27871749558192377, | |
| "grad_norm": 3.9614176750183105, | |
| "learning_rate": 0.00019570615229949842, | |
| "logits/chosen": -0.636820375919342, | |
| "logits/rejected": -0.7707249522209167, | |
| "logps/chosen": -3.3777596950531006, | |
| "logps/rejected": -26.16946029663086, | |
| "loss": 0.758621335029602, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3399200439453125, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.15843479335308075, | |
| "rewards/margins": 0.947920024394989, | |
| "rewards/rejected": -0.7894852161407471, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.021297 | |
| }, | |
| { | |
| "epoch": 0.2807371875788942, | |
| "grad_norm": 2.576108455657959, | |
| "learning_rate": 0.00019560873497315116, | |
| "logits/chosen": -0.6899356842041016, | |
| "logits/rejected": -0.7887363433837891, | |
| "logps/chosen": -1.9815049171447754, | |
| "logps/rejected": -15.912079811096191, | |
| "loss": 0.7393437623977661, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24023714661598206, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.33446478843688965, | |
| "rewards/margins": 0.6615203619003296, | |
| "rewards/rejected": -0.32705551385879517, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.021298 | |
| }, | |
| { | |
| "epoch": 0.2827568795758647, | |
| "grad_norm": 3.3134891986846924, | |
| "learning_rate": 0.00019551024972069126, | |
| "logits/chosen": -0.8353362679481506, | |
| "logits/rejected": -0.8483090996742249, | |
| "logps/chosen": -1.7245616912841797, | |
| "logps/rejected": -15.235477447509766, | |
| "loss": 0.5436122417449951, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1701793223619461, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3035600185394287, | |
| "rewards/margins": 1.1392890214920044, | |
| "rewards/rejected": -0.8357290029525757, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.021301 | |
| }, | |
| { | |
| "epoch": 0.28477657157283515, | |
| "grad_norm": 4.701112270355225, | |
| "learning_rate": 0.0001954106976421748, | |
| "logits/chosen": -0.7467123866081238, | |
| "logits/rejected": -0.742473840713501, | |
| "logps/chosen": -7.344741344451904, | |
| "logps/rejected": -13.826343536376953, | |
| "loss": 1.0974572896957397, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.45263901352882385, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.08538863807916641, | |
| "rewards/margins": 0.4929981231689453, | |
| "rewards/rejected": -0.5783867835998535, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.021302 | |
| }, | |
| { | |
| "epoch": 0.2867962635698056, | |
| "grad_norm": 2.704679012298584, | |
| "learning_rate": 0.00019531007984957408, | |
| "logits/chosen": -0.5686406493186951, | |
| "logits/rejected": -0.7427109479904175, | |
| "logps/chosen": -2.140307664871216, | |
| "logps/rejected": -37.99428939819336, | |
| "loss": 0.5559962391853333, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15430670976638794, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3728140592575073, | |
| "rewards/margins": 2.170938730239868, | |
| "rewards/rejected": -1.7981246709823608, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.021302 | |
| }, | |
| { | |
| "epoch": 0.2888159555667761, | |
| "grad_norm": 6.6994123458862305, | |
| "learning_rate": 0.0001952083974667652, | |
| "logits/chosen": -0.6588355898857117, | |
| "logits/rejected": -0.7316503524780273, | |
| "logps/chosen": -7.539848804473877, | |
| "logps/rejected": -26.308818817138672, | |
| "loss": 1.176750659942627, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5222424268722534, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.17204269766807556, | |
| "rewards/margins": 0.8352524042129517, | |
| "rewards/rejected": -1.0072951316833496, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.021302 | |
| }, | |
| { | |
| "epoch": 0.2908356475637465, | |
| "grad_norm": 5.0174384117126465, | |
| "learning_rate": 0.00019510565162951537, | |
| "logits/chosen": -0.720901608467102, | |
| "logits/rejected": -0.7480478882789612, | |
| "logps/chosen": -6.40681266784668, | |
| "logps/rejected": -27.90705680847168, | |
| "loss": 0.6913059949874878, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3720777928829193, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.31874871253967285, | |
| "rewards/margins": 2.0500223636627197, | |
| "rewards/rejected": -1.7312736511230469, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.021303 | |
| }, | |
| { | |
| "epoch": 0.29285533956071697, | |
| "grad_norm": 6.825158596038818, | |
| "learning_rate": 0.00019500184348547042, | |
| "logits/chosen": -0.7821186780929565, | |
| "logits/rejected": -0.8765726685523987, | |
| "logps/chosen": -3.37898588180542, | |
| "logps/rejected": -19.76290512084961, | |
| "loss": 0.8391829133033752, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.339937299489975, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.13619036972522736, | |
| "rewards/margins": 1.1103405952453613, | |
| "rewards/rejected": -0.9741502404212952, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.021304 | |
| }, | |
| { | |
| "epoch": 0.29487503155768746, | |
| "grad_norm": 2.3948497772216797, | |
| "learning_rate": 0.00019489697419414182, | |
| "logits/chosen": -0.8977736830711365, | |
| "logits/rejected": -0.954646110534668, | |
| "logps/chosen": -1.5781641006469727, | |
| "logps/rejected": -27.0587100982666, | |
| "loss": 0.4295532703399658, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1162162497639656, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24644073843955994, | |
| "rewards/margins": 1.8821758031845093, | |
| "rewards/rejected": -1.6357351541519165, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.021306 | |
| }, | |
| { | |
| "epoch": 0.2968947235546579, | |
| "grad_norm": 6.068948268890381, | |
| "learning_rate": 0.00019479104492689384, | |
| "logits/chosen": -0.7972388863563538, | |
| "logits/rejected": -0.9000754356384277, | |
| "logps/chosen": -8.90436840057373, | |
| "logps/rejected": -43.9642448425293, | |
| "loss": 1.004248023033142, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7405007481575012, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.2410261034965515, | |
| "rewards/margins": 2.683554172515869, | |
| "rewards/rejected": -2.9245800971984863, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.021307 | |
| }, | |
| { | |
| "epoch": 0.2989144155516284, | |
| "grad_norm": 6.354671478271484, | |
| "learning_rate": 0.00019468405686693044, | |
| "logits/chosen": -0.8239361643791199, | |
| "logits/rejected": -0.8870259523391724, | |
| "logps/chosen": -3.0636796951293945, | |
| "logps/rejected": -32.0543327331543, | |
| "loss": 0.6938296556472778, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.32726508378982544, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2392302304506302, | |
| "rewards/margins": 2.2771260738372803, | |
| "rewards/rejected": -2.037895917892456, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.021309 | |
| }, | |
| { | |
| "epoch": 0.30093410754859884, | |
| "grad_norm": 2.746241331100464, | |
| "learning_rate": 0.00019457601120928194, | |
| "logits/chosen": -0.7442300915718079, | |
| "logits/rejected": -0.8740307092666626, | |
| "logps/chosen": -0.39770960807800293, | |
| "logps/rejected": -24.435047149658203, | |
| "loss": 0.323159396648407, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.05953114107251167, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28615039587020874, | |
| "rewards/margins": 1.8557114601135254, | |
| "rewards/rejected": -1.5695610046386719, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.02131 | |
| }, | |
| { | |
| "epoch": 0.3029537995455693, | |
| "grad_norm": 7.339154243469238, | |
| "learning_rate": 0.0001944669091607919, | |
| "logits/chosen": -0.7669613361358643, | |
| "logits/rejected": -0.8887062072753906, | |
| "logps/chosen": -6.112335205078125, | |
| "logps/rejected": -46.467247009277344, | |
| "loss": 0.7917571663856506, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.44829899072647095, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.07194096595048904, | |
| "rewards/margins": 2.9925551414489746, | |
| "rewards/rejected": -3.0644962787628174, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.02131 | |
| }, | |
| { | |
| "epoch": 0.3049734915425398, | |
| "grad_norm": 13.051281929016113, | |
| "learning_rate": 0.00019435675194010336, | |
| "logits/chosen": -0.8439881801605225, | |
| "logits/rejected": -0.93268883228302, | |
| "logps/chosen": -4.412451267242432, | |
| "logps/rejected": -46.751976013183594, | |
| "loss": 0.8531545400619507, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.44560468196868896, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.06836838275194168, | |
| "rewards/margins": 3.4782376289367676, | |
| "rewards/rejected": -3.5466065406799316, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.021262 | |
| }, | |
| { | |
| "epoch": 0.3069931835395102, | |
| "grad_norm": 3.5028750896453857, | |
| "learning_rate": 0.00019424554077764546, | |
| "logits/chosen": -0.7861919403076172, | |
| "logits/rejected": -0.915184497833252, | |
| "logps/chosen": -2.617560386657715, | |
| "logps/rejected": -56.570960998535156, | |
| "loss": 0.4112832546234131, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2496473491191864, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.11519647389650345, | |
| "rewards/margins": 3.7134275436401367, | |
| "rewards/rejected": -3.598231315612793, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.3090128755364807, | |
| "grad_norm": 6.6451520919799805, | |
| "learning_rate": 0.00019413327691561967, | |
| "logits/chosen": -0.7669755816459656, | |
| "logits/rejected": -0.8034001588821411, | |
| "logps/chosen": -9.02087688446045, | |
| "logps/rejected": -36.971290588378906, | |
| "loss": 0.8952721357345581, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.42217180132865906, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.07903412729501724, | |
| "rewards/margins": 2.4241135120391846, | |
| "rewards/rejected": -2.503147602081299, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.31103256753345115, | |
| "grad_norm": 6.9827470779418945, | |
| "learning_rate": 0.00019401996160798573, | |
| "logits/chosen": -0.7891846895217896, | |
| "logits/rejected": -0.8431411981582642, | |
| "logps/chosen": -12.274852752685547, | |
| "logps/rejected": -40.9384765625, | |
| "loss": 1.0033327341079712, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5167030692100525, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.11504307389259338, | |
| "rewards/margins": 2.439614772796631, | |
| "rewards/rejected": -2.5546579360961914, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.3130522595304216, | |
| "grad_norm": 5.614060878753662, | |
| "learning_rate": 0.0001939055961204478, | |
| "logits/chosen": -0.8796770572662354, | |
| "logits/rejected": -0.9147617816925049, | |
| "logps/chosen": -7.191051959991455, | |
| "logps/rejected": -29.8262882232666, | |
| "loss": 0.8995785117149353, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.49978020787239075, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.055766861885786057, | |
| "rewards/margins": 1.4225391149520874, | |
| "rewards/rejected": -1.4783059358596802, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.021264 | |
| }, | |
| { | |
| "epoch": 0.3150719515273921, | |
| "grad_norm": 5.3426737785339355, | |
| "learning_rate": 0.00019379018173044037, | |
| "logits/chosen": -0.8801127076148987, | |
| "logits/rejected": -0.9478501081466675, | |
| "logps/chosen": -5.170099258422852, | |
| "logps/rejected": -29.119112014770508, | |
| "loss": 0.7686877846717834, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.36578065156936646, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10118754208087921, | |
| "rewards/margins": 1.4974370002746582, | |
| "rewards/rejected": -1.3962492942810059, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.31709164352436253, | |
| "grad_norm": 6.185426235198975, | |
| "learning_rate": 0.00019367371972711385, | |
| "logits/chosen": -0.883526623249054, | |
| "logits/rejected": -0.9433069229125977, | |
| "logps/chosen": -2.170651435852051, | |
| "logps/rejected": -28.505441665649414, | |
| "loss": 0.7070222496986389, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.333578884601593, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.17996083199977875, | |
| "rewards/margins": 1.5758326053619385, | |
| "rewards/rejected": -1.395871639251709, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.319111335521333, | |
| "grad_norm": 4.604299068450928, | |
| "learning_rate": 0.0001935562114113202, | |
| "logits/chosen": -0.874811053276062, | |
| "logits/rejected": -0.9069212079048157, | |
| "logps/chosen": -6.411377906799316, | |
| "logps/rejected": -28.813356399536133, | |
| "loss": 0.8389774560928345, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4572408199310303, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1476302295923233, | |
| "rewards/margins": 1.0184513330459595, | |
| "rewards/rejected": -0.8708210587501526, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.32113102751830347, | |
| "grad_norm": 2.668325424194336, | |
| "learning_rate": 0.00019343765809559852, | |
| "logits/chosen": -0.9191151261329651, | |
| "logits/rejected": -0.9647189378738403, | |
| "logps/chosen": -2.182382106781006, | |
| "logps/rejected": -27.029888153076172, | |
| "loss": 0.6324246525764465, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3407551646232605, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.22473560273647308, | |
| "rewards/margins": 1.382723093032837, | |
| "rewards/rejected": -1.1579875946044922, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.3231507195152739, | |
| "grad_norm": 3.9123880863189697, | |
| "learning_rate": 0.00019331806110416027, | |
| "logits/chosen": -0.9419438242912292, | |
| "logits/rejected": -0.9589441418647766, | |
| "logps/chosen": -2.685596466064453, | |
| "logps/rejected": -16.038766860961914, | |
| "loss": 0.8650633692741394, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3469831943511963, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12647470831871033, | |
| "rewards/margins": 0.6830577254295349, | |
| "rewards/rejected": -0.5565829873085022, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.021268 | |
| }, | |
| { | |
| "epoch": 0.3251704115122444, | |
| "grad_norm": 3.562811851501465, | |
| "learning_rate": 0.00019319742177287448, | |
| "logits/chosen": -0.895343542098999, | |
| "logits/rejected": -0.9661368727684021, | |
| "logps/chosen": -3.5327184200286865, | |
| "logps/rejected": -20.103837966918945, | |
| "loss": 0.8163770437240601, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.42449474334716797, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2701226472854614, | |
| "rewards/margins": 1.0340347290039062, | |
| "rewards/rejected": -0.7639120221138, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.02127 | |
| }, | |
| { | |
| "epoch": 0.32719010350921485, | |
| "grad_norm": 6.563948631286621, | |
| "learning_rate": 0.00019307574144925287, | |
| "logits/chosen": -0.9778874516487122, | |
| "logits/rejected": -1.0073670148849487, | |
| "logps/chosen": -2.233975887298584, | |
| "logps/rejected": -14.128082275390625, | |
| "loss": 0.8808709979057312, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3910011947154999, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16543619334697723, | |
| "rewards/margins": 0.6482046246528625, | |
| "rewards/rejected": -0.48276838660240173, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.021272 | |
| }, | |
| { | |
| "epoch": 0.3292097955061853, | |
| "grad_norm": 2.812866449356079, | |
| "learning_rate": 0.0001929530214924348, | |
| "logits/chosen": -0.8719493746757507, | |
| "logits/rejected": -0.9090234041213989, | |
| "logps/chosen": -2.135589361190796, | |
| "logps/rejected": -34.29349136352539, | |
| "loss": 0.6473661661148071, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23261404037475586, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12609758973121643, | |
| "rewards/margins": 1.2335658073425293, | |
| "rewards/rejected": -1.1074683666229248, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.021271 | |
| }, | |
| { | |
| "epoch": 0.3312294875031558, | |
| "grad_norm": 6.056075096130371, | |
| "learning_rate": 0.0001928292632731721, | |
| "logits/chosen": -0.927330732345581, | |
| "logits/rejected": -0.9583979845046997, | |
| "logps/chosen": -2.9721577167510986, | |
| "logps/rejected": -37.22073745727539, | |
| "loss": 0.5903728604316711, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22814247012138367, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24338555335998535, | |
| "rewards/margins": 1.3612616062164307, | |
| "rewards/rejected": -1.1178761720657349, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.021271 | |
| }, | |
| { | |
| "epoch": 0.3332491795001262, | |
| "grad_norm": 3.5847744941711426, | |
| "learning_rate": 0.00019270446817381377, | |
| "logits/chosen": -0.9705857038497925, | |
| "logits/rejected": -0.9790812134742737, | |
| "logps/chosen": -2.228187084197998, | |
| "logps/rejected": -22.54074478149414, | |
| "loss": 0.582669198513031, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3219188451766968, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.31063607335090637, | |
| "rewards/margins": 1.6680660247802734, | |
| "rewards/rejected": -1.3574302196502686, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.021273 | |
| }, | |
| { | |
| "epoch": 0.33526887149709667, | |
| "grad_norm": 3.5586040019989014, | |
| "learning_rate": 0.00019257863758829035, | |
| "logits/chosen": -0.9236764311790466, | |
| "logits/rejected": -0.9713916182518005, | |
| "logps/chosen": -2.841557264328003, | |
| "logps/rejected": -41.60185241699219, | |
| "loss": 0.667453408241272, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.45156461000442505, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1021651178598404, | |
| "rewards/margins": 2.591975450515747, | |
| "rewards/rejected": -2.4898104667663574, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.33728856349406716, | |
| "grad_norm": 11.787897109985352, | |
| "learning_rate": 0.00019245177292209867, | |
| "logits/chosen": -0.9395866394042969, | |
| "logits/rejected": -0.9611519575119019, | |
| "logps/chosen": -5.94741153717041, | |
| "logps/rejected": -48.858680725097656, | |
| "loss": 1.042246699333191, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6328973174095154, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.07254321873188019, | |
| "rewards/margins": 2.8825278282165527, | |
| "rewards/rejected": -2.955070734024048, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.3393082554910376, | |
| "grad_norm": 2.1068975925445557, | |
| "learning_rate": 0.00019232387559228587, | |
| "logits/chosen": -0.9090099930763245, | |
| "logits/rejected": -0.9743850827217102, | |
| "logps/chosen": -3.3460116386413574, | |
| "logps/rejected": -49.71737289428711, | |
| "loss": 0.3520747423171997, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20601019263267517, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.022673189640045166, | |
| "rewards/margins": 3.1425955295562744, | |
| "rewards/rejected": -3.165269136428833, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.3413279474880081, | |
| "grad_norm": 13.362913131713867, | |
| "learning_rate": 0.0001921949470274338, | |
| "logits/chosen": -0.9718740582466125, | |
| "logits/rejected": -0.9933693408966064, | |
| "logps/chosen": -16.02916717529297, | |
| "logps/rejected": -40.69719696044922, | |
| "loss": 1.3985366821289062, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 1.129913330078125, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.9396551847457886, | |
| "rewards/margins": 1.5676053762435913, | |
| "rewards/rejected": -2.507260799407959, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.34334763948497854, | |
| "grad_norm": 12.149360656738281, | |
| "learning_rate": 0.00019206498866764288, | |
| "logits/chosen": -0.9391348361968994, | |
| "logits/rejected": -0.9958175420761108, | |
| "logps/chosen": -4.999204635620117, | |
| "logps/rejected": -34.91378402709961, | |
| "loss": 1.1959863901138306, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.683914303779602, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.1860208809375763, | |
| "rewards/margins": 2.0848278999328613, | |
| "rewards/rejected": -2.2708487510681152, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.021276 | |
| }, | |
| { | |
| "epoch": 0.345367331481949, | |
| "grad_norm": 4.593865871429443, | |
| "learning_rate": 0.0001919340019645161, | |
| "logits/chosen": -0.8601446151733398, | |
| "logits/rejected": -0.9445533752441406, | |
| "logps/chosen": -6.576286792755127, | |
| "logps/rejected": -35.74972152709961, | |
| "loss": 0.8745996952056885, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.48976749181747437, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.1266278177499771, | |
| "rewards/margins": 1.351570963859558, | |
| "rewards/rejected": -1.478198766708374, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.3473870234789195, | |
| "grad_norm": 6.634700775146484, | |
| "learning_rate": 0.00019180198838114282, | |
| "logits/chosen": -0.9056757688522339, | |
| "logits/rejected": -0.9392012357711792, | |
| "logps/chosen": -1.7248777151107788, | |
| "logps/rejected": -23.6937255859375, | |
| "loss": 0.8178808093070984, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.37585797905921936, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18669246137142181, | |
| "rewards/margins": 1.2759226560592651, | |
| "rewards/rejected": -1.0892301797866821, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.021279 | |
| }, | |
| { | |
| "epoch": 0.3494067154758899, | |
| "grad_norm": 6.2399725914001465, | |
| "learning_rate": 0.00019166894939208237, | |
| "logits/chosen": -0.8763759732246399, | |
| "logits/rejected": -0.8875811100006104, | |
| "logps/chosen": -4.987262725830078, | |
| "logps/rejected": -23.384920120239258, | |
| "loss": 0.953944742679596, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5001811385154724, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.11620373278856277, | |
| "rewards/margins": 1.522448182106018, | |
| "rewards/rejected": -1.6386518478393555, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.02128 | |
| }, | |
| { | |
| "epoch": 0.3514264074728604, | |
| "grad_norm": 2.378427743911743, | |
| "learning_rate": 0.0001915348864833476, | |
| "logits/chosen": -0.8616642951965332, | |
| "logits/rejected": -0.9031955003738403, | |
| "logps/chosen": -2.75161075592041, | |
| "logps/rejected": -17.232093811035156, | |
| "loss": 0.7261631488800049, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3087785542011261, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24855753779411316, | |
| "rewards/margins": 0.8990098237991333, | |
| "rewards/rejected": -0.650452196598053, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.35344609946983085, | |
| "grad_norm": 2.4263904094696045, | |
| "learning_rate": 0.00019139980115238827, | |
| "logits/chosen": -0.8389776945114136, | |
| "logits/rejected": -0.8697970509529114, | |
| "logps/chosen": -4.028109073638916, | |
| "logps/rejected": -18.706117630004883, | |
| "loss": 0.780457615852356, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2751180827617645, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.006659353151917458, | |
| "rewards/margins": 0.7851797342300415, | |
| "rewards/rejected": -0.791839063167572, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.3554657914668013, | |
| "grad_norm": 2.074300765991211, | |
| "learning_rate": 0.00019126369490807447, | |
| "logits/chosen": -0.8048940896987915, | |
| "logits/rejected": -0.884000301361084, | |
| "logps/chosen": -1.4055310487747192, | |
| "logps/rejected": -25.309282302856445, | |
| "loss": 0.4804037809371948, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14255806803703308, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40084120631217957, | |
| "rewards/margins": 1.3346383571624756, | |
| "rewards/rejected": -0.9337972402572632, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.3574854834637718, | |
| "grad_norm": 3.744903802871704, | |
| "learning_rate": 0.00019112656927067955, | |
| "logits/chosen": -0.8155094981193542, | |
| "logits/rejected": -0.8395469784736633, | |
| "logps/chosen": -11.99010944366455, | |
| "logps/rejected": -26.437166213989258, | |
| "loss": 0.8095741271972656, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34381529688835144, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.11786942183971405, | |
| "rewards/margins": 1.111412763595581, | |
| "rewards/rejected": -1.2292821407318115, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.35950517546074223, | |
| "grad_norm": 2.4447503089904785, | |
| "learning_rate": 0.00019098842577186314, | |
| "logits/chosen": -0.8492040634155273, | |
| "logits/rejected": -0.9052773714065552, | |
| "logps/chosen": -2.7093420028686523, | |
| "logps/rejected": -21.28760528564453, | |
| "loss": 0.6568049192428589, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.21920911967754364, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19283369183540344, | |
| "rewards/margins": 1.1686737537384033, | |
| "rewards/rejected": -0.9758400321006775, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.3615248674577127, | |
| "grad_norm": 2.275618314743042, | |
| "learning_rate": 0.0001908492659546543, | |
| "logits/chosen": -0.7995213866233826, | |
| "logits/rejected": -0.9124236106872559, | |
| "logps/chosen": -2.1147406101226807, | |
| "logps/rejected": -30.72578239440918, | |
| "loss": 0.5593333840370178, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1950627565383911, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.16707345843315125, | |
| "rewards/margins": 1.2975778579711914, | |
| "rewards/rejected": -1.1305043697357178, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.36354455945468317, | |
| "grad_norm": 3.495725631713867, | |
| "learning_rate": 0.00019070909137343408, | |
| "logits/chosen": -0.9321005940437317, | |
| "logits/rejected": -0.9968794584274292, | |
| "logps/chosen": -3.873347759246826, | |
| "logps/rejected": -28.580020904541016, | |
| "loss": 0.6998752951622009, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.46146360039711, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.157605841755867, | |
| "rewards/margins": 1.7749366760253906, | |
| "rewards/rejected": -1.6173310279846191, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.021286 | |
| }, | |
| { | |
| "epoch": 0.3655642514516536, | |
| "grad_norm": 2.6631152629852295, | |
| "learning_rate": 0.0001905679035939181, | |
| "logits/chosen": -0.9386301636695862, | |
| "logits/rejected": -1.0215297937393188, | |
| "logps/chosen": -0.5281402468681335, | |
| "logps/rejected": -32.908546447753906, | |
| "loss": 0.3208782374858856, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11616937071084976, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.27659526467323303, | |
| "rewards/margins": 2.29314923286438, | |
| "rewards/rejected": -2.016554117202759, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.021288 | |
| }, | |
| { | |
| "epoch": 0.3675839434486241, | |
| "grad_norm": 10.830909729003906, | |
| "learning_rate": 0.00019042570419313925, | |
| "logits/chosen": -0.970279335975647, | |
| "logits/rejected": -1.0291110277175903, | |
| "logps/chosen": -8.81902027130127, | |
| "logps/rejected": -42.53478240966797, | |
| "loss": 1.1662126779556274, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6375398635864258, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.26809704303741455, | |
| "rewards/margins": 2.575526237487793, | |
| "rewards/rejected": -2.843623161315918, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.021289 | |
| }, | |
| { | |
| "epoch": 0.36960363544559455, | |
| "grad_norm": 9.357040405273438, | |
| "learning_rate": 0.0001902824947594299, | |
| "logits/chosen": -0.9984275102615356, | |
| "logits/rejected": -1.0901621580123901, | |
| "logps/chosen": -4.183664321899414, | |
| "logps/rejected": -42.764862060546875, | |
| "loss": 0.8461188077926636, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.662725031375885, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08130670338869095, | |
| "rewards/margins": 3.4639174938201904, | |
| "rewards/rejected": -3.3826112747192383, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.02129 | |
| }, | |
| { | |
| "epoch": 0.371623327442565, | |
| "grad_norm": 22.538454055786133, | |
| "learning_rate": 0.00019013827689240436, | |
| "logits/chosen": -0.9899927973747253, | |
| "logits/rejected": -1.0915980339050293, | |
| "logps/chosen": -5.971269130706787, | |
| "logps/rejected": -41.92043685913086, | |
| "loss": 1.3363139629364014, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7483702301979065, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.24273402988910675, | |
| "rewards/margins": 2.6009511947631836, | |
| "rewards/rejected": -2.8436849117279053, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.021291 | |
| }, | |
| { | |
| "epoch": 0.3736430194395355, | |
| "grad_norm": 5.44999361038208, | |
| "learning_rate": 0.0001899930522029408, | |
| "logits/chosen": -0.9289810061454773, | |
| "logits/rejected": -1.0461653470993042, | |
| "logps/chosen": -13.561850547790527, | |
| "logps/rejected": -50.344093322753906, | |
| "loss": 1.021875262260437, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7987765669822693, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.4458293318748474, | |
| "rewards/margins": 2.7672858238220215, | |
| "rewards/rejected": -3.2131152153015137, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.021291 | |
| }, | |
| { | |
| "epoch": 0.3756627114365059, | |
| "grad_norm": 9.218350410461426, | |
| "learning_rate": 0.00018984682231316333, | |
| "logits/chosen": -0.9281139373779297, | |
| "logits/rejected": -1.0329409837722778, | |
| "logps/chosen": -3.859086036682129, | |
| "logps/rejected": -30.334747314453125, | |
| "loss": 1.411182165145874, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8451413512229919, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08102743327617645, | |
| "rewards/margins": 1.733138084411621, | |
| "rewards/rejected": -1.6521105766296387, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.021292 | |
| }, | |
| { | |
| "epoch": 0.3776824034334764, | |
| "grad_norm": 9.405385971069336, | |
| "learning_rate": 0.00018969958885642398, | |
| "logits/chosen": -0.9063903093338013, | |
| "logits/rejected": -1.0287251472473145, | |
| "logps/chosen": -5.265182971954346, | |
| "logps/rejected": -53.523624420166016, | |
| "loss": 0.5908830165863037, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.38780495524406433, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0466960184276104, | |
| "rewards/margins": 3.7127225399017334, | |
| "rewards/rejected": -3.6660263538360596, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.021292 | |
| }, | |
| { | |
| "epoch": 0.37970209543044686, | |
| "grad_norm": 2.527911901473999, | |
| "learning_rate": 0.00018955135347728432, | |
| "logits/chosen": -0.749373733997345, | |
| "logits/rejected": -0.9382051229476929, | |
| "logps/chosen": -1.4075103998184204, | |
| "logps/rejected": -48.75277328491211, | |
| "loss": 0.32720643281936646, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15030686557292938, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2724253535270691, | |
| "rewards/margins": 2.877960205078125, | |
| "rewards/rejected": -2.605534791946411, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.021292 | |
| }, | |
| { | |
| "epoch": 0.3817217874274173, | |
| "grad_norm": 3.514798164367676, | |
| "learning_rate": 0.00018940211783149722, | |
| "logits/chosen": -0.9332194924354553, | |
| "logits/rejected": -0.9634183049201965, | |
| "logps/chosen": -3.9122090339660645, | |
| "logps/rejected": -23.81725311279297, | |
| "loss": 0.5536522269248962, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2619181275367737, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2673307955265045, | |
| "rewards/margins": 1.8769687414169312, | |
| "rewards/rejected": -1.609637975692749, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.021293 | |
| }, | |
| { | |
| "epoch": 0.3837414794243878, | |
| "grad_norm": 3.0047051906585693, | |
| "learning_rate": 0.00018925188358598813, | |
| "logits/chosen": -0.874540388584137, | |
| "logits/rejected": -0.9682676792144775, | |
| "logps/chosen": -1.5275218486785889, | |
| "logps/rejected": -36.20308303833008, | |
| "loss": 0.476752907037735, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.12829114496707916, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1873767375946045, | |
| "rewards/margins": 2.56374454498291, | |
| "rewards/rejected": -2.3763678073883057, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.021294 | |
| }, | |
| { | |
| "epoch": 0.38576117142135824, | |
| "grad_norm": 5.604814052581787, | |
| "learning_rate": 0.0001891006524188368, | |
| "logits/chosen": -0.8748272657394409, | |
| "logits/rejected": -0.8527596592903137, | |
| "logps/chosen": -22.366464614868164, | |
| "logps/rejected": -31.544967651367188, | |
| "loss": 0.844088077545166, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34909212589263916, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.017623694613575935, | |
| "rewards/margins": 1.6229170560836792, | |
| "rewards/rejected": -1.6052933931350708, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.021293 | |
| }, | |
| { | |
| "epoch": 0.3877808634183287, | |
| "grad_norm": 3.902900457382202, | |
| "learning_rate": 0.0001889484260192582, | |
| "logits/chosen": -0.8291831612586975, | |
| "logits/rejected": -0.9175705909729004, | |
| "logps/chosen": -3.4213364124298096, | |
| "logps/rejected": -28.334596633911133, | |
| "loss": 0.6280531883239746, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2871948778629303, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.20435035228729248, | |
| "rewards/margins": 1.6512333154678345, | |
| "rewards/rejected": -1.446882963180542, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.021293 | |
| }, | |
| { | |
| "epoch": 0.3898005554152992, | |
| "grad_norm": 3.3589909076690674, | |
| "learning_rate": 0.00018879520608758394, | |
| "logits/chosen": -0.7861786484718323, | |
| "logits/rejected": -0.9745673537254333, | |
| "logps/chosen": -2.2813668251037598, | |
| "logps/rejected": -30.406993865966797, | |
| "loss": 0.46809083223342896, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24172116816043854, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2660973072052002, | |
| "rewards/margins": 1.8777257204055786, | |
| "rewards/rejected": -1.6116284132003784, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.021294 | |
| }, | |
| { | |
| "epoch": 0.3918202474122696, | |
| "grad_norm": 3.7471225261688232, | |
| "learning_rate": 0.000188640994335243, | |
| "logits/chosen": -0.8293952941894531, | |
| "logits/rejected": -0.9208282232284546, | |
| "logps/chosen": -2.756782293319702, | |
| "logps/rejected": -28.273818969726562, | |
| "loss": 0.7544887065887451, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3577630817890167, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12236475944519043, | |
| "rewards/margins": 1.8170613050460815, | |
| "rewards/rejected": -1.6946964263916016, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.021295 | |
| }, | |
| { | |
| "epoch": 0.3938399394092401, | |
| "grad_norm": 3.194539785385132, | |
| "learning_rate": 0.00018848579248474288, | |
| "logits/chosen": -0.7125469446182251, | |
| "logits/rejected": -0.888473391532898, | |
| "logps/chosen": -4.232546329498291, | |
| "logps/rejected": -34.417152404785156, | |
| "loss": 0.634448230266571, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23650826513767242, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3275882303714752, | |
| "rewards/margins": 1.5964200496673584, | |
| "rewards/rejected": -1.2688318490982056, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.021294 | |
| }, | |
| { | |
| "epoch": 0.39585963140621055, | |
| "grad_norm": 7.319854736328125, | |
| "learning_rate": 0.00018832960226965008, | |
| "logits/chosen": -0.8826249837875366, | |
| "logits/rejected": -0.9558060169219971, | |
| "logps/chosen": -2.2309622764587402, | |
| "logps/rejected": -23.310834884643555, | |
| "loss": 0.7857663035392761, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31681591272354126, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.3184216618537903, | |
| "rewards/margins": 1.3100265264511108, | |
| "rewards/rejected": -0.9916048049926758, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.021296 | |
| }, | |
| { | |
| "epoch": 0.397879323403181, | |
| "grad_norm": 4.467423439025879, | |
| "learning_rate": 0.00018817242543457108, | |
| "logits/chosen": -0.7410279512405396, | |
| "logits/rejected": -0.8783193826675415, | |
| "logps/chosen": -6.2165632247924805, | |
| "logps/rejected": -40.68191909790039, | |
| "loss": 0.8568143844604492, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4732620418071747, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06536143273115158, | |
| "rewards/margins": 1.7412124872207642, | |
| "rewards/rejected": -1.6758511066436768, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.021296 | |
| }, | |
| { | |
| "epoch": 0.3998990154001515, | |
| "grad_norm": 3.227818250656128, | |
| "learning_rate": 0.0001880142637351325, | |
| "logits/chosen": -0.8976326584815979, | |
| "logits/rejected": -0.9664545059204102, | |
| "logps/chosen": -2.204209804534912, | |
| "logps/rejected": -19.951866149902344, | |
| "loss": 0.5582164525985718, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18982845544815063, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3193460702896118, | |
| "rewards/margins": 1.213867425918579, | |
| "rewards/rejected": -0.8945214748382568, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.021297 | |
| }, | |
| { | |
| "epoch": 0.40191870739712193, | |
| "grad_norm": 5.091889381408691, | |
| "learning_rate": 0.00018785511893796176, | |
| "logits/chosen": -0.813483476638794, | |
| "logits/rejected": -0.9725134968757629, | |
| "logps/chosen": -1.0746464729309082, | |
| "logps/rejected": -31.801054000854492, | |
| "loss": 0.38803631067276, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18849264085292816, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.29135608673095703, | |
| "rewards/margins": 1.9811937808990479, | |
| "rewards/rejected": -1.6898375749588013, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.021298 | |
| }, | |
| { | |
| "epoch": 0.4039383993940924, | |
| "grad_norm": 3.733981132507324, | |
| "learning_rate": 0.00018769499282066717, | |
| "logits/chosen": -0.8599748015403748, | |
| "logits/rejected": -0.9630089998245239, | |
| "logps/chosen": -2.635427236557007, | |
| "logps/rejected": -24.271150588989258, | |
| "loss": 0.6127274036407471, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2767713665962219, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2570668160915375, | |
| "rewards/margins": 1.4302881956100464, | |
| "rewards/rejected": -1.1732213497161865, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.021299 | |
| }, | |
| { | |
| "epoch": 0.40595809139106287, | |
| "grad_norm": 4.356893062591553, | |
| "learning_rate": 0.0001875338871718182, | |
| "logits/chosen": -0.8239525556564331, | |
| "logits/rejected": -0.9406594634056091, | |
| "logps/chosen": -3.5920815467834473, | |
| "logps/rejected": -33.701141357421875, | |
| "loss": 0.7486278414726257, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34808939695358276, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.06076638400554657, | |
| "rewards/margins": 1.9439024925231934, | |
| "rewards/rejected": -1.8831360340118408, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.021262 | |
| }, | |
| { | |
| "epoch": 0.4079777833880333, | |
| "grad_norm": 3.3695449829101562, | |
| "learning_rate": 0.00018737180379092537, | |
| "logits/chosen": -0.7839801907539368, | |
| "logits/rejected": -0.8861851096153259, | |
| "logps/chosen": -8.617507934570312, | |
| "logps/rejected": -47.99607849121094, | |
| "loss": 0.5823696851730347, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3239917457103729, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.02249305695295334, | |
| "rewards/margins": 3.1341774463653564, | |
| "rewards/rejected": -3.1116843223571777, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.021262 | |
| }, | |
| { | |
| "epoch": 0.4099974753850038, | |
| "grad_norm": 2.5396463871002197, | |
| "learning_rate": 0.00018720874448842034, | |
| "logits/chosen": -0.8206271529197693, | |
| "logits/rejected": -1.0252444744110107, | |
| "logps/chosen": -1.0570971965789795, | |
| "logps/rejected": -47.1510124206543, | |
| "loss": 0.324438214302063, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11744873970746994, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.36073753237724304, | |
| "rewards/margins": 3.558206558227539, | |
| "rewards/rejected": -3.1974687576293945, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.41201716738197425, | |
| "grad_norm": 3.693103551864624, | |
| "learning_rate": 0.00018704471108563548, | |
| "logits/chosen": -0.8473316431045532, | |
| "logits/rejected": -0.9990904927253723, | |
| "logps/chosen": -4.564356803894043, | |
| "logps/rejected": -40.657447814941406, | |
| "loss": 0.4926657974720001, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2881479859352112, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39431607723236084, | |
| "rewards/margins": 2.6521053314208984, | |
| "rewards/rejected": -2.257789373397827, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.4140368593789447, | |
| "grad_norm": 5.1197896003723145, | |
| "learning_rate": 0.00018687970541478364, | |
| "logits/chosen": -0.8696497082710266, | |
| "logits/rejected": -1.0545570850372314, | |
| "logps/chosen": -1.4695444107055664, | |
| "logps/rejected": -46.127044677734375, | |
| "loss": 0.34414029121398926, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.16013705730438232, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.33041495084762573, | |
| "rewards/margins": 3.691737174987793, | |
| "rewards/rejected": -3.3613224029541016, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.021264 | |
| }, | |
| { | |
| "epoch": 0.4160565513759152, | |
| "grad_norm": 11.712461471557617, | |
| "learning_rate": 0.00018671372931893773, | |
| "logits/chosen": -0.9976873993873596, | |
| "logits/rejected": -1.0082725286483765, | |
| "logps/chosen": -6.205466270446777, | |
| "logps/rejected": -21.121868133544922, | |
| "loss": 1.509117841720581, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.9143091440200806, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.13785380125045776, | |
| "rewards/margins": 1.1608891487121582, | |
| "rewards/rejected": -1.2987430095672607, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.4180762433728856, | |
| "grad_norm": 4.418537616729736, | |
| "learning_rate": 0.00018654678465201, | |
| "logits/chosen": -0.9154266119003296, | |
| "logits/rejected": -0.981490969657898, | |
| "logps/chosen": -9.175884246826172, | |
| "logps/rejected": -32.25775146484375, | |
| "loss": 0.7383416891098022, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3417145013809204, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03129662945866585, | |
| "rewards/margins": 2.172858476638794, | |
| "rewards/rejected": -2.14156174659729, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.4200959353698561, | |
| "grad_norm": 4.682573318481445, | |
| "learning_rate": 0.0001863788732787314, | |
| "logits/chosen": -0.845721423625946, | |
| "logits/rejected": -1.0325840711593628, | |
| "logps/chosen": -3.112144708633423, | |
| "logps/rejected": -48.1558952331543, | |
| "loss": 0.4932224452495575, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3019799590110779, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16389404237270355, | |
| "rewards/margins": 3.949674367904663, | |
| "rewards/rejected": -3.785780429840088, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.021267 | |
| }, | |
| { | |
| "epoch": 0.42211562736682656, | |
| "grad_norm": 6.930049419403076, | |
| "learning_rate": 0.0001862099970746308, | |
| "logits/chosen": -0.8911486268043518, | |
| "logits/rejected": -1.048769474029541, | |
| "logps/chosen": -3.7173314094543457, | |
| "logps/rejected": -37.73887252807617, | |
| "loss": 0.6971174478530884, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3776175379753113, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14115534722805023, | |
| "rewards/margins": 2.630204200744629, | |
| "rewards/rejected": -2.489048719406128, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.021268 | |
| }, | |
| { | |
| "epoch": 0.424135319363797, | |
| "grad_norm": 3.0014336109161377, | |
| "learning_rate": 0.00018604015792601396, | |
| "logits/chosen": -0.7730808854103088, | |
| "logits/rejected": -0.9816968441009521, | |
| "logps/chosen": -0.3805132210254669, | |
| "logps/rejected": -53.63943099975586, | |
| "loss": 0.21242156624794006, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.05388123169541359, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3490655720233917, | |
| "rewards/margins": 3.7549197673797607, | |
| "rewards/rejected": -3.4058542251586914, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.021268 | |
| }, | |
| { | |
| "epoch": 0.4261550113607675, | |
| "grad_norm": 6.788722991943359, | |
| "learning_rate": 0.00018586935772994245, | |
| "logits/chosen": -0.7963772416114807, | |
| "logits/rejected": -1.0568972826004028, | |
| "logps/chosen": -1.2283453941345215, | |
| "logps/rejected": -59.22148132324219, | |
| "loss": 0.18988274037837982, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.12394578754901886, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4420156478881836, | |
| "rewards/margins": 4.728057384490967, | |
| "rewards/rejected": -4.286042213439941, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.021269 | |
| }, | |
| { | |
| "epoch": 0.42817470335773794, | |
| "grad_norm": 2.8118438720703125, | |
| "learning_rate": 0.00018569759839421265, | |
| "logits/chosen": -0.819808840751648, | |
| "logits/rejected": -0.9025678038597107, | |
| "logps/chosen": -2.9665253162384033, | |
| "logps/rejected": -40.64404296875, | |
| "loss": 0.33937186002731323, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11274304240942001, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4729611575603485, | |
| "rewards/margins": 3.319221019744873, | |
| "rewards/rejected": -2.8462600708007812, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.021269 | |
| }, | |
| { | |
| "epoch": 0.4301943953547084, | |
| "grad_norm": 4.191134452819824, | |
| "learning_rate": 0.00018552488183733412, | |
| "logits/chosen": -0.8641024231910706, | |
| "logits/rejected": -0.9831883907318115, | |
| "logps/chosen": -7.590506553649902, | |
| "logps/rejected": -40.67595672607422, | |
| "loss": 0.6653822064399719, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3946245610713959, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.004725143313407898, | |
| "rewards/margins": 2.8683340549468994, | |
| "rewards/rejected": -2.8730592727661133, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.021269 | |
| }, | |
| { | |
| "epoch": 0.4322140873516789, | |
| "grad_norm": 7.408899307250977, | |
| "learning_rate": 0.00018535120998850848, | |
| "logits/chosen": -0.9360211491584778, | |
| "logits/rejected": -1.0136916637420654, | |
| "logps/chosen": -5.061653137207031, | |
| "logps/rejected": -31.533058166503906, | |
| "loss": 0.8134801983833313, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.38820868730545044, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2650642693042755, | |
| "rewards/margins": 2.2353947162628174, | |
| "rewards/rejected": -1.9703304767608643, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.021271 | |
| }, | |
| { | |
| "epoch": 0.4342337793486493, | |
| "grad_norm": 6.260317802429199, | |
| "learning_rate": 0.0001851765847876076, | |
| "logits/chosen": -0.9736087322235107, | |
| "logits/rejected": -1.0754610300064087, | |
| "logps/chosen": -6.311574935913086, | |
| "logps/rejected": -41.57005310058594, | |
| "loss": 1.0864337682724, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6948180794715881, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.11255162954330444, | |
| "rewards/margins": 2.995018482208252, | |
| "rewards/rejected": -3.107570171356201, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.021272 | |
| }, | |
| { | |
| "epoch": 0.4362534713456198, | |
| "grad_norm": 13.104352951049805, | |
| "learning_rate": 0.00018500100818515222, | |
| "logits/chosen": -0.6429583430290222, | |
| "logits/rejected": -0.9696972966194153, | |
| "logps/chosen": -2.051022529602051, | |
| "logps/rejected": -83.3814697265625, | |
| "loss": 0.6120116710662842, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.312576562166214, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.121861532330513, | |
| "rewards/margins": 5.671273708343506, | |
| "rewards/rejected": -5.549411773681641, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.021271 | |
| }, | |
| { | |
| "epoch": 0.43827316334259026, | |
| "grad_norm": 7.3358564376831055, | |
| "learning_rate": 0.0001848244821422899, | |
| "logits/chosen": -1.0172042846679688, | |
| "logits/rejected": -1.0574982166290283, | |
| "logps/chosen": -3.74454927444458, | |
| "logps/rejected": -25.982912063598633, | |
| "loss": 0.8323017358779907, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30521970987319946, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1191268116235733, | |
| "rewards/margins": 1.8004627227783203, | |
| "rewards/rejected": -1.6813361644744873, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.021273 | |
| }, | |
| { | |
| "epoch": 0.4402928553395607, | |
| "grad_norm": 2.6182119846343994, | |
| "learning_rate": 0.00018464700863077312, | |
| "logits/chosen": -0.995885968208313, | |
| "logits/rejected": -1.102242350578308, | |
| "logps/chosen": -1.5725170373916626, | |
| "logps/rejected": -46.24748229980469, | |
| "loss": 0.3959670662879944, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1685146987438202, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.18964146077632904, | |
| "rewards/margins": 3.7616095542907715, | |
| "rewards/rejected": -3.5719680786132812, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.4423125473365312, | |
| "grad_norm": 5.691047191619873, | |
| "learning_rate": 0.00018446858963293763, | |
| "logits/chosen": -0.9241669178009033, | |
| "logits/rejected": -1.0488460063934326, | |
| "logps/chosen": -2.7383437156677246, | |
| "logps/rejected": -53.106632232666016, | |
| "loss": 0.46598395705223083, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.28670936822891235, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08014581352472305, | |
| "rewards/margins": 3.8416402339935303, | |
| "rewards/rejected": -3.7614941596984863, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.44433223933350163, | |
| "grad_norm": 6.792243957519531, | |
| "learning_rate": 0.0001842892271416797, | |
| "logits/chosen": -0.867421567440033, | |
| "logits/rejected": -1.0047706365585327, | |
| "logps/chosen": -3.9948360919952393, | |
| "logps/rejected": -40.925697326660156, | |
| "loss": 0.559948205947876, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2816776633262634, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.27128446102142334, | |
| "rewards/margins": 2.5824544429779053, | |
| "rewards/rejected": -2.3111701011657715, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.44635193133047213, | |
| "grad_norm": 2.8233304023742676, | |
| "learning_rate": 0.00018410892316043448, | |
| "logits/chosen": -0.7455387711524963, | |
| "logits/rejected": -1.0043134689331055, | |
| "logps/chosen": -2.28206205368042, | |
| "logps/rejected": -50.90422821044922, | |
| "loss": 0.4489433765411377, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17719773948192596, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.17336970567703247, | |
| "rewards/margins": 3.006608009338379, | |
| "rewards/rejected": -2.833238363265991, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.021276 | |
| }, | |
| { | |
| "epoch": 0.44837162332744257, | |
| "grad_norm": 3.7978217601776123, | |
| "learning_rate": 0.00018392767970315313, | |
| "logits/chosen": -0.9136677980422974, | |
| "logits/rejected": -1.06996488571167, | |
| "logps/chosen": -1.5614748001098633, | |
| "logps/rejected": -34.510162353515625, | |
| "loss": 0.3262411057949066, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1898116022348404, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3149145543575287, | |
| "rewards/margins": 2.7444238662719727, | |
| "rewards/rejected": -2.429509162902832, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.450391315324413, | |
| "grad_norm": 6.886748313903809, | |
| "learning_rate": 0.00018374549879428062, | |
| "logits/chosen": -0.9338952302932739, | |
| "logits/rejected": -1.0804352760314941, | |
| "logps/chosen": -1.0283788442611694, | |
| "logps/rejected": -38.30894088745117, | |
| "loss": 0.3192234933376312, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11882957816123962, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24301038682460785, | |
| "rewards/margins": 2.798785924911499, | |
| "rewards/rejected": -2.5557756423950195, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.021278 | |
| }, | |
| { | |
| "epoch": 0.4524110073213835, | |
| "grad_norm": 6.402444362640381, | |
| "learning_rate": 0.000183562382468733, | |
| "logits/chosen": -0.9219646453857422, | |
| "logits/rejected": -1.0332969427108765, | |
| "logps/chosen": -4.296561241149902, | |
| "logps/rejected": -32.83451843261719, | |
| "loss": 1.1228792667388916, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8876572251319885, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.020390525460243225, | |
| "rewards/margins": 2.142768383026123, | |
| "rewards/rejected": -2.163159132003784, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.021279 | |
| }, | |
| { | |
| "epoch": 0.45443069931835395, | |
| "grad_norm": 9.758877754211426, | |
| "learning_rate": 0.00018337833277187472, | |
| "logits/chosen": -0.8922550082206726, | |
| "logits/rejected": -0.9859142303466797, | |
| "logps/chosen": -7.753718376159668, | |
| "logps/rejected": -28.561172485351562, | |
| "loss": 1.4200571775436401, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8696328997612, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.07261030375957489, | |
| "rewards/margins": 1.1861965656280518, | |
| "rewards/rejected": -1.2588069438934326, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.02128 | |
| }, | |
| { | |
| "epoch": 0.4564503913153244, | |
| "grad_norm": 7.866222858428955, | |
| "learning_rate": 0.0001831933517594957, | |
| "logits/chosen": -0.7848281860351562, | |
| "logits/rejected": -1.0049529075622559, | |
| "logps/chosen": -2.8492534160614014, | |
| "logps/rejected": -53.778289794921875, | |
| "loss": 0.520083487033844, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3156394362449646, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19083034992218018, | |
| "rewards/margins": 3.20526123046875, | |
| "rewards/rejected": -3.0144309997558594, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.02128 | |
| }, | |
| { | |
| "epoch": 0.4584700833122949, | |
| "grad_norm": 4.694428443908691, | |
| "learning_rate": 0.00018300744149778853, | |
| "logits/chosen": -0.9140058755874634, | |
| "logits/rejected": -1.035470724105835, | |
| "logps/chosen": -0.7746766805648804, | |
| "logps/rejected": -31.849538803100586, | |
| "loss": 0.41979673504829407, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1669030785560608, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.34211465716362, | |
| "rewards/margins": 2.157820701599121, | |
| "rewards/rejected": -1.8157060146331787, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.021281 | |
| }, | |
| { | |
| "epoch": 0.4604897753092653, | |
| "grad_norm": 4.092323303222656, | |
| "learning_rate": 0.00018282060406332512, | |
| "logits/chosen": -0.8949604034423828, | |
| "logits/rejected": -1.0626131296157837, | |
| "logps/chosen": -2.425996780395508, | |
| "logps/rejected": -28.149372100830078, | |
| "loss": 0.4806259274482727, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22964058816432953, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2916340231895447, | |
| "rewards/margins": 1.6805919408798218, | |
| "rewards/rejected": -1.3889580965042114, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.021281 | |
| }, | |
| { | |
| "epoch": 0.4625094673062358, | |
| "grad_norm": 4.152270317077637, | |
| "learning_rate": 0.0001826328415430339, | |
| "logits/chosen": -1.0330709218978882, | |
| "logits/rejected": -1.1299700736999512, | |
| "logps/chosen": -2.0911142826080322, | |
| "logps/rejected": -25.8432674407959, | |
| "loss": 0.47937411069869995, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24223287403583527, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22816987335681915, | |
| "rewards/margins": 1.9592314958572388, | |
| "rewards/rejected": -1.7310616970062256, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.46452915930320626, | |
| "grad_norm": 3.1440939903259277, | |
| "learning_rate": 0.00018244415603417603, | |
| "logits/chosen": -0.9888077974319458, | |
| "logits/rejected": -1.087904930114746, | |
| "logps/chosen": -1.7838736772537231, | |
| "logps/rejected": -31.170108795166016, | |
| "loss": 0.5677547454833984, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2625994384288788, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.36328813433647156, | |
| "rewards/margins": 2.194064140319824, | |
| "rewards/rejected": -1.8307762145996094, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.4665488513001767, | |
| "grad_norm": 3.9995431900024414, | |
| "learning_rate": 0.00018225454964432248, | |
| "logits/chosen": -0.8009510040283203, | |
| "logits/rejected": -0.9875888824462891, | |
| "logps/chosen": -4.417139530181885, | |
| "logps/rejected": -39.54981231689453, | |
| "loss": 0.5815356969833374, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4281938374042511, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21771493554115295, | |
| "rewards/margins": 2.3999886512756348, | |
| "rewards/rejected": -2.1822738647460938, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.4685685432971472, | |
| "grad_norm": 5.97980260848999, | |
| "learning_rate": 0.00018206402449132995, | |
| "logits/chosen": -0.8073972463607788, | |
| "logits/rejected": -1.005049705505371, | |
| "logps/chosen": -3.3927805423736572, | |
| "logps/rejected": -40.57596206665039, | |
| "loss": 0.6254691481590271, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.36383697390556335, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1796584278345108, | |
| "rewards/margins": 1.9802054166793823, | |
| "rewards/rejected": -1.8005468845367432, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.47058823529411764, | |
| "grad_norm": 3.2046210765838623, | |
| "learning_rate": 0.00018187258270331783, | |
| "logits/chosen": -0.843147873878479, | |
| "logits/rejected": -0.9698415398597717, | |
| "logps/chosen": -6.980717182159424, | |
| "logps/rejected": -47.44036865234375, | |
| "loss": 0.42867493629455566, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22475841641426086, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.42296847701072693, | |
| "rewards/margins": 3.3137428760528564, | |
| "rewards/rejected": -2.8907744884490967, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.47260792729108814, | |
| "grad_norm": 5.650546550750732, | |
| "learning_rate": 0.00018168022641864377, | |
| "logits/chosen": -0.9458031058311462, | |
| "logits/rejected": -1.022731900215149, | |
| "logps/chosen": -5.699041366577148, | |
| "logps/rejected": -27.91295051574707, | |
| "loss": 0.6052364706993103, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.25157076120376587, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.17266854643821716, | |
| "rewards/margins": 2.01995587348938, | |
| "rewards/rejected": -1.8472874164581299, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.4746276192880586, | |
| "grad_norm": 7.562004089355469, | |
| "learning_rate": 0.00018148695778588033, | |
| "logits/chosen": -0.8491840362548828, | |
| "logits/rejected": -0.9722462296485901, | |
| "logps/chosen": -8.168458938598633, | |
| "logps/rejected": -39.646427154541016, | |
| "loss": 1.076995849609375, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6254736185073853, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23536130785942078, | |
| "rewards/margins": 2.3698079586029053, | |
| "rewards/rejected": -2.134446859359741, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.476647311285029, | |
| "grad_norm": 2.8358967304229736, | |
| "learning_rate": 0.00018129277896379077, | |
| "logits/chosen": -0.8474506139755249, | |
| "logits/rejected": -0.9761014580726624, | |
| "logps/chosen": -1.0130198001861572, | |
| "logps/rejected": -34.24652099609375, | |
| "loss": 0.3748179078102112, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11387713998556137, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.42450040578842163, | |
| "rewards/margins": 2.2273645401000977, | |
| "rewards/rejected": -1.8028637170791626, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.4786670032819995, | |
| "grad_norm": 24.549625396728516, | |
| "learning_rate": 0.00018109769212130487, | |
| "logits/chosen": -0.7827628254890442, | |
| "logits/rejected": -0.899127721786499, | |
| "logps/chosen": -12.455778121948242, | |
| "logps/rejected": -39.55864715576172, | |
| "loss": 1.0212831497192383, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6375862956047058, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.05945993959903717, | |
| "rewards/margins": 2.1959457397460938, | |
| "rewards/rejected": -2.2554056644439697, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.021283 | |
| }, | |
| { | |
| "epoch": 0.48068669527896996, | |
| "grad_norm": 5.986259460449219, | |
| "learning_rate": 0.00018090169943749476, | |
| "logits/chosen": -0.9809411764144897, | |
| "logits/rejected": -1.0568145513534546, | |
| "logps/chosen": -2.8511006832122803, | |
| "logps/rejected": -30.153661727905273, | |
| "loss": 0.6427941918373108, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31609585881233215, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.20257410407066345, | |
| "rewards/margins": 2.3083198070526123, | |
| "rewards/rejected": -2.105745553970337, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.4827063872759404, | |
| "grad_norm": 6.145867824554443, | |
| "learning_rate": 0.00018070480310155066, | |
| "logits/chosen": -0.8342568874359131, | |
| "logits/rejected": -0.9062321782112122, | |
| "logps/chosen": -7.222947120666504, | |
| "logps/rejected": -37.760414123535156, | |
| "loss": 0.8602092862129211, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.47236353158950806, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14982852339744568, | |
| "rewards/margins": 2.0299620628356934, | |
| "rewards/rejected": -1.8801336288452148, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.4847260792729109, | |
| "grad_norm": 5.842182159423828, | |
| "learning_rate": 0.0001805070053127563, | |
| "logits/chosen": -0.8298416137695312, | |
| "logits/rejected": -0.9391087889671326, | |
| "logps/chosen": -4.0047993659973145, | |
| "logps/rejected": -34.49217224121094, | |
| "loss": 0.6390224695205688, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.391327440738678, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.296629935503006, | |
| "rewards/margins": 2.591277837753296, | |
| "rewards/rejected": -2.294647693634033, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.48674577126988133, | |
| "grad_norm": 3.0892484188079834, | |
| "learning_rate": 0.0001803083082804645, | |
| "logits/chosen": -0.6407896876335144, | |
| "logits/rejected": -0.8386159539222717, | |
| "logps/chosen": -2.6044552326202393, | |
| "logps/rejected": -43.223602294921875, | |
| "loss": 0.5524685978889465, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23806366324424744, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.17818674445152283, | |
| "rewards/margins": 2.3168139457702637, | |
| "rewards/rejected": -2.138627052307129, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.48876546326685183, | |
| "grad_norm": 2.5642099380493164, | |
| "learning_rate": 0.00018010871422407236, | |
| "logits/chosen": -0.5903664231300354, | |
| "logits/rejected": -0.817259669303894, | |
| "logps/chosen": -1.1348421573638916, | |
| "logps/rejected": -54.072288513183594, | |
| "loss": 0.390775203704834, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18238955736160278, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.31289827823638916, | |
| "rewards/margins": 3.0836544036865234, | |
| "rewards/rejected": -2.7707560062408447, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.49078515526382227, | |
| "grad_norm": 4.531945705413818, | |
| "learning_rate": 0.00017990822537299647, | |
| "logits/chosen": -0.7170388698577881, | |
| "logits/rejected": -0.8259367942810059, | |
| "logps/chosen": -6.029257774353027, | |
| "logps/rejected": -34.971519470214844, | |
| "loss": 0.7846373915672302, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31968259811401367, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.002697870135307312, | |
| "rewards/margins": 1.6093158721923828, | |
| "rewards/rejected": -1.612013816833496, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.4928048472607927, | |
| "grad_norm": 3.57047176361084, | |
| "learning_rate": 0.00017970684396664813, | |
| "logits/chosen": -0.7720434069633484, | |
| "logits/rejected": -0.9465057253837585, | |
| "logps/chosen": -3.873821258544922, | |
| "logps/rejected": -37.18175506591797, | |
| "loss": 0.8110936284065247, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.44118532538414, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19488100707530975, | |
| "rewards/margins": 1.9362576007843018, | |
| "rewards/rejected": -1.741376519203186, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.021284 | |
| }, | |
| { | |
| "epoch": 0.4948245392577632, | |
| "grad_norm": 5.007617473602295, | |
| "learning_rate": 0.0001795045722544083, | |
| "logits/chosen": -0.7931674122810364, | |
| "logits/rejected": -0.8741809129714966, | |
| "logps/chosen": -1.8064591884613037, | |
| "logps/rejected": -22.11163330078125, | |
| "loss": 0.6888466477394104, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31985488533973694, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28564998507499695, | |
| "rewards/margins": 1.2898226976394653, | |
| "rewards/rejected": -1.0041728019714355, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.021285 | |
| }, | |
| { | |
| "epoch": 0.49684423125473365, | |
| "grad_norm": 6.91418981552124, | |
| "learning_rate": 0.00017930141249560233, | |
| "logits/chosen": -0.8298520445823669, | |
| "logits/rejected": -0.9262869358062744, | |
| "logps/chosen": -1.8928561210632324, | |
| "logps/rejected": -22.42644691467285, | |
| "loss": 0.5054484605789185, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17920702695846558, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.19144940376281738, | |
| "rewards/margins": 1.3705973625183105, | |
| "rewards/rejected": -1.1791479587554932, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.021286 | |
| }, | |
| { | |
| "epoch": 0.4988639232517041, | |
| "grad_norm": 5.468963146209717, | |
| "learning_rate": 0.00017909736695947485, | |
| "logits/chosen": -0.8126583695411682, | |
| "logits/rejected": -0.9218447804450989, | |
| "logps/chosen": -5.573441982269287, | |
| "logps/rejected": -31.411596298217773, | |
| "loss": 0.640342652797699, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2689912021160126, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.249068945646286, | |
| "rewards/margins": 1.9487626552581787, | |
| "rewards/rejected": -1.6996936798095703, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.5008836152486745, | |
| "grad_norm": 5.13163423538208, | |
| "learning_rate": 0.0001788924379251645, | |
| "logits/chosen": -0.6676142811775208, | |
| "logits/rejected": -0.7854112982749939, | |
| "logps/chosen": -5.0913262367248535, | |
| "logps/rejected": -33.67715835571289, | |
| "loss": 0.6214959621429443, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30665862560272217, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09342917054891586, | |
| "rewards/margins": 2.036255121231079, | |
| "rewards/rejected": -1.9428261518478394, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.502903307245645, | |
| "grad_norm": 5.3085246086120605, | |
| "learning_rate": 0.00017868662768167828, | |
| "logits/chosen": -0.8283058404922485, | |
| "logits/rejected": -0.8981807827949524, | |
| "logps/chosen": -3.5498528480529785, | |
| "logps/rejected": -25.92713737487793, | |
| "loss": 0.8023664355278015, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3884091079235077, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.14035727083683014, | |
| "rewards/margins": 1.476125717163086, | |
| "rewards/rejected": -1.335768461227417, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.021287 | |
| }, | |
| { | |
| "epoch": 0.5049229992426155, | |
| "grad_norm": 3.970473051071167, | |
| "learning_rate": 0.0001784799385278661, | |
| "logits/chosen": -0.7480765581130981, | |
| "logits/rejected": -0.850541889667511, | |
| "logps/chosen": -2.1585793495178223, | |
| "logps/rejected": -25.883459091186523, | |
| "loss": 0.5557476878166199, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23389576375484467, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27245235443115234, | |
| "rewards/margins": 1.5237624645233154, | |
| "rewards/rejected": -1.2513102293014526, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.021288 | |
| }, | |
| { | |
| "epoch": 0.506942691239586, | |
| "grad_norm": 2.7458653450012207, | |
| "learning_rate": 0.00017827237277239514, | |
| "logits/chosen": -0.7085766792297363, | |
| "logits/rejected": -0.8612480163574219, | |
| "logps/chosen": -1.5254360437393188, | |
| "logps/rejected": -41.573387145996094, | |
| "loss": 0.4261833429336548, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20671844482421875, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23911702632904053, | |
| "rewards/margins": 2.4618849754333496, | |
| "rewards/rejected": -2.2227678298950195, | |
| "step": 251, | |
| "train_speed(iter/s)": 0.021259 | |
| }, | |
| { | |
| "epoch": 0.5089623832365564, | |
| "grad_norm": 4.110019207000732, | |
| "learning_rate": 0.00017806393273372395, | |
| "logits/chosen": -0.6960774064064026, | |
| "logits/rejected": -0.773073673248291, | |
| "logps/chosen": -5.731773376464844, | |
| "logps/rejected": -40.48484420776367, | |
| "loss": 0.6885837912559509, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.38311967253685, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13538384437561035, | |
| "rewards/margins": 2.754824638366699, | |
| "rewards/rejected": -2.619440793991089, | |
| "step": 252, | |
| "train_speed(iter/s)": 0.021259 | |
| }, | |
| { | |
| "epoch": 0.5109820752335269, | |
| "grad_norm": 2.490933656692505, | |
| "learning_rate": 0.0001778546207400766, | |
| "logits/chosen": -0.7139323353767395, | |
| "logits/rejected": -0.8478928208351135, | |
| "logps/chosen": -2.643089771270752, | |
| "logps/rejected": -49.735321044921875, | |
| "loss": 0.4857577383518219, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20252788066864014, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2547016441822052, | |
| "rewards/margins": 3.3733713626861572, | |
| "rewards/rejected": -3.1186697483062744, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.021258 | |
| }, | |
| { | |
| "epoch": 0.5130017672304974, | |
| "grad_norm": 1.8276517391204834, | |
| "learning_rate": 0.00017764443912941672, | |
| "logits/chosen": -0.8284695148468018, | |
| "logits/rejected": -0.9083284735679626, | |
| "logps/chosen": -0.5445702075958252, | |
| "logps/rejected": -36.77948760986328, | |
| "loss": 0.3219444751739502, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.10567262023687363, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28718090057373047, | |
| "rewards/margins": 2.473656415939331, | |
| "rewards/rejected": -2.1864752769470215, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.021259 | |
| }, | |
| { | |
| "epoch": 0.5150214592274678, | |
| "grad_norm": 1.7103385925292969, | |
| "learning_rate": 0.00017743339024942135, | |
| "logits/chosen": -0.8364546298980713, | |
| "logits/rejected": -0.9355967044830322, | |
| "logps/chosen": -1.8402678966522217, | |
| "logps/rejected": -41.97530746459961, | |
| "loss": 0.3561093807220459, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15152454376220703, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3776871860027313, | |
| "rewards/margins": 3.4742887020111084, | |
| "rewards/rejected": -3.096601963043213, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.02126 | |
| }, | |
| { | |
| "epoch": 0.5170411512244383, | |
| "grad_norm": 5.862149238586426, | |
| "learning_rate": 0.00017722147645745468, | |
| "logits/chosen": -0.8007981777191162, | |
| "logits/rejected": -0.9000130891799927, | |
| "logps/chosen": -4.51971435546875, | |
| "logps/rejected": -49.85738754272461, | |
| "loss": 0.6844031810760498, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23998194932937622, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.11539852619171143, | |
| "rewards/margins": 3.546253204345703, | |
| "rewards/rejected": -3.661651849746704, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.021261 | |
| }, | |
| { | |
| "epoch": 0.5190608432214088, | |
| "grad_norm": 23.92522621154785, | |
| "learning_rate": 0.0001770087001205418, | |
| "logits/chosen": -0.7442535161972046, | |
| "logits/rejected": -0.8944082260131836, | |
| "logps/chosen": -5.961298942565918, | |
| "logps/rejected": -71.44552612304688, | |
| "loss": 1.19035804271698, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7366040945053101, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.2813420295715332, | |
| "rewards/margins": 4.797372817993164, | |
| "rewards/rejected": -5.078714847564697, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.021261 | |
| }, | |
| { | |
| "epoch": 0.5210805352183792, | |
| "grad_norm": 9.221707344055176, | |
| "learning_rate": 0.00017679506361534215, | |
| "logits/chosen": -0.8309729099273682, | |
| "logits/rejected": -0.9244940280914307, | |
| "logps/chosen": -3.6046130657196045, | |
| "logps/rejected": -38.451324462890625, | |
| "loss": 1.0726348161697388, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5696147084236145, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.056192442774772644, | |
| "rewards/margins": 2.7530393600463867, | |
| "rewards/rejected": -2.6968469619750977, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.021262 | |
| }, | |
| { | |
| "epoch": 0.5231002272153497, | |
| "grad_norm": 3.6904711723327637, | |
| "learning_rate": 0.0001765805693281231, | |
| "logits/chosen": -0.7574508786201477, | |
| "logits/rejected": -0.8763286471366882, | |
| "logps/chosen": -1.6263139247894287, | |
| "logps/rejected": -46.19388198852539, | |
| "loss": 0.5760003328323364, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.32455456256866455, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.25203612446784973, | |
| "rewards/margins": 3.3660078048706055, | |
| "rewards/rejected": -3.1139719486236572, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.5251199192123202, | |
| "grad_norm": 6.571902751922607, | |
| "learning_rate": 0.00017636521965473323, | |
| "logits/chosen": -0.7622162103652954, | |
| "logits/rejected": -0.8849962949752808, | |
| "logps/chosen": -3.6163456439971924, | |
| "logps/rejected": -57.187339782714844, | |
| "loss": 0.513578474521637, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.28239667415618896, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.26628056168556213, | |
| "rewards/margins": 4.149145603179932, | |
| "rewards/rejected": -3.8828649520874023, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.021263 | |
| }, | |
| { | |
| "epoch": 0.5271396112092905, | |
| "grad_norm": 3.009442090988159, | |
| "learning_rate": 0.00017614901700057552, | |
| "logits/chosen": -0.7535040974617004, | |
| "logits/rejected": -0.8197404146194458, | |
| "logps/chosen": -1.611877679824829, | |
| "logps/rejected": -36.75214767456055, | |
| "loss": 0.4263669550418854, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1808186173439026, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.355543851852417, | |
| "rewards/margins": 2.128063678741455, | |
| "rewards/rejected": -1.7725193500518799, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.021264 | |
| }, | |
| { | |
| "epoch": 0.529159303206261, | |
| "grad_norm": 10.684004783630371, | |
| "learning_rate": 0.0001759319637805806, | |
| "logits/chosen": -0.7372271418571472, | |
| "logits/rejected": -0.8281789422035217, | |
| "logps/chosen": -1.6989682912826538, | |
| "logps/rejected": -33.11771011352539, | |
| "loss": 0.5836552381515503, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24641528725624084, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.42360562086105347, | |
| "rewards/margins": 2.2778561115264893, | |
| "rewards/rejected": -1.8542505502700806, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.5311789952032315, | |
| "grad_norm": 4.7525248527526855, | |
| "learning_rate": 0.00017571406241917968, | |
| "logits/chosen": -0.7032569646835327, | |
| "logits/rejected": -0.8048897385597229, | |
| "logps/chosen": -3.0269763469696045, | |
| "logps/rejected": -29.489608764648438, | |
| "loss": 0.5058411359786987, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19841410219669342, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.27225935459136963, | |
| "rewards/margins": 2.0580902099609375, | |
| "rewards/rejected": -1.7858312129974365, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.5331986872002019, | |
| "grad_norm": 2.464600086212158, | |
| "learning_rate": 0.0001754953153502775, | |
| "logits/chosen": -0.6921654939651489, | |
| "logits/rejected": -0.8245174288749695, | |
| "logps/chosen": -1.2894872426986694, | |
| "logps/rejected": -41.8453369140625, | |
| "loss": 0.36821237206459045, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.10888063907623291, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.26967915892601013, | |
| "rewards/margins": 2.722353458404541, | |
| "rewards/rejected": -2.452674150466919, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.021265 | |
| }, | |
| { | |
| "epoch": 0.5352183791971724, | |
| "grad_norm": 3.666675329208374, | |
| "learning_rate": 0.00017527572501722512, | |
| "logits/chosen": -0.6526811718940735, | |
| "logits/rejected": -0.8120133876800537, | |
| "logps/chosen": -5.671820640563965, | |
| "logps/rejected": -57.84872055053711, | |
| "loss": 0.6365722417831421, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.44796761870384216, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.04257254675030708, | |
| "rewards/margins": 3.3321990966796875, | |
| "rewards/rejected": -3.289626121520996, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.5372380711941429, | |
| "grad_norm": 5.50975227355957, | |
| "learning_rate": 0.00017505529387279277, | |
| "logits/chosen": -0.7191404104232788, | |
| "logits/rejected": -0.7549193501472473, | |
| "logps/chosen": -11.20957088470459, | |
| "logps/rejected": -24.620988845825195, | |
| "loss": 0.8978201746940613, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3969779908657074, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.3098965585231781, | |
| "rewards/margins": 1.0103328227996826, | |
| "rewards/rejected": -1.320229411125183, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.5392577631911134, | |
| "grad_norm": 9.796467781066895, | |
| "learning_rate": 0.0001748340243791422, | |
| "logits/chosen": -0.6914748549461365, | |
| "logits/rejected": -0.8334357738494873, | |
| "logps/chosen": -5.802427291870117, | |
| "logps/rejected": -41.96017074584961, | |
| "loss": 0.6360026597976685, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3448495864868164, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2543778419494629, | |
| "rewards/margins": 2.576064348220825, | |
| "rewards/rejected": -2.321686267852783, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.021266 | |
| }, | |
| { | |
| "epoch": 0.5412774551880838, | |
| "grad_norm": 4.284933567047119, | |
| "learning_rate": 0.00017461191900779936, | |
| "logits/chosen": -0.713287353515625, | |
| "logits/rejected": -0.7692936658859253, | |
| "logps/chosen": -4.46176290512085, | |
| "logps/rejected": -30.945892333984375, | |
| "loss": 0.5797103047370911, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3343329429626465, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1580563336610794, | |
| "rewards/margins": 2.0286142826080322, | |
| "rewards/rejected": -1.8705579042434692, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.021267 | |
| }, | |
| { | |
| "epoch": 0.5432971471850543, | |
| "grad_norm": 3.172943353652954, | |
| "learning_rate": 0.00017438898023962679, | |
| "logits/chosen": -0.7907764911651611, | |
| "logits/rejected": -0.8711207509040833, | |
| "logps/chosen": -1.7791467905044556, | |
| "logps/rejected": -29.88024139404297, | |
| "loss": 0.33940574526786804, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14780378341674805, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2693939208984375, | |
| "rewards/margins": 2.3542535305023193, | |
| "rewards/rejected": -2.0848593711853027, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.021268 | |
| }, | |
| { | |
| "epoch": 0.5453168391820248, | |
| "grad_norm": 5.463645935058594, | |
| "learning_rate": 0.00017416521056479577, | |
| "logits/chosen": -0.7378922700881958, | |
| "logits/rejected": -0.8519225120544434, | |
| "logps/chosen": -5.347389221191406, | |
| "logps/rejected": -35.428524017333984, | |
| "loss": 0.6419250965118408, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.49513840675354004, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09582029283046722, | |
| "rewards/margins": 2.3689239025115967, | |
| "rewards/rejected": -2.2731034755706787, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.021269 | |
| }, | |
| { | |
| "epoch": 0.5473365311789952, | |
| "grad_norm": 2.791165828704834, | |
| "learning_rate": 0.00017394061248275872, | |
| "logits/chosen": -0.7984417080879211, | |
| "logits/rejected": -0.8422114849090576, | |
| "logps/chosen": -6.475491046905518, | |
| "logps/rejected": -26.260494232177734, | |
| "loss": 0.47203221917152405, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23484748601913452, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4524388909339905, | |
| "rewards/margins": 1.7292096614837646, | |
| "rewards/rejected": -1.2767709493637085, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.021269 | |
| }, | |
| { | |
| "epoch": 0.5493562231759657, | |
| "grad_norm": 2.7601311206817627, | |
| "learning_rate": 0.00017371518850222112, | |
| "logits/chosen": -0.7166031002998352, | |
| "logits/rejected": -0.8156049251556396, | |
| "logps/chosen": -1.3833684921264648, | |
| "logps/rejected": -45.072750091552734, | |
| "loss": 0.4653846323490143, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.185410737991333, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1616918444633484, | |
| "rewards/margins": 2.9714224338531494, | |
| "rewards/rejected": -2.8097305297851562, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.021269 | |
| }, | |
| { | |
| "epoch": 0.5513759151729362, | |
| "grad_norm": 4.9853434562683105, | |
| "learning_rate": 0.00017348894114111344, | |
| "logits/chosen": -0.7632589340209961, | |
| "logits/rejected": -0.7834702730178833, | |
| "logps/chosen": -5.120803356170654, | |
| "logps/rejected": -20.066801071166992, | |
| "loss": 0.7621564865112305, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.39412054419517517, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09666721522808075, | |
| "rewards/margins": 1.2335360050201416, | |
| "rewards/rejected": -1.1368687152862549, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.02127 | |
| }, | |
| { | |
| "epoch": 0.5533956071699065, | |
| "grad_norm": 6.144747734069824, | |
| "learning_rate": 0.00017326187292656333, | |
| "logits/chosen": -0.7423402070999146, | |
| "logits/rejected": -0.8353608846664429, | |
| "logps/chosen": -3.019026756286621, | |
| "logps/rejected": -38.725494384765625, | |
| "loss": 0.4919193685054779, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.29635170102119446, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20840522646903992, | |
| "rewards/margins": 2.5846292972564697, | |
| "rewards/rejected": -2.3762240409851074, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.021271 | |
| }, | |
| { | |
| "epoch": 0.555415299166877, | |
| "grad_norm": 5.072936058044434, | |
| "learning_rate": 0.00017303398639486695, | |
| "logits/chosen": -0.8050971627235413, | |
| "logits/rejected": -0.8979619741439819, | |
| "logps/chosen": -3.597996473312378, | |
| "logps/rejected": -38.68907165527344, | |
| "loss": 0.6185693144798279, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.36338648200035095, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04303528368473053, | |
| "rewards/margins": 2.610353946685791, | |
| "rewards/rejected": -2.567318916320801, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.021272 | |
| }, | |
| { | |
| "epoch": 0.5574349911638475, | |
| "grad_norm": 4.154740810394287, | |
| "learning_rate": 0.00017280528409146094, | |
| "logits/chosen": -0.8580950498580933, | |
| "logits/rejected": -0.9338577389717102, | |
| "logps/chosen": -1.9045888185501099, | |
| "logps/rejected": -29.787948608398438, | |
| "loss": 0.6412729024887085, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2939704358577728, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12071260064840317, | |
| "rewards/margins": 2.376711130142212, | |
| "rewards/rejected": -2.255998373031616, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.021272 | |
| }, | |
| { | |
| "epoch": 0.5594546831608179, | |
| "grad_norm": 4.429795265197754, | |
| "learning_rate": 0.00017257576857089397, | |
| "logits/chosen": -0.7823255658149719, | |
| "logits/rejected": -0.8295686841011047, | |
| "logps/chosen": -6.783672332763672, | |
| "logps/rejected": -42.67618942260742, | |
| "loss": 0.5918665528297424, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3899191915988922, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04123719036579132, | |
| "rewards/margins": 2.868664503097534, | |
| "rewards/rejected": -2.827427387237549, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.021273 | |
| }, | |
| { | |
| "epoch": 0.5614743751577884, | |
| "grad_norm": 3.5302765369415283, | |
| "learning_rate": 0.00017234544239679806, | |
| "logits/chosen": -0.7818064093589783, | |
| "logits/rejected": -0.8903212547302246, | |
| "logps/chosen": -1.2885193824768066, | |
| "logps/rejected": -25.56497573852539, | |
| "loss": 0.5648685693740845, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20888982713222504, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.252044677734375, | |
| "rewards/margins": 1.763919472694397, | |
| "rewards/rejected": -1.5118746757507324, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.5634940671547589, | |
| "grad_norm": 1.8682705163955688, | |
| "learning_rate": 0.0001721143081418601, | |
| "logits/chosen": -0.6173131465911865, | |
| "logits/rejected": -0.7885771989822388, | |
| "logps/chosen": -0.348890095949173, | |
| "logps/rejected": -61.137290954589844, | |
| "loss": 0.2171340137720108, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.0689445212483406, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4386233389377594, | |
| "rewards/margins": 4.034773826599121, | |
| "rewards/rejected": -3.5961508750915527, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.5655137591517294, | |
| "grad_norm": 1.9534425735473633, | |
| "learning_rate": 0.00017188236838779295, | |
| "logits/chosen": -0.6642014384269714, | |
| "logits/rejected": -0.8017529249191284, | |
| "logps/chosen": -1.7374509572982788, | |
| "logps/rejected": -56.20750427246094, | |
| "loss": 0.22880004346370697, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09635397791862488, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3913995027542114, | |
| "rewards/margins": 3.391270160675049, | |
| "rewards/rejected": -2.999870777130127, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.021273 | |
| }, | |
| { | |
| "epoch": 0.5675334511486998, | |
| "grad_norm": 6.31340217590332, | |
| "learning_rate": 0.0001716496257253068, | |
| "logits/chosen": -0.7913269996643066, | |
| "logits/rejected": -0.9220376014709473, | |
| "logps/chosen": -3.3653981685638428, | |
| "logps/rejected": -47.17043685913086, | |
| "loss": 0.7093809843063354, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.40024468302726746, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22013141214847565, | |
| "rewards/margins": 3.3141214847564697, | |
| "rewards/rejected": -3.0939903259277344, | |
| "step": 281, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.5695531431456703, | |
| "grad_norm": 2.4428505897521973, | |
| "learning_rate": 0.00017141608275408006, | |
| "logits/chosen": -0.8131429553031921, | |
| "logits/rejected": -0.9399922490119934, | |
| "logps/chosen": -1.98673415184021, | |
| "logps/rejected": -42.24494552612305, | |
| "loss": 0.4994111657142639, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2407137006521225, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18601495027542114, | |
| "rewards/margins": 2.6695024967193604, | |
| "rewards/rejected": -2.483487367630005, | |
| "step": 282, | |
| "train_speed(iter/s)": 0.021274 | |
| }, | |
| { | |
| "epoch": 0.5715728351426408, | |
| "grad_norm": 1.5563158988952637, | |
| "learning_rate": 0.0001711817420827305, | |
| "logits/chosen": -0.6783189177513123, | |
| "logits/rejected": -0.9088720083236694, | |
| "logps/chosen": -0.37805676460266113, | |
| "logps/rejected": -64.65815734863281, | |
| "loss": 0.18766579031944275, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.08086632192134857, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3040025234222412, | |
| "rewards/margins": 4.409641265869141, | |
| "rewards/rejected": -4.10563850402832, | |
| "step": 283, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.5735925271396112, | |
| "grad_norm": 7.082139015197754, | |
| "learning_rate": 0.00017094660632878582, | |
| "logits/chosen": -0.7040260434150696, | |
| "logits/rejected": -0.7696897387504578, | |
| "logps/chosen": -8.167627334594727, | |
| "logps/rejected": -38.17253112792969, | |
| "loss": 0.9717364311218262, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5700907111167908, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.012362787500023842, | |
| "rewards/margins": 2.3398733139038086, | |
| "rewards/rejected": -2.327510356903076, | |
| "step": 284, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.5756122191365817, | |
| "grad_norm": 5.067822456359863, | |
| "learning_rate": 0.00017071067811865476, | |
| "logits/chosen": -0.802982747554779, | |
| "logits/rejected": -0.8972690105438232, | |
| "logps/chosen": -2.8758363723754883, | |
| "logps/rejected": -46.713172912597656, | |
| "loss": 0.5463993549346924, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.284506618976593, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16443192958831787, | |
| "rewards/margins": 3.5550990104675293, | |
| "rewards/rejected": -3.3906667232513428, | |
| "step": 285, | |
| "train_speed(iter/s)": 0.021275 | |
| }, | |
| { | |
| "epoch": 0.5776319111335522, | |
| "grad_norm": 4.077809810638428, | |
| "learning_rate": 0.00017047396008759754, | |
| "logits/chosen": -0.8403116464614868, | |
| "logits/rejected": -0.8808307647705078, | |
| "logps/chosen": -6.7314581871032715, | |
| "logps/rejected": -30.9017333984375, | |
| "loss": 0.6438797116279602, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3068145215511322, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.03903551399707794, | |
| "rewards/margins": 1.8479769229888916, | |
| "rewards/rejected": -1.887012243270874, | |
| "step": 286, | |
| "train_speed(iter/s)": 0.021276 | |
| }, | |
| { | |
| "epoch": 0.5796516031305226, | |
| "grad_norm": 2.9939074516296387, | |
| "learning_rate": 0.00017023645487969645, | |
| "logits/chosen": -0.7674691081047058, | |
| "logits/rejected": -0.8917283415794373, | |
| "logps/chosen": -3.4815213680267334, | |
| "logps/rejected": -56.125099182128906, | |
| "loss": 0.29649537801742554, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15909157693386078, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16410662233829498, | |
| "rewards/margins": 4.206541061401367, | |
| "rewards/rejected": -4.042433738708496, | |
| "step": 287, | |
| "train_speed(iter/s)": 0.021276 | |
| }, | |
| { | |
| "epoch": 0.581671295127493, | |
| "grad_norm": 12.105512619018555, | |
| "learning_rate": 0.00016999816514782647, | |
| "logits/chosen": -0.7554559707641602, | |
| "logits/rejected": -0.8941792845726013, | |
| "logps/chosen": -6.372040271759033, | |
| "logps/rejected": -39.95315170288086, | |
| "loss": 1.1656122207641602, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6600521206855774, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.05390087515115738, | |
| "rewards/margins": 2.4357922077178955, | |
| "rewards/rejected": -2.4896934032440186, | |
| "step": 288, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.5836909871244635, | |
| "grad_norm": 5.215820789337158, | |
| "learning_rate": 0.0001697590935536254, | |
| "logits/chosen": -0.8481535911560059, | |
| "logits/rejected": -0.9250099062919617, | |
| "logps/chosen": -2.248663902282715, | |
| "logps/rejected": -45.463008880615234, | |
| "loss": 0.4629695415496826, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22682401537895203, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0752679854631424, | |
| "rewards/margins": 3.593411922454834, | |
| "rewards/rejected": -3.5181431770324707, | |
| "step": 289, | |
| "train_speed(iter/s)": 0.021278 | |
| }, | |
| { | |
| "epoch": 0.5857106791214339, | |
| "grad_norm": 7.402690887451172, | |
| "learning_rate": 0.00016951924276746425, | |
| "logits/chosen": -0.5944700241088867, | |
| "logits/rejected": -0.7739753723144531, | |
| "logps/chosen": -8.305325508117676, | |
| "logps/rejected": -56.55354690551758, | |
| "loss": 1.023478627204895, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5631112456321716, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.024727948009967804, | |
| "rewards/margins": 3.671443462371826, | |
| "rewards/rejected": -3.696171522140503, | |
| "step": 290, | |
| "train_speed(iter/s)": 0.021277 | |
| }, | |
| { | |
| "epoch": 0.5877303711184044, | |
| "grad_norm": 9.028773307800293, | |
| "learning_rate": 0.00016927861546841747, | |
| "logits/chosen": -0.827506959438324, | |
| "logits/rejected": -0.8843482136726379, | |
| "logps/chosen": -3.57808256149292, | |
| "logps/rejected": -27.147445678710938, | |
| "loss": 0.9430906772613525, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.36645135283470154, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07185473293066025, | |
| "rewards/margins": 1.882130742073059, | |
| "rewards/rejected": -1.810275912284851, | |
| "step": 291, | |
| "train_speed(iter/s)": 0.021278 | |
| }, | |
| { | |
| "epoch": 0.5897500631153749, | |
| "grad_norm": 3.0350229740142822, | |
| "learning_rate": 0.00016903721434423306, | |
| "logits/chosen": -0.9094471335411072, | |
| "logits/rejected": -0.9361112713813782, | |
| "logps/chosen": -2.4875197410583496, | |
| "logps/rejected": -24.18358612060547, | |
| "loss": 0.4315643012523651, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24477659165859222, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3049478530883789, | |
| "rewards/margins": 2.156770706176758, | |
| "rewards/rejected": -1.8518224954605103, | |
| "step": 292, | |
| "train_speed(iter/s)": 0.021279 | |
| }, | |
| { | |
| "epoch": 0.5917697551123454, | |
| "grad_norm": 4.291833877563477, | |
| "learning_rate": 0.0001687950420913022, | |
| "logits/chosen": -0.7475178241729736, | |
| "logits/rejected": -0.8380208015441895, | |
| "logps/chosen": -3.275129795074463, | |
| "logps/rejected": -32.63922882080078, | |
| "loss": 0.6617104411125183, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4119285047054291, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08241842687129974, | |
| "rewards/margins": 2.206611394882202, | |
| "rewards/rejected": -2.124192953109741, | |
| "step": 293, | |
| "train_speed(iter/s)": 0.02128 | |
| }, | |
| { | |
| "epoch": 0.5937894471093158, | |
| "grad_norm": 4.568887710571289, | |
| "learning_rate": 0.00016855210141462963, | |
| "logits/chosen": -0.7708112001419067, | |
| "logits/rejected": -0.8631462454795837, | |
| "logps/chosen": -2.731691837310791, | |
| "logps/rejected": -34.596675872802734, | |
| "loss": 0.5602784156799316, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3268437683582306, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27219781279563904, | |
| "rewards/margins": 2.2604424953460693, | |
| "rewards/rejected": -1.9882445335388184, | |
| "step": 294, | |
| "train_speed(iter/s)": 0.02128 | |
| }, | |
| { | |
| "epoch": 0.5958091391062863, | |
| "grad_norm": 4.01273250579834, | |
| "learning_rate": 0.0001683083950278031, | |
| "logits/chosen": -0.8505802750587463, | |
| "logits/rejected": -0.9058212637901306, | |
| "logps/chosen": -1.9776384830474854, | |
| "logps/rejected": -29.04343605041504, | |
| "loss": 0.5075977444648743, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.26625630259513855, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16404712200164795, | |
| "rewards/margins": 2.069391965866089, | |
| "rewards/rejected": -1.905344843864441, | |
| "step": 295, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.5978288311032568, | |
| "grad_norm": 2.308389186859131, | |
| "learning_rate": 0.00016806392565296311, | |
| "logits/chosen": -0.7509005665779114, | |
| "logits/rejected": -0.8670397996902466, | |
| "logps/chosen": -2.6714932918548584, | |
| "logps/rejected": -31.49539566040039, | |
| "loss": 0.4104999899864197, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14024530351161957, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3330576419830322, | |
| "rewards/margins": 1.9010692834854126, | |
| "rewards/rejected": -1.5680116415023804, | |
| "step": 296, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.5998485231002272, | |
| "grad_norm": 7.128021717071533, | |
| "learning_rate": 0.00016781869602077264, | |
| "logits/chosen": -0.7379200458526611, | |
| "logits/rejected": -0.8878840804100037, | |
| "logps/chosen": -3.651395320892334, | |
| "logps/rejected": -39.45635986328125, | |
| "loss": 0.8120747208595276, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.46895888447761536, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07825376093387604, | |
| "rewards/margins": 1.777091145515442, | |
| "rewards/rejected": -1.698837399482727, | |
| "step": 297, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.6018682150971977, | |
| "grad_norm": 3.926884651184082, | |
| "learning_rate": 0.00016757270887038654, | |
| "logits/chosen": -0.7688292264938354, | |
| "logits/rejected": -0.9089186191558838, | |
| "logps/chosen": -1.3693759441375732, | |
| "logps/rejected": -37.80522918701172, | |
| "loss": 0.4208237826824188, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17390652000904083, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1809903383255005, | |
| "rewards/margins": 2.1318840980529785, | |
| "rewards/rejected": -1.9508938789367676, | |
| "step": 298, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.6038879070941682, | |
| "grad_norm": 3.3669636249542236, | |
| "learning_rate": 0.00016732596694942083, | |
| "logits/chosen": -0.74614417552948, | |
| "logits/rejected": -0.8711810111999512, | |
| "logps/chosen": -4.000098705291748, | |
| "logps/rejected": -40.62786102294922, | |
| "loss": 0.5480436682701111, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23701626062393188, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11138585954904556, | |
| "rewards/margins": 1.9405393600463867, | |
| "rewards/rejected": -1.8291537761688232, | |
| "step": 299, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.6059075990911386, | |
| "grad_norm": 2.457587480545044, | |
| "learning_rate": 0.00016707847301392236, | |
| "logits/chosen": -0.8123277425765991, | |
| "logits/rejected": -0.9144627451896667, | |
| "logps/chosen": -4.013862133026123, | |
| "logps/rejected": -33.994991302490234, | |
| "loss": 0.5886133909225464, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31008380651474, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23923330008983612, | |
| "rewards/margins": 2.1191067695617676, | |
| "rewards/rejected": -1.879873514175415, | |
| "step": 300, | |
| "train_speed(iter/s)": 0.021282 | |
| }, | |
| { | |
| "epoch": 0.6059075990911386, | |
| "eval_logits/chosen": -0.8244539499282837, | |
| "eval_logits/rejected": -0.9301112294197083, | |
| "eval_logps/chosen": -2.4614338874816895, | |
| "eval_logps/rejected": -37.376708984375, | |
| "eval_loss": 0.5653835535049438, | |
| "eval_nll_loss": 0.26967209577560425, | |
| "eval_rewards/accuracies": 0.862500011920929, | |
| "eval_rewards/chosen": 0.19960978627204895, | |
| "eval_rewards/margins": 2.2363221645355225, | |
| "eval_rewards/rejected": -2.036712169647217, | |
| "eval_runtime": 92.5823, | |
| "eval_samples_per_second": 0.864, | |
| "eval_steps_per_second": 0.432, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.6079272910881091, | |
| "grad_norm": 1.4425960779190063, | |
| "learning_rate": 0.00016683022982833757, | |
| "logits/chosen": -0.9167453050613403, | |
| "logits/rejected": -0.9786884784698486, | |
| "logps/chosen": -0.2554780840873718, | |
| "logps/rejected": -30.395259857177734, | |
| "loss": 0.28913912177085876, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.056439101696014404, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2730258107185364, | |
| "rewards/margins": 2.289043664932251, | |
| "rewards/rejected": -2.0160179138183594, | |
| "step": 301, | |
| "train_speed(iter/s)": 0.021119 | |
| }, | |
| { | |
| "epoch": 0.6099469830850796, | |
| "grad_norm": 2.9968175888061523, | |
| "learning_rate": 0.00016658124016548197, | |
| "logits/chosen": -0.9765443801879883, | |
| "logits/rejected": -1.0245364904403687, | |
| "logps/chosen": -1.0650570392608643, | |
| "logps/rejected": -35.4031867980957, | |
| "loss": 0.43358710408210754, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18546591699123383, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2088906615972519, | |
| "rewards/margins": 2.796689748764038, | |
| "rewards/rejected": -2.587799310684204, | |
| "step": 302, | |
| "train_speed(iter/s)": 0.021121 | |
| }, | |
| { | |
| "epoch": 0.6119666750820499, | |
| "grad_norm": 4.542461395263672, | |
| "learning_rate": 0.000166331506806509, | |
| "logits/chosen": -0.9329476356506348, | |
| "logits/rejected": -1.0012348890304565, | |
| "logps/chosen": -2.2945432662963867, | |
| "logps/rejected": -31.613216400146484, | |
| "loss": 0.5403211116790771, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2446451485157013, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2515539526939392, | |
| "rewards/margins": 2.3975443840026855, | |
| "rewards/rejected": -2.1459906101226807, | |
| "step": 303, | |
| "train_speed(iter/s)": 0.021123 | |
| }, | |
| { | |
| "epoch": 0.6139863670790204, | |
| "grad_norm": 3.4531707763671875, | |
| "learning_rate": 0.00016608103254087906, | |
| "logits/chosen": -0.7963448762893677, | |
| "logits/rejected": -0.9296629428863525, | |
| "logps/chosen": -3.21559476852417, | |
| "logps/rejected": -49.27157211303711, | |
| "loss": 0.5262452363967896, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2854577302932739, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08577384054660797, | |
| "rewards/margins": 3.5433404445648193, | |
| "rewards/rejected": -3.457566261291504, | |
| "step": 304, | |
| "train_speed(iter/s)": 0.021123 | |
| }, | |
| { | |
| "epoch": 0.6160060590759909, | |
| "grad_norm": 5.113759994506836, | |
| "learning_rate": 0.00016582982016632818, | |
| "logits/chosen": -0.7916707396507263, | |
| "logits/rejected": -0.934760570526123, | |
| "logps/chosen": -2.8785698413848877, | |
| "logps/rejected": -56.01650619506836, | |
| "loss": 0.6735590100288391, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.42455944418907166, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24037745594978333, | |
| "rewards/margins": 3.957566261291504, | |
| "rewards/rejected": -3.717188835144043, | |
| "step": 305, | |
| "train_speed(iter/s)": 0.021124 | |
| }, | |
| { | |
| "epoch": 0.6180257510729614, | |
| "grad_norm": 1.8782538175582886, | |
| "learning_rate": 0.00016557787248883696, | |
| "logits/chosen": -0.8707424402236938, | |
| "logits/rejected": -0.9912842512130737, | |
| "logps/chosen": -1.2852058410644531, | |
| "logps/rejected": -55.1501579284668, | |
| "loss": 0.26773229241371155, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11378525197505951, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.32057979702949524, | |
| "rewards/margins": 4.313370227813721, | |
| "rewards/rejected": -3.992790460586548, | |
| "step": 306, | |
| "train_speed(iter/s)": 0.021124 | |
| }, | |
| { | |
| "epoch": 0.6200454430699318, | |
| "grad_norm": 12.83481216430664, | |
| "learning_rate": 0.00016532519232259916, | |
| "logits/chosen": -0.8531877398490906, | |
| "logits/rejected": -0.9290578365325928, | |
| "logps/chosen": -3.8104918003082275, | |
| "logps/rejected": -58.618621826171875, | |
| "loss": 0.3679554760456085, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2755557596683502, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2785298526287079, | |
| "rewards/margins": 4.633764743804932, | |
| "rewards/rejected": -4.355234622955322, | |
| "step": 307, | |
| "train_speed(iter/s)": 0.021125 | |
| }, | |
| { | |
| "epoch": 0.6220651350669023, | |
| "grad_norm": 3.644946336746216, | |
| "learning_rate": 0.00016507178248999024, | |
| "logits/chosen": -0.8718377947807312, | |
| "logits/rejected": -1.0232672691345215, | |
| "logps/chosen": -1.1764187812805176, | |
| "logps/rejected": -66.40010070800781, | |
| "loss": 0.4798681139945984, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2249489575624466, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23639193177223206, | |
| "rewards/margins": 4.824877738952637, | |
| "rewards/rejected": -4.5884857177734375, | |
| "step": 308, | |
| "train_speed(iter/s)": 0.021126 | |
| }, | |
| { | |
| "epoch": 0.6240848270638728, | |
| "grad_norm": 3.6663687229156494, | |
| "learning_rate": 0.00016481764582153586, | |
| "logits/chosen": -0.8408634066581726, | |
| "logits/rejected": -0.9267845153808594, | |
| "logps/chosen": -4.433281898498535, | |
| "logps/rejected": -32.701011657714844, | |
| "loss": 0.47992053627967834, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.21022652089595795, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5157691240310669, | |
| "rewards/margins": 2.2275538444519043, | |
| "rewards/rejected": -1.7117843627929688, | |
| "step": 309, | |
| "train_speed(iter/s)": 0.021127 | |
| }, | |
| { | |
| "epoch": 0.6261045190608432, | |
| "grad_norm": 8.538496017456055, | |
| "learning_rate": 0.00016456278515588024, | |
| "logits/chosen": -0.8827572464942932, | |
| "logits/rejected": -0.9595881700515747, | |
| "logps/chosen": -5.372483253479004, | |
| "logps/rejected": -43.774436950683594, | |
| "loss": 0.74099200963974, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4238053560256958, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08053889870643616, | |
| "rewards/margins": 2.704007148742676, | |
| "rewards/rejected": -2.6234686374664307, | |
| "step": 310, | |
| "train_speed(iter/s)": 0.021128 | |
| }, | |
| { | |
| "epoch": 0.6281242110578137, | |
| "grad_norm": 3.513566493988037, | |
| "learning_rate": 0.00016430720333975452, | |
| "logits/chosen": -0.8878616094589233, | |
| "logits/rejected": -0.9629725217819214, | |
| "logps/chosen": -2.4065513610839844, | |
| "logps/rejected": -43.71923065185547, | |
| "loss": 0.4641585052013397, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2343730330467224, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1930648535490036, | |
| "rewards/margins": 3.418928623199463, | |
| "rewards/rejected": -3.2258636951446533, | |
| "step": 311, | |
| "train_speed(iter/s)": 0.021129 | |
| }, | |
| { | |
| "epoch": 0.6301439030547842, | |
| "grad_norm": 6.264689922332764, | |
| "learning_rate": 0.00016405090322794483, | |
| "logits/chosen": -0.9043357968330383, | |
| "logits/rejected": -0.9985758066177368, | |
| "logps/chosen": -2.7129530906677246, | |
| "logps/rejected": -41.665489196777344, | |
| "loss": 0.6599389910697937, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3321758210659027, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.17053501307964325, | |
| "rewards/margins": 2.564326047897339, | |
| "rewards/rejected": -2.3937911987304688, | |
| "step": 312, | |
| "train_speed(iter/s)": 0.021131 | |
| }, | |
| { | |
| "epoch": 0.6321635950517546, | |
| "grad_norm": 22.02393913269043, | |
| "learning_rate": 0.00016379388768326063, | |
| "logits/chosen": -0.8338424563407898, | |
| "logits/rejected": -0.9313662052154541, | |
| "logps/chosen": -4.164543151855469, | |
| "logps/rejected": -50.46995544433594, | |
| "loss": 1.0124552249908447, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6529191732406616, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.016213715076446533, | |
| "rewards/margins": 3.471205949783325, | |
| "rewards/rejected": -3.4549922943115234, | |
| "step": 313, | |
| "train_speed(iter/s)": 0.021131 | |
| }, | |
| { | |
| "epoch": 0.6341832870487251, | |
| "grad_norm": 10.904000282287598, | |
| "learning_rate": 0.00016353615957650236, | |
| "logits/chosen": -0.7540192008018494, | |
| "logits/rejected": -0.8433898687362671, | |
| "logps/chosen": -10.264131546020508, | |
| "logps/rejected": -41.65949630737305, | |
| "loss": 0.5326629877090454, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.239348366856575, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.253826379776001, | |
| "rewards/margins": 2.7431883811950684, | |
| "rewards/rejected": -2.4893617630004883, | |
| "step": 314, | |
| "train_speed(iter/s)": 0.021131 | |
| }, | |
| { | |
| "epoch": 0.6362029790456956, | |
| "grad_norm": 3.1705944538116455, | |
| "learning_rate": 0.00016327772178642986, | |
| "logits/chosen": -0.9517133831977844, | |
| "logits/rejected": -1.0139639377593994, | |
| "logps/chosen": -0.973305344581604, | |
| "logps/rejected": -38.540000915527344, | |
| "loss": 0.3936949670314789, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1697213351726532, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20970085263252258, | |
| "rewards/margins": 3.3330564498901367, | |
| "rewards/rejected": -3.1233556270599365, | |
| "step": 315, | |
| "train_speed(iter/s)": 0.021133 | |
| }, | |
| { | |
| "epoch": 0.638222671042666, | |
| "grad_norm": 5.624232769012451, | |
| "learning_rate": 0.00016301857719972976, | |
| "logits/chosen": -0.8001008629798889, | |
| "logits/rejected": -0.8618478775024414, | |
| "logps/chosen": -1.4323068857192993, | |
| "logps/rejected": -35.56591033935547, | |
| "loss": 0.4376400411128998, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14159713685512543, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20484629273414612, | |
| "rewards/margins": 2.43072247505188, | |
| "rewards/rejected": -2.2258763313293457, | |
| "step": 316, | |
| "train_speed(iter/s)": 0.021134 | |
| }, | |
| { | |
| "epoch": 0.6402423630396364, | |
| "grad_norm": 7.583630561828613, | |
| "learning_rate": 0.0001627587287109836, | |
| "logits/chosen": -0.8299413919448853, | |
| "logits/rejected": -0.9769677519798279, | |
| "logps/chosen": -3.7215254306793213, | |
| "logps/rejected": -60.84526062011719, | |
| "loss": 0.5378049612045288, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.32689476013183594, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.025372333824634552, | |
| "rewards/margins": 4.722233295440674, | |
| "rewards/rejected": -4.6968607902526855, | |
| "step": 317, | |
| "train_speed(iter/s)": 0.021135 | |
| }, | |
| { | |
| "epoch": 0.6422620550366069, | |
| "grad_norm": 8.251932144165039, | |
| "learning_rate": 0.00016249817922263517, | |
| "logits/chosen": -0.8568125367164612, | |
| "logits/rejected": -0.931611955165863, | |
| "logps/chosen": -5.391039848327637, | |
| "logps/rejected": -45.42852020263672, | |
| "loss": 0.5377641916275024, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.29841428995132446, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.31022340059280396, | |
| "rewards/margins": 3.579132080078125, | |
| "rewards/rejected": -3.268908977508545, | |
| "step": 318, | |
| "train_speed(iter/s)": 0.021135 | |
| }, | |
| { | |
| "epoch": 0.6442817470335774, | |
| "grad_norm": 4.026428699493408, | |
| "learning_rate": 0.00016223693164495835, | |
| "logits/chosen": -0.77679044008255, | |
| "logits/rejected": -0.8818118572235107, | |
| "logps/chosen": -5.223626136779785, | |
| "logps/rejected": -46.39476013183594, | |
| "loss": 0.5932655930519104, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30503058433532715, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.009123122319579124, | |
| "rewards/margins": 3.3854122161865234, | |
| "rewards/rejected": -3.3945353031158447, | |
| "step": 319, | |
| "train_speed(iter/s)": 0.021136 | |
| }, | |
| { | |
| "epoch": 0.6463014390305478, | |
| "grad_norm": 3.859316110610962, | |
| "learning_rate": 0.00016197498889602448, | |
| "logits/chosen": -0.9226962924003601, | |
| "logits/rejected": -0.984259843826294, | |
| "logps/chosen": -0.3310558497905731, | |
| "logps/rejected": -39.15312576293945, | |
| "loss": 0.21047677099704742, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.053509388118982315, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37339526414871216, | |
| "rewards/margins": 3.054718494415283, | |
| "rewards/rejected": -2.681323289871216, | |
| "step": 320, | |
| "train_speed(iter/s)": 0.021137 | |
| }, | |
| { | |
| "epoch": 0.6483211310275183, | |
| "grad_norm": 4.3604888916015625, | |
| "learning_rate": 0.00016171235390166985, | |
| "logits/chosen": -0.9235320687294006, | |
| "logits/rejected": -0.9902734160423279, | |
| "logps/chosen": -2.538111448287964, | |
| "logps/rejected": -48.80242156982422, | |
| "loss": 0.5195378661155701, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23220032453536987, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.17571590840816498, | |
| "rewards/margins": 3.9404807090759277, | |
| "rewards/rejected": -3.7647647857666016, | |
| "step": 321, | |
| "train_speed(iter/s)": 0.021138 | |
| }, | |
| { | |
| "epoch": 0.6503408230244888, | |
| "grad_norm": 9.97143268585205, | |
| "learning_rate": 0.00016144902959546286, | |
| "logits/chosen": -0.9121385216712952, | |
| "logits/rejected": -0.9658838510513306, | |
| "logps/chosen": -5.540125846862793, | |
| "logps/rejected": -45.613990783691406, | |
| "loss": 0.8853093385696411, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.35688427090644836, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.05821647495031357, | |
| "rewards/margins": 3.1649882793426514, | |
| "rewards/rejected": -3.2232048511505127, | |
| "step": 322, | |
| "train_speed(iter/s)": 0.021139 | |
| }, | |
| { | |
| "epoch": 0.6523605150214592, | |
| "grad_norm": 4.8883819580078125, | |
| "learning_rate": 0.0001611850189186714, | |
| "logits/chosen": -0.9210085868835449, | |
| "logits/rejected": -0.9733687043190002, | |
| "logps/chosen": -4.037269592285156, | |
| "logps/rejected": -41.21742630004883, | |
| "loss": 0.5509124398231506, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.32746627926826477, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21709240972995758, | |
| "rewards/margins": 3.416368246078491, | |
| "rewards/rejected": -3.199275493621826, | |
| "step": 323, | |
| "train_speed(iter/s)": 0.02114 | |
| }, | |
| { | |
| "epoch": 0.6543802070184297, | |
| "grad_norm": 2.4553871154785156, | |
| "learning_rate": 0.00016092032482023, | |
| "logits/chosen": -0.9412962794303894, | |
| "logits/rejected": -1.0209475755691528, | |
| "logps/chosen": -0.632290244102478, | |
| "logps/rejected": -33.6468505859375, | |
| "loss": 0.23645614087581635, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.07834430038928986, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.43455106019973755, | |
| "rewards/margins": 3.022073745727539, | |
| "rewards/rejected": -2.587522506713867, | |
| "step": 324, | |
| "train_speed(iter/s)": 0.021142 | |
| }, | |
| { | |
| "epoch": 0.6563998990154002, | |
| "grad_norm": 2.446058511734009, | |
| "learning_rate": 0.00016065495025670675, | |
| "logits/chosen": -0.8765738606452942, | |
| "logits/rejected": -0.9390391111373901, | |
| "logps/chosen": -5.492425918579102, | |
| "logps/rejected": -34.9351692199707, | |
| "loss": 0.5046104788780212, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34279099106788635, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22330977022647858, | |
| "rewards/margins": 2.7527146339416504, | |
| "rewards/rejected": -2.529404878616333, | |
| "step": 325, | |
| "train_speed(iter/s)": 0.021143 | |
| }, | |
| { | |
| "epoch": 0.6584195910123706, | |
| "grad_norm": 18.5092716217041, | |
| "learning_rate": 0.00016038889819227045, | |
| "logits/chosen": -0.8468933701515198, | |
| "logits/rejected": -0.9487016201019287, | |
| "logps/chosen": -1.3551874160766602, | |
| "logps/rejected": -38.7204475402832, | |
| "loss": 0.4489996135234833, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2548639476299286, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3463600277900696, | |
| "rewards/margins": 2.8273019790649414, | |
| "rewards/rejected": -2.4809420108795166, | |
| "step": 326, | |
| "train_speed(iter/s)": 0.021144 | |
| }, | |
| { | |
| "epoch": 0.6604392830093411, | |
| "grad_norm": 6.140425682067871, | |
| "learning_rate": 0.00016012217159865739, | |
| "logits/chosen": -0.8302001357078552, | |
| "logits/rejected": -0.924152135848999, | |
| "logps/chosen": -3.6062324047088623, | |
| "logps/rejected": -56.65538787841797, | |
| "loss": 0.784902811050415, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3868030309677124, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.006980091333389282, | |
| "rewards/margins": 3.1850905418395996, | |
| "rewards/rejected": -3.178110122680664, | |
| "step": 327, | |
| "train_speed(iter/s)": 0.021144 | |
| }, | |
| { | |
| "epoch": 0.6624589750063116, | |
| "grad_norm": 2.915184259414673, | |
| "learning_rate": 0.00015985477345513817, | |
| "logits/chosen": -0.7988994121551514, | |
| "logits/rejected": -0.9357851147651672, | |
| "logps/chosen": -5.732859134674072, | |
| "logps/rejected": -39.42655944824219, | |
| "loss": 0.347720742225647, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.16449037194252014, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23062925040721893, | |
| "rewards/margins": 2.8876638412475586, | |
| "rewards/rejected": -2.6570348739624023, | |
| "step": 328, | |
| "train_speed(iter/s)": 0.021145 | |
| }, | |
| { | |
| "epoch": 0.664478667003282, | |
| "grad_norm": 7.8771162033081055, | |
| "learning_rate": 0.00015958670674848442, | |
| "logits/chosen": -0.857587456703186, | |
| "logits/rejected": -0.9888629913330078, | |
| "logps/chosen": -6.550410270690918, | |
| "logps/rejected": -41.466896057128906, | |
| "loss": 0.709037184715271, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.40757060050964355, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.43693459033966064, | |
| "rewards/margins": 2.189579486846924, | |
| "rewards/rejected": -1.7526450157165527, | |
| "step": 329, | |
| "train_speed(iter/s)": 0.021145 | |
| }, | |
| { | |
| "epoch": 0.6664983590002524, | |
| "grad_norm": 19.00602149963379, | |
| "learning_rate": 0.00015931797447293552, | |
| "logits/chosen": -0.8882402181625366, | |
| "logits/rejected": -0.9668765068054199, | |
| "logps/chosen": -3.752054214477539, | |
| "logps/rejected": -34.47447204589844, | |
| "loss": 0.6838876605033875, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4321058392524719, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22359441220760345, | |
| "rewards/margins": 2.5547034740448, | |
| "rewards/rejected": -2.331109046936035, | |
| "step": 330, | |
| "train_speed(iter/s)": 0.021146 | |
| }, | |
| { | |
| "epoch": 0.668518050997223, | |
| "grad_norm": 1.7641230821609497, | |
| "learning_rate": 0.00015904857963016506, | |
| "logits/chosen": -0.7825491428375244, | |
| "logits/rejected": -0.9280312061309814, | |
| "logps/chosen": -0.6239898204803467, | |
| "logps/rejected": -43.15408706665039, | |
| "loss": 0.24098820984363556, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09237208962440491, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2947159707546234, | |
| "rewards/margins": 3.279745578765869, | |
| "rewards/rejected": -2.985029697418213, | |
| "step": 331, | |
| "train_speed(iter/s)": 0.021146 | |
| }, | |
| { | |
| "epoch": 0.6705377429941933, | |
| "grad_norm": 2.2421019077301025, | |
| "learning_rate": 0.00015877852522924732, | |
| "logits/chosen": -0.8130238652229309, | |
| "logits/rejected": -0.9327349662780762, | |
| "logps/chosen": -0.8687487244606018, | |
| "logps/rejected": -47.515663146972656, | |
| "loss": 0.2235592156648636, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09912680834531784, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2986675500869751, | |
| "rewards/margins": 3.4509923458099365, | |
| "rewards/rejected": -3.152324914932251, | |
| "step": 332, | |
| "train_speed(iter/s)": 0.021147 | |
| }, | |
| { | |
| "epoch": 0.6725574349911638, | |
| "grad_norm": 8.463959693908691, | |
| "learning_rate": 0.0001585078142866237, | |
| "logits/chosen": -0.8485694527626038, | |
| "logits/rejected": -0.9816790819168091, | |
| "logps/chosen": -4.081976890563965, | |
| "logps/rejected": -34.49391174316406, | |
| "loss": 0.8111600279808044, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5827361941337585, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.010378856211900711, | |
| "rewards/margins": 2.1897881031036377, | |
| "rewards/rejected": -2.1794090270996094, | |
| "step": 333, | |
| "train_speed(iter/s)": 0.021149 | |
| }, | |
| { | |
| "epoch": 0.6745771269881343, | |
| "grad_norm": 3.4926505088806152, | |
| "learning_rate": 0.00015823644982606905, | |
| "logits/chosen": -0.9417222142219543, | |
| "logits/rejected": -1.0309451818466187, | |
| "logps/chosen": -0.7485335469245911, | |
| "logps/rejected": -33.3504524230957, | |
| "loss": 0.307941198348999, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09651970863342285, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.388710618019104, | |
| "rewards/margins": 2.98738956451416, | |
| "rewards/rejected": -2.5986788272857666, | |
| "step": 334, | |
| "train_speed(iter/s)": 0.02115 | |
| }, | |
| { | |
| "epoch": 0.6765968189851048, | |
| "grad_norm": 10.243365287780762, | |
| "learning_rate": 0.00015796443487865776, | |
| "logits/chosen": -0.909482479095459, | |
| "logits/rejected": -0.9898862838745117, | |
| "logps/chosen": -6.335696220397949, | |
| "logps/rejected": -46.39136505126953, | |
| "loss": 0.6261657476425171, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.43729183077812195, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27775925397872925, | |
| "rewards/margins": 3.944711446762085, | |
| "rewards/rejected": -3.666951894760132, | |
| "step": 335, | |
| "train_speed(iter/s)": 0.021151 | |
| }, | |
| { | |
| "epoch": 0.6786165109820752, | |
| "grad_norm": 7.904644012451172, | |
| "learning_rate": 0.00015769177248273008, | |
| "logits/chosen": -0.9360239505767822, | |
| "logits/rejected": -1.049852967262268, | |
| "logps/chosen": -7.70269250869751, | |
| "logps/rejected": -51.02676773071289, | |
| "loss": 0.8781910538673401, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5348291397094727, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.07586444914340973, | |
| "rewards/margins": 3.814580202102661, | |
| "rewards/rejected": -3.738715648651123, | |
| "step": 336, | |
| "train_speed(iter/s)": 0.021152 | |
| }, | |
| { | |
| "epoch": 0.6806362029790457, | |
| "grad_norm": 16.91658592224121, | |
| "learning_rate": 0.00015741846568385808, | |
| "logits/chosen": -0.8461523652076721, | |
| "logits/rejected": -1.0379836559295654, | |
| "logps/chosen": -8.801255226135254, | |
| "logps/rejected": -61.471771240234375, | |
| "loss": 1.1453731060028076, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7435779571533203, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.463644415140152, | |
| "rewards/margins": 4.270198345184326, | |
| "rewards/rejected": -4.733842849731445, | |
| "step": 337, | |
| "train_speed(iter/s)": 0.021152 | |
| }, | |
| { | |
| "epoch": 0.6826558949760162, | |
| "grad_norm": 12.933732986450195, | |
| "learning_rate": 0.00015714451753481168, | |
| "logits/chosen": -0.6461415886878967, | |
| "logits/rejected": -0.9560658931732178, | |
| "logps/chosen": -6.069940567016602, | |
| "logps/rejected": -53.62686538696289, | |
| "loss": 1.2495336532592773, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8185646533966064, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.3106077015399933, | |
| "rewards/margins": 3.0313639640808105, | |
| "rewards/rejected": -3.3419713973999023, | |
| "step": 338, | |
| "train_speed(iter/s)": 0.021152 | |
| }, | |
| { | |
| "epoch": 0.6846755869729866, | |
| "grad_norm": 6.386441230773926, | |
| "learning_rate": 0.00015686993109552443, | |
| "logits/chosen": -0.9001967906951904, | |
| "logits/rejected": -1.0288763046264648, | |
| "logps/chosen": -4.8095598220825195, | |
| "logps/rejected": -63.7664909362793, | |
| "loss": 0.6220850348472595, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.42656922340393066, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07018661499023438, | |
| "rewards/margins": 4.841952323913574, | |
| "rewards/rejected": -4.77176570892334, | |
| "step": 339, | |
| "train_speed(iter/s)": 0.021153 | |
| }, | |
| { | |
| "epoch": 0.6866952789699571, | |
| "grad_norm": 5.94568395614624, | |
| "learning_rate": 0.00015659470943305955, | |
| "logits/chosen": -0.8113903999328613, | |
| "logits/rejected": -1.0205042362213135, | |
| "logps/chosen": -3.7077159881591797, | |
| "logps/rejected": -56.63233947753906, | |
| "loss": 0.6539210081100464, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4288255274295807, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.059340257197618484, | |
| "rewards/margins": 4.157015800476074, | |
| "rewards/rejected": -4.097675323486328, | |
| "step": 340, | |
| "train_speed(iter/s)": 0.021154 | |
| }, | |
| { | |
| "epoch": 0.6887149709669276, | |
| "grad_norm": 3.9790964126586914, | |
| "learning_rate": 0.00015631885562157543, | |
| "logits/chosen": -0.7372142672538757, | |
| "logits/rejected": -0.9902328848838806, | |
| "logps/chosen": -4.715322017669678, | |
| "logps/rejected": -48.823387145996094, | |
| "loss": 0.6435255408287048, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3544943630695343, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.05755168944597244, | |
| "rewards/margins": 2.823580741882324, | |
| "rewards/rejected": -2.766029119491577, | |
| "step": 341, | |
| "train_speed(iter/s)": 0.021153 | |
| }, | |
| { | |
| "epoch": 0.690734662963898, | |
| "grad_norm": 3.6011016368865967, | |
| "learning_rate": 0.00015604237274229147, | |
| "logits/chosen": -0.9505451321601868, | |
| "logits/rejected": -1.0710150003433228, | |
| "logps/chosen": -1.6771836280822754, | |
| "logps/rejected": -42.753135681152344, | |
| "loss": 0.3884910047054291, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2611246109008789, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41318997740745544, | |
| "rewards/margins": 3.458676338195801, | |
| "rewards/rejected": -3.0454862117767334, | |
| "step": 342, | |
| "train_speed(iter/s)": 0.021155 | |
| }, | |
| { | |
| "epoch": 0.6927543549608685, | |
| "grad_norm": 10.275211334228516, | |
| "learning_rate": 0.00015576526388345367, | |
| "logits/chosen": -0.9035798907279968, | |
| "logits/rejected": -1.0091338157653809, | |
| "logps/chosen": -4.990538597106934, | |
| "logps/rejected": -41.765995025634766, | |
| "loss": 0.998170018196106, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7295805215835571, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13218021392822266, | |
| "rewards/margins": 3.011774778366089, | |
| "rewards/rejected": -2.879594326019287, | |
| "step": 343, | |
| "train_speed(iter/s)": 0.021155 | |
| }, | |
| { | |
| "epoch": 0.694774046957839, | |
| "grad_norm": 8.156365394592285, | |
| "learning_rate": 0.0001554875321402999, | |
| "logits/chosen": -0.8031080961227417, | |
| "logits/rejected": -0.9648129940032959, | |
| "logps/chosen": -2.28568696975708, | |
| "logps/rejected": -35.34866714477539, | |
| "loss": 0.5425023436546326, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24677146971225739, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23254749178886414, | |
| "rewards/margins": 2.27335262298584, | |
| "rewards/rejected": -2.0408051013946533, | |
| "step": 344, | |
| "train_speed(iter/s)": 0.021156 | |
| }, | |
| { | |
| "epoch": 0.6967937389548093, | |
| "grad_norm": 4.11509370803833, | |
| "learning_rate": 0.00015520918061502569, | |
| "logits/chosen": -0.8795959949493408, | |
| "logits/rejected": -1.0246540307998657, | |
| "logps/chosen": -1.0050594806671143, | |
| "logps/rejected": -38.232444763183594, | |
| "loss": 0.32429325580596924, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1644802689552307, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3108518719673157, | |
| "rewards/margins": 2.897658109664917, | |
| "rewards/rejected": -2.586806297302246, | |
| "step": 345, | |
| "train_speed(iter/s)": 0.021157 | |
| }, | |
| { | |
| "epoch": 0.6988134309517798, | |
| "grad_norm": 3.702918529510498, | |
| "learning_rate": 0.00015493021241674918, | |
| "logits/chosen": -0.8280074000358582, | |
| "logits/rejected": -0.9851573705673218, | |
| "logps/chosen": -1.3124903440475464, | |
| "logps/rejected": -35.455692291259766, | |
| "loss": 0.46161431074142456, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20427490770816803, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2279079556465149, | |
| "rewards/margins": 2.2844018936157227, | |
| "rewards/rejected": -2.0564939975738525, | |
| "step": 346, | |
| "train_speed(iter/s)": 0.021158 | |
| }, | |
| { | |
| "epoch": 0.7008331229487503, | |
| "grad_norm": 7.40757417678833, | |
| "learning_rate": 0.0001546506306614768, | |
| "logits/chosen": -0.8412176966667175, | |
| "logits/rejected": -0.9579489231109619, | |
| "logps/chosen": -6.378708839416504, | |
| "logps/rejected": -44.914512634277344, | |
| "loss": 0.6551076173782349, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3504900634288788, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.00600462406873703, | |
| "rewards/margins": 3.1142947673797607, | |
| "rewards/rejected": -3.1202995777130127, | |
| "step": 347, | |
| "train_speed(iter/s)": 0.021159 | |
| }, | |
| { | |
| "epoch": 0.7028528149457208, | |
| "grad_norm": 2.9458255767822266, | |
| "learning_rate": 0.0001543704384720681, | |
| "logits/chosen": -0.7899777889251709, | |
| "logits/rejected": -0.9945221543312073, | |
| "logps/chosen": -1.4169785976409912, | |
| "logps/rejected": -50.57292556762695, | |
| "loss": 0.3628111779689789, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15231113135814667, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.226759135723114, | |
| "rewards/margins": 3.434785842895508, | |
| "rewards/rejected": -3.208026647567749, | |
| "step": 348, | |
| "train_speed(iter/s)": 0.021159 | |
| }, | |
| { | |
| "epoch": 0.7048725069426912, | |
| "grad_norm": 4.447574615478516, | |
| "learning_rate": 0.00015408963897820113, | |
| "logits/chosen": -0.8848673105239868, | |
| "logits/rejected": -0.8949815034866333, | |
| "logps/chosen": -9.218939781188965, | |
| "logps/rejected": -32.96113967895508, | |
| "loss": 0.6976296901702881, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.31593263149261475, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1799672544002533, | |
| "rewards/margins": 2.5064430236816406, | |
| "rewards/rejected": -2.3264756202697754, | |
| "step": 349, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.7068921989396617, | |
| "grad_norm": 3.5722556114196777, | |
| "learning_rate": 0.00015380823531633729, | |
| "logits/chosen": -0.9537544250488281, | |
| "logits/rejected": -1.0240473747253418, | |
| "logps/chosen": -3.9818813800811768, | |
| "logps/rejected": -31.99053382873535, | |
| "loss": 0.6191223859786987, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34284406900405884, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09681667387485504, | |
| "rewards/margins": 2.406569480895996, | |
| "rewards/rejected": -2.309752941131592, | |
| "step": 350, | |
| "train_speed(iter/s)": 0.021161 | |
| }, | |
| { | |
| "epoch": 0.7089118909366322, | |
| "grad_norm": 3.7325596809387207, | |
| "learning_rate": 0.00015352623062968648, | |
| "logits/chosen": -0.922427773475647, | |
| "logits/rejected": -0.9690065383911133, | |
| "logps/chosen": -4.305528163909912, | |
| "logps/rejected": -23.71919059753418, | |
| "loss": 0.7693547010421753, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.33499932289123535, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.06479213386774063, | |
| "rewards/margins": 1.370113730430603, | |
| "rewards/rejected": -1.3053216934204102, | |
| "step": 351, | |
| "train_speed(iter/s)": 0.021139 | |
| }, | |
| { | |
| "epoch": 0.7109315829336026, | |
| "grad_norm": 16.7460880279541, | |
| "learning_rate": 0.00015324362806817186, | |
| "logits/chosen": -0.7807352542877197, | |
| "logits/rejected": -0.9729360342025757, | |
| "logps/chosen": -7.726840972900391, | |
| "logps/rejected": -53.6373176574707, | |
| "loss": 1.1061019897460938, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6384282112121582, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.23256784677505493, | |
| "rewards/margins": 2.8845200538635254, | |
| "rewards/rejected": -3.1170878410339355, | |
| "step": 352, | |
| "train_speed(iter/s)": 0.021139 | |
| }, | |
| { | |
| "epoch": 0.7129512749305731, | |
| "grad_norm": 2.80759596824646, | |
| "learning_rate": 0.00015296043078839473, | |
| "logits/chosen": -0.7530017495155334, | |
| "logits/rejected": -0.9337269067764282, | |
| "logps/chosen": -1.4654000997543335, | |
| "logps/rejected": -55.76970672607422, | |
| "loss": 0.254292368888855, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13821597397327423, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.28305867314338684, | |
| "rewards/margins": 4.615407943725586, | |
| "rewards/rejected": -4.3323493003845215, | |
| "step": 353, | |
| "train_speed(iter/s)": 0.02114 | |
| }, | |
| { | |
| "epoch": 0.7149709669275436, | |
| "grad_norm": 4.502577781677246, | |
| "learning_rate": 0.00015267664195359917, | |
| "logits/chosen": -0.9706122279167175, | |
| "logits/rejected": -1.0545164346694946, | |
| "logps/chosen": -1.6742087602615356, | |
| "logps/rejected": -41.54838180541992, | |
| "loss": 0.518170177936554, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2445138841867447, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10661309212446213, | |
| "rewards/margins": 3.0441462993621826, | |
| "rewards/rejected": -2.937532901763916, | |
| "step": 354, | |
| "train_speed(iter/s)": 0.021141 | |
| }, | |
| { | |
| "epoch": 0.716990658924514, | |
| "grad_norm": 5.956605434417725, | |
| "learning_rate": 0.00015239226473363687, | |
| "logits/chosen": -0.9984610080718994, | |
| "logits/rejected": -1.0658961534500122, | |
| "logps/chosen": -2.667590379714966, | |
| "logps/rejected": -30.01835823059082, | |
| "loss": 0.6159235239028931, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.25425097346305847, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13858197629451752, | |
| "rewards/margins": 2.178638219833374, | |
| "rewards/rejected": -2.0400562286376953, | |
| "step": 355, | |
| "train_speed(iter/s)": 0.021142 | |
| }, | |
| { | |
| "epoch": 0.7190103509214845, | |
| "grad_norm": 2.670485734939575, | |
| "learning_rate": 0.00015210730230493162, | |
| "logits/chosen": -0.8936488628387451, | |
| "logits/rejected": -1.0093450546264648, | |
| "logps/chosen": -3.5686304569244385, | |
| "logps/rejected": -55.824180603027344, | |
| "loss": 0.3414130210876465, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20404773950576782, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14025713503360748, | |
| "rewards/margins": 3.9673044681549072, | |
| "rewards/rejected": -3.827047109603882, | |
| "step": 356, | |
| "train_speed(iter/s)": 0.021142 | |
| }, | |
| { | |
| "epoch": 0.721030042918455, | |
| "grad_norm": 4.567800521850586, | |
| "learning_rate": 0.00015182175785044387, | |
| "logits/chosen": -0.981977105140686, | |
| "logits/rejected": -0.96744304895401, | |
| "logps/chosen": -7.694738388061523, | |
| "logps/rejected": -33.95967483520508, | |
| "loss": 0.5043447613716125, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24890656769275665, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2846420407295227, | |
| "rewards/margins": 2.429332733154297, | |
| "rewards/rejected": -2.144690752029419, | |
| "step": 357, | |
| "train_speed(iter/s)": 0.021143 | |
| }, | |
| { | |
| "epoch": 0.7230497349154253, | |
| "grad_norm": 8.642942428588867, | |
| "learning_rate": 0.00015153563455963499, | |
| "logits/chosen": -0.9537326097488403, | |
| "logits/rejected": -1.1215823888778687, | |
| "logps/chosen": -2.9258816242218018, | |
| "logps/rejected": -48.52583312988281, | |
| "loss": 0.7397590279579163, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4563119411468506, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18413014709949493, | |
| "rewards/margins": 4.132811069488525, | |
| "rewards/rejected": -3.9486806392669678, | |
| "step": 358, | |
| "train_speed(iter/s)": 0.021144 | |
| }, | |
| { | |
| "epoch": 0.7250694269123958, | |
| "grad_norm": 24.88861083984375, | |
| "learning_rate": 0.00015124893562843208, | |
| "logits/chosen": -0.9031403660774231, | |
| "logits/rejected": -0.9935811758041382, | |
| "logps/chosen": -8.023815155029297, | |
| "logps/rejected": -40.717247009277344, | |
| "loss": 0.8925535082817078, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5370101928710938, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3610239028930664, | |
| "rewards/margins": 3.118933916091919, | |
| "rewards/rejected": -2.7579100131988525, | |
| "step": 359, | |
| "train_speed(iter/s)": 0.021144 | |
| }, | |
| { | |
| "epoch": 0.7270891189093663, | |
| "grad_norm": 10.635350227355957, | |
| "learning_rate": 0.00015096166425919175, | |
| "logits/chosen": -0.9903375506401062, | |
| "logits/rejected": -1.0812005996704102, | |
| "logps/chosen": -3.357611656188965, | |
| "logps/rejected": -47.11662292480469, | |
| "loss": 0.7105602025985718, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3658413290977478, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13873916864395142, | |
| "rewards/margins": 3.40531063079834, | |
| "rewards/rejected": -3.266571283340454, | |
| "step": 360, | |
| "train_speed(iter/s)": 0.021145 | |
| }, | |
| { | |
| "epoch": 0.7291088109063368, | |
| "grad_norm": 18.06879234313965, | |
| "learning_rate": 0.0001506738236606648, | |
| "logits/chosen": -1.099637508392334, | |
| "logits/rejected": -1.1945291757583618, | |
| "logps/chosen": -8.104093551635742, | |
| "logps/rejected": -45.32279968261719, | |
| "loss": 1.623255729675293, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 1.006649374961853, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.31839191913604736, | |
| "rewards/margins": 3.014329433441162, | |
| "rewards/rejected": -3.332721471786499, | |
| "step": 361, | |
| "train_speed(iter/s)": 0.021146 | |
| }, | |
| { | |
| "epoch": 0.7311285029033072, | |
| "grad_norm": 15.128271102905273, | |
| "learning_rate": 0.00015038541704796003, | |
| "logits/chosen": -1.1882942914962769, | |
| "logits/rejected": -1.2618598937988281, | |
| "logps/chosen": -1.8502236604690552, | |
| "logps/rejected": -69.4446792602539, | |
| "loss": 0.38569730520248413, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.24810141324996948, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1845402717590332, | |
| "rewards/margins": 6.129173278808594, | |
| "rewards/rejected": -5.944633483886719, | |
| "step": 362, | |
| "train_speed(iter/s)": 0.021148 | |
| }, | |
| { | |
| "epoch": 0.7331481949002777, | |
| "grad_norm": 5.277956485748291, | |
| "learning_rate": 0.00015009644764250863, | |
| "logits/chosen": -1.163029432296753, | |
| "logits/rejected": -1.2435169219970703, | |
| "logps/chosen": -5.300413608551025, | |
| "logps/rejected": -73.11473846435547, | |
| "loss": 0.8010823130607605, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5916219353675842, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.007427714765071869, | |
| "rewards/margins": 5.836453914642334, | |
| "rewards/rejected": -5.829026222229004, | |
| "step": 363, | |
| "train_speed(iter/s)": 0.021148 | |
| }, | |
| { | |
| "epoch": 0.7351678868972482, | |
| "grad_norm": 75.7375717163086, | |
| "learning_rate": 0.0001498069186720279, | |
| "logits/chosen": -1.1564539670944214, | |
| "logits/rejected": -1.1993024349212646, | |
| "logps/chosen": -2.832427978515625, | |
| "logps/rejected": -73.21650695800781, | |
| "loss": 0.8798462748527527, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4809403121471405, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.17453742027282715, | |
| "rewards/margins": 5.794814109802246, | |
| "rewards/rejected": -5.620276927947998, | |
| "step": 364, | |
| "train_speed(iter/s)": 0.021149 | |
| }, | |
| { | |
| "epoch": 0.7371875788942186, | |
| "grad_norm": 2.991504669189453, | |
| "learning_rate": 0.00014951683337048537, | |
| "logits/chosen": -1.1292376518249512, | |
| "logits/rejected": -1.1874810457229614, | |
| "logps/chosen": -6.187487602233887, | |
| "logps/rejected": -55.482765197753906, | |
| "loss": 0.45134469866752625, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22427882254123688, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3069310486316681, | |
| "rewards/margins": 4.149868488311768, | |
| "rewards/rejected": -3.842937707901001, | |
| "step": 365, | |
| "train_speed(iter/s)": 0.02115 | |
| }, | |
| { | |
| "epoch": 0.7392072708911891, | |
| "grad_norm": 10.73784065246582, | |
| "learning_rate": 0.00014922619497806277, | |
| "logits/chosen": -1.167018175125122, | |
| "logits/rejected": -1.2153444290161133, | |
| "logps/chosen": -1.954573631286621, | |
| "logps/rejected": -61.2001953125, | |
| "loss": 0.5314586162567139, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2992059588432312, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14029161632061005, | |
| "rewards/margins": 4.6798810958862305, | |
| "rewards/rejected": -4.539588928222656, | |
| "step": 366, | |
| "train_speed(iter/s)": 0.02115 | |
| }, | |
| { | |
| "epoch": 0.7412269628881596, | |
| "grad_norm": 5.413460731506348, | |
| "learning_rate": 0.0001489350067411196, | |
| "logits/chosen": -1.1709797382354736, | |
| "logits/rejected": -1.1748571395874023, | |
| "logps/chosen": -7.91160774230957, | |
| "logps/rejected": -46.791404724121094, | |
| "loss": 0.5436979532241821, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30416107177734375, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3512665033340454, | |
| "rewards/margins": 3.6528432369232178, | |
| "rewards/rejected": -3.301577091217041, | |
| "step": 367, | |
| "train_speed(iter/s)": 0.021151 | |
| }, | |
| { | |
| "epoch": 0.74324665488513, | |
| "grad_norm": 7.643467903137207, | |
| "learning_rate": 0.00014864327191215702, | |
| "logits/chosen": -1.1821328401565552, | |
| "logits/rejected": -1.2253855466842651, | |
| "logps/chosen": -2.3498167991638184, | |
| "logps/rejected": -73.46287536621094, | |
| "loss": 0.664942741394043, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.454881489276886, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1444016695022583, | |
| "rewards/margins": 5.324404716491699, | |
| "rewards/rejected": -5.1800031661987305, | |
| "step": 368, | |
| "train_speed(iter/s)": 0.021151 | |
| }, | |
| { | |
| "epoch": 0.7452663468821005, | |
| "grad_norm": 3.926517963409424, | |
| "learning_rate": 0.00014835099374978147, | |
| "logits/chosen": -1.1555640697479248, | |
| "logits/rejected": -1.2078311443328857, | |
| "logps/chosen": -0.9639624953269958, | |
| "logps/rejected": -67.16943359375, | |
| "loss": 0.2394624501466751, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1322186291217804, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2654881775379181, | |
| "rewards/margins": 6.110224723815918, | |
| "rewards/rejected": -5.844736099243164, | |
| "step": 369, | |
| "train_speed(iter/s)": 0.021152 | |
| }, | |
| { | |
| "epoch": 0.747286038879071, | |
| "grad_norm": 4.563858985900879, | |
| "learning_rate": 0.00014805817551866838, | |
| "logits/chosen": -1.183912992477417, | |
| "logits/rejected": -1.2156834602355957, | |
| "logps/chosen": -1.4219800233840942, | |
| "logps/rejected": -39.744171142578125, | |
| "loss": 0.3572657108306885, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15966495871543884, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4396134316921234, | |
| "rewards/margins": 3.298137903213501, | |
| "rewards/rejected": -2.8585243225097656, | |
| "step": 370, | |
| "train_speed(iter/s)": 0.021153 | |
| }, | |
| { | |
| "epoch": 0.7493057308760414, | |
| "grad_norm": 4.50530481338501, | |
| "learning_rate": 0.00014776482048952551, | |
| "logits/chosen": -1.1194803714752197, | |
| "logits/rejected": -1.1540480852127075, | |
| "logps/chosen": -1.7459050416946411, | |
| "logps/rejected": -64.54890441894531, | |
| "loss": 0.2934742867946625, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15494152903556824, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2886925935745239, | |
| "rewards/margins": 5.029353141784668, | |
| "rewards/rejected": -4.740660190582275, | |
| "step": 371, | |
| "train_speed(iter/s)": 0.021153 | |
| }, | |
| { | |
| "epoch": 0.7513254228730119, | |
| "grad_norm": 7.041140556335449, | |
| "learning_rate": 0.00014747093193905657, | |
| "logits/chosen": -1.1590553522109985, | |
| "logits/rejected": -1.1508252620697021, | |
| "logps/chosen": -3.047581434249878, | |
| "logps/rejected": -61.70812225341797, | |
| "loss": 0.6074828505516052, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3978445827960968, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13817714154720306, | |
| "rewards/margins": 4.407755374908447, | |
| "rewards/rejected": -4.269577980041504, | |
| "step": 372, | |
| "train_speed(iter/s)": 0.021154 | |
| }, | |
| { | |
| "epoch": 0.7533451148699823, | |
| "grad_norm": 4.780473709106445, | |
| "learning_rate": 0.00014717651314992455, | |
| "logits/chosen": -1.1245406866073608, | |
| "logits/rejected": -1.1541649103164673, | |
| "logps/chosen": -2.052983283996582, | |
| "logps/rejected": -59.029022216796875, | |
| "loss": 0.3612958490848541, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17177711427211761, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1790371835231781, | |
| "rewards/margins": 4.619558811187744, | |
| "rewards/rejected": -4.440521717071533, | |
| "step": 373, | |
| "train_speed(iter/s)": 0.021154 | |
| }, | |
| { | |
| "epoch": 0.7553648068669528, | |
| "grad_norm": 2.6618669033050537, | |
| "learning_rate": 0.00014688156741071514, | |
| "logits/chosen": -1.16391921043396, | |
| "logits/rejected": -1.2101376056671143, | |
| "logps/chosen": -2.5643341541290283, | |
| "logps/rejected": -50.99317932128906, | |
| "loss": 0.359174907207489, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14501263201236725, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2054893523454666, | |
| "rewards/margins": 4.245234489440918, | |
| "rewards/rejected": -4.039744853973389, | |
| "step": 374, | |
| "train_speed(iter/s)": 0.021155 | |
| }, | |
| { | |
| "epoch": 0.7573844988639232, | |
| "grad_norm": 2.183286666870117, | |
| "learning_rate": 0.00014658609801589982, | |
| "logits/chosen": -1.197989583015442, | |
| "logits/rejected": -1.232681155204773, | |
| "logps/chosen": -1.0838813781738281, | |
| "logps/rejected": -53.68153762817383, | |
| "loss": 0.27284619212150574, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11144410073757172, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3119613528251648, | |
| "rewards/margins": 4.7982072830200195, | |
| "rewards/rejected": -4.486246109008789, | |
| "step": 375, | |
| "train_speed(iter/s)": 0.021156 | |
| }, | |
| { | |
| "epoch": 0.7594041908608937, | |
| "grad_norm": 6.413065433502197, | |
| "learning_rate": 0.00014629010826579928, | |
| "logits/chosen": -1.217897891998291, | |
| "logits/rejected": -1.279034972190857, | |
| "logps/chosen": -2.029020071029663, | |
| "logps/rejected": -67.19940948486328, | |
| "loss": 0.3730330765247345, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2322002500295639, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2920472323894501, | |
| "rewards/margins": 5.175812244415283, | |
| "rewards/rejected": -4.883764266967773, | |
| "step": 376, | |
| "train_speed(iter/s)": 0.021157 | |
| }, | |
| { | |
| "epoch": 0.7614238828578642, | |
| "grad_norm": 3.451570987701416, | |
| "learning_rate": 0.0001459936014665464, | |
| "logits/chosen": -1.17360258102417, | |
| "logits/rejected": -1.2139333486557007, | |
| "logps/chosen": -4.350042819976807, | |
| "logps/rejected": -56.49632263183594, | |
| "loss": 0.5775706171989441, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.39697498083114624, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23329809308052063, | |
| "rewards/margins": 4.431912422180176, | |
| "rewards/rejected": -4.198614597320557, | |
| "step": 377, | |
| "train_speed(iter/s)": 0.021158 | |
| }, | |
| { | |
| "epoch": 0.7634435748548346, | |
| "grad_norm": 5.291248798370361, | |
| "learning_rate": 0.00014569658093004935, | |
| "logits/chosen": -1.1762566566467285, | |
| "logits/rejected": -1.2233586311340332, | |
| "logps/chosen": -3.534919261932373, | |
| "logps/rejected": -80.47354888916016, | |
| "loss": 0.30777013301849365, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2154829502105713, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2291412353515625, | |
| "rewards/margins": 6.180717468261719, | |
| "rewards/rejected": -5.951576232910156, | |
| "step": 378, | |
| "train_speed(iter/s)": 0.021158 | |
| }, | |
| { | |
| "epoch": 0.7654632668518051, | |
| "grad_norm": 10.057852745056152, | |
| "learning_rate": 0.00014539904997395468, | |
| "logits/chosen": -1.1968324184417725, | |
| "logits/rejected": -1.2274653911590576, | |
| "logps/chosen": -3.546328544616699, | |
| "logps/rejected": -69.02865600585938, | |
| "loss": 0.6399840712547302, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4272352159023285, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11763279885053635, | |
| "rewards/margins": 5.601714611053467, | |
| "rewards/rejected": -5.484081745147705, | |
| "step": 379, | |
| "train_speed(iter/s)": 0.021158 | |
| }, | |
| { | |
| "epoch": 0.7674829588487756, | |
| "grad_norm": 4.334756374359131, | |
| "learning_rate": 0.00014510101192161018, | |
| "logits/chosen": -1.2146495580673218, | |
| "logits/rejected": -1.2545320987701416, | |
| "logps/chosen": -6.085969924926758, | |
| "logps/rejected": -41.06128692626953, | |
| "loss": 0.776848316192627, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5693851709365845, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.19634687900543213, | |
| "rewards/margins": 3.313415050506592, | |
| "rewards/rejected": -3.1170685291290283, | |
| "step": 380, | |
| "train_speed(iter/s)": 0.021159 | |
| }, | |
| { | |
| "epoch": 0.769502650845746, | |
| "grad_norm": 6.6673479080200195, | |
| "learning_rate": 0.00014480247010202775, | |
| "logits/chosen": -1.2620035409927368, | |
| "logits/rejected": -1.2927439212799072, | |
| "logps/chosen": -0.9638640880584717, | |
| "logps/rejected": -58.5118293762207, | |
| "loss": 0.3140888810157776, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13222388923168182, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.43909886479377747, | |
| "rewards/margins": 5.030383110046387, | |
| "rewards/rejected": -4.591284275054932, | |
| "step": 381, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.7715223428427165, | |
| "grad_norm": 1.8640215396881104, | |
| "learning_rate": 0.00014450342784984633, | |
| "logits/chosen": -1.2142149209976196, | |
| "logits/rejected": -1.2449159622192383, | |
| "logps/chosen": -3.2471883296966553, | |
| "logps/rejected": -69.44312286376953, | |
| "loss": 0.2647269666194916, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17502562701702118, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.32493484020233154, | |
| "rewards/margins": 5.946244239807129, | |
| "rewards/rejected": -5.621310234069824, | |
| "step": 382, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.773542034839687, | |
| "grad_norm": 4.235260963439941, | |
| "learning_rate": 0.00014420388850529446, | |
| "logits/chosen": -1.2407033443450928, | |
| "logits/rejected": -1.280212163925171, | |
| "logps/chosen": -1.4121766090393066, | |
| "logps/rejected": -73.05975341796875, | |
| "loss": 0.4667883813381195, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23148246109485626, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.42525410652160645, | |
| "rewards/margins": 5.927689552307129, | |
| "rewards/rejected": -5.502435207366943, | |
| "step": 383, | |
| "train_speed(iter/s)": 0.021161 | |
| }, | |
| { | |
| "epoch": 0.7755617268366574, | |
| "grad_norm": 11.74973201751709, | |
| "learning_rate": 0.00014390385541415308, | |
| "logits/chosen": -1.2475506067276, | |
| "logits/rejected": -1.2707443237304688, | |
| "logps/chosen": -2.454108953475952, | |
| "logps/rejected": -42.124366760253906, | |
| "loss": 0.6018331050872803, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3722446858882904, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23790600895881653, | |
| "rewards/margins": 3.314408779144287, | |
| "rewards/rejected": -3.076502561569214, | |
| "step": 384, | |
| "train_speed(iter/s)": 0.021162 | |
| }, | |
| { | |
| "epoch": 0.7775814188336279, | |
| "grad_norm": 2.7534830570220947, | |
| "learning_rate": 0.0001436033319277183, | |
| "logits/chosen": -1.2355518341064453, | |
| "logits/rejected": -1.2741280794143677, | |
| "logps/chosen": -0.7196122407913208, | |
| "logps/rejected": -107.31944274902344, | |
| "loss": 0.1968921422958374, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1137460246682167, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2591235637664795, | |
| "rewards/margins": 8.63725757598877, | |
| "rewards/rejected": -8.378134727478027, | |
| "step": 385, | |
| "train_speed(iter/s)": 0.021162 | |
| }, | |
| { | |
| "epoch": 0.7796011108305984, | |
| "grad_norm": 5.864130020141602, | |
| "learning_rate": 0.00014330232140276366, | |
| "logits/chosen": -1.1965060234069824, | |
| "logits/rejected": -1.2489956617355347, | |
| "logps/chosen": -3.9303858280181885, | |
| "logps/rejected": -66.87359619140625, | |
| "loss": 0.6629573106765747, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5041288137435913, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.20213821530342102, | |
| "rewards/margins": 5.429197311401367, | |
| "rewards/rejected": -5.2270588874816895, | |
| "step": 386, | |
| "train_speed(iter/s)": 0.021162 | |
| }, | |
| { | |
| "epoch": 0.7816208028275689, | |
| "grad_norm": 0.9686940312385559, | |
| "learning_rate": 0.0001430008272015029, | |
| "logits/chosen": -1.168556571006775, | |
| "logits/rejected": -1.2702208757400513, | |
| "logps/chosen": -0.1927298754453659, | |
| "logps/rejected": -86.75350189208984, | |
| "loss": 0.07656482607126236, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.02479482628405094, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3893800973892212, | |
| "rewards/margins": 6.8833112716674805, | |
| "rewards/rejected": -6.493931770324707, | |
| "step": 387, | |
| "train_speed(iter/s)": 0.021162 | |
| }, | |
| { | |
| "epoch": 0.7836404948245392, | |
| "grad_norm": 6.69142484664917, | |
| "learning_rate": 0.0001426988526915523, | |
| "logits/chosen": -1.1132441759109497, | |
| "logits/rejected": -1.2206928730010986, | |
| "logps/chosen": -2.1822941303253174, | |
| "logps/rejected": -58.27075958251953, | |
| "loss": 0.4767617881298065, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2635282874107361, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.18697461485862732, | |
| "rewards/margins": 4.062845706939697, | |
| "rewards/rejected": -3.875871419906616, | |
| "step": 388, | |
| "train_speed(iter/s)": 0.021163 | |
| }, | |
| { | |
| "epoch": 0.7856601868215097, | |
| "grad_norm": 22.11477279663086, | |
| "learning_rate": 0.00014239640124589302, | |
| "logits/chosen": -1.1612333059310913, | |
| "logits/rejected": -1.2209270000457764, | |
| "logps/chosen": -5.149811267852783, | |
| "logps/rejected": -56.67973327636719, | |
| "loss": 0.9844444394111633, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.464616984128952, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.07719806581735611, | |
| "rewards/margins": 3.927542209625244, | |
| "rewards/rejected": -4.004740238189697, | |
| "step": 389, | |
| "train_speed(iter/s)": 0.021163 | |
| }, | |
| { | |
| "epoch": 0.7876798788184802, | |
| "grad_norm": 4.598104476928711, | |
| "learning_rate": 0.0001420934762428335, | |
| "logits/chosen": -1.191237211227417, | |
| "logits/rejected": -1.2505682706832886, | |
| "logps/chosen": -1.6766197681427002, | |
| "logps/rejected": -68.58138275146484, | |
| "loss": 0.37751591205596924, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1912289708852768, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2715514898300171, | |
| "rewards/margins": 6.051302909851074, | |
| "rewards/rejected": -5.779752731323242, | |
| "step": 390, | |
| "train_speed(iter/s)": 0.021164 | |
| }, | |
| { | |
| "epoch": 0.7896995708154506, | |
| "grad_norm": 5.1656084060668945, | |
| "learning_rate": 0.00014179008106597173, | |
| "logits/chosen": -1.1447128057479858, | |
| "logits/rejected": -1.2311046123504639, | |
| "logps/chosen": -1.3589807748794556, | |
| "logps/rejected": -69.0888900756836, | |
| "loss": 0.37555360794067383, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20962855219841003, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2835935950279236, | |
| "rewards/margins": 6.014133453369141, | |
| "rewards/rejected": -5.730539798736572, | |
| "step": 391, | |
| "train_speed(iter/s)": 0.021165 | |
| }, | |
| { | |
| "epoch": 0.7917192628124211, | |
| "grad_norm": 4.515217304229736, | |
| "learning_rate": 0.0001414862191041574, | |
| "logits/chosen": -1.1313319206237793, | |
| "logits/rejected": -1.1735104322433472, | |
| "logps/chosen": -1.4379080533981323, | |
| "logps/rejected": -41.75006103515625, | |
| "loss": 0.42747819423675537, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13288989663124084, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.21147757768630981, | |
| "rewards/margins": 3.0256876945495605, | |
| "rewards/rejected": -2.8142104148864746, | |
| "step": 392, | |
| "train_speed(iter/s)": 0.021166 | |
| }, | |
| { | |
| "epoch": 0.7937389548093916, | |
| "grad_norm": 4.281467437744141, | |
| "learning_rate": 0.00014118189375145402, | |
| "logits/chosen": -1.129544734954834, | |
| "logits/rejected": -1.2433701753616333, | |
| "logps/chosen": -1.0194271802902222, | |
| "logps/rejected": -68.8100357055664, | |
| "loss": 0.4009433388710022, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2110380381345749, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.42351850867271423, | |
| "rewards/margins": 5.658205032348633, | |
| "rewards/rejected": -5.234686374664307, | |
| "step": 393, | |
| "train_speed(iter/s)": 0.021166 | |
| }, | |
| { | |
| "epoch": 0.795758646806362, | |
| "grad_norm": 0.9730565547943115, | |
| "learning_rate": 0.0001408771084071012, | |
| "logits/chosen": -1.098219394683838, | |
| "logits/rejected": -1.2555054426193237, | |
| "logps/chosen": -0.3178718388080597, | |
| "logps/rejected": -82.52906799316406, | |
| "loss": 0.08471984416246414, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.025890445336699486, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41851806640625, | |
| "rewards/margins": 7.259293556213379, | |
| "rewards/rejected": -6.840775489807129, | |
| "step": 394, | |
| "train_speed(iter/s)": 0.021167 | |
| }, | |
| { | |
| "epoch": 0.7977783388033325, | |
| "grad_norm": 6.422388076782227, | |
| "learning_rate": 0.0001405718664754764, | |
| "logits/chosen": -1.0757089853286743, | |
| "logits/rejected": -1.2194029092788696, | |
| "logps/chosen": -4.098117351531982, | |
| "logps/rejected": -79.46504211425781, | |
| "loss": 0.9334844946861267, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.670303463935852, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.09435828030109406, | |
| "rewards/margins": 6.080230236053467, | |
| "rewards/rejected": -6.174588680267334, | |
| "step": 395, | |
| "train_speed(iter/s)": 0.021168 | |
| }, | |
| { | |
| "epoch": 0.799798030800303, | |
| "grad_norm": 3.1609609127044678, | |
| "learning_rate": 0.0001402661713660571, | |
| "logits/chosen": -1.1343252658843994, | |
| "logits/rejected": -1.2600665092468262, | |
| "logps/chosen": -1.6706289052963257, | |
| "logps/rejected": -69.32755279541016, | |
| "loss": 0.22293509542942047, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17708872258663177, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18604204058647156, | |
| "rewards/margins": 6.022045612335205, | |
| "rewards/rejected": -5.836003303527832, | |
| "step": 396, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.8018177227972734, | |
| "grad_norm": 3.5824060440063477, | |
| "learning_rate": 0.0001399600264933827, | |
| "logits/chosen": -1.1588817834854126, | |
| "logits/rejected": -1.2686594724655151, | |
| "logps/chosen": -2.480526924133301, | |
| "logps/rejected": -77.53683471679688, | |
| "loss": 0.400388240814209, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2272554636001587, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2708975374698639, | |
| "rewards/margins": 6.85975980758667, | |
| "rewards/rejected": -6.58886194229126, | |
| "step": 397, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.8038374147942439, | |
| "grad_norm": 8.915884017944336, | |
| "learning_rate": 0.00013965343527701628, | |
| "logits/chosen": -1.0931580066680908, | |
| "logits/rejected": -1.2515380382537842, | |
| "logps/chosen": -6.809703826904297, | |
| "logps/rejected": -92.00086975097656, | |
| "loss": 1.2307904958724976, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.950491189956665, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.23660066723823547, | |
| "rewards/margins": 7.736156463623047, | |
| "rewards/rejected": -7.9727559089660645, | |
| "step": 398, | |
| "train_speed(iter/s)": 0.02117 | |
| }, | |
| { | |
| "epoch": 0.8058571067912144, | |
| "grad_norm": 16.942861557006836, | |
| "learning_rate": 0.00013934640114150656, | |
| "logits/chosen": -1.1165294647216797, | |
| "logits/rejected": -1.2258877754211426, | |
| "logps/chosen": -5.151846885681152, | |
| "logps/rejected": -50.20682144165039, | |
| "loss": 1.4095838069915771, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 1.0055750608444214, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.08993971347808838, | |
| "rewards/margins": 3.8719429969787598, | |
| "rewards/rejected": -3.9618825912475586, | |
| "step": 399, | |
| "train_speed(iter/s)": 0.021171 | |
| }, | |
| { | |
| "epoch": 0.8078767987881847, | |
| "grad_norm": 12.716894149780273, | |
| "learning_rate": 0.00013903892751634947, | |
| "logits/chosen": -1.1147105693817139, | |
| "logits/rejected": -1.2179588079452515, | |
| "logps/chosen": -2.3593387603759766, | |
| "logps/rejected": -60.22994613647461, | |
| "loss": 0.3005334734916687, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17930257320404053, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2562834620475769, | |
| "rewards/margins": 5.470202445983887, | |
| "rewards/rejected": -5.213918685913086, | |
| "step": 400, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.8098964907851552, | |
| "grad_norm": 3.6407527923583984, | |
| "learning_rate": 0.00013873101783594999, | |
| "logits/chosen": -0.9179055690765381, | |
| "logits/rejected": -1.0948255062103271, | |
| "logps/chosen": -7.396864414215088, | |
| "logps/rejected": -76.39356994628906, | |
| "loss": 0.7279776334762573, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5141282081604004, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07542237639427185, | |
| "rewards/margins": 5.8221588134765625, | |
| "rewards/rejected": -5.746736526489258, | |
| "step": 401, | |
| "train_speed(iter/s)": 0.021153 | |
| }, | |
| { | |
| "epoch": 0.8119161827821257, | |
| "grad_norm": 4.730077743530273, | |
| "learning_rate": 0.00013842267553958371, | |
| "logits/chosen": -1.0015758275985718, | |
| "logits/rejected": -1.173001766204834, | |
| "logps/chosen": -1.2833012342453003, | |
| "logps/rejected": -65.50496673583984, | |
| "loss": 0.31842923164367676, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15187285840511322, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3435157239437103, | |
| "rewards/margins": 5.360050201416016, | |
| "rewards/rejected": -5.016533851623535, | |
| "step": 402, | |
| "train_speed(iter/s)": 0.021154 | |
| }, | |
| { | |
| "epoch": 0.8139358747790962, | |
| "grad_norm": 6.681663513183594, | |
| "learning_rate": 0.00013811390407135837, | |
| "logits/chosen": -1.0345579385757446, | |
| "logits/rejected": -1.1669750213623047, | |
| "logps/chosen": -2.711009979248047, | |
| "logps/rejected": -48.982208251953125, | |
| "loss": 0.49727287888526917, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.25284403562545776, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15987528860569, | |
| "rewards/margins": 4.172056674957275, | |
| "rewards/rejected": -4.012181282043457, | |
| "step": 403, | |
| "train_speed(iter/s)": 0.021155 | |
| }, | |
| { | |
| "epoch": 0.8159555667760666, | |
| "grad_norm": 3.184199571609497, | |
| "learning_rate": 0.00013780470688017562, | |
| "logits/chosen": -1.0638835430145264, | |
| "logits/rejected": -1.1304998397827148, | |
| "logps/chosen": -4.9558868408203125, | |
| "logps/rejected": -44.02895736694336, | |
| "loss": 0.6054225564002991, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3829798102378845, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39171290397644043, | |
| "rewards/margins": 3.7432100772857666, | |
| "rewards/rejected": -3.3514974117279053, | |
| "step": 404, | |
| "train_speed(iter/s)": 0.021156 | |
| }, | |
| { | |
| "epoch": 0.8179752587730371, | |
| "grad_norm": 16.700468063354492, | |
| "learning_rate": 0.00013749508741969213, | |
| "logits/chosen": -0.9126327633857727, | |
| "logits/rejected": -0.9981098771095276, | |
| "logps/chosen": -8.324628829956055, | |
| "logps/rejected": -54.67494201660156, | |
| "loss": 1.088732361793518, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7484469413757324, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.14237897098064423, | |
| "rewards/margins": 3.1626644134521484, | |
| "rewards/rejected": -3.3050432205200195, | |
| "step": 405, | |
| "train_speed(iter/s)": 0.021156 | |
| }, | |
| { | |
| "epoch": 0.8199949507700076, | |
| "grad_norm": 4.572319507598877, | |
| "learning_rate": 0.00013718504914828135, | |
| "logits/chosen": -0.9639456272125244, | |
| "logits/rejected": -1.0909277200698853, | |
| "logps/chosen": -2.374218225479126, | |
| "logps/rejected": -28.60363006591797, | |
| "loss": 0.6309629082679749, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3386070728302002, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.38088110089302063, | |
| "rewards/margins": 2.043933868408203, | |
| "rewards/rejected": -1.6630527973175049, | |
| "step": 406, | |
| "train_speed(iter/s)": 0.021157 | |
| }, | |
| { | |
| "epoch": 0.822014642766978, | |
| "grad_norm": 7.175300598144531, | |
| "learning_rate": 0.00013687459552899465, | |
| "logits/chosen": -1.011370062828064, | |
| "logits/rejected": -1.1552919149398804, | |
| "logps/chosen": -0.751252293586731, | |
| "logps/rejected": -58.353179931640625, | |
| "loss": 0.3189142942428589, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1253315508365631, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2173149585723877, | |
| "rewards/margins": 4.045991897583008, | |
| "rewards/rejected": -3.828676700592041, | |
| "step": 407, | |
| "train_speed(iter/s)": 0.021157 | |
| }, | |
| { | |
| "epoch": 0.8240343347639485, | |
| "grad_norm": 3.638871908187866, | |
| "learning_rate": 0.0001365637300295229, | |
| "logits/chosen": -0.9884570240974426, | |
| "logits/rejected": -1.1229445934295654, | |
| "logps/chosen": -2.4416940212249756, | |
| "logps/rejected": -49.12045669555664, | |
| "loss": 0.5083186030387878, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.30594146251678467, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28965339064598083, | |
| "rewards/margins": 3.306330919265747, | |
| "rewards/rejected": -3.0166776180267334, | |
| "step": 408, | |
| "train_speed(iter/s)": 0.021158 | |
| }, | |
| { | |
| "epoch": 0.826054026760919, | |
| "grad_norm": 1.9313740730285645, | |
| "learning_rate": 0.0001362524561221574, | |
| "logits/chosen": -1.0589873790740967, | |
| "logits/rejected": -1.155687928199768, | |
| "logps/chosen": -0.7494394183158875, | |
| "logps/rejected": -61.899314880371094, | |
| "loss": 0.16012489795684814, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.06837154924869537, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.422152578830719, | |
| "rewards/margins": 5.1323323249816895, | |
| "rewards/rejected": -4.710179805755615, | |
| "step": 409, | |
| "train_speed(iter/s)": 0.021159 | |
| }, | |
| { | |
| "epoch": 0.8280737187578894, | |
| "grad_norm": 2.8826475143432617, | |
| "learning_rate": 0.00013594077728375128, | |
| "logits/chosen": -1.046625018119812, | |
| "logits/rejected": -1.1403248310089111, | |
| "logps/chosen": -2.6342790126800537, | |
| "logps/rejected": -47.86298370361328, | |
| "loss": 0.3936201333999634, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19051307439804077, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13923531770706177, | |
| "rewards/margins": 3.3216652870178223, | |
| "rewards/rejected": -3.182429790496826, | |
| "step": 410, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.8300934107548599, | |
| "grad_norm": 7.247873306274414, | |
| "learning_rate": 0.00013562869699568076, | |
| "logits/chosen": -1.1259405612945557, | |
| "logits/rejected": -1.1454825401306152, | |
| "logps/chosen": -7.434700012207031, | |
| "logps/rejected": -49.61088562011719, | |
| "loss": 0.960975170135498, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7216768860816956, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.03636153042316437, | |
| "rewards/margins": 3.5744729042053223, | |
| "rewards/rejected": -3.6108345985412598, | |
| "step": 411, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.8321131027518304, | |
| "grad_norm": 2.7764785289764404, | |
| "learning_rate": 0.00013531621874380613, | |
| "logits/chosen": -0.9636606574058533, | |
| "logits/rejected": -1.1189731359481812, | |
| "logps/chosen": -3.8168373107910156, | |
| "logps/rejected": -65.32124328613281, | |
| "loss": 0.31505468487739563, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2553892135620117, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2123510092496872, | |
| "rewards/margins": 5.209415912628174, | |
| "rewards/rejected": -4.997064590454102, | |
| "step": 412, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.8341327947488008, | |
| "grad_norm": 4.009552001953125, | |
| "learning_rate": 0.0001350033460184327, | |
| "logits/chosen": -0.8576051592826843, | |
| "logits/rejected": -1.1664515733718872, | |
| "logps/chosen": -1.3953887224197388, | |
| "logps/rejected": -94.75813293457031, | |
| "loss": 0.1995779424905777, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09238594025373459, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33278360962867737, | |
| "rewards/margins": 6.894500255584717, | |
| "rewards/rejected": -6.5617170333862305, | |
| "step": 413, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.8361524867457713, | |
| "grad_norm": 14.014391899108887, | |
| "learning_rate": 0.00013469008231427207, | |
| "logits/chosen": -1.1141268014907837, | |
| "logits/rejected": -1.1793636083602905, | |
| "logps/chosen": -2.8426718711853027, | |
| "logps/rejected": -64.9253158569336, | |
| "loss": 0.6592072248458862, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.44861316680908203, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20249105989933014, | |
| "rewards/margins": 5.202639579772949, | |
| "rewards/rejected": -5.000148296356201, | |
| "step": 414, | |
| "train_speed(iter/s)": 0.02116 | |
| }, | |
| { | |
| "epoch": 0.8381721787427417, | |
| "grad_norm": 6.667239189147949, | |
| "learning_rate": 0.00013437643113040301, | |
| "logits/chosen": -1.1405432224273682, | |
| "logits/rejected": -1.205533504486084, | |
| "logps/chosen": -4.049654960632324, | |
| "logps/rejected": -65.5449447631836, | |
| "loss": 0.955814003944397, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.7577894926071167, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.011894673109054565, | |
| "rewards/margins": 5.261639595031738, | |
| "rewards/rejected": -5.273534297943115, | |
| "step": 415, | |
| "train_speed(iter/s)": 0.021161 | |
| }, | |
| { | |
| "epoch": 0.8401918707397122, | |
| "grad_norm": 5.3052802085876465, | |
| "learning_rate": 0.00013406239597023225, | |
| "logits/chosen": -1.1984199285507202, | |
| "logits/rejected": -1.2300504446029663, | |
| "logps/chosen": -2.0026376247406006, | |
| "logps/rejected": -44.80060958862305, | |
| "loss": 0.32053616642951965, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1967550367116928, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.29741793870925903, | |
| "rewards/margins": 3.937462329864502, | |
| "rewards/rejected": -3.6400444507598877, | |
| "step": 416, | |
| "train_speed(iter/s)": 0.021162 | |
| }, | |
| { | |
| "epoch": 0.8422115627366826, | |
| "grad_norm": 4.6360578536987305, | |
| "learning_rate": 0.0001337479803414555, | |
| "logits/chosen": -1.1135053634643555, | |
| "logits/rejected": -1.1990042924880981, | |
| "logps/chosen": -1.2526822090148926, | |
| "logps/rejected": -64.39313507080078, | |
| "loss": 0.3324093520641327, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19946074485778809, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22650685906410217, | |
| "rewards/margins": 5.059194087982178, | |
| "rewards/rejected": -4.8326873779296875, | |
| "step": 417, | |
| "train_speed(iter/s)": 0.021162 | |
| }, | |
| { | |
| "epoch": 0.8442312547336531, | |
| "grad_norm": 5.64458703994751, | |
| "learning_rate": 0.0001334331877560182, | |
| "logits/chosen": -1.1316285133361816, | |
| "logits/rejected": -1.1844420433044434, | |
| "logps/chosen": -2.270009994506836, | |
| "logps/rejected": -73.60192108154297, | |
| "loss": 0.37290775775909424, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2037116289138794, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22195757925510406, | |
| "rewards/margins": 6.114259719848633, | |
| "rewards/rejected": -5.892301559448242, | |
| "step": 418, | |
| "train_speed(iter/s)": 0.021163 | |
| }, | |
| { | |
| "epoch": 0.8462509467306236, | |
| "grad_norm": 1.5520920753479004, | |
| "learning_rate": 0.00013311802173007626, | |
| "logits/chosen": -1.1409199237823486, | |
| "logits/rejected": -1.203282356262207, | |
| "logps/chosen": -2.087766408920288, | |
| "logps/rejected": -75.88261413574219, | |
| "loss": 0.19689969718456268, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11977825313806534, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1527182012796402, | |
| "rewards/margins": 6.459143161773682, | |
| "rewards/rejected": -6.306424617767334, | |
| "step": 419, | |
| "train_speed(iter/s)": 0.021164 | |
| }, | |
| { | |
| "epoch": 0.848270638727594, | |
| "grad_norm": 16.449495315551758, | |
| "learning_rate": 0.0001328024857839569, | |
| "logits/chosen": -1.189044713973999, | |
| "logits/rejected": -1.2236502170562744, | |
| "logps/chosen": -4.713018894195557, | |
| "logps/rejected": -54.21986389160156, | |
| "loss": 0.7003884315490723, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4415695369243622, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.018294498324394226, | |
| "rewards/margins": 4.57138204574585, | |
| "rewards/rejected": -4.589676856994629, | |
| "step": 420, | |
| "train_speed(iter/s)": 0.021164 | |
| }, | |
| { | |
| "epoch": 0.8502903307245645, | |
| "grad_norm": 28.160564422607422, | |
| "learning_rate": 0.00013248658344211926, | |
| "logits/chosen": -1.0967679023742676, | |
| "logits/rejected": -1.1361645460128784, | |
| "logps/chosen": -6.815154552459717, | |
| "logps/rejected": -83.51364135742188, | |
| "loss": 1.2551347017288208, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8729581832885742, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.03463226556777954, | |
| "rewards/margins": 6.367086410522461, | |
| "rewards/rejected": -6.401719093322754, | |
| "step": 421, | |
| "train_speed(iter/s)": 0.021164 | |
| }, | |
| { | |
| "epoch": 0.852310022721535, | |
| "grad_norm": 31.47573471069336, | |
| "learning_rate": 0.00013217031823311488, | |
| "logits/chosen": -1.1553871631622314, | |
| "logits/rejected": -1.2064706087112427, | |
| "logps/chosen": -5.438415050506592, | |
| "logps/rejected": -65.18042755126953, | |
| "loss": 0.8344112038612366, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5628060698509216, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07962656021118164, | |
| "rewards/margins": 5.513628959655762, | |
| "rewards/rejected": -5.434001922607422, | |
| "step": 422, | |
| "train_speed(iter/s)": 0.021165 | |
| }, | |
| { | |
| "epoch": 0.8543297147185054, | |
| "grad_norm": 8.784391403198242, | |
| "learning_rate": 0.0001318536936895487, | |
| "logits/chosen": -1.123747706413269, | |
| "logits/rejected": -1.1673023700714111, | |
| "logps/chosen": -3.4688830375671387, | |
| "logps/rejected": -54.17964172363281, | |
| "loss": 0.8599854707717896, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5710347890853882, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.038751691579818726, | |
| "rewards/margins": 4.241340637207031, | |
| "rewards/rejected": -4.2025885581970215, | |
| "step": 423, | |
| "train_speed(iter/s)": 0.021166 | |
| }, | |
| { | |
| "epoch": 0.8563494067154759, | |
| "grad_norm": 22.89176368713379, | |
| "learning_rate": 0.00013153671334803905, | |
| "logits/chosen": -1.1089229583740234, | |
| "logits/rejected": -1.1420047283172607, | |
| "logps/chosen": -4.063858985900879, | |
| "logps/rejected": -40.476722717285156, | |
| "loss": 0.9364627599716187, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6597320437431335, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.02382955513894558, | |
| "rewards/margins": 3.0120341777801514, | |
| "rewards/rejected": -2.9882047176361084, | |
| "step": 424, | |
| "train_speed(iter/s)": 0.021166 | |
| }, | |
| { | |
| "epoch": 0.8583690987124464, | |
| "grad_norm": 4.699946880340576, | |
| "learning_rate": 0.00013121938074917865, | |
| "logits/chosen": -1.0667518377304077, | |
| "logits/rejected": -1.1017130613327026, | |
| "logps/chosen": -4.643237113952637, | |
| "logps/rejected": -60.97563934326172, | |
| "loss": 0.39269566535949707, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3167289197444916, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.22700132429599762, | |
| "rewards/margins": 4.699875354766846, | |
| "rewards/rejected": -4.472874641418457, | |
| "step": 425, | |
| "train_speed(iter/s)": 0.021167 | |
| }, | |
| { | |
| "epoch": 0.8603887907094168, | |
| "grad_norm": 2.7371695041656494, | |
| "learning_rate": 0.00013090169943749476, | |
| "logits/chosen": -1.076597809791565, | |
| "logits/rejected": -1.0993525981903076, | |
| "logps/chosen": -2.2984302043914795, | |
| "logps/rejected": -54.213531494140625, | |
| "loss": 0.3011862337589264, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17973017692565918, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.19591867923736572, | |
| "rewards/margins": 3.4975361824035645, | |
| "rewards/rejected": -3.3016176223754883, | |
| "step": 426, | |
| "train_speed(iter/s)": 0.021168 | |
| }, | |
| { | |
| "epoch": 0.8624084827063873, | |
| "grad_norm": 17.75054168701172, | |
| "learning_rate": 0.00013058367296140967, | |
| "logits/chosen": -1.046842098236084, | |
| "logits/rejected": -1.0758651494979858, | |
| "logps/chosen": -4.21718692779541, | |
| "logps/rejected": -39.91408920288086, | |
| "loss": 0.9825822114944458, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6494057774543762, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.017109857872128487, | |
| "rewards/margins": 2.6019086837768555, | |
| "rewards/rejected": -2.584798812866211, | |
| "step": 427, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.8644281747033578, | |
| "grad_norm": 2.5992624759674072, | |
| "learning_rate": 0.00013026530487320113, | |
| "logits/chosen": -1.0623323917388916, | |
| "logits/rejected": -1.1041500568389893, | |
| "logps/chosen": -1.7210079431533813, | |
| "logps/rejected": -52.09022521972656, | |
| "loss": 0.3279334008693695, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19231894612312317, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27669844031333923, | |
| "rewards/margins": 4.07616662979126, | |
| "rewards/rejected": -3.7994682788848877, | |
| "step": 428, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.8664478667003283, | |
| "grad_norm": 3.9208383560180664, | |
| "learning_rate": 0.00012994659872896257, | |
| "logits/chosen": -1.0508674383163452, | |
| "logits/rejected": -1.1102675199508667, | |
| "logps/chosen": -3.953282594680786, | |
| "logps/rejected": -63.04370880126953, | |
| "loss": 0.7971250414848328, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5409887433052063, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06726647913455963, | |
| "rewards/margins": 4.291454792022705, | |
| "rewards/rejected": -4.224188327789307, | |
| "step": 429, | |
| "train_speed(iter/s)": 0.02117 | |
| }, | |
| { | |
| "epoch": 0.8684675586972986, | |
| "grad_norm": 2.1997742652893066, | |
| "learning_rate": 0.00012962755808856342, | |
| "logits/chosen": -1.0617396831512451, | |
| "logits/rejected": -1.0978208780288696, | |
| "logps/chosen": -1.448944330215454, | |
| "logps/rejected": -47.621673583984375, | |
| "loss": 0.17363907396793365, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.10171680897474289, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2539137005805969, | |
| "rewards/margins": 3.7236616611480713, | |
| "rewards/rejected": -3.4697484970092773, | |
| "step": 430, | |
| "train_speed(iter/s)": 0.02117 | |
| }, | |
| { | |
| "epoch": 0.8704872506942691, | |
| "grad_norm": 5.373311519622803, | |
| "learning_rate": 0.00012930818651560934, | |
| "logits/chosen": -1.015924096107483, | |
| "logits/rejected": -1.0387259721755981, | |
| "logps/chosen": -3.2455596923828125, | |
| "logps/rejected": -39.7397575378418, | |
| "loss": 0.8503936529159546, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.522122859954834, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.04042099043726921, | |
| "rewards/margins": 2.7263174057006836, | |
| "rewards/rejected": -2.7667384147644043, | |
| "step": 431, | |
| "train_speed(iter/s)": 0.021171 | |
| }, | |
| { | |
| "epoch": 0.8725069426912396, | |
| "grad_norm": 10.711043357849121, | |
| "learning_rate": 0.00012898848757740246, | |
| "logits/chosen": -0.9647800922393799, | |
| "logits/rejected": -0.9854017496109009, | |
| "logps/chosen": -9.754167556762695, | |
| "logps/rejected": -35.71137619018555, | |
| "loss": 1.1322778463363647, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6833858489990234, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09812775254249573, | |
| "rewards/margins": 1.88960862159729, | |
| "rewards/rejected": -1.7914810180664062, | |
| "step": 432, | |
| "train_speed(iter/s)": 0.021171 | |
| }, | |
| { | |
| "epoch": 0.87452663468821, | |
| "grad_norm": 6.029493808746338, | |
| "learning_rate": 0.00012866846484490147, | |
| "logits/chosen": -1.05926513671875, | |
| "logits/rejected": -1.0726540088653564, | |
| "logps/chosen": -1.8859708309173584, | |
| "logps/rejected": -38.563228607177734, | |
| "loss": 0.3466527760028839, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2102343887090683, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.403474360704422, | |
| "rewards/margins": 3.249852180480957, | |
| "rewards/rejected": -2.8463780879974365, | |
| "step": 433, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.8765463266851805, | |
| "grad_norm": 9.18895149230957, | |
| "learning_rate": 0.0001283481218926818, | |
| "logits/chosen": -1.060423731803894, | |
| "logits/rejected": -1.0363166332244873, | |
| "logps/chosen": -4.131833553314209, | |
| "logps/rejected": -75.67689514160156, | |
| "loss": 0.7851709723472595, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5702386498451233, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1319551020860672, | |
| "rewards/margins": 5.650537490844727, | |
| "rewards/rejected": -5.518582820892334, | |
| "step": 434, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.878566018682151, | |
| "grad_norm": 6.691397666931152, | |
| "learning_rate": 0.00012802746229889563, | |
| "logits/chosen": -1.0681829452514648, | |
| "logits/rejected": -1.0891364812850952, | |
| "logps/chosen": -1.9405295848846436, | |
| "logps/rejected": -50.287044525146484, | |
| "loss": 0.4823431670665741, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2815513014793396, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.21010005474090576, | |
| "rewards/margins": 3.8635170459747314, | |
| "rewards/rejected": -3.653416633605957, | |
| "step": 435, | |
| "train_speed(iter/s)": 0.021173 | |
| }, | |
| { | |
| "epoch": 0.8805857106791214, | |
| "grad_norm": 4.134374141693115, | |
| "learning_rate": 0.00012770648964523194, | |
| "logits/chosen": -1.0445590019226074, | |
| "logits/rejected": -1.0800678730010986, | |
| "logps/chosen": -4.192701816558838, | |
| "logps/rejected": -41.08876037597656, | |
| "loss": 0.764896035194397, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6386605501174927, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.05937701463699341, | |
| "rewards/margins": 3.2779440879821777, | |
| "rewards/rejected": -3.21856689453125, | |
| "step": 436, | |
| "train_speed(iter/s)": 0.021174 | |
| }, | |
| { | |
| "epoch": 0.8826054026760919, | |
| "grad_norm": 5.5645976066589355, | |
| "learning_rate": 0.0001273852075168765, | |
| "logits/chosen": -1.052649736404419, | |
| "logits/rejected": -1.0750157833099365, | |
| "logps/chosen": -3.2202606201171875, | |
| "logps/rejected": -39.1766471862793, | |
| "loss": 0.7316163778305054, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.35654330253601074, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.04998503625392914, | |
| "rewards/margins": 2.966275453567505, | |
| "rewards/rejected": -2.916290521621704, | |
| "step": 437, | |
| "train_speed(iter/s)": 0.021175 | |
| }, | |
| { | |
| "epoch": 0.8846250946730624, | |
| "grad_norm": 3.430967330932617, | |
| "learning_rate": 0.0001270636195024719, | |
| "logits/chosen": -1.0656282901763916, | |
| "logits/rejected": -1.0755031108856201, | |
| "logps/chosen": -0.5838297605514526, | |
| "logps/rejected": -53.800167083740234, | |
| "loss": 0.23027637600898743, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11958169937133789, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.35133183002471924, | |
| "rewards/margins": 4.607048034667969, | |
| "rewards/rejected": -4.255716323852539, | |
| "step": 438, | |
| "train_speed(iter/s)": 0.021176 | |
| }, | |
| { | |
| "epoch": 0.8866447866700328, | |
| "grad_norm": 4.035180568695068, | |
| "learning_rate": 0.00012674172919407734, | |
| "logits/chosen": -1.035705327987671, | |
| "logits/rejected": -1.046338677406311, | |
| "logps/chosen": -1.762102484703064, | |
| "logps/rejected": -41.274600982666016, | |
| "loss": 0.44759538769721985, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17419928312301636, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2473682463169098, | |
| "rewards/margins": 3.196018695831299, | |
| "rewards/rejected": -2.948650360107422, | |
| "step": 439, | |
| "train_speed(iter/s)": 0.021177 | |
| }, | |
| { | |
| "epoch": 0.8886644786670033, | |
| "grad_norm": 5.988144397735596, | |
| "learning_rate": 0.00012641954018712863, | |
| "logits/chosen": -1.0401451587677002, | |
| "logits/rejected": -1.0481927394866943, | |
| "logps/chosen": -1.6200381517410278, | |
| "logps/rejected": -40.854026794433594, | |
| "loss": 0.4076470732688904, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.28579434752464294, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2611207365989685, | |
| "rewards/margins": 3.813446044921875, | |
| "rewards/rejected": -3.5523252487182617, | |
| "step": 440, | |
| "train_speed(iter/s)": 0.021178 | |
| }, | |
| { | |
| "epoch": 0.8906841706639738, | |
| "grad_norm": 4.463588237762451, | |
| "learning_rate": 0.00012609705608039782, | |
| "logits/chosen": -1.0440635681152344, | |
| "logits/rejected": -1.038417935371399, | |
| "logps/chosen": -1.1576311588287354, | |
| "logps/rejected": -78.23765563964844, | |
| "loss": 0.2654612958431244, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14011946320533752, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.31270933151245117, | |
| "rewards/margins": 5.999755859375, | |
| "rewards/rejected": -5.687046051025391, | |
| "step": 441, | |
| "train_speed(iter/s)": 0.021178 | |
| }, | |
| { | |
| "epoch": 0.8927038626609443, | |
| "grad_norm": 3.0731234550476074, | |
| "learning_rate": 0.00012577428047595344, | |
| "logits/chosen": -1.016157865524292, | |
| "logits/rejected": -1.0280359983444214, | |
| "logps/chosen": -3.0516724586486816, | |
| "logps/rejected": -60.31180191040039, | |
| "loss": 0.4081045091152191, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23720964789390564, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2602730989456177, | |
| "rewards/margins": 4.627702236175537, | |
| "rewards/rejected": -4.367428779602051, | |
| "step": 442, | |
| "train_speed(iter/s)": 0.021178 | |
| }, | |
| { | |
| "epoch": 0.8947235546579146, | |
| "grad_norm": 2.895439624786377, | |
| "learning_rate": 0.00012545121697911962, | |
| "logits/chosen": -1.0191925764083862, | |
| "logits/rejected": -1.0200212001800537, | |
| "logps/chosen": -2.8940157890319824, | |
| "logps/rejected": -57.44503402709961, | |
| "loss": 0.36436915397644043, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1371701955795288, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2842387855052948, | |
| "rewards/margins": 4.40120792388916, | |
| "rewards/rejected": -4.116969108581543, | |
| "step": 443, | |
| "train_speed(iter/s)": 0.021178 | |
| }, | |
| { | |
| "epoch": 0.8967432466548851, | |
| "grad_norm": 9.891191482543945, | |
| "learning_rate": 0.00012512786919843648, | |
| "logits/chosen": -1.0200165510177612, | |
| "logits/rejected": -1.032355785369873, | |
| "logps/chosen": -2.6891350746154785, | |
| "logps/rejected": -47.72188949584961, | |
| "loss": 0.7450097799301147, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5138753652572632, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2414613664150238, | |
| "rewards/margins": 4.151015281677246, | |
| "rewards/rejected": -3.9095540046691895, | |
| "step": 444, | |
| "train_speed(iter/s)": 0.021179 | |
| }, | |
| { | |
| "epoch": 0.8987629386518556, | |
| "grad_norm": 3.1112067699432373, | |
| "learning_rate": 0.00012480424074561933, | |
| "logits/chosen": -1.025837779045105, | |
| "logits/rejected": -1.0225645303726196, | |
| "logps/chosen": -1.7361624240875244, | |
| "logps/rejected": -58.649635314941406, | |
| "loss": 0.2522731125354767, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09138274937868118, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2967418134212494, | |
| "rewards/margins": 4.663671970367432, | |
| "rewards/rejected": -4.3669304847717285, | |
| "step": 445, | |
| "train_speed(iter/s)": 0.021179 | |
| }, | |
| { | |
| "epoch": 0.900782630648826, | |
| "grad_norm": 14.950603485107422, | |
| "learning_rate": 0.00012448033523551865, | |
| "logits/chosen": -1.0079376697540283, | |
| "logits/rejected": -1.0010699033737183, | |
| "logps/chosen": -7.840879440307617, | |
| "logps/rejected": -26.104421615600586, | |
| "loss": 1.1924169063568115, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4921947121620178, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.1946742981672287, | |
| "rewards/margins": 1.5733067989349365, | |
| "rewards/rejected": -1.7679810523986816, | |
| "step": 446, | |
| "train_speed(iter/s)": 0.02118 | |
| }, | |
| { | |
| "epoch": 0.9028023226457965, | |
| "grad_norm": 3.8511011600494385, | |
| "learning_rate": 0.00012415615628607945, | |
| "logits/chosen": -1.015897274017334, | |
| "logits/rejected": -1.014409065246582, | |
| "logps/chosen": -2.20813250541687, | |
| "logps/rejected": -45.50457763671875, | |
| "loss": 0.5370233058929443, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34335654973983765, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12667731940746307, | |
| "rewards/margins": 3.747370958328247, | |
| "rewards/rejected": -3.6206939220428467, | |
| "step": 447, | |
| "train_speed(iter/s)": 0.021181 | |
| }, | |
| { | |
| "epoch": 0.904822014642767, | |
| "grad_norm": 4.594604969024658, | |
| "learning_rate": 0.0001238317075183011, | |
| "logits/chosen": -1.0298758745193481, | |
| "logits/rejected": -1.0120558738708496, | |
| "logps/chosen": -0.9791274070739746, | |
| "logps/rejected": -79.58103942871094, | |
| "loss": 0.3356885612010956, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19914807379245758, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.22014901041984558, | |
| "rewards/margins": 5.962551116943359, | |
| "rewards/rejected": -5.742402076721191, | |
| "step": 448, | |
| "train_speed(iter/s)": 0.021181 | |
| }, | |
| { | |
| "epoch": 0.9068417066397374, | |
| "grad_norm": 3.488224983215332, | |
| "learning_rate": 0.00012350699255619677, | |
| "logits/chosen": -1.0189076662063599, | |
| "logits/rejected": -1.0452524423599243, | |
| "logps/chosen": -1.572611689567566, | |
| "logps/rejected": -41.083641052246094, | |
| "loss": 0.36099478602409363, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.19940336048603058, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20073141157627106, | |
| "rewards/margins": 3.2094714641571045, | |
| "rewards/rejected": -3.008740186691284, | |
| "step": 449, | |
| "train_speed(iter/s)": 0.021182 | |
| }, | |
| { | |
| "epoch": 0.9088613986367079, | |
| "grad_norm": 1.7710275650024414, | |
| "learning_rate": 0.00012318201502675285, | |
| "logits/chosen": -0.9990462064743042, | |
| "logits/rejected": -1.00516939163208, | |
| "logps/chosen": -1.445307731628418, | |
| "logps/rejected": -54.3629035949707, | |
| "loss": 0.2929742634296417, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14184969663619995, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3061780631542206, | |
| "rewards/margins": 4.353916645050049, | |
| "rewards/rejected": -4.047738552093506, | |
| "step": 450, | |
| "train_speed(iter/s)": 0.021182 | |
| }, | |
| { | |
| "epoch": 0.9108810906336784, | |
| "grad_norm": 5.618566989898682, | |
| "learning_rate": 0.00012285677855988864, | |
| "logits/chosen": -1.0002800226211548, | |
| "logits/rejected": -1.0010613203048706, | |
| "logps/chosen": -3.4435813426971436, | |
| "logps/rejected": -65.43953704833984, | |
| "loss": 0.5797629952430725, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2722090482711792, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.13838529586791992, | |
| "rewards/margins": 4.899312973022461, | |
| "rewards/rejected": -4.760928153991699, | |
| "step": 451, | |
| "train_speed(iter/s)": 0.021166 | |
| }, | |
| { | |
| "epoch": 0.9129007826306488, | |
| "grad_norm": 22.944427490234375, | |
| "learning_rate": 0.00012253128678841568, | |
| "logits/chosen": -1.011128544807434, | |
| "logits/rejected": -1.0143555402755737, | |
| "logps/chosen": -15.104331970214844, | |
| "logps/rejected": -42.862266540527344, | |
| "loss": 1.11042058467865, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3811737298965454, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.3371947109699249, | |
| "rewards/margins": 2.6465537548065186, | |
| "rewards/rejected": -2.983748435974121, | |
| "step": 452, | |
| "train_speed(iter/s)": 0.021166 | |
| }, | |
| { | |
| "epoch": 0.9149204746276193, | |
| "grad_norm": 4.528737545013428, | |
| "learning_rate": 0.0001222055433479972, | |
| "logits/chosen": -1.0228255987167358, | |
| "logits/rejected": -1.0586241483688354, | |
| "logps/chosen": -1.2600595951080322, | |
| "logps/rejected": -73.49124145507812, | |
| "loss": 0.28426051139831543, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14906807243824005, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2577366530895233, | |
| "rewards/margins": 5.7026872634887695, | |
| "rewards/rejected": -5.444951057434082, | |
| "step": 453, | |
| "train_speed(iter/s)": 0.021167 | |
| }, | |
| { | |
| "epoch": 0.9169401666245898, | |
| "grad_norm": 4.978267669677734, | |
| "learning_rate": 0.0001218795518771075, | |
| "logits/chosen": -1.0025545358657837, | |
| "logits/rejected": -1.0025382041931152, | |
| "logps/chosen": -0.9946606755256653, | |
| "logps/rejected": -37.86664581298828, | |
| "loss": 0.34124690294265747, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09514570236206055, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.231367290019989, | |
| "rewards/margins": 2.811678171157837, | |
| "rewards/rejected": -2.580310821533203, | |
| "step": 454, | |
| "train_speed(iter/s)": 0.021168 | |
| }, | |
| { | |
| "epoch": 0.9189598586215603, | |
| "grad_norm": 5.106620788574219, | |
| "learning_rate": 0.00012155331601699136, | |
| "logits/chosen": -1.0310418605804443, | |
| "logits/rejected": -1.0054916143417358, | |
| "logps/chosen": -1.0205014944076538, | |
| "logps/rejected": -85.00090026855469, | |
| "loss": 0.18072457611560822, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1114395335316658, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41535112261772156, | |
| "rewards/margins": 6.101562023162842, | |
| "rewards/rejected": -5.686211109161377, | |
| "step": 455, | |
| "train_speed(iter/s)": 0.021167 | |
| }, | |
| { | |
| "epoch": 0.9209795506185307, | |
| "grad_norm": 1.438368797302246, | |
| "learning_rate": 0.0001212268394116233, | |
| "logits/chosen": -1.0807647705078125, | |
| "logits/rejected": -1.057398796081543, | |
| "logps/chosen": -0.6302530765533447, | |
| "logps/rejected": -55.822792053222656, | |
| "loss": 0.25450506806373596, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09770296514034271, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2143504023551941, | |
| "rewards/margins": 4.336926460266113, | |
| "rewards/rejected": -4.1225762367248535, | |
| "step": 456, | |
| "train_speed(iter/s)": 0.021168 | |
| }, | |
| { | |
| "epoch": 0.9229992426155011, | |
| "grad_norm": 2.4940450191497803, | |
| "learning_rate": 0.00012090012570766685, | |
| "logits/chosen": -1.047285556793213, | |
| "logits/rejected": -1.0609232187271118, | |
| "logps/chosen": -3.7559874057769775, | |
| "logps/rejected": -58.776737213134766, | |
| "loss": 0.2771581709384918, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1527220904827118, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3420707583427429, | |
| "rewards/margins": 5.054807662963867, | |
| "rewards/rejected": -4.712737083435059, | |
| "step": 457, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.9250189346124716, | |
| "grad_norm": 16.446552276611328, | |
| "learning_rate": 0.00012057317855443395, | |
| "logits/chosen": -1.1021456718444824, | |
| "logits/rejected": -1.1048663854599, | |
| "logps/chosen": -5.987412452697754, | |
| "logps/rejected": -61.24203872680664, | |
| "loss": 0.6597545742988586, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.40991318225860596, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.06934911757707596, | |
| "rewards/margins": 4.689109802246094, | |
| "rewards/rejected": -4.758459091186523, | |
| "step": 458, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.927038626609442, | |
| "grad_norm": 2.537680149078369, | |
| "learning_rate": 0.00012024600160384416, | |
| "logits/chosen": -1.1070061922073364, | |
| "logits/rejected": -1.1183254718780518, | |
| "logps/chosen": -2.1882822513580322, | |
| "logps/rejected": -94.47828674316406, | |
| "loss": 0.47271794080734253, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3363499641418457, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23398056626319885, | |
| "rewards/margins": 7.600938320159912, | |
| "rewards/rejected": -7.366957187652588, | |
| "step": 459, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.9290583186064125, | |
| "grad_norm": 3.8238890171051025, | |
| "learning_rate": 0.0001199185985103836, | |
| "logits/chosen": -1.079871416091919, | |
| "logits/rejected": -1.1050368547439575, | |
| "logps/chosen": -0.6882074475288391, | |
| "logps/rejected": -112.36473846435547, | |
| "loss": 0.2024538367986679, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1239171102643013, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.41684651374816895, | |
| "rewards/margins": 8.971007347106934, | |
| "rewards/rejected": -8.554160118103027, | |
| "step": 460, | |
| "train_speed(iter/s)": 0.021169 | |
| }, | |
| { | |
| "epoch": 0.931078010603383, | |
| "grad_norm": 7.065299987792969, | |
| "learning_rate": 0.00011959097293106465, | |
| "logits/chosen": -1.1408017873764038, | |
| "logits/rejected": -1.1611324548721313, | |
| "logps/chosen": -0.8949813842773438, | |
| "logps/rejected": -44.59485626220703, | |
| "loss": 0.26141998171806335, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1390543431043625, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3610275685787201, | |
| "rewards/margins": 3.8335914611816406, | |
| "rewards/rejected": -3.4725637435913086, | |
| "step": 461, | |
| "train_speed(iter/s)": 0.02117 | |
| }, | |
| { | |
| "epoch": 0.9330977026003534, | |
| "grad_norm": 4.476932048797607, | |
| "learning_rate": 0.00011926312852538455, | |
| "logits/chosen": -1.128575086593628, | |
| "logits/rejected": -1.157038688659668, | |
| "logps/chosen": -3.6390225887298584, | |
| "logps/rejected": -63.7474365234375, | |
| "loss": 0.5282421708106995, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2585342824459076, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11798002570867538, | |
| "rewards/margins": 5.297179222106934, | |
| "rewards/rejected": -5.179199695587158, | |
| "step": 462, | |
| "train_speed(iter/s)": 0.02117 | |
| }, | |
| { | |
| "epoch": 0.9351173945973239, | |
| "grad_norm": 11.82602310180664, | |
| "learning_rate": 0.0001189350689552849, | |
| "logits/chosen": -1.1367065906524658, | |
| "logits/rejected": -1.156144618988037, | |
| "logps/chosen": -1.9807525873184204, | |
| "logps/rejected": -49.89271926879883, | |
| "loss": 0.6038030385971069, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34540605545043945, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.37543025612831116, | |
| "rewards/margins": 4.289130687713623, | |
| "rewards/rejected": -3.9137003421783447, | |
| "step": 463, | |
| "train_speed(iter/s)": 0.021171 | |
| }, | |
| { | |
| "epoch": 0.9371370865942944, | |
| "grad_norm": 12.497689247131348, | |
| "learning_rate": 0.00011860679788511064, | |
| "logits/chosen": -1.1170810461044312, | |
| "logits/rejected": -1.1292904615402222, | |
| "logps/chosen": -4.893659591674805, | |
| "logps/rejected": -60.843013763427734, | |
| "loss": 0.6962206363677979, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4090201258659363, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10479210317134857, | |
| "rewards/margins": 4.898015022277832, | |
| "rewards/rejected": -4.793222427368164, | |
| "step": 464, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.9391567785912648, | |
| "grad_norm": 2.3905272483825684, | |
| "learning_rate": 0.00011827831898156905, | |
| "logits/chosen": -1.119379997253418, | |
| "logits/rejected": -1.0900958776474, | |
| "logps/chosen": -1.0332272052764893, | |
| "logps/rejected": -82.55847930908203, | |
| "loss": 0.21928882598876953, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14558973908424377, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21076346933841705, | |
| "rewards/margins": 6.53924560546875, | |
| "rewards/rejected": -6.328482151031494, | |
| "step": 465, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.9411764705882353, | |
| "grad_norm": 2.804384708404541, | |
| "learning_rate": 0.00011794963591368893, | |
| "logits/chosen": -1.1550871133804321, | |
| "logits/rejected": -1.1876434087753296, | |
| "logps/chosen": -1.962457299232483, | |
| "logps/rejected": -91.43489837646484, | |
| "loss": 0.26453521847724915, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18894466757774353, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2565460503101349, | |
| "rewards/margins": 7.109828472137451, | |
| "rewards/rejected": -6.853282451629639, | |
| "step": 466, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.9431961625852058, | |
| "grad_norm": 6.29252290725708, | |
| "learning_rate": 0.00011762075235277943, | |
| "logits/chosen": -1.1255277395248413, | |
| "logits/rejected": -1.148550271987915, | |
| "logps/chosen": -7.0823774337768555, | |
| "logps/rejected": -84.76576232910156, | |
| "loss": 0.7452417016029358, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6746703386306763, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.21994975209236145, | |
| "rewards/margins": 6.5102715492248535, | |
| "rewards/rejected": -6.730221271514893, | |
| "step": 467, | |
| "train_speed(iter/s)": 0.021172 | |
| }, | |
| { | |
| "epoch": 0.9452158545821763, | |
| "grad_norm": 3.2159340381622314, | |
| "learning_rate": 0.00011729167197238935, | |
| "logits/chosen": -1.0966346263885498, | |
| "logits/rejected": -1.103726863861084, | |
| "logps/chosen": -4.399909496307373, | |
| "logps/rejected": -42.98252487182617, | |
| "loss": 0.7106723785400391, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3980051279067993, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04321293905377388, | |
| "rewards/margins": 3.2986812591552734, | |
| "rewards/rejected": -3.2554681301116943, | |
| "step": 468, | |
| "train_speed(iter/s)": 0.021173 | |
| }, | |
| { | |
| "epoch": 0.9472355465791467, | |
| "grad_norm": 3.3617236614227295, | |
| "learning_rate": 0.00011696239844826571, | |
| "logits/chosen": -1.1088882684707642, | |
| "logits/rejected": -1.1284962892532349, | |
| "logps/chosen": -1.639062762260437, | |
| "logps/rejected": -72.10785675048828, | |
| "loss": 0.24586933851242065, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.12198629230260849, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3906645178794861, | |
| "rewards/margins": 6.221713066101074, | |
| "rewards/rejected": -5.831048011779785, | |
| "step": 469, | |
| "train_speed(iter/s)": 0.021174 | |
| }, | |
| { | |
| "epoch": 0.9492552385761172, | |
| "grad_norm": 2.8374667167663574, | |
| "learning_rate": 0.00011663293545831302, | |
| "logits/chosen": -1.1557269096374512, | |
| "logits/rejected": -1.175348162651062, | |
| "logps/chosen": -2.1615452766418457, | |
| "logps/rejected": -36.723304748535156, | |
| "loss": 0.38634181022644043, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22775641083717346, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3754770755767822, | |
| "rewards/margins": 3.0530035495758057, | |
| "rewards/rejected": -2.6775267124176025, | |
| "step": 470, | |
| "train_speed(iter/s)": 0.021175 | |
| }, | |
| { | |
| "epoch": 0.9512749305730877, | |
| "grad_norm": 11.482617378234863, | |
| "learning_rate": 0.00011630328668255206, | |
| "logits/chosen": -1.1401901245117188, | |
| "logits/rejected": -1.1286134719848633, | |
| "logps/chosen": -6.495123386383057, | |
| "logps/rejected": -35.29318618774414, | |
| "loss": 0.8619951009750366, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5049220323562622, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13930773735046387, | |
| "rewards/margins": 2.6000585556030273, | |
| "rewards/rejected": -2.4607508182525635, | |
| "step": 471, | |
| "train_speed(iter/s)": 0.021175 | |
| }, | |
| { | |
| "epoch": 0.953294622570058, | |
| "grad_norm": 3.4752252101898193, | |
| "learning_rate": 0.00011597345580307875, | |
| "logits/chosen": -1.162688970565796, | |
| "logits/rejected": -1.192884922027588, | |
| "logps/chosen": -2.404099225997925, | |
| "logps/rejected": -56.021663665771484, | |
| "loss": 0.3634865880012512, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23837605118751526, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12834902107715607, | |
| "rewards/margins": 4.692193508148193, | |
| "rewards/rejected": -4.563844203948975, | |
| "step": 472, | |
| "train_speed(iter/s)": 0.021176 | |
| }, | |
| { | |
| "epoch": 0.9553143145670285, | |
| "grad_norm": 2.5039899349212646, | |
| "learning_rate": 0.0001156434465040231, | |
| "logits/chosen": -1.1668778657913208, | |
| "logits/rejected": -1.1930913925170898, | |
| "logps/chosen": -3.766876697540283, | |
| "logps/rejected": -63.9132194519043, | |
| "loss": 0.3028702735900879, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20875141024589539, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3659513592720032, | |
| "rewards/margins": 5.140607833862305, | |
| "rewards/rejected": -4.774656295776367, | |
| "step": 473, | |
| "train_speed(iter/s)": 0.021177 | |
| }, | |
| { | |
| "epoch": 0.957334006563999, | |
| "grad_norm": 2.068408250808716, | |
| "learning_rate": 0.00011531326247150803, | |
| "logits/chosen": -1.1649010181427002, | |
| "logits/rejected": -1.1960549354553223, | |
| "logps/chosen": -1.7281254529953003, | |
| "logps/rejected": -72.08183288574219, | |
| "loss": 0.3556201756000519, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1918855905532837, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12103867530822754, | |
| "rewards/margins": 5.5760884284973145, | |
| "rewards/rejected": -5.45504903793335, | |
| "step": 474, | |
| "train_speed(iter/s)": 0.021177 | |
| }, | |
| { | |
| "epoch": 0.9593536985609694, | |
| "grad_norm": 2.6573944091796875, | |
| "learning_rate": 0.00011498290739360815, | |
| "logits/chosen": -1.1912912130355835, | |
| "logits/rejected": -1.1985927820205688, | |
| "logps/chosen": -1.0083485841751099, | |
| "logps/rejected": -56.71221923828125, | |
| "loss": 0.2199336588382721, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09299471974372864, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2724168002605438, | |
| "rewards/margins": 4.650609493255615, | |
| "rewards/rejected": -4.37819242477417, | |
| "step": 475, | |
| "train_speed(iter/s)": 0.021178 | |
| }, | |
| { | |
| "epoch": 0.9613733905579399, | |
| "grad_norm": 5.599519729614258, | |
| "learning_rate": 0.00011465238496030868, | |
| "logits/chosen": -1.186398983001709, | |
| "logits/rejected": -1.2222926616668701, | |
| "logps/chosen": -2.25126576423645, | |
| "logps/rejected": -65.31526184082031, | |
| "loss": 0.6140868067741394, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.350625216960907, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11485815793275833, | |
| "rewards/margins": 5.405522346496582, | |
| "rewards/rejected": -5.2906646728515625, | |
| "step": 476, | |
| "train_speed(iter/s)": 0.021178 | |
| }, | |
| { | |
| "epoch": 0.9633930825549104, | |
| "grad_norm": 1.3937158584594727, | |
| "learning_rate": 0.00011432169886346404, | |
| "logits/chosen": -1.1549639701843262, | |
| "logits/rejected": -1.1829733848571777, | |
| "logps/chosen": -2.5441954135894775, | |
| "logps/rejected": -70.29151916503906, | |
| "loss": 0.24065297842025757, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1281718909740448, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2520023286342621, | |
| "rewards/margins": 5.15536642074585, | |
| "rewards/rejected": -4.903364181518555, | |
| "step": 477, | |
| "train_speed(iter/s)": 0.021179 | |
| }, | |
| { | |
| "epoch": 0.9654127745518808, | |
| "grad_norm": 3.0468287467956543, | |
| "learning_rate": 0.00011399085279675687, | |
| "logits/chosen": -1.1789178848266602, | |
| "logits/rejected": -1.2163946628570557, | |
| "logps/chosen": -4.268495082855225, | |
| "logps/rejected": -53.77469253540039, | |
| "loss": 0.40022939443588257, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2632007300853729, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3904189169406891, | |
| "rewards/margins": 4.054966926574707, | |
| "rewards/rejected": -3.66454815864563, | |
| "step": 478, | |
| "train_speed(iter/s)": 0.021179 | |
| }, | |
| { | |
| "epoch": 0.9674324665488513, | |
| "grad_norm": 6.615331172943115, | |
| "learning_rate": 0.00011365985045565648, | |
| "logits/chosen": -1.1960713863372803, | |
| "logits/rejected": -1.2022978067398071, | |
| "logps/chosen": -4.764765739440918, | |
| "logps/rejected": -46.24211120605469, | |
| "loss": 0.8375652432441711, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.47868138551712036, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2317066639661789, | |
| "rewards/margins": 3.9557816982269287, | |
| "rewards/rejected": -3.7240753173828125, | |
| "step": 479, | |
| "train_speed(iter/s)": 0.02118 | |
| }, | |
| { | |
| "epoch": 0.9694521585458218, | |
| "grad_norm": 3.0518853664398193, | |
| "learning_rate": 0.0001133286955373779, | |
| "logits/chosen": -1.1568349599838257, | |
| "logits/rejected": -1.1736950874328613, | |
| "logps/chosen": -1.8058488368988037, | |
| "logps/rejected": -63.62800979614258, | |
| "loss": 0.3420032560825348, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1940608024597168, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4025638699531555, | |
| "rewards/margins": 5.4827446937561035, | |
| "rewards/rejected": -5.080180644989014, | |
| "step": 480, | |
| "train_speed(iter/s)": 0.02118 | |
| }, | |
| { | |
| "epoch": 0.9714718505427922, | |
| "grad_norm": 6.214394569396973, | |
| "learning_rate": 0.00011299739174084025, | |
| "logits/chosen": -1.1839512586593628, | |
| "logits/rejected": -1.2068456411361694, | |
| "logps/chosen": -2.6526894569396973, | |
| "logps/rejected": -55.63904571533203, | |
| "loss": 0.44367533922195435, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2684517502784729, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1775396466255188, | |
| "rewards/margins": 4.404716968536377, | |
| "rewards/rejected": -4.227177619934082, | |
| "step": 481, | |
| "train_speed(iter/s)": 0.021181 | |
| }, | |
| { | |
| "epoch": 0.9734915425397627, | |
| "grad_norm": 5.678071975708008, | |
| "learning_rate": 0.0001126659427666257, | |
| "logits/chosen": -1.1944388151168823, | |
| "logits/rejected": -1.2148536443710327, | |
| "logps/chosen": -2.0405924320220947, | |
| "logps/rejected": -61.48400115966797, | |
| "loss": 0.40944910049438477, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23419791460037231, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34613850712776184, | |
| "rewards/margins": 5.159732818603516, | |
| "rewards/rejected": -4.813594341278076, | |
| "step": 482, | |
| "train_speed(iter/s)": 0.021182 | |
| }, | |
| { | |
| "epoch": 0.9755112345367332, | |
| "grad_norm": 26.189855575561523, | |
| "learning_rate": 0.00011233435231693794, | |
| "logits/chosen": -1.1763508319854736, | |
| "logits/rejected": -1.195464015007019, | |
| "logps/chosen": -9.439873695373535, | |
| "logps/rejected": -40.02541732788086, | |
| "loss": 1.6160178184509277, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.8637927174568176, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.2953401505947113, | |
| "rewards/margins": 2.8487725257873535, | |
| "rewards/rejected": -3.1441128253936768, | |
| "step": 483, | |
| "train_speed(iter/s)": 0.021182 | |
| }, | |
| { | |
| "epoch": 0.9775309265337037, | |
| "grad_norm": 3.0877511501312256, | |
| "learning_rate": 0.00011200262409556097, | |
| "logits/chosen": -1.1713593006134033, | |
| "logits/rejected": -1.2405827045440674, | |
| "logps/chosen": -1.0278502702713013, | |
| "logps/rejected": -76.41952514648438, | |
| "loss": 0.28457099199295044, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20625659823417664, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32308924198150635, | |
| "rewards/margins": 6.389144420623779, | |
| "rewards/rejected": -6.066054821014404, | |
| "step": 484, | |
| "train_speed(iter/s)": 0.021182 | |
| }, | |
| { | |
| "epoch": 0.979550618530674, | |
| "grad_norm": 9.65100383758545, | |
| "learning_rate": 0.00011167076180781764, | |
| "logits/chosen": -1.146728277206421, | |
| "logits/rejected": -1.2022031545639038, | |
| "logps/chosen": -5.121095657348633, | |
| "logps/rejected": -74.87187957763672, | |
| "loss": 0.5169023871421814, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4096004366874695, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2158682644367218, | |
| "rewards/margins": 5.7417778968811035, | |
| "rewards/rejected": -5.525909900665283, | |
| "step": 485, | |
| "train_speed(iter/s)": 0.021182 | |
| }, | |
| { | |
| "epoch": 0.9815703105276445, | |
| "grad_norm": 3.232163190841675, | |
| "learning_rate": 0.00011133876916052821, | |
| "logits/chosen": -1.1618849039077759, | |
| "logits/rejected": -1.19745934009552, | |
| "logps/chosen": -4.945662498474121, | |
| "logps/rejected": -65.05085754394531, | |
| "loss": 0.3440502882003784, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2677401304244995, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.08972585201263428, | |
| "rewards/margins": 5.094820976257324, | |
| "rewards/rejected": -5.0050950050354, | |
| "step": 486, | |
| "train_speed(iter/s)": 0.021183 | |
| }, | |
| { | |
| "epoch": 0.983590002524615, | |
| "grad_norm": 1.1338063478469849, | |
| "learning_rate": 0.0001110066498619692, | |
| "logits/chosen": -1.1489181518554688, | |
| "logits/rejected": -1.1883840560913086, | |
| "logps/chosen": -0.9724054336547852, | |
| "logps/rejected": -69.8716812133789, | |
| "loss": 0.16405296325683594, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1183013990521431, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37503695487976074, | |
| "rewards/margins": 6.176860809326172, | |
| "rewards/rejected": -5.801823616027832, | |
| "step": 487, | |
| "train_speed(iter/s)": 0.021183 | |
| }, | |
| { | |
| "epoch": 0.9856096945215854, | |
| "grad_norm": 4.550635814666748, | |
| "learning_rate": 0.00011067440762183164, | |
| "logits/chosen": -1.127516508102417, | |
| "logits/rejected": -1.1615864038467407, | |
| "logps/chosen": -1.5935579538345337, | |
| "logps/rejected": -70.34913635253906, | |
| "loss": 0.32236579060554504, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.21638807654380798, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30907154083251953, | |
| "rewards/margins": 4.958349704742432, | |
| "rewards/rejected": -4.649278163909912, | |
| "step": 488, | |
| "train_speed(iter/s)": 0.021183 | |
| }, | |
| { | |
| "epoch": 0.9876293865185559, | |
| "grad_norm": 4.5942206382751465, | |
| "learning_rate": 0.00011034204615117982, | |
| "logits/chosen": -1.1207928657531738, | |
| "logits/rejected": -1.1431444883346558, | |
| "logps/chosen": -2.02649188041687, | |
| "logps/rejected": -69.4359359741211, | |
| "loss": 0.45521846413612366, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2501518428325653, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21566975116729736, | |
| "rewards/margins": 4.797036647796631, | |
| "rewards/rejected": -4.581367492675781, | |
| "step": 489, | |
| "train_speed(iter/s)": 0.021183 | |
| }, | |
| { | |
| "epoch": 0.9896490785155264, | |
| "grad_norm": 3.483578681945801, | |
| "learning_rate": 0.00011000956916240985, | |
| "logits/chosen": -1.1226303577423096, | |
| "logits/rejected": -1.1501247882843018, | |
| "logps/chosen": -5.958000659942627, | |
| "logps/rejected": -32.57322311401367, | |
| "loss": 0.6992753148078918, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5034775137901306, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.47746312618255615, | |
| "rewards/margins": 2.7217843532562256, | |
| "rewards/rejected": -2.24432110786438, | |
| "step": 490, | |
| "train_speed(iter/s)": 0.021184 | |
| }, | |
| { | |
| "epoch": 0.9916687705124968, | |
| "grad_norm": 4.195751667022705, | |
| "learning_rate": 0.00010967698036920812, | |
| "logits/chosen": -1.10448157787323, | |
| "logits/rejected": -1.1570674180984497, | |
| "logps/chosen": -4.190779685974121, | |
| "logps/rejected": -60.6494255065918, | |
| "loss": 0.5290452837944031, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3574896454811096, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.35892462730407715, | |
| "rewards/margins": 4.584457874298096, | |
| "rewards/rejected": -4.225533485412598, | |
| "step": 491, | |
| "train_speed(iter/s)": 0.021184 | |
| }, | |
| { | |
| "epoch": 0.9936884625094673, | |
| "grad_norm": 1.556215524673462, | |
| "learning_rate": 0.00010934428348650986, | |
| "logits/chosen": -1.1513900756835938, | |
| "logits/rejected": -1.1773016452789307, | |
| "logps/chosen": -0.4516194462776184, | |
| "logps/rejected": -54.02649688720703, | |
| "loss": 0.15559712052345276, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.06051451712846756, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3142217993736267, | |
| "rewards/margins": 4.602743148803711, | |
| "rewards/rejected": -4.2885212898254395, | |
| "step": 492, | |
| "train_speed(iter/s)": 0.021185 | |
| }, | |
| { | |
| "epoch": 0.9957081545064378, | |
| "grad_norm": 1.837632656097412, | |
| "learning_rate": 0.00010901148223045761, | |
| "logits/chosen": -1.122188925743103, | |
| "logits/rejected": -1.1630114316940308, | |
| "logps/chosen": -1.2533413171768188, | |
| "logps/rejected": -65.71454620361328, | |
| "loss": 0.23370426893234253, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1294473558664322, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34939849376678467, | |
| "rewards/margins": 4.393534183502197, | |
| "rewards/rejected": -4.044135093688965, | |
| "step": 493, | |
| "train_speed(iter/s)": 0.021185 | |
| }, | |
| { | |
| "epoch": 0.9977278465034082, | |
| "grad_norm": 5.143455982208252, | |
| "learning_rate": 0.00010867858031835975, | |
| "logits/chosen": -1.160941481590271, | |
| "logits/rejected": -1.1693061590194702, | |
| "logps/chosen": -2.2333078384399414, | |
| "logps/rejected": -62.20633316040039, | |
| "loss": 0.33971500396728516, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23756271600723267, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17624695599079132, | |
| "rewards/margins": 5.301555633544922, | |
| "rewards/rejected": -5.125308513641357, | |
| "step": 494, | |
| "train_speed(iter/s)": 0.021186 | |
| }, | |
| { | |
| "epoch": 0.9997475385003787, | |
| "grad_norm": 1.6146841049194336, | |
| "learning_rate": 0.000108345581468649, | |
| "logits/chosen": -1.156958818435669, | |
| "logits/rejected": -1.2084702253341675, | |
| "logps/chosen": -1.2683087587356567, | |
| "logps/rejected": -73.02035522460938, | |
| "loss": 0.2508525550365448, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.12798351049423218, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23698541522026062, | |
| "rewards/margins": 5.670597553253174, | |
| "rewards/rejected": -5.433611869812012, | |
| "step": 495, | |
| "train_speed(iter/s)": 0.021186 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 1.6146841049194336, | |
| "learning_rate": 0.00010801248940084074, | |
| "logits/chosen": -1.271807074546814, | |
| "logits/rejected": -1.3348701000213623, | |
| "logps/chosen": -4.720621291198768e-05, | |
| "logps/rejected": -91.26646423339844, | |
| "loss": 1.2297836292418651e-05, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 7.867701242503244e-06, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5421666502952576, | |
| "rewards/margins": 9.30994987487793, | |
| "rewards/rejected": -8.767783164978027, | |
| "step": 496, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.0020196919969704, | |
| "grad_norm": 2.052020311355591, | |
| "learning_rate": 0.00010767930783549171, | |
| "logits/chosen": -1.1468470096588135, | |
| "logits/rejected": -1.1875897645950317, | |
| "logps/chosen": -1.5805768966674805, | |
| "logps/rejected": -60.07487869262695, | |
| "loss": 0.35193732380867004, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22589635848999023, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43169844150543213, | |
| "rewards/margins": 4.954350471496582, | |
| "rewards/rejected": -4.522652626037598, | |
| "step": 497, | |
| "train_speed(iter/s)": 0.021223 | |
| }, | |
| { | |
| "epoch": 1.004039383993941, | |
| "grad_norm": 3.080597400665283, | |
| "learning_rate": 0.00010734604049415822, | |
| "logits/chosen": -1.1931610107421875, | |
| "logits/rejected": -1.2040530443191528, | |
| "logps/chosen": -0.3329848051071167, | |
| "logps/rejected": -89.8782730102539, | |
| "loss": 0.08142131567001343, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.028553346171975136, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3950589895248413, | |
| "rewards/margins": 7.771610260009766, | |
| "rewards/rejected": -7.376551628112793, | |
| "step": 498, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.0060590759909114, | |
| "grad_norm": 1.200395941734314, | |
| "learning_rate": 0.00010701269109935474, | |
| "logits/chosen": -1.1844416856765747, | |
| "logits/rejected": -1.216762900352478, | |
| "logps/chosen": -2.2689549922943115, | |
| "logps/rejected": -74.18507385253906, | |
| "loss": 0.18864388763904572, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13327570259571075, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5378884673118591, | |
| "rewards/margins": 6.781070709228516, | |
| "rewards/rejected": -6.2431817054748535, | |
| "step": 499, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.0080787679878818, | |
| "grad_norm": 1.3004249334335327, | |
| "learning_rate": 0.00010667926337451217, | |
| "logits/chosen": -1.2056668996810913, | |
| "logits/rejected": -1.2564384937286377, | |
| "logps/chosen": -2.1434969902038574, | |
| "logps/rejected": -107.59019470214844, | |
| "loss": 0.14688310027122498, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1056690588593483, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18269282579421997, | |
| "rewards/margins": 9.098722457885742, | |
| "rewards/rejected": -8.916029930114746, | |
| "step": 500, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.0100984599848524, | |
| "grad_norm": 10.15276050567627, | |
| "learning_rate": 0.00010634576104393643, | |
| "logits/chosen": -1.2333784103393555, | |
| "logits/rejected": -1.2786855697631836, | |
| "logps/chosen": -1.4780651330947876, | |
| "logps/rejected": -113.30062866210938, | |
| "loss": 0.33663061261177063, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18906863033771515, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.19989997148513794, | |
| "rewards/margins": 9.928545951843262, | |
| "rewards/rejected": -9.728645324707031, | |
| "step": 501, | |
| "train_speed(iter/s)": 0.021209 | |
| }, | |
| { | |
| "epoch": 1.0121181519818228, | |
| "grad_norm": 1.6605217456817627, | |
| "learning_rate": 0.00010601218783276672, | |
| "logits/chosen": -1.224414348602295, | |
| "logits/rejected": -1.286801815032959, | |
| "logps/chosen": -0.5362107753753662, | |
| "logps/rejected": -101.3456802368164, | |
| "loss": 0.1514112651348114, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.07159439474344254, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21423012018203735, | |
| "rewards/margins": 8.556539535522461, | |
| "rewards/rejected": -8.342309951782227, | |
| "step": 502, | |
| "train_speed(iter/s)": 0.021209 | |
| }, | |
| { | |
| "epoch": 1.0141378439787931, | |
| "grad_norm": 12.038124084472656, | |
| "learning_rate": 0.00010567854746693396, | |
| "logits/chosen": -1.2550753355026245, | |
| "logits/rejected": -1.3067824840545654, | |
| "logps/chosen": -4.968113899230957, | |
| "logps/rejected": -76.51419067382812, | |
| "loss": 0.6970563530921936, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5403850674629211, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.015964236110448837, | |
| "rewards/margins": 6.770257472991943, | |
| "rewards/rejected": -6.7542924880981445, | |
| "step": 503, | |
| "train_speed(iter/s)": 0.02121 | |
| }, | |
| { | |
| "epoch": 1.0161575359757637, | |
| "grad_norm": 5.976532936096191, | |
| "learning_rate": 0.00010534484367311923, | |
| "logits/chosen": -1.2590959072113037, | |
| "logits/rejected": -1.3068499565124512, | |
| "logps/chosen": -2.158994436264038, | |
| "logps/rejected": -74.8353271484375, | |
| "loss": 0.34383249282836914, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22420844435691833, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4135916233062744, | |
| "rewards/margins": 6.9369611740112305, | |
| "rewards/rejected": -6.523369789123535, | |
| "step": 504, | |
| "train_speed(iter/s)": 0.02121 | |
| }, | |
| { | |
| "epoch": 1.0181772279727341, | |
| "grad_norm": 8.177599906921387, | |
| "learning_rate": 0.00010501108017871192, | |
| "logits/chosen": -1.2204450368881226, | |
| "logits/rejected": -1.2789673805236816, | |
| "logps/chosen": -1.5879818201065063, | |
| "logps/rejected": -66.489990234375, | |
| "loss": 0.35112184286117554, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18649819493293762, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.41614973545074463, | |
| "rewards/margins": 5.6356306076049805, | |
| "rewards/rejected": -5.219481468200684, | |
| "step": 505, | |
| "train_speed(iter/s)": 0.021211 | |
| }, | |
| { | |
| "epoch": 1.0201969199697045, | |
| "grad_norm": 1.072225570678711, | |
| "learning_rate": 0.00010467726071176853, | |
| "logits/chosen": -1.2156474590301514, | |
| "logits/rejected": -1.2541887760162354, | |
| "logps/chosen": -7.711733341217041, | |
| "logps/rejected": -65.3000717163086, | |
| "loss": 0.1724158525466919, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.12215537577867508, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6666063070297241, | |
| "rewards/margins": 6.159120559692383, | |
| "rewards/rejected": -5.492514133453369, | |
| "step": 506, | |
| "train_speed(iter/s)": 0.021211 | |
| }, | |
| { | |
| "epoch": 1.0222166119666751, | |
| "grad_norm": 2.4010398387908936, | |
| "learning_rate": 0.00010434338900097049, | |
| "logits/chosen": -1.2528554201126099, | |
| "logits/rejected": -1.3154045343399048, | |
| "logps/chosen": -0.8416248559951782, | |
| "logps/rejected": -69.87122344970703, | |
| "loss": 0.12864626944065094, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.07988111674785614, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31406697630882263, | |
| "rewards/margins": 6.217660903930664, | |
| "rewards/rejected": -5.903594493865967, | |
| "step": 507, | |
| "train_speed(iter/s)": 0.021212 | |
| }, | |
| { | |
| "epoch": 1.0242363039636455, | |
| "grad_norm": 1.6103118658065796, | |
| "learning_rate": 0.00010400946877558293, | |
| "logits/chosen": -1.171745777130127, | |
| "logits/rejected": -1.205277919769287, | |
| "logps/chosen": -1.2725749015808105, | |
| "logps/rejected": -75.42990112304688, | |
| "loss": 0.17115575075149536, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11690245568752289, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.42929667234420776, | |
| "rewards/margins": 5.8164963722229, | |
| "rewards/rejected": -5.387199878692627, | |
| "step": 508, | |
| "train_speed(iter/s)": 0.021212 | |
| }, | |
| { | |
| "epoch": 1.0262559959606161, | |
| "grad_norm": 7.029423713684082, | |
| "learning_rate": 0.00010367550376541283, | |
| "logits/chosen": -1.205200433731079, | |
| "logits/rejected": -1.2511245012283325, | |
| "logps/chosen": -2.5946669578552246, | |
| "logps/rejected": -84.32099914550781, | |
| "loss": 0.30733728408813477, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2792370319366455, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25035470724105835, | |
| "rewards/margins": 6.80730676651001, | |
| "rewards/rejected": -6.556951999664307, | |
| "step": 509, | |
| "train_speed(iter/s)": 0.021213 | |
| }, | |
| { | |
| "epoch": 1.0282756879575865, | |
| "grad_norm": 0.7719494700431824, | |
| "learning_rate": 0.00010334149770076747, | |
| "logits/chosen": -1.2033907175064087, | |
| "logits/rejected": -1.2671985626220703, | |
| "logps/chosen": -0.1477760523557663, | |
| "logps/rejected": -67.04902648925781, | |
| "loss": 0.06301882117986679, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.029819779098033905, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3393843173980713, | |
| "rewards/margins": 5.922677516937256, | |
| "rewards/rejected": -5.5832929611206055, | |
| "step": 510, | |
| "train_speed(iter/s)": 0.021213 | |
| }, | |
| { | |
| "epoch": 1.030295379954557, | |
| "grad_norm": 6.209945201873779, | |
| "learning_rate": 0.00010300745431241259, | |
| "logits/chosen": -1.1784838438034058, | |
| "logits/rejected": -1.2575358152389526, | |
| "logps/chosen": -2.9259207248687744, | |
| "logps/rejected": -66.25347137451172, | |
| "loss": 0.493066668510437, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.34985142946243286, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2988048195838928, | |
| "rewards/margins": 5.669159412384033, | |
| "rewards/rejected": -5.370354652404785, | |
| "step": 511, | |
| "train_speed(iter/s)": 0.021214 | |
| }, | |
| { | |
| "epoch": 1.0323150719515275, | |
| "grad_norm": 14.864357948303223, | |
| "learning_rate": 0.00010267337733153089, | |
| "logits/chosen": -1.211972951889038, | |
| "logits/rejected": -1.2457599639892578, | |
| "logps/chosen": -4.108205795288086, | |
| "logps/rejected": -49.29187774658203, | |
| "loss": 0.7474625110626221, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5005552768707275, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1060146689414978, | |
| "rewards/margins": 3.993147134780884, | |
| "rewards/rejected": -3.8871326446533203, | |
| "step": 512, | |
| "train_speed(iter/s)": 0.021214 | |
| }, | |
| { | |
| "epoch": 1.0343347639484979, | |
| "grad_norm": 4.5455522537231445, | |
| "learning_rate": 0.0001023392704896803, | |
| "logits/chosen": -1.1689393520355225, | |
| "logits/rejected": -1.1586272716522217, | |
| "logps/chosen": -2.678110361099243, | |
| "logps/rejected": -66.11392974853516, | |
| "loss": 0.3088136315345764, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2110619693994522, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2811347544193268, | |
| "rewards/margins": 5.262904167175293, | |
| "rewards/rejected": -4.981769561767578, | |
| "step": 513, | |
| "train_speed(iter/s)": 0.021214 | |
| }, | |
| { | |
| "epoch": 1.0363544559454683, | |
| "grad_norm": 6.412376880645752, | |
| "learning_rate": 0.00010200513751875227, | |
| "logits/chosen": -1.1625449657440186, | |
| "logits/rejected": -1.1948907375335693, | |
| "logps/chosen": -2.3596391677856445, | |
| "logps/rejected": -68.15946197509766, | |
| "loss": 0.39961010217666626, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.26144012808799744, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3064810037612915, | |
| "rewards/margins": 5.5451202392578125, | |
| "rewards/rejected": -5.2386393547058105, | |
| "step": 514, | |
| "train_speed(iter/s)": 0.021215 | |
| }, | |
| { | |
| "epoch": 1.0383741479424389, | |
| "grad_norm": 2.85520601272583, | |
| "learning_rate": 0.00010167098215093009, | |
| "logits/chosen": -1.1633456945419312, | |
| "logits/rejected": -1.2228730916976929, | |
| "logps/chosen": -3.7188360691070557, | |
| "logps/rejected": -95.9930419921875, | |
| "loss": 0.2916540801525116, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23056216537952423, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3937748074531555, | |
| "rewards/margins": 7.421454429626465, | |
| "rewards/rejected": -7.027679443359375, | |
| "step": 515, | |
| "train_speed(iter/s)": 0.021214 | |
| }, | |
| { | |
| "epoch": 1.0403938399394093, | |
| "grad_norm": 5.375782012939453, | |
| "learning_rate": 0.00010133680811864727, | |
| "logits/chosen": -1.1782926321029663, | |
| "logits/rejected": -1.2417353391647339, | |
| "logps/chosen": -1.3107043504714966, | |
| "logps/rejected": -53.36506652832031, | |
| "loss": 0.19477064907550812, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14968222379684448, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25208836793899536, | |
| "rewards/margins": 4.3324995040893555, | |
| "rewards/rejected": -4.080410957336426, | |
| "step": 516, | |
| "train_speed(iter/s)": 0.021215 | |
| }, | |
| { | |
| "epoch": 1.0424135319363796, | |
| "grad_norm": 1.9422154426574707, | |
| "learning_rate": 0.00010100261915454571, | |
| "logits/chosen": -1.1514760255813599, | |
| "logits/rejected": -1.2427828311920166, | |
| "logps/chosen": -0.6266792416572571, | |
| "logps/rejected": -79.95481872558594, | |
| "loss": 0.09264641255140305, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.06077795848250389, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45081964135169983, | |
| "rewards/margins": 6.714786529541016, | |
| "rewards/rejected": -6.263967037200928, | |
| "step": 517, | |
| "train_speed(iter/s)": 0.021215 | |
| }, | |
| { | |
| "epoch": 1.0444332239333503, | |
| "grad_norm": 20.16422462463379, | |
| "learning_rate": 0.00010066841899143425, | |
| "logits/chosen": -1.1963735818862915, | |
| "logits/rejected": -1.2633908987045288, | |
| "logps/chosen": -6.527058124542236, | |
| "logps/rejected": -39.10000991821289, | |
| "loss": 0.7584791779518127, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5177947878837585, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3015112280845642, | |
| "rewards/margins": 3.383577585220337, | |
| "rewards/rejected": -3.082066535949707, | |
| "step": 518, | |
| "train_speed(iter/s)": 0.021215 | |
| }, | |
| { | |
| "epoch": 1.0464529159303206, | |
| "grad_norm": 7.269643783569336, | |
| "learning_rate": 0.00010033421136224659, | |
| "logits/chosen": -1.1538660526275635, | |
| "logits/rejected": -1.1920374631881714, | |
| "logps/chosen": -1.6170885562896729, | |
| "logps/rejected": -57.34727096557617, | |
| "loss": 0.1741914451122284, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11453510820865631, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2959902584552765, | |
| "rewards/margins": 4.944981575012207, | |
| "rewards/rejected": -4.648991584777832, | |
| "step": 519, | |
| "train_speed(iter/s)": 0.021216 | |
| }, | |
| { | |
| "epoch": 1.048472607927291, | |
| "grad_norm": 2.5758349895477295, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -1.1641168594360352, | |
| "logits/rejected": -1.2306013107299805, | |
| "logps/chosen": -2.8853821754455566, | |
| "logps/rejected": -45.58841323852539, | |
| "loss": 0.35295766592025757, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2536754012107849, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34334903955459595, | |
| "rewards/margins": 3.8398725986480713, | |
| "rewards/rejected": -3.49652361869812, | |
| "step": 520, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.0504922999242616, | |
| "grad_norm": 3.192835569381714, | |
| "learning_rate": 9.966578863775344e-05, | |
| "logits/chosen": -1.1690419912338257, | |
| "logits/rejected": -1.2847118377685547, | |
| "logps/chosen": -1.6086413860321045, | |
| "logps/rejected": -75.8061294555664, | |
| "loss": 0.2794322371482849, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20665356516838074, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3336547017097473, | |
| "rewards/margins": 6.422711372375488, | |
| "rewards/rejected": -6.089056491851807, | |
| "step": 521, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.052511991921232, | |
| "grad_norm": 5.373813629150391, | |
| "learning_rate": 9.93315810085658e-05, | |
| "logits/chosen": -1.099102258682251, | |
| "logits/rejected": -1.2499687671661377, | |
| "logps/chosen": -0.8937387466430664, | |
| "logps/rejected": -83.5426254272461, | |
| "loss": 0.22286824882030487, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1412465125322342, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34925389289855957, | |
| "rewards/margins": 6.224581718444824, | |
| "rewards/rejected": -5.8753275871276855, | |
| "step": 522, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.0545316839182024, | |
| "grad_norm": 1.588864803314209, | |
| "learning_rate": 9.89973808454543e-05, | |
| "logits/chosen": -1.2088499069213867, | |
| "logits/rejected": -1.2908425331115723, | |
| "logps/chosen": -1.425804615020752, | |
| "logps/rejected": -84.73382568359375, | |
| "loss": 0.24856942892074585, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17529940605163574, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33582112193107605, | |
| "rewards/margins": 7.493390083312988, | |
| "rewards/rejected": -7.157568454742432, | |
| "step": 523, | |
| "train_speed(iter/s)": 0.021218 | |
| }, | |
| { | |
| "epoch": 1.056551375915173, | |
| "grad_norm": 11.534995079040527, | |
| "learning_rate": 9.866319188135274e-05, | |
| "logits/chosen": -1.155828833580017, | |
| "logits/rejected": -1.226155400276184, | |
| "logps/chosen": -2.9224207401275635, | |
| "logps/rejected": -76.7179946899414, | |
| "loss": 0.39948102831840515, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.28366178274154663, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40342777967453003, | |
| "rewards/margins": 6.173599720001221, | |
| "rewards/rejected": -5.770172119140625, | |
| "step": 524, | |
| "train_speed(iter/s)": 0.021218 | |
| }, | |
| { | |
| "epoch": 1.0585710679121434, | |
| "grad_norm": 3.017298936843872, | |
| "learning_rate": 9.83290178490699e-05, | |
| "logits/chosen": -1.2128490209579468, | |
| "logits/rejected": -1.3072235584259033, | |
| "logps/chosen": -2.281188488006592, | |
| "logps/rejected": -75.67351531982422, | |
| "loss": 0.28667759895324707, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2029131054878235, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27607351541519165, | |
| "rewards/margins": 6.455198287963867, | |
| "rewards/rejected": -6.17912483215332, | |
| "step": 525, | |
| "train_speed(iter/s)": 0.021218 | |
| }, | |
| { | |
| "epoch": 1.0605907599091138, | |
| "grad_norm": 2.768603563308716, | |
| "learning_rate": 9.799486248124775e-05, | |
| "logits/chosen": -1.1740716695785522, | |
| "logits/rejected": -1.267440915107727, | |
| "logps/chosen": -3.626737594604492, | |
| "logps/rejected": -79.38348388671875, | |
| "loss": 0.2453736811876297, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15417639911174774, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.7520807385444641, | |
| "rewards/margins": 7.059826850891113, | |
| "rewards/rejected": -6.307745933532715, | |
| "step": 526, | |
| "train_speed(iter/s)": 0.021218 | |
| }, | |
| { | |
| "epoch": 1.0626104519060844, | |
| "grad_norm": 2.207165002822876, | |
| "learning_rate": 9.766072951031972e-05, | |
| "logits/chosen": -1.2672584056854248, | |
| "logits/rejected": -1.32329261302948, | |
| "logps/chosen": -1.5716861486434937, | |
| "logps/rejected": -68.19523620605469, | |
| "loss": 0.20522795617580414, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.16552022099494934, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3385736048221588, | |
| "rewards/margins": 5.919947624206543, | |
| "rewards/rejected": -5.581373691558838, | |
| "step": 527, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.0646301439030548, | |
| "grad_norm": 1.6318920850753784, | |
| "learning_rate": 9.732662266846912e-05, | |
| "logits/chosen": -1.157897710800171, | |
| "logits/rejected": -1.2902889251708984, | |
| "logps/chosen": -1.1771454811096191, | |
| "logps/rejected": -94.12054443359375, | |
| "loss": 0.21492774784564972, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17460428178310394, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3003194034099579, | |
| "rewards/margins": 8.205141067504883, | |
| "rewards/rejected": -7.904821395874023, | |
| "step": 528, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.0666498359000252, | |
| "grad_norm": 5.924353122711182, | |
| "learning_rate": 9.699254568758741e-05, | |
| "logits/chosen": -1.2643760442733765, | |
| "logits/rejected": -1.368143081665039, | |
| "logps/chosen": -1.368375301361084, | |
| "logps/rejected": -86.12940979003906, | |
| "loss": 0.14123007655143738, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11123973876237869, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3200608789920807, | |
| "rewards/margins": 7.876832008361816, | |
| "rewards/rejected": -7.556771278381348, | |
| "step": 529, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.0686695278969958, | |
| "grad_norm": 1.9186508655548096, | |
| "learning_rate": 9.665850229923258e-05, | |
| "logits/chosen": -1.2655577659606934, | |
| "logits/rejected": -1.344153642654419, | |
| "logps/chosen": -0.23585116863250732, | |
| "logps/rejected": -80.97904968261719, | |
| "loss": 0.11053043603897095, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.04247582331299782, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3903675675392151, | |
| "rewards/margins": 7.256943702697754, | |
| "rewards/rejected": -6.866576194763184, | |
| "step": 530, | |
| "train_speed(iter/s)": 0.02122 | |
| }, | |
| { | |
| "epoch": 1.0706892198939661, | |
| "grad_norm": 1.6089398860931396, | |
| "learning_rate": 9.632449623458718e-05, | |
| "logits/chosen": -1.2310450077056885, | |
| "logits/rejected": -1.306509256362915, | |
| "logps/chosen": -1.039363145828247, | |
| "logps/rejected": -56.28333282470703, | |
| "loss": 0.18445441126823425, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09440238028764725, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4418891668319702, | |
| "rewards/margins": 4.846897602081299, | |
| "rewards/rejected": -4.405008792877197, | |
| "step": 531, | |
| "train_speed(iter/s)": 0.021221 | |
| }, | |
| { | |
| "epoch": 1.0727089118909365, | |
| "grad_norm": 4.852963447570801, | |
| "learning_rate": 9.59905312244171e-05, | |
| "logits/chosen": -1.2377697229385376, | |
| "logits/rejected": -1.3623260259628296, | |
| "logps/chosen": -0.7856588363647461, | |
| "logps/rejected": -99.22467041015625, | |
| "loss": 0.1534590870141983, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11053737998008728, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.27947190403938293, | |
| "rewards/margins": 8.624140739440918, | |
| "rewards/rejected": -8.3446683883667, | |
| "step": 532, | |
| "train_speed(iter/s)": 0.021221 | |
| }, | |
| { | |
| "epoch": 1.0747286038879071, | |
| "grad_norm": 10.742178916931152, | |
| "learning_rate": 9.565661099902952e-05, | |
| "logits/chosen": -1.1463772058486938, | |
| "logits/rejected": -1.2955669164657593, | |
| "logps/chosen": -3.547930955886841, | |
| "logps/rejected": -82.50328063964844, | |
| "loss": 0.657089352607727, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.4685670733451843, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0838821679353714, | |
| "rewards/margins": 6.732100009918213, | |
| "rewards/rejected": -6.64821720123291, | |
| "step": 533, | |
| "train_speed(iter/s)": 0.021221 | |
| }, | |
| { | |
| "epoch": 1.0767482958848775, | |
| "grad_norm": 1.633371114730835, | |
| "learning_rate": 9.532273928823151e-05, | |
| "logits/chosen": -1.2212746143341064, | |
| "logits/rejected": -1.269982099533081, | |
| "logps/chosen": -3.351022243499756, | |
| "logps/rejected": -92.98002624511719, | |
| "loss": 0.20061077177524567, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09750235080718994, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.6985870599746704, | |
| "rewards/margins": 7.949156284332275, | |
| "rewards/rejected": -7.250568389892578, | |
| "step": 534, | |
| "train_speed(iter/s)": 0.021221 | |
| }, | |
| { | |
| "epoch": 1.078767987881848, | |
| "grad_norm": 1.1351590156555176, | |
| "learning_rate": 9.498891982128809e-05, | |
| "logits/chosen": -1.2288845777511597, | |
| "logits/rejected": -1.3357539176940918, | |
| "logps/chosen": -0.435973584651947, | |
| "logps/rejected": -82.69353485107422, | |
| "loss": 0.06550046801567078, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.051096200942993164, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3056626617908478, | |
| "rewards/margins": 7.295601844787598, | |
| "rewards/rejected": -6.989939212799072, | |
| "step": 535, | |
| "train_speed(iter/s)": 0.021222 | |
| }, | |
| { | |
| "epoch": 1.0807876798788185, | |
| "grad_norm": 7.175545692443848, | |
| "learning_rate": 9.46551563268808e-05, | |
| "logits/chosen": -1.1364165544509888, | |
| "logits/rejected": -1.2312272787094116, | |
| "logps/chosen": -3.2798967361450195, | |
| "logps/rejected": -68.39805603027344, | |
| "loss": 0.40154242515563965, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.27947506308555603, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20716847479343414, | |
| "rewards/margins": 5.617040634155273, | |
| "rewards/rejected": -5.409872531890869, | |
| "step": 536, | |
| "train_speed(iter/s)": 0.021222 | |
| }, | |
| { | |
| "epoch": 1.082807371875789, | |
| "grad_norm": 16.1717472076416, | |
| "learning_rate": 9.432145253306604e-05, | |
| "logits/chosen": -1.1581474542617798, | |
| "logits/rejected": -1.275297999382019, | |
| "logps/chosen": -6.416726112365723, | |
| "logps/rejected": -84.11360931396484, | |
| "loss": 0.6197578310966492, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.6048212647438049, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3198436498641968, | |
| "rewards/margins": 7.643919944763184, | |
| "rewards/rejected": -7.324074745178223, | |
| "step": 537, | |
| "train_speed(iter/s)": 0.021223 | |
| }, | |
| { | |
| "epoch": 1.0848270638727593, | |
| "grad_norm": 16.336959838867188, | |
| "learning_rate": 9.398781216723331e-05, | |
| "logits/chosen": -1.035546898841858, | |
| "logits/rejected": -1.2581911087036133, | |
| "logps/chosen": -1.4019535779953003, | |
| "logps/rejected": -93.62826538085938, | |
| "loss": 0.3454136550426483, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.23441605269908905, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2636178433895111, | |
| "rewards/margins": 8.16170597076416, | |
| "rewards/rejected": -7.898087501525879, | |
| "step": 538, | |
| "train_speed(iter/s)": 0.021223 | |
| }, | |
| { | |
| "epoch": 1.08684675586973, | |
| "grad_norm": 4.587718963623047, | |
| "learning_rate": 9.36542389560636e-05, | |
| "logits/chosen": -1.0745295286178589, | |
| "logits/rejected": -1.2483410835266113, | |
| "logps/chosen": -5.092793941497803, | |
| "logps/rejected": -87.74403381347656, | |
| "loss": 0.5541177988052368, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.42148298025131226, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3391857147216797, | |
| "rewards/margins": 7.316706657409668, | |
| "rewards/rejected": -6.977520942687988, | |
| "step": 539, | |
| "train_speed(iter/s)": 0.021223 | |
| }, | |
| { | |
| "epoch": 1.0888664478667003, | |
| "grad_norm": 2.1240127086639404, | |
| "learning_rate": 9.332073662548784e-05, | |
| "logits/chosen": -1.1243212223052979, | |
| "logits/rejected": -1.193894863128662, | |
| "logps/chosen": -1.587296724319458, | |
| "logps/rejected": -59.78162384033203, | |
| "loss": 0.28339654207229614, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18274566531181335, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2662951350212097, | |
| "rewards/margins": 5.166958808898926, | |
| "rewards/rejected": -4.900664329528809, | |
| "step": 540, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.090886139863671, | |
| "grad_norm": 2.6355695724487305, | |
| "learning_rate": 9.29873089006453e-05, | |
| "logits/chosen": -1.0941351652145386, | |
| "logits/rejected": -1.2066431045532227, | |
| "logps/chosen": -1.4627405405044556, | |
| "logps/rejected": -77.10699462890625, | |
| "loss": 0.2207845151424408, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13547611236572266, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3999878466129303, | |
| "rewards/margins": 6.711189270019531, | |
| "rewards/rejected": -6.311202049255371, | |
| "step": 541, | |
| "train_speed(iter/s)": 0.021225 | |
| }, | |
| { | |
| "epoch": 1.0929058318606413, | |
| "grad_norm": 2.05720853805542, | |
| "learning_rate": 9.26539595058418e-05, | |
| "logits/chosen": -1.0910502672195435, | |
| "logits/rejected": -1.2283904552459717, | |
| "logps/chosen": -1.5382826328277588, | |
| "logps/rejected": -76.15080261230469, | |
| "loss": 0.25323227047920227, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1447850912809372, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3722470700740814, | |
| "rewards/margins": 6.785793304443359, | |
| "rewards/rejected": -6.413545608520508, | |
| "step": 542, | |
| "train_speed(iter/s)": 0.021225 | |
| }, | |
| { | |
| "epoch": 1.0949255238576117, | |
| "grad_norm": 2.266726493835449, | |
| "learning_rate": 9.23206921645083e-05, | |
| "logits/chosen": -1.0470198392868042, | |
| "logits/rejected": -1.150384545326233, | |
| "logps/chosen": -3.195725679397583, | |
| "logps/rejected": -61.4305534362793, | |
| "loss": 0.293194055557251, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2274458259344101, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5585137605667114, | |
| "rewards/margins": 5.642398834228516, | |
| "rewards/rejected": -5.083885192871094, | |
| "step": 543, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.0969452158545823, | |
| "grad_norm": 2.564605474472046, | |
| "learning_rate": 9.198751059915925e-05, | |
| "logits/chosen": -1.0186107158660889, | |
| "logits/rejected": -1.2122492790222168, | |
| "logps/chosen": -2.0936737060546875, | |
| "logps/rejected": -82.15401458740234, | |
| "loss": 0.34008562564849854, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2496323138475418, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31812718510627747, | |
| "rewards/margins": 6.999300479888916, | |
| "rewards/rejected": -6.6811723709106445, | |
| "step": 544, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.0989649078515527, | |
| "grad_norm": 9.990952491760254, | |
| "learning_rate": 9.165441853135104e-05, | |
| "logits/chosen": -1.1474440097808838, | |
| "logits/rejected": -1.2639394998550415, | |
| "logps/chosen": -1.8011548519134521, | |
| "logps/rejected": -73.41018676757812, | |
| "loss": 0.36625638604164124, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.29132476449012756, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21145863831043243, | |
| "rewards/margins": 6.8196306228637695, | |
| "rewards/rejected": -6.608172416687012, | |
| "step": 545, | |
| "train_speed(iter/s)": 0.021227 | |
| }, | |
| { | |
| "epoch": 1.100984599848523, | |
| "grad_norm": 2.7831358909606934, | |
| "learning_rate": 9.132141968164026e-05, | |
| "logits/chosen": -1.0405611991882324, | |
| "logits/rejected": -1.2216545343399048, | |
| "logps/chosen": -1.1892681121826172, | |
| "logps/rejected": -94.48490905761719, | |
| "loss": 0.25090837478637695, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14087605476379395, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3783609867095947, | |
| "rewards/margins": 8.133208274841309, | |
| "rewards/rejected": -7.754847526550293, | |
| "step": 546, | |
| "train_speed(iter/s)": 0.021227 | |
| }, | |
| { | |
| "epoch": 1.1030042918454936, | |
| "grad_norm": 8.550939559936523, | |
| "learning_rate": 9.098851776954241e-05, | |
| "logits/chosen": -1.0600169897079468, | |
| "logits/rejected": -1.1879816055297852, | |
| "logps/chosen": -2.9978091716766357, | |
| "logps/rejected": -69.18419647216797, | |
| "loss": 0.491380512714386, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.32408130168914795, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21779419481754303, | |
| "rewards/margins": 5.817697048187256, | |
| "rewards/rejected": -5.599903106689453, | |
| "step": 547, | |
| "train_speed(iter/s)": 0.021227 | |
| }, | |
| { | |
| "epoch": 1.105023983842464, | |
| "grad_norm": 14.694620132446289, | |
| "learning_rate": 9.065571651349015e-05, | |
| "logits/chosen": -1.0587307214736938, | |
| "logits/rejected": -1.1352782249450684, | |
| "logps/chosen": -2.723759174346924, | |
| "logps/rejected": -73.38800048828125, | |
| "loss": 0.3820952773094177, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.28878253698349, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25954926013946533, | |
| "rewards/margins": 6.028653621673584, | |
| "rewards/rejected": -5.769104480743408, | |
| "step": 548, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.1070436758394344, | |
| "grad_norm": 3.4368412494659424, | |
| "learning_rate": 9.032301963079191e-05, | |
| "logits/chosen": -1.0471107959747314, | |
| "logits/rejected": -1.216453194618225, | |
| "logps/chosen": -2.2245757579803467, | |
| "logps/rejected": -64.19511413574219, | |
| "loss": 0.2849371135234833, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2175203114748001, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3077858090400696, | |
| "rewards/margins": 5.670999526977539, | |
| "rewards/rejected": -5.363213539123535, | |
| "step": 549, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.109063367836405, | |
| "grad_norm": 2.0185515880584717, | |
| "learning_rate": 8.999043083759017e-05, | |
| "logits/chosen": -1.0703552961349487, | |
| "logits/rejected": -1.2551573514938354, | |
| "logps/chosen": -1.0120265483856201, | |
| "logps/rejected": -85.53215026855469, | |
| "loss": 0.15907928347587585, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.11441606283187866, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2885012924671173, | |
| "rewards/margins": 7.635853290557861, | |
| "rewards/rejected": -7.347352504730225, | |
| "step": 550, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.1110830598333754, | |
| "grad_norm": 2.8778460025787354, | |
| "learning_rate": 8.965795384882021e-05, | |
| "logits/chosen": -0.9114001393318176, | |
| "logits/rejected": -1.166597604751587, | |
| "logps/chosen": -1.139864444732666, | |
| "logps/rejected": -100.16082000732422, | |
| "loss": 0.30031049251556396, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2430577278137207, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24268564581871033, | |
| "rewards/margins": 8.84631633758545, | |
| "rewards/rejected": -8.603631019592285, | |
| "step": 551, | |
| "train_speed(iter/s)": 0.021214 | |
| }, | |
| { | |
| "epoch": 1.1131027518303458, | |
| "grad_norm": 2.5478785037994385, | |
| "learning_rate": 8.932559237816839e-05, | |
| "logits/chosen": -0.9818710088729858, | |
| "logits/rejected": -1.225954532623291, | |
| "logps/chosen": -3.4108481407165527, | |
| "logps/rejected": -79.83183288574219, | |
| "loss": 0.4420861601829529, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3446241617202759, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22779923677444458, | |
| "rewards/margins": 6.333407402038574, | |
| "rewards/rejected": -6.105607509613037, | |
| "step": 552, | |
| "train_speed(iter/s)": 0.021214 | |
| }, | |
| { | |
| "epoch": 1.1151224438273164, | |
| "grad_norm": 6.415960788726807, | |
| "learning_rate": 8.899335013803084e-05, | |
| "logits/chosen": -1.091843605041504, | |
| "logits/rejected": -1.242721438407898, | |
| "logps/chosen": -1.220659613609314, | |
| "logps/rejected": -61.345306396484375, | |
| "loss": 0.22371630370616913, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1757785677909851, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40316012501716614, | |
| "rewards/margins": 5.553282737731934, | |
| "rewards/rejected": -5.150122165679932, | |
| "step": 553, | |
| "train_speed(iter/s)": 0.021215 | |
| }, | |
| { | |
| "epoch": 1.1171421358242868, | |
| "grad_norm": 1.3796110153198242, | |
| "learning_rate": 8.866123083947182e-05, | |
| "logits/chosen": -1.075179100036621, | |
| "logits/rejected": -1.1752409934997559, | |
| "logps/chosen": -1.5424776077270508, | |
| "logps/rejected": -65.63243103027344, | |
| "loss": 0.23596073687076569, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18632307648658752, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34452810883522034, | |
| "rewards/margins": 5.910964012145996, | |
| "rewards/rejected": -5.566435813903809, | |
| "step": 554, | |
| "train_speed(iter/s)": 0.021215 | |
| }, | |
| { | |
| "epoch": 1.1191618278212572, | |
| "grad_norm": 3.3275868892669678, | |
| "learning_rate": 8.832923819218238e-05, | |
| "logits/chosen": -1.001117467880249, | |
| "logits/rejected": -1.1721633672714233, | |
| "logps/chosen": -1.894881010055542, | |
| "logps/rejected": -61.61512756347656, | |
| "loss": 0.35188451409339905, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3188917636871338, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12245701998472214, | |
| "rewards/margins": 5.278988838195801, | |
| "rewards/rejected": -5.15653133392334, | |
| "step": 555, | |
| "train_speed(iter/s)": 0.021216 | |
| }, | |
| { | |
| "epoch": 1.1211815198182278, | |
| "grad_norm": 1.58943510055542, | |
| "learning_rate": 8.799737590443902e-05, | |
| "logits/chosen": -0.9907103776931763, | |
| "logits/rejected": -1.2039836645126343, | |
| "logps/chosen": -3.9374332427978516, | |
| "logps/rejected": -85.5752944946289, | |
| "loss": 0.3835102617740631, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3536885380744934, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1798345446586609, | |
| "rewards/margins": 7.102011203765869, | |
| "rewards/rejected": -6.922177314758301, | |
| "step": 556, | |
| "train_speed(iter/s)": 0.021216 | |
| }, | |
| { | |
| "epoch": 1.1232012118151982, | |
| "grad_norm": 4.0305495262146, | |
| "learning_rate": 8.766564768306207e-05, | |
| "logits/chosen": -1.1515066623687744, | |
| "logits/rejected": -1.214231252670288, | |
| "logps/chosen": -0.7779844999313354, | |
| "logps/rejected": -56.81134796142578, | |
| "loss": 0.1507856547832489, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.0650799572467804, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30766594409942627, | |
| "rewards/margins": 5.128314971923828, | |
| "rewards/rejected": -4.820648670196533, | |
| "step": 557, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.1252209038121685, | |
| "grad_norm": 4.040610313415527, | |
| "learning_rate": 8.733405723337432e-05, | |
| "logits/chosen": -1.0960428714752197, | |
| "logits/rejected": -1.2518525123596191, | |
| "logps/chosen": -0.9766073226928711, | |
| "logps/rejected": -73.12732696533203, | |
| "loss": 0.26937615871429443, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1882752627134323, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.26189538836479187, | |
| "rewards/margins": 6.15379524230957, | |
| "rewards/rejected": -5.891900062561035, | |
| "step": 558, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.1272405958091392, | |
| "grad_norm": 2.961078643798828, | |
| "learning_rate": 8.700260825915976e-05, | |
| "logits/chosen": -0.997047483921051, | |
| "logits/rejected": -1.174019455909729, | |
| "logps/chosen": -1.8312853574752808, | |
| "logps/rejected": -93.381591796875, | |
| "loss": 0.2475411295890808, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.21483805775642395, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3925812244415283, | |
| "rewards/margins": 7.863485336303711, | |
| "rewards/rejected": -7.470904350280762, | |
| "step": 559, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.1292602878061095, | |
| "grad_norm": 13.051665306091309, | |
| "learning_rate": 8.667130446262214e-05, | |
| "logits/chosen": -0.8055945634841919, | |
| "logits/rejected": -1.1168835163116455, | |
| "logps/chosen": -1.7664347887039185, | |
| "logps/rejected": -100.53841400146484, | |
| "loss": 0.30384474992752075, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2042587250471115, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1575130969285965, | |
| "rewards/margins": 8.052501678466797, | |
| "rewards/rejected": -7.894989490509033, | |
| "step": 560, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.1312799798030801, | |
| "grad_norm": 2.204517364501953, | |
| "learning_rate": 8.634014954434355e-05, | |
| "logits/chosen": -0.9541032314300537, | |
| "logits/rejected": -1.1428359746932983, | |
| "logps/chosen": -0.8130196928977966, | |
| "logps/rejected": -77.63139343261719, | |
| "loss": 0.11135084927082062, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.06836092472076416, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31184935569763184, | |
| "rewards/margins": 5.629817485809326, | |
| "rewards/rejected": -5.317968368530273, | |
| "step": 561, | |
| "train_speed(iter/s)": 0.021217 | |
| }, | |
| { | |
| "epoch": 1.1332996718000505, | |
| "grad_norm": 0.7750061750411987, | |
| "learning_rate": 8.600914720324316e-05, | |
| "logits/chosen": -1.127307415008545, | |
| "logits/rejected": -1.2096644639968872, | |
| "logps/chosen": -0.43007510900497437, | |
| "logps/rejected": -60.772300720214844, | |
| "loss": 0.0971565991640091, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.06539256125688553, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.367216557264328, | |
| "rewards/margins": 5.615878105163574, | |
| "rewards/rejected": -5.248661041259766, | |
| "step": 562, | |
| "train_speed(iter/s)": 0.021218 | |
| }, | |
| { | |
| "epoch": 1.135319363797021, | |
| "grad_norm": 2.891634464263916, | |
| "learning_rate": 8.567830113653597e-05, | |
| "logits/chosen": -1.1409940719604492, | |
| "logits/rejected": -1.1916230916976929, | |
| "logps/chosen": -1.7586002349853516, | |
| "logps/rejected": -63.676971435546875, | |
| "loss": 0.2738097012042999, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.18838034570217133, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5218551158905029, | |
| "rewards/margins": 5.294318675994873, | |
| "rewards/rejected": -4.772463798522949, | |
| "step": 563, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.1373390557939915, | |
| "grad_norm": 1.045423150062561, | |
| "learning_rate": 8.534761503969136e-05, | |
| "logits/chosen": -1.0010972023010254, | |
| "logits/rejected": -1.1904897689819336, | |
| "logps/chosen": -1.6170446872711182, | |
| "logps/rejected": -74.0367660522461, | |
| "loss": 0.19317412376403809, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13384878635406494, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2380320429801941, | |
| "rewards/margins": 5.972710132598877, | |
| "rewards/rejected": -5.734678745269775, | |
| "step": 564, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.139358747790962, | |
| "grad_norm": 2.1970374584198, | |
| "learning_rate": 8.501709260639186e-05, | |
| "logits/chosen": -1.0450353622436523, | |
| "logits/rejected": -1.163125991821289, | |
| "logps/chosen": -1.5424336194992065, | |
| "logps/rejected": -73.43540954589844, | |
| "loss": 0.21883387863636017, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1583956778049469, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.27178311347961426, | |
| "rewards/margins": 5.603139877319336, | |
| "rewards/rejected": -5.331357002258301, | |
| "step": 565, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.1413784397879323, | |
| "grad_norm": 2.8700995445251465, | |
| "learning_rate": 8.4686737528492e-05, | |
| "logits/chosen": -1.1470935344696045, | |
| "logits/rejected": -1.2003036737442017, | |
| "logps/chosen": -2.7194712162017822, | |
| "logps/rejected": -73.11854553222656, | |
| "loss": 0.24578091502189636, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14729218184947968, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.32028070092201233, | |
| "rewards/margins": 6.802761077880859, | |
| "rewards/rejected": -6.482481002807617, | |
| "step": 566, | |
| "train_speed(iter/s)": 0.021219 | |
| }, | |
| { | |
| "epoch": 1.143398131784903, | |
| "grad_norm": 1.381791114807129, | |
| "learning_rate": 8.435655349597689e-05, | |
| "logits/chosen": -1.0863614082336426, | |
| "logits/rejected": -1.2500827312469482, | |
| "logps/chosen": -0.5668889880180359, | |
| "logps/rejected": -100.23611450195312, | |
| "loss": 0.11013483256101608, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.0759727880358696, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25675472617149353, | |
| "rewards/margins": 8.975456237792969, | |
| "rewards/rejected": -8.71870231628418, | |
| "step": 567, | |
| "train_speed(iter/s)": 0.02122 | |
| }, | |
| { | |
| "epoch": 1.1454178237818733, | |
| "grad_norm": 1.6486469507217407, | |
| "learning_rate": 8.40265441969213e-05, | |
| "logits/chosen": -1.108482837677002, | |
| "logits/rejected": -1.2181017398834229, | |
| "logps/chosen": -0.9796234965324402, | |
| "logps/rejected": -72.5177993774414, | |
| "loss": 0.17747226357460022, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.0940045714378357, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4885254204273224, | |
| "rewards/margins": 5.819605350494385, | |
| "rewards/rejected": -5.331079959869385, | |
| "step": 568, | |
| "train_speed(iter/s)": 0.02122 | |
| }, | |
| { | |
| "epoch": 1.1474375157788437, | |
| "grad_norm": 5.995792865753174, | |
| "learning_rate": 8.369671331744798e-05, | |
| "logits/chosen": -1.119094729423523, | |
| "logits/rejected": -1.2429081201553345, | |
| "logps/chosen": -1.075197696685791, | |
| "logps/rejected": -81.46918487548828, | |
| "loss": 0.21839378774166107, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.15385104715824127, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.457529217004776, | |
| "rewards/margins": 7.371258735656738, | |
| "rewards/rejected": -6.913729667663574, | |
| "step": 569, | |
| "train_speed(iter/s)": 0.021221 | |
| }, | |
| { | |
| "epoch": 1.1494572077758143, | |
| "grad_norm": 5.149206638336182, | |
| "learning_rate": 8.336706454168701e-05, | |
| "logits/chosen": -1.1530694961547852, | |
| "logits/rejected": -1.29622220993042, | |
| "logps/chosen": -1.0280964374542236, | |
| "logps/rejected": -119.51797485351562, | |
| "loss": 0.20643891394138336, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.08810500800609589, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.43384313583374023, | |
| "rewards/margins": 10.894699096679688, | |
| "rewards/rejected": -10.460856437683105, | |
| "step": 570, | |
| "train_speed(iter/s)": 0.021221 | |
| }, | |
| { | |
| "epoch": 1.1514768997727847, | |
| "grad_norm": 1.2678836584091187, | |
| "learning_rate": 8.303760155173431e-05, | |
| "logits/chosen": -1.1424627304077148, | |
| "logits/rejected": -1.3004976511001587, | |
| "logps/chosen": -0.5466084480285645, | |
| "logps/rejected": -118.68138122558594, | |
| "loss": 0.12502805888652802, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1129414513707161, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3263624608516693, | |
| "rewards/margins": 10.448878288269043, | |
| "rewards/rejected": -10.122516632080078, | |
| "step": 571, | |
| "train_speed(iter/s)": 0.021222 | |
| }, | |
| { | |
| "epoch": 1.153496591769755, | |
| "grad_norm": 1.4974409341812134, | |
| "learning_rate": 8.27083280276107e-05, | |
| "logits/chosen": -1.1443991661071777, | |
| "logits/rejected": -1.3150042295455933, | |
| "logps/chosen": -0.3272748589515686, | |
| "logps/rejected": -139.84246826171875, | |
| "loss": 0.08136013895273209, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.050167154520750046, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4843906760215759, | |
| "rewards/margins": 12.638895034790039, | |
| "rewards/rejected": -12.15450382232666, | |
| "step": 572, | |
| "train_speed(iter/s)": 0.021222 | |
| }, | |
| { | |
| "epoch": 1.1555162837667257, | |
| "grad_norm": 1.1129848957061768, | |
| "learning_rate": 8.237924764722058e-05, | |
| "logits/chosen": -1.1491975784301758, | |
| "logits/rejected": -1.307010531425476, | |
| "logps/chosen": -1.0129919052124023, | |
| "logps/rejected": -127.45437622070312, | |
| "loss": 0.11947691440582275, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.10945737361907959, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2766776978969574, | |
| "rewards/margins": 11.592185974121094, | |
| "rewards/rejected": -11.315506935119629, | |
| "step": 573, | |
| "train_speed(iter/s)": 0.021222 | |
| }, | |
| { | |
| "epoch": 1.157535975763696, | |
| "grad_norm": 12.299660682678223, | |
| "learning_rate": 8.20503640863111e-05, | |
| "logits/chosen": -1.2407050132751465, | |
| "logits/rejected": -1.3422547578811646, | |
| "logps/chosen": -0.5153883099555969, | |
| "logps/rejected": -133.4427032470703, | |
| "loss": 0.14274229109287262, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09612210839986801, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25790077447891235, | |
| "rewards/margins": 12.522222518920898, | |
| "rewards/rejected": -12.264321327209473, | |
| "step": 574, | |
| "train_speed(iter/s)": 0.021222 | |
| }, | |
| { | |
| "epoch": 1.1595556677606664, | |
| "grad_norm": 4.597177505493164, | |
| "learning_rate": 8.172168101843099e-05, | |
| "logits/chosen": -1.2469947338104248, | |
| "logits/rejected": -1.3221312761306763, | |
| "logps/chosen": -2.5218143463134766, | |
| "logps/rejected": -64.33858489990234, | |
| "loss": 0.33642834424972534, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2502836585044861, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3977520167827606, | |
| "rewards/margins": 6.087981700897217, | |
| "rewards/rejected": -5.690229415893555, | |
| "step": 575, | |
| "train_speed(iter/s)": 0.021223 | |
| }, | |
| { | |
| "epoch": 1.161575359757637, | |
| "grad_norm": 1.4237756729125977, | |
| "learning_rate": 8.139320211488938e-05, | |
| "logits/chosen": -1.20731520652771, | |
| "logits/rejected": -1.3155488967895508, | |
| "logps/chosen": -1.9141697883605957, | |
| "logps/rejected": -84.08015441894531, | |
| "loss": 0.20295384526252747, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1318996697664261, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3964309096336365, | |
| "rewards/margins": 8.057353973388672, | |
| "rewards/rejected": -7.660923480987549, | |
| "step": 576, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.1635950517546074, | |
| "grad_norm": 2.7795519828796387, | |
| "learning_rate": 8.106493104471512e-05, | |
| "logits/chosen": -1.1746073961257935, | |
| "logits/rejected": -1.2740343809127808, | |
| "logps/chosen": -2.3649284839630127, | |
| "logps/rejected": -110.2456283569336, | |
| "loss": 0.2869383990764618, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.21996352076530457, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37983080744743347, | |
| "rewards/margins": 9.394953727722168, | |
| "rewards/rejected": -9.015122413635254, | |
| "step": 577, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.1656147437515778, | |
| "grad_norm": 2.63078236579895, | |
| "learning_rate": 8.073687147461547e-05, | |
| "logits/chosen": -1.1673715114593506, | |
| "logits/rejected": -1.330165147781372, | |
| "logps/chosen": -2.938627004623413, | |
| "logps/rejected": -126.129638671875, | |
| "loss": 0.36669260263442993, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3255380392074585, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.19922614097595215, | |
| "rewards/margins": 10.992043495178223, | |
| "rewards/rejected": -10.792817115783691, | |
| "step": 578, | |
| "train_speed(iter/s)": 0.021224 | |
| }, | |
| { | |
| "epoch": 1.1676344357485484, | |
| "grad_norm": 3.1014156341552734, | |
| "learning_rate": 8.04090270689354e-05, | |
| "logits/chosen": -1.2527494430541992, | |
| "logits/rejected": -1.3397026062011719, | |
| "logps/chosen": -2.1539173126220703, | |
| "logps/rejected": -119.85777282714844, | |
| "loss": 0.35629451274871826, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.26880595088005066, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.17089465260505676, | |
| "rewards/margins": 10.79810619354248, | |
| "rewards/rejected": -10.62721061706543, | |
| "step": 579, | |
| "train_speed(iter/s)": 0.021225 | |
| }, | |
| { | |
| "epoch": 1.1696541277455188, | |
| "grad_norm": 2.183499813079834, | |
| "learning_rate": 8.008140148961641e-05, | |
| "logits/chosen": -1.2131707668304443, | |
| "logits/rejected": -1.3254077434539795, | |
| "logps/chosen": -1.9817386865615845, | |
| "logps/rejected": -97.93504333496094, | |
| "loss": 0.2147722840309143, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.13111397624015808, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3702988922595978, | |
| "rewards/margins": 8.80711555480957, | |
| "rewards/rejected": -8.436817169189453, | |
| "step": 580, | |
| "train_speed(iter/s)": 0.021225 | |
| }, | |
| { | |
| "epoch": 1.1716738197424892, | |
| "grad_norm": 1.777718186378479, | |
| "learning_rate": 7.975399839615588e-05, | |
| "logits/chosen": -1.2131725549697876, | |
| "logits/rejected": -1.3256409168243408, | |
| "logps/chosen": -1.6898517608642578, | |
| "logps/rejected": -143.40451049804688, | |
| "loss": 0.10389101505279541, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.07294470816850662, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7127897143363953, | |
| "rewards/margins": 13.449665069580078, | |
| "rewards/rejected": -12.736875534057617, | |
| "step": 581, | |
| "train_speed(iter/s)": 0.021225 | |
| }, | |
| { | |
| "epoch": 1.1736935117394598, | |
| "grad_norm": 3.9212543964385986, | |
| "learning_rate": 7.942682144556604e-05, | |
| "logits/chosen": -1.1815121173858643, | |
| "logits/rejected": -1.2933522462844849, | |
| "logps/chosen": -1.2875924110412598, | |
| "logps/rejected": -102.97988891601562, | |
| "loss": 0.25881722569465637, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.17525863647460938, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23393197357654572, | |
| "rewards/margins": 9.580009460449219, | |
| "rewards/rejected": -9.346076011657715, | |
| "step": 582, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.1757132037364302, | |
| "grad_norm": 10.820318222045898, | |
| "learning_rate": 7.909987429233317e-05, | |
| "logits/chosen": -1.1671289205551147, | |
| "logits/rejected": -1.2844188213348389, | |
| "logps/chosen": -3.267451047897339, | |
| "logps/rejected": -142.51571655273438, | |
| "loss": 0.3873688876628876, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2906343936920166, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.45434269309043884, | |
| "rewards/margins": 12.700260162353516, | |
| "rewards/rejected": -12.245917320251465, | |
| "step": 583, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.1777328957334006, | |
| "grad_norm": 8.162153244018555, | |
| "learning_rate": 7.877316058837674e-05, | |
| "logits/chosen": -1.0726277828216553, | |
| "logits/rejected": -1.2778667211532593, | |
| "logps/chosen": -2.711777687072754, | |
| "logps/rejected": -147.33900451660156, | |
| "loss": 0.43292930722236633, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.37318992614746094, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31741955876350403, | |
| "rewards/margins": 13.22387981414795, | |
| "rewards/rejected": -12.906461715698242, | |
| "step": 584, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.1797525877303712, | |
| "grad_norm": 8.373458862304688, | |
| "learning_rate": 7.844668398300865e-05, | |
| "logits/chosen": -1.1396088600158691, | |
| "logits/rejected": -1.260819435119629, | |
| "logps/chosen": -2.466878890991211, | |
| "logps/rejected": -117.13096618652344, | |
| "loss": 0.3733997344970703, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3299589157104492, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.13099858164787292, | |
| "rewards/margins": 10.681720733642578, | |
| "rewards/rejected": -10.550722122192383, | |
| "step": 585, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.1817722797273416, | |
| "grad_norm": 20.348384857177734, | |
| "learning_rate": 7.812044812289249e-05, | |
| "logits/chosen": -1.2010091543197632, | |
| "logits/rejected": -1.3245834112167358, | |
| "logps/chosen": -3.3453171253204346, | |
| "logps/rejected": -117.00688171386719, | |
| "loss": 0.6515809893608093, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.3382578492164612, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15548963844776154, | |
| "rewards/margins": 10.246532440185547, | |
| "rewards/rejected": -10.091042518615723, | |
| "step": 586, | |
| "train_speed(iter/s)": 0.021226 | |
| }, | |
| { | |
| "epoch": 1.183791971724312, | |
| "grad_norm": 14.155014991760254, | |
| "learning_rate": 7.779445665200284e-05, | |
| "logits/chosen": -1.1876106262207031, | |
| "logits/rejected": -1.2901134490966797, | |
| "logps/chosen": -3.768019437789917, | |
| "logps/rejected": -83.8199691772461, | |
| "loss": 0.7886047959327698, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5176796913146973, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16025924682617188, | |
| "rewards/margins": 7.629866600036621, | |
| "rewards/rejected": -7.469607353210449, | |
| "step": 587, | |
| "train_speed(iter/s)": 0.021227 | |
| }, | |
| { | |
| "epoch": 1.1858116637212825, | |
| "grad_norm": 2.6726722717285156, | |
| "learning_rate": 7.746871321158434e-05, | |
| "logits/chosen": -1.2011233568191528, | |
| "logits/rejected": -1.2838491201400757, | |
| "logps/chosen": -1.551110863685608, | |
| "logps/rejected": -74.54078674316406, | |
| "loss": 0.3482269048690796, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.20897427201271057, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.13612668216228485, | |
| "rewards/margins": 6.496390342712402, | |
| "rewards/rejected": -6.360263824462891, | |
| "step": 588, | |
| "train_speed(iter/s)": 0.021227 | |
| }, | |
| { | |
| "epoch": 1.187831355718253, | |
| "grad_norm": 11.104055404663086, | |
| "learning_rate": 7.71432214401114e-05, | |
| "logits/chosen": -1.184781551361084, | |
| "logits/rejected": -1.367568850517273, | |
| "logps/chosen": -2.4659273624420166, | |
| "logps/rejected": -158.41024780273438, | |
| "loss": 0.46998411417007446, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.37064406275749207, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14929750561714172, | |
| "rewards/margins": 14.278914451599121, | |
| "rewards/rejected": -14.129616737365723, | |
| "step": 589, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.1898510477152233, | |
| "grad_norm": 1.3642657995224, | |
| "learning_rate": 7.681798497324716e-05, | |
| "logits/chosen": -1.1494981050491333, | |
| "logits/rejected": -1.2755074501037598, | |
| "logps/chosen": -3.920079231262207, | |
| "logps/rejected": -99.15157318115234, | |
| "loss": 0.1694917380809784, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.1302870661020279, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6689797043800354, | |
| "rewards/margins": 8.986592292785645, | |
| "rewards/rejected": -8.317612648010254, | |
| "step": 590, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.191870739712194, | |
| "grad_norm": 2.9878756999969482, | |
| "learning_rate": 7.649300744380328e-05, | |
| "logits/chosen": -1.2234166860580444, | |
| "logits/rejected": -1.3413805961608887, | |
| "logps/chosen": -3.245425224304199, | |
| "logps/rejected": -97.82754516601562, | |
| "loss": 0.6991743445396423, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.5142159461975098, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04035697877407074, | |
| "rewards/margins": 8.96734619140625, | |
| "rewards/rejected": -8.926989555358887, | |
| "step": 591, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.1938904317091643, | |
| "grad_norm": 3.8199944496154785, | |
| "learning_rate": 7.616829248169891e-05, | |
| "logits/chosen": -1.168949842453003, | |
| "logits/rejected": -1.2326381206512451, | |
| "logps/chosen": -2.8712589740753174, | |
| "logps/rejected": -63.083431243896484, | |
| "loss": 0.4011121094226837, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2862622141838074, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.291637659072876, | |
| "rewards/margins": 5.633680820465088, | |
| "rewards/rejected": -5.342043399810791, | |
| "step": 592, | |
| "train_speed(iter/s)": 0.021228 | |
| }, | |
| { | |
| "epoch": 1.1959101237061347, | |
| "grad_norm": 2.4625227451324463, | |
| "learning_rate": 7.584384371392055e-05, | |
| "logits/chosen": -1.2142324447631836, | |
| "logits/rejected": -1.2614374160766602, | |
| "logps/chosen": -1.5779057741165161, | |
| "logps/rejected": -86.51065826416016, | |
| "loss": 0.1223965585231781, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09837526828050613, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9265052676200867, | |
| "rewards/margins": 8.553476333618164, | |
| "rewards/rejected": -7.62697172164917, | |
| "step": 593, | |
| "train_speed(iter/s)": 0.021229 | |
| }, | |
| { | |
| "epoch": 1.1979298157031053, | |
| "grad_norm": 3.092069149017334, | |
| "learning_rate": 7.55196647644814e-05, | |
| "logits/chosen": -1.1460374593734741, | |
| "logits/rejected": -1.325160264968872, | |
| "logps/chosen": -0.844829261302948, | |
| "logps/rejected": -130.2720184326172, | |
| "loss": 0.1258152425289154, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.09725081920623779, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.22555547952651978, | |
| "rewards/margins": 11.706364631652832, | |
| "rewards/rejected": -11.480809211730957, | |
| "step": 594, | |
| "train_speed(iter/s)": 0.021229 | |
| }, | |
| { | |
| "epoch": 1.1999495077000757, | |
| "grad_norm": 4.890739440917969, | |
| "learning_rate": 7.519575925438067e-05, | |
| "logits/chosen": -1.1363235712051392, | |
| "logits/rejected": -1.3047442436218262, | |
| "logps/chosen": -3.450829267501831, | |
| "logps/rejected": -122.64608001708984, | |
| "loss": 0.40785038471221924, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.2815420627593994, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.30323055386543274, | |
| "rewards/margins": 10.626569747924805, | |
| "rewards/rejected": -10.323339462280273, | |
| "step": 595, | |
| "train_speed(iter/s)": 0.021229 | |
| }, | |
| { | |
| "epoch": 1.201969199697046, | |
| "grad_norm": 9.498205184936523, | |
| "learning_rate": 7.487213080156355e-05, | |
| "logits/chosen": -1.2033909559249878, | |
| "logits/rejected": -1.2762019634246826, | |
| "logps/chosen": -1.286055326461792, | |
| "logps/rejected": -79.14070129394531, | |
| "loss": 0.24982167780399323, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.14821632206439972, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2594597637653351, | |
| "rewards/margins": 7.015608787536621, | |
| "rewards/rejected": -6.756147861480713, | |
| "step": 596, | |
| "train_speed(iter/s)": 0.02123 | |
| }, | |
| { | |
| "epoch": 1.2039888916940167, | |
| "grad_norm": 5.124003887176514, | |
| "learning_rate": 7.454878302088039e-05, | |
| "logits/chosen": -1.1855096817016602, | |
| "logits/rejected": -1.2832536697387695, | |
| "logps/chosen": -2.1323423385620117, | |
| "logps/rejected": -77.67525482177734, | |
| "loss": 0.3236369490623474, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.22611530125141144, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2844330668449402, | |
| "rewards/margins": 6.800313472747803, | |
| "rewards/rejected": -6.515880584716797, | |
| "step": 597, | |
| "train_speed(iter/s)": 0.02123 | |
| }, | |
| { | |
| "epoch": 1.206008583690987, | |
| "grad_norm": 7.811437606811523, | |
| "learning_rate": 7.422571952404663e-05, | |
| "logits/chosen": -1.1619443893432617, | |
| "logits/rejected": -1.2858407497406006, | |
| "logps/chosen": -3.6687519550323486, | |
| "logps/rejected": -89.48348236083984, | |
| "loss": 0.6337468028068542, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.430719256401062, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09281295537948608, | |
| "rewards/margins": 7.673408508300781, | |
| "rewards/rejected": -7.58059549331665, | |
| "step": 598, | |
| "train_speed(iter/s)": 0.021231 | |
| }, | |
| { | |
| "epoch": 1.2080282756879577, | |
| "grad_norm": 6.1173577308654785, | |
| "learning_rate": 7.390294391960217e-05, | |
| "logits/chosen": -1.2435667514801025, | |
| "logits/rejected": -1.3407572507858276, | |
| "logps/chosen": -0.851167619228363, | |
| "logps/rejected": -90.95581817626953, | |
| "loss": 0.1322077065706253, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.07706882804632187, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3039519786834717, | |
| "rewards/margins": 8.613190650939941, | |
| "rewards/rejected": -8.309237480163574, | |
| "step": 599, | |
| "train_speed(iter/s)": 0.021231 | |
| }, | |
| { | |
| "epoch": 1.210047967684928, | |
| "grad_norm": 1.1325865983963013, | |
| "learning_rate": 7.358045981287141e-05, | |
| "logits/chosen": -1.1153496503829956, | |
| "logits/rejected": -1.2983583211898804, | |
| "logps/chosen": -0.8740055561065674, | |
| "logps/rejected": -100.239990234375, | |
| "loss": 0.1091877669095993, | |
| "memory(GiB)": 45.64, | |
| "nll_loss": 0.0765417069196701, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24975469708442688, | |
| "rewards/margins": 8.55569076538086, | |
| "rewards/rejected": -8.305935859680176, | |
| "step": 600, | |
| "train_speed(iter/s)": 0.021231 | |
| }, | |
| { | |
| "epoch": 1.210047967684928, | |
| "eval_logits/chosen": -1.1828652620315552, | |
| "eval_logits/rejected": -1.3658164739608765, | |
| "eval_logps/chosen": -1.8309376239776611, | |
| "eval_logps/rejected": -125.0011215209961, | |
| "eval_loss": 0.24665305018424988, | |
| "eval_nll_loss": 0.17694206535816193, | |
| "eval_rewards/accuracies": 0.9750000238418579, | |
| "eval_rewards/chosen": 0.26265937089920044, | |
| "eval_rewards/margins": 11.061813354492188, | |
| "eval_rewards/rejected": -10.799153327941895, | |
| "eval_runtime": 92.2944, | |
| "eval_samples_per_second": 0.867, | |
| "eval_steps_per_second": 0.433, | |
| "step": 600 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 990, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.7337917669638144e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |