Instructions to use cragtmp/pair1-600 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/pair1-600 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/pair1-600") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 500, | |
| "best_metric": 0.5266422, | |
| "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task1_dpo_absgt10_noidk__pari1_0602/v0-20250602-171601/checkpoint-500", | |
| "epoch": 2.902638762511374, | |
| "eval_steps": 500, | |
| "global_step": 600, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.004852896572641796, | |
| "grad_norm": 3.7387311458587646, | |
| "learning_rate": 6.451612903225806e-06, | |
| "logits/chosen": -0.5510790944099426, | |
| "logits/rejected": -0.5881398916244507, | |
| "logps/chosen": -12.010782241821289, | |
| "logps/rejected": -14.501535415649414, | |
| "loss": 1.3914958238601685, | |
| "memory(GiB)": 30.65, | |
| "nll_loss": 0.6983487010002136, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.010451 | |
| }, | |
| { | |
| "epoch": 0.009705793145283591, | |
| "grad_norm": 5.074642658233643, | |
| "learning_rate": 1.2903225806451613e-05, | |
| "logits/chosen": -0.523028552532196, | |
| "logits/rejected": -0.48799216747283936, | |
| "logps/chosen": -15.598363876342773, | |
| "logps/rejected": -12.491965293884277, | |
| "loss": 1.3891178369522095, | |
| "memory(GiB)": 33.32, | |
| "nll_loss": 0.6959705948829651, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.010818 | |
| }, | |
| { | |
| "epoch": 0.014558689717925387, | |
| "grad_norm": 4.8900933265686035, | |
| "learning_rate": 1.935483870967742e-05, | |
| "logits/chosen": -0.6194146871566772, | |
| "logits/rejected": -0.6501045227050781, | |
| "logps/chosen": -4.106720924377441, | |
| "logps/rejected": -9.803337097167969, | |
| "loss": 1.0989456176757812, | |
| "memory(GiB)": 33.32, | |
| "nll_loss": 0.4074462950229645, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0007492969743907452, | |
| "rewards/margins": 0.003412690246477723, | |
| "rewards/rejected": -0.0026633935049176216, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.010979 | |
| }, | |
| { | |
| "epoch": 0.019411586290567183, | |
| "grad_norm": 4.551450729370117, | |
| "learning_rate": 2.5806451612903226e-05, | |
| "logits/chosen": -0.4892222285270691, | |
| "logits/rejected": -0.6288261413574219, | |
| "logps/chosen": -11.312190055847168, | |
| "logps/rejected": -19.471235275268555, | |
| "loss": 1.4801559448242188, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.788896381855011, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.009614704176783562, | |
| "rewards/margins": 0.003918787930160761, | |
| "rewards/rejected": 0.00569591810926795, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.011017 | |
| }, | |
| { | |
| "epoch": 0.024264482863208977, | |
| "grad_norm": 5.593626499176025, | |
| "learning_rate": 3.2258064516129034e-05, | |
| "logits/chosen": -0.5494186282157898, | |
| "logits/rejected": -0.6138424277305603, | |
| "logps/chosen": -9.588997840881348, | |
| "logps/rejected": -13.734201431274414, | |
| "loss": 1.360138177871704, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.6719292998313904, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.006837800145149231, | |
| "rewards/margins": 0.01003339048475027, | |
| "rewards/rejected": -0.003195591736584902, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.011063 | |
| }, | |
| { | |
| "epoch": 0.029117379435850774, | |
| "grad_norm": 4.7115631103515625, | |
| "learning_rate": 3.870967741935484e-05, | |
| "logits/chosen": -0.5902564525604248, | |
| "logits/rejected": -0.6040255427360535, | |
| "logps/chosen": -10.28292465209961, | |
| "logps/rejected": -10.143241882324219, | |
| "loss": 1.4910708665847778, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.7961816787719727, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.010182744823396206, | |
| "rewards/margins": -0.0029990212060511112, | |
| "rewards/rejected": 0.013181766495108604, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.011101 | |
| }, | |
| { | |
| "epoch": 0.03397027600849257, | |
| "grad_norm": 3.242079257965088, | |
| "learning_rate": 4.516129032258064e-05, | |
| "logits/chosen": -0.5178452730178833, | |
| "logits/rejected": -0.5171934366226196, | |
| "logps/chosen": -11.35531997680664, | |
| "logps/rejected": -13.940824508666992, | |
| "loss": 1.256138563156128, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.5596349239349365, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.027008483186364174, | |
| "rewards/margins": -0.005357709713280201, | |
| "rewards/rejected": 0.03236619383096695, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.01111 | |
| }, | |
| { | |
| "epoch": 0.038823172581134366, | |
| "grad_norm": 4.068852424621582, | |
| "learning_rate": 5.161290322580645e-05, | |
| "logits/chosen": -0.5522034168243408, | |
| "logits/rejected": -0.5255574584007263, | |
| "logps/chosen": -12.265619277954102, | |
| "logps/rejected": -11.32555866241455, | |
| "loss": 1.3358875513076782, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.6352814435958862, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": 0.021265771239995956, | |
| "rewards/margins": -0.011079448275268078, | |
| "rewards/rejected": 0.03234522044658661, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.011128 | |
| }, | |
| { | |
| "epoch": 0.04367606915377616, | |
| "grad_norm": 3.7364556789398193, | |
| "learning_rate": 5.8064516129032266e-05, | |
| "logits/chosen": -0.5157386064529419, | |
| "logits/rejected": -0.5693979263305664, | |
| "logps/chosen": -8.727921485900879, | |
| "logps/rejected": -15.667279243469238, | |
| "loss": 1.2342674732208252, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.565812349319458, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06674117594957352, | |
| "rewards/margins": 0.05803339183330536, | |
| "rewards/rejected": 0.008707791566848755, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.01114 | |
| }, | |
| { | |
| "epoch": 0.048528965726417954, | |
| "grad_norm": 5.376058578491211, | |
| "learning_rate": 6.451612903225807e-05, | |
| "logits/chosen": -0.5336275696754456, | |
| "logits/rejected": -0.5664803385734558, | |
| "logps/chosen": -10.200874328613281, | |
| "logps/rejected": -14.752674102783203, | |
| "loss": 1.3360637426376343, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.6595087647438049, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.05797234922647476, | |
| "rewards/margins": 0.05362413078546524, | |
| "rewards/rejected": 0.00434822216629982, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.011149 | |
| }, | |
| { | |
| "epoch": 0.05338186229905975, | |
| "grad_norm": 3.41105318069458, | |
| "learning_rate": 7.096774193548388e-05, | |
| "logits/chosen": -0.5836127996444702, | |
| "logits/rejected": -0.5781168341636658, | |
| "logps/chosen": -16.744802474975586, | |
| "logps/rejected": -10.854264259338379, | |
| "loss": 1.4587984085083008, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.8293395042419434, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.10905362665653229, | |
| "rewards/margins": 0.15107941627502441, | |
| "rewards/rejected": -0.04202580079436302, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.011156 | |
| }, | |
| { | |
| "epoch": 0.05823475887170155, | |
| "grad_norm": 3.8034191131591797, | |
| "learning_rate": 7.741935483870968e-05, | |
| "logits/chosen": -0.5040208101272583, | |
| "logits/rejected": -0.5330135822296143, | |
| "logps/chosen": -9.613079071044922, | |
| "logps/rejected": -11.064685821533203, | |
| "loss": 1.267149806022644, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.6177489161491394, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.02217767760157585, | |
| "rewards/margins": 0.10778125375509262, | |
| "rewards/rejected": -0.08560357987880707, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.011164 | |
| }, | |
| { | |
| "epoch": 0.06308765544434335, | |
| "grad_norm": 3.453901767730713, | |
| "learning_rate": 8.387096774193549e-05, | |
| "logits/chosen": -0.5467038154602051, | |
| "logits/rejected": -0.577677845954895, | |
| "logps/chosen": -8.353002548217773, | |
| "logps/rejected": -13.458589553833008, | |
| "loss": 1.233524203300476, | |
| "memory(GiB)": 36.76, | |
| "nll_loss": 0.5735047459602356, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0792345255613327, | |
| "rewards/margins": 0.10825661569833755, | |
| "rewards/rejected": -0.02902209758758545, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.011171 | |
| }, | |
| { | |
| "epoch": 0.06794055201698514, | |
| "grad_norm": 3.1424827575683594, | |
| "learning_rate": 9.032258064516129e-05, | |
| "logits/chosen": -0.5190276503562927, | |
| "logits/rejected": -0.5021806359291077, | |
| "logps/chosen": -11.147318840026855, | |
| "logps/rejected": -11.436860084533691, | |
| "loss": 1.254595398902893, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5940842628479004, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.12143825739622116, | |
| "rewards/margins": 0.11505899578332901, | |
| "rewards/rejected": 0.006379259284585714, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.011173 | |
| }, | |
| { | |
| "epoch": 0.07279344858962693, | |
| "grad_norm": 3.430884599685669, | |
| "learning_rate": 9.677419354838711e-05, | |
| "logits/chosen": -0.4556944668292999, | |
| "logits/rejected": -0.4863564968109131, | |
| "logps/chosen": -13.696606636047363, | |
| "logps/rejected": -16.93030548095703, | |
| "loss": 1.4541280269622803, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7789333462715149, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.06093275174498558, | |
| "rewards/margins": 0.06727998703718185, | |
| "rewards/rejected": -0.006347230635583401, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.011173 | |
| }, | |
| { | |
| "epoch": 0.07764634516226873, | |
| "grad_norm": 5.697832107543945, | |
| "learning_rate": 0.0001032258064516129, | |
| "logits/chosen": -0.5404947400093079, | |
| "logits/rejected": -0.5623520016670227, | |
| "logps/chosen": -8.202204704284668, | |
| "logps/rejected": -12.407597541809082, | |
| "loss": 1.244711995124817, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.601537823677063, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.14254164695739746, | |
| "rewards/margins": 0.16008448600769043, | |
| "rewards/rejected": -0.017542842775583267, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.011181 | |
| }, | |
| { | |
| "epoch": 0.08249924173491052, | |
| "grad_norm": 3.0015194416046143, | |
| "learning_rate": 0.00010967741935483871, | |
| "logits/chosen": -0.5660006999969482, | |
| "logits/rejected": -0.5559377074241638, | |
| "logps/chosen": -10.180459022521973, | |
| "logps/rejected": -10.599821090698242, | |
| "loss": 1.2977104187011719, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6220536231994629, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.12847113609313965, | |
| "rewards/margins": 0.0701126754283905, | |
| "rewards/rejected": 0.058358460664749146, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.011186 | |
| }, | |
| { | |
| "epoch": 0.08735213830755233, | |
| "grad_norm": 5.351679801940918, | |
| "learning_rate": 0.00011612903225806453, | |
| "logits/chosen": -0.4931953251361847, | |
| "logits/rejected": -0.5151236653327942, | |
| "logps/chosen": -9.91970157623291, | |
| "logps/rejected": -17.587669372558594, | |
| "loss": 1.2324532270431519, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6188042163848877, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.10037277638912201, | |
| "rewards/margins": 0.1970798224210739, | |
| "rewards/rejected": -0.0967070460319519, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.011184 | |
| }, | |
| { | |
| "epoch": 0.09220503488019412, | |
| "grad_norm": 2.8047103881835938, | |
| "learning_rate": 0.00012258064516129034, | |
| "logits/chosen": -0.5366685390472412, | |
| "logits/rejected": -0.5188369154930115, | |
| "logps/chosen": -11.985616683959961, | |
| "logps/rejected": -9.721867561340332, | |
| "loss": 1.243293285369873, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5873799920082092, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.1405532956123352, | |
| "rewards/margins": 0.13308030366897583, | |
| "rewards/rejected": 0.007473001256585121, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.011187 | |
| }, | |
| { | |
| "epoch": 0.09705793145283591, | |
| "grad_norm": 3.8547439575195312, | |
| "learning_rate": 0.00012903225806451613, | |
| "logits/chosen": -0.4702628254890442, | |
| "logits/rejected": -0.45280686020851135, | |
| "logps/chosen": -11.422282218933105, | |
| "logps/rejected": -13.049072265625, | |
| "loss": 1.1890830993652344, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.49578943848609924, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.15254227817058563, | |
| "rewards/margins": 0.06372587382793427, | |
| "rewards/rejected": 0.08881638944149017, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.011186 | |
| }, | |
| { | |
| "epoch": 0.10191082802547771, | |
| "grad_norm": 3.9698216915130615, | |
| "learning_rate": 0.00013548387096774193, | |
| "logits/chosen": -0.46789583563804626, | |
| "logits/rejected": -0.511239230632782, | |
| "logps/chosen": -6.999385833740234, | |
| "logps/rejected": -15.381391525268555, | |
| "loss": 1.1891487836837769, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4858560860157013, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.0561373308300972, | |
| "rewards/margins": 0.021670352667570114, | |
| "rewards/rejected": 0.034466978162527084, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.01119 | |
| }, | |
| { | |
| "epoch": 0.1067637245981195, | |
| "grad_norm": 2.810508966445923, | |
| "learning_rate": 0.00014193548387096775, | |
| "logits/chosen": -0.43238648772239685, | |
| "logits/rejected": -0.5333250164985657, | |
| "logps/chosen": -10.029150009155273, | |
| "logps/rejected": -19.058868408203125, | |
| "loss": 1.1820727586746216, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5326224565505981, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09418301284313202, | |
| "rewards/margins": 0.12642550468444824, | |
| "rewards/rejected": -0.03224247321486473, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.011191 | |
| }, | |
| { | |
| "epoch": 0.1116166211707613, | |
| "grad_norm": 5.709966659545898, | |
| "learning_rate": 0.00014838709677419355, | |
| "logits/chosen": -0.42264610528945923, | |
| "logits/rejected": -0.45910894870758057, | |
| "logps/chosen": -16.804805755615234, | |
| "logps/rejected": -18.372587203979492, | |
| "loss": 1.3850518465042114, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8230935335159302, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05581340938806534, | |
| "rewards/margins": 0.3414239287376404, | |
| "rewards/rejected": -0.285610556602478, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.01119 | |
| }, | |
| { | |
| "epoch": 0.1164695177434031, | |
| "grad_norm": 8.213228225708008, | |
| "learning_rate": 0.00015483870967741937, | |
| "logits/chosen": -0.43471360206604004, | |
| "logits/rejected": -0.4376092553138733, | |
| "logps/chosen": -10.293994903564453, | |
| "logps/rejected": -12.654733657836914, | |
| "loss": 1.2845356464385986, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6288778781890869, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.019672194495797157, | |
| "rewards/margins": 0.11052073538303375, | |
| "rewards/rejected": -0.09084855020046234, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.011191 | |
| }, | |
| { | |
| "epoch": 0.12132241431604489, | |
| "grad_norm": 2.5066726207733154, | |
| "learning_rate": 0.00016129032258064516, | |
| "logits/chosen": -0.45425349473953247, | |
| "logits/rejected": -0.46823209524154663, | |
| "logps/chosen": -5.9361162185668945, | |
| "logps/rejected": -12.616898536682129, | |
| "loss": 0.9625968933105469, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.3818866014480591, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.14780059456825256, | |
| "rewards/margins": 0.3101717531681061, | |
| "rewards/rejected": -0.16237111389636993, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.011195 | |
| }, | |
| { | |
| "epoch": 0.1261753108886867, | |
| "grad_norm": 3.1320712566375732, | |
| "learning_rate": 0.00016774193548387098, | |
| "logits/chosen": -0.47818127274513245, | |
| "logits/rejected": -0.43204230070114136, | |
| "logps/chosen": -13.965362548828125, | |
| "logps/rejected": -15.635419845581055, | |
| "loss": 1.1598286628723145, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6072496175765991, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.06804848462343216, | |
| "rewards/margins": 0.44113460183143616, | |
| "rewards/rejected": -0.3730861246585846, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.011195 | |
| }, | |
| { | |
| "epoch": 0.13102820746132848, | |
| "grad_norm": 3.8042213916778564, | |
| "learning_rate": 0.00017419354838709678, | |
| "logits/chosen": -0.449899286031723, | |
| "logits/rejected": -0.4721740484237671, | |
| "logps/chosen": -9.528651237487793, | |
| "logps/rejected": -12.257569313049316, | |
| "loss": 1.2201637029647827, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6225947737693787, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07078885287046432, | |
| "rewards/margins": 0.28294628858566284, | |
| "rewards/rejected": -0.21215742826461792, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.011198 | |
| }, | |
| { | |
| "epoch": 0.13588110403397027, | |
| "grad_norm": 2.5645625591278076, | |
| "learning_rate": 0.00018064516129032257, | |
| "logits/chosen": -0.3968259394168854, | |
| "logits/rejected": -0.41532400250434875, | |
| "logps/chosen": -7.651938438415527, | |
| "logps/rejected": -15.575130462646484, | |
| "loss": 0.9698889851570129, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4171852469444275, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1875855028629303, | |
| "rewards/margins": 0.46900543570518494, | |
| "rewards/rejected": -0.28141990303993225, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.011199 | |
| }, | |
| { | |
| "epoch": 0.14073400060661206, | |
| "grad_norm": 3.2087931632995605, | |
| "learning_rate": 0.0001870967741935484, | |
| "logits/chosen": -0.38016778230667114, | |
| "logits/rejected": -0.45883065462112427, | |
| "logps/chosen": -9.820419311523438, | |
| "logps/rejected": -17.21317481994629, | |
| "loss": 1.156844973564148, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5829570293426514, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.21587063372135162, | |
| "rewards/margins": 0.3926744759082794, | |
| "rewards/rejected": -0.1768038272857666, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.0112 | |
| }, | |
| { | |
| "epoch": 0.14558689717925385, | |
| "grad_norm": 3.5056474208831787, | |
| "learning_rate": 0.00019354838709677422, | |
| "logits/chosen": -0.43780362606048584, | |
| "logits/rejected": -0.46428602933883667, | |
| "logps/chosen": -12.7692289352417, | |
| "logps/rejected": -16.947650909423828, | |
| "loss": 1.2092680931091309, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7365323305130005, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.19128330051898956, | |
| "rewards/margins": 0.7160227298736572, | |
| "rewards/rejected": -0.5247394442558289, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.011202 | |
| }, | |
| { | |
| "epoch": 0.15043979375189567, | |
| "grad_norm": 7.983421802520752, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.3911149799823761, | |
| "logits/rejected": -0.4533422887325287, | |
| "logps/chosen": -11.242105484008789, | |
| "logps/rejected": -16.97354507446289, | |
| "loss": 1.3208513259887695, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7320083975791931, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.08527207374572754, | |
| "rewards/margins": 0.4059477746486664, | |
| "rewards/rejected": -0.4912198483943939, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.15529269032453746, | |
| "grad_norm": 7.263556957244873, | |
| "learning_rate": 0.0001999985678367986, | |
| "logits/chosen": -0.4142841398715973, | |
| "logits/rejected": -0.49599555134773254, | |
| "logps/chosen": -8.028633117675781, | |
| "logps/rejected": -19.247087478637695, | |
| "loss": 1.1268211603164673, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5463874936103821, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.16298356652259827, | |
| "rewards/margins": 0.4510626792907715, | |
| "rewards/rejected": -0.6140461564064026, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.16014558689717925, | |
| "grad_norm": 7.569846153259277, | |
| "learning_rate": 0.0001999942713882162, | |
| "logits/chosen": -0.4265003502368927, | |
| "logits/rejected": -0.42608755826950073, | |
| "logps/chosen": -9.83013916015625, | |
| "logps/rejected": -17.054443359375, | |
| "loss": 1.2255939245224, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6033804416656494, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.24369043111801147, | |
| "rewards/margins": 0.24309512972831726, | |
| "rewards/rejected": -0.48678556084632874, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.16499848346982104, | |
| "grad_norm": 3.240605592727661, | |
| "learning_rate": 0.00019998711077731716, | |
| "logits/chosen": -0.4495273232460022, | |
| "logits/rejected": -0.3768068850040436, | |
| "logps/chosen": -12.2802095413208, | |
| "logps/rejected": -12.816421508789062, | |
| "loss": 1.085668683052063, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5540680289268494, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0720956027507782, | |
| "rewards/margins": 0.47421759366989136, | |
| "rewards/rejected": -0.40212199091911316, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.16985138004246284, | |
| "grad_norm": 2.972562551498413, | |
| "learning_rate": 0.00019997708620920465, | |
| "logits/chosen": -0.4633820354938507, | |
| "logits/rejected": -0.5037291646003723, | |
| "logps/chosen": -8.281206130981445, | |
| "logps/rejected": -17.908266067504883, | |
| "loss": 1.0561590194702148, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6168872714042664, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.13331066071987152, | |
| "rewards/margins": 0.9570158123970032, | |
| "rewards/rejected": -0.8237051963806152, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.17470427661510465, | |
| "grad_norm": 5.980532646179199, | |
| "learning_rate": 0.00019996419797101514, | |
| "logits/chosen": -0.39558717608451843, | |
| "logits/rejected": -0.431841105222702, | |
| "logps/chosen": -10.584002494812012, | |
| "logps/rejected": -19.50037956237793, | |
| "loss": 1.2352135181427002, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6387596130371094, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.029237767681479454, | |
| "rewards/margins": 0.46423807740211487, | |
| "rewards/rejected": -0.43500036001205444, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.17955717318774644, | |
| "grad_norm": 5.786473751068115, | |
| "learning_rate": 0.00019994844643190975, | |
| "logits/chosen": -0.3947299122810364, | |
| "logits/rejected": -0.5335777997970581, | |
| "logps/chosen": -10.800368309020996, | |
| "logps/rejected": -19.217914581298828, | |
| "loss": 1.4149001836776733, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8904857635498047, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.04618726670742035, | |
| "rewards/margins": 0.49434420466423035, | |
| "rewards/rejected": -0.5405314564704895, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.18441006976038823, | |
| "grad_norm": 2.6556568145751953, | |
| "learning_rate": 0.00019992983204306403, | |
| "logits/chosen": -0.39078089594841003, | |
| "logits/rejected": -0.39872410893440247, | |
| "logps/chosen": -12.065397262573242, | |
| "logps/rejected": -19.61814308166504, | |
| "loss": 1.1651582717895508, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5659552812576294, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06024760380387306, | |
| "rewards/margins": 0.4251976013183594, | |
| "rewards/rejected": -0.36494994163513184, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.18926296633303002, | |
| "grad_norm": 4.3966779708862305, | |
| "learning_rate": 0.0001999083553376548, | |
| "logits/chosen": -0.4178510308265686, | |
| "logits/rejected": -0.42042505741119385, | |
| "logps/chosen": -10.572690963745117, | |
| "logps/rejected": -17.888080596923828, | |
| "loss": 1.1389288902282715, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6220788955688477, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14774595201015472, | |
| "rewards/margins": 0.5430118441581726, | |
| "rewards/rejected": -0.3952659070491791, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.19411586290567182, | |
| "grad_norm": 2.347978115081787, | |
| "learning_rate": 0.00019988401693084502, | |
| "logits/chosen": -0.4415282905101776, | |
| "logits/rejected": -0.4420144259929657, | |
| "logps/chosen": -10.284622192382812, | |
| "logps/rejected": -15.651193618774414, | |
| "loss": 1.131446123123169, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5388365387916565, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08026871085166931, | |
| "rewards/margins": 0.271782785654068, | |
| "rewards/rejected": -0.19151407480239868, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.1989687594783136, | |
| "grad_norm": 3.0811686515808105, | |
| "learning_rate": 0.0001998568175197661, | |
| "logits/chosen": -0.48944562673568726, | |
| "logits/rejected": -0.48836228251457214, | |
| "logps/chosen": -10.908992767333984, | |
| "logps/rejected": -16.806554794311523, | |
| "loss": 1.1378778219223022, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5336601734161377, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.026157543063163757, | |
| "rewards/margins": 0.3137216567993164, | |
| "rewards/rejected": -0.33987918496131897, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.20382165605095542, | |
| "grad_norm": 3.496178150177002, | |
| "learning_rate": 0.00019982675788349794, | |
| "logits/chosen": -0.4175988435745239, | |
| "logits/rejected": -0.49307048320770264, | |
| "logps/chosen": -8.874513626098633, | |
| "logps/rejected": -16.90668296813965, | |
| "loss": 1.237853765487671, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6065552830696106, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.028882348909974098, | |
| "rewards/margins": 0.22182509303092957, | |
| "rewards/rejected": -0.19294273853302002, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.20867455262359721, | |
| "grad_norm": 2.585383892059326, | |
| "learning_rate": 0.00019979383888304666, | |
| "logits/chosen": -0.40949565172195435, | |
| "logits/rejected": -0.3888520896434784, | |
| "logps/chosen": -12.942455291748047, | |
| "logps/rejected": -16.93043327331543, | |
| "loss": 1.1456714868545532, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5834133625030518, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.029632963240146637, | |
| "rewards/margins": 0.47202715277671814, | |
| "rewards/rejected": -0.4423941969871521, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.213527449196239, | |
| "grad_norm": 2.6477532386779785, | |
| "learning_rate": 0.0001997580614613199, | |
| "logits/chosen": -0.4283292591571808, | |
| "logits/rejected": -0.417165070772171, | |
| "logps/chosen": -11.886260986328125, | |
| "logps/rejected": -22.782238006591797, | |
| "loss": 1.126604676246643, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6129148602485657, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.020920906215906143, | |
| "rewards/margins": 0.8850383162498474, | |
| "rewards/rejected": -0.9059593677520752, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.2183803457688808, | |
| "grad_norm": 2.563398599624634, | |
| "learning_rate": 0.00019971942664309968, | |
| "logits/chosen": -0.4108792245388031, | |
| "logits/rejected": -0.4292621612548828, | |
| "logps/chosen": -10.143468856811523, | |
| "logps/rejected": -21.13189125061035, | |
| "loss": 0.957160472869873, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4789010286331177, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04898708686232567, | |
| "rewards/margins": 0.9526273012161255, | |
| "rewards/rejected": -0.9036401510238647, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.2232332423415226, | |
| "grad_norm": 5.1497344970703125, | |
| "learning_rate": 0.00019967793553501346, | |
| "logits/chosen": -0.3103107213973999, | |
| "logits/rejected": -0.3952590227127075, | |
| "logps/chosen": -12.430742263793945, | |
| "logps/rejected": -20.878339767456055, | |
| "loss": 1.2279822826385498, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6726821660995483, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.020153822377324104, | |
| "rewards/margins": 0.7637170553207397, | |
| "rewards/rejected": -0.7435632348060608, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.2280861389141644, | |
| "grad_norm": 3.151014566421509, | |
| "learning_rate": 0.00019963358932550192, | |
| "logits/chosen": -0.3890960216522217, | |
| "logits/rejected": -0.4021611511707306, | |
| "logps/chosen": -10.522011756896973, | |
| "logps/rejected": -18.351852416992188, | |
| "loss": 1.1763105392456055, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5507612228393555, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.15107618272304535, | |
| "rewards/margins": 0.30810290575027466, | |
| "rewards/rejected": -0.4591791033744812, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.2329390354868062, | |
| "grad_norm": 4.961374759674072, | |
| "learning_rate": 0.00019958638928478523, | |
| "logits/chosen": -0.31074726581573486, | |
| "logits/rejected": -0.3801327645778656, | |
| "logps/chosen": -9.19954776763916, | |
| "logps/rejected": -21.655811309814453, | |
| "loss": 0.9774930477142334, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5149185657501221, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.030308127403259277, | |
| "rewards/margins": 0.8868625164031982, | |
| "rewards/rejected": -0.8565543293952942, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.23779193205944799, | |
| "grad_norm": 4.1918511390686035, | |
| "learning_rate": 0.00019953633676482669, | |
| "logits/chosen": -0.3845188617706299, | |
| "logits/rejected": -0.4037459194660187, | |
| "logps/chosen": -14.745367050170898, | |
| "logps/rejected": -18.788145065307617, | |
| "loss": 1.2587707042694092, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7012693285942078, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.11992412805557251, | |
| "rewards/margins": 0.648144543170929, | |
| "rewards/rejected": -0.5282202959060669, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.011207 | |
| }, | |
| { | |
| "epoch": 0.24264482863208978, | |
| "grad_norm": 3.7718863487243652, | |
| "learning_rate": 0.00019948343319929374, | |
| "logits/chosen": -0.3694141209125519, | |
| "logits/rejected": -0.474610835313797, | |
| "logps/chosen": -10.025066375732422, | |
| "logps/rejected": -20.226930618286133, | |
| "loss": 1.0972646474838257, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5580352544784546, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.015783965587615967, | |
| "rewards/margins": 0.48214325308799744, | |
| "rewards/rejected": -0.4979272484779358, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.011207 | |
| }, | |
| { | |
| "epoch": 0.24749772520473157, | |
| "grad_norm": 3.204578161239624, | |
| "learning_rate": 0.00019942768010351727, | |
| "logits/chosen": -0.5031870007514954, | |
| "logits/rejected": -0.46329694986343384, | |
| "logps/chosen": -13.154851913452148, | |
| "logps/rejected": -16.299560546875, | |
| "loss": 1.1670925617218018, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.648939311504364, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.07203729450702667, | |
| "rewards/margins": 0.5248441696166992, | |
| "rewards/rejected": -0.5968814492225647, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.2523506217773734, | |
| "grad_norm": 3.282288074493408, | |
| "learning_rate": 0.00019936907907444788, | |
| "logits/chosen": -0.40597957372665405, | |
| "logits/rejected": -0.4711161255836487, | |
| "logps/chosen": -10.530755996704102, | |
| "logps/rejected": -18.246557235717773, | |
| "loss": 1.1418707370758057, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6192983984947205, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.012871884740889072, | |
| "rewards/margins": 0.4392779469490051, | |
| "rewards/rejected": -0.4264060854911804, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.25720351835001515, | |
| "grad_norm": 3.151282787322998, | |
| "learning_rate": 0.00019930763179061036, | |
| "logits/chosen": -0.4330732226371765, | |
| "logits/rejected": -0.456554651260376, | |
| "logps/chosen": -8.236556053161621, | |
| "logps/rejected": -15.27733039855957, | |
| "loss": 1.168614149093628, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6144590973854065, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.12388759851455688, | |
| "rewards/margins": 0.6339080333709717, | |
| "rewards/rejected": -0.5100203156471252, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.26205641492265697, | |
| "grad_norm": 3.4259731769561768, | |
| "learning_rate": 0.00019924334001205542, | |
| "logits/chosen": -0.4073447287082672, | |
| "logits/rejected": -0.42736995220184326, | |
| "logps/chosen": -11.766214370727539, | |
| "logps/rejected": -20.65784454345703, | |
| "loss": 1.234757423400879, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6889488697052002, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08055731654167175, | |
| "rewards/margins": 0.7608071565628052, | |
| "rewards/rejected": -0.680249810218811, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.26690931149529873, | |
| "grad_norm": 2.5751075744628906, | |
| "learning_rate": 0.00019917620558030947, | |
| "logits/chosen": -0.45161640644073486, | |
| "logits/rejected": -0.40232208371162415, | |
| "logps/chosen": -10.377983093261719, | |
| "logps/rejected": -15.469682693481445, | |
| "loss": 1.1288338899612427, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6078510284423828, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.13011425733566284, | |
| "rewards/margins": 0.7133916020393372, | |
| "rewards/rejected": -0.5832774043083191, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.27176220806794055, | |
| "grad_norm": 1.9270464181900024, | |
| "learning_rate": 0.0001991062304183218, | |
| "logits/chosen": -0.3679361641407013, | |
| "logits/rejected": -0.4820949137210846, | |
| "logps/chosen": -6.5226335525512695, | |
| "logps/rejected": -21.38983917236328, | |
| "loss": 0.9311513900756836, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.48036620020866394, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1770131140947342, | |
| "rewards/margins": 0.9639515280723572, | |
| "rewards/rejected": -0.7869384288787842, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.27661510464058237, | |
| "grad_norm": 2.343013048171997, | |
| "learning_rate": 0.0001990334165304094, | |
| "logits/chosen": -0.3758355975151062, | |
| "logits/rejected": -0.446993350982666, | |
| "logps/chosen": -10.01812744140625, | |
| "logps/rejected": -22.936779022216797, | |
| "loss": 1.017271637916565, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5227488875389099, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.20892874896526337, | |
| "rewards/margins": 0.9375370144844055, | |
| "rewards/rejected": -0.728608250617981, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.28146800121322413, | |
| "grad_norm": 3.4284698963165283, | |
| "learning_rate": 0.00019895776600219973, | |
| "logits/chosen": -0.3820294141769409, | |
| "logits/rejected": -0.4261220097541809, | |
| "logps/chosen": -12.147420883178711, | |
| "logps/rejected": -21.496156692504883, | |
| "loss": 1.173353910446167, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.579372763633728, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.036380209028720856, | |
| "rewards/margins": 0.430204302072525, | |
| "rewards/rejected": -0.46658453345298767, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.28632089778586595, | |
| "grad_norm": 3.7487685680389404, | |
| "learning_rate": 0.0001988792810005708, | |
| "logits/chosen": -0.3050299882888794, | |
| "logits/rejected": -0.40809452533721924, | |
| "logps/chosen": -10.987959861755371, | |
| "logps/rejected": -24.92184066772461, | |
| "loss": 1.2469043731689453, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6960954070091248, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.009784307330846786, | |
| "rewards/margins": 0.4835450351238251, | |
| "rewards/rejected": -0.473760724067688, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.2911737943585077, | |
| "grad_norm": 3.093308448791504, | |
| "learning_rate": 0.00019879796377358927, | |
| "logits/chosen": -0.37827837467193604, | |
| "logits/rejected": -0.4184655547142029, | |
| "logps/chosen": -7.49070930480957, | |
| "logps/rejected": -17.80307388305664, | |
| "loss": 1.0403252840042114, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.49073174595832825, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.00874985009431839, | |
| "rewards/margins": 0.46609920263290405, | |
| "rewards/rejected": -0.47484904527664185, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.2960266909311495, | |
| "grad_norm": 3.3970422744750977, | |
| "learning_rate": 0.00019871381665044594, | |
| "logits/chosen": -0.3776484727859497, | |
| "logits/rejected": -0.3863822817802429, | |
| "logps/chosen": -9.921972274780273, | |
| "logps/rejected": -15.067032814025879, | |
| "loss": 1.250232219696045, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7360854744911194, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09412748366594315, | |
| "rewards/margins": 0.5320085287094116, | |
| "rewards/rejected": -0.4378809928894043, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.30087958750379135, | |
| "grad_norm": 2.651646137237549, | |
| "learning_rate": 0.00019862684204138907, | |
| "logits/chosen": -0.3813178539276123, | |
| "logits/rejected": -0.3218821585178375, | |
| "logps/chosen": -12.840286254882812, | |
| "logps/rejected": -17.035186767578125, | |
| "loss": 1.1197326183319092, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6345531940460205, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10404972732067108, | |
| "rewards/margins": 0.6996921896934509, | |
| "rewards/rejected": -0.5956425070762634, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.3057324840764331, | |
| "grad_norm": 2.7409791946411133, | |
| "learning_rate": 0.00019853704243765532, | |
| "logits/chosen": -0.21578770875930786, | |
| "logits/rejected": -0.40845662355422974, | |
| "logps/chosen": -9.395906448364258, | |
| "logps/rejected": -28.66230583190918, | |
| "loss": 1.0102654695510864, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6361392736434937, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23129011690616608, | |
| "rewards/margins": 1.06308913230896, | |
| "rewards/rejected": -0.8317990303039551, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.3105853806490749, | |
| "grad_norm": 2.692429304122925, | |
| "learning_rate": 0.00019844442041139847, | |
| "logits/chosen": -0.35631364583969116, | |
| "logits/rejected": -0.3108435571193695, | |
| "logps/chosen": -11.395570755004883, | |
| "logps/rejected": -16.973485946655273, | |
| "loss": 0.9985603094100952, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5419827699661255, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07737573981285095, | |
| "rewards/margins": 0.7498005628585815, | |
| "rewards/rejected": -0.672424852848053, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.3154382772217167, | |
| "grad_norm": 5.938281536102295, | |
| "learning_rate": 0.00019834897861561573, | |
| "logits/chosen": -0.3479470908641815, | |
| "logits/rejected": -0.3646903932094574, | |
| "logps/chosen": -8.458881378173828, | |
| "logps/rejected": -18.25616455078125, | |
| "loss": 1.0791547298431396, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5545474290847778, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.05356256291270256, | |
| "rewards/margins": 0.5557125210762024, | |
| "rewards/rejected": -0.6092751026153564, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.3202911737943585, | |
| "grad_norm": 2.738814353942871, | |
| "learning_rate": 0.00019825071978407156, | |
| "logits/chosen": -0.29352137446403503, | |
| "logits/rejected": -0.2870010733604431, | |
| "logps/chosen": -12.466264724731445, | |
| "logps/rejected": -22.961450576782227, | |
| "loss": 0.9836492538452148, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5442343354225159, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.123663991689682, | |
| "rewards/margins": 0.9405882954597473, | |
| "rewards/rejected": -0.8169243335723877, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.3251440703670003, | |
| "grad_norm": 3.51104998588562, | |
| "learning_rate": 0.00019814964673121966, | |
| "logits/chosen": -0.3337523937225342, | |
| "logits/rejected": -0.3147628903388977, | |
| "logps/chosen": -11.947603225708008, | |
| "logps/rejected": -17.78832244873047, | |
| "loss": 1.2882845401763916, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8149017095565796, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.04635877162218094, | |
| "rewards/margins": 0.7259438037872314, | |
| "rewards/rejected": -0.7723026275634766, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.3299969669396421, | |
| "grad_norm": 3.068816661834717, | |
| "learning_rate": 0.00019804576235212218, | |
| "logits/chosen": -0.2215232253074646, | |
| "logits/rejected": -0.2657161355018616, | |
| "logps/chosen": -11.033540725708008, | |
| "logps/rejected": -25.50714874267578, | |
| "loss": 0.8847059607505798, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5216297507286072, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09357042610645294, | |
| "rewards/margins": 1.1900687217712402, | |
| "rewards/rejected": -1.0964982509613037, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.3348498635122839, | |
| "grad_norm": 2.5830941200256348, | |
| "learning_rate": 0.00019793906962236682, | |
| "logits/chosen": -0.24091127514839172, | |
| "logits/rejected": -0.29128578305244446, | |
| "logps/chosen": -10.63074016571045, | |
| "logps/rejected": -26.628215789794922, | |
| "loss": 1.0002039670944214, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5858277082443237, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06674355268478394, | |
| "rewards/margins": 1.1017783880233765, | |
| "rewards/rejected": -1.0350347757339478, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.33970276008492567, | |
| "grad_norm": 2.7311224937438965, | |
| "learning_rate": 0.00019782957159798157, | |
| "logits/chosen": -0.30429190397262573, | |
| "logits/rejected": -0.2560291290283203, | |
| "logps/chosen": -12.162567138671875, | |
| "logps/rejected": -17.434350967407227, | |
| "loss": 1.063048005104065, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6400512456893921, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.18220071494579315, | |
| "rewards/margins": 1.0044963359832764, | |
| "rewards/rejected": -0.8222954869270325, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.3445556566575675, | |
| "grad_norm": 3.414921760559082, | |
| "learning_rate": 0.0001977172714153473, | |
| "logits/chosen": -0.28515180945396423, | |
| "logits/rejected": -0.3108617961406708, | |
| "logps/chosen": -10.81340503692627, | |
| "logps/rejected": -26.520463943481445, | |
| "loss": 1.1172614097595215, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.685325026512146, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1235567182302475, | |
| "rewards/margins": 1.0347576141357422, | |
| "rewards/rejected": -0.9112008810043335, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.3494085532302093, | |
| "grad_norm": 4.576763153076172, | |
| "learning_rate": 0.00019760217229110777, | |
| "logits/chosen": -0.36723142862319946, | |
| "logits/rejected": -0.3557523488998413, | |
| "logps/chosen": -12.69983196258545, | |
| "logps/rejected": -20.64535140991211, | |
| "loss": 1.1201751232147217, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.692030668258667, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.049573928117752075, | |
| "rewards/margins": 1.0138797760009766, | |
| "rewards/rejected": -0.9643057584762573, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.35426144980285107, | |
| "grad_norm": 4.538747310638428, | |
| "learning_rate": 0.00019748427752207755, | |
| "logits/chosen": -0.34310680627822876, | |
| "logits/rejected": -0.366294801235199, | |
| "logps/chosen": -12.221488952636719, | |
| "logps/rejected": -21.165037155151367, | |
| "loss": 1.2563344240188599, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7162244915962219, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.12930546700954437, | |
| "rewards/margins": 0.6588571667671204, | |
| "rewards/rejected": -0.7881627082824707, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.3591143463754929, | |
| "grad_norm": 2.0262386798858643, | |
| "learning_rate": 0.00019736359048514766, | |
| "logits/chosen": -0.334412157535553, | |
| "logits/rejected": -0.37951967120170593, | |
| "logps/chosen": -14.834428787231445, | |
| "logps/rejected": -21.54924964904785, | |
| "loss": 1.0132083892822266, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6331067085266113, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1725282073020935, | |
| "rewards/margins": 1.028924822807312, | |
| "rewards/rejected": -0.8563966751098633, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.36396724294813465, | |
| "grad_norm": 3.2811484336853027, | |
| "learning_rate": 0.00019724011463718885, | |
| "logits/chosen": -0.360372394323349, | |
| "logits/rejected": -0.35564228892326355, | |
| "logps/chosen": -11.420612335205078, | |
| "logps/rejected": -19.772428512573242, | |
| "loss": 1.2705371379852295, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6594747304916382, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.09604446589946747, | |
| "rewards/margins": 0.5641387701034546, | |
| "rewards/rejected": -0.660183310508728, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.36882013952077647, | |
| "grad_norm": 3.251281976699829, | |
| "learning_rate": 0.0001971138535149523, | |
| "logits/chosen": -0.3563613295555115, | |
| "logits/rejected": -0.38878530263900757, | |
| "logps/chosen": -12.576432228088379, | |
| "logps/rejected": -21.920602798461914, | |
| "loss": 0.9680290222167969, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5066214799880981, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.009179912507534027, | |
| "rewards/margins": 0.7688724994659424, | |
| "rewards/rejected": -0.7780523896217346, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.37367303609341823, | |
| "grad_norm": 2.962810516357422, | |
| "learning_rate": 0.00019698481073496878, | |
| "logits/chosen": -0.3119925856590271, | |
| "logits/rejected": -0.4056414067745209, | |
| "logps/chosen": -9.659420013427734, | |
| "logps/rejected": -23.653026580810547, | |
| "loss": 0.9925091862678528, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5779968500137329, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.030417252331972122, | |
| "rewards/margins": 0.987002968788147, | |
| "rewards/rejected": -0.956585705280304, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.37852593266606005, | |
| "grad_norm": 10.599248886108398, | |
| "learning_rate": 0.00019685298999344458, | |
| "logits/chosen": -0.35163983702659607, | |
| "logits/rejected": -0.3840740919113159, | |
| "logps/chosen": -8.082690238952637, | |
| "logps/rejected": -25.49774169921875, | |
| "loss": 1.0417295694351196, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7148680686950684, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.03415816277265549, | |
| "rewards/margins": 1.2999666929244995, | |
| "rewards/rejected": -1.3341249227523804, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.38337882923870187, | |
| "grad_norm": 3.775139331817627, | |
| "learning_rate": 0.00019671839506615614, | |
| "logits/chosen": -0.3263033926486969, | |
| "logits/rejected": -0.336015522480011, | |
| "logps/chosen": -12.873096466064453, | |
| "logps/rejected": -25.73821258544922, | |
| "loss": 1.011587142944336, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5964220762252808, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.15943416953086853, | |
| "rewards/margins": 1.001997947692871, | |
| "rewards/rejected": -0.8425638675689697, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.38823172581134363, | |
| "grad_norm": 2.6962356567382812, | |
| "learning_rate": 0.00019658102980834146, | |
| "logits/chosen": -0.42636168003082275, | |
| "logits/rejected": -0.40870201587677, | |
| "logps/chosen": -9.675471305847168, | |
| "logps/rejected": -17.18560791015625, | |
| "loss": 1.0823123455047607, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6633837819099426, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09595775604248047, | |
| "rewards/margins": 0.8637285232543945, | |
| "rewards/rejected": -0.7677708268165588, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.39308462238398545, | |
| "grad_norm": 3.252925395965576, | |
| "learning_rate": 0.0001964408981545898, | |
| "logits/chosen": -0.3987385034561157, | |
| "logits/rejected": -0.3940485715866089, | |
| "logps/chosen": -11.167372703552246, | |
| "logps/rejected": -19.442848205566406, | |
| "loss": 1.2748379707336426, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8224515914916992, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.004448680207133293, | |
| "rewards/margins": 0.9587394595146179, | |
| "rewards/rejected": -0.9631881713867188, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.3979375189566272, | |
| "grad_norm": 2.8878297805786133, | |
| "learning_rate": 0.00019629800411872928, | |
| "logits/chosen": -0.35343819856643677, | |
| "logits/rejected": -0.4096568822860718, | |
| "logps/chosen": -8.287420272827148, | |
| "logps/rejected": -20.879899978637695, | |
| "loss": 0.9840810894966125, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5656735897064209, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13655401766300201, | |
| "rewards/margins": 0.9052618145942688, | |
| "rewards/rejected": -0.768707811832428, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.40279041552926903, | |
| "grad_norm": 2.34645676612854, | |
| "learning_rate": 0.00019615235179371135, | |
| "logits/chosen": -0.31612086296081543, | |
| "logits/rejected": -0.39879709482192993, | |
| "logps/chosen": -9.401403427124023, | |
| "logps/rejected": -27.325342178344727, | |
| "loss": 0.888444721698761, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.569918692111969, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23369260132312775, | |
| "rewards/margins": 1.3009941577911377, | |
| "rewards/rejected": -1.0673015117645264, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.40764331210191085, | |
| "grad_norm": 2.7571706771850586, | |
| "learning_rate": 0.00019600394535149404, | |
| "logits/chosen": -0.34237152338027954, | |
| "logits/rejected": -0.38029745221138, | |
| "logps/chosen": -9.792423248291016, | |
| "logps/rejected": -21.61672592163086, | |
| "loss": 1.0087002515792847, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5312238335609436, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07024291902780533, | |
| "rewards/margins": 0.8068092465400696, | |
| "rewards/rejected": -0.7365662455558777, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.4124962086745526, | |
| "grad_norm": 2.0822556018829346, | |
| "learning_rate": 0.0001958527890429223, | |
| "logits/chosen": -0.3475739657878876, | |
| "logits/rejected": -0.31929460167884827, | |
| "logps/chosen": -13.526400566101074, | |
| "logps/rejected": -25.060049057006836, | |
| "loss": 0.8273504376411438, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5433682203292847, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2506234347820282, | |
| "rewards/margins": 1.4649745225906372, | |
| "rewards/rejected": -1.2143512964248657, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.41734910524719443, | |
| "grad_norm": 2.4087798595428467, | |
| "learning_rate": 0.0001956988871976062, | |
| "logits/chosen": -0.27175548672676086, | |
| "logits/rejected": -0.3286592662334442, | |
| "logps/chosen": -7.984870910644531, | |
| "logps/rejected": -24.256772994995117, | |
| "loss": 0.7937061786651611, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.42936819791793823, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.059691205620765686, | |
| "rewards/margins": 1.0793851613998413, | |
| "rewards/rejected": -1.0196938514709473, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.4222020018198362, | |
| "grad_norm": 2.174376964569092, | |
| "learning_rate": 0.00019554224422379686, | |
| "logits/chosen": -0.23324547708034515, | |
| "logits/rejected": -0.30267754197120667, | |
| "logps/chosen": -11.11595344543457, | |
| "logps/rejected": -27.55086326599121, | |
| "loss": 0.799884021282196, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4499448537826538, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.12257401645183563, | |
| "rewards/margins": 1.2369678020477295, | |
| "rewards/rejected": -1.114393711090088, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.427054898392478, | |
| "grad_norm": 4.111970901489258, | |
| "learning_rate": 0.00019538286460826041, | |
| "logits/chosen": -0.2658248543739319, | |
| "logits/rejected": -0.2973652482032776, | |
| "logps/chosen": -8.75698471069336, | |
| "logps/rejected": -22.72409439086914, | |
| "loss": 0.8912484645843506, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.48959213495254517, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09087920188903809, | |
| "rewards/margins": 1.290701150894165, | |
| "rewards/rejected": -1.199821949005127, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.43190779496511983, | |
| "grad_norm": 3.519275665283203, | |
| "learning_rate": 0.0001952207529161492, | |
| "logits/chosen": -0.3236900866031647, | |
| "logits/rejected": -0.29652339220046997, | |
| "logps/chosen": -15.083149909973145, | |
| "logps/rejected": -29.6583251953125, | |
| "loss": 1.028883695602417, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7164204120635986, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.056427597999572754, | |
| "rewards/margins": 1.5590038299560547, | |
| "rewards/rejected": -1.5025763511657715, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.4367606915377616, | |
| "grad_norm": 5.104607105255127, | |
| "learning_rate": 0.00019505591379087128, | |
| "logits/chosen": -0.30673032999038696, | |
| "logits/rejected": -0.284626841545105, | |
| "logps/chosen": -18.149417877197266, | |
| "logps/rejected": -27.66114616394043, | |
| "loss": 1.1724226474761963, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8443087935447693, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12549515068531036, | |
| "rewards/margins": 1.6692070960998535, | |
| "rewards/rejected": -1.5437119007110596, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.4416135881104034, | |
| "grad_norm": 5.404626846313477, | |
| "learning_rate": 0.00019488835195395718, | |
| "logits/chosen": -0.25754019618034363, | |
| "logits/rejected": -0.25054478645324707, | |
| "logps/chosen": -11.13974380493164, | |
| "logps/rejected": -29.229190826416016, | |
| "loss": 0.9712298512458801, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.614799976348877, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06202991306781769, | |
| "rewards/margins": 1.4658480882644653, | |
| "rewards/rejected": -1.4038183689117432, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.4464664846830452, | |
| "grad_norm": 4.149505138397217, | |
| "learning_rate": 0.00019471807220492487, | |
| "logits/chosen": -0.3054165542125702, | |
| "logits/rejected": -0.3217582106590271, | |
| "logps/chosen": -7.596218585968018, | |
| "logps/rejected": -24.510986328125, | |
| "loss": 0.8925672173500061, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5096707344055176, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.05373791605234146, | |
| "rewards/margins": 1.6141862869262695, | |
| "rewards/rejected": -1.560448408126831, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.451319381255687, | |
| "grad_norm": 2.699763536453247, | |
| "learning_rate": 0.00019454507942114218, | |
| "logits/chosen": -0.4031309485435486, | |
| "logits/rejected": -0.3797576129436493, | |
| "logps/chosen": -11.298748970031738, | |
| "logps/rejected": -21.17618751525879, | |
| "loss": 0.9288226366043091, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5129250884056091, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.09262087196111679, | |
| "rewards/margins": 1.186156988143921, | |
| "rewards/rejected": -1.0935360193252563, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.4561722778283288, | |
| "grad_norm": 2.987886905670166, | |
| "learning_rate": 0.00019436937855768705, | |
| "logits/chosen": -0.3467521667480469, | |
| "logits/rejected": -0.38047531247138977, | |
| "logps/chosen": -8.127204895019531, | |
| "logps/rejected": -27.24859619140625, | |
| "loss": 0.9090497493743896, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5626466274261475, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.01449224166572094, | |
| "rewards/margins": 1.3198893070220947, | |
| "rewards/rejected": -1.3053967952728271, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.011216 | |
| }, | |
| { | |
| "epoch": 0.46102517440097057, | |
| "grad_norm": 6.682155609130859, | |
| "learning_rate": 0.0001941909746472057, | |
| "logits/chosen": -0.36795341968536377, | |
| "logits/rejected": -0.33038249611854553, | |
| "logps/chosen": -14.30661392211914, | |
| "logps/rejected": -27.33529281616211, | |
| "loss": 1.2022923231124878, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6685870289802551, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.14697454869747162, | |
| "rewards/margins": 0.7069932818412781, | |
| "rewards/rejected": -0.8539677858352661, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.4658780709736124, | |
| "grad_norm": 6.086058616638184, | |
| "learning_rate": 0.00019400987279976847, | |
| "logits/chosen": -0.4552175998687744, | |
| "logits/rejected": -0.3753393590450287, | |
| "logps/chosen": -12.3525390625, | |
| "logps/rejected": -24.96709632873535, | |
| "loss": 1.1781623363494873, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8305119276046753, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.04669938236474991, | |
| "rewards/margins": 1.6278446912765503, | |
| "rewards/rejected": -1.674544095993042, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.011216 | |
| }, | |
| { | |
| "epoch": 0.47073096754625415, | |
| "grad_norm": 2.856499671936035, | |
| "learning_rate": 0.00019382607820272343, | |
| "logits/chosen": -0.34398210048675537, | |
| "logits/rejected": -0.3632335662841797, | |
| "logps/chosen": -13.498963356018066, | |
| "logps/rejected": -23.799148559570312, | |
| "loss": 0.9125381708145142, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6083617806434631, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.16915112733840942, | |
| "rewards/margins": 1.5896618366241455, | |
| "rewards/rejected": -1.4205105304718018, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.011216 | |
| }, | |
| { | |
| "epoch": 0.47558386411889597, | |
| "grad_norm": 2.2536661624908447, | |
| "learning_rate": 0.00019363959612054768, | |
| "logits/chosen": -0.3522893190383911, | |
| "logits/rejected": -0.3821050822734833, | |
| "logps/chosen": -7.958831310272217, | |
| "logps/rejected": -22.634958267211914, | |
| "loss": 0.9238535165786743, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5074257254600525, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.05879054591059685, | |
| "rewards/margins": 1.1695164442062378, | |
| "rewards/rejected": -1.1107258796691895, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.011217 | |
| }, | |
| { | |
| "epoch": 0.48043676069153773, | |
| "grad_norm": 4.499397277832031, | |
| "learning_rate": 0.00019345043189469675, | |
| "logits/chosen": -0.3616553843021393, | |
| "logits/rejected": -0.3694867789745331, | |
| "logps/chosen": -9.15666389465332, | |
| "logps/rejected": -22.706497192382812, | |
| "loss": 0.8626678586006165, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4881688058376312, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22088897228240967, | |
| "rewards/margins": 1.2141640186309814, | |
| "rewards/rejected": -0.993274986743927, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.011217 | |
| }, | |
| { | |
| "epoch": 0.48528965726417955, | |
| "grad_norm": 2.5381503105163574, | |
| "learning_rate": 0.00019325859094345148, | |
| "logits/chosen": -0.3770003914833069, | |
| "logits/rejected": -0.4174918234348297, | |
| "logps/chosen": -10.83204460144043, | |
| "logps/rejected": -20.01091194152832, | |
| "loss": 1.1128623485565186, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6556410193443298, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08420430123806, | |
| "rewards/margins": 0.7714729905128479, | |
| "rewards/rejected": -0.6872686743736267, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.011217 | |
| }, | |
| { | |
| "epoch": 0.49014255383682137, | |
| "grad_norm": 3.571274995803833, | |
| "learning_rate": 0.000193064078761763, | |
| "logits/chosen": -0.3813248872756958, | |
| "logits/rejected": -0.4329451024532318, | |
| "logps/chosen": -11.104312896728516, | |
| "logps/rejected": -24.20327377319336, | |
| "loss": 1.1288418769836426, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7659333944320679, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13299986720085144, | |
| "rewards/margins": 1.1876386404037476, | |
| "rewards/rejected": -1.0546387434005737, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.011197 | |
| }, | |
| { | |
| "epoch": 0.49499545040946313, | |
| "grad_norm": 3.4420199394226074, | |
| "learning_rate": 0.00019286690092109495, | |
| "logits/chosen": -0.3884170353412628, | |
| "logits/rejected": -0.4291474521160126, | |
| "logps/chosen": -8.859447479248047, | |
| "logps/rejected": -19.800003051757812, | |
| "loss": 1.0438815355300903, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6051428318023682, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10340974479913712, | |
| "rewards/margins": 0.9933844804763794, | |
| "rewards/rejected": -0.8899747729301453, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.011197 | |
| }, | |
| { | |
| "epoch": 0.49984834698210495, | |
| "grad_norm": 3.0272207260131836, | |
| "learning_rate": 0.00019266706306926437, | |
| "logits/chosen": -0.28712770342826843, | |
| "logits/rejected": -0.482435941696167, | |
| "logps/chosen": -8.935839653015137, | |
| "logps/rejected": -26.6412353515625, | |
| "loss": 1.1441514492034912, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6857534646987915, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1457400619983673, | |
| "rewards/margins": 1.0326664447784424, | |
| "rewards/rejected": -0.8869264125823975, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.011197 | |
| }, | |
| { | |
| "epoch": 0.5047012435547468, | |
| "grad_norm": 2.2835068702697754, | |
| "learning_rate": 0.00019246457093027955, | |
| "logits/chosen": -0.3885180354118347, | |
| "logits/rejected": -0.4434734582901001, | |
| "logps/chosen": -7.748335838317871, | |
| "logps/rejected": -27.667823791503906, | |
| "loss": 0.7652894258499146, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.3754329979419708, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.06499351561069489, | |
| "rewards/margins": 1.0574610233306885, | |
| "rewards/rejected": -0.9924674034118652, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.011197 | |
| }, | |
| { | |
| "epoch": 0.5095541401273885, | |
| "grad_norm": 3.3575081825256348, | |
| "learning_rate": 0.0001922594303041764, | |
| "logits/chosen": -0.314767062664032, | |
| "logits/rejected": -0.418552041053772, | |
| "logps/chosen": -9.141714096069336, | |
| "logps/rejected": -26.07691192626953, | |
| "loss": 0.8440835475921631, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.53468257188797, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18071942031383514, | |
| "rewards/margins": 1.4176182746887207, | |
| "rewards/rejected": -1.2368988990783691, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.011197 | |
| }, | |
| { | |
| "epoch": 0.5144070367000303, | |
| "grad_norm": 3.938190460205078, | |
| "learning_rate": 0.0001920516470668519, | |
| "logits/chosen": -0.38045060634613037, | |
| "logits/rejected": -0.46996402740478516, | |
| "logps/chosen": -9.252923965454102, | |
| "logps/rejected": -25.073986053466797, | |
| "loss": 0.8858380913734436, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5138120651245117, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.24657589197158813, | |
| "rewards/margins": 1.3090505599975586, | |
| "rewards/rejected": -1.0624747276306152, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.011198 | |
| }, | |
| { | |
| "epoch": 0.5192599332726722, | |
| "grad_norm": 3.807465076446533, | |
| "learning_rate": 0.00019184122716989625, | |
| "logits/chosen": -0.38855308294296265, | |
| "logits/rejected": -0.384641170501709, | |
| "logps/chosen": -10.419635772705078, | |
| "logps/rejected": -23.18486213684082, | |
| "loss": 1.1566160917282104, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6819642782211304, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.015541527420282364, | |
| "rewards/margins": 1.0274978876113892, | |
| "rewards/rejected": -1.0430394411087036, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.011198 | |
| }, | |
| { | |
| "epoch": 0.5241128298453139, | |
| "grad_norm": 3.046457529067993, | |
| "learning_rate": 0.0001916281766404221, | |
| "logits/chosen": -0.41123640537261963, | |
| "logits/rejected": -0.4135390818119049, | |
| "logps/chosen": -10.575555801391602, | |
| "logps/rejected": -25.36039924621582, | |
| "loss": 0.9802708625793457, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5873898863792419, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.016565335914492607, | |
| "rewards/margins": 1.2314006090164185, | |
| "rewards/rejected": -1.2479660511016846, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.011199 | |
| }, | |
| { | |
| "epoch": 0.5289657264179557, | |
| "grad_norm": 5.713778495788574, | |
| "learning_rate": 0.00019141250158089202, | |
| "logits/chosen": -0.36335325241088867, | |
| "logits/rejected": -0.42550188302993774, | |
| "logps/chosen": -11.970105171203613, | |
| "logps/rejected": -30.854656219482422, | |
| "loss": 1.0406579971313477, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7013589143753052, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.020902972668409348, | |
| "rewards/margins": 1.5762500762939453, | |
| "rewards/rejected": -1.5553470849990845, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.011199 | |
| }, | |
| { | |
| "epoch": 0.5338186229905975, | |
| "grad_norm": 3.487213373184204, | |
| "learning_rate": 0.0001911942081689437, | |
| "logits/chosen": -0.33955633640289307, | |
| "logits/rejected": -0.4554653465747833, | |
| "logps/chosen": -13.618782997131348, | |
| "logps/rejected": -27.65629005432129, | |
| "loss": 1.2663241624832153, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.8004875183105469, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.034927308559417725, | |
| "rewards/margins": 1.3416428565979004, | |
| "rewards/rejected": -1.306715488433838, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.011199 | |
| }, | |
| { | |
| "epoch": 0.5386715195632393, | |
| "grad_norm": 5.0910491943359375, | |
| "learning_rate": 0.00019097330265721295, | |
| "logits/chosen": -0.2648548185825348, | |
| "logits/rejected": -0.3673378527164459, | |
| "logps/chosen": -12.02265453338623, | |
| "logps/rejected": -30.836153030395508, | |
| "loss": 1.0310111045837402, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5808767676353455, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.09649889171123505, | |
| "rewards/margins": 1.15187406539917, | |
| "rewards/rejected": -1.248373031616211, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.011199 | |
| }, | |
| { | |
| "epoch": 0.5435244161358811, | |
| "grad_norm": 2.8877944946289062, | |
| "learning_rate": 0.00019074979137315468, | |
| "logits/chosen": -0.4370982348918915, | |
| "logits/rejected": -0.41886797547340393, | |
| "logps/chosen": -8.66671371459961, | |
| "logps/rejected": -21.121248245239258, | |
| "loss": 0.915783703327179, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5682031512260437, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.0029869861900806427, | |
| "rewards/margins": 1.161545753479004, | |
| "rewards/rejected": -1.1645326614379883, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.0112 | |
| }, | |
| { | |
| "epoch": 0.5483773127085229, | |
| "grad_norm": 6.939223289489746, | |
| "learning_rate": 0.0001905236807188616, | |
| "logits/chosen": -0.32761722803115845, | |
| "logits/rejected": -0.3690508306026459, | |
| "logps/chosen": -9.920032501220703, | |
| "logps/rejected": -33.124969482421875, | |
| "loss": 0.9988139867782593, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6303930282592773, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.05219712853431702, | |
| "rewards/margins": 1.4993199110031128, | |
| "rewards/rejected": -1.5515170097351074, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.0112 | |
| }, | |
| { | |
| "epoch": 0.5532302092811647, | |
| "grad_norm": 3.1117734909057617, | |
| "learning_rate": 0.00019029497717088086, | |
| "logits/chosen": -0.3898760974407196, | |
| "logits/rejected": -0.42370229959487915, | |
| "logps/chosen": -8.5205078125, | |
| "logps/rejected": -28.223445892333984, | |
| "loss": 0.9178063869476318, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5913013219833374, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11722102761268616, | |
| "rewards/margins": 1.5129557847976685, | |
| "rewards/rejected": -1.3957347869873047, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.0112 | |
| }, | |
| { | |
| "epoch": 0.5580831058538065, | |
| "grad_norm": 9.934938430786133, | |
| "learning_rate": 0.00019006368728002862, | |
| "logits/chosen": -0.3294893503189087, | |
| "logits/rejected": -0.4310123026371002, | |
| "logps/chosen": -7.87459135055542, | |
| "logps/rejected": -26.407917022705078, | |
| "loss": 1.0052833557128906, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6052643656730652, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.08163556456565857, | |
| "rewards/margins": 1.377348780632019, | |
| "rewards/rejected": -1.295713186264038, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.011201 | |
| }, | |
| { | |
| "epoch": 0.5629360024264483, | |
| "grad_norm": 2.110900640487671, | |
| "learning_rate": 0.00018982981767120231, | |
| "logits/chosen": -0.2874082624912262, | |
| "logits/rejected": -0.27834200859069824, | |
| "logps/chosen": -11.620476722717285, | |
| "logps/rejected": -28.311389923095703, | |
| "loss": 0.8064985871315002, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4605460464954376, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.03009045496582985, | |
| "rewards/margins": 1.43373441696167, | |
| "rewards/rejected": -1.4036438465118408, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.0112 | |
| }, | |
| { | |
| "epoch": 0.5677888989990901, | |
| "grad_norm": 4.351490497589111, | |
| "learning_rate": 0.0001895933750431908, | |
| "logits/chosen": -0.31533291935920715, | |
| "logits/rejected": -0.33318501710891724, | |
| "logps/chosen": -9.928375244140625, | |
| "logps/rejected": -26.295669555664062, | |
| "loss": 1.0582681894302368, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6660478711128235, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0869743824005127, | |
| "rewards/margins": 1.2630525827407837, | |
| "rewards/rejected": -1.3500269651412964, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.011201 | |
| }, | |
| { | |
| "epoch": 0.5726417955717319, | |
| "grad_norm": 2.8951752185821533, | |
| "learning_rate": 0.0001893543661684828, | |
| "logits/chosen": -0.33839067816734314, | |
| "logits/rejected": -0.3445620536804199, | |
| "logps/chosen": -8.102829933166504, | |
| "logps/rejected": -22.460590362548828, | |
| "loss": 0.7739503979682922, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.43036913871765137, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1979444921016693, | |
| "rewards/margins": 1.243354082107544, | |
| "rewards/rejected": -1.0454095602035522, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.011201 | |
| }, | |
| { | |
| "epoch": 0.5774946921443737, | |
| "grad_norm": 7.867568492889404, | |
| "learning_rate": 0.00018911279789307254, | |
| "logits/chosen": -0.2516986131668091, | |
| "logits/rejected": -0.30931952595710754, | |
| "logps/chosen": -8.088445663452148, | |
| "logps/rejected": -28.628847122192383, | |
| "loss": 0.8760090470314026, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6033605933189392, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18770426511764526, | |
| "rewards/margins": 1.7780780792236328, | |
| "rewards/rejected": -1.5903738737106323, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.011201 | |
| }, | |
| { | |
| "epoch": 0.5823475887170154, | |
| "grad_norm": 9.06499195098877, | |
| "learning_rate": 0.00018886867713626394, | |
| "logits/chosen": -0.31181472539901733, | |
| "logits/rejected": -0.35031330585479736, | |
| "logps/chosen": -6.005623817443848, | |
| "logps/rejected": -24.879501342773438, | |
| "loss": 0.7998319864273071, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5190199613571167, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15923379361629486, | |
| "rewards/margins": 1.547129511833191, | |
| "rewards/rejected": -1.3878957033157349, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.011202 | |
| }, | |
| { | |
| "epoch": 0.5872004852896573, | |
| "grad_norm": 2.1969258785247803, | |
| "learning_rate": 0.00018862201089047228, | |
| "logits/chosen": -0.36267367005348206, | |
| "logits/rejected": -0.35898861289024353, | |
| "logps/chosen": -9.9768648147583, | |
| "logps/rejected": -31.001258850097656, | |
| "loss": 0.8342351913452148, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6177542805671692, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3305099904537201, | |
| "rewards/margins": 2.1078670024871826, | |
| "rewards/rejected": -1.7773568630218506, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.011202 | |
| }, | |
| { | |
| "epoch": 0.592053381862299, | |
| "grad_norm": 4.638126850128174, | |
| "learning_rate": 0.000188372806221024, | |
| "logits/chosen": -0.2871503531932831, | |
| "logits/rejected": -0.3778407573699951, | |
| "logps/chosen": -11.12118911743164, | |
| "logps/rejected": -28.530237197875977, | |
| "loss": 1.1293538808822632, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7672280669212341, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.024127217009663582, | |
| "rewards/margins": 1.5403187274932861, | |
| "rewards/rejected": -1.5644460916519165, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.5969062784349408, | |
| "grad_norm": 2.8399314880371094, | |
| "learning_rate": 0.0001881210702659542, | |
| "logits/chosen": -0.2696555554866791, | |
| "logits/rejected": -0.2814023196697235, | |
| "logps/chosen": -12.141545295715332, | |
| "logps/rejected": -28.03343391418457, | |
| "loss": 0.8627264499664307, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5336970090866089, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07849591970443726, | |
| "rewards/margins": 1.3175827264785767, | |
| "rewards/rejected": -1.2390867471694946, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.6017591750075827, | |
| "grad_norm": 2.7301621437072754, | |
| "learning_rate": 0.00018786681023580235, | |
| "logits/chosen": -0.26133084297180176, | |
| "logits/rejected": -0.2869059145450592, | |
| "logps/chosen": -12.609733581542969, | |
| "logps/rejected": -32.32643508911133, | |
| "loss": 0.7636784315109253, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.4288833439350128, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08298669010400772, | |
| "rewards/margins": 1.697174072265625, | |
| "rewards/rejected": -1.6141873598098755, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.011202 | |
| }, | |
| { | |
| "epoch": 0.6066120715802245, | |
| "grad_norm": 4.0161309242248535, | |
| "learning_rate": 0.0001876100334134056, | |
| "logits/chosen": -0.28447672724723816, | |
| "logits/rejected": -0.3584819436073303, | |
| "logps/chosen": -17.320146560668945, | |
| "logps/rejected": -27.78953742980957, | |
| "loss": 1.2440454959869385, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.867017924785614, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12772110104560852, | |
| "rewards/margins": 1.4953205585479736, | |
| "rewards/rejected": -1.3675994873046875, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.011202 | |
| }, | |
| { | |
| "epoch": 0.6114649681528662, | |
| "grad_norm": 4.7182159423828125, | |
| "learning_rate": 0.00018735074715369026, | |
| "logits/chosen": -0.3351546823978424, | |
| "logits/rejected": -0.34775683283805847, | |
| "logps/chosen": -12.783681869506836, | |
| "logps/rejected": -28.113178253173828, | |
| "loss": 1.1283553838729858, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7738282084465027, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.028632041066884995, | |
| "rewards/margins": 1.5667368173599243, | |
| "rewards/rejected": -1.5381048917770386, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.6163178647255081, | |
| "grad_norm": 3.1524689197540283, | |
| "learning_rate": 0.00018708895888346118, | |
| "logits/chosen": -0.33259081840515137, | |
| "logits/rejected": -0.38818880915641785, | |
| "logps/chosen": -8.918370246887207, | |
| "logps/rejected": -27.71927261352539, | |
| "loss": 0.9142798185348511, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6048630475997925, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16594702005386353, | |
| "rewards/margins": 1.7087321281433105, | |
| "rewards/rejected": -1.5427850484848022, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.6211707612981499, | |
| "grad_norm": 2.636528491973877, | |
| "learning_rate": 0.00018682467610118883, | |
| "logits/chosen": -0.2616899013519287, | |
| "logits/rejected": -0.31121164560317993, | |
| "logps/chosen": -7.396364212036133, | |
| "logps/rejected": -26.648653030395508, | |
| "loss": 0.685588538646698, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.40424948930740356, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18888305127620697, | |
| "rewards/margins": 1.6681468486785889, | |
| "rewards/rejected": -1.4792636632919312, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.6260236578707916, | |
| "grad_norm": 5.758305072784424, | |
| "learning_rate": 0.00018655790637679478, | |
| "logits/chosen": -0.3434281349182129, | |
| "logits/rejected": -0.36044564843177795, | |
| "logps/chosen": -8.97478199005127, | |
| "logps/rejected": -31.279216766357422, | |
| "loss": 0.9071744680404663, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5397835373878479, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0950365662574768, | |
| "rewards/margins": 1.9973032474517822, | |
| "rewards/rejected": -1.9022667407989502, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.6308765544434334, | |
| "grad_norm": 5.446237087249756, | |
| "learning_rate": 0.00018628865735143463, | |
| "logits/chosen": -0.40321969985961914, | |
| "logits/rejected": -0.44060012698173523, | |
| "logps/chosen": -7.757773399353027, | |
| "logps/rejected": -26.798311233520508, | |
| "loss": 0.9266724586486816, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5693855881690979, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0821087509393692, | |
| "rewards/margins": 1.3789818286895752, | |
| "rewards/rejected": -1.4610905647277832, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.6357294510160753, | |
| "grad_norm": 3.8205740451812744, | |
| "learning_rate": 0.00018601693673727933, | |
| "logits/chosen": -0.40578073263168335, | |
| "logits/rejected": -0.45195069909095764, | |
| "logps/chosen": -12.803248405456543, | |
| "logps/rejected": -31.195695877075195, | |
| "loss": 0.9055405855178833, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6313671469688416, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.27764347195625305, | |
| "rewards/margins": 1.7698627710342407, | |
| "rewards/rejected": -1.492219090461731, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.640582347588717, | |
| "grad_norm": 4.257453918457031, | |
| "learning_rate": 0.00018574275231729418, | |
| "logits/chosen": -0.3832516670227051, | |
| "logits/rejected": -0.40236127376556396, | |
| "logps/chosen": -10.488710403442383, | |
| "logps/rejected": -29.920001983642578, | |
| "loss": 0.9821866154670715, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6411001682281494, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.07582154870033264, | |
| "rewards/margins": 1.663382649421692, | |
| "rewards/rejected": -1.7392042875289917, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.6454352441613588, | |
| "grad_norm": 5.575984954833984, | |
| "learning_rate": 0.00018546611194501594, | |
| "logits/chosen": -0.3834778666496277, | |
| "logits/rejected": -0.4196530878543854, | |
| "logps/chosen": -8.930424690246582, | |
| "logps/rejected": -34.139522552490234, | |
| "loss": 0.9412792921066284, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5637305974960327, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.2074286788702011, | |
| "rewards/margins": 1.6988741159439087, | |
| "rewards/rejected": -1.9063026905059814, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.6502881407340007, | |
| "grad_norm": 2.6553735733032227, | |
| "learning_rate": 0.00018518702354432774, | |
| "logits/chosen": -0.302835613489151, | |
| "logits/rejected": -0.4271845519542694, | |
| "logps/chosen": -6.828452110290527, | |
| "logps/rejected": -32.71015167236328, | |
| "loss": 0.8524077534675598, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5101207494735718, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.007050292566418648, | |
| "rewards/margins": 1.6347914934158325, | |
| "rewards/rejected": -1.6277412176132202, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.6551410373066424, | |
| "grad_norm": 2.3347177505493164, | |
| "learning_rate": 0.0001849054951092324, | |
| "logits/chosen": -0.4007658362388611, | |
| "logits/rejected": -0.4008050560951233, | |
| "logps/chosen": -10.33335018157959, | |
| "logps/rejected": -23.038896560668945, | |
| "loss": 0.8887284398078918, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5501910448074341, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2812037765979767, | |
| "rewards/margins": 1.3908374309539795, | |
| "rewards/rejected": -1.1096336841583252, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.011205 | |
| }, | |
| { | |
| "epoch": 0.6599939338792842, | |
| "grad_norm": 2.9783730506896973, | |
| "learning_rate": 0.00018462153470362322, | |
| "logits/chosen": -0.3893599808216095, | |
| "logits/rejected": -0.44760093092918396, | |
| "logps/chosen": -7.99445915222168, | |
| "logps/rejected": -26.292232513427734, | |
| "loss": 0.9434449672698975, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5910047292709351, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11856328696012497, | |
| "rewards/margins": 1.402287244796753, | |
| "rewards/rejected": -1.2837239503860474, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.011205 | |
| }, | |
| { | |
| "epoch": 0.6648468304519259, | |
| "grad_norm": 2.7139804363250732, | |
| "learning_rate": 0.00018433515046105306, | |
| "logits/chosen": -0.4038199782371521, | |
| "logits/rejected": -0.3786419630050659, | |
| "logps/chosen": -11.153128623962402, | |
| "logps/rejected": -27.12870216369629, | |
| "loss": 0.8474470376968384, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5868622660636902, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18890687823295593, | |
| "rewards/margins": 1.7894312143325806, | |
| "rewards/rejected": -1.6005244255065918, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.011205 | |
| }, | |
| { | |
| "epoch": 0.6696997270245678, | |
| "grad_norm": 2.877267599105835, | |
| "learning_rate": 0.0001840463505845014, | |
| "logits/chosen": -0.30394551157951355, | |
| "logits/rejected": -0.42835158109664917, | |
| "logps/chosen": -7.929500102996826, | |
| "logps/rejected": -30.011865615844727, | |
| "loss": 0.806150496006012, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.49172037839889526, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15592113137245178, | |
| "rewards/margins": 1.6279278993606567, | |
| "rewards/rejected": -1.4720066785812378, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.011205 | |
| }, | |
| { | |
| "epoch": 0.6745526235972096, | |
| "grad_norm": 2.5812747478485107, | |
| "learning_rate": 0.0001837551433461393, | |
| "logits/chosen": -0.3570711016654968, | |
| "logits/rejected": -0.40324440598487854, | |
| "logps/chosen": -9.332073211669922, | |
| "logps/rejected": -23.627119064331055, | |
| "loss": 0.7940301299095154, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.480025053024292, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24301281571388245, | |
| "rewards/margins": 1.4770238399505615, | |
| "rewards/rejected": -1.234011173248291, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.6794055201698513, | |
| "grad_norm": 9.010900497436523, | |
| "learning_rate": 0.00018346153708709268, | |
| "logits/chosen": -0.36091697216033936, | |
| "logits/rejected": -0.36146706342697144, | |
| "logps/chosen": -11.872391700744629, | |
| "logps/rejected": -22.261938095092773, | |
| "loss": 1.231181263923645, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7421593070030212, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.055155493319034576, | |
| "rewards/margins": 0.9281628131866455, | |
| "rewards/rejected": -0.8730072975158691, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.011205 | |
| }, | |
| { | |
| "epoch": 0.6842584167424932, | |
| "grad_norm": 2.032696485519409, | |
| "learning_rate": 0.00018316554021720306, | |
| "logits/chosen": -0.32833001017570496, | |
| "logits/rejected": -0.44503307342529297, | |
| "logps/chosen": -7.086223602294922, | |
| "logps/rejected": -27.835424423217773, | |
| "loss": 0.8454415202140808, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.49735450744628906, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16136682033538818, | |
| "rewards/margins": 1.4422115087509155, | |
| "rewards/rejected": -1.2808446884155273, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.689111313315135, | |
| "grad_norm": 8.792712211608887, | |
| "learning_rate": 0.00018286716121478693, | |
| "logits/chosen": -0.32804882526397705, | |
| "logits/rejected": -0.4235531687736511, | |
| "logps/chosen": -7.5324883460998535, | |
| "logps/rejected": -31.770389556884766, | |
| "loss": 0.6662007570266724, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.43374398350715637, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18283605575561523, | |
| "rewards/margins": 2.050058364868164, | |
| "rewards/rejected": -1.8672223091125488, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.6939642098877767, | |
| "grad_norm": 3.7807235717773438, | |
| "learning_rate": 0.00018256640862639287, | |
| "logits/chosen": -0.31429523229599, | |
| "logits/rejected": -0.42787081003189087, | |
| "logps/chosen": -7.7822160720825195, | |
| "logps/rejected": -30.884796142578125, | |
| "loss": 0.823533296585083, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.556084394454956, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.06609532237052917, | |
| "rewards/margins": 1.6945431232452393, | |
| "rewards/rejected": -1.6284478902816772, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.6988171064604186, | |
| "grad_norm": 2.3116719722747803, | |
| "learning_rate": 0.00018226329106655668, | |
| "logits/chosen": -0.4266669750213623, | |
| "logits/rejected": -0.4430805444717407, | |
| "logps/chosen": -9.213752746582031, | |
| "logps/rejected": -29.852783203125, | |
| "loss": 0.671653687953949, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.434116929769516, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08867526799440384, | |
| "rewards/margins": 1.9470399618148804, | |
| "rewards/rejected": -1.8583647012710571, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.7036700030330604, | |
| "grad_norm": 3.421821355819702, | |
| "learning_rate": 0.00018195781721755465, | |
| "logits/chosen": -0.44033709168434143, | |
| "logits/rejected": -0.4357948899269104, | |
| "logps/chosen": -9.914063453674316, | |
| "logps/rejected": -33.468997955322266, | |
| "loss": 0.911195695400238, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5890682935714722, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.049831733107566833, | |
| "rewards/margins": 2.241945505142212, | |
| "rewards/rejected": -2.1921138763427734, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.011207 | |
| }, | |
| { | |
| "epoch": 0.7085228996057021, | |
| "grad_norm": 2.5243051052093506, | |
| "learning_rate": 0.00018164999582915488, | |
| "logits/chosen": -0.3629850447177887, | |
| "logits/rejected": -0.4418475925922394, | |
| "logps/chosen": -12.760583877563477, | |
| "logps/rejected": -46.22138595581055, | |
| "loss": 0.8992067575454712, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.685957133769989, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3213002681732178, | |
| "rewards/margins": 3.270735502243042, | |
| "rewards/rejected": -2.9494354724884033, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.7133757961783439, | |
| "grad_norm": 4.871396064758301, | |
| "learning_rate": 0.00018133983571836667, | |
| "logits/chosen": -0.33027127385139465, | |
| "logits/rejected": -0.4520616829395294, | |
| "logps/chosen": -10.541389465332031, | |
| "logps/rejected": -41.49027633666992, | |
| "loss": 1.0133702754974365, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6680970788002014, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.13710376620292664, | |
| "rewards/margins": 2.4736220836639404, | |
| "rewards/rejected": -2.3365182876586914, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.7182286927509858, | |
| "grad_norm": 3.6936795711517334, | |
| "learning_rate": 0.000181027345769188, | |
| "logits/chosen": -0.41163426637649536, | |
| "logits/rejected": -0.40933167934417725, | |
| "logps/chosen": -9.165144920349121, | |
| "logps/rejected": -30.310758590698242, | |
| "loss": 0.7363777160644531, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.42432036995887756, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.02400527521967888, | |
| "rewards/margins": 1.7538728713989258, | |
| "rewards/rejected": -1.7778780460357666, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.7230815893236275, | |
| "grad_norm": 6.49341344833374, | |
| "learning_rate": 0.00018071253493235094, | |
| "logits/chosen": -0.4786967933177948, | |
| "logits/rejected": -0.4735773801803589, | |
| "logps/chosen": -12.567697525024414, | |
| "logps/rejected": -31.06718635559082, | |
| "loss": 1.0480177402496338, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7017223834991455, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.04890735074877739, | |
| "rewards/margins": 1.8125377893447876, | |
| "rewards/rejected": -1.8614450693130493, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.7279344858962693, | |
| "grad_norm": 11.014755249023438, | |
| "learning_rate": 0.0001803954122250654, | |
| "logits/chosen": -0.493363618850708, | |
| "logits/rejected": -0.560202419757843, | |
| "logps/chosen": -11.512059211730957, | |
| "logps/rejected": -37.07139587402344, | |
| "loss": 1.237532138824463, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7943273782730103, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.1521718055009842, | |
| "rewards/margins": 2.0435235500335693, | |
| "rewards/rejected": -2.195695161819458, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.011207 | |
| }, | |
| { | |
| "epoch": 0.7327873824689112, | |
| "grad_norm": 4.69052791595459, | |
| "learning_rate": 0.00018007598673076093, | |
| "logits/chosen": -0.4235774278640747, | |
| "logits/rejected": -0.4463633596897125, | |
| "logps/chosen": -11.031900405883789, | |
| "logps/rejected": -27.883403778076172, | |
| "loss": 1.107750415802002, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.7605136632919312, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.05042722821235657, | |
| "rewards/margins": 1.6558500528335571, | |
| "rewards/rejected": -1.7062770128250122, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.011207 | |
| }, | |
| { | |
| "epoch": 0.7376402790415529, | |
| "grad_norm": 2.4655253887176514, | |
| "learning_rate": 0.00017975426759882614, | |
| "logits/chosen": -0.44894903898239136, | |
| "logits/rejected": -0.4738643765449524, | |
| "logps/chosen": -9.968032836914062, | |
| "logps/rejected": -29.113271713256836, | |
| "loss": 0.7568652629852295, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5070943236351013, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.34214267134666443, | |
| "rewards/margins": 1.9045073986053467, | |
| "rewards/rejected": -1.5623646974563599, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7424931756141947, | |
| "grad_norm": 3.0639827251434326, | |
| "learning_rate": 0.00017943026404434719, | |
| "logits/chosen": -0.45172956585884094, | |
| "logits/rejected": -0.5009413957595825, | |
| "logps/chosen": -9.160325050354004, | |
| "logps/rejected": -31.873594284057617, | |
| "loss": 0.9305005669593811, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.6987206935882568, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11259810626506805, | |
| "rewards/margins": 1.9045584201812744, | |
| "rewards/rejected": -1.7919602394104004, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7473460721868365, | |
| "grad_norm": 3.0101685523986816, | |
| "learning_rate": 0.00017910398534784337, | |
| "logits/chosen": -0.3823431730270386, | |
| "logits/rejected": -0.47442248463630676, | |
| "logps/chosen": -10.423698425292969, | |
| "logps/rejected": -23.59076690673828, | |
| "loss": 1.046834945678711, | |
| "memory(GiB)": 40.31, | |
| "nll_loss": 0.5919281244277954, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2845015525817871, | |
| "rewards/margins": 1.1300426721572876, | |
| "rewards/rejected": -0.8455410599708557, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7521989687594783, | |
| "grad_norm": 6.684966087341309, | |
| "learning_rate": 0.00017877544085500156, | |
| "logits/chosen": -0.32389581203460693, | |
| "logits/rejected": -0.4660918116569519, | |
| "logps/chosen": -5.926966190338135, | |
| "logps/rejected": -32.869140625, | |
| "loss": 0.8766897916793823, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5428420305252075, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.006232857704162598, | |
| "rewards/margins": 1.7234890460968018, | |
| "rewards/rejected": -1.7172563076019287, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7570518653321201, | |
| "grad_norm": 3.565051317214966, | |
| "learning_rate": 0.00017844463997640842, | |
| "logits/chosen": -0.40359729528427124, | |
| "logits/rejected": -0.44952863454818726, | |
| "logps/chosen": -11.961484909057617, | |
| "logps/rejected": -28.9517879486084, | |
| "loss": 1.0656830072402954, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6759463548660278, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06430176645517349, | |
| "rewards/margins": 1.5096461772918701, | |
| "rewards/rejected": -1.44534432888031, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7619047619047619, | |
| "grad_norm": 2.5383567810058594, | |
| "learning_rate": 0.00017811159218728082, | |
| "logits/chosen": -0.39084097743034363, | |
| "logits/rejected": -0.4242747128009796, | |
| "logps/chosen": -8.804425239562988, | |
| "logps/rejected": -22.249990463256836, | |
| "loss": 0.9147839546203613, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.590728759765625, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2870722711086273, | |
| "rewards/margins": 1.4324426651000977, | |
| "rewards/rejected": -1.1453704833984375, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7667576584774037, | |
| "grad_norm": 2.662156343460083, | |
| "learning_rate": 0.00017777630702719453, | |
| "logits/chosen": -0.32536131143569946, | |
| "logits/rejected": -0.397830992937088, | |
| "logps/chosen": -9.738006591796875, | |
| "logps/rejected": -30.069774627685547, | |
| "loss": 0.8968651294708252, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.527851402759552, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08923595398664474, | |
| "rewards/margins": 1.6620792150497437, | |
| "rewards/rejected": -1.5728431940078735, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7716105550500455, | |
| "grad_norm": 3.2361485958099365, | |
| "learning_rate": 0.00017743879409981095, | |
| "logits/chosen": -0.3466249704360962, | |
| "logits/rejected": -0.41640138626098633, | |
| "logps/chosen": -11.293127059936523, | |
| "logps/rejected": -30.880006790161133, | |
| "loss": 0.9047757387161255, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5920196175575256, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.030911901965737343, | |
| "rewards/margins": 1.6093332767486572, | |
| "rewards/rejected": -1.5784213542938232, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7764634516226873, | |
| "grad_norm": 2.2754669189453125, | |
| "learning_rate": 0.00017709906307260194, | |
| "logits/chosen": -0.3480105400085449, | |
| "logits/rejected": -0.4323396682739258, | |
| "logps/chosen": -5.929109573364258, | |
| "logps/rejected": -34.05678939819336, | |
| "loss": 0.7185795903205872, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4936397075653076, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06835521012544632, | |
| "rewards/margins": 2.1114068031311035, | |
| "rewards/rejected": -2.0430517196655273, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.7813163481953291, | |
| "grad_norm": 2.226016044616699, | |
| "learning_rate": 0.000176757123676573, | |
| "logits/chosen": -0.39186131954193115, | |
| "logits/rejected": -0.3231448531150818, | |
| "logps/chosen": -12.739521026611328, | |
| "logps/rejected": -28.13015365600586, | |
| "loss": 0.8966748714447021, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5328811407089233, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.17805510759353638, | |
| "rewards/margins": 1.8448935747146606, | |
| "rewards/rejected": -1.6668384075164795, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7861692447679709, | |
| "grad_norm": 2.2700612545013428, | |
| "learning_rate": 0.00017641298570598459, | |
| "logits/chosen": -0.36923766136169434, | |
| "logits/rejected": -0.41111743450164795, | |
| "logps/chosen": -6.442410469055176, | |
| "logps/rejected": -29.95729637145996, | |
| "loss": 0.7110913991928101, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4247634708881378, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.08174540847539902, | |
| "rewards/margins": 1.7869547605514526, | |
| "rewards/rejected": -1.7052093744277954, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7910221413406127, | |
| "grad_norm": 5.662917613983154, | |
| "learning_rate": 0.0001760666590180714, | |
| "logits/chosen": -0.2990395426750183, | |
| "logits/rejected": -0.4443129301071167, | |
| "logps/chosen": -11.827997207641602, | |
| "logps/rejected": -39.40394592285156, | |
| "loss": 0.9818216562271118, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6332793831825256, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.07979752123355865, | |
| "rewards/margins": 2.349473237991333, | |
| "rewards/rejected": -2.4292705059051514, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.7958750379132544, | |
| "grad_norm": 2.659315586090088, | |
| "learning_rate": 0.0001757181535327602, | |
| "logits/chosen": -0.41728484630584717, | |
| "logits/rejected": -0.44338852167129517, | |
| "logps/chosen": -7.938527584075928, | |
| "logps/rejected": -30.74227523803711, | |
| "loss": 0.8022794723510742, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4814991056919098, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.056870464235544205, | |
| "rewards/margins": 1.9418084621429443, | |
| "rewards/rejected": -1.8849378824234009, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.8007279344858963, | |
| "grad_norm": 2.9071202278137207, | |
| "learning_rate": 0.00017536747923238566, | |
| "logits/chosen": -0.3409942090511322, | |
| "logits/rejected": -0.457685649394989, | |
| "logps/chosen": -7.500731468200684, | |
| "logps/rejected": -44.705909729003906, | |
| "loss": 0.6390520930290222, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.38755032420158386, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19773569703102112, | |
| "rewards/margins": 3.0309081077575684, | |
| "rewards/rejected": -2.83317232131958, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.8055808310585381, | |
| "grad_norm": 3.0054497718811035, | |
| "learning_rate": 0.00017501464616140436, | |
| "logits/chosen": -0.41681885719299316, | |
| "logits/rejected": -0.45619145035743713, | |
| "logps/chosen": -8.748014450073242, | |
| "logps/rejected": -35.70191955566406, | |
| "loss": 0.7890005111694336, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5446341633796692, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.16440145671367645, | |
| "rewards/margins": 2.74184250831604, | |
| "rewards/rejected": -2.5774412155151367, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8104337276311798, | |
| "grad_norm": 3.300097942352295, | |
| "learning_rate": 0.000174659664426107, | |
| "logits/chosen": -0.4365924298763275, | |
| "logits/rejected": -0.45622488856315613, | |
| "logps/chosen": -11.21609115600586, | |
| "logps/rejected": -34.401222229003906, | |
| "loss": 0.9579750299453735, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.7187469601631165, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14886964857578278, | |
| "rewards/margins": 2.472686529159546, | |
| "rewards/rejected": -2.323817253112793, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8152866242038217, | |
| "grad_norm": 2.5296413898468018, | |
| "learning_rate": 0.00017430254419432931, | |
| "logits/chosen": -0.41913431882858276, | |
| "logits/rejected": -0.41736355423927307, | |
| "logps/chosen": -13.593805313110352, | |
| "logps/rejected": -33.63285827636719, | |
| "loss": 0.6976242065429688, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.46450674533843994, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2216261476278305, | |
| "rewards/margins": 2.4022936820983887, | |
| "rewards/rejected": -2.1806676387786865, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8201395207764635, | |
| "grad_norm": 21.119770050048828, | |
| "learning_rate": 0.00017394329569516028, | |
| "logits/chosen": -0.3196732997894287, | |
| "logits/rejected": -0.47898930311203003, | |
| "logps/chosen": -11.645589828491211, | |
| "logps/rejected": -45.33073425292969, | |
| "loss": 1.067216157913208, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.8613059520721436, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.024522848427295685, | |
| "rewards/margins": 2.9725117683410645, | |
| "rewards/rejected": -2.947988748550415, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8249924173491052, | |
| "grad_norm": 2.541898012161255, | |
| "learning_rate": 0.00017358192921864953, | |
| "logits/chosen": -0.40079769492149353, | |
| "logits/rejected": -0.4508993923664093, | |
| "logps/chosen": -10.424609184265137, | |
| "logps/rejected": -34.24469757080078, | |
| "loss": 0.7411442399024963, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4615729749202728, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.05271195247769356, | |
| "rewards/margins": 2.12577223777771, | |
| "rewards/rejected": -2.0730605125427246, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8298453139217471, | |
| "grad_norm": 4.101256370544434, | |
| "learning_rate": 0.00017321845511551244, | |
| "logits/chosen": -0.38883864879608154, | |
| "logits/rejected": -0.46420595049858093, | |
| "logps/chosen": -9.728652954101562, | |
| "logps/rejected": -49.25832748413086, | |
| "loss": 0.7956501245498657, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6269941926002502, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07354284077882767, | |
| "rewards/margins": 3.7279632091522217, | |
| "rewards/rejected": -3.6544198989868164, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8346982104943889, | |
| "grad_norm": 6.031051158905029, | |
| "learning_rate": 0.00017285288379683376, | |
| "logits/chosen": -0.4501774311065674, | |
| "logits/rejected": -0.49218156933784485, | |
| "logps/chosen": -12.754474639892578, | |
| "logps/rejected": -35.773963928222656, | |
| "loss": 0.9267921447753906, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6455193758010864, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23461803793907166, | |
| "rewards/margins": 2.5618717670440674, | |
| "rewards/rejected": -2.327253580093384, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8395511070670306, | |
| "grad_norm": 2.7078492641448975, | |
| "learning_rate": 0.00017248522573376932, | |
| "logits/chosen": -0.5002922415733337, | |
| "logits/rejected": -0.4927571713924408, | |
| "logps/chosen": -12.274182319641113, | |
| "logps/rejected": -38.476226806640625, | |
| "loss": 0.8795382976531982, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.679415225982666, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.20902375876903534, | |
| "rewards/margins": 2.886625289916992, | |
| "rewards/rejected": -2.6776018142700195, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8444040036396724, | |
| "grad_norm": 3.0864455699920654, | |
| "learning_rate": 0.00017211549145724602, | |
| "logits/chosen": -0.44441068172454834, | |
| "logits/rejected": -0.5031411647796631, | |
| "logps/chosen": -6.964417934417725, | |
| "logps/rejected": -47.59633255004883, | |
| "loss": 0.5743454694747925, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39823874831199646, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1409493237733841, | |
| "rewards/margins": 3.664174795150757, | |
| "rewards/rejected": -3.5232253074645996, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.8492569002123143, | |
| "grad_norm": 13.482826232910156, | |
| "learning_rate": 0.00017174369155766037, | |
| "logits/chosen": -0.44830185174942017, | |
| "logits/rejected": -0.4931170344352722, | |
| "logps/chosen": -11.00506591796875, | |
| "logps/rejected": -38.13721466064453, | |
| "loss": 1.102919578552246, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.8681702017784119, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.020436841994524002, | |
| "rewards/margins": 2.716992139816284, | |
| "rewards/rejected": -2.6965548992156982, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.854109796784956, | |
| "grad_norm": 2.788137435913086, | |
| "learning_rate": 0.0001713698366845751, | |
| "logits/chosen": -0.41955456137657166, | |
| "logits/rejected": -0.4849671423435211, | |
| "logps/chosen": -10.713014602661133, | |
| "logps/rejected": -38.87740707397461, | |
| "loss": 0.8198617696762085, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5618011951446533, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.052750274538993835, | |
| "rewards/margins": 2.4263105392456055, | |
| "rewards/rejected": -2.3735604286193848, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.8589626933575978, | |
| "grad_norm": 2.8578059673309326, | |
| "learning_rate": 0.00017099393754641402, | |
| "logits/chosen": -0.4903329014778137, | |
| "logits/rejected": -0.44835591316223145, | |
| "logps/chosen": -12.698493957519531, | |
| "logps/rejected": -31.339452743530273, | |
| "loss": 0.8736453056335449, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5660265684127808, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12503781914710999, | |
| "rewards/margins": 2.115137815475464, | |
| "rewards/rejected": -1.9901000261306763, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.8638155899302397, | |
| "grad_norm": 14.433143615722656, | |
| "learning_rate": 0.0001706160049101554, | |
| "logits/chosen": -0.39836981892585754, | |
| "logits/rejected": -0.4502709209918976, | |
| "logps/chosen": -12.003418922424316, | |
| "logps/rejected": -33.39105224609375, | |
| "loss": 0.9455697536468506, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6791843771934509, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2257295846939087, | |
| "rewards/margins": 2.307054042816162, | |
| "rewards/rejected": -2.081324577331543, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.8686684865028814, | |
| "grad_norm": 4.972922325134277, | |
| "learning_rate": 0.00017023604960102355, | |
| "logits/chosen": -0.48707541823387146, | |
| "logits/rejected": -0.43483617901802063, | |
| "logps/chosen": -15.320083618164062, | |
| "logps/rejected": -26.741153717041016, | |
| "loss": 1.0946437120437622, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.7049025893211365, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14932136237621307, | |
| "rewards/margins": 1.6685651540756226, | |
| "rewards/rejected": -1.519243836402893, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.8735213830755232, | |
| "grad_norm": 7.616319179534912, | |
| "learning_rate": 0.00016985408250217864, | |
| "logits/chosen": -0.48446008563041687, | |
| "logits/rejected": -0.5007644891738892, | |
| "logps/chosen": -9.878619194030762, | |
| "logps/rejected": -33.84723663330078, | |
| "loss": 0.91806560754776, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.588477373123169, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13273106515407562, | |
| "rewards/margins": 2.1440441608428955, | |
| "rewards/rejected": -2.0113131999969482, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.878374279648165, | |
| "grad_norm": 5.360206604003906, | |
| "learning_rate": 0.00016947011455440523, | |
| "logits/chosen": -0.45152074098587036, | |
| "logits/rejected": -0.4405006766319275, | |
| "logps/chosen": -12.04659652709961, | |
| "logps/rejected": -29.337995529174805, | |
| "loss": 0.9476042985916138, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5956300497055054, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.007146604359149933, | |
| "rewards/margins": 1.6998629570007324, | |
| "rewards/rejected": -1.6927162408828735, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.8832271762208068, | |
| "grad_norm": 2.752962589263916, | |
| "learning_rate": 0.00016908415675579854, | |
| "logits/chosen": -0.400238573551178, | |
| "logits/rejected": -0.5106572508811951, | |
| "logps/chosen": -5.792488098144531, | |
| "logps/rejected": -31.905841827392578, | |
| "loss": 0.7257025241851807, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4335445463657379, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0758802518248558, | |
| "rewards/margins": 1.8862504959106445, | |
| "rewards/rejected": -1.8103703260421753, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.8880800727934486, | |
| "grad_norm": 2.3120791912078857, | |
| "learning_rate": 0.00016869622016144973, | |
| "logits/chosen": -0.5098201632499695, | |
| "logits/rejected": -0.4519084095954895, | |
| "logps/chosen": -8.241873741149902, | |
| "logps/rejected": -25.190824508666992, | |
| "loss": 0.7128751277923584, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44536417722702026, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2868940234184265, | |
| "rewards/margins": 1.7276583909988403, | |
| "rewards/rejected": -1.4407645463943481, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.8929329693660903, | |
| "grad_norm": 2.231217861175537, | |
| "learning_rate": 0.0001683063158831291, | |
| "logits/chosen": -0.4472496509552002, | |
| "logits/rejected": -0.4929869771003723, | |
| "logps/chosen": -7.548064231872559, | |
| "logps/rejected": -31.63290023803711, | |
| "loss": 0.7525639533996582, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4533500671386719, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2907182276248932, | |
| "rewards/margins": 2.194798231124878, | |
| "rewards/rejected": -1.9040801525115967, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.8977858659387322, | |
| "grad_norm": 2.4883766174316406, | |
| "learning_rate": 0.00016791445508896783, | |
| "logits/chosen": -0.36559921503067017, | |
| "logits/rejected": -0.42163488268852234, | |
| "logps/chosen": -11.388641357421875, | |
| "logps/rejected": -32.0931510925293, | |
| "loss": 0.7775099873542786, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5461112856864929, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22250865399837494, | |
| "rewards/margins": 1.9723868370056152, | |
| "rewards/rejected": -1.749878168106079, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.902638762511374, | |
| "grad_norm": 3.259838819503784, | |
| "learning_rate": 0.00016752064900313815, | |
| "logits/chosen": -0.5012748837471008, | |
| "logits/rejected": -0.4815691113471985, | |
| "logps/chosen": -8.668580055236816, | |
| "logps/rejected": -27.685821533203125, | |
| "loss": 0.7447406649589539, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.46015244722366333, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07047421485185623, | |
| "rewards/margins": 1.7800168991088867, | |
| "rewards/rejected": -1.7095428705215454, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9074916590840157, | |
| "grad_norm": 4.5533576011657715, | |
| "learning_rate": 0.0001671249089055317, | |
| "logits/chosen": -0.5065349340438843, | |
| "logits/rejected": -0.4818389117717743, | |
| "logps/chosen": -9.181870460510254, | |
| "logps/rejected": -33.568580627441406, | |
| "loss": 0.7996796369552612, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5168719291687012, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10808134078979492, | |
| "rewards/margins": 2.115391731262207, | |
| "rewards/rejected": -2.007310628890991, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9123445556566576, | |
| "grad_norm": 4.431750297546387, | |
| "learning_rate": 0.0001667272461314366, | |
| "logits/chosen": -0.48659980297088623, | |
| "logits/rejected": -0.487091988325119, | |
| "logps/chosen": -10.220385551452637, | |
| "logps/rejected": -35.60252380371094, | |
| "loss": 0.9328407049179077, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6412612199783325, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.01909228041768074, | |
| "rewards/margins": 2.4949698448181152, | |
| "rewards/rejected": -2.475877285003662, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.9171974522292994, | |
| "grad_norm": 8.757882118225098, | |
| "learning_rate": 0.00016632767207121267, | |
| "logits/chosen": -0.33902058005332947, | |
| "logits/rejected": -0.4704265594482422, | |
| "logps/chosen": -10.807303428649902, | |
| "logps/rejected": -48.82100296020508, | |
| "loss": 1.2881890535354614, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.8564696907997131, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.06860647350549698, | |
| "rewards/margins": 2.6622214317321777, | |
| "rewards/rejected": -2.7308273315429688, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9220503488019411, | |
| "grad_norm": 9.251166343688965, | |
| "learning_rate": 0.00016592619816996527, | |
| "logits/chosen": -0.47989535331726074, | |
| "logits/rejected": -0.5115556716918945, | |
| "logps/chosen": -15.828009605407715, | |
| "logps/rejected": -35.08710861206055, | |
| "loss": 0.9385941624641418, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.632335901260376, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0631108283996582, | |
| "rewards/margins": 1.8624895811080933, | |
| "rewards/rejected": -1.799378752708435, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9269032453745829, | |
| "grad_norm": 4.995007038116455, | |
| "learning_rate": 0.0001655228359272173, | |
| "logits/chosen": -0.45928898453712463, | |
| "logits/rejected": -0.42803335189819336, | |
| "logps/chosen": -11.98594856262207, | |
| "logps/rejected": -27.537172317504883, | |
| "loss": 1.0162464380264282, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6742801070213318, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0864061713218689, | |
| "rewards/margins": 1.6110825538635254, | |
| "rewards/rejected": -1.5246765613555908, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9317561419472248, | |
| "grad_norm": 8.054399490356445, | |
| "learning_rate": 0.00016511759689657999, | |
| "logits/chosen": -0.3773999512195587, | |
| "logits/rejected": -0.42789533734321594, | |
| "logps/chosen": -12.406736373901367, | |
| "logps/rejected": -39.963958740234375, | |
| "loss": 0.7866171598434448, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5565248131752014, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.005689222365617752, | |
| "rewards/margins": 2.343252658843994, | |
| "rewards/rejected": -2.3489420413970947, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9366090385198665, | |
| "grad_norm": 3.3172736167907715, | |
| "learning_rate": 0.00016471049268542188, | |
| "logits/chosen": -0.46051445603370667, | |
| "logits/rejected": -0.41965189576148987, | |
| "logps/chosen": -10.034582138061523, | |
| "logps/rejected": -36.16367721557617, | |
| "loss": 0.7486264109611511, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4820393919944763, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0357435941696167, | |
| "rewards/margins": 2.641000747680664, | |
| "rewards/rejected": -2.605257034301758, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9414619350925083, | |
| "grad_norm": 2.3992457389831543, | |
| "learning_rate": 0.00016430153495453642, | |
| "logits/chosen": -0.5328064560890198, | |
| "logits/rejected": -0.47638142108917236, | |
| "logps/chosen": -11.91832160949707, | |
| "logps/rejected": -36.306785583496094, | |
| "loss": 0.8761617541313171, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6264892220497131, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1922227442264557, | |
| "rewards/margins": 2.7257025241851807, | |
| "rewards/rejected": -2.533479690551758, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9463148316651502, | |
| "grad_norm": 4.527428150177002, | |
| "learning_rate": 0.00016389073541780782, | |
| "logits/chosen": -0.46726107597351074, | |
| "logits/rejected": -0.47500157356262207, | |
| "logps/chosen": -8.38770580291748, | |
| "logps/rejected": -29.87854766845703, | |
| "loss": 0.7214972376823425, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4556006193161011, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08811609447002411, | |
| "rewards/margins": 1.9756295680999756, | |
| "rewards/rejected": -1.8875133991241455, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9511677282377919, | |
| "grad_norm": 3.743474006652832, | |
| "learning_rate": 0.00016347810584187568, | |
| "logits/chosen": -0.5369599461555481, | |
| "logits/rejected": -0.5066350102424622, | |
| "logps/chosen": -8.895236015319824, | |
| "logps/rejected": -26.281404495239258, | |
| "loss": 0.8112626075744629, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5115976333618164, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04646964743733406, | |
| "rewards/margins": 1.599694848060608, | |
| "rewards/rejected": -1.5532252788543701, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.9560206248104337, | |
| "grad_norm": 2.772148370742798, | |
| "learning_rate": 0.00016306365804579794, | |
| "logits/chosen": -0.36604201793670654, | |
| "logits/rejected": -0.4730686545372009, | |
| "logps/chosen": -9.536896705627441, | |
| "logps/rejected": -40.390995025634766, | |
| "loss": 0.6381856799125671, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4115173816680908, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2083117514848709, | |
| "rewards/margins": 2.512366771697998, | |
| "rewards/rejected": -2.3040552139282227, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.9608735213830755, | |
| "grad_norm": 3.5839767456054688, | |
| "learning_rate": 0.0001626474039007122, | |
| "logits/chosen": -0.4816967844963074, | |
| "logits/rejected": -0.47818446159362793, | |
| "logps/chosen": -7.637480735778809, | |
| "logps/rejected": -29.050764083862305, | |
| "loss": 0.6914876103401184, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3912826478481293, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2960473895072937, | |
| "rewards/margins": 2.151468515396118, | |
| "rewards/rejected": -1.8554210662841797, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.9657264179557173, | |
| "grad_norm": 2.633289098739624, | |
| "learning_rate": 0.00016222935532949587, | |
| "logits/chosen": -0.4851294755935669, | |
| "logits/rejected": -0.4861046373844147, | |
| "logps/chosen": -10.165040969848633, | |
| "logps/rejected": -34.33792495727539, | |
| "loss": 0.7900617718696594, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5045729279518127, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.33929818868637085, | |
| "rewards/margins": 2.4269657135009766, | |
| "rewards/rejected": -2.08766770362854, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.9705793145283591, | |
| "grad_norm": 4.324284553527832, | |
| "learning_rate": 0.0001618095243064245, | |
| "logits/chosen": -0.486560583114624, | |
| "logits/rejected": -0.46493133902549744, | |
| "logps/chosen": -7.55566930770874, | |
| "logps/rejected": -32.536399841308594, | |
| "loss": 0.7669270038604736, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.45861828327178955, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0628332868218422, | |
| "rewards/margins": 2.340352773666382, | |
| "rewards/rejected": -2.277519464492798, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.9754322111010009, | |
| "grad_norm": 1.9603885412216187, | |
| "learning_rate": 0.000161387922856829, | |
| "logits/chosen": -0.5021265149116516, | |
| "logits/rejected": -0.5176340937614441, | |
| "logps/chosen": -9.77086067199707, | |
| "logps/rejected": -40.27810287475586, | |
| "loss": 0.7130787968635559, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4609830379486084, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18531039357185364, | |
| "rewards/margins": 2.942089080810547, | |
| "rewards/rejected": -2.7567787170410156, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.9802851076736427, | |
| "grad_norm": 2.769995927810669, | |
| "learning_rate": 0.00016096456305675095, | |
| "logits/chosen": -0.44220247864723206, | |
| "logits/rejected": -0.5238637328147888, | |
| "logps/chosen": -7.195171356201172, | |
| "logps/rejected": -44.38209533691406, | |
| "loss": 0.6904028058052063, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5173193216323853, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3396221101284027, | |
| "rewards/margins": 3.3168182373046875, | |
| "rewards/rejected": -2.977196216583252, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.9851380042462845, | |
| "grad_norm": 3.073450803756714, | |
| "learning_rate": 0.00016053945703259692, | |
| "logits/chosen": -0.47079914808273315, | |
| "logits/rejected": -0.4507486820220947, | |
| "logps/chosen": -9.377758979797363, | |
| "logps/rejected": -35.4901008605957, | |
| "loss": 0.8126031756401062, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5169999599456787, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07428787648677826, | |
| "rewards/margins": 2.5271918773651123, | |
| "rewards/rejected": -2.452903985977173, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.9899909008189263, | |
| "grad_norm": 3.061457872390747, | |
| "learning_rate": 0.00016011261696079098, | |
| "logits/chosen": -0.43547484278678894, | |
| "logits/rejected": -0.5544446110725403, | |
| "logps/chosen": -11.976186752319336, | |
| "logps/rejected": -53.08049392700195, | |
| "loss": 0.8855732679367065, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6567856073379517, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1509181559085846, | |
| "rewards/margins": 3.721925973892212, | |
| "rewards/rejected": -3.5710079669952393, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.9948437973915681, | |
| "grad_norm": 2.193002223968506, | |
| "learning_rate": 0.00015968405506742599, | |
| "logits/chosen": -0.5186320543289185, | |
| "logits/rejected": -0.5116863250732422, | |
| "logps/chosen": -9.911492347717285, | |
| "logps/rejected": -34.19422912597656, | |
| "loss": 0.9093415141105652, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6466048359870911, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2533470094203949, | |
| "rewards/margins": 2.494154214859009, | |
| "rewards/rejected": -2.240807294845581, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.9996966939642099, | |
| "grad_norm": 2.4486677646636963, | |
| "learning_rate": 0.00015925378362791347, | |
| "logits/chosen": -0.49749520421028137, | |
| "logits/rejected": -0.5242308378219604, | |
| "logps/chosen": -7.672642707824707, | |
| "logps/rejected": -41.62055206298828, | |
| "loss": 0.6428540349006653, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3894902467727661, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07286091148853302, | |
| "rewards/margins": 3.0560548305511475, | |
| "rewards/rejected": -2.983193874359131, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 2.4486677646636963, | |
| "learning_rate": 0.0001588218149666318, | |
| "logits/chosen": -0.0672072023153305, | |
| "logits/rejected": -0.3169337511062622, | |
| "logps/chosen": -3.5387771129608154, | |
| "logps/rejected": -19.517276763916016, | |
| "loss": 0.10221779346466064, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 1.1795923709869385, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.21849411725997925, | |
| "rewards/margins": 0.8076673746109009, | |
| "rewards/rejected": -0.5891733169555664, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 1.0048528965726418, | |
| "grad_norm": 1.7180174589157104, | |
| "learning_rate": 0.00015838816145657343, | |
| "logits/chosen": -0.41013669967651367, | |
| "logits/rejected": -0.5080668330192566, | |
| "logps/chosen": -8.022540092468262, | |
| "logps/rejected": -41.35959243774414, | |
| "loss": 0.5290953516960144, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.42788973450660706, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43706047534942627, | |
| "rewards/margins": 3.0258355140686035, | |
| "rewards/rejected": -2.588775157928467, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0097057931452835, | |
| "grad_norm": 1.6782983541488647, | |
| "learning_rate": 0.00015795283551899036, | |
| "logits/chosen": -0.4570477306842804, | |
| "logits/rejected": -0.4886360168457031, | |
| "logps/chosen": -9.411005973815918, | |
| "logps/rejected": -43.55297088623047, | |
| "loss": 0.5858383774757385, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44828641414642334, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3919137418270111, | |
| "rewards/margins": 3.3793742656707764, | |
| "rewards/rejected": -2.9874606132507324, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0145586897179253, | |
| "grad_norm": 1.8372869491577148, | |
| "learning_rate": 0.00015751584962303832, | |
| "logits/chosen": -0.45137134194374084, | |
| "logits/rejected": -0.49931854009628296, | |
| "logps/chosen": -5.573295593261719, | |
| "logps/rejected": -44.04582214355469, | |
| "loss": 0.47281989455223083, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3471827208995819, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5734691023826599, | |
| "rewards/margins": 3.8452658653259277, | |
| "rewards/rejected": -3.271796464920044, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0194115862905673, | |
| "grad_norm": 2.122117280960083, | |
| "learning_rate": 0.0001570772162854197, | |
| "logits/chosen": -0.4932425022125244, | |
| "logits/rejected": -0.5862610936164856, | |
| "logps/chosen": -5.677023410797119, | |
| "logps/rejected": -67.28507995605469, | |
| "loss": 0.5105875134468079, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4059942364692688, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20374003052711487, | |
| "rewards/margins": 5.488041877746582, | |
| "rewards/rejected": -5.284302234649658, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.024264482863209, | |
| "grad_norm": 2.133958339691162, | |
| "learning_rate": 0.00015663694807002506, | |
| "logits/chosen": -0.5366697311401367, | |
| "logits/rejected": -0.627138078212738, | |
| "logps/chosen": -9.758528709411621, | |
| "logps/rejected": -38.330787658691406, | |
| "loss": 0.5926258563995361, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4576071500778198, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45621615648269653, | |
| "rewards/margins": 2.72711181640625, | |
| "rewards/rejected": -2.2708957195281982, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0291173794358508, | |
| "grad_norm": 5.999765872955322, | |
| "learning_rate": 0.00015619505758757312, | |
| "logits/chosen": -0.5824704766273499, | |
| "logits/rejected": -0.5835531949996948, | |
| "logps/chosen": -7.275055885314941, | |
| "logps/rejected": -45.14403533935547, | |
| "loss": 0.6712980270385742, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5353971719741821, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28136032819747925, | |
| "rewards/margins": 3.9529309272766113, | |
| "rewards/rejected": -3.6715707778930664, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0339702760084926, | |
| "grad_norm": 3.805849313735962, | |
| "learning_rate": 0.0001557515574952496, | |
| "logits/chosen": -0.5069078207015991, | |
| "logits/rejected": -0.55241459608078, | |
| "logps/chosen": -7.691582202911377, | |
| "logps/rejected": -50.89150619506836, | |
| "loss": 0.6278761029243469, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5273099541664124, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.492880642414093, | |
| "rewards/margins": 4.282929420471191, | |
| "rewards/rejected": -3.790048122406006, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0388231725811343, | |
| "grad_norm": 10.641289710998535, | |
| "learning_rate": 0.00015530646049634474, | |
| "logits/chosen": -0.532200813293457, | |
| "logits/rejected": -0.6343463659286499, | |
| "logps/chosen": -10.347488403320312, | |
| "logps/rejected": -58.461692810058594, | |
| "loss": 0.7014778256416321, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5599174499511719, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.08643528819084167, | |
| "rewards/margins": 4.3690185546875, | |
| "rewards/rejected": -4.282583713531494, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.043676069153776, | |
| "grad_norm": 4.997859954833984, | |
| "learning_rate": 0.00015485977933988947, | |
| "logits/chosen": -0.5499998331069946, | |
| "logits/rejected": -0.6231508255004883, | |
| "logps/chosen": -8.2232027053833, | |
| "logps/rejected": -70.93086242675781, | |
| "loss": 0.5264535546302795, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41253799200057983, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3687896430492401, | |
| "rewards/margins": 5.875752925872803, | |
| "rewards/rejected": -5.50696325302124, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0485289657264178, | |
| "grad_norm": 1.6605055332183838, | |
| "learning_rate": 0.00015441152682029, | |
| "logits/chosen": -0.5347371101379395, | |
| "logits/rejected": -0.6293535232543945, | |
| "logps/chosen": -6.7471184730529785, | |
| "logps/rejected": -57.79261016845703, | |
| "loss": 0.4279806613922119, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3485845923423767, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4243243932723999, | |
| "rewards/margins": 4.480070114135742, | |
| "rewards/rejected": -4.055746078491211, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 1.0533818622990598, | |
| "grad_norm": 1.3759158849716187, | |
| "learning_rate": 0.00015396171577696167, | |
| "logits/chosen": -0.5051631927490234, | |
| "logits/rejected": -0.6489286422729492, | |
| "logps/chosen": -6.5541839599609375, | |
| "logps/rejected": -61.18578338623047, | |
| "loss": 0.40871456265449524, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.34622615575790405, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8713262677192688, | |
| "rewards/margins": 5.349825859069824, | |
| "rewards/rejected": -4.4785003662109375, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 1.0582347588717016, | |
| "grad_norm": 1.5643813610076904, | |
| "learning_rate": 0.00015351035909396088, | |
| "logits/chosen": -0.5682575702667236, | |
| "logits/rejected": -0.5700003504753113, | |
| "logps/chosen": -7.853461265563965, | |
| "logps/rejected": -37.5399284362793, | |
| "loss": 0.5135300755500793, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39472249150276184, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.44226574897766113, | |
| "rewards/margins": 2.9900660514831543, | |
| "rewards/rejected": -2.5478007793426514, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 1.0630876554443434, | |
| "grad_norm": 1.9472591876983643, | |
| "learning_rate": 0.0001530574696996164, | |
| "logits/chosen": -0.6036070585250854, | |
| "logits/rejected": -0.6442514061927795, | |
| "logps/chosen": -7.859013557434082, | |
| "logps/rejected": -51.61414337158203, | |
| "loss": 0.47415411472320557, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3808107376098633, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4538901150226593, | |
| "rewards/margins": 4.290732383728027, | |
| "rewards/rejected": -3.8368425369262695, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 1.0679405520169851, | |
| "grad_norm": 7.173949241638184, | |
| "learning_rate": 0.00015260306056615858, | |
| "logits/chosen": -0.5031501650810242, | |
| "logits/rejected": -0.5708950757980347, | |
| "logps/chosen": -8.430438041687012, | |
| "logps/rejected": -49.38084030151367, | |
| "loss": 0.6345080733299255, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4748482406139374, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5568549633026123, | |
| "rewards/margins": 3.7820630073547363, | |
| "rewards/rejected": -3.225208044052124, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 1.0727934485896269, | |
| "grad_norm": 2.499420404434204, | |
| "learning_rate": 0.0001521471447093483, | |
| "logits/chosen": -0.5780302286148071, | |
| "logits/rejected": -0.652087390422821, | |
| "logps/chosen": -6.439700126647949, | |
| "logps/rejected": -47.79240036010742, | |
| "loss": 0.6468124389648438, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5188155174255371, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4574861526489258, | |
| "rewards/margins": 4.022400856018066, | |
| "rewards/rejected": -3.5649144649505615, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.0776463451622686, | |
| "grad_norm": 2.868643045425415, | |
| "learning_rate": 0.0001516897351881038, | |
| "logits/chosen": -0.48600101470947266, | |
| "logits/rejected": -0.7179228067398071, | |
| "logps/chosen": -7.020376682281494, | |
| "logps/rejected": -63.106910705566406, | |
| "loss": 0.5186583995819092, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.45133551955223083, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4073833227157593, | |
| "rewards/margins": 5.3973588943481445, | |
| "rewards/rejected": -4.989975929260254, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.0824992417349106, | |
| "grad_norm": 2.9537835121154785, | |
| "learning_rate": 0.00015123084510412676, | |
| "logits/chosen": -0.6880484223365784, | |
| "logits/rejected": -0.6554800868034363, | |
| "logps/chosen": -12.542672157287598, | |
| "logps/rejected": -41.370513916015625, | |
| "loss": 0.7187406420707703, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6188425421714783, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6864035129547119, | |
| "rewards/margins": 3.933318614959717, | |
| "rewards/rejected": -3.246915102005005, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.0873521383075524, | |
| "grad_norm": 2.0743846893310547, | |
| "learning_rate": 0.00015077048760152702, | |
| "logits/chosen": -0.7064493894577026, | |
| "logits/rejected": -0.5577601194381714, | |
| "logps/chosen": -8.18484878540039, | |
| "logps/rejected": -44.98584747314453, | |
| "loss": 0.3742949962615967, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3041650652885437, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6248530745506287, | |
| "rewards/margins": 4.210747718811035, | |
| "rewards/rejected": -3.58589506149292, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.0922050348801942, | |
| "grad_norm": 3.051504373550415, | |
| "learning_rate": 0.00015030867586644605, | |
| "logits/chosen": -0.4182083010673523, | |
| "logits/rejected": -0.5224165916442871, | |
| "logps/chosen": -8.414253234863281, | |
| "logps/rejected": -50.0076789855957, | |
| "loss": 0.5939789414405823, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.43186870217323303, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2714881896972656, | |
| "rewards/margins": 3.5979065895080566, | |
| "rewards/rejected": -3.32641863822937, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.097057931452836, | |
| "grad_norm": 19.128318786621094, | |
| "learning_rate": 0.00014984542312667935, | |
| "logits/chosen": -0.5070249438285828, | |
| "logits/rejected": -0.6899809837341309, | |
| "logps/chosen": -5.100536823272705, | |
| "logps/rejected": -58.729217529296875, | |
| "loss": 0.5768824219703674, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.45623981952667236, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.29099348187446594, | |
| "rewards/margins": 4.82575798034668, | |
| "rewards/rejected": -4.534764766693115, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1019108280254777, | |
| "grad_norm": 15.456758499145508, | |
| "learning_rate": 0.00014938074265129743, | |
| "logits/chosen": -0.6614000797271729, | |
| "logits/rejected": -0.583651065826416, | |
| "logps/chosen": -10.315933227539062, | |
| "logps/rejected": -44.13168716430664, | |
| "loss": 0.8722174763679504, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6912877559661865, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4925556778907776, | |
| "rewards/margins": 3.7772724628448486, | |
| "rewards/rejected": -3.2847163677215576, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1067637245981194, | |
| "grad_norm": 4.41496467590332, | |
| "learning_rate": 0.00014891464775026585, | |
| "logits/chosen": -0.6627179980278015, | |
| "logits/rejected": -0.5836312770843506, | |
| "logps/chosen": -7.832060813903809, | |
| "logps/rejected": -51.398380279541016, | |
| "loss": 0.42356374859809875, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33340057730674744, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33356133103370667, | |
| "rewards/margins": 4.259485721588135, | |
| "rewards/rejected": -3.92592453956604, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1116166211707612, | |
| "grad_norm": 2.4247095584869385, | |
| "learning_rate": 0.0001484471517740639, | |
| "logits/chosen": -0.6520415544509888, | |
| "logits/rejected": -0.6481152772903442, | |
| "logps/chosen": -7.814848899841309, | |
| "logps/rejected": -48.36859130859375, | |
| "loss": 0.5468817949295044, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44277364015579224, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.29666104912757874, | |
| "rewards/margins": 4.1083831787109375, | |
| "rewards/rejected": -3.8117218017578125, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1164695177434032, | |
| "grad_norm": 1.3357291221618652, | |
| "learning_rate": 0.00014797826811330228, | |
| "logits/chosen": -0.5879421830177307, | |
| "logits/rejected": -0.5645837187767029, | |
| "logps/chosen": -6.680647373199463, | |
| "logps/rejected": -54.134193420410156, | |
| "loss": 0.38013574481010437, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33245307207107544, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5417324900627136, | |
| "rewards/margins": 4.868451118469238, | |
| "rewards/rejected": -4.326718807220459, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.121322414316045, | |
| "grad_norm": 1.5943940877914429, | |
| "learning_rate": 0.00014750801019833949, | |
| "logits/chosen": -0.568419873714447, | |
| "logits/rejected": -0.6231982111930847, | |
| "logps/chosen": -5.1526055335998535, | |
| "logps/rejected": -46.67970657348633, | |
| "loss": 0.43953895568847656, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35486042499542236, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4100644588470459, | |
| "rewards/margins": 3.7241714000701904, | |
| "rewards/rejected": -3.3141071796417236, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1261753108886867, | |
| "grad_norm": 2.373943328857422, | |
| "learning_rate": 0.00014703639149889712, | |
| "logits/chosen": -0.5270050764083862, | |
| "logits/rejected": -0.6688944101333618, | |
| "logps/chosen": -6.8727521896362305, | |
| "logps/rejected": -54.39302444458008, | |
| "loss": 0.5719085931777954, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4776768386363983, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5398850440979004, | |
| "rewards/margins": 4.560108184814453, | |
| "rewards/rejected": -4.0202226638793945, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1310282074613285, | |
| "grad_norm": 1.4414172172546387, | |
| "learning_rate": 0.00014656342552367416, | |
| "logits/chosen": -0.5357221961021423, | |
| "logits/rejected": -0.5533539652824402, | |
| "logps/chosen": -6.900845527648926, | |
| "logps/rejected": -45.86457443237305, | |
| "loss": 0.4437209367752075, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3537225127220154, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38456112146377563, | |
| "rewards/margins": 3.7542195320129395, | |
| "rewards/rejected": -3.3696582317352295, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1358811040339702, | |
| "grad_norm": 1.4943245649337769, | |
| "learning_rate": 0.00014608912581995983, | |
| "logits/chosen": -0.5588849186897278, | |
| "logits/rejected": -0.6436609029769897, | |
| "logps/chosen": -5.6003923416137695, | |
| "logps/rejected": -46.67798614501953, | |
| "loss": 0.4039139151573181, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33202505111694336, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7212438583374023, | |
| "rewards/margins": 3.975301742553711, | |
| "rewards/rejected": -3.2540581226348877, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.140734000606612, | |
| "grad_norm": 4.428430557250977, | |
| "learning_rate": 0.00014561350597324578, | |
| "logits/chosen": -0.6040487289428711, | |
| "logits/rejected": -0.5729888677597046, | |
| "logps/chosen": -10.751192092895508, | |
| "logps/rejected": -46.61857223510742, | |
| "loss": 0.6180225014686584, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5182946920394897, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.482886403799057, | |
| "rewards/margins": 3.716885566711426, | |
| "rewards/rejected": -3.233999490737915, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1455868971792538, | |
| "grad_norm": 1.5909223556518555, | |
| "learning_rate": 0.00014513657960683692, | |
| "logits/chosen": -0.6496992707252502, | |
| "logits/rejected": -0.6147754192352295, | |
| "logps/chosen": -9.563628196716309, | |
| "logps/rejected": -53.87767028808594, | |
| "loss": 0.5457061529159546, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5064206719398499, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5197762250900269, | |
| "rewards/margins": 4.888551235198975, | |
| "rewards/rejected": -4.368774890899658, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1504397937518958, | |
| "grad_norm": 2.698936700820923, | |
| "learning_rate": 0.00014465836038146107, | |
| "logits/chosen": -0.5431322455406189, | |
| "logits/rejected": -0.6387051343917847, | |
| "logps/chosen": -7.608684539794922, | |
| "logps/rejected": -50.657470703125, | |
| "loss": 0.5676233172416687, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4664645493030548, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.157401442527771, | |
| "rewards/margins": 4.005822658538818, | |
| "rewards/rejected": -3.848421096801758, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 1.1552926903245375, | |
| "grad_norm": 2.1706926822662354, | |
| "learning_rate": 0.00014417886199487775, | |
| "logits/chosen": -0.5933765172958374, | |
| "logits/rejected": -0.5305951237678528, | |
| "logps/chosen": -9.74417495727539, | |
| "logps/rejected": -41.780517578125, | |
| "loss": 0.4316883087158203, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33147385716438293, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.6860098838806152, | |
| "rewards/margins": 3.783914566040039, | |
| "rewards/rejected": -3.0979042053222656, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1601455868971793, | |
| "grad_norm": 2.7774465084075928, | |
| "learning_rate": 0.00014369809818148586, | |
| "logits/chosen": -0.6653566360473633, | |
| "logits/rejected": -0.645525336265564, | |
| "logps/chosen": -7.276230812072754, | |
| "logps/rejected": -42.255470275878906, | |
| "loss": 0.5839024186134338, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.45142966508865356, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3745161294937134, | |
| "rewards/margins": 3.7749557495117188, | |
| "rewards/rejected": -3.400439977645874, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.164998483469821, | |
| "grad_norm": 2.202160358428955, | |
| "learning_rate": 0.00014321608271193018, | |
| "logits/chosen": -0.5993486046791077, | |
| "logits/rejected": -0.6560922861099243, | |
| "logps/chosen": -7.505954742431641, | |
| "logps/rejected": -51.6959114074707, | |
| "loss": 0.615651547908783, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5654053688049316, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5433130860328674, | |
| "rewards/margins": 4.539626598358154, | |
| "rewards/rejected": -3.9963133335113525, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1698513800424628, | |
| "grad_norm": 1.8709537982940674, | |
| "learning_rate": 0.00014273282939270714, | |
| "logits/chosen": -0.5413939952850342, | |
| "logits/rejected": -0.6282732486724854, | |
| "logps/chosen": -6.796370029449463, | |
| "logps/rejected": -60.840675354003906, | |
| "loss": 0.5075444579124451, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.404622882604599, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33700963854789734, | |
| "rewards/margins": 4.8637542724609375, | |
| "rewards/rejected": -4.526744365692139, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1747042766151046, | |
| "grad_norm": 3.5226120948791504, | |
| "learning_rate": 0.00014224835206576915, | |
| "logits/chosen": -0.6383830308914185, | |
| "logits/rejected": -0.6402108073234558, | |
| "logps/chosen": -9.347366333007812, | |
| "logps/rejected": -52.63505172729492, | |
| "loss": 0.524966299533844, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.413347065448761, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4538324773311615, | |
| "rewards/margins": 4.46920919418335, | |
| "rewards/rejected": -4.015376567840576, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1795571731877463, | |
| "grad_norm": 2.4066126346588135, | |
| "learning_rate": 0.00014176266460812816, | |
| "logits/chosen": -0.4784002900123596, | |
| "logits/rejected": -0.5839812159538269, | |
| "logps/chosen": -5.386353969573975, | |
| "logps/rejected": -57.16166687011719, | |
| "loss": 0.4779638946056366, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35747677087783813, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39205074310302734, | |
| "rewards/margins": 4.41473913192749, | |
| "rewards/rejected": -4.022688388824463, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1844100697603883, | |
| "grad_norm": 1.8582743406295776, | |
| "learning_rate": 0.0001412757809314583, | |
| "logits/chosen": -0.5211676359176636, | |
| "logits/rejected": -0.5809144973754883, | |
| "logps/chosen": -6.789330005645752, | |
| "logps/rejected": -53.503807067871094, | |
| "loss": 0.4873069226741791, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39957380294799805, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3342842757701874, | |
| "rewards/margins": 4.531519412994385, | |
| "rewards/rejected": -4.197235584259033, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.18926296633303, | |
| "grad_norm": 1.9136053323745728, | |
| "learning_rate": 0.00014078771498169727, | |
| "logits/chosen": -0.5340145826339722, | |
| "logits/rejected": -0.502403974533081, | |
| "logps/chosen": -7.623006820678711, | |
| "logps/rejected": -48.99563217163086, | |
| "loss": 0.5889253616333008, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44297417998313904, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3839024305343628, | |
| "rewards/margins": 4.315854072570801, | |
| "rewards/rejected": -3.9319517612457275, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1941158629056718, | |
| "grad_norm": 5.204230785369873, | |
| "learning_rate": 0.0001402984807386469, | |
| "logits/chosen": -0.466047078371048, | |
| "logits/rejected": -0.6075699329376221, | |
| "logps/chosen": -4.622448921203613, | |
| "logps/rejected": -61.837646484375, | |
| "loss": 0.3498527705669403, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30633744597435, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3042653203010559, | |
| "rewards/margins": 4.933521270751953, | |
| "rewards/rejected": -4.629256248474121, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.1989687594783136, | |
| "grad_norm": 2.3503730297088623, | |
| "learning_rate": 0.00013980809221557277, | |
| "logits/chosen": -0.5060653686523438, | |
| "logits/rejected": -0.633462131023407, | |
| "logps/chosen": -5.608469009399414, | |
| "logps/rejected": -56.556522369384766, | |
| "loss": 0.8063190579414368, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.533983051776886, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13630348443984985, | |
| "rewards/margins": 4.395716190338135, | |
| "rewards/rejected": -4.259413719177246, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.2038216560509554, | |
| "grad_norm": 5.791271686553955, | |
| "learning_rate": 0.0001393165634588029, | |
| "logits/chosen": -0.4766685962677002, | |
| "logits/rejected": -0.4965994656085968, | |
| "logps/chosen": -8.610245704650879, | |
| "logps/rejected": -50.26591110229492, | |
| "loss": 0.5034311413764954, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4234567880630493, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5894193649291992, | |
| "rewards/margins": 3.848754644393921, | |
| "rewards/rejected": -3.2593352794647217, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.2086745526235971, | |
| "grad_norm": 3.2736964225769043, | |
| "learning_rate": 0.00013882390854732518, | |
| "logits/chosen": -0.44910845160484314, | |
| "logits/rejected": -0.5383850336074829, | |
| "logps/chosen": -6.248256683349609, | |
| "logps/rejected": -58.71024703979492, | |
| "loss": 0.5866567492485046, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4265459477901459, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2640109658241272, | |
| "rewards/margins": 4.627007484436035, | |
| "rewards/rejected": -4.362997055053711, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 1.213527449196239, | |
| "grad_norm": 1.668660044670105, | |
| "learning_rate": 0.00013833014159238434, | |
| "logits/chosen": -0.5141372084617615, | |
| "logits/rejected": -0.4604420065879822, | |
| "logps/chosen": -10.546465873718262, | |
| "logps/rejected": -49.485198974609375, | |
| "loss": 0.5634040236473083, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.43968477845191956, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5591100454330444, | |
| "rewards/margins": 4.2043328285217285, | |
| "rewards/rejected": -3.6452226638793945, | |
| "step": 251, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2183803457688809, | |
| "grad_norm": 2.68563175201416, | |
| "learning_rate": 0.00013783527673707761, | |
| "logits/chosen": -0.5613682866096497, | |
| "logits/rejected": -0.6005113124847412, | |
| "logps/chosen": -7.227791786193848, | |
| "logps/rejected": -44.98606491088867, | |
| "loss": 0.69660884141922, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.57420814037323, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3206728994846344, | |
| "rewards/margins": 3.6510839462280273, | |
| "rewards/rejected": -3.3304104804992676, | |
| "step": 252, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2232332423415226, | |
| "grad_norm": 1.2537397146224976, | |
| "learning_rate": 0.00013733932815594975, | |
| "logits/chosen": -0.5108453631401062, | |
| "logits/rejected": -0.5226196050643921, | |
| "logps/chosen": -5.904589653015137, | |
| "logps/rejected": -42.56575393676758, | |
| "loss": 0.5000451803207397, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3508087992668152, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3466809391975403, | |
| "rewards/margins": 3.448155403137207, | |
| "rewards/rejected": -3.1014742851257324, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2280861389141644, | |
| "grad_norm": 9.252999305725098, | |
| "learning_rate": 0.00013684231005458685, | |
| "logits/chosen": -0.4556179940700531, | |
| "logits/rejected": -0.5657678842544556, | |
| "logps/chosen": -5.150843620300293, | |
| "logps/rejected": -50.85475158691406, | |
| "loss": 0.48492416739463806, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39000463485717773, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.28096336126327515, | |
| "rewards/margins": 3.930372476577759, | |
| "rewards/rejected": -3.6494088172912598, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2329390354868062, | |
| "grad_norm": 1.8387612104415894, | |
| "learning_rate": 0.00013634423666920967, | |
| "logits/chosen": -0.5443651080131531, | |
| "logits/rejected": -0.5357040166854858, | |
| "logps/chosen": -4.140000820159912, | |
| "logps/rejected": -41.748435974121094, | |
| "loss": 0.42465436458587646, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30934131145477295, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44264912605285645, | |
| "rewards/margins": 3.596529960632324, | |
| "rewards/rejected": -3.1538808345794678, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.237791932059448, | |
| "grad_norm": 2.0355947017669678, | |
| "learning_rate": 0.00013584512226626566, | |
| "logits/chosen": -0.5308322906494141, | |
| "logits/rejected": -0.583949089050293, | |
| "logps/chosen": -8.423534393310547, | |
| "logps/rejected": -46.4453125, | |
| "loss": 0.5745125412940979, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.46543920040130615, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5006444454193115, | |
| "rewards/margins": 3.8912205696105957, | |
| "rewards/rejected": -3.3905763626098633, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2426448286320897, | |
| "grad_norm": 13.295863151550293, | |
| "learning_rate": 0.0001353449811420205, | |
| "logits/chosen": -0.602102518081665, | |
| "logits/rejected": -0.62212073802948, | |
| "logps/chosen": -9.10683822631836, | |
| "logps/rejected": -58.837486267089844, | |
| "loss": 0.5338473320007324, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.47453534603118896, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5761138796806335, | |
| "rewards/margins": 5.05469274520874, | |
| "rewards/rejected": -4.478578567504883, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2474977252047315, | |
| "grad_norm": 2.8557815551757812, | |
| "learning_rate": 0.00013484382762214838, | |
| "logits/chosen": -0.5345262289047241, | |
| "logits/rejected": -0.6295793056488037, | |
| "logps/chosen": -8.022461891174316, | |
| "logps/rejected": -51.12040710449219, | |
| "loss": 0.9521405696868896, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.7950073480606079, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3921523094177246, | |
| "rewards/margins": 4.2459635734558105, | |
| "rewards/rejected": -3.853811025619507, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2523506217773734, | |
| "grad_norm": 1.9786404371261597, | |
| "learning_rate": 0.00013434167606132192, | |
| "logits/chosen": -0.41818898916244507, | |
| "logits/rejected": -0.6048794984817505, | |
| "logps/chosen": -4.521004676818848, | |
| "logps/rejected": -54.303401947021484, | |
| "loss": 0.45169034600257874, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.32108208537101746, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2147521823644638, | |
| "rewards/margins": 4.153278350830078, | |
| "rewards/rejected": -3.9385263919830322, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2572035183500152, | |
| "grad_norm": 2.75905179977417, | |
| "learning_rate": 0.00013383854084280088, | |
| "logits/chosen": -0.505330502986908, | |
| "logits/rejected": -0.599029541015625, | |
| "logps/chosen": -7.0438127517700195, | |
| "logps/rejected": -52.19548416137695, | |
| "loss": 0.44328948855400085, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2728576064109802, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3309274911880493, | |
| "rewards/margins": 3.922762393951416, | |
| "rewards/rejected": -3.591834783554077, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.262056414922657, | |
| "grad_norm": 2.26991605758667, | |
| "learning_rate": 0.00013333443637802018, | |
| "logits/chosen": -0.5596145391464233, | |
| "logits/rejected": -0.606502890586853, | |
| "logps/chosen": -11.379673957824707, | |
| "logps/rejected": -57.18223190307617, | |
| "loss": 0.6898365020751953, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.577810525894165, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.8344271779060364, | |
| "rewards/margins": 5.093077182769775, | |
| "rewards/rejected": -4.258649826049805, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2669093114952987, | |
| "grad_norm": 2.1123597621917725, | |
| "learning_rate": 0.00013282937710617704, | |
| "logits/chosen": -0.5448533892631531, | |
| "logits/rejected": -0.5932585597038269, | |
| "logps/chosen": -8.195714950561523, | |
| "logps/rejected": -45.97007751464844, | |
| "loss": 0.6087915301322937, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.46375781297683716, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3240474462509155, | |
| "rewards/margins": 3.550736665725708, | |
| "rewards/rejected": -3.226688861846924, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.2717622080679405, | |
| "grad_norm": 2.723811626434326, | |
| "learning_rate": 0.0001323233774938176, | |
| "logits/chosen": -0.42906200885772705, | |
| "logits/rejected": -0.5946815013885498, | |
| "logps/chosen": -4.58329439163208, | |
| "logps/rejected": -51.42955017089844, | |
| "loss": 0.620631754398346, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44010403752326965, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08876454085111618, | |
| "rewards/margins": 3.707002878189087, | |
| "rewards/rejected": -3.6182377338409424, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.2766151046405825, | |
| "grad_norm": 3.211887836456299, | |
| "learning_rate": 0.0001318164520344223, | |
| "logits/chosen": -0.6018912196159363, | |
| "logits/rejected": -0.6174960136413574, | |
| "logps/chosen": -7.36622428894043, | |
| "logps/rejected": -38.56849670410156, | |
| "loss": 0.6065197587013245, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4719517230987549, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33680105209350586, | |
| "rewards/margins": 3.2080583572387695, | |
| "rewards/rejected": -2.8712568283081055, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 1.281468001213224, | |
| "grad_norm": 1.8414616584777832, | |
| "learning_rate": 0.0001313086152479909, | |
| "logits/chosen": -0.5074475407600403, | |
| "logits/rejected": -0.5390546917915344, | |
| "logps/chosen": -8.070147514343262, | |
| "logps/rejected": -59.026817321777344, | |
| "loss": 0.48236605525016785, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41621944308280945, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36634740233421326, | |
| "rewards/margins": 4.637523651123047, | |
| "rewards/rejected": -4.271176338195801, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.286320897785866, | |
| "grad_norm": 2.0310163497924805, | |
| "learning_rate": 0.00013079988168062667, | |
| "logits/chosen": -0.5628597736358643, | |
| "logits/rejected": -0.5743812918663025, | |
| "logps/chosen": -4.6434760093688965, | |
| "logps/rejected": -45.32111740112305, | |
| "loss": 0.477159708738327, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3573269844055176, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2367573380470276, | |
| "rewards/margins": 3.900679111480713, | |
| "rewards/rejected": -3.66392183303833, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.2911737943585078, | |
| "grad_norm": 3.795938730239868, | |
| "learning_rate": 0.0001302902659041194, | |
| "logits/chosen": -0.509046196937561, | |
| "logits/rejected": -0.58137446641922, | |
| "logps/chosen": -9.875723838806152, | |
| "logps/rejected": -66.20906829833984, | |
| "loss": 0.6042941808700562, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.489199161529541, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24621973931789398, | |
| "rewards/margins": 5.606562614440918, | |
| "rewards/rejected": -5.360342979431152, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.2960266909311495, | |
| "grad_norm": 1.6810376644134521, | |
| "learning_rate": 0.00012977978251552835, | |
| "logits/chosen": -0.550262451171875, | |
| "logits/rejected": -0.5889716148376465, | |
| "logps/chosen": -6.327710151672363, | |
| "logps/rejected": -50.49878692626953, | |
| "loss": 0.48666831851005554, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.420614093542099, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6961234211921692, | |
| "rewards/margins": 4.526570796966553, | |
| "rewards/rejected": -3.8304474353790283, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3008795875037913, | |
| "grad_norm": 16.308164596557617, | |
| "learning_rate": 0.000129268446136764, | |
| "logits/chosen": -0.4653426706790924, | |
| "logits/rejected": -0.5483728647232056, | |
| "logps/chosen": -12.072315216064453, | |
| "logps/rejected": -41.71879577636719, | |
| "loss": 1.1896687746047974, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.8476365804672241, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23016682267189026, | |
| "rewards/margins": 3.016373634338379, | |
| "rewards/rejected": -2.7862064838409424, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.305732484076433, | |
| "grad_norm": 2.573183298110962, | |
| "learning_rate": 0.00012875627141416927, | |
| "logits/chosen": -0.5348551273345947, | |
| "logits/rejected": -0.6181008219718933, | |
| "logps/chosen": -8.181488037109375, | |
| "logps/rejected": -42.61102294921875, | |
| "loss": 0.47875651717185974, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37093132734298706, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44617781043052673, | |
| "rewards/margins": 3.2320666313171387, | |
| "rewards/rejected": -2.785888671875, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.310585380649075, | |
| "grad_norm": 1.3156378269195557, | |
| "learning_rate": 0.00012824327301809993, | |
| "logits/chosen": -0.5920026898384094, | |
| "logits/rejected": -0.5561531186103821, | |
| "logps/chosen": -6.337456226348877, | |
| "logps/rejected": -42.275054931640625, | |
| "loss": 0.437936931848526, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3473253846168518, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5198031067848206, | |
| "rewards/margins": 3.6137380599975586, | |
| "rewards/rejected": -3.093935251235962, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3154382772217166, | |
| "grad_norm": 3.2668862342834473, | |
| "learning_rate": 0.00012772946564250454, | |
| "logits/chosen": -0.5389162302017212, | |
| "logits/rejected": -0.6585366725921631, | |
| "logps/chosen": -5.637282371520996, | |
| "logps/rejected": -69.4276351928711, | |
| "loss": 0.4279293417930603, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35049596428871155, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2999909818172455, | |
| "rewards/margins": 5.595761299133301, | |
| "rewards/rejected": -5.295770645141602, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3202911737943586, | |
| "grad_norm": 2.0276119709014893, | |
| "learning_rate": 0.0001272148640045034, | |
| "logits/chosen": -0.4903223514556885, | |
| "logits/rejected": -0.6459658741950989, | |
| "logps/chosen": -6.910153388977051, | |
| "logps/rejected": -53.252685546875, | |
| "loss": 0.5313152074813843, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44600358605384827, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3201812505722046, | |
| "rewards/margins": 4.161154270172119, | |
| "rewards/rejected": -3.840973138809204, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3251440703670003, | |
| "grad_norm": 2.30670166015625, | |
| "learning_rate": 0.00012669948284396707, | |
| "logits/chosen": -0.4254702925682068, | |
| "logits/rejected": -0.584973156452179, | |
| "logps/chosen": -6.449925422668457, | |
| "logps/rejected": -67.56501770019531, | |
| "loss": 0.4670742154121399, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3590107858181, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.38133683800697327, | |
| "rewards/margins": 5.280056953430176, | |
| "rewards/rejected": -4.8987202644348145, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.329996966939642, | |
| "grad_norm": 2.108753204345703, | |
| "learning_rate": 0.00012618333692309425, | |
| "logits/chosen": -0.4286295175552368, | |
| "logits/rejected": -0.5902926325798035, | |
| "logps/chosen": -8.96891975402832, | |
| "logps/rejected": -69.50025939941406, | |
| "loss": 0.611693799495697, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.538907527923584, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41572242975234985, | |
| "rewards/margins": 5.492770195007324, | |
| "rewards/rejected": -5.077048301696777, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3348498635122839, | |
| "grad_norm": 2.288952350616455, | |
| "learning_rate": 0.00012566644102598876, | |
| "logits/chosen": -0.551298201084137, | |
| "logits/rejected": -0.6482630968093872, | |
| "logps/chosen": -4.394012928009033, | |
| "logps/rejected": -64.0866470336914, | |
| "loss": 0.3978855609893799, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3059917390346527, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37667152285575867, | |
| "rewards/margins": 5.563392639160156, | |
| "rewards/rejected": -5.1867218017578125, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3397027600849256, | |
| "grad_norm": 1.6208826303482056, | |
| "learning_rate": 0.00012514880995823633, | |
| "logits/chosen": -0.5507360100746155, | |
| "logits/rejected": -0.5011016130447388, | |
| "logps/chosen": -8.466445922851562, | |
| "logps/rejected": -62.78064727783203, | |
| "loss": 0.4081018269062042, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3593176305294037, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6712185144424438, | |
| "rewards/margins": 5.426558494567871, | |
| "rewards/rejected": -4.755340576171875, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 1.3445556566575676, | |
| "grad_norm": 1.3175307512283325, | |
| "learning_rate": 0.00012463045854648028, | |
| "logits/chosen": -0.47354656457901, | |
| "logits/rejected": -0.5843176245689392, | |
| "logps/chosen": -9.277057647705078, | |
| "logps/rejected": -67.9296646118164, | |
| "loss": 0.4239290654659271, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3504438102245331, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31161031126976013, | |
| "rewards/margins": 5.217825889587402, | |
| "rewards/rejected": -4.906215190887451, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3494085532302094, | |
| "grad_norm": 2.984900712966919, | |
| "learning_rate": 0.0001241114016379969, | |
| "logits/chosen": -0.5064204335212708, | |
| "logits/rejected": -0.6357665061950684, | |
| "logps/chosen": -5.173352241516113, | |
| "logps/rejected": -70.36311340332031, | |
| "loss": 0.3665909767150879, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3104407489299774, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.28970491886138916, | |
| "rewards/margins": 5.905008316040039, | |
| "rewards/rejected": -5.6153035163879395, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3542614498028511, | |
| "grad_norm": 3.8592402935028076, | |
| "learning_rate": 0.00012359165410027038, | |
| "logits/chosen": -0.5974986553192139, | |
| "logits/rejected": -0.5683308243751526, | |
| "logps/chosen": -7.685509204864502, | |
| "logps/rejected": -68.6963119506836, | |
| "loss": 0.6189377903938293, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5725656747817993, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.017608020454645157, | |
| "rewards/margins": 5.929078578948975, | |
| "rewards/rejected": -5.911470890045166, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3591143463754929, | |
| "grad_norm": 1.8517260551452637, | |
| "learning_rate": 0.0001230712308205666, | |
| "logits/chosen": -0.5278875827789307, | |
| "logits/rejected": -0.5831331610679626, | |
| "logps/chosen": -6.993500709533691, | |
| "logps/rejected": -71.447265625, | |
| "loss": 0.5337494611740112, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4362339377403259, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43342167139053345, | |
| "rewards/margins": 6.075827598571777, | |
| "rewards/rejected": -5.642406463623047, | |
| "step": 281, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3639672429481347, | |
| "grad_norm": 8.710851669311523, | |
| "learning_rate": 0.00012255014670550695, | |
| "logits/chosen": -0.5506738424301147, | |
| "logits/rejected": -0.6786321401596069, | |
| "logps/chosen": -6.308893203735352, | |
| "logps/rejected": -61.42897415161133, | |
| "loss": 0.4665891230106354, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3888118863105774, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10167393088340759, | |
| "rewards/margins": 4.767309188842773, | |
| "rewards/rejected": -4.665635108947754, | |
| "step": 282, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3688201395207764, | |
| "grad_norm": 1.639738917350769, | |
| "learning_rate": 0.00012202841668064133, | |
| "logits/chosen": -0.5712087750434875, | |
| "logits/rejected": -0.5994412899017334, | |
| "logps/chosen": -8.841192245483398, | |
| "logps/rejected": -49.02497863769531, | |
| "loss": 0.49249428510665894, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3942464590072632, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.513531506061554, | |
| "rewards/margins": 4.046916484832764, | |
| "rewards/rejected": -3.5333847999572754, | |
| "step": 283, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3736730360934182, | |
| "grad_norm": 2.5005526542663574, | |
| "learning_rate": 0.0001215060556900206, | |
| "logits/chosen": -0.6159342527389526, | |
| "logits/rejected": -0.5261151790618896, | |
| "logps/chosen": -11.058247566223145, | |
| "logps/rejected": -38.02698516845703, | |
| "loss": 0.6315582990646362, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.45601698756217957, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.29090481996536255, | |
| "rewards/margins": 3.167656421661377, | |
| "rewards/rejected": -2.8767518997192383, | |
| "step": 284, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3785259326660602, | |
| "grad_norm": 2.1935603618621826, | |
| "learning_rate": 0.00012098307869576857, | |
| "logits/chosen": -0.5347535014152527, | |
| "logits/rejected": -0.6269012093544006, | |
| "logps/chosen": -5.4327263832092285, | |
| "logps/rejected": -53.36666488647461, | |
| "loss": 0.5734392404556274, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.48551303148269653, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3451090455055237, | |
| "rewards/margins": 4.587835788726807, | |
| "rewards/rejected": -4.242726802825928, | |
| "step": 285, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.383378829238702, | |
| "grad_norm": 1.7531166076660156, | |
| "learning_rate": 0.0001204595006776533, | |
| "logits/chosen": -0.5986635684967041, | |
| "logits/rejected": -0.5231766104698181, | |
| "logps/chosen": -6.427237510681152, | |
| "logps/rejected": -44.34131622314453, | |
| "loss": 0.5123925805091858, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35561901330947876, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.5461777448654175, | |
| "rewards/margins": 4.032759189605713, | |
| "rewards/rejected": -3.486581563949585, | |
| "step": 286, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3882317258113437, | |
| "grad_norm": 5.020232677459717, | |
| "learning_rate": 0.00011993533663265825, | |
| "logits/chosen": -0.530123233795166, | |
| "logits/rejected": -0.5217273831367493, | |
| "logps/chosen": -6.204465866088867, | |
| "logps/rejected": -45.284400939941406, | |
| "loss": 0.41509750485420227, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31672149896621704, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37450146675109863, | |
| "rewards/margins": 3.961106300354004, | |
| "rewards/rejected": -3.586604595184326, | |
| "step": 287, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3930846223839854, | |
| "grad_norm": 1.5128018856048584, | |
| "learning_rate": 0.00011941060157455255, | |
| "logits/chosen": -0.4853004217147827, | |
| "logits/rejected": -0.5132114291191101, | |
| "logps/chosen": -5.440448760986328, | |
| "logps/rejected": -52.13562774658203, | |
| "loss": 0.36660510301589966, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3081294596195221, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3041588366031647, | |
| "rewards/margins": 4.590592384338379, | |
| "rewards/rejected": -4.286433219909668, | |
| "step": 288, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.3979375189566272, | |
| "grad_norm": 2.4077889919281006, | |
| "learning_rate": 0.00011888531053346102, | |
| "logits/chosen": -0.49237561225891113, | |
| "logits/rejected": -0.6040050983428955, | |
| "logps/chosen": -4.646081924438477, | |
| "logps/rejected": -52.04267120361328, | |
| "loss": 0.5002583861351013, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3552401661872864, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1544920951128006, | |
| "rewards/margins": 3.924790859222412, | |
| "rewards/rejected": -3.770298480987549, | |
| "step": 289, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.402790415529269, | |
| "grad_norm": 4.293540000915527, | |
| "learning_rate": 0.00011835947855543357, | |
| "logits/chosen": -0.49632903933525085, | |
| "logits/rejected": -0.5672129988670349, | |
| "logps/chosen": -6.0486836433410645, | |
| "logps/rejected": -46.195953369140625, | |
| "loss": 0.6360176801681519, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41714945435523987, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17008864879608154, | |
| "rewards/margins": 3.6374118328094482, | |
| "rewards/rejected": -3.4673233032226562, | |
| "step": 290, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4076433121019107, | |
| "grad_norm": 1.6993286609649658, | |
| "learning_rate": 0.00011783312070201449, | |
| "logits/chosen": -0.4478822946548462, | |
| "logits/rejected": -0.54694002866745, | |
| "logps/chosen": -4.392575263977051, | |
| "logps/rejected": -59.24988555908203, | |
| "loss": 0.37447091937065125, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30612316727638245, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.42798465490341187, | |
| "rewards/margins": 4.448915004730225, | |
| "rewards/rejected": -4.020930290222168, | |
| "step": 291, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4124962086745527, | |
| "grad_norm": 1.3974409103393555, | |
| "learning_rate": 0.00011730625204981067, | |
| "logits/chosen": -0.5312929153442383, | |
| "logits/rejected": -0.5600184202194214, | |
| "logps/chosen": -6.275518894195557, | |
| "logps/rejected": -45.678016662597656, | |
| "loss": 0.4217968285083771, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33802202343940735, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5175706148147583, | |
| "rewards/margins": 3.6293063163757324, | |
| "rewards/rejected": -3.1117360591888428, | |
| "step": 292, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4173491052471945, | |
| "grad_norm": 1.445651650428772, | |
| "learning_rate": 0.00011677888769006006, | |
| "logits/chosen": -0.43435779213905334, | |
| "logits/rejected": -0.5795896053314209, | |
| "logps/chosen": -5.8951029777526855, | |
| "logps/rejected": -68.92474365234375, | |
| "loss": 0.43839338421821594, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3801453113555908, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5051225423812866, | |
| "rewards/margins": 5.6808271408081055, | |
| "rewards/rejected": -5.175704479217529, | |
| "step": 293, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4222020018198362, | |
| "grad_norm": 4.672330379486084, | |
| "learning_rate": 0.00011625104272819924, | |
| "logits/chosen": -0.5387169122695923, | |
| "logits/rejected": -0.5754097104072571, | |
| "logps/chosen": -11.130827903747559, | |
| "logps/rejected": -46.85166931152344, | |
| "loss": 0.65695720911026, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5195148587226868, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.34614866971969604, | |
| "rewards/margins": 3.703500747680664, | |
| "rewards/rejected": -3.357351541519165, | |
| "step": 294, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.427054898392478, | |
| "grad_norm": 3.555694580078125, | |
| "learning_rate": 0.00011572273228343085, | |
| "logits/chosen": -0.5434516668319702, | |
| "logits/rejected": -0.5415772795677185, | |
| "logps/chosen": -9.660689353942871, | |
| "logps/rejected": -49.3802490234375, | |
| "loss": 0.6120375990867615, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5219308733940125, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.27294304966926575, | |
| "rewards/margins": 4.194357872009277, | |
| "rewards/rejected": -3.921414613723755, | |
| "step": 295, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4319077949651198, | |
| "grad_norm": 2.3203206062316895, | |
| "learning_rate": 0.00011519397148829036, | |
| "logits/chosen": -0.48395296931266785, | |
| "logits/rejected": -0.5959677696228027, | |
| "logps/chosen": -6.713860511779785, | |
| "logps/rejected": -48.37174987792969, | |
| "loss": 0.5959409475326538, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4754820168018341, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3614426255226135, | |
| "rewards/margins": 4.109649181365967, | |
| "rewards/rejected": -3.748206615447998, | |
| "step": 296, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4367606915377615, | |
| "grad_norm": 5.711208343505859, | |
| "learning_rate": 0.00011466477548821295, | |
| "logits/chosen": -0.48468971252441406, | |
| "logits/rejected": -0.6009706854820251, | |
| "logps/chosen": -11.339531898498535, | |
| "logps/rejected": -54.938899993896484, | |
| "loss": 0.7243435978889465, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.580468475818634, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2628437876701355, | |
| "rewards/margins": 4.038267612457275, | |
| "rewards/rejected": -3.775423288345337, | |
| "step": 297, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4416135881104033, | |
| "grad_norm": 2.0594329833984375, | |
| "learning_rate": 0.0001141351594410993, | |
| "logits/chosen": -0.3807358741760254, | |
| "logits/rejected": -0.5564501285552979, | |
| "logps/chosen": -5.445425510406494, | |
| "logps/rejected": -80.2322998046875, | |
| "loss": 0.4422198534011841, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.34769272804260254, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43609946966171265, | |
| "rewards/margins": 6.63840389251709, | |
| "rewards/rejected": -6.202303886413574, | |
| "step": 298, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4464664846830453, | |
| "grad_norm": 9.533624649047852, | |
| "learning_rate": 0.0001136051385168817, | |
| "logits/chosen": -0.588534951210022, | |
| "logits/rejected": -0.5490925312042236, | |
| "logps/chosen": -8.359615325927734, | |
| "logps/rejected": -47.81086349487305, | |
| "loss": 0.7052288055419922, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.48559439182281494, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.325547456741333, | |
| "rewards/margins": 4.019394397735596, | |
| "rewards/rejected": -3.6938464641571045, | |
| "step": 299, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.451319381255687, | |
| "grad_norm": 3.8685522079467773, | |
| "learning_rate": 0.00011307472789708941, | |
| "logits/chosen": -0.42629003524780273, | |
| "logits/rejected": -0.6104705929756165, | |
| "logps/chosen": -5.350531578063965, | |
| "logps/rejected": -81.26776123046875, | |
| "loss": 0.40768933296203613, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3698083162307739, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2111378014087677, | |
| "rewards/margins": 6.788004398345947, | |
| "rewards/rejected": -6.576866149902344, | |
| "step": 300, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 1.4561722778283288, | |
| "grad_norm": 2.512544631958008, | |
| "learning_rate": 0.00011254394277441389, | |
| "logits/chosen": -0.6382584571838379, | |
| "logits/rejected": -0.6019880175590515, | |
| "logps/chosen": -7.892996311187744, | |
| "logps/rejected": -41.86744689941406, | |
| "loss": 0.5821014642715454, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4599181115627289, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5158106088638306, | |
| "rewards/margins": 3.640463352203369, | |
| "rewards/rejected": -3.124652624130249, | |
| "step": 301, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.4610251744009706, | |
| "grad_norm": 5.1838202476501465, | |
| "learning_rate": 0.0001120127983522735, | |
| "logits/chosen": -0.5451475977897644, | |
| "logits/rejected": -0.6455233097076416, | |
| "logps/chosen": -5.687978744506836, | |
| "logps/rejected": -60.908546447753906, | |
| "loss": 0.3940511643886566, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3449006676673889, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25533920526504517, | |
| "rewards/margins": 4.936288833618164, | |
| "rewards/rejected": -4.6809492111206055, | |
| "step": 302, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.4658780709736123, | |
| "grad_norm": 3.94558048248291, | |
| "learning_rate": 0.00011148130984437821, | |
| "logits/chosen": -0.6005349159240723, | |
| "logits/rejected": -0.5671123266220093, | |
| "logps/chosen": -10.100912094116211, | |
| "logps/rejected": -43.90180587768555, | |
| "loss": 0.6855916380882263, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.49480047821998596, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5798794627189636, | |
| "rewards/margins": 3.9076735973358154, | |
| "rewards/rejected": -3.327794313430786, | |
| "step": 303, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.470730967546254, | |
| "grad_norm": 10.446398735046387, | |
| "learning_rate": 0.00011094949247429367, | |
| "logits/chosen": -0.6262880563735962, | |
| "logits/rejected": -0.6268706321716309, | |
| "logps/chosen": -4.362340927124023, | |
| "logps/rejected": -38.86144256591797, | |
| "loss": 0.4943389594554901, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3061213195323944, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.250787615776062, | |
| "rewards/margins": 3.219599485397339, | |
| "rewards/rejected": -2.9688122272491455, | |
| "step": 304, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.4755838641188959, | |
| "grad_norm": 6.095590591430664, | |
| "learning_rate": 0.00011041736147500521, | |
| "logits/chosen": -0.6093315482139587, | |
| "logits/rejected": -0.6166112422943115, | |
| "logps/chosen": -6.5841217041015625, | |
| "logps/rejected": -49.99675750732422, | |
| "loss": 0.6060968041419983, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4157266318798065, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.27827149629592896, | |
| "rewards/margins": 4.0666279792785645, | |
| "rewards/rejected": -3.7883565425872803, | |
| "step": 305, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 1.4804367606915378, | |
| "grad_norm": 2.046461582183838, | |
| "learning_rate": 0.00010988493208848152, | |
| "logits/chosen": -0.5020789504051208, | |
| "logits/rejected": -0.6924933195114136, | |
| "logps/chosen": -3.8782224655151367, | |
| "logps/rejected": -43.1043586730957, | |
| "loss": 0.4394162893295288, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3379245400428772, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39841321110725403, | |
| "rewards/margins": 3.356016159057617, | |
| "rewards/rejected": -2.9576029777526855, | |
| "step": 306, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 1.4852896572641796, | |
| "grad_norm": 3.209573745727539, | |
| "learning_rate": 0.00010935221956523811, | |
| "logits/chosen": -0.516386866569519, | |
| "logits/rejected": -0.6068312525749207, | |
| "logps/chosen": -6.945718288421631, | |
| "logps/rejected": -51.43964385986328, | |
| "loss": 0.4786148965358734, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4294402003288269, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5849922895431519, | |
| "rewards/margins": 3.91150164604187, | |
| "rewards/rejected": -3.3265092372894287, | |
| "step": 307, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 1.4901425538368214, | |
| "grad_norm": 1.7191513776779175, | |
| "learning_rate": 0.00010881923916390049, | |
| "logits/chosen": -0.6583538055419922, | |
| "logits/rejected": -0.5885652303695679, | |
| "logps/chosen": -8.440103530883789, | |
| "logps/rejected": -43.60992431640625, | |
| "loss": 0.5813593864440918, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4593623876571655, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5861528515815735, | |
| "rewards/margins": 3.7840263843536377, | |
| "rewards/rejected": -3.197873830795288, | |
| "step": 308, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 1.4949954504094631, | |
| "grad_norm": 1.9797133207321167, | |
| "learning_rate": 0.00010828600615076693, | |
| "logits/chosen": -0.6261879205703735, | |
| "logits/rejected": -0.6092458963394165, | |
| "logps/chosen": -10.712249755859375, | |
| "logps/rejected": -41.042816162109375, | |
| "loss": 0.7072800397872925, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5846267938613892, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45308753848075867, | |
| "rewards/margins": 3.4953689575195312, | |
| "rewards/rejected": -3.0422816276550293, | |
| "step": 309, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 1.499848346982105, | |
| "grad_norm": 1.494490623474121, | |
| "learning_rate": 0.00010775253579937149, | |
| "logits/chosen": -0.5959508419036865, | |
| "logits/rejected": -0.6111063957214355, | |
| "logps/chosen": -7.947078227996826, | |
| "logps/rejected": -46.89546585083008, | |
| "loss": 0.4895540773868561, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3979214131832123, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43845731019973755, | |
| "rewards/margins": 3.7343225479125977, | |
| "rewards/rejected": -3.295865297317505, | |
| "step": 310, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 1.5047012435547469, | |
| "grad_norm": 1.7461920976638794, | |
| "learning_rate": 0.00010721884339004624, | |
| "logits/chosen": -0.5780505537986755, | |
| "logits/rejected": -0.6416879296302795, | |
| "logps/chosen": -9.42603588104248, | |
| "logps/rejected": -49.22099304199219, | |
| "loss": 0.5403653383255005, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4666685163974762, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38684380054473877, | |
| "rewards/margins": 4.107515335083008, | |
| "rewards/rejected": -3.7206711769104004, | |
| "step": 311, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5095541401273884, | |
| "grad_norm": 3.064173460006714, | |
| "learning_rate": 0.00010668494420948379, | |
| "logits/chosen": -0.5867709517478943, | |
| "logits/rejected": -0.5716814994812012, | |
| "logps/chosen": -9.473301887512207, | |
| "logps/rejected": -46.06374740600586, | |
| "loss": 0.581583559513092, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.501546323299408, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5978618264198303, | |
| "rewards/margins": 3.9907402992248535, | |
| "rewards/rejected": -3.392878770828247, | |
| "step": 312, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5144070367000304, | |
| "grad_norm": 5.558590888977051, | |
| "learning_rate": 0.00010615085355029932, | |
| "logits/chosen": -0.5637609362602234, | |
| "logits/rejected": -0.6482722759246826, | |
| "logps/chosen": -5.787672996520996, | |
| "logps/rejected": -43.255775451660156, | |
| "loss": 0.5569506287574768, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37950095534324646, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3309112787246704, | |
| "rewards/margins": 3.25948429107666, | |
| "rewards/rejected": -2.9285731315612793, | |
| "step": 313, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5192599332726722, | |
| "grad_norm": 2.0172033309936523, | |
| "learning_rate": 0.00010561658671059263, | |
| "logits/chosen": -0.6036593914031982, | |
| "logits/rejected": -0.6019976139068604, | |
| "logps/chosen": -6.517274856567383, | |
| "logps/rejected": -38.87729263305664, | |
| "loss": 0.6991593837738037, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5105293989181519, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11020549386739731, | |
| "rewards/margins": 2.9691853523254395, | |
| "rewards/rejected": -2.8589797019958496, | |
| "step": 314, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.524112829845314, | |
| "grad_norm": 5.136120796203613, | |
| "learning_rate": 0.00010508215899350987, | |
| "logits/chosen": -0.558395504951477, | |
| "logits/rejected": -0.652247428894043, | |
| "logps/chosen": -6.060056686401367, | |
| "logps/rejected": -43.995033264160156, | |
| "loss": 0.5087853074073792, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3800632655620575, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4679667353630066, | |
| "rewards/margins": 3.6016788482666016, | |
| "rewards/rejected": -3.133711814880371, | |
| "step": 315, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5289657264179557, | |
| "grad_norm": 2.09102725982666, | |
| "learning_rate": 0.00010454758570680519, | |
| "logits/chosen": -0.5643672347068787, | |
| "logits/rejected": -0.7025154829025269, | |
| "logps/chosen": -5.460536956787109, | |
| "logps/rejected": -57.277549743652344, | |
| "loss": 0.40410315990448, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.32965555787086487, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5296620726585388, | |
| "rewards/margins": 4.8166351318359375, | |
| "rewards/rejected": -4.286972999572754, | |
| "step": 316, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5338186229905975, | |
| "grad_norm": 2.1291167736053467, | |
| "learning_rate": 0.00010401288216240243, | |
| "logits/chosen": -0.5920678973197937, | |
| "logits/rejected": -0.6028088927268982, | |
| "logps/chosen": -8.511551856994629, | |
| "logps/rejected": -43.544952392578125, | |
| "loss": 0.5118197202682495, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3973322808742523, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3254610598087311, | |
| "rewards/margins": 3.3970041275024414, | |
| "rewards/rejected": -3.071542978286743, | |
| "step": 317, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5386715195632394, | |
| "grad_norm": 1.4472366571426392, | |
| "learning_rate": 0.00010347806367595641, | |
| "logits/chosen": -0.6946428418159485, | |
| "logits/rejected": -0.6046017408370972, | |
| "logps/chosen": -9.026538848876953, | |
| "logps/rejected": -44.3914909362793, | |
| "loss": 0.4705048203468323, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4167212247848511, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6066378355026245, | |
| "rewards/margins": 4.151495456695557, | |
| "rewards/rejected": -3.5448575019836426, | |
| "step": 318, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.543524416135881, | |
| "grad_norm": 1.4794950485229492, | |
| "learning_rate": 0.00010294314556641415, | |
| "logits/chosen": -0.5651342868804932, | |
| "logits/rejected": -0.6376992464065552, | |
| "logps/chosen": -6.627153396606445, | |
| "logps/rejected": -61.56837463378906, | |
| "loss": 0.3749412000179291, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2864323854446411, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6291906833648682, | |
| "rewards/margins": 5.060451984405518, | |
| "rewards/rejected": -4.43126106262207, | |
| "step": 319, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.548377312708523, | |
| "grad_norm": 1.9077544212341309, | |
| "learning_rate": 0.00010240814315557641, | |
| "logits/chosen": -0.609174370765686, | |
| "logits/rejected": -0.6467056274414062, | |
| "logps/chosen": -6.6128830909729, | |
| "logps/rejected": -45.46076202392578, | |
| "loss": 0.5334227085113525, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.42581820487976074, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3819562792778015, | |
| "rewards/margins": 3.7431411743164062, | |
| "rewards/rejected": -3.36118483543396, | |
| "step": 320, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5532302092811647, | |
| "grad_norm": 2.2690963745117188, | |
| "learning_rate": 0.00010187307176765843, | |
| "logits/chosen": -0.617026686668396, | |
| "logits/rejected": -0.5606160759925842, | |
| "logps/chosen": -7.428723335266113, | |
| "logps/rejected": -46.8917236328125, | |
| "loss": 0.3421052098274231, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2879929542541504, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.513569176197052, | |
| "rewards/margins": 4.016087532043457, | |
| "rewards/rejected": -3.5025181770324707, | |
| "step": 321, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5580831058538065, | |
| "grad_norm": 1.8495913743972778, | |
| "learning_rate": 0.00010133794672885126, | |
| "logits/chosen": -0.654956579208374, | |
| "logits/rejected": -0.6292996406555176, | |
| "logps/chosen": -5.92061710357666, | |
| "logps/rejected": -43.26755142211914, | |
| "loss": 0.41225647926330566, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2992178201675415, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3303091526031494, | |
| "rewards/margins": 3.460402727127075, | |
| "rewards/rejected": -3.130093812942505, | |
| "step": 322, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5629360024264483, | |
| "grad_norm": 2.2607078552246094, | |
| "learning_rate": 0.00010080278336688269, | |
| "logits/chosen": -0.6333922147750854, | |
| "logits/rejected": -0.6164621114730835, | |
| "logps/chosen": -7.66819953918457, | |
| "logps/rejected": -37.640716552734375, | |
| "loss": 0.5807369947433472, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44647595286369324, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41271087527275085, | |
| "rewards/margins": 3.116626024246216, | |
| "rewards/rejected": -2.7039151191711426, | |
| "step": 323, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.56778889899909, | |
| "grad_norm": 2.041767120361328, | |
| "learning_rate": 0.0001002675970105782, | |
| "logits/chosen": -0.5944446325302124, | |
| "logits/rejected": -0.649810254573822, | |
| "logps/chosen": -5.130420684814453, | |
| "logps/rejected": -57.715633392333984, | |
| "loss": 0.44472748041152954, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.38934436440467834, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31300902366638184, | |
| "rewards/margins": 4.556962490081787, | |
| "rewards/rejected": -4.243953704833984, | |
| "step": 324, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.572641795571732, | |
| "grad_norm": 1.8666281700134277, | |
| "learning_rate": 9.973240298942186e-05, | |
| "logits/chosen": -0.6077824831008911, | |
| "logits/rejected": -0.6768872737884521, | |
| "logps/chosen": -4.431147575378418, | |
| "logps/rejected": -47.667083740234375, | |
| "loss": 0.3861500024795532, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3025864362716675, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4579262435436249, | |
| "rewards/margins": 4.076756000518799, | |
| "rewards/rejected": -3.6188297271728516, | |
| "step": 325, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 1.5774946921443735, | |
| "grad_norm": 1.354288101196289, | |
| "learning_rate": 9.919721663311735e-05, | |
| "logits/chosen": -0.581783652305603, | |
| "logits/rejected": -0.6307191848754883, | |
| "logps/chosen": -7.806026458740234, | |
| "logps/rejected": -57.728450775146484, | |
| "loss": 0.3800911605358124, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3367314040660858, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7344149351119995, | |
| "rewards/margins": 5.010638236999512, | |
| "rewards/rejected": -4.276223182678223, | |
| "step": 326, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.5823475887170155, | |
| "grad_norm": 3.4802000522613525, | |
| "learning_rate": 9.866205327114878e-05, | |
| "logits/chosen": -0.6555965542793274, | |
| "logits/rejected": -0.623173713684082, | |
| "logps/chosen": -7.538932800292969, | |
| "logps/rejected": -50.15068435668945, | |
| "loss": 0.4507198929786682, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3541090488433838, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5268290638923645, | |
| "rewards/margins": 4.412640571594238, | |
| "rewards/rejected": -3.8858118057250977, | |
| "step": 327, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.5872004852896573, | |
| "grad_norm": 6.735937595367432, | |
| "learning_rate": 9.812692823234162e-05, | |
| "logits/chosen": -0.5485168695449829, | |
| "logits/rejected": -0.6471503376960754, | |
| "logps/chosen": -15.263660430908203, | |
| "logps/rejected": -52.954689025878906, | |
| "loss": 1.1621382236480713, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.8926911950111389, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.30793625116348267, | |
| "rewards/margins": 4.04182767868042, | |
| "rewards/rejected": -3.733891725540161, | |
| "step": 328, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.592053381862299, | |
| "grad_norm": 3.428593158721924, | |
| "learning_rate": 9.759185684442364e-05, | |
| "logits/chosen": -0.5640755891799927, | |
| "logits/rejected": -0.6619393229484558, | |
| "logps/chosen": -9.795215606689453, | |
| "logps/rejected": -56.33967590332031, | |
| "loss": 0.4578760862350464, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41830143332481384, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36150434613227844, | |
| "rewards/margins": 4.640243053436279, | |
| "rewards/rejected": -4.278738975524902, | |
| "step": 329, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.5969062784349408, | |
| "grad_norm": 1.3190497159957886, | |
| "learning_rate": 9.705685443358587e-05, | |
| "logits/chosen": -0.5729192495346069, | |
| "logits/rejected": -0.7135790586471558, | |
| "logps/chosen": -4.78794002532959, | |
| "logps/rejected": -54.89573287963867, | |
| "loss": 0.5212274789810181, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3776065707206726, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.443916916847229, | |
| "rewards/margins": 4.637664794921875, | |
| "rewards/rejected": -4.1937479972839355, | |
| "step": 330, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6017591750075826, | |
| "grad_norm": 9.288045883178711, | |
| "learning_rate": 9.652193632404366e-05, | |
| "logits/chosen": -0.595818281173706, | |
| "logits/rejected": -0.6348686218261719, | |
| "logps/chosen": -6.8341569900512695, | |
| "logps/rejected": -48.808326721191406, | |
| "loss": 0.5226893424987793, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41388052701950073, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3592848777770996, | |
| "rewards/margins": 4.086162567138672, | |
| "rewards/rejected": -3.726877450942993, | |
| "step": 331, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6066120715802246, | |
| "grad_norm": 5.546242713928223, | |
| "learning_rate": 9.59871178375976e-05, | |
| "logits/chosen": -0.48975422978401184, | |
| "logits/rejected": -0.6462091207504272, | |
| "logps/chosen": -7.947976112365723, | |
| "logps/rejected": -58.80369186401367, | |
| "loss": 0.6880707144737244, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5256102681159973, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24807511270046234, | |
| "rewards/margins": 4.507709980010986, | |
| "rewards/rejected": -4.259634494781494, | |
| "step": 332, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.611464968152866, | |
| "grad_norm": 1.386412262916565, | |
| "learning_rate": 9.545241429319485e-05, | |
| "logits/chosen": -0.5779885053634644, | |
| "logits/rejected": -0.6384286880493164, | |
| "logps/chosen": -6.562236785888672, | |
| "logps/rejected": -56.188209533691406, | |
| "loss": 0.407429039478302, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3221083879470825, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38200071454048157, | |
| "rewards/margins": 4.46467399597168, | |
| "rewards/rejected": -4.082673072814941, | |
| "step": 333, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.616317864725508, | |
| "grad_norm": 2.560448408126831, | |
| "learning_rate": 9.49178410064902e-05, | |
| "logits/chosen": -0.6340376734733582, | |
| "logits/rejected": -0.7194669842720032, | |
| "logps/chosen": -7.199141025543213, | |
| "logps/rejected": -63.84518814086914, | |
| "loss": 0.5680751204490662, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.47767576575279236, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.26790323853492737, | |
| "rewards/margins": 5.208552360534668, | |
| "rewards/rejected": -4.940649032592773, | |
| "step": 334, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6211707612981499, | |
| "grad_norm": 1.8407776355743408, | |
| "learning_rate": 9.438341328940741e-05, | |
| "logits/chosen": -0.599894106388092, | |
| "logits/rejected": -0.6249052286148071, | |
| "logps/chosen": -5.6531500816345215, | |
| "logps/rejected": -58.302886962890625, | |
| "loss": 0.4413163959980011, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3573150932788849, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3164544999599457, | |
| "rewards/margins": 4.9474873542785645, | |
| "rewards/rejected": -4.631032943725586, | |
| "step": 335, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6260236578707916, | |
| "grad_norm": 2.40498423576355, | |
| "learning_rate": 9.38491464497007e-05, | |
| "logits/chosen": -0.5375716686248779, | |
| "logits/rejected": -0.5499206185340881, | |
| "logps/chosen": -8.159395217895508, | |
| "logps/rejected": -48.34782028198242, | |
| "loss": 0.49570977687835693, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3956414759159088, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3522006571292877, | |
| "rewards/margins": 4.193397521972656, | |
| "rewards/rejected": -3.8411965370178223, | |
| "step": 336, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6308765544434334, | |
| "grad_norm": 1.6417068243026733, | |
| "learning_rate": 9.331505579051625e-05, | |
| "logits/chosen": -0.545053243637085, | |
| "logits/rejected": -0.6773225665092468, | |
| "logps/chosen": -6.606297969818115, | |
| "logps/rejected": -59.53656768798828, | |
| "loss": 0.4224468469619751, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3473230004310608, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4226296544075012, | |
| "rewards/margins": 5.076443195343018, | |
| "rewards/rejected": -4.65381383895874, | |
| "step": 337, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6357294510160751, | |
| "grad_norm": 13.740976333618164, | |
| "learning_rate": 9.278115660995381e-05, | |
| "logits/chosen": -0.5505022406578064, | |
| "logits/rejected": -0.5583426356315613, | |
| "logps/chosen": -11.989409446716309, | |
| "logps/rejected": -47.868778228759766, | |
| "loss": 0.8071911334991455, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.6452237367630005, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2338467538356781, | |
| "rewards/margins": 3.940605878829956, | |
| "rewards/rejected": -3.706758975982666, | |
| "step": 338, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6405823475887171, | |
| "grad_norm": 1.625360131263733, | |
| "learning_rate": 9.224746420062856e-05, | |
| "logits/chosen": -0.5600079298019409, | |
| "logits/rejected": -0.6354740858078003, | |
| "logps/chosen": -4.1894683837890625, | |
| "logps/rejected": -49.874656677246094, | |
| "loss": 0.4195435047149658, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31842583417892456, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32246169447898865, | |
| "rewards/margins": 4.235136985778809, | |
| "rewards/rejected": -3.912675142288208, | |
| "step": 339, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6454352441613587, | |
| "grad_norm": 4.4795637130737305, | |
| "learning_rate": 9.17139938492331e-05, | |
| "logits/chosen": -0.49861690402030945, | |
| "logits/rejected": -0.5702850222587585, | |
| "logps/chosen": -4.143195152282715, | |
| "logps/rejected": -59.96359634399414, | |
| "loss": 0.4519193768501282, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3539150059223175, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3664929270744324, | |
| "rewards/margins": 5.257262706756592, | |
| "rewards/rejected": -4.890769958496094, | |
| "step": 340, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6502881407340007, | |
| "grad_norm": 1.5060231685638428, | |
| "learning_rate": 9.118076083609957e-05, | |
| "logits/chosen": -0.44778943061828613, | |
| "logits/rejected": -0.6046348810195923, | |
| "logps/chosen": -6.510164260864258, | |
| "logps/rejected": -69.77119445800781, | |
| "loss": 0.463850200176239, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3615817427635193, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3123082220554352, | |
| "rewards/margins": 5.188659191131592, | |
| "rewards/rejected": -4.876350402832031, | |
| "step": 341, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6551410373066424, | |
| "grad_norm": 2.397501230239868, | |
| "learning_rate": 9.06477804347619e-05, | |
| "logits/chosen": -0.5780848264694214, | |
| "logits/rejected": -0.6476944088935852, | |
| "logps/chosen": -6.870480537414551, | |
| "logps/rejected": -53.82758331298828, | |
| "loss": 0.5952875018119812, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5066685080528259, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1310853809118271, | |
| "rewards/margins": 4.296086311340332, | |
| "rewards/rejected": -4.1650004386901855, | |
| "step": 342, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6599939338792842, | |
| "grad_norm": 1.5056358575820923, | |
| "learning_rate": 9.011506791151852e-05, | |
| "logits/chosen": -0.4288467764854431, | |
| "logits/rejected": -0.5699352025985718, | |
| "logps/chosen": -7.348167419433594, | |
| "logps/rejected": -63.37668228149414, | |
| "loss": 0.5560216903686523, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3829069435596466, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07641153037548065, | |
| "rewards/margins": 5.002201557159424, | |
| "rewards/rejected": -4.925789833068848, | |
| "step": 343, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.664846830451926, | |
| "grad_norm": 1.5031427145004272, | |
| "learning_rate": 8.958263852499484e-05, | |
| "logits/chosen": -0.4225258231163025, | |
| "logits/rejected": -0.535403847694397, | |
| "logps/chosen": -5.367722034454346, | |
| "logps/rejected": -49.57887268066406, | |
| "loss": 0.4295026957988739, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3338817059993744, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4614546298980713, | |
| "rewards/margins": 4.152436256408691, | |
| "rewards/rejected": -3.690981864929199, | |
| "step": 344, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6696997270245677, | |
| "grad_norm": 2.489946126937866, | |
| "learning_rate": 8.905050752570637e-05, | |
| "logits/chosen": -0.5617578029632568, | |
| "logits/rejected": -0.5615582466125488, | |
| "logps/chosen": -10.081955909729004, | |
| "logps/rejected": -44.940128326416016, | |
| "loss": 0.7347481846809387, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5868388414382935, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.49463242292404175, | |
| "rewards/margins": 3.9436519145965576, | |
| "rewards/rejected": -3.44901967048645, | |
| "step": 345, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6745526235972097, | |
| "grad_norm": 1.5559295415878296, | |
| "learning_rate": 8.851869015562182e-05, | |
| "logits/chosen": -0.5702999830245972, | |
| "logits/rejected": -0.5214522480964661, | |
| "logps/chosen": -5.7895588874816895, | |
| "logps/rejected": -39.77272415161133, | |
| "loss": 0.4607730209827423, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.29008588194847107, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35730960965156555, | |
| "rewards/margins": 3.4512643814086914, | |
| "rewards/rejected": -3.09395432472229, | |
| "step": 346, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6794055201698512, | |
| "grad_norm": 4.507357597351074, | |
| "learning_rate": 8.798720164772652e-05, | |
| "logits/chosen": -0.42328932881355286, | |
| "logits/rejected": -0.5958046317100525, | |
| "logps/chosen": -4.903199672698975, | |
| "logps/rejected": -59.0321044921875, | |
| "loss": 0.4769352972507477, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3681376278400421, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30076682567596436, | |
| "rewards/margins": 4.566420078277588, | |
| "rewards/rejected": -4.265653133392334, | |
| "step": 347, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6842584167424932, | |
| "grad_norm": 1.1447113752365112, | |
| "learning_rate": 8.745605722558614e-05, | |
| "logits/chosen": -0.5531865358352661, | |
| "logits/rejected": -0.6662507057189941, | |
| "logps/chosen": -7.424785137176514, | |
| "logps/rejected": -66.3174819946289, | |
| "loss": 0.42974644899368286, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37240737676620483, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45229923725128174, | |
| "rewards/margins": 5.330164909362793, | |
| "rewards/rejected": -4.877865791320801, | |
| "step": 348, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.689111313315135, | |
| "grad_norm": 1.5469876527786255, | |
| "learning_rate": 8.692527210291061e-05, | |
| "logits/chosen": -0.5137654542922974, | |
| "logits/rejected": -0.5954875946044922, | |
| "logps/chosen": -6.440439224243164, | |
| "logps/rejected": -52.39330291748047, | |
| "loss": 0.47360655665397644, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.354643315076828, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3581860065460205, | |
| "rewards/margins": 4.325052738189697, | |
| "rewards/rejected": -3.9668664932250977, | |
| "step": 349, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6939642098877767, | |
| "grad_norm": 1.29133141040802, | |
| "learning_rate": 8.639486148311832e-05, | |
| "logits/chosen": -0.5328890085220337, | |
| "logits/rejected": -0.5401005744934082, | |
| "logps/chosen": -5.215033531188965, | |
| "logps/rejected": -41.489501953125, | |
| "loss": 0.42927610874176025, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3394067585468292, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5777302980422974, | |
| "rewards/margins": 3.701390266418457, | |
| "rewards/rejected": -3.123660087585449, | |
| "step": 350, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.6988171064604187, | |
| "grad_norm": 1.0701820850372314, | |
| "learning_rate": 8.586484055890073e-05, | |
| "logits/chosen": -0.5304415822029114, | |
| "logits/rejected": -0.5903620719909668, | |
| "logps/chosen": -7.539663791656494, | |
| "logps/rejected": -57.893089294433594, | |
| "loss": 0.3725716769695282, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.34029409289360046, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8499858379364014, | |
| "rewards/margins": 5.209049701690674, | |
| "rewards/rejected": -4.359063625335693, | |
| "step": 351, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.7036700030330603, | |
| "grad_norm": 1.6989585161209106, | |
| "learning_rate": 8.533522451178709e-05, | |
| "logits/chosen": -0.40656912326812744, | |
| "logits/rejected": -0.5467347502708435, | |
| "logps/chosen": -6.945850372314453, | |
| "logps/rejected": -66.7576675415039, | |
| "loss": 0.4149318039417267, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30544260144233704, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45475703477859497, | |
| "rewards/margins": 5.145503520965576, | |
| "rewards/rejected": -4.690746784210205, | |
| "step": 352, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 1.7085228996057022, | |
| "grad_norm": 1.4892257452011108, | |
| "learning_rate": 8.480602851170965e-05, | |
| "logits/chosen": -0.5176103115081787, | |
| "logits/rejected": -0.602209210395813, | |
| "logps/chosen": -8.820964813232422, | |
| "logps/rejected": -70.21007537841797, | |
| "loss": 0.47460365295410156, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39704644680023193, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39281153678894043, | |
| "rewards/margins": 5.77950382232666, | |
| "rewards/rejected": -5.386692047119141, | |
| "step": 353, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7133757961783438, | |
| "grad_norm": 2.6191413402557373, | |
| "learning_rate": 8.427726771656919e-05, | |
| "logits/chosen": -0.5776093602180481, | |
| "logits/rejected": -0.6113609075546265, | |
| "logps/chosen": -7.561610698699951, | |
| "logps/rejected": -55.61864471435547, | |
| "loss": 0.506373405456543, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.45334392786026, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.27774930000305176, | |
| "rewards/margins": 4.664512634277344, | |
| "rewards/rejected": -4.386763572692871, | |
| "step": 354, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7182286927509858, | |
| "grad_norm": 1.8908771276474, | |
| "learning_rate": 8.374895727180078e-05, | |
| "logits/chosen": -0.5553713440895081, | |
| "logits/rejected": -0.5910208225250244, | |
| "logps/chosen": -4.75492000579834, | |
| "logps/rejected": -50.89332580566406, | |
| "loss": 0.47143951058387756, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35297641158103943, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.731899619102478, | |
| "rewards/margins": 4.826332092285156, | |
| "rewards/rejected": -4.094432353973389, | |
| "step": 355, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7230815893236275, | |
| "grad_norm": 1.6974931955337524, | |
| "learning_rate": 8.322111230993996e-05, | |
| "logits/chosen": -0.5272183418273926, | |
| "logits/rejected": -0.6386415362358093, | |
| "logps/chosen": -5.672680854797363, | |
| "logps/rejected": -59.400821685791016, | |
| "loss": 0.4574481248855591, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4211491346359253, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34737688302993774, | |
| "rewards/margins": 5.093772888183594, | |
| "rewards/rejected": -4.746396064758301, | |
| "step": 356, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7279344858962693, | |
| "grad_norm": 4.814131736755371, | |
| "learning_rate": 8.269374795018935e-05, | |
| "logits/chosen": -0.5472154021263123, | |
| "logits/rejected": -0.6678116917610168, | |
| "logps/chosen": -4.800302028656006, | |
| "logps/rejected": -50.18709945678711, | |
| "loss": 0.4820733368396759, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3411250114440918, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.36357274651527405, | |
| "rewards/margins": 4.207507610321045, | |
| "rewards/rejected": -3.8439345359802246, | |
| "step": 357, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7327873824689113, | |
| "grad_norm": 25.56521987915039, | |
| "learning_rate": 8.216687929798555e-05, | |
| "logits/chosen": -0.59607994556427, | |
| "logits/rejected": -0.5965242981910706, | |
| "logps/chosen": -7.4342827796936035, | |
| "logps/rejected": -55.70969772338867, | |
| "loss": 0.6015688180923462, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.47894054651260376, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2108612060546875, | |
| "rewards/margins": 4.618812561035156, | |
| "rewards/rejected": -4.407951354980469, | |
| "step": 358, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7376402790415528, | |
| "grad_norm": 2.646254301071167, | |
| "learning_rate": 8.164052144456644e-05, | |
| "logits/chosen": -0.5229163765907288, | |
| "logits/rejected": -0.5666540861129761, | |
| "logps/chosen": -7.539342403411865, | |
| "logps/rejected": -65.20008850097656, | |
| "loss": 0.5384639501571655, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3802006244659424, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2473461627960205, | |
| "rewards/margins": 5.495670318603516, | |
| "rewards/rejected": -5.248324394226074, | |
| "step": 359, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7424931756141948, | |
| "grad_norm": 3.1693460941314697, | |
| "learning_rate": 8.1114689466539e-05, | |
| "logits/chosen": -0.511572539806366, | |
| "logits/rejected": -0.5504287481307983, | |
| "logps/chosen": -7.456597805023193, | |
| "logps/rejected": -60.54533767700195, | |
| "loss": 0.4974018931388855, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3851374685764313, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13325002789497375, | |
| "rewards/margins": 4.76202392578125, | |
| "rewards/rejected": -4.628774166107178, | |
| "step": 360, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7473460721868364, | |
| "grad_norm": 4.455358982086182, | |
| "learning_rate": 8.058939842544746e-05, | |
| "logits/chosen": -0.563317060470581, | |
| "logits/rejected": -0.5798763632774353, | |
| "logps/chosen": -8.331918716430664, | |
| "logps/rejected": -73.94954681396484, | |
| "loss": 0.6620030403137207, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5270119905471802, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35882383584976196, | |
| "rewards/margins": 6.576168060302734, | |
| "rewards/rejected": -6.217343807220459, | |
| "step": 361, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7521989687594783, | |
| "grad_norm": 1.7637327909469604, | |
| "learning_rate": 8.006466336734175e-05, | |
| "logits/chosen": -0.6341654062271118, | |
| "logits/rejected": -0.6398584246635437, | |
| "logps/chosen": -7.4092278480529785, | |
| "logps/rejected": -72.494140625, | |
| "loss": 0.4158819615840912, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3542729914188385, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5741710662841797, | |
| "rewards/margins": 6.305863857269287, | |
| "rewards/rejected": -5.731692790985107, | |
| "step": 362, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.75705186533212, | |
| "grad_norm": 1.5812638998031616, | |
| "learning_rate": 7.954049932234671e-05, | |
| "logits/chosen": -0.6816877126693726, | |
| "logits/rejected": -0.6603627800941467, | |
| "logps/chosen": -6.160002708435059, | |
| "logps/rejected": -50.724632263183594, | |
| "loss": 0.48404860496520996, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41279760003089905, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35023611783981323, | |
| "rewards/margins": 4.546292304992676, | |
| "rewards/rejected": -4.196056365966797, | |
| "step": 363, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7619047619047619, | |
| "grad_norm": 3.961177349090576, | |
| "learning_rate": 7.901692130423146e-05, | |
| "logits/chosen": -0.44241440296173096, | |
| "logits/rejected": -0.6773367524147034, | |
| "logps/chosen": -7.554819107055664, | |
| "logps/rejected": -75.7926025390625, | |
| "loss": 0.6084886193275452, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.555864155292511, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.665946364402771, | |
| "rewards/margins": 6.574328422546387, | |
| "rewards/rejected": -5.908381938934326, | |
| "step": 364, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7667576584774038, | |
| "grad_norm": 2.4002699851989746, | |
| "learning_rate": 7.849394430997942e-05, | |
| "logits/chosen": -0.5866585373878479, | |
| "logits/rejected": -0.6919276714324951, | |
| "logps/chosen": -5.258626461029053, | |
| "logps/rejected": -71.92113494873047, | |
| "loss": 0.362761914730072, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2987920045852661, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4903678297996521, | |
| "rewards/margins": 6.378476619720459, | |
| "rewards/rejected": -5.88810920715332, | |
| "step": 365, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7716105550500454, | |
| "grad_norm": 7.544757843017578, | |
| "learning_rate": 7.797158331935868e-05, | |
| "logits/chosen": -0.5447720289230347, | |
| "logits/rejected": -0.7196207642555237, | |
| "logps/chosen": -5.016351699829102, | |
| "logps/rejected": -74.3594741821289, | |
| "loss": 0.43109458684921265, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37264254689216614, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5947989821434021, | |
| "rewards/margins": 6.384332180023193, | |
| "rewards/rejected": -5.789533615112305, | |
| "step": 366, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7764634516226874, | |
| "grad_norm": 3.2290894985198975, | |
| "learning_rate": 7.744985329449308e-05, | |
| "logits/chosen": -0.5767285227775574, | |
| "logits/rejected": -0.6524717211723328, | |
| "logps/chosen": -8.41595458984375, | |
| "logps/rejected": -61.92336654663086, | |
| "loss": 0.45252880454063416, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37806618213653564, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20435132086277008, | |
| "rewards/margins": 4.638521671295166, | |
| "rewards/rejected": -4.434170722961426, | |
| "step": 367, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7813163481953291, | |
| "grad_norm": 1.3838449716567993, | |
| "learning_rate": 7.692876917943344e-05, | |
| "logits/chosen": -0.5361247062683105, | |
| "logits/rejected": -0.6537144780158997, | |
| "logps/chosen": -5.467535972595215, | |
| "logps/rejected": -68.74711608886719, | |
| "loss": 0.40285754203796387, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3363882005214691, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.436367928981781, | |
| "rewards/margins": 5.848932266235352, | |
| "rewards/rejected": -5.412564277648926, | |
| "step": 368, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.786169244767971, | |
| "grad_norm": 1.336934208869934, | |
| "learning_rate": 7.640834589972963e-05, | |
| "logits/chosen": -0.6001090407371521, | |
| "logits/rejected": -0.5818979740142822, | |
| "logps/chosen": -8.308907508850098, | |
| "logps/rejected": -60.38719177246094, | |
| "loss": 0.4286263883113861, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3554682731628418, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4350327253341675, | |
| "rewards/margins": 4.90503454208374, | |
| "rewards/rejected": -4.470002174377441, | |
| "step": 369, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7910221413406127, | |
| "grad_norm": 1.9011597633361816, | |
| "learning_rate": 7.588859836200308e-05, | |
| "logits/chosen": -0.5916749238967896, | |
| "logits/rejected": -0.7118907570838928, | |
| "logps/chosen": -6.806790351867676, | |
| "logps/rejected": -66.50003051757812, | |
| "loss": 0.4563574492931366, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.389671266078949, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.22776946425437927, | |
| "rewards/margins": 5.538066864013672, | |
| "rewards/rejected": -5.31029748916626, | |
| "step": 370, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.7958750379132544, | |
| "grad_norm": 1.700817346572876, | |
| "learning_rate": 7.536954145351976e-05, | |
| "logits/chosen": -0.6129568815231323, | |
| "logits/rejected": -0.6337454319000244, | |
| "logps/chosen": -7.165014266967773, | |
| "logps/rejected": -46.610076904296875, | |
| "loss": 0.5435734987258911, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4342629313468933, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2315727323293686, | |
| "rewards/margins": 3.8478901386260986, | |
| "rewards/rejected": -3.6163172721862793, | |
| "step": 371, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.8007279344858964, | |
| "grad_norm": 2.0048391819000244, | |
| "learning_rate": 7.485119004176369e-05, | |
| "logits/chosen": -0.5811576843261719, | |
| "logits/rejected": -0.6571300029754639, | |
| "logps/chosen": -5.568129539489746, | |
| "logps/rejected": -54.286800384521484, | |
| "loss": 0.4205508530139923, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33261215686798096, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5853878259658813, | |
| "rewards/margins": 4.741663932800293, | |
| "rewards/rejected": -4.156275749206543, | |
| "step": 372, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.805580831058538, | |
| "grad_norm": 1.4573878049850464, | |
| "learning_rate": 7.433355897401124e-05, | |
| "logits/chosen": -0.5516615509986877, | |
| "logits/rejected": -0.6074531674385071, | |
| "logps/chosen": -9.620394706726074, | |
| "logps/rejected": -58.0218620300293, | |
| "loss": 0.427951842546463, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39728832244873047, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5336946249008179, | |
| "rewards/margins": 5.072145462036133, | |
| "rewards/rejected": -4.538450241088867, | |
| "step": 373, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.81043372763118, | |
| "grad_norm": 1.408173680305481, | |
| "learning_rate": 7.381666307690577e-05, | |
| "logits/chosen": -0.48643210530281067, | |
| "logits/rejected": -0.6415500044822693, | |
| "logps/chosen": -4.454833507537842, | |
| "logps/rejected": -67.23634338378906, | |
| "loss": 0.39852896332740784, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3160818815231323, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3882303535938263, | |
| "rewards/margins": 5.432356834411621, | |
| "rewards/rejected": -5.044126510620117, | |
| "step": 374, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.8152866242038217, | |
| "grad_norm": 1.442551851272583, | |
| "learning_rate": 7.330051715603294e-05, | |
| "logits/chosen": -0.566937267780304, | |
| "logits/rejected": -0.5860986113548279, | |
| "logps/chosen": -7.206866264343262, | |
| "logps/rejected": -43.63417434692383, | |
| "loss": 0.49567076563835144, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3601769506931305, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.568464457988739, | |
| "rewards/margins": 3.668775796890259, | |
| "rewards/rejected": -3.100311279296875, | |
| "step": 375, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.8201395207764635, | |
| "grad_norm": 2.181886911392212, | |
| "learning_rate": 7.278513599549663e-05, | |
| "logits/chosen": -0.5393786430358887, | |
| "logits/rejected": -0.6041433215141296, | |
| "logps/chosen": -7.469542026519775, | |
| "logps/rejected": -48.04313278198242, | |
| "loss": 0.619269847869873, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.47027507424354553, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32126161456108093, | |
| "rewards/margins": 3.8658785820007324, | |
| "rewards/rejected": -3.544617176055908, | |
| "step": 376, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 1.8249924173491052, | |
| "grad_norm": 1.3919330835342407, | |
| "learning_rate": 7.227053435749549e-05, | |
| "logits/chosen": -0.5749082565307617, | |
| "logits/rejected": -0.5841610431671143, | |
| "logps/chosen": -6.959747314453125, | |
| "logps/rejected": -57.52180480957031, | |
| "loss": 0.3529089093208313, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.28856778144836426, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37144219875335693, | |
| "rewards/margins": 4.348825454711914, | |
| "rewards/rejected": -3.977383852005005, | |
| "step": 377, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.829845313921747, | |
| "grad_norm": 1.7412115335464478, | |
| "learning_rate": 7.17567269819001e-05, | |
| "logits/chosen": -0.5738805532455444, | |
| "logits/rejected": -0.7051008939743042, | |
| "logps/chosen": -7.830523490905762, | |
| "logps/rejected": -64.7002182006836, | |
| "loss": 0.4786835014820099, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3948074281215668, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3502471446990967, | |
| "rewards/margins": 5.341516017913818, | |
| "rewards/rejected": -4.991268634796143, | |
| "step": 378, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.834698210494389, | |
| "grad_norm": 3.2949538230895996, | |
| "learning_rate": 7.124372858583075e-05, | |
| "logits/chosen": -0.6679587364196777, | |
| "logits/rejected": -0.6492090821266174, | |
| "logps/chosen": -10.784191131591797, | |
| "logps/rejected": -47.8851318359375, | |
| "loss": 0.6186568737030029, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5258687734603882, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.8247672319412231, | |
| "rewards/margins": 4.363984107971191, | |
| "rewards/rejected": -3.5392165184020996, | |
| "step": 379, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8395511070670305, | |
| "grad_norm": 1.7295747995376587, | |
| "learning_rate": 7.073155386323602e-05, | |
| "logits/chosen": -0.5703502893447876, | |
| "logits/rejected": -0.6435679793357849, | |
| "logps/chosen": -4.786211013793945, | |
| "logps/rejected": -64.0704116821289, | |
| "loss": 0.4095216691493988, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31882521510124207, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3547903895378113, | |
| "rewards/margins": 5.545722007751465, | |
| "rewards/rejected": -5.19093132019043, | |
| "step": 380, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8444040036396725, | |
| "grad_norm": 1.6840583086013794, | |
| "learning_rate": 7.022021748447169e-05, | |
| "logits/chosen": -0.649626612663269, | |
| "logits/rejected": -0.560150682926178, | |
| "logps/chosen": -6.373272895812988, | |
| "logps/rejected": -56.86819839477539, | |
| "loss": 0.48045921325683594, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37087392807006836, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11567066609859467, | |
| "rewards/margins": 4.902979850769043, | |
| "rewards/rejected": -4.787309169769287, | |
| "step": 381, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8492569002123143, | |
| "grad_norm": 1.650234341621399, | |
| "learning_rate": 6.970973409588065e-05, | |
| "logits/chosen": -0.5789573192596436, | |
| "logits/rejected": -0.6413402557373047, | |
| "logps/chosen": -5.014113903045654, | |
| "logps/rejected": -65.09786987304688, | |
| "loss": 0.42816442251205444, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35624444484710693, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3604971170425415, | |
| "rewards/margins": 5.791001319885254, | |
| "rewards/rejected": -5.430504322052002, | |
| "step": 382, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.854109796784956, | |
| "grad_norm": 1.8853092193603516, | |
| "learning_rate": 6.920011831937336e-05, | |
| "logits/chosen": -0.5871360898017883, | |
| "logits/rejected": -0.668504536151886, | |
| "logps/chosen": -6.634885787963867, | |
| "logps/rejected": -58.79209518432617, | |
| "loss": 0.5035263299942017, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3908762037754059, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22656232118606567, | |
| "rewards/margins": 4.557960033416748, | |
| "rewards/rejected": -4.331398010253906, | |
| "step": 383, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8589626933575978, | |
| "grad_norm": 1.4440381526947021, | |
| "learning_rate": 6.86913847520091e-05, | |
| "logits/chosen": -0.6340850591659546, | |
| "logits/rejected": -0.5996443629264832, | |
| "logps/chosen": -7.348658561706543, | |
| "logps/rejected": -55.52830123901367, | |
| "loss": 0.413021445274353, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.32434841990470886, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4989248216152191, | |
| "rewards/margins": 4.711764335632324, | |
| "rewards/rejected": -4.212839603424072, | |
| "step": 384, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8638155899302395, | |
| "grad_norm": 2.6543493270874023, | |
| "learning_rate": 6.818354796557773e-05, | |
| "logits/chosen": -0.6379173398017883, | |
| "logits/rejected": -0.707264244556427, | |
| "logps/chosen": -5.950522422790527, | |
| "logps/rejected": -63.79926681518555, | |
| "loss": 0.6506538987159729, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5377727746963501, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.36954978108406067, | |
| "rewards/margins": 5.459112167358398, | |
| "rewards/rejected": -5.08956241607666, | |
| "step": 385, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8686684865028815, | |
| "grad_norm": 20.590307235717773, | |
| "learning_rate": 6.767662250618243e-05, | |
| "logits/chosen": -0.5293274521827698, | |
| "logits/rejected": -0.6586419343948364, | |
| "logps/chosen": -6.335323810577393, | |
| "logps/rejected": -78.02333068847656, | |
| "loss": 0.46748459339141846, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3868253231048584, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3897989094257355, | |
| "rewards/margins": 6.800065040588379, | |
| "rewards/rejected": -6.410265922546387, | |
| "step": 386, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.873521383075523, | |
| "grad_norm": 2.472882032394409, | |
| "learning_rate": 6.717062289382297e-05, | |
| "logits/chosen": -0.5522483587265015, | |
| "logits/rejected": -0.7064594030380249, | |
| "logps/chosen": -5.804100036621094, | |
| "logps/rejected": -64.4820327758789, | |
| "loss": 0.40444841980934143, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.341098815202713, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33708566427230835, | |
| "rewards/margins": 5.492044448852539, | |
| "rewards/rejected": -5.154959201812744, | |
| "step": 387, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.878374279648165, | |
| "grad_norm": 1.2962751388549805, | |
| "learning_rate": 6.666556362197984e-05, | |
| "logits/chosen": -0.5597288608551025, | |
| "logits/rejected": -0.5751113891601562, | |
| "logps/chosen": -6.068740367889404, | |
| "logps/rejected": -54.90497589111328, | |
| "loss": 0.3598553538322449, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30901849269866943, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4880349934101105, | |
| "rewards/margins": 4.9425048828125, | |
| "rewards/rejected": -4.454470157623291, | |
| "step": 388, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8832271762208068, | |
| "grad_norm": 1.4437354803085327, | |
| "learning_rate": 6.616145915719911e-05, | |
| "logits/chosen": -0.5228104591369629, | |
| "logits/rejected": -0.6020510792732239, | |
| "logps/chosen": -9.428549766540527, | |
| "logps/rejected": -60.88127517700195, | |
| "loss": 0.432922899723053, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.38782861828804016, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7320907115936279, | |
| "rewards/margins": 5.48491096496582, | |
| "rewards/rejected": -4.7528204917907715, | |
| "step": 389, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8880800727934486, | |
| "grad_norm": 1.4708114862442017, | |
| "learning_rate": 6.565832393867807e-05, | |
| "logits/chosen": -0.6569843292236328, | |
| "logits/rejected": -0.6164300441741943, | |
| "logps/chosen": -7.9239888191223145, | |
| "logps/rejected": -64.12823486328125, | |
| "loss": 0.42454642057418823, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.39411866664886475, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6901445984840393, | |
| "rewards/margins": 6.002928733825684, | |
| "rewards/rejected": -5.312784194946289, | |
| "step": 390, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.8929329693660903, | |
| "grad_norm": 5.587650775909424, | |
| "learning_rate": 6.515617237785161e-05, | |
| "logits/chosen": -0.5097727179527283, | |
| "logits/rejected": -0.6843152046203613, | |
| "logps/chosen": -5.784012794494629, | |
| "logps/rejected": -80.45916748046875, | |
| "loss": 0.3884187340736389, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3028048276901245, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.26418939232826233, | |
| "rewards/margins": 6.720728874206543, | |
| "rewards/rejected": -6.456539154052734, | |
| "step": 391, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.897785865938732, | |
| "grad_norm": 1.3641635179519653, | |
| "learning_rate": 6.46550188579795e-05, | |
| "logits/chosen": -0.6258033514022827, | |
| "logits/rejected": -0.6140759587287903, | |
| "logps/chosen": -7.939098358154297, | |
| "logps/rejected": -57.6026496887207, | |
| "loss": 0.4729928970336914, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.42656460404396057, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6678609251976013, | |
| "rewards/margins": 5.128674030303955, | |
| "rewards/rejected": -4.460812568664551, | |
| "step": 392, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.902638762511374, | |
| "grad_norm": 1.433518648147583, | |
| "learning_rate": 6.415487773373432e-05, | |
| "logits/chosen": -0.48423802852630615, | |
| "logits/rejected": -0.727780818939209, | |
| "logps/chosen": -5.194042205810547, | |
| "logps/rejected": -76.763427734375, | |
| "loss": 0.3742868900299072, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.32017481327056885, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45845797657966614, | |
| "rewards/margins": 6.453439712524414, | |
| "rewards/rejected": -5.994982719421387, | |
| "step": 393, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9074916590840156, | |
| "grad_norm": 2.0489797592163086, | |
| "learning_rate": 6.365576333079033e-05, | |
| "logits/chosen": -0.5642970204353333, | |
| "logits/rejected": -0.7255823612213135, | |
| "logps/chosen": -5.168341636657715, | |
| "logps/rejected": -62.463470458984375, | |
| "loss": 0.49911901354789734, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3718736171722412, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.34627172350883484, | |
| "rewards/margins": 5.3951239585876465, | |
| "rewards/rejected": -5.048852443695068, | |
| "step": 394, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9123445556566576, | |
| "grad_norm": 13.144484519958496, | |
| "learning_rate": 6.315768994541316e-05, | |
| "logits/chosen": -0.5394759774208069, | |
| "logits/rejected": -0.6262955665588379, | |
| "logps/chosen": -7.741772651672363, | |
| "logps/rejected": -71.7663803100586, | |
| "loss": 0.6049909591674805, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5267656445503235, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6295551061630249, | |
| "rewards/margins": 6.1715874671936035, | |
| "rewards/rejected": -5.5420331954956055, | |
| "step": 395, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9171974522292994, | |
| "grad_norm": 2.6059982776641846, | |
| "learning_rate": 6.26606718440503e-05, | |
| "logits/chosen": -0.5170502662658691, | |
| "logits/rejected": -0.6558076739311218, | |
| "logps/chosen": -6.861051082611084, | |
| "logps/rejected": -72.72247314453125, | |
| "loss": 0.29509392380714417, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2526565194129944, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5151864290237427, | |
| "rewards/margins": 5.9344868659973145, | |
| "rewards/rejected": -5.419300079345703, | |
| "step": 396, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9220503488019411, | |
| "grad_norm": 2.470369338989258, | |
| "learning_rate": 6.21647232629224e-05, | |
| "logits/chosen": -0.5494529008865356, | |
| "logits/rejected": -0.673836886882782, | |
| "logps/chosen": -3.8468756675720215, | |
| "logps/rejected": -61.96172332763672, | |
| "loss": 0.39937981963157654, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3439187705516815, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3373187780380249, | |
| "rewards/margins": 5.420201301574707, | |
| "rewards/rejected": -5.082881927490234, | |
| "step": 397, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.926903245374583, | |
| "grad_norm": 2.0193822383880615, | |
| "learning_rate": 6.166985840761568e-05, | |
| "logits/chosen": -0.5513358116149902, | |
| "logits/rejected": -0.6709374785423279, | |
| "logps/chosen": -8.177743911743164, | |
| "logps/rejected": -60.590641021728516, | |
| "loss": 0.6492336988449097, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5699800848960876, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4450030028820038, | |
| "rewards/margins": 5.057470798492432, | |
| "rewards/rejected": -4.6124677658081055, | |
| "step": 398, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9317561419472247, | |
| "grad_norm": 2.0543642044067383, | |
| "learning_rate": 6.117609145267483e-05, | |
| "logits/chosen": -0.596189558506012, | |
| "logits/rejected": -0.6998448371887207, | |
| "logps/chosen": -5.446857929229736, | |
| "logps/rejected": -73.25975036621094, | |
| "loss": 0.46828165650367737, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3943880796432495, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4068390429019928, | |
| "rewards/margins": 6.468771934509277, | |
| "rewards/rejected": -6.061932563781738, | |
| "step": 399, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9366090385198667, | |
| "grad_norm": 1.6793818473815918, | |
| "learning_rate": 6.068343654119711e-05, | |
| "logits/chosen": -0.5776796936988831, | |
| "logits/rejected": -0.6625195145606995, | |
| "logps/chosen": -8.133685111999512, | |
| "logps/rejected": -73.1596450805664, | |
| "loss": 0.4375830590724945, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35888928174972534, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2760465443134308, | |
| "rewards/margins": 5.986852645874023, | |
| "rewards/rejected": -5.710805892944336, | |
| "step": 400, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 1.9414619350925082, | |
| "grad_norm": 2.238196611404419, | |
| "learning_rate": 6.0191907784427226e-05, | |
| "logits/chosen": -0.6916513442993164, | |
| "logits/rejected": -0.5903735756874084, | |
| "logps/chosen": -7.253473281860352, | |
| "logps/rejected": -50.6401252746582, | |
| "loss": 0.5812284350395203, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4128568172454834, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.28418195247650146, | |
| "rewards/margins": 4.288484573364258, | |
| "rewards/rejected": -4.004302978515625, | |
| "step": 401, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9463148316651502, | |
| "grad_norm": 5.120907783508301, | |
| "learning_rate": 5.970151926135312e-05, | |
| "logits/chosen": -0.5616315007209778, | |
| "logits/rejected": -0.6693225502967834, | |
| "logps/chosen": -7.260046482086182, | |
| "logps/rejected": -52.737152099609375, | |
| "loss": 0.48539096117019653, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41692259907722473, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5142911076545715, | |
| "rewards/margins": 4.516655921936035, | |
| "rewards/rejected": -4.002364635467529, | |
| "step": 402, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.951167728237792, | |
| "grad_norm": 1.697556972503662, | |
| "learning_rate": 5.921228501830273e-05, | |
| "logits/chosen": -0.5886166095733643, | |
| "logits/rejected": -0.5929046869277954, | |
| "logps/chosen": -5.69044303894043, | |
| "logps/rejected": -58.81311798095703, | |
| "loss": 0.3982204496860504, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3054937720298767, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3671545386314392, | |
| "rewards/margins": 4.762682914733887, | |
| "rewards/rejected": -4.395528793334961, | |
| "step": 403, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9560206248104337, | |
| "grad_norm": 1.4293382167816162, | |
| "learning_rate": 5.8724219068541684e-05, | |
| "logits/chosen": -0.5470460653305054, | |
| "logits/rejected": -0.614927351474762, | |
| "logps/chosen": -5.842641830444336, | |
| "logps/rejected": -60.834686279296875, | |
| "loss": 0.32668179273605347, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.27136296033859253, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.759373128414154, | |
| "rewards/margins": 5.15871524810791, | |
| "rewards/rejected": -4.3993425369262695, | |
| "step": 404, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9608735213830755, | |
| "grad_norm": 1.405045747756958, | |
| "learning_rate": 5.823733539187184e-05, | |
| "logits/chosen": -0.5101728439331055, | |
| "logits/rejected": -0.6546907424926758, | |
| "logps/chosen": -5.478858470916748, | |
| "logps/rejected": -74.52674102783203, | |
| "loss": 0.3513491451740265, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2812453806400299, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5197562575340271, | |
| "rewards/margins": 6.233264923095703, | |
| "rewards/rejected": -5.713508605957031, | |
| "step": 405, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 1.9657264179557172, | |
| "grad_norm": 1.8343368768692017, | |
| "learning_rate": 5.775164793423085e-05, | |
| "logits/chosen": -0.6065165996551514, | |
| "logits/rejected": -0.7087149620056152, | |
| "logps/chosen": -6.467832088470459, | |
| "logps/rejected": -62.092350006103516, | |
| "loss": 0.4561832547187805, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3919418454170227, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5326191782951355, | |
| "rewards/margins": 5.569681167602539, | |
| "rewards/rejected": -5.03706169128418, | |
| "step": 406, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 1.9705793145283592, | |
| "grad_norm": 1.5813467502593994, | |
| "learning_rate": 5.726717060729283e-05, | |
| "logits/chosen": -0.5709447264671326, | |
| "logits/rejected": -0.6999301910400391, | |
| "logps/chosen": -5.386603832244873, | |
| "logps/rejected": -58.74079895019531, | |
| "loss": 0.47837477922439575, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.42871785163879395, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30111584067344666, | |
| "rewards/margins": 4.91839075088501, | |
| "rewards/rejected": -4.617275238037109, | |
| "step": 407, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9754322111010008, | |
| "grad_norm": 1.3108994960784912, | |
| "learning_rate": 5.6783917288069824e-05, | |
| "logits/chosen": -0.5694084167480469, | |
| "logits/rejected": -0.6749392747879028, | |
| "logps/chosen": -5.45776891708374, | |
| "logps/rejected": -59.98723220825195, | |
| "loss": 0.41860875487327576, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3364361822605133, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6290720105171204, | |
| "rewards/margins": 5.232394218444824, | |
| "rewards/rejected": -4.6033220291137695, | |
| "step": 408, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9802851076736427, | |
| "grad_norm": 1.2569776773452759, | |
| "learning_rate": 5.63019018185142e-05, | |
| "logits/chosen": -0.5498265027999878, | |
| "logits/rejected": -0.6534051895141602, | |
| "logps/chosen": -5.3643293380737305, | |
| "logps/rejected": -63.33412170410156, | |
| "loss": 0.39089763164520264, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3332664370536804, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45818138122558594, | |
| "rewards/margins": 5.595734596252441, | |
| "rewards/rejected": -5.137552261352539, | |
| "step": 409, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9851380042462845, | |
| "grad_norm": 1.5402867794036865, | |
| "learning_rate": 5.5821138005122276e-05, | |
| "logits/chosen": -0.588860273361206, | |
| "logits/rejected": -0.6495682597160339, | |
| "logps/chosen": -6.2586469650268555, | |
| "logps/rejected": -68.46063232421875, | |
| "loss": 0.36965829133987427, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3286050260066986, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3861139118671417, | |
| "rewards/margins": 5.710513114929199, | |
| "rewards/rejected": -5.324398994445801, | |
| "step": 410, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9899909008189263, | |
| "grad_norm": 15.348603248596191, | |
| "learning_rate": 5.534163961853895e-05, | |
| "logits/chosen": -0.5704806447029114, | |
| "logits/rejected": -0.5746374130249023, | |
| "logps/chosen": -10.46075439453125, | |
| "logps/rejected": -61.404415130615234, | |
| "loss": 0.7037609815597534, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5613011121749878, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.38260629773139954, | |
| "rewards/margins": 5.22413969039917, | |
| "rewards/rejected": -4.8415327072143555, | |
| "step": 411, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9948437973915683, | |
| "grad_norm": 1.2093790769577026, | |
| "learning_rate": 5.486342039316308e-05, | |
| "logits/chosen": -0.5898178219795227, | |
| "logits/rejected": -0.6428400278091431, | |
| "logps/chosen": -9.394416809082031, | |
| "logps/rejected": -69.36016845703125, | |
| "loss": 0.4140172600746155, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3269772231578827, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5661544799804688, | |
| "rewards/margins": 6.253747940063477, | |
| "rewards/rejected": -5.687593460083008, | |
| "step": 412, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 1.9996966939642098, | |
| "grad_norm": 19.901134490966797, | |
| "learning_rate": 5.4386494026754256e-05, | |
| "logits/chosen": -0.5830307006835938, | |
| "logits/rejected": -0.5608057379722595, | |
| "logps/chosen": -8.336356163024902, | |
| "logps/rejected": -54.35915756225586, | |
| "loss": 0.6140868067741394, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5580479502677917, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.35107266902923584, | |
| "rewards/margins": 4.820346355438232, | |
| "rewards/rejected": -4.469273567199707, | |
| "step": 413, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 19.901134490966797, | |
| "learning_rate": 5.3910874180040215e-05, | |
| "logits/chosen": -0.7718560099601746, | |
| "logits/rejected": -0.7857134342193604, | |
| "logps/chosen": -2.6399106979370117, | |
| "logps/rejected": -41.370601654052734, | |
| "loss": 0.04079321399331093, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.5866467952728271, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.13549162447452545, | |
| "rewards/margins": 3.3679678440093994, | |
| "rewards/rejected": -3.232476234436035, | |
| "step": 414, | |
| "train_speed(iter/s)": 0.011256 | |
| }, | |
| { | |
| "epoch": 2.004852896572642, | |
| "grad_norm": 1.7103745937347412, | |
| "learning_rate": 5.343657447632593e-05, | |
| "logits/chosen": -0.6576464176177979, | |
| "logits/rejected": -0.6749541163444519, | |
| "logps/chosen": -4.138018608093262, | |
| "logps/rejected": -56.804466247558594, | |
| "loss": 0.3550814390182495, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2688111662864685, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5430993437767029, | |
| "rewards/margins": 4.9238667488098145, | |
| "rewards/rejected": -4.380766868591309, | |
| "step": 415, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0097057931452835, | |
| "grad_norm": 1.7100054025650024, | |
| "learning_rate": 5.2963608501102914e-05, | |
| "logits/chosen": -0.6248231530189514, | |
| "logits/rejected": -0.5797164440155029, | |
| "logps/chosen": -9.778017044067383, | |
| "logps/rejected": -56.765010833740234, | |
| "loss": 0.4737195670604706, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3435889482498169, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.7175150513648987, | |
| "rewards/margins": 5.213233947753906, | |
| "rewards/rejected": -4.4957194328308105, | |
| "step": 416, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0145586897179255, | |
| "grad_norm": 2.2152140140533447, | |
| "learning_rate": 5.2491989801660524e-05, | |
| "logits/chosen": -0.5175850987434387, | |
| "logits/rejected": -0.6484419107437134, | |
| "logps/chosen": -2.9495556354522705, | |
| "logps/rejected": -58.35166931152344, | |
| "loss": 0.31732234358787537, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24524033069610596, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46936601400375366, | |
| "rewards/margins": 5.002573013305664, | |
| "rewards/rejected": -4.533207416534424, | |
| "step": 417, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.019411586290567, | |
| "grad_norm": 1.1143717765808105, | |
| "learning_rate": 5.2021731886697754e-05, | |
| "logits/chosen": -0.59154212474823, | |
| "logits/rejected": -0.6745224595069885, | |
| "logps/chosen": -3.8427507877349854, | |
| "logps/rejected": -81.35245513916016, | |
| "loss": 0.2931164801120758, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2529327869415283, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.600913405418396, | |
| "rewards/margins": 7.400912761688232, | |
| "rewards/rejected": -6.799999237060547, | |
| "step": 418, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.024264482863209, | |
| "grad_norm": 1.048675298690796, | |
| "learning_rate": 5.155284822593612e-05, | |
| "logits/chosen": -0.6347998380661011, | |
| "logits/rejected": -0.6369694471359253, | |
| "logps/chosen": -3.8031458854675293, | |
| "logps/rejected": -59.46213150024414, | |
| "loss": 0.24725747108459473, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.20662586390972137, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5879597067832947, | |
| "rewards/margins": 5.255596160888672, | |
| "rewards/rejected": -4.667635917663574, | |
| "step": 419, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0291173794358506, | |
| "grad_norm": 1.398929238319397, | |
| "learning_rate": 5.1085352249734206e-05, | |
| "logits/chosen": -0.6476820707321167, | |
| "logits/rejected": -0.6371381282806396, | |
| "logps/chosen": -4.309937477111816, | |
| "logps/rejected": -54.77187728881836, | |
| "loss": 0.39276301860809326, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2665747404098511, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6286377906799316, | |
| "rewards/margins": 5.1919169425964355, | |
| "rewards/rejected": -4.563279151916504, | |
| "step": 420, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0339702760084926, | |
| "grad_norm": 1.9430773258209229, | |
| "learning_rate": 5.061925734870261e-05, | |
| "logits/chosen": -0.568241536617279, | |
| "logits/rejected": -0.6414785981178284, | |
| "logps/chosen": -3.603362560272217, | |
| "logps/rejected": -71.40116882324219, | |
| "loss": 0.2789428234100342, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2381601184606552, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45179325342178345, | |
| "rewards/margins": 6.566485404968262, | |
| "rewards/rejected": -6.114692211151123, | |
| "step": 421, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0388231725811345, | |
| "grad_norm": 1.4404975175857544, | |
| "learning_rate": 5.015457687332068e-05, | |
| "logits/chosen": -0.521833062171936, | |
| "logits/rejected": -0.5258269309997559, | |
| "logps/chosen": -6.85002326965332, | |
| "logps/rejected": -63.62668228149414, | |
| "loss": 0.3955244719982147, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.36709916591644287, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7947784662246704, | |
| "rewards/margins": 5.641209125518799, | |
| "rewards/rejected": -4.846430778503418, | |
| "step": 422, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.043676069153776, | |
| "grad_norm": 1.0905966758728027, | |
| "learning_rate": 4.9691324133554e-05, | |
| "logits/chosen": -0.5340093374252319, | |
| "logits/rejected": -0.7035649418830872, | |
| "logps/chosen": -3.4495232105255127, | |
| "logps/rejected": -70.30438995361328, | |
| "loss": 0.30751505494117737, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2758285701274872, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4122127890586853, | |
| "rewards/margins": 6.187828540802002, | |
| "rewards/rejected": -5.77561616897583, | |
| "step": 423, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.048528965726418, | |
| "grad_norm": 1.8435275554656982, | |
| "learning_rate": 4.922951239847302e-05, | |
| "logits/chosen": -0.62380051612854, | |
| "logits/rejected": -0.6297496557235718, | |
| "logps/chosen": -5.121340274810791, | |
| "logps/rejected": -60.15717315673828, | |
| "loss": 0.2708042860031128, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24423417448997498, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5659652948379517, | |
| "rewards/margins": 5.171314239501953, | |
| "rewards/rejected": -4.605348587036133, | |
| "step": 424, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0533818622990596, | |
| "grad_norm": 1.1041159629821777, | |
| "learning_rate": 4.8769154895873295e-05, | |
| "logits/chosen": -0.6036903858184814, | |
| "logits/rejected": -0.7029792070388794, | |
| "logps/chosen": -3.6619272232055664, | |
| "logps/rejected": -66.3722152709961, | |
| "loss": 0.30501964688301086, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.25918588042259216, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48364874720573425, | |
| "rewards/margins": 5.97569465637207, | |
| "rewards/rejected": -5.492046356201172, | |
| "step": 425, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.0582347588717016, | |
| "grad_norm": 1.1010433435440063, | |
| "learning_rate": 4.831026481189623e-05, | |
| "logits/chosen": -0.5250847339630127, | |
| "logits/rejected": -0.7158811688423157, | |
| "logps/chosen": -4.143977642059326, | |
| "logps/rejected": -66.16500091552734, | |
| "loss": 0.26263052225112915, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23536168038845062, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5593248605728149, | |
| "rewards/margins": 5.607025146484375, | |
| "rewards/rejected": -5.047700881958008, | |
| "step": 426, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.063087655444343, | |
| "grad_norm": 1.154613971710205, | |
| "learning_rate": 4.7852855290651754e-05, | |
| "logits/chosen": -0.5912641286849976, | |
| "logits/rejected": -0.7294796705245972, | |
| "logps/chosen": -3.3604657649993896, | |
| "logps/rejected": -70.48619079589844, | |
| "loss": 0.25948047637939453, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23739154636859894, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41612908244132996, | |
| "rewards/margins": 6.0457916259765625, | |
| "rewards/rejected": -5.629662036895752, | |
| "step": 427, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 2.067940552016985, | |
| "grad_norm": 1.051516056060791, | |
| "learning_rate": 4.7396939433841446e-05, | |
| "logits/chosen": -0.5746322870254517, | |
| "logits/rejected": -0.580484926700592, | |
| "logps/chosen": -3.965383529663086, | |
| "logps/rejected": -70.87100982666016, | |
| "loss": 0.2262018620967865, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.1915430724620819, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7772011756896973, | |
| "rewards/margins": 6.5070319175720215, | |
| "rewards/rejected": -5.729830741882324, | |
| "step": 428, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.072793448589627, | |
| "grad_norm": 1.0563068389892578, | |
| "learning_rate": 4.6942530300383635e-05, | |
| "logits/chosen": -0.5833026766777039, | |
| "logits/rejected": -0.7528508901596069, | |
| "logps/chosen": -2.6754822731018066, | |
| "logps/rejected": -68.6397933959961, | |
| "loss": 0.2472558617591858, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.20797507464885712, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5482291579246521, | |
| "rewards/margins": 6.067309379577637, | |
| "rewards/rejected": -5.51908016204834, | |
| "step": 429, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.0776463451622686, | |
| "grad_norm": 1.131528377532959, | |
| "learning_rate": 4.648964090603913e-05, | |
| "logits/chosen": -0.674924373626709, | |
| "logits/rejected": -0.6664502620697021, | |
| "logps/chosen": -4.549936771392822, | |
| "logps/rejected": -81.32006072998047, | |
| "loss": 0.23375847935676575, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2181502729654312, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.634281575679779, | |
| "rewards/margins": 7.627570152282715, | |
| "rewards/rejected": -6.993288993835449, | |
| "step": 430, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.0824992417349106, | |
| "grad_norm": 1.1656712293624878, | |
| "learning_rate": 4.603828422303836e-05, | |
| "logits/chosen": -0.6664698123931885, | |
| "logits/rejected": -0.765815258026123, | |
| "logps/chosen": -6.197681427001953, | |
| "logps/rejected": -79.1690673828125, | |
| "loss": 0.29951390624046326, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2486487478017807, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6122455596923828, | |
| "rewards/margins": 6.936047077178955, | |
| "rewards/rejected": -6.323802471160889, | |
| "step": 431, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.087352138307552, | |
| "grad_norm": 1.1247355937957764, | |
| "learning_rate": 4.558847317971003e-05, | |
| "logits/chosen": -0.4650381803512573, | |
| "logits/rejected": -0.6967143416404724, | |
| "logps/chosen": -2.8249785900115967, | |
| "logps/rejected": -87.56880187988281, | |
| "loss": 0.19954200088977814, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.18967397511005402, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44147244095802307, | |
| "rewards/margins": 7.568870544433594, | |
| "rewards/rejected": -7.1273980140686035, | |
| "step": 432, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.092205034880194, | |
| "grad_norm": 1.0575859546661377, | |
| "learning_rate": 4.5140220660110563e-05, | |
| "logits/chosen": -0.6105688810348511, | |
| "logits/rejected": -0.7071132063865662, | |
| "logps/chosen": -2.7582192420959473, | |
| "logps/rejected": -82.40766143798828, | |
| "loss": 0.21136504411697388, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.18957176804542542, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6403380036354065, | |
| "rewards/margins": 7.480942726135254, | |
| "rewards/rejected": -6.840604305267334, | |
| "step": 433, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.0970579314528357, | |
| "grad_norm": 1.068354606628418, | |
| "learning_rate": 4.469353950365526e-05, | |
| "logits/chosen": -0.5943747162818909, | |
| "logits/rejected": -0.7755705714225769, | |
| "logps/chosen": -2.567960262298584, | |
| "logps/rejected": -84.9272232055664, | |
| "loss": 0.23424190282821655, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21452906727790833, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43265074491500854, | |
| "rewards/margins": 7.627684116363525, | |
| "rewards/rejected": -7.195033550262451, | |
| "step": 434, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1019108280254777, | |
| "grad_norm": 2.187613010406494, | |
| "learning_rate": 4.424844250475043e-05, | |
| "logits/chosen": -0.5415499806404114, | |
| "logits/rejected": -0.5903127789497375, | |
| "logps/chosen": -5.204537391662598, | |
| "logps/rejected": -75.83631134033203, | |
| "loss": 0.28421807289123535, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.249911367893219, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5597148537635803, | |
| "rewards/margins": 6.775341033935547, | |
| "rewards/rejected": -6.2156267166137695, | |
| "step": 435, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1067637245981197, | |
| "grad_norm": 1.492302417755127, | |
| "learning_rate": 4.3804942412426894e-05, | |
| "logits/chosen": -0.6103017926216125, | |
| "logits/rejected": -0.7948559522628784, | |
| "logps/chosen": -4.872592449188232, | |
| "logps/rejected": -84.67940521240234, | |
| "loss": 0.3622143864631653, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3478931188583374, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4477728009223938, | |
| "rewards/margins": 7.514899253845215, | |
| "rewards/rejected": -7.067126750946045, | |
| "step": 436, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.111616621170761, | |
| "grad_norm": 2.4054040908813477, | |
| "learning_rate": 4.336305192997495e-05, | |
| "logits/chosen": -0.5646602511405945, | |
| "logits/rejected": -0.7334972023963928, | |
| "logps/chosen": -3.899735450744629, | |
| "logps/rejected": -81.83793640136719, | |
| "loss": 0.352499395608902, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30323106050491333, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5049260258674622, | |
| "rewards/margins": 6.938649654388428, | |
| "rewards/rejected": -6.433723449707031, | |
| "step": 437, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.116469517743403, | |
| "grad_norm": 1.6753463745117188, | |
| "learning_rate": 4.292278371458029e-05, | |
| "logits/chosen": -0.5587155818939209, | |
| "logits/rejected": -0.7751632928848267, | |
| "logps/chosen": -5.977566719055176, | |
| "logps/rejected": -75.08719635009766, | |
| "loss": 0.4502590298652649, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.41746312379837036, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45097923278808594, | |
| "rewards/margins": 6.474588871002197, | |
| "rewards/rejected": -6.0236101150512695, | |
| "step": 438, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1213224143160447, | |
| "grad_norm": 1.7224318981170654, | |
| "learning_rate": 4.248415037696172e-05, | |
| "logits/chosen": -0.6733944416046143, | |
| "logits/rejected": -0.7546575665473938, | |
| "logps/chosen": -5.412630558013916, | |
| "logps/rejected": -73.04483795166016, | |
| "loss": 0.29187679290771484, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.27865365147590637, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7158041000366211, | |
| "rewards/margins": 6.534392833709717, | |
| "rewards/rejected": -5.818588733673096, | |
| "step": 439, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1261753108886867, | |
| "grad_norm": 1.2259713411331177, | |
| "learning_rate": 4.204716448100967e-05, | |
| "logits/chosen": -0.6316118240356445, | |
| "logits/rejected": -0.8165422677993774, | |
| "logps/chosen": -1.8100426197052002, | |
| "logps/rejected": -76.30622863769531, | |
| "loss": 0.24028167128562927, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.1524275541305542, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2536695897579193, | |
| "rewards/margins": 6.859058380126953, | |
| "rewards/rejected": -6.605388641357422, | |
| "step": 440, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1310282074613287, | |
| "grad_norm": 1.3491581678390503, | |
| "learning_rate": 4.1611838543426575e-05, | |
| "logits/chosen": -0.6688476800918579, | |
| "logits/rejected": -0.746134877204895, | |
| "logps/chosen": -4.709392070770264, | |
| "logps/rejected": -71.77696990966797, | |
| "loss": 0.3602367639541626, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2859509587287903, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5984158515930176, | |
| "rewards/margins": 6.695918560028076, | |
| "rewards/rejected": -6.0975022315979, | |
| "step": 441, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1358811040339702, | |
| "grad_norm": 1.729594349861145, | |
| "learning_rate": 4.117818503336823e-05, | |
| "logits/chosen": -0.612391471862793, | |
| "logits/rejected": -0.722761332988739, | |
| "logps/chosen": -4.888609886169434, | |
| "logps/rejected": -75.52186584472656, | |
| "loss": 0.29490357637405396, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2540242671966553, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8231287598609924, | |
| "rewards/margins": 6.8504533767700195, | |
| "rewards/rejected": -6.02732515335083, | |
| "step": 442, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1407340006066122, | |
| "grad_norm": 1.8159576654434204, | |
| "learning_rate": 4.0746216372086554e-05, | |
| "logits/chosen": -0.6382140517234802, | |
| "logits/rejected": -0.7934158444404602, | |
| "logps/chosen": -6.1513800621032715, | |
| "logps/rejected": -81.4271011352539, | |
| "loss": 0.414209246635437, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.36056700348854065, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.9469428658485413, | |
| "rewards/margins": 7.889645576477051, | |
| "rewards/rejected": -6.9427032470703125, | |
| "step": 443, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 2.1455868971792538, | |
| "grad_norm": 1.139815092086792, | |
| "learning_rate": 4.031594493257404e-05, | |
| "logits/chosen": -0.574187159538269, | |
| "logits/rejected": -0.7048439979553223, | |
| "logps/chosen": -4.332146167755127, | |
| "logps/rejected": -88.98193359375, | |
| "loss": 0.27797508239746094, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24519619345664978, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44460007548332214, | |
| "rewards/margins": 7.874017238616943, | |
| "rewards/rejected": -7.429418087005615, | |
| "step": 444, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1504397937518958, | |
| "grad_norm": 1.6107572317123413, | |
| "learning_rate": 3.988738303920905e-05, | |
| "logits/chosen": -0.6264583468437195, | |
| "logits/rejected": -0.7592600584030151, | |
| "logps/chosen": -6.279190540313721, | |
| "logps/rejected": -74.63982391357422, | |
| "loss": 0.36384135484695435, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3393724262714386, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7801031470298767, | |
| "rewards/margins": 6.928196430206299, | |
| "rewards/rejected": -6.148093223571777, | |
| "step": 445, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1552926903245373, | |
| "grad_norm": 1.8288161754608154, | |
| "learning_rate": 3.946054296740308e-05, | |
| "logits/chosen": -0.5789830088615417, | |
| "logits/rejected": -0.649995744228363, | |
| "logps/chosen": -4.88557243347168, | |
| "logps/rejected": -68.19690704345703, | |
| "loss": 0.27423524856567383, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22798556089401245, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7776866555213928, | |
| "rewards/margins": 6.230835914611816, | |
| "rewards/rejected": -5.453149318695068, | |
| "step": 446, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1601455868971793, | |
| "grad_norm": 1.3431345224380493, | |
| "learning_rate": 3.9035436943249074e-05, | |
| "logits/chosen": -0.6648738980293274, | |
| "logits/rejected": -0.7525128126144409, | |
| "logps/chosen": -4.117088317871094, | |
| "logps/rejected": -82.5321044921875, | |
| "loss": 0.23675437271595, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2009417712688446, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5036224126815796, | |
| "rewards/margins": 7.469633102416992, | |
| "rewards/rejected": -6.966010570526123, | |
| "step": 447, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1649984834698213, | |
| "grad_norm": 1.1795604228973389, | |
| "learning_rate": 3.861207714317101e-05, | |
| "logits/chosen": -0.6157270669937134, | |
| "logits/rejected": -0.8115067481994629, | |
| "logps/chosen": -3.8770270347595215, | |
| "logps/rejected": -83.44925689697266, | |
| "loss": 0.28868693113327026, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.25425729155540466, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5448073148727417, | |
| "rewards/margins": 7.526980400085449, | |
| "rewards/rejected": -6.98217248916626, | |
| "step": 448, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.169851380042463, | |
| "grad_norm": 1.8656221628189087, | |
| "learning_rate": 3.8190475693575525e-05, | |
| "logits/chosen": -0.630928099155426, | |
| "logits/rejected": -0.7019495964050293, | |
| "logps/chosen": -5.107481956481934, | |
| "logps/rejected": -69.24285888671875, | |
| "loss": 0.3451606333255768, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3133423626422882, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.787118136882782, | |
| "rewards/margins": 6.469849586486816, | |
| "rewards/rejected": -5.682731628417969, | |
| "step": 449, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.174704276615105, | |
| "grad_norm": 1.2469972372055054, | |
| "learning_rate": 3.777064467050415e-05, | |
| "logits/chosen": -0.7220731973648071, | |
| "logits/rejected": -0.5617960691452026, | |
| "logps/chosen": -6.509490013122559, | |
| "logps/rejected": -55.3745002746582, | |
| "loss": 0.28667396306991577, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2628459632396698, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8570376634597778, | |
| "rewards/margins": 5.263401985168457, | |
| "rewards/rejected": -4.4063639640808105, | |
| "step": 450, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1795571731877463, | |
| "grad_norm": 1.1279361248016357, | |
| "learning_rate": 3.735259609928783e-05, | |
| "logits/chosen": -0.5988903045654297, | |
| "logits/rejected": -0.5270404815673828, | |
| "logps/chosen": -5.610360145568848, | |
| "logps/rejected": -66.67525482177734, | |
| "loss": 0.2672625184059143, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23771369457244873, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7778688669204712, | |
| "rewards/margins": 6.522233009338379, | |
| "rewards/rejected": -5.744363307952881, | |
| "step": 451, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.1844100697603883, | |
| "grad_norm": 1.888991355895996, | |
| "learning_rate": 3.693634195420207e-05, | |
| "logits/chosen": -0.5833410024642944, | |
| "logits/rejected": -0.744320809841156, | |
| "logps/chosen": -7.641537666320801, | |
| "logps/rejected": -68.27262115478516, | |
| "loss": 0.4697856307029724, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4046317934989929, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6140312552452087, | |
| "rewards/margins": 5.861536979675293, | |
| "rewards/rejected": -5.247506141662598, | |
| "step": 452, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.18926296633303, | |
| "grad_norm": 1.1562418937683105, | |
| "learning_rate": 3.6521894158124304e-05, | |
| "logits/chosen": -0.5816525220870972, | |
| "logits/rejected": -0.7091232538223267, | |
| "logps/chosen": -6.165643692016602, | |
| "logps/rejected": -85.69442749023438, | |
| "loss": 0.4001867175102234, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3554808795452118, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5184711217880249, | |
| "rewards/margins": 7.9999518394470215, | |
| "rewards/rejected": -7.481479644775391, | |
| "step": 453, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.194115862905672, | |
| "grad_norm": 1.3678451776504517, | |
| "learning_rate": 3.6109264582192204e-05, | |
| "logits/chosen": -0.5466452836990356, | |
| "logits/rejected": -0.5956474542617798, | |
| "logps/chosen": -4.137876987457275, | |
| "logps/rejected": -63.271522521972656, | |
| "loss": 0.3123564124107361, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23659031093120575, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5052592754364014, | |
| "rewards/margins": 5.7905683517456055, | |
| "rewards/rejected": -5.285309314727783, | |
| "step": 454, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.198968759478314, | |
| "grad_norm": 1.3903266191482544, | |
| "learning_rate": 3.5698465045463594e-05, | |
| "logits/chosen": -0.5965472459793091, | |
| "logits/rejected": -0.7013838887214661, | |
| "logps/chosen": -4.56015682220459, | |
| "logps/rejected": -77.71282196044922, | |
| "loss": 0.32230252027511597, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2889389097690582, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6711404323577881, | |
| "rewards/margins": 7.152957916259766, | |
| "rewards/rejected": -6.481818199157715, | |
| "step": 455, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.2038216560509554, | |
| "grad_norm": 1.299912452697754, | |
| "learning_rate": 3.5289507314578144e-05, | |
| "logits/chosen": -0.616992712020874, | |
| "logits/rejected": -0.7047509551048279, | |
| "logps/chosen": -3.682377815246582, | |
| "logps/rejected": -68.11058044433594, | |
| "loss": 0.26603108644485474, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21944132447242737, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5110298991203308, | |
| "rewards/margins": 6.120639801025391, | |
| "rewards/rejected": -5.609610080718994, | |
| "step": 456, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.2086745526235974, | |
| "grad_norm": 1.8810874223709106, | |
| "learning_rate": 3.488240310342004e-05, | |
| "logits/chosen": -0.5876594185829163, | |
| "logits/rejected": -0.6341923475265503, | |
| "logps/chosen": -7.129437446594238, | |
| "logps/rejected": -72.90968322753906, | |
| "loss": 0.40724483132362366, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.38784417510032654, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6922696828842163, | |
| "rewards/margins": 6.4668869972229, | |
| "rewards/rejected": -5.774618148803711, | |
| "step": 457, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 2.213527449196239, | |
| "grad_norm": 1.2393200397491455, | |
| "learning_rate": 3.447716407278274e-05, | |
| "logits/chosen": -0.6355774998664856, | |
| "logits/rejected": -0.6285971403121948, | |
| "logps/chosen": -6.684994697570801, | |
| "logps/rejected": -70.50365447998047, | |
| "loss": 0.35306984186172485, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3040386736392975, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8566898107528687, | |
| "rewards/margins": 6.598665714263916, | |
| "rewards/rejected": -5.741974830627441, | |
| "step": 458, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.218380345768881, | |
| "grad_norm": 1.8380502462387085, | |
| "learning_rate": 3.407380183003476e-05, | |
| "logits/chosen": -0.518718421459198, | |
| "logits/rejected": -0.7331145405769348, | |
| "logps/chosen": -4.08372688293457, | |
| "logps/rejected": -75.85030364990234, | |
| "loss": 0.27920135855674744, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2567867934703827, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8323625326156616, | |
| "rewards/margins": 6.971919536590576, | |
| "rewards/rejected": -6.139556407928467, | |
| "step": 459, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2232332423415224, | |
| "grad_norm": 1.087579369544983, | |
| "learning_rate": 3.367232792878733e-05, | |
| "logits/chosen": -0.539095401763916, | |
| "logits/rejected": -0.6914297938346863, | |
| "logps/chosen": -3.1564764976501465, | |
| "logps/rejected": -77.16769409179688, | |
| "loss": 0.20867927372455597, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.19920367002487183, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6145564913749695, | |
| "rewards/margins": 6.980978488922119, | |
| "rewards/rejected": -6.366422176361084, | |
| "step": 460, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2280861389141644, | |
| "grad_norm": 1.262670874595642, | |
| "learning_rate": 3.3272753868563436e-05, | |
| "logits/chosen": -0.6567162275314331, | |
| "logits/rejected": -0.7439036965370178, | |
| "logps/chosen": -5.618927955627441, | |
| "logps/rejected": -79.2799301147461, | |
| "loss": 0.30224716663360596, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26572662591934204, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5710941553115845, | |
| "rewards/margins": 6.797823429107666, | |
| "rewards/rejected": -6.226728916168213, | |
| "step": 461, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2329390354868064, | |
| "grad_norm": 1.2577284574508667, | |
| "learning_rate": 3.2875091094468326e-05, | |
| "logits/chosen": -0.5661948919296265, | |
| "logits/rejected": -0.6570711135864258, | |
| "logps/chosen": -4.0363616943359375, | |
| "logps/rejected": -77.39669799804688, | |
| "loss": 0.3253019452095032, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2505328059196472, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7372369766235352, | |
| "rewards/margins": 7.21522855758667, | |
| "rewards/rejected": -6.477992057800293, | |
| "step": 462, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.237791932059448, | |
| "grad_norm": 2.986211061477661, | |
| "learning_rate": 3.2479350996861904e-05, | |
| "logits/chosen": -0.4938846826553345, | |
| "logits/rejected": -0.7930436134338379, | |
| "logps/chosen": -4.972700119018555, | |
| "logps/rejected": -98.2266616821289, | |
| "loss": 0.3510643541812897, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3243980407714844, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40329405665397644, | |
| "rewards/margins": 8.57909870147705, | |
| "rewards/rejected": -8.175804138183594, | |
| "step": 463, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.24264482863209, | |
| "grad_norm": 1.2485299110412598, | |
| "learning_rate": 3.2085544911032185e-05, | |
| "logits/chosen": -0.6531729698181152, | |
| "logits/rejected": -0.6215148568153381, | |
| "logps/chosen": -5.742528915405273, | |
| "logps/rejected": -62.864280700683594, | |
| "loss": 0.36156442761421204, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.28394508361816406, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6101444959640503, | |
| "rewards/margins": 5.6347150802612305, | |
| "rewards/rejected": -5.024570465087891, | |
| "step": 464, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2474977252047315, | |
| "grad_norm": 1.4023082256317139, | |
| "learning_rate": 3.1693684116870917e-05, | |
| "logits/chosen": -0.5702226161956787, | |
| "logits/rejected": -0.594810962677002, | |
| "logps/chosen": -7.308235168457031, | |
| "logps/rejected": -77.59276580810547, | |
| "loss": 0.37958383560180664, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.32211926579475403, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7508624792098999, | |
| "rewards/margins": 6.877819538116455, | |
| "rewards/rejected": -6.126956939697266, | |
| "step": 465, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2523506217773734, | |
| "grad_norm": 2.6499226093292236, | |
| "learning_rate": 3.1303779838550305e-05, | |
| "logits/chosen": -0.586449146270752, | |
| "logits/rejected": -0.7023281455039978, | |
| "logps/chosen": -4.720959663391113, | |
| "logps/rejected": -70.30622100830078, | |
| "loss": 0.41410836577415466, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.36013275384902954, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4221152067184448, | |
| "rewards/margins": 6.140308380126953, | |
| "rewards/rejected": -5.718193054199219, | |
| "step": 466, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.257203518350015, | |
| "grad_norm": 1.5963656902313232, | |
| "learning_rate": 3.091584324420148e-05, | |
| "logits/chosen": -0.719754159450531, | |
| "logits/rejected": -0.7114791870117188, | |
| "logps/chosen": -3.162487506866455, | |
| "logps/rejected": -66.79630279541016, | |
| "loss": 0.28990158438682556, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26499366760253906, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6342480182647705, | |
| "rewards/margins": 6.1950225830078125, | |
| "rewards/rejected": -5.560773849487305, | |
| "step": 467, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.262056414922657, | |
| "grad_norm": 1.5152466297149658, | |
| "learning_rate": 3.052988544559481e-05, | |
| "logits/chosen": -0.6474988460540771, | |
| "logits/rejected": -0.765911877155304, | |
| "logps/chosen": -3.883812189102173, | |
| "logps/rejected": -71.20598602294922, | |
| "loss": 0.3200334310531616, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2523345351219177, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4930821359157562, | |
| "rewards/margins": 6.202452659606934, | |
| "rewards/rejected": -5.709371089935303, | |
| "step": 468, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.266909311495299, | |
| "grad_norm": 1.3038029670715332, | |
| "learning_rate": 3.0145917497821353e-05, | |
| "logits/chosen": -0.6062139868736267, | |
| "logits/rejected": -0.6221698522567749, | |
| "logps/chosen": -7.865614414215088, | |
| "logps/rejected": -73.40093994140625, | |
| "loss": 0.4076291024684906, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3660508990287781, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8389542698860168, | |
| "rewards/margins": 6.78849458694458, | |
| "rewards/rejected": -5.949540138244629, | |
| "step": 469, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2717622080679405, | |
| "grad_norm": 1.5724742412567139, | |
| "learning_rate": 2.976395039897649e-05, | |
| "logits/chosen": -0.6632733345031738, | |
| "logits/rejected": -0.7214508056640625, | |
| "logps/chosen": -4.546309471130371, | |
| "logps/rejected": -59.435733795166016, | |
| "loss": 0.3333764374256134, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.30241602659225464, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45513343811035156, | |
| "rewards/margins": 5.376614570617676, | |
| "rewards/rejected": -4.921481609344482, | |
| "step": 470, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2766151046405825, | |
| "grad_norm": 7.230510234832764, | |
| "learning_rate": 2.9383995089844607e-05, | |
| "logits/chosen": -0.5174412727355957, | |
| "logits/rejected": -0.6021267771720886, | |
| "logps/chosen": -6.61854362487793, | |
| "logps/rejected": -73.89866638183594, | |
| "loss": 0.48573341965675354, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.44528844952583313, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6030895709991455, | |
| "rewards/margins": 6.799238681793213, | |
| "rewards/rejected": -6.196148872375488, | |
| "step": 471, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.281468001213224, | |
| "grad_norm": 1.697090983390808, | |
| "learning_rate": 2.900606245358597e-05, | |
| "logits/chosen": -0.5469837188720703, | |
| "logits/rejected": -0.6303236484527588, | |
| "logps/chosen": -4.303004741668701, | |
| "logps/rejected": -64.27133178710938, | |
| "loss": 0.3373926877975464, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26331040263175964, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5473422408103943, | |
| "rewards/margins": 5.771317481994629, | |
| "rewards/rejected": -5.22397518157959, | |
| "step": 472, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.286320897785866, | |
| "grad_norm": 6.686594009399414, | |
| "learning_rate": 2.863016331542492e-05, | |
| "logits/chosen": -0.6710754036903381, | |
| "logits/rejected": -0.6800743341445923, | |
| "logps/chosen": -4.009454727172852, | |
| "logps/rejected": -63.84429168701172, | |
| "loss": 0.32219192385673523, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2701086103916168, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5145846605300903, | |
| "rewards/margins": 5.94988489151001, | |
| "rewards/rejected": -5.435300827026367, | |
| "step": 473, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2911737943585075, | |
| "grad_norm": 2.3082244396209717, | |
| "learning_rate": 2.825630844233963e-05, | |
| "logits/chosen": -0.561713457107544, | |
| "logits/rejected": -0.6025364398956299, | |
| "logps/chosen": -6.1616387367248535, | |
| "logps/rejected": -68.35212707519531, | |
| "loss": 0.3893013894557953, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3033299744129181, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5736039876937866, | |
| "rewards/margins": 5.9543375968933105, | |
| "rewards/rejected": -5.380733966827393, | |
| "step": 474, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.2960266909311495, | |
| "grad_norm": 1.322324514389038, | |
| "learning_rate": 2.7884508542754005e-05, | |
| "logits/chosen": -0.5761018395423889, | |
| "logits/rejected": -0.7665583491325378, | |
| "logps/chosen": -3.493131637573242, | |
| "logps/rejected": -83.15670776367188, | |
| "loss": 0.299123078584671, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2713433802127838, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40203040838241577, | |
| "rewards/margins": 7.464962482452393, | |
| "rewards/rejected": -7.062931537628174, | |
| "step": 475, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.3008795875037915, | |
| "grad_norm": 1.5836275815963745, | |
| "learning_rate": 2.751477426623069e-05, | |
| "logits/chosen": -0.6751578450202942, | |
| "logits/rejected": -0.6575517654418945, | |
| "logps/chosen": -4.7211127281188965, | |
| "logps/rejected": -80.58235931396484, | |
| "loss": 0.2701725959777832, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23246991634368896, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.82881098985672, | |
| "rewards/margins": 7.436627388000488, | |
| "rewards/rejected": -6.607816696166992, | |
| "step": 476, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.305732484076433, | |
| "grad_norm": 1.1231694221496582, | |
| "learning_rate": 2.7147116203166213e-05, | |
| "logits/chosen": -0.7108644247055054, | |
| "logits/rejected": -0.6924277544021606, | |
| "logps/chosen": -5.6986188888549805, | |
| "logps/rejected": -67.3929443359375, | |
| "loss": 0.29998016357421875, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2663887143135071, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7154280543327332, | |
| "rewards/margins": 6.429024696350098, | |
| "rewards/rejected": -5.713595867156982, | |
| "step": 477, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.310585380649075, | |
| "grad_norm": 1.439975380897522, | |
| "learning_rate": 2.6781544884487553e-05, | |
| "logits/chosen": -0.70315021276474, | |
| "logits/rejected": -0.6653990745544434, | |
| "logps/chosen": -4.5957183837890625, | |
| "logps/rejected": -62.12273406982422, | |
| "loss": 0.2995275855064392, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2515711486339569, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5706096887588501, | |
| "rewards/margins": 5.842994689941406, | |
| "rewards/rejected": -5.272385120391846, | |
| "step": 478, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.3154382772217166, | |
| "grad_norm": 1.3081414699554443, | |
| "learning_rate": 2.641807078135048e-05, | |
| "logits/chosen": -0.6237938404083252, | |
| "logits/rejected": -0.7200265526771545, | |
| "logps/chosen": -4.262935161590576, | |
| "logps/rejected": -80.07354736328125, | |
| "loss": 0.24590399861335754, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23250536620616913, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7500859498977661, | |
| "rewards/margins": 7.531890392303467, | |
| "rewards/rejected": -6.781804084777832, | |
| "step": 479, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.3202911737943586, | |
| "grad_norm": 1.1120408773422241, | |
| "learning_rate": 2.6056704304839753e-05, | |
| "logits/chosen": -0.6690621972084045, | |
| "logits/rejected": -0.6809266209602356, | |
| "logps/chosen": -6.932089328765869, | |
| "logps/rejected": -63.18939971923828, | |
| "loss": 0.4045547544956207, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.36685311794281006, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6981146335601807, | |
| "rewards/margins": 5.684694766998291, | |
| "rewards/rejected": -4.986579418182373, | |
| "step": 480, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.325144070367, | |
| "grad_norm": 2.918973684310913, | |
| "learning_rate": 2.56974558056707e-05, | |
| "logits/chosen": -0.6097082495689392, | |
| "logits/rejected": -0.7919716835021973, | |
| "logps/chosen": -3.8928496837615967, | |
| "logps/rejected": -72.72596740722656, | |
| "loss": 0.2936333417892456, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26834753155708313, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7436856031417847, | |
| "rewards/margins": 6.6920270919799805, | |
| "rewards/rejected": -5.948341369628906, | |
| "step": 481, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.329996966939642, | |
| "grad_norm": 1.2894641160964966, | |
| "learning_rate": 2.5340335573892992e-05, | |
| "logits/chosen": -0.6067335605621338, | |
| "logits/rejected": -0.6634172797203064, | |
| "logps/chosen": -4.323107719421387, | |
| "logps/rejected": -76.63206481933594, | |
| "loss": 0.292362242937088, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2741416096687317, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7397990226745605, | |
| "rewards/margins": 6.946049213409424, | |
| "rewards/rejected": -6.2062506675720215, | |
| "step": 482, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.334849863512284, | |
| "grad_norm": 1.3045153617858887, | |
| "learning_rate": 2.498535383859567e-05, | |
| "logits/chosen": -0.6427303552627563, | |
| "logits/rejected": -0.6319226026535034, | |
| "logps/chosen": -4.033558368682861, | |
| "logps/rejected": -53.094970703125, | |
| "loss": 0.27308526635169983, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21971692144870758, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6469345092773438, | |
| "rewards/margins": 4.94242000579834, | |
| "rewards/rejected": -4.295485019683838, | |
| "step": 483, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 2.3397027600849256, | |
| "grad_norm": 1.100091576576233, | |
| "learning_rate": 2.463252076761432e-05, | |
| "logits/chosen": -0.4562618136405945, | |
| "logits/rejected": -0.4926108717918396, | |
| "logps/chosen": -10.018251419067383, | |
| "logps/rejected": -76.7733154296875, | |
| "loss": 0.38205552101135254, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3671962320804596, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 1.0105069875717163, | |
| "rewards/margins": 7.122824668884277, | |
| "rewards/rejected": -6.1123175621032715, | |
| "step": 484, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3445556566575676, | |
| "grad_norm": 1.2113065719604492, | |
| "learning_rate": 2.42818464672398e-05, | |
| "logits/chosen": -0.5199840664863586, | |
| "logits/rejected": -0.6611853837966919, | |
| "logps/chosen": -4.256794452667236, | |
| "logps/rejected": -66.3099594116211, | |
| "loss": 0.25264662504196167, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21553239226341248, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.7238807678222656, | |
| "rewards/margins": 5.997700214385986, | |
| "rewards/rejected": -5.273819446563721, | |
| "step": 485, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.349408553230209, | |
| "grad_norm": 1.3507411479949951, | |
| "learning_rate": 2.393334098192861e-05, | |
| "logits/chosen": -0.620098352432251, | |
| "logits/rejected": -0.6651744246482849, | |
| "logps/chosen": -4.321560382843018, | |
| "logps/rejected": -68.92963409423828, | |
| "loss": 0.3379530608654022, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2956015467643738, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6811820268630981, | |
| "rewards/margins": 6.303360462188721, | |
| "rewards/rejected": -5.622178077697754, | |
| "step": 486, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.354261449802851, | |
| "grad_norm": 1.4188830852508545, | |
| "learning_rate": 2.358701429401543e-05, | |
| "logits/chosen": -0.6596326231956482, | |
| "logits/rejected": -0.74278324842453, | |
| "logps/chosen": -5.557445049285889, | |
| "logps/rejected": -76.30393981933594, | |
| "loss": 0.3814314305782318, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.33436375856399536, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7247028350830078, | |
| "rewards/margins": 7.090615749359131, | |
| "rewards/rejected": -6.365912914276123, | |
| "step": 487, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3591143463754927, | |
| "grad_norm": 1.361630916595459, | |
| "learning_rate": 2.3242876323426986e-05, | |
| "logits/chosen": -0.6007675528526306, | |
| "logits/rejected": -0.6027626395225525, | |
| "logps/chosen": -5.9105963706970215, | |
| "logps/rejected": -78.77207946777344, | |
| "loss": 0.3376059830188751, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3192291259765625, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5186867117881775, | |
| "rewards/margins": 6.999545097351074, | |
| "rewards/rejected": -6.480858325958252, | |
| "step": 488, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3639672429481347, | |
| "grad_norm": 1.3891178369522095, | |
| "learning_rate": 2.2900936927398066e-05, | |
| "logits/chosen": -0.5618247985839844, | |
| "logits/rejected": -0.6703006625175476, | |
| "logps/chosen": -4.186057090759277, | |
| "logps/rejected": -81.91600799560547, | |
| "loss": 0.308733195066452, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2652272582054138, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45423176884651184, | |
| "rewards/margins": 7.114677429199219, | |
| "rewards/rejected": -6.660444736480713, | |
| "step": 489, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3688201395207766, | |
| "grad_norm": 1.330357313156128, | |
| "learning_rate": 2.2561205900189063e-05, | |
| "logits/chosen": -0.6231691837310791, | |
| "logits/rejected": -0.6378612518310547, | |
| "logps/chosen": -3.3179421424865723, | |
| "logps/rejected": -60.08818435668945, | |
| "loss": 0.25377383828163147, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2259960025548935, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.693466067314148, | |
| "rewards/margins": 5.677266597747803, | |
| "rewards/rejected": -4.983800888061523, | |
| "step": 490, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.373673036093418, | |
| "grad_norm": 7.891284942626953, | |
| "learning_rate": 2.2223692972805465e-05, | |
| "logits/chosen": -0.47812098264694214, | |
| "logits/rejected": -0.5958016514778137, | |
| "logps/chosen": -5.672540664672852, | |
| "logps/rejected": -69.21145629882812, | |
| "loss": 0.4438927471637726, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.37813857197761536, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6400350332260132, | |
| "rewards/margins": 6.061525821685791, | |
| "rewards/rejected": -5.421490669250488, | |
| "step": 491, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.37852593266606, | |
| "grad_norm": 1.0560330152511597, | |
| "learning_rate": 2.1888407812719213e-05, | |
| "logits/chosen": -0.652582585811615, | |
| "logits/rejected": -0.6849609017372131, | |
| "logps/chosen": -3.9795026779174805, | |
| "logps/rejected": -81.12940979003906, | |
| "loss": 0.26955920457839966, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24579624831676483, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6712239980697632, | |
| "rewards/margins": 7.6322736740112305, | |
| "rewards/rejected": -6.961050033569336, | |
| "step": 492, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3833788292387017, | |
| "grad_norm": 1.080903172492981, | |
| "learning_rate": 2.155536002359163e-05, | |
| "logits/chosen": -0.646990180015564, | |
| "logits/rejected": -0.6402767896652222, | |
| "logps/chosen": -4.045482635498047, | |
| "logps/rejected": -64.47953796386719, | |
| "loss": 0.24721212685108185, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21147200465202332, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7795693874359131, | |
| "rewards/margins": 6.032608509063721, | |
| "rewards/rejected": -5.253039360046387, | |
| "step": 493, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3882317258113437, | |
| "grad_norm": 1.7657544612884521, | |
| "learning_rate": 2.122455914499847e-05, | |
| "logits/chosen": -0.6361933350563049, | |
| "logits/rejected": -0.5889335870742798, | |
| "logps/chosen": -6.925358295440674, | |
| "logps/rejected": -68.10716247558594, | |
| "loss": 0.3637090027332306, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3136679232120514, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.8250202536582947, | |
| "rewards/margins": 6.658473968505859, | |
| "rewards/rejected": -5.833454132080078, | |
| "step": 494, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.3930846223839852, | |
| "grad_norm": 1.281602382659912, | |
| "learning_rate": 2.089601465215667e-05, | |
| "logits/chosen": -0.6201906204223633, | |
| "logits/rejected": -0.7101805210113525, | |
| "logps/chosen": -3.0874547958374023, | |
| "logps/rejected": -63.684532165527344, | |
| "loss": 0.2674156129360199, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2146831899881363, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4494803547859192, | |
| "rewards/margins": 5.8777337074279785, | |
| "rewards/rejected": -5.428253650665283, | |
| "step": 495, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.397937518956627, | |
| "grad_norm": 3.88493275642395, | |
| "learning_rate": 2.0569735955652837e-05, | |
| "logits/chosen": -0.6932687759399414, | |
| "logits/rejected": -0.6651889681816101, | |
| "logps/chosen": -3.7990403175354004, | |
| "logps/rejected": -65.77095794677734, | |
| "loss": 0.2505370080471039, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2302899807691574, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4310615360736847, | |
| "rewards/margins": 6.1071085929870605, | |
| "rewards/rejected": -5.676047325134277, | |
| "step": 496, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.402790415529269, | |
| "grad_norm": 1.1978486776351929, | |
| "learning_rate": 2.024573240117389e-05, | |
| "logits/chosen": -0.4672708511352539, | |
| "logits/rejected": -0.6781721711158752, | |
| "logps/chosen": -5.265255451202393, | |
| "logps/rejected": -86.04757690429688, | |
| "loss": 0.315344899892807, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2749974727630615, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7576773762702942, | |
| "rewards/margins": 7.209413051605225, | |
| "rewards/rejected": -6.4517364501953125, | |
| "step": 497, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.4076433121019107, | |
| "grad_norm": 1.2648472785949707, | |
| "learning_rate": 1.9924013269239116e-05, | |
| "logits/chosen": -0.5999471545219421, | |
| "logits/rejected": -0.6572548151016235, | |
| "logps/chosen": -4.432610511779785, | |
| "logps/rejected": -53.93971252441406, | |
| "loss": 0.29823601245880127, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2568816542625427, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6503888964653015, | |
| "rewards/margins": 4.959167003631592, | |
| "rewards/rejected": -4.308778285980225, | |
| "step": 498, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.4124962086745527, | |
| "grad_norm": 1.1838700771331787, | |
| "learning_rate": 1.960458777493458e-05, | |
| "logits/chosen": -0.6197922825813293, | |
| "logits/rejected": -0.6211436986923218, | |
| "logps/chosen": -4.995461940765381, | |
| "logps/rejected": -65.41806030273438, | |
| "loss": 0.29283180832862854, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24281112849712372, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8721405267715454, | |
| "rewards/margins": 6.260648727416992, | |
| "rewards/rejected": -5.388508319854736, | |
| "step": 499, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.4173491052471943, | |
| "grad_norm": 1.4069000482559204, | |
| "learning_rate": 1.928746506764909e-05, | |
| "logits/chosen": -0.6488434672355652, | |
| "logits/rejected": -0.6510740518569946, | |
| "logps/chosen": -7.472756862640381, | |
| "logps/rejected": -73.92906188964844, | |
| "loss": 0.31848254799842834, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.28204986453056335, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9478404521942139, | |
| "rewards/margins": 6.967720985412598, | |
| "rewards/rejected": -6.019880771636963, | |
| "step": 500, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 2.4173491052471943, | |
| "eval_logits/chosen": -0.6245597004890442, | |
| "eval_logits/rejected": -0.6505962610244751, | |
| "eval_logps/chosen": -8.391451835632324, | |
| "eval_logps/rejected": -66.3331298828125, | |
| "eval_loss": 0.5266422033309937, | |
| "eval_nll_loss": 0.38375306129455566, | |
| "eval_rewards/accuracies": 0.9090909361839294, | |
| "eval_rewards/chosen": 0.26028066873550415, | |
| "eval_rewards/margins": 5.599364757537842, | |
| "eval_rewards/rejected": -5.339084625244141, | |
| "eval_runtime": 73.3832, | |
| "eval_samples_per_second": 0.899, | |
| "eval_steps_per_second": 0.45, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.4222020018198362, | |
| "grad_norm": 1.263938069343567, | |
| "learning_rate": 1.8972654230812026e-05, | |
| "logits/chosen": -0.5988291501998901, | |
| "logits/rejected": -0.6830064058303833, | |
| "logps/chosen": -2.984997034072876, | |
| "logps/rejected": -66.90113067626953, | |
| "loss": 0.24838778376579285, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22545474767684937, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6021384596824646, | |
| "rewards/margins": 6.096469402313232, | |
| "rewards/rejected": -5.494331359863281, | |
| "step": 501, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.427054898392478, | |
| "grad_norm": 1.2791967391967773, | |
| "learning_rate": 1.8660164281633352e-05, | |
| "logits/chosen": -0.6398135423660278, | |
| "logits/rejected": -0.62666916847229, | |
| "logps/chosen": -4.515021800994873, | |
| "logps/rejected": -68.46668243408203, | |
| "loss": 0.3062646687030792, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26552700996398926, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8389389514923096, | |
| "rewards/margins": 6.339666843414307, | |
| "rewards/rejected": -5.500727653503418, | |
| "step": 502, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.4319077949651198, | |
| "grad_norm": 1.3032886981964111, | |
| "learning_rate": 1.8350004170845136e-05, | |
| "logits/chosen": -0.6431097984313965, | |
| "logits/rejected": -0.7017399668693542, | |
| "logps/chosen": -3.0887632369995117, | |
| "logps/rejected": -74.11160278320312, | |
| "loss": 0.2234165370464325, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.20440611243247986, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46391719579696655, | |
| "rewards/margins": 6.703655242919922, | |
| "rewards/rejected": -6.239737510681152, | |
| "step": 503, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.4367606915377618, | |
| "grad_norm": 1.2653758525848389, | |
| "learning_rate": 1.8042182782445383e-05, | |
| "logits/chosen": -0.5412404537200928, | |
| "logits/rejected": -0.6211848855018616, | |
| "logps/chosen": -4.350437164306641, | |
| "logps/rejected": -64.78961181640625, | |
| "loss": 0.28720590472221375, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.20788416266441345, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8469313383102417, | |
| "rewards/margins": 5.9930500984191895, | |
| "rewards/rejected": -5.146119117736816, | |
| "step": 504, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.4416135881104033, | |
| "grad_norm": 1.2140146493911743, | |
| "learning_rate": 1.7736708933443336e-05, | |
| "logits/chosen": -0.5879851579666138, | |
| "logits/rejected": -0.696338415145874, | |
| "logps/chosen": -3.454037666320801, | |
| "logps/rejected": -67.06798553466797, | |
| "loss": 0.30861765146255493, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24386748671531677, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6034155488014221, | |
| "rewards/margins": 6.013645172119141, | |
| "rewards/rejected": -5.410229206085205, | |
| "step": 505, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.4464664846830453, | |
| "grad_norm": 1.0971474647521973, | |
| "learning_rate": 1.7433591373607128e-05, | |
| "logits/chosen": -0.5175135135650635, | |
| "logits/rejected": -0.6727510690689087, | |
| "logps/chosen": -4.643450736999512, | |
| "logps/rejected": -78.39659881591797, | |
| "loss": 0.24435929954051971, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22019843757152557, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9445281624794006, | |
| "rewards/margins": 7.022038459777832, | |
| "rewards/rejected": -6.077510833740234, | |
| "step": 506, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.451319381255687, | |
| "grad_norm": 1.5399696826934814, | |
| "learning_rate": 1.713283878521309e-05, | |
| "logits/chosen": -0.5577830076217651, | |
| "logits/rejected": -0.6565651297569275, | |
| "logps/chosen": -6.412364482879639, | |
| "logps/rejected": -85.86710357666016, | |
| "loss": 0.35082387924194336, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3224188983440399, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6681461334228516, | |
| "rewards/margins": 7.556405544281006, | |
| "rewards/rejected": -6.8882598876953125, | |
| "step": 507, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.456172277828329, | |
| "grad_norm": 1.0757454633712769, | |
| "learning_rate": 1.6834459782796975e-05, | |
| "logits/chosen": -0.6026188731193542, | |
| "logits/rejected": -0.7656413316726685, | |
| "logps/chosen": -2.748373508453369, | |
| "logps/rejected": -79.50444793701172, | |
| "loss": 0.2234983742237091, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.17070621252059937, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45764869451522827, | |
| "rewards/margins": 6.994377136230469, | |
| "rewards/rejected": -6.536728858947754, | |
| "step": 508, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.4610251744009704, | |
| "grad_norm": 1.13639497756958, | |
| "learning_rate": 1.653846291290736e-05, | |
| "logits/chosen": -0.4561789631843567, | |
| "logits/rejected": -0.6723291873931885, | |
| "logps/chosen": -3.8757572174072266, | |
| "logps/rejected": -82.55781555175781, | |
| "loss": 0.27448591589927673, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23665347695350647, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6254897117614746, | |
| "rewards/margins": 7.049038410186768, | |
| "rewards/rejected": -6.423548698425293, | |
| "step": 509, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.4658780709736123, | |
| "grad_norm": 1.5579639673233032, | |
| "learning_rate": 1.6244856653860698e-05, | |
| "logits/chosen": -0.5730074644088745, | |
| "logits/rejected": -0.7386057376861572, | |
| "logps/chosen": -3.650538206100464, | |
| "logps/rejected": -80.90959930419922, | |
| "loss": 0.2885248363018036, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2766887843608856, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3508065342903137, | |
| "rewards/margins": 7.294322967529297, | |
| "rewards/rejected": -6.943516254425049, | |
| "step": 510, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.4707309675462543, | |
| "grad_norm": 1.6524419784545898, | |
| "learning_rate": 1.5953649415498615e-05, | |
| "logits/chosen": -0.6207405924797058, | |
| "logits/rejected": -0.6518632173538208, | |
| "logps/chosen": -2.9671497344970703, | |
| "logps/rejected": -65.34343719482422, | |
| "loss": 0.2083687037229538, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.18514777719974518, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6263832449913025, | |
| "rewards/margins": 5.95265007019043, | |
| "rewards/rejected": -5.326266765594482, | |
| "step": 511, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.475583864118896, | |
| "grad_norm": 1.5170190334320068, | |
| "learning_rate": 1.5664849538946956e-05, | |
| "logits/chosen": -0.5624093413352966, | |
| "logits/rejected": -0.636039674282074, | |
| "logps/chosen": -5.128310680389404, | |
| "logps/rejected": -74.0645980834961, | |
| "loss": 0.3078325390815735, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2792140245437622, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7656122446060181, | |
| "rewards/margins": 6.84016227722168, | |
| "rewards/rejected": -6.074550628662109, | |
| "step": 512, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.480436760691538, | |
| "grad_norm": 1.216543436050415, | |
| "learning_rate": 1.5378465296376787e-05, | |
| "logits/chosen": -0.6067565679550171, | |
| "logits/rejected": -0.7403771877288818, | |
| "logps/chosen": -4.511190891265869, | |
| "logps/rejected": -85.67679595947266, | |
| "loss": 0.32774895429611206, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2699936628341675, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.7177954912185669, | |
| "rewards/margins": 7.9194464683532715, | |
| "rewards/rejected": -7.201650619506836, | |
| "step": 513, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.4852896572641794, | |
| "grad_norm": 1.6767792701721191, | |
| "learning_rate": 1.5094504890767613e-05, | |
| "logits/chosen": -0.5079765915870667, | |
| "logits/rejected": -0.6599058508872986, | |
| "logps/chosen": -4.198574542999268, | |
| "logps/rejected": -87.94737243652344, | |
| "loss": 0.26133331656455994, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22318491339683533, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5011770129203796, | |
| "rewards/margins": 7.885378837585449, | |
| "rewards/rejected": -7.384202480316162, | |
| "step": 514, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.4901425538368214, | |
| "grad_norm": 1.326190710067749, | |
| "learning_rate": 1.4812976455672278e-05, | |
| "logits/chosen": -0.6393294930458069, | |
| "logits/rejected": -0.7055521011352539, | |
| "logps/chosen": -3.240469455718994, | |
| "logps/rejected": -57.782073974609375, | |
| "loss": 0.31008535623550415, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22774767875671387, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4847087264060974, | |
| "rewards/margins": 5.150230884552002, | |
| "rewards/rejected": -4.665521621704102, | |
| "step": 515, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.494995450409463, | |
| "grad_norm": 1.579909086227417, | |
| "learning_rate": 1.4533888054984124e-05, | |
| "logits/chosen": -0.6371945142745972, | |
| "logits/rejected": -0.7249441146850586, | |
| "logps/chosen": -3.8241167068481445, | |
| "logps/rejected": -70.08920288085938, | |
| "loss": 0.3598320484161377, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31129947304725647, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6991544365882874, | |
| "rewards/margins": 6.174752235412598, | |
| "rewards/rejected": -5.475598335266113, | |
| "step": 516, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.499848346982105, | |
| "grad_norm": 1.9239884614944458, | |
| "learning_rate": 1.4257247682705831e-05, | |
| "logits/chosen": -0.6705074310302734, | |
| "logits/rejected": -0.717799961566925, | |
| "logps/chosen": -6.6241068840026855, | |
| "logps/rejected": -74.49586486816406, | |
| "loss": 0.3932706117630005, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3469349443912506, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.7798833847045898, | |
| "rewards/margins": 6.881312370300293, | |
| "rewards/rejected": -6.101428031921387, | |
| "step": 517, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.504701243554747, | |
| "grad_norm": 1.750999093055725, | |
| "learning_rate": 1.3983063262720674e-05, | |
| "logits/chosen": -0.7233198285102844, | |
| "logits/rejected": -0.6751686334609985, | |
| "logps/chosen": -3.4001848697662354, | |
| "logps/rejected": -58.414588928222656, | |
| "loss": 0.2905004918575287, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23718759417533875, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6900285482406616, | |
| "rewards/margins": 5.630923271179199, | |
| "rewards/rejected": -4.940895080566406, | |
| "step": 518, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5095541401273884, | |
| "grad_norm": 1.17816960811615, | |
| "learning_rate": 1.3711342648565395e-05, | |
| "logits/chosen": -0.6511246562004089, | |
| "logits/rejected": -0.6315872073173523, | |
| "logps/chosen": -3.8363049030303955, | |
| "logps/rejected": -82.18436431884766, | |
| "loss": 0.27953267097473145, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22049736976623535, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5025582313537598, | |
| "rewards/margins": 7.59553337097168, | |
| "rewards/rejected": -7.09297513961792, | |
| "step": 519, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5144070367000304, | |
| "grad_norm": 1.528738260269165, | |
| "learning_rate": 1.3442093623205244e-05, | |
| "logits/chosen": -0.5284984707832336, | |
| "logits/rejected": -0.5880804061889648, | |
| "logps/chosen": -6.295646667480469, | |
| "logps/rejected": -71.8191909790039, | |
| "loss": 0.3324465751647949, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2943190038204193, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6065807342529297, | |
| "rewards/margins": 6.351663589477539, | |
| "rewards/rejected": -5.745083332061768, | |
| "step": 520, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5192599332726724, | |
| "grad_norm": 1.6091433763504028, | |
| "learning_rate": 1.3175323898811197e-05, | |
| "logits/chosen": -0.685472309589386, | |
| "logits/rejected": -0.6990259885787964, | |
| "logps/chosen": -4.821969509124756, | |
| "logps/rejected": -66.74286651611328, | |
| "loss": 0.3098326325416565, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26654139161109924, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6519781947135925, | |
| "rewards/margins": 6.056249618530273, | |
| "rewards/rejected": -5.404271125793457, | |
| "step": 521, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.524112829845314, | |
| "grad_norm": 5.470762252807617, | |
| "learning_rate": 1.2911041116538846e-05, | |
| "logits/chosen": -0.45411062240600586, | |
| "logits/rejected": -0.6557490825653076, | |
| "logps/chosen": -4.312535285949707, | |
| "logps/rejected": -91.11286926269531, | |
| "loss": 0.3187633752822876, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31130799651145935, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5361497402191162, | |
| "rewards/margins": 8.018531799316406, | |
| "rewards/rejected": -7.482381820678711, | |
| "step": 522, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5289657264179555, | |
| "grad_norm": 1.4774200916290283, | |
| "learning_rate": 1.2649252846309733e-05, | |
| "logits/chosen": -0.6635085940361023, | |
| "logits/rejected": -0.605628490447998, | |
| "logps/chosen": -7.1102447509765625, | |
| "logps/rejected": -74.81694030761719, | |
| "loss": 0.306240439414978, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26569002866744995, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7803066372871399, | |
| "rewards/margins": 7.067170143127441, | |
| "rewards/rejected": -6.286863803863525, | |
| "step": 523, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5338186229905975, | |
| "grad_norm": 1.0488476753234863, | |
| "learning_rate": 1.2389966586594414e-05, | |
| "logits/chosen": -0.5447586178779602, | |
| "logits/rejected": -0.5369805693626404, | |
| "logps/chosen": -3.447723150253296, | |
| "logps/rejected": -88.88944244384766, | |
| "loss": 0.21297568082809448, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.182179793715477, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5839394927024841, | |
| "rewards/margins": 8.098406791687012, | |
| "rewards/rejected": -7.514467239379883, | |
| "step": 524, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5386715195632394, | |
| "grad_norm": 1.0361472368240356, | |
| "learning_rate": 1.2133189764197661e-05, | |
| "logits/chosen": -0.6308922171592712, | |
| "logits/rejected": -0.7404856085777283, | |
| "logps/chosen": -2.784160852432251, | |
| "logps/rejected": -95.75941467285156, | |
| "loss": 0.21578243374824524, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.18099337816238403, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6500582098960876, | |
| "rewards/margins": 8.876696586608887, | |
| "rewards/rejected": -8.226637840270996, | |
| "step": 525, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.543524416135881, | |
| "grad_norm": 1.79173743724823, | |
| "learning_rate": 1.1878929734045818e-05, | |
| "logits/chosen": -0.6110001802444458, | |
| "logits/rejected": -0.6262306571006775, | |
| "logps/chosen": -6.778800964355469, | |
| "logps/rejected": -87.50578308105469, | |
| "loss": 0.30274614691734314, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26720935106277466, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 1.0621232986450195, | |
| "rewards/margins": 8.512027740478516, | |
| "rewards/rejected": -7.449903964996338, | |
| "step": 526, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.548377312708523, | |
| "grad_norm": 2.000715970993042, | |
| "learning_rate": 1.162719377897602e-05, | |
| "logits/chosen": -0.5943518280982971, | |
| "logits/rejected": -0.6359549760818481, | |
| "logps/chosen": -5.562086582183838, | |
| "logps/rejected": -68.6212387084961, | |
| "loss": 0.3447694778442383, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31126195192337036, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6160578727722168, | |
| "rewards/margins": 6.380156993865967, | |
| "rewards/rejected": -5.76409912109375, | |
| "step": 527, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.553230209281165, | |
| "grad_norm": 1.4852534532546997, | |
| "learning_rate": 1.1377989109527742e-05, | |
| "logits/chosen": -0.5011255145072937, | |
| "logits/rejected": -0.7031669020652771, | |
| "logps/chosen": -7.240500450134277, | |
| "logps/rejected": -90.84039306640625, | |
| "loss": 0.39430809020996094, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3423583507537842, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5104676485061646, | |
| "rewards/margins": 7.663325309753418, | |
| "rewards/rejected": -7.152856826782227, | |
| "step": 528, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5580831058538065, | |
| "grad_norm": 1.242391586303711, | |
| "learning_rate": 1.1131322863736093e-05, | |
| "logits/chosen": -0.542841374874115, | |
| "logits/rejected": -0.7170069217681885, | |
| "logps/chosen": -2.369621753692627, | |
| "logps/rejected": -85.62417602539062, | |
| "loss": 0.2668972611427307, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22110672295093536, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4210094213485718, | |
| "rewards/margins": 7.71583366394043, | |
| "rewards/rejected": -7.294824600219727, | |
| "step": 529, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.562936002426448, | |
| "grad_norm": 1.3011131286621094, | |
| "learning_rate": 1.0887202106927486e-05, | |
| "logits/chosen": -0.6600781083106995, | |
| "logits/rejected": -0.6249566674232483, | |
| "logps/chosen": -5.837836742401123, | |
| "logps/rejected": -75.44886779785156, | |
| "loss": 0.2946113646030426, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2741503417491913, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9563972353935242, | |
| "rewards/margins": 7.257170677185059, | |
| "rewards/rejected": -6.300772666931152, | |
| "step": 530, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.56778889899909, | |
| "grad_norm": 1.3871097564697266, | |
| "learning_rate": 1.0645633831517232e-05, | |
| "logits/chosen": -0.5616427659988403, | |
| "logits/rejected": -0.6960521936416626, | |
| "logps/chosen": -3.7587993144989014, | |
| "logps/rejected": -83.2022933959961, | |
| "loss": 0.3260115385055542, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3067921996116638, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7035154104232788, | |
| "rewards/margins": 7.776434421539307, | |
| "rewards/rejected": -7.07291841506958, | |
| "step": 531, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.572641795571732, | |
| "grad_norm": 1.5472198724746704, | |
| "learning_rate": 1.0406624956809197e-05, | |
| "logits/chosen": -0.6853356957435608, | |
| "logits/rejected": -0.6965226531028748, | |
| "logps/chosen": -5.5691118240356445, | |
| "logps/rejected": -73.27023315429688, | |
| "loss": 0.3294845223426819, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2499282956123352, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6833174228668213, | |
| "rewards/margins": 6.747676849365234, | |
| "rewards/rejected": -6.064359664916992, | |
| "step": 532, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5774946921443735, | |
| "grad_norm": 1.2449613809585571, | |
| "learning_rate": 1.0170182328797706e-05, | |
| "logits/chosen": -0.606645941734314, | |
| "logits/rejected": -0.633548378944397, | |
| "logps/chosen": -4.97255802154541, | |
| "logps/rejected": -72.04747009277344, | |
| "loss": 0.2594848573207855, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2443123459815979, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5883159041404724, | |
| "rewards/margins": 6.705166339874268, | |
| "rewards/rejected": -6.11685037612915, | |
| "step": 533, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5823475887170155, | |
| "grad_norm": 1.1566741466522217, | |
| "learning_rate": 9.936312719971364e-06, | |
| "logits/chosen": -0.6987078785896301, | |
| "logits/rejected": -0.6870675683021545, | |
| "logps/chosen": -5.161203384399414, | |
| "logps/rejected": -60.97746658325195, | |
| "loss": 0.28268638253211975, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23964349925518036, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7758079171180725, | |
| "rewards/margins": 5.7517595291137695, | |
| "rewards/rejected": -4.975951194763184, | |
| "step": 534, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5872004852896575, | |
| "grad_norm": 1.7748700380325317, | |
| "learning_rate": 9.705022829119149e-06, | |
| "logits/chosen": -0.6157975792884827, | |
| "logits/rejected": -0.6135507225990295, | |
| "logps/chosen": -5.582276344299316, | |
| "logps/rejected": -80.65266418457031, | |
| "loss": 0.3971032500267029, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.38286298513412476, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7267523407936096, | |
| "rewards/margins": 7.693857669830322, | |
| "rewards/rejected": -6.967105388641357, | |
| "step": 535, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.592053381862299, | |
| "grad_norm": 1.4526790380477905, | |
| "learning_rate": 9.476319281138434e-06, | |
| "logits/chosen": -0.5274029970169067, | |
| "logits/rejected": -0.511991024017334, | |
| "logps/chosen": -5.712172508239746, | |
| "logps/rejected": -73.76600646972656, | |
| "loss": 0.2770354449748993, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2199779897928238, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.9270089864730835, | |
| "rewards/margins": 6.778651237487793, | |
| "rewards/rejected": -5.85164213180542, | |
| "step": 536, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.5969062784349406, | |
| "grad_norm": 1.376893162727356, | |
| "learning_rate": 9.250208626845347e-06, | |
| "logits/chosen": -0.666334867477417, | |
| "logits/rejected": -0.7197456955909729, | |
| "logps/chosen": -4.104304313659668, | |
| "logps/rejected": -67.00099182128906, | |
| "loss": 0.3043120503425598, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.265789270401001, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6462286114692688, | |
| "rewards/margins": 6.2581868171691895, | |
| "rewards/rejected": -5.611958026885986, | |
| "step": 537, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6017591750075826, | |
| "grad_norm": 1.150494933128357, | |
| "learning_rate": 9.026697342787083e-06, | |
| "logits/chosen": -0.4191227853298187, | |
| "logits/rejected": -0.6400511264801025, | |
| "logps/chosen": -4.48159122467041, | |
| "logps/rejected": -87.18013000488281, | |
| "loss": 0.24335730075836182, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22230477631092072, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9204366207122803, | |
| "rewards/margins": 7.774313926696777, | |
| "rewards/rejected": -6.853877067565918, | |
| "step": 538, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6066120715802246, | |
| "grad_norm": 1.1541962623596191, | |
| "learning_rate": 8.80579183105632e-06, | |
| "logits/chosen": -0.4612496793270111, | |
| "logits/rejected": -0.724190354347229, | |
| "logps/chosen": -3.2115061283111572, | |
| "logps/rejected": -90.94115447998047, | |
| "loss": 0.252180278301239, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24034032225608826, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8692710399627686, | |
| "rewards/margins": 8.218337059020996, | |
| "rewards/rejected": -7.349066734313965, | |
| "step": 539, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.611464968152866, | |
| "grad_norm": 1.054308295249939, | |
| "learning_rate": 8.58749841910801e-06, | |
| "logits/chosen": -0.6450219750404358, | |
| "logits/rejected": -0.6790457963943481, | |
| "logps/chosen": -3.768889904022217, | |
| "logps/rejected": -83.36199188232422, | |
| "loss": 0.20920971035957336, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.1725481152534485, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7003928422927856, | |
| "rewards/margins": 7.690936088562012, | |
| "rewards/rejected": -6.990543365478516, | |
| "step": 540, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.616317864725508, | |
| "grad_norm": 1.2990069389343262, | |
| "learning_rate": 8.371823359577924e-06, | |
| "logits/chosen": -0.6696596145629883, | |
| "logits/rejected": -0.6568961143493652, | |
| "logps/chosen": -4.934835910797119, | |
| "logps/rejected": -74.93921661376953, | |
| "loss": 0.29285791516304016, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24631813168525696, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5812507271766663, | |
| "rewards/margins": 7.073369979858398, | |
| "rewards/rejected": -6.492118835449219, | |
| "step": 541, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.62117076129815, | |
| "grad_norm": 1.3262054920196533, | |
| "learning_rate": 8.158772830103766e-06, | |
| "logits/chosen": -0.5888740420341492, | |
| "logits/rejected": -0.7671657204627991, | |
| "logps/chosen": -2.408108949661255, | |
| "logps/rejected": -76.29938507080078, | |
| "loss": 0.23443228006362915, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.17877687513828278, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4497838616371155, | |
| "rewards/margins": 6.6610589027404785, | |
| "rewards/rejected": -6.211275100708008, | |
| "step": 542, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6260236578707916, | |
| "grad_norm": 1.3674209117889404, | |
| "learning_rate": 7.94835293314813e-06, | |
| "logits/chosen": -0.6336026191711426, | |
| "logits/rejected": -0.6717860102653503, | |
| "logps/chosen": -3.7745471000671387, | |
| "logps/rejected": -83.17045593261719, | |
| "loss": 0.2999756336212158, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2512662410736084, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45172563195228577, | |
| "rewards/margins": 7.474765300750732, | |
| "rewards/rejected": -7.0230393409729, | |
| "step": 543, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.630876554443433, | |
| "grad_norm": 1.6633349657058716, | |
| "learning_rate": 7.74056969582363e-06, | |
| "logits/chosen": -0.6119914650917053, | |
| "logits/rejected": -0.6555767059326172, | |
| "logps/chosen": -5.214101791381836, | |
| "logps/rejected": -65.82194519042969, | |
| "loss": 0.38802871108055115, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.35996925830841064, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6504403352737427, | |
| "rewards/margins": 6.15578556060791, | |
| "rewards/rejected": -5.505345344543457, | |
| "step": 544, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.635729451016075, | |
| "grad_norm": 2.7028918266296387, | |
| "learning_rate": 7.535429069720446e-06, | |
| "logits/chosen": -0.5627576112747192, | |
| "logits/rejected": -0.6168221235275269, | |
| "logps/chosen": -3.6882591247558594, | |
| "logps/rejected": -78.04385375976562, | |
| "loss": 0.39260461926460266, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3294668197631836, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5123076438903809, | |
| "rewards/margins": 6.842529296875, | |
| "rewards/rejected": -6.330221652984619, | |
| "step": 545, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.640582347588717, | |
| "grad_norm": 0.9586774706840515, | |
| "learning_rate": 7.332936930735645e-06, | |
| "logits/chosen": -0.6537356376647949, | |
| "logits/rejected": -0.6149921417236328, | |
| "logps/chosen": -4.187732696533203, | |
| "logps/rejected": -69.28356170654297, | |
| "loss": 0.23359212279319763, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.202595055103302, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6548523306846619, | |
| "rewards/margins": 6.59209680557251, | |
| "rewards/rejected": -5.937243938446045, | |
| "step": 546, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6454352441613587, | |
| "grad_norm": 1.0134333372116089, | |
| "learning_rate": 7.133099078905059e-06, | |
| "logits/chosen": -0.6819161176681519, | |
| "logits/rejected": -0.5654838681221008, | |
| "logps/chosen": -6.256715774536133, | |
| "logps/rejected": -61.5181884765625, | |
| "loss": 0.30377814173698425, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2530100643634796, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5411121845245361, | |
| "rewards/margins": 5.765064239501953, | |
| "rewards/rejected": -5.223952293395996, | |
| "step": 547, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6502881407340007, | |
| "grad_norm": 1.21867036819458, | |
| "learning_rate": 6.935921238237031e-06, | |
| "logits/chosen": -0.4909206032752991, | |
| "logits/rejected": -0.6327600479125977, | |
| "logps/chosen": -5.3197784423828125, | |
| "logps/rejected": -82.01422882080078, | |
| "loss": 0.2401219606399536, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21994267404079437, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9529493451118469, | |
| "rewards/margins": 7.428947925567627, | |
| "rewards/rejected": -6.475998878479004, | |
| "step": 548, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6551410373066426, | |
| "grad_norm": 1.7388098239898682, | |
| "learning_rate": 6.741409056548498e-06, | |
| "logits/chosen": -0.5950425267219543, | |
| "logits/rejected": -0.6263363361358643, | |
| "logps/chosen": -7.403132438659668, | |
| "logps/rejected": -72.31837463378906, | |
| "loss": 0.29825326800346375, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.27065610885620117, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5925252437591553, | |
| "rewards/margins": 6.4211955070495605, | |
| "rewards/rejected": -5.828670024871826, | |
| "step": 549, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.659993933879284, | |
| "grad_norm": 1.258311152458191, | |
| "learning_rate": 6.549568105303283e-06, | |
| "logits/chosen": -0.6573214530944824, | |
| "logits/rejected": -0.5716169476509094, | |
| "logps/chosen": -6.566021919250488, | |
| "logps/rejected": -54.28481674194336, | |
| "loss": 0.34059563279151917, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2952244281768799, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.8521791696548462, | |
| "rewards/margins": 5.009435176849365, | |
| "rewards/rejected": -4.157256126403809, | |
| "step": 550, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6648468304519257, | |
| "grad_norm": 1.3572889566421509, | |
| "learning_rate": 6.360403879452348e-06, | |
| "logits/chosen": -0.5853492021560669, | |
| "logits/rejected": -0.6580321192741394, | |
| "logps/chosen": -4.4574127197265625, | |
| "logps/rejected": -72.95016479492188, | |
| "loss": 0.2586040198802948, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24071131646633148, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33485573530197144, | |
| "rewards/margins": 6.350434303283691, | |
| "rewards/rejected": -6.015578746795654, | |
| "step": 551, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6696997270245677, | |
| "grad_norm": 1.001535415649414, | |
| "learning_rate": 6.173921797276594e-06, | |
| "logits/chosen": -0.4845524728298187, | |
| "logits/rejected": -0.7450335025787354, | |
| "logps/chosen": -2.1300714015960693, | |
| "logps/rejected": -101.27091217041016, | |
| "loss": 0.18080495297908783, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.17188967764377594, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8859935998916626, | |
| "rewards/margins": 8.968729019165039, | |
| "rewards/rejected": -8.082735061645508, | |
| "step": 552, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6745526235972097, | |
| "grad_norm": 1.079775333404541, | |
| "learning_rate": 5.990127200231521e-06, | |
| "logits/chosen": -0.6458494663238525, | |
| "logits/rejected": -0.6909027099609375, | |
| "logps/chosen": -3.3572652339935303, | |
| "logps/rejected": -83.99946594238281, | |
| "loss": 0.16723589599132538, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.15566836297512054, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9213991761207581, | |
| "rewards/margins": 8.174687385559082, | |
| "rewards/rejected": -7.253288269042969, | |
| "step": 553, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6794055201698512, | |
| "grad_norm": 1.6464003324508667, | |
| "learning_rate": 5.809025352794295e-06, | |
| "logits/chosen": -0.7148035764694214, | |
| "logits/rejected": -0.7438273429870605, | |
| "logps/chosen": -6.564733982086182, | |
| "logps/rejected": -73.30074310302734, | |
| "loss": 0.367018461227417, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3348327875137329, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 1.1383326053619385, | |
| "rewards/margins": 7.054368495941162, | |
| "rewards/rejected": -5.916035175323486, | |
| "step": 554, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.684258416742493, | |
| "grad_norm": 1.156564474105835, | |
| "learning_rate": 5.630621442312977e-06, | |
| "logits/chosen": -0.6095857620239258, | |
| "logits/rejected": -0.7412688732147217, | |
| "logps/chosen": -3.028287172317505, | |
| "logps/rejected": -79.75489044189453, | |
| "loss": 0.23433054983615875, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21965308487415314, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4976278841495514, | |
| "rewards/margins": 7.210433006286621, | |
| "rewards/rejected": -6.712805271148682, | |
| "step": 555, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.689111313315135, | |
| "grad_norm": 1.285481333732605, | |
| "learning_rate": 5.454920578857847e-06, | |
| "logits/chosen": -0.5876249074935913, | |
| "logits/rejected": -0.6156005859375, | |
| "logps/chosen": -4.672130584716797, | |
| "logps/rejected": -77.4134521484375, | |
| "loss": 0.3000246286392212, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2520310580730438, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6469151377677917, | |
| "rewards/margins": 7.214725971221924, | |
| "rewards/rejected": -6.567811012268066, | |
| "step": 556, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6939642098877767, | |
| "grad_norm": 1.5650440454483032, | |
| "learning_rate": 5.281927795075147e-06, | |
| "logits/chosen": -0.6793171763420105, | |
| "logits/rejected": -0.600409746170044, | |
| "logps/chosen": -4.7508544921875, | |
| "logps/rejected": -63.6263427734375, | |
| "loss": 0.2976361811161041, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2658487856388092, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5067247152328491, | |
| "rewards/margins": 5.866987228393555, | |
| "rewards/rejected": -5.360262870788574, | |
| "step": 557, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.6988171064604187, | |
| "grad_norm": 1.533954381942749, | |
| "learning_rate": 5.111648046042838e-06, | |
| "logits/chosen": -0.6235670447349548, | |
| "logits/rejected": -0.599725604057312, | |
| "logps/chosen": -7.128866672515869, | |
| "logps/rejected": -61.256004333496094, | |
| "loss": 0.4164516031742096, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.365759938955307, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9608311057090759, | |
| "rewards/margins": 5.79639196395874, | |
| "rewards/rejected": -4.8355607986450195, | |
| "step": 558, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7036700030330603, | |
| "grad_norm": 1.4163203239440918, | |
| "learning_rate": 4.944086209128762e-06, | |
| "logits/chosen": -0.6154830455780029, | |
| "logits/rejected": -0.7014257311820984, | |
| "logps/chosen": -3.0960350036621094, | |
| "logps/rejected": -66.363525390625, | |
| "loss": 0.3143976628780365, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2553515136241913, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3277318775653839, | |
| "rewards/margins": 5.919757843017578, | |
| "rewards/rejected": -5.592025279998779, | |
| "step": 559, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7085228996057022, | |
| "grad_norm": 3.145951747894287, | |
| "learning_rate": 4.779247083850813e-06, | |
| "logits/chosen": -0.5868672132492065, | |
| "logits/rejected": -0.682079553604126, | |
| "logps/chosen": -4.701343059539795, | |
| "logps/rejected": -79.12904357910156, | |
| "loss": 0.30399391055107117, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.25830909609794617, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7219226360321045, | |
| "rewards/margins": 7.157114505767822, | |
| "rewards/rejected": -6.4351911544799805, | |
| "step": 560, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.713375796178344, | |
| "grad_norm": 1.0887823104858398, | |
| "learning_rate": 4.6171353917396025e-06, | |
| "logits/chosen": -0.5832952260971069, | |
| "logits/rejected": -0.6455456614494324, | |
| "logps/chosen": -2.9903736114501953, | |
| "logps/rejected": -72.71980285644531, | |
| "loss": 0.22216308116912842, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.19487781822681427, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6730550527572632, | |
| "rewards/margins": 6.637686729431152, | |
| "rewards/rejected": -5.964632034301758, | |
| "step": 561, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7182286927509858, | |
| "grad_norm": 1.0971318483352661, | |
| "learning_rate": 4.457755776203143e-06, | |
| "logits/chosen": -0.5158579349517822, | |
| "logits/rejected": -0.6222469806671143, | |
| "logps/chosen": -5.3845744132995605, | |
| "logps/rejected": -76.79359436035156, | |
| "loss": 0.28452813625335693, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2528444230556488, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6198722124099731, | |
| "rewards/margins": 6.857849597930908, | |
| "rewards/rejected": -6.237977981567383, | |
| "step": 562, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7230815893236278, | |
| "grad_norm": 1.0558278560638428, | |
| "learning_rate": 4.301112802393814e-06, | |
| "logits/chosen": -0.47783035039901733, | |
| "logits/rejected": -0.6842986941337585, | |
| "logps/chosen": -4.336657524108887, | |
| "logps/rejected": -86.71261596679688, | |
| "loss": 0.269113153219223, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23316583037376404, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6362613439559937, | |
| "rewards/margins": 7.899141311645508, | |
| "rewards/rejected": -7.262879848480225, | |
| "step": 563, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7279344858962693, | |
| "grad_norm": 1.4527698755264282, | |
| "learning_rate": 4.147210957077707e-06, | |
| "logits/chosen": -0.49381861090660095, | |
| "logits/rejected": -0.6985749006271362, | |
| "logps/chosen": -3.957543134689331, | |
| "logps/rejected": -75.6917724609375, | |
| "loss": 0.2904997766017914, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.27173855900764465, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43937811255455017, | |
| "rewards/margins": 6.531035423278809, | |
| "rewards/rejected": -6.0916571617126465, | |
| "step": 564, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.7327873824689113, | |
| "grad_norm": 1.2592573165893555, | |
| "learning_rate": 3.9960546485059645e-06, | |
| "logits/chosen": -0.4694216549396515, | |
| "logits/rejected": -0.5996910333633423, | |
| "logps/chosen": -5.795609951019287, | |
| "logps/rejected": -76.38688659667969, | |
| "loss": 0.32609495520591736, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.25437840819358826, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 1.0999343395233154, | |
| "rewards/margins": 7.130618572235107, | |
| "rewards/rejected": -6.030683517456055, | |
| "step": 565, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.737640279041553, | |
| "grad_norm": 1.7845202684402466, | |
| "learning_rate": 3.847648206288679e-06, | |
| "logits/chosen": -0.6614808440208435, | |
| "logits/rejected": -0.6614678502082825, | |
| "logps/chosen": -3.736708641052246, | |
| "logps/rejected": -62.491573333740234, | |
| "loss": 0.3258419930934906, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3071213662624359, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.609050989151001, | |
| "rewards/margins": 6.090709209442139, | |
| "rewards/rejected": -5.481658458709717, | |
| "step": 566, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.742493175614195, | |
| "grad_norm": 1.408831000328064, | |
| "learning_rate": 3.701995881270759e-06, | |
| "logits/chosen": -0.6209757328033447, | |
| "logits/rejected": -0.7135674953460693, | |
| "logps/chosen": -3.4056577682495117, | |
| "logps/rejected": -67.20903778076172, | |
| "loss": 0.3275013267993927, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26725274324417114, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45872312784194946, | |
| "rewards/margins": 6.042834281921387, | |
| "rewards/rejected": -5.584111213684082, | |
| "step": 567, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7473460721868364, | |
| "grad_norm": 1.1358519792556763, | |
| "learning_rate": 3.5591018454101733e-06, | |
| "logits/chosen": -0.6003003120422363, | |
| "logits/rejected": -0.6499158143997192, | |
| "logps/chosen": -5.425545692443848, | |
| "logps/rejected": -80.85736846923828, | |
| "loss": 0.2741672992706299, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2493070811033249, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6840863227844238, | |
| "rewards/margins": 7.286033630371094, | |
| "rewards/rejected": -6.6019463539123535, | |
| "step": 568, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7521989687594783, | |
| "grad_norm": 1.3961986303329468, | |
| "learning_rate": 3.4189701916585658e-06, | |
| "logits/chosen": -0.5912141799926758, | |
| "logits/rejected": -0.6046114563941956, | |
| "logps/chosen": -5.98162317276001, | |
| "logps/rejected": -69.55836486816406, | |
| "loss": 0.3379112780094147, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3042459487915039, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6573737263679504, | |
| "rewards/margins": 6.057140350341797, | |
| "rewards/rejected": -5.399766445159912, | |
| "step": 569, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.7570518653321203, | |
| "grad_norm": 1.1803474426269531, | |
| "learning_rate": 3.2816049338438515e-06, | |
| "logits/chosen": -0.6759913563728333, | |
| "logits/rejected": -0.6377274394035339, | |
| "logps/chosen": -4.227444648742676, | |
| "logps/rejected": -75.10655975341797, | |
| "loss": 0.24658191204071045, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21662141382694244, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.9968286752700806, | |
| "rewards/margins": 7.148850917816162, | |
| "rewards/rejected": -6.152021408081055, | |
| "step": 570, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.761904761904762, | |
| "grad_norm": 1.7335277795791626, | |
| "learning_rate": 3.1470100065554065e-06, | |
| "logits/chosen": -0.5925988554954529, | |
| "logits/rejected": -0.5310141444206238, | |
| "logps/chosen": -5.708135604858398, | |
| "logps/rejected": -62.627197265625, | |
| "loss": 0.375058650970459, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.28614649176597595, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6117146611213684, | |
| "rewards/margins": 5.78903865814209, | |
| "rewards/rejected": -5.177323818206787, | |
| "step": 571, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.766757658477404, | |
| "grad_norm": 1.5135831832885742, | |
| "learning_rate": 3.0151892650312486e-06, | |
| "logits/chosen": -0.4460604786872864, | |
| "logits/rejected": -0.6057941317558289, | |
| "logps/chosen": -5.843016624450684, | |
| "logps/rejected": -85.45220947265625, | |
| "loss": 0.28981560468673706, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.268351674079895, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6125141382217407, | |
| "rewards/margins": 7.521608829498291, | |
| "rewards/rejected": -6.90909481048584, | |
| "step": 572, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.7716105550500454, | |
| "grad_norm": 2.420679807662964, | |
| "learning_rate": 2.8861464850476915e-06, | |
| "logits/chosen": -0.5691827535629272, | |
| "logits/rejected": -0.6603055000305176, | |
| "logps/chosen": -6.756178379058838, | |
| "logps/rejected": -77.78731536865234, | |
| "loss": 0.6143761873245239, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.46434399485588074, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3798247277736664, | |
| "rewards/margins": 6.535775184631348, | |
| "rewards/rejected": -6.155951023101807, | |
| "step": 573, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.7764634516226874, | |
| "grad_norm": 1.787204384803772, | |
| "learning_rate": 2.7598853628111654e-06, | |
| "logits/chosen": -0.6925213932991028, | |
| "logits/rejected": -0.687929630279541, | |
| "logps/chosen": -5.252668857574463, | |
| "logps/rejected": -70.31333923339844, | |
| "loss": 0.28863418102264404, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2660493850708008, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7543946504592896, | |
| "rewards/margins": 6.397459983825684, | |
| "rewards/rejected": -5.643064498901367, | |
| "step": 574, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.781316348195329, | |
| "grad_norm": 1.1583391427993774, | |
| "learning_rate": 2.6364095148523115e-06, | |
| "logits/chosen": -0.6633619070053101, | |
| "logits/rejected": -0.6157128214836121, | |
| "logps/chosen": -4.2213592529296875, | |
| "logps/rejected": -66.35498046875, | |
| "loss": 0.28126227855682373, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22441771626472473, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6379067301750183, | |
| "rewards/margins": 6.419068813323975, | |
| "rewards/rejected": -5.781162261962891, | |
| "step": 575, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.786169244767971, | |
| "grad_norm": 11.637575149536133, | |
| "learning_rate": 2.5157224779224663e-06, | |
| "logits/chosen": -0.5898752808570862, | |
| "logits/rejected": -0.7940924167633057, | |
| "logps/chosen": -3.808439254760742, | |
| "logps/rejected": -88.16741180419922, | |
| "loss": 0.6030371785163879, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.4664407968521118, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4791591167449951, | |
| "rewards/margins": 7.68593692779541, | |
| "rewards/rejected": -7.206778526306152, | |
| "step": 576, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.791022141340613, | |
| "grad_norm": 0.9988016486167908, | |
| "learning_rate": 2.397827708892275e-06, | |
| "logits/chosen": -0.5425560474395752, | |
| "logits/rejected": -0.6762557029724121, | |
| "logps/chosen": -3.099478006362915, | |
| "logps/rejected": -77.6517562866211, | |
| "loss": 0.19713303446769714, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.15968939661979675, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5258162617683411, | |
| "rewards/margins": 6.772641181945801, | |
| "rewards/rejected": -6.246824264526367, | |
| "step": 577, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.7958750379132544, | |
| "grad_norm": 1.1130667924880981, | |
| "learning_rate": 2.2827285846527267e-06, | |
| "logits/chosen": -0.6856554746627808, | |
| "logits/rejected": -0.6484403610229492, | |
| "logps/chosen": -5.102944374084473, | |
| "logps/rejected": -74.56300354003906, | |
| "loss": 0.25943467020988464, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.25173312425613403, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7908580899238586, | |
| "rewards/margins": 7.17742919921875, | |
| "rewards/rejected": -6.386571884155273, | |
| "step": 578, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8007279344858964, | |
| "grad_norm": 1.3540998697280884, | |
| "learning_rate": 2.170428402018454e-06, | |
| "logits/chosen": -0.5527167320251465, | |
| "logits/rejected": -0.6700523495674133, | |
| "logps/chosen": -4.328135013580322, | |
| "logps/rejected": -87.7101821899414, | |
| "loss": 0.29061490297317505, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2609217166900635, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6555958390235901, | |
| "rewards/margins": 8.07041072845459, | |
| "rewards/rejected": -7.414814472198486, | |
| "step": 579, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.805580831058538, | |
| "grad_norm": 1.1067967414855957, | |
| "learning_rate": 2.060930377633208e-06, | |
| "logits/chosen": -0.5161330103874207, | |
| "logits/rejected": -0.6544777154922485, | |
| "logps/chosen": -3.52884578704834, | |
| "logps/rejected": -71.98677825927734, | |
| "loss": 0.2510020434856415, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2291746437549591, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 1.0852431058883667, | |
| "rewards/margins": 6.795363903045654, | |
| "rewards/rejected": -5.710120677947998, | |
| "step": 580, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.81043372763118, | |
| "grad_norm": 0.9963717460632324, | |
| "learning_rate": 1.9542376478778325e-06, | |
| "logits/chosen": -0.43871888518333435, | |
| "logits/rejected": -0.6573876738548279, | |
| "logps/chosen": -3.2459049224853516, | |
| "logps/rejected": -100.56980895996094, | |
| "loss": 0.2473662793636322, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.20325958728790283, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43369534611701965, | |
| "rewards/margins": 8.468315124511719, | |
| "rewards/rejected": -8.03462028503418, | |
| "step": 581, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8152866242038215, | |
| "grad_norm": 1.392749309539795, | |
| "learning_rate": 1.850353268780347e-06, | |
| "logits/chosen": -0.6165626049041748, | |
| "logits/rejected": -0.6160469055175781, | |
| "logps/chosen": -6.996610641479492, | |
| "logps/rejected": -71.03480529785156, | |
| "loss": 0.3443552851676941, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2931034564971924, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6882839202880859, | |
| "rewards/margins": 6.527416229248047, | |
| "rewards/rejected": -5.839132308959961, | |
| "step": 582, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8201395207764635, | |
| "grad_norm": 1.4353554248809814, | |
| "learning_rate": 1.7492802159284504e-06, | |
| "logits/chosen": -0.5443241596221924, | |
| "logits/rejected": -0.6477392911911011, | |
| "logps/chosen": -3.5459916591644287, | |
| "logps/rejected": -70.18553161621094, | |
| "loss": 0.30543196201324463, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2626985013484955, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.44523292779922485, | |
| "rewards/margins": 6.3155364990234375, | |
| "rewards/rejected": -5.870303630828857, | |
| "step": 583, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8249924173491054, | |
| "grad_norm": 4.229792594909668, | |
| "learning_rate": 1.6510213843842993e-06, | |
| "logits/chosen": -0.6439812183380127, | |
| "logits/rejected": -0.6191773414611816, | |
| "logps/chosen": -3.4887168407440186, | |
| "logps/rejected": -67.8311538696289, | |
| "loss": 0.2946528494358063, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.22248035669326782, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.585202693939209, | |
| "rewards/margins": 6.365661144256592, | |
| "rewards/rejected": -5.780457973480225, | |
| "step": 584, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.829845313921747, | |
| "grad_norm": 1.1957576274871826, | |
| "learning_rate": 1.555579588601519e-06, | |
| "logits/chosen": -0.6375803351402283, | |
| "logits/rejected": -0.6728043556213379, | |
| "logps/chosen": -3.231778860092163, | |
| "logps/rejected": -65.84593963623047, | |
| "loss": 0.2873823344707489, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2213016301393509, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3490631580352783, | |
| "rewards/margins": 5.803371429443359, | |
| "rewards/rejected": -5.45430850982666, | |
| "step": 585, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.834698210494389, | |
| "grad_norm": 1.4112876653671265, | |
| "learning_rate": 1.4629575623446912e-06, | |
| "logits/chosen": -0.49536263942718506, | |
| "logits/rejected": -0.6761806011199951, | |
| "logps/chosen": -3.7668538093566895, | |
| "logps/rejected": -75.00050354003906, | |
| "loss": 0.2986650764942169, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.25518423318862915, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6310227513313293, | |
| "rewards/margins": 6.633948802947998, | |
| "rewards/rejected": -6.002926349639893, | |
| "step": 586, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8395511070670305, | |
| "grad_norm": 1.3129956722259521, | |
| "learning_rate": 1.3731579586109488e-06, | |
| "logits/chosen": -0.6105469465255737, | |
| "logits/rejected": -0.7250996232032776, | |
| "logps/chosen": -2.8378262519836426, | |
| "logps/rejected": -66.61893463134766, | |
| "loss": 0.2684396207332611, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23575717210769653, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5389773845672607, | |
| "rewards/margins": 6.062278747558594, | |
| "rewards/rejected": -5.523301124572754, | |
| "step": 587, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8444040036396725, | |
| "grad_norm": 1.4426474571228027, | |
| "learning_rate": 1.2861833495540598e-06, | |
| "logits/chosen": -0.6414166688919067, | |
| "logits/rejected": -0.6822341084480286, | |
| "logps/chosen": -5.342228412628174, | |
| "logps/rejected": -64.44208526611328, | |
| "loss": 0.3522323668003082, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2949366569519043, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7516011595726013, | |
| "rewards/margins": 5.8581862449646, | |
| "rewards/rejected": -5.1065850257873535, | |
| "step": 588, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.849256900212314, | |
| "grad_norm": 1.5711462497711182, | |
| "learning_rate": 1.2020362264107299e-06, | |
| "logits/chosen": -0.7026433348655701, | |
| "logits/rejected": -0.6092592477798462, | |
| "logps/chosen": -5.549158573150635, | |
| "logps/rejected": -74.82679748535156, | |
| "loss": 0.3261924088001251, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2990919053554535, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44334396719932556, | |
| "rewards/margins": 6.824084281921387, | |
| "rewards/rejected": -6.380739688873291, | |
| "step": 589, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.854109796784956, | |
| "grad_norm": 1.2662723064422607, | |
| "learning_rate": 1.1207189994291934e-06, | |
| "logits/chosen": -0.666496992111206, | |
| "logits/rejected": -0.7142549157142639, | |
| "logps/chosen": -3.416738271713257, | |
| "logps/rejected": -74.77567291259766, | |
| "loss": 0.2598741054534912, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.23818902671337128, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6595956087112427, | |
| "rewards/margins": 6.948293685913086, | |
| "rewards/rejected": -6.288697719573975, | |
| "step": 590, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.858962693357598, | |
| "grad_norm": 1.1154190301895142, | |
| "learning_rate": 1.0422339978002794e-06, | |
| "logits/chosen": -0.5692818760871887, | |
| "logits/rejected": -0.6300691962242126, | |
| "logps/chosen": -4.063802719116211, | |
| "logps/rejected": -84.52105712890625, | |
| "loss": 0.2750423550605774, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24334850907325745, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7736673951148987, | |
| "rewards/margins": 7.891201019287109, | |
| "rewards/rejected": -7.1175336837768555, | |
| "step": 591, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.8638155899302395, | |
| "grad_norm": 1.5483903884887695, | |
| "learning_rate": 9.665834695905984e-07, | |
| "logits/chosen": -0.5174902081489563, | |
| "logits/rejected": -0.6690682172775269, | |
| "logps/chosen": -6.149733066558838, | |
| "logps/rejected": -78.21675872802734, | |
| "loss": 0.3669990003108978, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.31727883219718933, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.8387702703475952, | |
| "rewards/margins": 7.123826026916504, | |
| "rewards/rejected": -6.285056114196777, | |
| "step": 592, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.8686684865028815, | |
| "grad_norm": 1.2512680292129517, | |
| "learning_rate": 8.937695816782165e-07, | |
| "logits/chosen": -0.6008585095405579, | |
| "logits/rejected": -0.617967963218689, | |
| "logps/chosen": -4.447417259216309, | |
| "logps/rejected": -65.23139190673828, | |
| "loss": 0.3125492334365845, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.2529398798942566, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.710686981678009, | |
| "rewards/margins": 5.968020915985107, | |
| "rewards/rejected": -5.2573347091674805, | |
| "step": 593, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 2.873521383075523, | |
| "grad_norm": 1.3596117496490479, | |
| "learning_rate": 8.237944196905267e-07, | |
| "logits/chosen": -0.6395550966262817, | |
| "logits/rejected": -0.6397189497947693, | |
| "logps/chosen": -4.548499584197998, | |
| "logps/rejected": -68.8891830444336, | |
| "loss": 0.31486326456069946, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.28357455134391785, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7500711679458618, | |
| "rewards/margins": 6.59789514541626, | |
| "rewards/rejected": -5.847823143005371, | |
| "step": 594, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.878374279648165, | |
| "grad_norm": 1.62712562084198, | |
| "learning_rate": 7.566599879445969e-07, | |
| "logits/chosen": -0.5238099694252014, | |
| "logits/rejected": -0.7091976404190063, | |
| "logps/chosen": -4.742247581481934, | |
| "logps/rejected": -75.19202423095703, | |
| "loss": 0.3593892455101013, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3285648226737976, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5222659111022949, | |
| "rewards/margins": 6.4979448318481445, | |
| "rewards/rejected": -5.97567892074585, | |
| "step": 595, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.8832271762208066, | |
| "grad_norm": 1.3156123161315918, | |
| "learning_rate": 6.923682093896599e-07, | |
| "logits/chosen": -0.6918641924858093, | |
| "logits/rejected": -0.7102535963058472, | |
| "logps/chosen": -3.9321398735046387, | |
| "logps/rejected": -62.69544982910156, | |
| "loss": 0.28034743666648865, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24923518300056458, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6051350235939026, | |
| "rewards/margins": 5.7953362464904785, | |
| "rewards/rejected": -5.190201282501221, | |
| "step": 596, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.8880800727934486, | |
| "grad_norm": 1.3201446533203125, | |
| "learning_rate": 6.309209255521142e-07, | |
| "logits/chosen": -0.4450490176677704, | |
| "logits/rejected": -0.6366504430770874, | |
| "logps/chosen": -4.065878868103027, | |
| "logps/rejected": -109.29559326171875, | |
| "loss": 0.23159153759479523, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.21965548396110535, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8024083971977234, | |
| "rewards/margins": 9.651895523071289, | |
| "rewards/rejected": -8.8494873046875, | |
| "step": 597, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.8929329693660906, | |
| "grad_norm": 1.1872270107269287, | |
| "learning_rate": 5.723198964827315e-07, | |
| "logits/chosen": -0.6643305420875549, | |
| "logits/rejected": -0.7629011273384094, | |
| "logps/chosen": -4.642033576965332, | |
| "logps/rejected": -74.26622009277344, | |
| "loss": 0.2887212932109833, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.26376262307167053, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.76788330078125, | |
| "rewards/margins": 6.93171501159668, | |
| "rewards/rejected": -6.16383171081543, | |
| "step": 598, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.897785865938732, | |
| "grad_norm": 1.433158278465271, | |
| "learning_rate": 5.16566800706264e-07, | |
| "logits/chosen": -0.5919219255447388, | |
| "logits/rejected": -0.7172699570655823, | |
| "logps/chosen": -8.425199508666992, | |
| "logps/rejected": -90.48617553710938, | |
| "loss": 0.42298826575279236, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.3865172564983368, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.9087278842926025, | |
| "rewards/margins": 8.40493392944336, | |
| "rewards/rejected": -7.496206283569336, | |
| "step": 599, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 2.902638762511374, | |
| "grad_norm": 1.353162407875061, | |
| "learning_rate": 4.636632351733394e-07, | |
| "logits/chosen": -0.520107626914978, | |
| "logits/rejected": -0.5799854397773743, | |
| "logps/chosen": -5.4928131103515625, | |
| "logps/rejected": -79.27229309082031, | |
| "loss": 0.26224735379219055, | |
| "memory(GiB)": 43.93, | |
| "nll_loss": 0.24353599548339844, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6925230026245117, | |
| "rewards/margins": 6.808859825134277, | |
| "rewards/rejected": -6.116337299346924, | |
| "step": 600, | |
| "train_speed(iter/s)": 0.011227 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 618, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.2279527556120576e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |