Instructions to use cragtmp/2gt5-750 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/2gt5-750 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/2gt5-750") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 600, | |
| "best_metric": 0.30104092, | |
| "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task2_dpo_absgt0_taskgt5__pari0.3_no_cheat/v0-20250606-011515/checkpoint-600", | |
| "epoch": 1.418436778888823, | |
| "eval_steps": 300, | |
| "global_step": 750, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0018933790899946748, | |
| "grad_norm": 12.48285961151123, | |
| "learning_rate": 2.5e-06, | |
| "logits/chosen": -0.600911557674408, | |
| "logits/rejected": -0.6057144403457642, | |
| "logps/chosen": -8.623997688293457, | |
| "logps/rejected": -21.27922248840332, | |
| "loss": 1.5083240270614624, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8151768445968628, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005677 | |
| }, | |
| { | |
| "epoch": 0.0037867581799893497, | |
| "grad_norm": 12.232138633728027, | |
| "learning_rate": 5e-06, | |
| "logits/chosen": -0.6421620845794678, | |
| "logits/rejected": -0.6454498767852783, | |
| "logps/chosen": -10.60006046295166, | |
| "logps/rejected": -13.605328559875488, | |
| "loss": 1.547582983970642, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8544361591339111, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005654 | |
| }, | |
| { | |
| "epoch": 0.005680137269984025, | |
| "grad_norm": 14.417566299438477, | |
| "learning_rate": 7.5e-06, | |
| "logits/chosen": -0.664191484451294, | |
| "logits/rejected": -0.6654082536697388, | |
| "logps/chosen": -11.958788871765137, | |
| "logps/rejected": -13.785713195800781, | |
| "loss": 1.6179333925247192, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.9271513819694519, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.003109893761575222, | |
| "rewards/margins": 0.0048811971209943295, | |
| "rewards/rejected": -0.0017713033594191074, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.007573516359978699, | |
| "grad_norm": 8.840044975280762, | |
| "learning_rate": 1e-05, | |
| "logits/chosen": -0.6362882256507874, | |
| "logits/rejected": -0.6385632753372192, | |
| "logps/chosen": -9.689570426940918, | |
| "logps/rejected": -18.226909637451172, | |
| "loss": 1.4001612663269043, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7101836204528809, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.005959533154964447, | |
| "rewards/margins": 0.00653040548786521, | |
| "rewards/rejected": -0.0005708730313926935, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005654 | |
| }, | |
| { | |
| "epoch": 0.009466895449973374, | |
| "grad_norm": 12.643730163574219, | |
| "learning_rate": 1.25e-05, | |
| "logits/chosen": -0.6108935475349426, | |
| "logits/rejected": -0.6125737428665161, | |
| "logps/chosen": -10.900370597839355, | |
| "logps/rejected": -16.267436981201172, | |
| "loss": 1.5408352613449097, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.853638768196106, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.018230972811579704, | |
| "rewards/margins": 0.01212537381798029, | |
| "rewards/rejected": 0.006105600390583277, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005633 | |
| }, | |
| { | |
| "epoch": 0.01136027453996805, | |
| "grad_norm": 13.595820426940918, | |
| "learning_rate": 1.5e-05, | |
| "logits/chosen": -0.6641858220100403, | |
| "logits/rejected": -0.6705058217048645, | |
| "logps/chosen": -7.528585910797119, | |
| "logps/rejected": -18.073911666870117, | |
| "loss": 1.4404857158660889, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7598920464515686, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.034823305904865265, | |
| "rewards/margins": 0.026311496272683144, | |
| "rewards/rejected": 0.008511810563504696, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005634 | |
| }, | |
| { | |
| "epoch": 0.013253653629962723, | |
| "grad_norm": 13.2615385055542, | |
| "learning_rate": 1.75e-05, | |
| "logits/chosen": -0.6327687501907349, | |
| "logits/rejected": -0.637922465801239, | |
| "logps/chosen": -8.100177764892578, | |
| "logps/rejected": -22.4697322845459, | |
| "loss": 1.310943603515625, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6429428458213806, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07164613902568817, | |
| "rewards/margins": 0.053715869784355164, | |
| "rewards/rejected": 0.017930276691913605, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005641 | |
| }, | |
| { | |
| "epoch": 0.015147032719957399, | |
| "grad_norm": 9.518823623657227, | |
| "learning_rate": 2e-05, | |
| "logits/chosen": -0.6458379626274109, | |
| "logits/rejected": -0.6480465531349182, | |
| "logps/chosen": -8.227258682250977, | |
| "logps/rejected": -15.074575424194336, | |
| "loss": 1.2895722389221191, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6121883392333984, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.11458335816860199, | |
| "rewards/margins": 0.04461951553821564, | |
| "rewards/rejected": 0.06996384263038635, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005657 | |
| }, | |
| { | |
| "epoch": 0.017040411809952073, | |
| "grad_norm": 5.971006393432617, | |
| "learning_rate": 2.25e-05, | |
| "logits/chosen": -0.6322387456893921, | |
| "logits/rejected": -0.6355814933776855, | |
| "logps/chosen": -6.8561859130859375, | |
| "logps/rejected": -16.394319534301758, | |
| "loss": 1.1358637809753418, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4396786093711853, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.126601442694664, | |
| "rewards/margins": 0.027468431740999222, | |
| "rewards/rejected": 0.09913301467895508, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005656 | |
| }, | |
| { | |
| "epoch": 0.018933790899946748, | |
| "grad_norm": 4.615151405334473, | |
| "learning_rate": 2.5e-05, | |
| "logits/chosen": -0.6353996992111206, | |
| "logits/rejected": -0.6420772075653076, | |
| "logps/chosen": -4.39181661605835, | |
| "logps/rejected": -19.73300552368164, | |
| "loss": 0.98687344789505, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38576164841651917, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.196926087141037, | |
| "rewards/margins": 0.274502158164978, | |
| "rewards/rejected": -0.07757607102394104, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005651 | |
| }, | |
| { | |
| "epoch": 0.020827169989941424, | |
| "grad_norm": 3.6985604763031006, | |
| "learning_rate": 2.7500000000000004e-05, | |
| "logits/chosen": -0.6321280002593994, | |
| "logits/rejected": -0.6365548968315125, | |
| "logps/chosen": -7.2246904373168945, | |
| "logps/rejected": -19.404216766357422, | |
| "loss": 0.9879567623138428, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36671119928359985, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.12358222156763077, | |
| "rewards/margins": 0.28244268894195557, | |
| "rewards/rejected": -0.1588604599237442, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005662 | |
| }, | |
| { | |
| "epoch": 0.0227205490799361, | |
| "grad_norm": 7.83486270904541, | |
| "learning_rate": 3e-05, | |
| "logits/chosen": -0.6391905546188354, | |
| "logits/rejected": -0.6451292634010315, | |
| "logps/chosen": -8.3941011428833, | |
| "logps/rejected": -24.687467575073242, | |
| "loss": 1.1386761665344238, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3862188458442688, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.004531089216470718, | |
| "rewards/margins": 0.17587248980998993, | |
| "rewards/rejected": -0.18040357530117035, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005646 | |
| }, | |
| { | |
| "epoch": 0.024613928169930775, | |
| "grad_norm": 5.917618274688721, | |
| "learning_rate": 3.2500000000000004e-05, | |
| "logits/chosen": -0.6517987251281738, | |
| "logits/rejected": -0.658316969871521, | |
| "logps/chosen": -6.573670387268066, | |
| "logps/rejected": -19.874000549316406, | |
| "loss": 1.050663948059082, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.40407559275627136, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.10255793482065201, | |
| "rewards/margins": 0.36497071385383606, | |
| "rewards/rejected": -0.26241275668144226, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.00565 | |
| }, | |
| { | |
| "epoch": 0.026507307259925447, | |
| "grad_norm": 4.1237287521362305, | |
| "learning_rate": 3.5e-05, | |
| "logits/chosen": -0.61805260181427, | |
| "logits/rejected": -0.6224305033683777, | |
| "logps/chosen": -5.8840789794921875, | |
| "logps/rejected": -29.290557861328125, | |
| "loss": 0.9034114480018616, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.33107179403305054, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.13439905643463135, | |
| "rewards/margins": 0.5032773017883301, | |
| "rewards/rejected": -0.36887818574905396, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005633 | |
| }, | |
| { | |
| "epoch": 0.028400686349920122, | |
| "grad_norm": 2.141984701156616, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "logits/chosen": -0.6251233816146851, | |
| "logits/rejected": -0.6291872262954712, | |
| "logps/chosen": -5.3556623458862305, | |
| "logps/rejected": -22.30205535888672, | |
| "loss": 0.7756511569023132, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22363990545272827, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21060410141944885, | |
| "rewards/margins": 0.5203964710235596, | |
| "rewards/rejected": -0.30979233980178833, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005622 | |
| }, | |
| { | |
| "epoch": 0.030294065439914798, | |
| "grad_norm": 6.157620906829834, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.6184762716293335, | |
| "logits/rejected": -0.6184364557266235, | |
| "logps/chosen": -10.368714332580566, | |
| "logps/rejected": -12.033210754394531, | |
| "loss": 1.4029701948165894, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6103286743164062, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.020060203969478607, | |
| "rewards/margins": -0.03359239548444748, | |
| "rewards/rejected": 0.013532169163227081, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.03218744452990947, | |
| "grad_norm": 2.690070152282715, | |
| "learning_rate": 4.25e-05, | |
| "logits/chosen": -0.6329092383384705, | |
| "logits/rejected": -0.6367439031600952, | |
| "logps/chosen": -6.010343551635742, | |
| "logps/rejected": -17.85470199584961, | |
| "loss": 0.8949607610702515, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3054018020629883, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.25051170587539673, | |
| "rewards/margins": 0.37515202164649963, | |
| "rewards/rejected": -0.12464030832052231, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.00562 | |
| }, | |
| { | |
| "epoch": 0.034080823619904145, | |
| "grad_norm": 2.8276467323303223, | |
| "learning_rate": 4.5e-05, | |
| "logits/chosen": -0.6264123320579529, | |
| "logits/rejected": -0.6279273629188538, | |
| "logps/chosen": -9.41238021850586, | |
| "logps/rejected": -18.639442443847656, | |
| "loss": 1.0180559158325195, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3220836818218231, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.1841900646686554, | |
| "rewards/margins": 0.13813874125480652, | |
| "rewards/rejected": 0.04605132341384888, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.035974202709898824, | |
| "grad_norm": 2.10530161857605, | |
| "learning_rate": 4.75e-05, | |
| "logits/chosen": -0.6376557946205139, | |
| "logits/rejected": -0.6416239738464355, | |
| "logps/chosen": -5.7143964767456055, | |
| "logps/rejected": -16.784849166870117, | |
| "loss": 0.9154303669929504, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2545720934867859, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.24181872606277466, | |
| "rewards/margins": 0.18784700334072113, | |
| "rewards/rejected": 0.05397173762321472, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.00562 | |
| }, | |
| { | |
| "epoch": 0.037867581799893496, | |
| "grad_norm": 2.357306480407715, | |
| "learning_rate": 5e-05, | |
| "logits/chosen": -0.6326904296875, | |
| "logits/rejected": -0.6354666352272034, | |
| "logps/chosen": -5.867492198944092, | |
| "logps/rejected": -13.818038940429688, | |
| "loss": 0.9468417167663574, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3124926686286926, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.3217320740222931, | |
| "rewards/margins": 0.22124268114566803, | |
| "rewards/rejected": 0.10048942267894745, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005628 | |
| }, | |
| { | |
| "epoch": 0.039760960889888175, | |
| "grad_norm": 2.5859196186065674, | |
| "learning_rate": 5.25e-05, | |
| "logits/chosen": -0.6597320437431335, | |
| "logits/rejected": -0.6610896587371826, | |
| "logps/chosen": -7.943680286407471, | |
| "logps/rejected": -11.634421348571777, | |
| "loss": 1.0064345598220825, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3732220232486725, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.3646732270717621, | |
| "rewards/margins": 0.21462492644786835, | |
| "rewards/rejected": 0.15004827082157135, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.04165433997988285, | |
| "grad_norm": 2.20487642288208, | |
| "learning_rate": 5.500000000000001e-05, | |
| "logits/chosen": -0.6439244151115417, | |
| "logits/rejected": -0.6464219093322754, | |
| "logps/chosen": -4.180229187011719, | |
| "logps/rejected": -19.56499481201172, | |
| "loss": 0.9136227369308472, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22558730840682983, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.25369688868522644, | |
| "rewards/margins": 0.14792592823505402, | |
| "rewards/rejected": 0.10577096790075302, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.00562 | |
| }, | |
| { | |
| "epoch": 0.04354771906987752, | |
| "grad_norm": 2.80965518951416, | |
| "learning_rate": 5.7499999999999995e-05, | |
| "logits/chosen": -0.5748096108436584, | |
| "logits/rejected": -0.5799225568771362, | |
| "logps/chosen": -5.921882629394531, | |
| "logps/rejected": -22.432538986206055, | |
| "loss": 0.9860997796058655, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3462521731853485, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.24639810621738434, | |
| "rewards/margins": 0.1898707151412964, | |
| "rewards/rejected": 0.05652741342782974, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005621 | |
| }, | |
| { | |
| "epoch": 0.0454410981598722, | |
| "grad_norm": 2.9503355026245117, | |
| "learning_rate": 6e-05, | |
| "logits/chosen": -0.6007645726203918, | |
| "logits/rejected": -0.6086101531982422, | |
| "logps/chosen": -5.338952541351318, | |
| "logps/rejected": -26.883895874023438, | |
| "loss": 0.9453619122505188, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3667706847190857, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.392182856798172, | |
| "rewards/margins": 0.36902523040771484, | |
| "rewards/rejected": 0.02315761335194111, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.04733447724986687, | |
| "grad_norm": 2.2843515872955322, | |
| "learning_rate": 6.25e-05, | |
| "logits/chosen": -0.6047165393829346, | |
| "logits/rejected": -0.608917772769928, | |
| "logps/chosen": -6.276377201080322, | |
| "logps/rejected": -21.095470428466797, | |
| "loss": 0.914051353931427, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3292374610900879, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.3036147356033325, | |
| "rewards/margins": 0.32923099398612976, | |
| "rewards/rejected": -0.025616232305765152, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.04922785633986155, | |
| "grad_norm": 2.7294957637786865, | |
| "learning_rate": 6.500000000000001e-05, | |
| "logits/chosen": -0.6337023377418518, | |
| "logits/rejected": -0.6374361515045166, | |
| "logps/chosen": -7.032902240753174, | |
| "logps/rejected": -24.937816619873047, | |
| "loss": 0.8451516032218933, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25359871983528137, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.24989479780197144, | |
| "rewards/margins": 0.3727536201477051, | |
| "rewards/rejected": -0.12285882234573364, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.05112123542985622, | |
| "grad_norm": 1.9816867113113403, | |
| "learning_rate": 6.750000000000001e-05, | |
| "logits/chosen": -0.6674913167953491, | |
| "logits/rejected": -0.6716790795326233, | |
| "logps/chosen": -3.894029378890991, | |
| "logps/rejected": -19.461292266845703, | |
| "loss": 0.720669686794281, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1943943053483963, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.40334552526474, | |
| "rewards/margins": 0.5223954319953918, | |
| "rewards/rejected": -0.11904986202716827, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.05301461451985089, | |
| "grad_norm": 1.9561638832092285, | |
| "learning_rate": 7e-05, | |
| "logits/chosen": -0.6560395359992981, | |
| "logits/rejected": -0.6615370512008667, | |
| "logps/chosen": -3.828300952911377, | |
| "logps/rejected": -27.646583557128906, | |
| "loss": 0.7324035167694092, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18986308574676514, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2855417728424072, | |
| "rewards/margins": 0.5658388733863831, | |
| "rewards/rejected": -0.28029707074165344, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.05490799360984557, | |
| "grad_norm": 2.197960376739502, | |
| "learning_rate": 7.25e-05, | |
| "logits/chosen": -0.6013461351394653, | |
| "logits/rejected": -0.6078683733940125, | |
| "logps/chosen": -5.841001987457275, | |
| "logps/rejected": -28.59882926940918, | |
| "loss": 0.763361930847168, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29682645201683044, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.33854252099990845, | |
| "rewards/margins": 0.7552333474159241, | |
| "rewards/rejected": -0.416690856218338, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005603 | |
| }, | |
| { | |
| "epoch": 0.056801372699840244, | |
| "grad_norm": 4.102924823760986, | |
| "learning_rate": 7.500000000000001e-05, | |
| "logits/chosen": -0.6362655758857727, | |
| "logits/rejected": -0.6371059417724609, | |
| "logps/chosen": -6.047646522521973, | |
| "logps/rejected": -16.402286529541016, | |
| "loss": 0.930861234664917, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.33219844102859497, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2280413955450058, | |
| "rewards/margins": 0.48401153087615967, | |
| "rewards/rejected": -0.25597015023231506, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005604 | |
| }, | |
| { | |
| "epoch": 0.05869475178983492, | |
| "grad_norm": 2.643806219100952, | |
| "learning_rate": 7.75e-05, | |
| "logits/chosen": -0.6917952299118042, | |
| "logits/rejected": -0.6954830884933472, | |
| "logps/chosen": -4.5008368492126465, | |
| "logps/rejected": -25.313228607177734, | |
| "loss": 0.7698233127593994, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21702390909194946, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2267376184463501, | |
| "rewards/margins": 0.6824056506156921, | |
| "rewards/rejected": -0.4556680917739868, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005603 | |
| }, | |
| { | |
| "epoch": 0.060588130879829595, | |
| "grad_norm": 3.9089903831481934, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.6848002672195435, | |
| "logits/rejected": -0.6877056360244751, | |
| "logps/chosen": -9.047338485717773, | |
| "logps/rejected": -25.891061782836914, | |
| "loss": 0.9844011068344116, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3213033378124237, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.13390681147575378, | |
| "rewards/margins": 0.6111294031143188, | |
| "rewards/rejected": -0.4772225618362427, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005603 | |
| }, | |
| { | |
| "epoch": 0.062481509969824274, | |
| "grad_norm": 3.631053924560547, | |
| "learning_rate": 8.25e-05, | |
| "logits/chosen": -0.6787916421890259, | |
| "logits/rejected": -0.681725025177002, | |
| "logps/chosen": -11.23558521270752, | |
| "logps/rejected": -24.226280212402344, | |
| "loss": 1.1201726198196411, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5571246147155762, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2192046195268631, | |
| "rewards/margins": 0.6016167402267456, | |
| "rewards/rejected": -0.3824121356010437, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.06437488905981895, | |
| "grad_norm": 2.667919158935547, | |
| "learning_rate": 8.5e-05, | |
| "logits/chosen": -0.7005462646484375, | |
| "logits/rejected": -0.7055037021636963, | |
| "logps/chosen": -3.1784541606903076, | |
| "logps/rejected": -23.535545349121094, | |
| "loss": 0.638558566570282, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23515944182872772, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.27606871724128723, | |
| "rewards/margins": 1.0784178972244263, | |
| "rewards/rejected": -0.8023491501808167, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.06626826814981363, | |
| "grad_norm": 4.037520408630371, | |
| "learning_rate": 8.75e-05, | |
| "logits/chosen": -0.7001099586486816, | |
| "logits/rejected": -0.7051636576652527, | |
| "logps/chosen": -6.665594577789307, | |
| "logps/rejected": -30.973716735839844, | |
| "loss": 0.848934531211853, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38612014055252075, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15037909150123596, | |
| "rewards/margins": 1.0571930408477783, | |
| "rewards/rejected": -0.9068138599395752, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.06816164723980829, | |
| "grad_norm": 3.6542232036590576, | |
| "learning_rate": 9e-05, | |
| "logits/chosen": -0.7070563435554504, | |
| "logits/rejected": -0.7053466439247131, | |
| "logps/chosen": -5.064585208892822, | |
| "logps/rejected": -19.19178581237793, | |
| "loss": 0.7724434733390808, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26881077885627747, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2176203727722168, | |
| "rewards/margins": 0.7342812418937683, | |
| "rewards/rejected": -0.5166608095169067, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.07005502632980297, | |
| "grad_norm": 3.4213714599609375, | |
| "learning_rate": 9.250000000000001e-05, | |
| "logits/chosen": -0.7090893387794495, | |
| "logits/rejected": -0.7106159329414368, | |
| "logps/chosen": -10.25515365600586, | |
| "logps/rejected": -24.033281326293945, | |
| "loss": 0.9920384883880615, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.46471139788627625, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0965394526720047, | |
| "rewards/margins": 0.8922154307365417, | |
| "rewards/rejected": -0.7956759929656982, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.07194840541979765, | |
| "grad_norm": 5.325904846191406, | |
| "learning_rate": 9.5e-05, | |
| "logits/chosen": -0.657074511051178, | |
| "logits/rejected": -0.6611977815628052, | |
| "logps/chosen": -11.612046241760254, | |
| "logps/rejected": -27.249744415283203, | |
| "loss": 0.8334037065505981, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3489510715007782, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.12560953199863434, | |
| "rewards/margins": 0.9447187781333923, | |
| "rewards/rejected": -0.819109320640564, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005622 | |
| }, | |
| { | |
| "epoch": 0.07384178450979231, | |
| "grad_norm": 2.9407873153686523, | |
| "learning_rate": 9.75e-05, | |
| "logits/chosen": -0.7148993611335754, | |
| "logits/rejected": -0.7166731357574463, | |
| "logps/chosen": -7.349883079528809, | |
| "logps/rejected": -25.866724014282227, | |
| "loss": 0.7971550822257996, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3317265808582306, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1786963939666748, | |
| "rewards/margins": 0.9361187815666199, | |
| "rewards/rejected": -0.7574224472045898, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005621 | |
| }, | |
| { | |
| "epoch": 0.07573516359978699, | |
| "grad_norm": 7.271725654602051, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.6494594216346741, | |
| "logits/rejected": -0.6519922018051147, | |
| "logps/chosen": -10.921842575073242, | |
| "logps/rejected": -26.213640213012695, | |
| "loss": 1.3029272556304932, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7071102261543274, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04726380109786987, | |
| "rewards/margins": 0.7260035276412964, | |
| "rewards/rejected": -0.6787396669387817, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005622 | |
| }, | |
| { | |
| "epoch": 0.07762854268978167, | |
| "grad_norm": 2.3149876594543457, | |
| "learning_rate": 0.0001025, | |
| "logits/chosen": -0.6998907327651978, | |
| "logits/rejected": -0.7039870023727417, | |
| "logps/chosen": -4.173505783081055, | |
| "logps/rejected": -23.617250442504883, | |
| "loss": 0.5567827224731445, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22731299698352814, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3785739839076996, | |
| "rewards/margins": 1.2282123565673828, | |
| "rewards/rejected": -0.8496384620666504, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.07952192177977635, | |
| "grad_norm": 2.81628155708313, | |
| "learning_rate": 0.000105, | |
| "logits/chosen": -0.7065268754959106, | |
| "logits/rejected": -0.7109476923942566, | |
| "logps/chosen": -7.945868492126465, | |
| "logps/rejected": -28.209381103515625, | |
| "loss": 0.9143926501274109, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45929795503616333, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.14874038100242615, | |
| "rewards/margins": 0.9704731702804565, | |
| "rewards/rejected": -0.8217328786849976, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.08141530086977102, | |
| "grad_norm": 5.763336658477783, | |
| "learning_rate": 0.0001075, | |
| "logits/chosen": -0.6870285868644714, | |
| "logits/rejected": -0.6968757510185242, | |
| "logps/chosen": -5.37760066986084, | |
| "logps/rejected": -30.209644317626953, | |
| "loss": 1.0033479928970337, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5952383279800415, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.25675737857818604, | |
| "rewards/margins": 1.0465596914291382, | |
| "rewards/rejected": -0.7898023128509521, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005627 | |
| }, | |
| { | |
| "epoch": 0.0833086799597657, | |
| "grad_norm": 5.945868015289307, | |
| "learning_rate": 0.00011000000000000002, | |
| "logits/chosen": -0.6680281758308411, | |
| "logits/rejected": -0.6685014963150024, | |
| "logps/chosen": -11.777937889099121, | |
| "logps/rejected": -14.195478439331055, | |
| "loss": 1.2500255107879639, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6744679808616638, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2654823362827301, | |
| "rewards/margins": 0.44828659296035767, | |
| "rewards/rejected": -0.18280424177646637, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005626 | |
| }, | |
| { | |
| "epoch": 0.08520205904976037, | |
| "grad_norm": 3.6887738704681396, | |
| "learning_rate": 0.00011250000000000001, | |
| "logits/chosen": -0.6420993804931641, | |
| "logits/rejected": -0.649295449256897, | |
| "logps/chosen": -5.845967769622803, | |
| "logps/rejected": -29.958538055419922, | |
| "loss": 0.8367453217506409, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.40336742997169495, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.25286757946014404, | |
| "rewards/margins": 0.9195659160614014, | |
| "rewards/rejected": -0.6666983962059021, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005627 | |
| }, | |
| { | |
| "epoch": 0.08709543813975504, | |
| "grad_norm": 2.1550676822662354, | |
| "learning_rate": 0.00011499999999999999, | |
| "logits/chosen": -0.6583084464073181, | |
| "logits/rejected": -0.6640565395355225, | |
| "logps/chosen": -2.7918519973754883, | |
| "logps/rejected": -30.053329467773438, | |
| "loss": 0.6384420394897461, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16433243453502655, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.33078277111053467, | |
| "rewards/margins": 0.8035537004470825, | |
| "rewards/rejected": -0.4727708697319031, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005628 | |
| }, | |
| { | |
| "epoch": 0.08898881722974972, | |
| "grad_norm": 1.9267369508743286, | |
| "learning_rate": 0.00011750000000000001, | |
| "logits/chosen": -0.6443086266517639, | |
| "logits/rejected": -0.6484851837158203, | |
| "logps/chosen": -6.4907331466674805, | |
| "logps/rejected": -26.10548973083496, | |
| "loss": 0.8166890740394592, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2826446294784546, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.33410829305648804, | |
| "rewards/margins": 0.7130259275436401, | |
| "rewards/rejected": -0.3789176642894745, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005627 | |
| }, | |
| { | |
| "epoch": 0.0908821963197444, | |
| "grad_norm": 2.238929510116577, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.6500992774963379, | |
| "logits/rejected": -0.6550747156143188, | |
| "logps/chosen": -6.974908351898193, | |
| "logps/rejected": -25.759687423706055, | |
| "loss": 0.8363897800445557, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26740241050720215, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.2779407501220703, | |
| "rewards/margins": 0.71395343542099, | |
| "rewards/rejected": -0.43601274490356445, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.09277557540973908, | |
| "grad_norm": 2.5497782230377197, | |
| "learning_rate": 0.00012250000000000002, | |
| "logits/chosen": -0.676102876663208, | |
| "logits/rejected": -0.676883339881897, | |
| "logps/chosen": -6.410519599914551, | |
| "logps/rejected": -17.417396545410156, | |
| "loss": 0.9155470728874207, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3170667886734009, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.24874374270439148, | |
| "rewards/margins": 0.6556647419929504, | |
| "rewards/rejected": -0.40692102909088135, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.09466895449973374, | |
| "grad_norm": 2.275879144668579, | |
| "learning_rate": 0.000125, | |
| "logits/chosen": -0.6682412028312683, | |
| "logits/rejected": -0.6694232225418091, | |
| "logps/chosen": -7.84281587600708, | |
| "logps/rejected": -18.11672019958496, | |
| "loss": 0.8602735996246338, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.342671662569046, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.16426895558834076, | |
| "rewards/margins": 0.6373977065086365, | |
| "rewards/rejected": -0.47312870621681213, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.09656233358972842, | |
| "grad_norm": 2.448835611343384, | |
| "learning_rate": 0.0001275, | |
| "logits/chosen": -0.7030003070831299, | |
| "logits/rejected": -0.702628493309021, | |
| "logps/chosen": -7.209776401519775, | |
| "logps/rejected": -24.76384162902832, | |
| "loss": 0.7324039340019226, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22679060697555542, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2451048642396927, | |
| "rewards/margins": 0.9410224556922913, | |
| "rewards/rejected": -0.695917546749115, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.0984557126797231, | |
| "grad_norm": 2.4740657806396484, | |
| "learning_rate": 0.00013000000000000002, | |
| "logits/chosen": -0.7383002042770386, | |
| "logits/rejected": -0.7460674047470093, | |
| "logps/chosen": -4.4354424476623535, | |
| "logps/rejected": -26.271957397460938, | |
| "loss": 0.738042414188385, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30589190125465393, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.35504794120788574, | |
| "rewards/margins": 1.1514215469360352, | |
| "rewards/rejected": -0.7963736057281494, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.10034909176971776, | |
| "grad_norm": 3.1427273750305176, | |
| "learning_rate": 0.0001325, | |
| "logits/chosen": -0.7910199165344238, | |
| "logits/rejected": -0.7956037521362305, | |
| "logps/chosen": -5.2786359786987305, | |
| "logps/rejected": -27.01905632019043, | |
| "loss": 0.7005700469017029, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2977657616138458, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.32858696579933167, | |
| "rewards/margins": 1.1505931615829468, | |
| "rewards/rejected": -0.8220062255859375, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.10224247085971244, | |
| "grad_norm": 2.710829973220825, | |
| "learning_rate": 0.00013500000000000003, | |
| "logits/chosen": -0.7300952672958374, | |
| "logits/rejected": -0.7392382621765137, | |
| "logps/chosen": -4.204522132873535, | |
| "logps/rejected": -35.52387237548828, | |
| "loss": 0.5068414211273193, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18188302218914032, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3228433430194855, | |
| "rewards/margins": 1.5467703342437744, | |
| "rewards/rejected": -1.2239267826080322, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.10413584994970712, | |
| "grad_norm": 2.6672115325927734, | |
| "learning_rate": 0.0001375, | |
| "logits/chosen": -0.7622752785682678, | |
| "logits/rejected": -0.7692346572875977, | |
| "logps/chosen": -5.656646728515625, | |
| "logps/rejected": -36.99287033081055, | |
| "loss": 0.6165193319320679, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2455344796180725, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21251262724399567, | |
| "rewards/margins": 1.7865149974822998, | |
| "rewards/rejected": -1.5740022659301758, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.10602922903970179, | |
| "grad_norm": 7.261322975158691, | |
| "learning_rate": 0.00014, | |
| "logits/chosen": -0.8227823376655579, | |
| "logits/rejected": -0.8353255391120911, | |
| "logps/chosen": -7.420350551605225, | |
| "logps/rejected": -42.59074401855469, | |
| "loss": 0.8744301199913025, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.49042099714279175, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.23873600363731384, | |
| "rewards/margins": 2.152242422103882, | |
| "rewards/rejected": -1.9135063886642456, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.10792260812969647, | |
| "grad_norm": 3.6271088123321533, | |
| "learning_rate": 0.00014250000000000002, | |
| "logits/chosen": -0.8145865201950073, | |
| "logits/rejected": -0.8213882446289062, | |
| "logps/chosen": -4.568179130554199, | |
| "logps/rejected": -37.50999450683594, | |
| "loss": 0.6209616661071777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29730865359306335, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.26820147037506104, | |
| "rewards/margins": 2.114492893218994, | |
| "rewards/rejected": -1.8462913036346436, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.10981598721969114, | |
| "grad_norm": 3.6261045932769775, | |
| "learning_rate": 0.000145, | |
| "logits/chosen": -0.7670393586158752, | |
| "logits/rejected": -0.7794223427772522, | |
| "logps/chosen": -8.460503578186035, | |
| "logps/rejected": -43.186954498291016, | |
| "loss": 0.6528911590576172, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30593881011009216, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.28572511672973633, | |
| "rewards/margins": 2.0398354530334473, | |
| "rewards/rejected": -1.75411057472229, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.11170936630968582, | |
| "grad_norm": 2.79728364944458, | |
| "learning_rate": 0.0001475, | |
| "logits/chosen": -0.8239770531654358, | |
| "logits/rejected": -0.8207590579986572, | |
| "logps/chosen": -12.058256149291992, | |
| "logps/rejected": -25.070674896240234, | |
| "loss": 0.8349239230155945, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4342367947101593, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2961112856864929, | |
| "rewards/margins": 1.2313449382781982, | |
| "rewards/rejected": -0.9352336525917053, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.11360274539968049, | |
| "grad_norm": 3.0574796199798584, | |
| "learning_rate": 0.00015000000000000001, | |
| "logits/chosen": -0.810753345489502, | |
| "logits/rejected": -0.8193599581718445, | |
| "logps/chosen": -5.105385780334473, | |
| "logps/rejected": -29.203344345092773, | |
| "loss": 0.6070073843002319, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24924401938915253, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.5035626292228699, | |
| "rewards/margins": 1.4562283754348755, | |
| "rewards/rejected": -0.9526655077934265, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.11549612448967517, | |
| "grad_norm": 5.350250720977783, | |
| "learning_rate": 0.0001525, | |
| "logits/chosen": -0.815939724445343, | |
| "logits/rejected": -0.826446533203125, | |
| "logps/chosen": -2.3785085678100586, | |
| "logps/rejected": -34.224422454833984, | |
| "loss": 0.7174049019813538, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38427019119262695, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.4009089469909668, | |
| "rewards/margins": 1.891708254814148, | |
| "rewards/rejected": -1.4907994270324707, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.11738950357966985, | |
| "grad_norm": 2.239091157913208, | |
| "learning_rate": 0.000155, | |
| "logits/chosen": -0.8229139447212219, | |
| "logits/rejected": -0.8320141434669495, | |
| "logps/chosen": -4.586618900299072, | |
| "logps/rejected": -32.01433181762695, | |
| "loss": 0.6079644560813904, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20739667117595673, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26031073927879333, | |
| "rewards/margins": 1.4821346998214722, | |
| "rewards/rejected": -1.2218239307403564, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.11928288266966451, | |
| "grad_norm": 4.1209940910339355, | |
| "learning_rate": 0.0001575, | |
| "logits/chosen": -0.8513484597206116, | |
| "logits/rejected": -0.8552687168121338, | |
| "logps/chosen": -9.33289909362793, | |
| "logps/rejected": -29.56768226623535, | |
| "loss": 1.0120337009429932, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4378553628921509, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.14417365193367004, | |
| "rewards/margins": 1.3170634508132935, | |
| "rewards/rejected": -1.1728898286819458, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.12117626175965919, | |
| "grad_norm": 4.230152606964111, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.7943696975708008, | |
| "logits/rejected": -0.8050058484077454, | |
| "logps/chosen": -6.4711594581604, | |
| "logps/rejected": -42.82871627807617, | |
| "loss": 0.5924439430236816, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23330256342887878, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16898760199546814, | |
| "rewards/margins": 1.992952585220337, | |
| "rewards/rejected": -1.823965072631836, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.12306964084965387, | |
| "grad_norm": 2.351702928543091, | |
| "learning_rate": 0.00016250000000000002, | |
| "logits/chosen": -0.8158823251724243, | |
| "logits/rejected": -0.8219522833824158, | |
| "logps/chosen": -4.3665313720703125, | |
| "logps/rejected": -28.09051513671875, | |
| "loss": 0.7134827375411987, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22144050896167755, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.3041003942489624, | |
| "rewards/margins": 1.2433838844299316, | |
| "rewards/rejected": -0.9392834305763245, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.12496301993964855, | |
| "grad_norm": 3.1737756729125977, | |
| "learning_rate": 0.000165, | |
| "logits/chosen": -0.8072597980499268, | |
| "logits/rejected": -0.8171340823173523, | |
| "logps/chosen": -5.0343122482299805, | |
| "logps/rejected": -32.46968460083008, | |
| "loss": 0.63325434923172, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29483139514923096, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.29814648628234863, | |
| "rewards/margins": 1.4677376747131348, | |
| "rewards/rejected": -1.1695910692214966, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.1268563990296432, | |
| "grad_norm": 2.5199668407440186, | |
| "learning_rate": 0.0001675, | |
| "logits/chosen": -0.8106119632720947, | |
| "logits/rejected": -0.8191246390342712, | |
| "logps/chosen": -8.389342308044434, | |
| "logps/rejected": -36.18731689453125, | |
| "loss": 0.7148120403289795, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31000831723213196, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2828730642795563, | |
| "rewards/margins": 1.7046067714691162, | |
| "rewards/rejected": -1.4217336177825928, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.1287497781196379, | |
| "grad_norm": 3.428029775619507, | |
| "learning_rate": 0.00017, | |
| "logits/chosen": -0.8391574621200562, | |
| "logits/rejected": -0.8546858429908752, | |
| "logps/chosen": -8.799811363220215, | |
| "logps/rejected": -37.64997863769531, | |
| "loss": 0.7224959135055542, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4090877175331116, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3909546434879303, | |
| "rewards/margins": 1.7023922204971313, | |
| "rewards/rejected": -1.3114374876022339, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.13064315720963257, | |
| "grad_norm": 3.7791826725006104, | |
| "learning_rate": 0.00017250000000000002, | |
| "logits/chosen": -0.8618558049201965, | |
| "logits/rejected": -0.86772221326828, | |
| "logps/chosen": -8.02017879486084, | |
| "logps/rejected": -28.318117141723633, | |
| "loss": 0.8481130003929138, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32193318009376526, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.07287055253982544, | |
| "rewards/margins": 1.3111273050308228, | |
| "rewards/rejected": -1.2382566928863525, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.13253653629962725, | |
| "grad_norm": 3.5219051837921143, | |
| "learning_rate": 0.000175, | |
| "logits/chosen": -0.8731855154037476, | |
| "logits/rejected": -0.8781698346138, | |
| "logps/chosen": -8.205753326416016, | |
| "logps/rejected": -23.05510902404785, | |
| "loss": 0.9284813404083252, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4099024832248688, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.26493778824806213, | |
| "rewards/margins": 1.1318817138671875, | |
| "rewards/rejected": -0.866943895816803, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.13442991538962193, | |
| "grad_norm": 2.412374973297119, | |
| "learning_rate": 0.0001775, | |
| "logits/chosen": -0.8586634993553162, | |
| "logits/rejected": -0.8701040744781494, | |
| "logps/chosen": -3.7027158737182617, | |
| "logps/rejected": -42.672996520996094, | |
| "loss": 0.5218284130096436, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2169719785451889, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.371543824672699, | |
| "rewards/margins": 2.3614425659179688, | |
| "rewards/rejected": -1.989898920059204, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.13632329447961658, | |
| "grad_norm": 1.723345160484314, | |
| "learning_rate": 0.00018, | |
| "logits/chosen": -0.8107991814613342, | |
| "logits/rejected": -0.8227972388267517, | |
| "logps/chosen": -4.743021488189697, | |
| "logps/rejected": -38.795711517333984, | |
| "loss": 0.4607815742492676, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18950311839580536, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.36083462834358215, | |
| "rewards/margins": 2.311211585998535, | |
| "rewards/rejected": -1.9503768682479858, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.13821667356961126, | |
| "grad_norm": 4.164133548736572, | |
| "learning_rate": 0.0001825, | |
| "logits/chosen": -0.9086084365844727, | |
| "logits/rejected": -0.9208739995956421, | |
| "logps/chosen": -13.34437084197998, | |
| "logps/rejected": -53.04572296142578, | |
| "loss": 0.6920671463012695, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.43207526206970215, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.031513512134552, | |
| "rewards/margins": 3.146587371826172, | |
| "rewards/rejected": -3.1150739192962646, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.14011005265960594, | |
| "grad_norm": 6.1999382972717285, | |
| "learning_rate": 0.00018500000000000002, | |
| "logits/chosen": -0.8234269618988037, | |
| "logits/rejected": -0.8303597569465637, | |
| "logps/chosen": -8.394856452941895, | |
| "logps/rejected": -41.975399017333984, | |
| "loss": 1.1737077236175537, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7135495543479919, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.14376360177993774, | |
| "rewards/margins": 2.6206157207489014, | |
| "rewards/rejected": -2.4768521785736084, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.14200343174960062, | |
| "grad_norm": 6.218433856964111, | |
| "learning_rate": 0.0001875, | |
| "logits/chosen": -0.8009334802627563, | |
| "logits/rejected": -0.8051450848579407, | |
| "logps/chosen": -12.022541046142578, | |
| "logps/rejected": -38.48487091064453, | |
| "loss": 0.9869168400764465, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45167890191078186, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.010723039507865906, | |
| "rewards/margins": 1.8775376081466675, | |
| "rewards/rejected": -1.8882607221603394, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.1438968108395953, | |
| "grad_norm": 1.9325371980667114, | |
| "learning_rate": 0.00019, | |
| "logits/chosen": -0.7815489768981934, | |
| "logits/rejected": -0.7896750569343567, | |
| "logps/chosen": -6.42656946182251, | |
| "logps/rejected": -33.38284683227539, | |
| "loss": 0.6605334281921387, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30029603838920593, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.31539270281791687, | |
| "rewards/margins": 1.6843116283416748, | |
| "rewards/rejected": -1.368919014930725, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.14579018992958998, | |
| "grad_norm": 5.768399238586426, | |
| "learning_rate": 0.00019250000000000002, | |
| "logits/chosen": -0.7157012820243835, | |
| "logits/rejected": -0.7218092679977417, | |
| "logps/chosen": -5.720545291900635, | |
| "logps/rejected": -32.14387512207031, | |
| "loss": 0.9388673901557922, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.49579885601997375, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2496451437473297, | |
| "rewards/margins": 1.3803541660308838, | |
| "rewards/rejected": -1.130708932876587, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.14768356901958463, | |
| "grad_norm": 2.978989601135254, | |
| "learning_rate": 0.000195, | |
| "logits/chosen": -0.7398240566253662, | |
| "logits/rejected": -0.74552983045578, | |
| "logps/chosen": -6.459310054779053, | |
| "logps/rejected": -28.873746871948242, | |
| "loss": 0.6721470952033997, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2696229815483093, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.28077179193496704, | |
| "rewards/margins": 1.547407865524292, | |
| "rewards/rejected": -1.2666360139846802, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.1495769481095793, | |
| "grad_norm": 2.109548568725586, | |
| "learning_rate": 0.00019750000000000003, | |
| "logits/chosen": -0.7017478942871094, | |
| "logits/rejected": -0.7096887826919556, | |
| "logps/chosen": -4.097768783569336, | |
| "logps/rejected": -31.799213409423828, | |
| "loss": 0.5941745042800903, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19475214183330536, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.4046904742717743, | |
| "rewards/margins": 1.6549233198165894, | |
| "rewards/rejected": -1.2502328157424927, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.15147032719957398, | |
| "grad_norm": 3.9734411239624023, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.6862869262695312, | |
| "logits/rejected": -0.6942235827445984, | |
| "logps/chosen": -8.900280952453613, | |
| "logps/rejected": -41.978641510009766, | |
| "loss": 0.7803151607513428, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3115917146205902, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1415846347808838, | |
| "rewards/margins": 2.006580352783203, | |
| "rewards/rejected": -1.8649954795837402, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.15336370628956866, | |
| "grad_norm": 6.735928535461426, | |
| "learning_rate": 0.00019999978184060562, | |
| "logits/chosen": -0.7448083162307739, | |
| "logits/rejected": -0.7499798536300659, | |
| "logps/chosen": -5.58134126663208, | |
| "logps/rejected": -42.04484939575195, | |
| "loss": 0.9395004510879517, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.515042245388031, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.24552975594997406, | |
| "rewards/margins": 2.421520233154297, | |
| "rewards/rejected": -2.175990343093872, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.15525708537956334, | |
| "grad_norm": 4.143361568450928, | |
| "learning_rate": 0.00019999912736337437, | |
| "logits/chosen": -0.7276468873023987, | |
| "logits/rejected": -0.741879940032959, | |
| "logps/chosen": -3.295543670654297, | |
| "logps/rejected": -54.32012939453125, | |
| "loss": 0.660046398639679, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.42805707454681396, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2942177951335907, | |
| "rewards/margins": 3.302980661392212, | |
| "rewards/rejected": -3.008762836456299, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.15715046446955802, | |
| "grad_norm": 4.713730812072754, | |
| "learning_rate": 0.00019999803657116188, | |
| "logits/chosen": -0.7310099601745605, | |
| "logits/rejected": -0.7400019764900208, | |
| "logps/chosen": -6.529958248138428, | |
| "logps/rejected": -39.906105041503906, | |
| "loss": 0.7617413997650146, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.422638475894928, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2212720513343811, | |
| "rewards/margins": 2.413503885269165, | |
| "rewards/rejected": -2.1922316551208496, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.1590438435595527, | |
| "grad_norm": 4.658056735992432, | |
| "learning_rate": 0.00019999650946872738, | |
| "logits/chosen": -0.7134297490119934, | |
| "logits/rejected": -0.7193505764007568, | |
| "logps/chosen": -5.202678680419922, | |
| "logps/rejected": -33.255706787109375, | |
| "loss": 0.6914293766021729, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2725370526313782, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.29689377546310425, | |
| "rewards/margins": 1.9401971101760864, | |
| "rewards/rejected": -1.6433032751083374, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.16093722264954735, | |
| "grad_norm": 2.288125991821289, | |
| "learning_rate": 0.00019999454606273404, | |
| "logits/chosen": -0.6521891951560974, | |
| "logits/rejected": -0.6597902774810791, | |
| "logps/chosen": -6.535229206085205, | |
| "logps/rejected": -33.92669677734375, | |
| "loss": 0.5946552157402039, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29953494668006897, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3503923714160919, | |
| "rewards/margins": 1.96759831905365, | |
| "rewards/rejected": -1.61720609664917, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.16283060173954203, | |
| "grad_norm": 6.193369388580322, | |
| "learning_rate": 0.00019999214636174845, | |
| "logits/chosen": -0.7137624025344849, | |
| "logits/rejected": -0.7180912494659424, | |
| "logps/chosen": -6.647699356079102, | |
| "logps/rejected": -31.25023078918457, | |
| "loss": 0.9301581382751465, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.46883538365364075, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.29692143201828003, | |
| "rewards/margins": 1.745566964149475, | |
| "rewards/rejected": -1.4486457109451294, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.1647239808295367, | |
| "grad_norm": 3.9115772247314453, | |
| "learning_rate": 0.00019998931037624104, | |
| "logits/chosen": -0.6435313820838928, | |
| "logits/rejected": -0.6480632424354553, | |
| "logps/chosen": -6.559725284576416, | |
| "logps/rejected": -34.3360481262207, | |
| "loss": 0.7339984178543091, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3988235890865326, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2545357048511505, | |
| "rewards/margins": 1.8583070039749146, | |
| "rewards/rejected": -1.603771448135376, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.1666173599195314, | |
| "grad_norm": 2.725975751876831, | |
| "learning_rate": 0.00019998603811858571, | |
| "logits/chosen": -0.6484612822532654, | |
| "logits/rejected": -0.6513442993164062, | |
| "logps/chosen": -5.939992427825928, | |
| "logps/rejected": -30.691526412963867, | |
| "loss": 0.6261233687400818, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30717653036117554, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3799961507320404, | |
| "rewards/margins": 1.8060214519500732, | |
| "rewards/rejected": -1.426025390625, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.16851073900952607, | |
| "grad_norm": 3.1483325958251953, | |
| "learning_rate": 0.00019998232960305993, | |
| "logits/chosen": -0.640424907207489, | |
| "logits/rejected": -0.6445133090019226, | |
| "logps/chosen": -10.158927917480469, | |
| "logps/rejected": -31.649131774902344, | |
| "loss": 0.7713112235069275, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4013857841491699, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2583284080028534, | |
| "rewards/margins": 1.7178279161453247, | |
| "rewards/rejected": -1.4594995975494385, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.17040411809952075, | |
| "grad_norm": 9.671393394470215, | |
| "learning_rate": 0.0001999781848458447, | |
| "logits/chosen": -0.6384307146072388, | |
| "logits/rejected": -0.6467083692550659, | |
| "logps/chosen": -5.6327433586120605, | |
| "logps/rejected": -33.724124908447266, | |
| "loss": 1.136250615119934, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6182616353034973, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12717147171497345, | |
| "rewards/margins": 1.5072848796844482, | |
| "rewards/rejected": -1.3801133632659912, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.17229749718951543, | |
| "grad_norm": 3.9667158126831055, | |
| "learning_rate": 0.0001999736038650243, | |
| "logits/chosen": -0.6727519035339355, | |
| "logits/rejected": -0.678146243095398, | |
| "logps/chosen": -3.9062070846557617, | |
| "logps/rejected": -40.605716705322266, | |
| "loss": 0.5808683633804321, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29070931673049927, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3750736713409424, | |
| "rewards/margins": 2.2590668201446533, | |
| "rewards/rejected": -1.883993148803711, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.17419087627951008, | |
| "grad_norm": 2.966646909713745, | |
| "learning_rate": 0.00019996858668058646, | |
| "logits/chosen": -0.6560570597648621, | |
| "logits/rejected": -0.6633113622665405, | |
| "logps/chosen": -6.821100234985352, | |
| "logps/rejected": -35.842308044433594, | |
| "loss": 0.5389344096183777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22853048145771027, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.33146628737449646, | |
| "rewards/margins": 2.221740484237671, | |
| "rewards/rejected": -1.8902742862701416, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.17608425536950476, | |
| "grad_norm": 4.352930068969727, | |
| "learning_rate": 0.0001999631333144221, | |
| "logits/chosen": -0.6744297742843628, | |
| "logits/rejected": -0.6817238926887512, | |
| "logps/chosen": -10.121214866638184, | |
| "logps/rejected": -45.07015609741211, | |
| "loss": 0.7165765166282654, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36157098412513733, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3100533187389374, | |
| "rewards/margins": 2.3896117210388184, | |
| "rewards/rejected": -2.0795583724975586, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.17797763445949943, | |
| "grad_norm": 3.650033473968506, | |
| "learning_rate": 0.00019995724379032526, | |
| "logits/chosen": -0.6463199257850647, | |
| "logits/rejected": -0.6561610102653503, | |
| "logps/chosen": -5.5554704666137695, | |
| "logps/rejected": -39.192264556884766, | |
| "loss": 0.7099438309669495, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3186087906360626, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28469714522361755, | |
| "rewards/margins": 2.1725757122039795, | |
| "rewards/rejected": -1.887878656387329, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.1798710135494941, | |
| "grad_norm": 3.6392762660980225, | |
| "learning_rate": 0.00019995091813399305, | |
| "logits/chosen": -0.6218971014022827, | |
| "logits/rejected": -0.6236589550971985, | |
| "logps/chosen": -9.031105041503906, | |
| "logps/rejected": -29.54071044921875, | |
| "loss": 0.7348965406417847, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35691019892692566, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3281153440475464, | |
| "rewards/margins": 1.6330987215042114, | |
| "rewards/rejected": -1.3049836158752441, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.1817643926394888, | |
| "grad_norm": 4.513101100921631, | |
| "learning_rate": 0.00019994415637302547, | |
| "logits/chosen": -0.6518260836601257, | |
| "logits/rejected": -0.6591805815696716, | |
| "logps/chosen": -3.454824447631836, | |
| "logps/rejected": -40.539100646972656, | |
| "loss": 0.4428410232067108, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16427120566368103, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.29650911688804626, | |
| "rewards/margins": 1.9197403192520142, | |
| "rewards/rejected": -1.623231053352356, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.18365777172948347, | |
| "grad_norm": 3.081139087677002, | |
| "learning_rate": 0.00019993695853692537, | |
| "logits/chosen": -0.6301771402359009, | |
| "logits/rejected": -0.6361221671104431, | |
| "logps/chosen": -5.919186592102051, | |
| "logps/rejected": -33.726078033447266, | |
| "loss": 0.6770766377449036, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3173068165779114, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.288848340511322, | |
| "rewards/margins": 1.7297114133834839, | |
| "rewards/rejected": -1.4408631324768066, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.18555115081947815, | |
| "grad_norm": 5.967331409454346, | |
| "learning_rate": 0.0001999293246570983, | |
| "logits/chosen": -0.6614546179771423, | |
| "logits/rejected": -0.6638529300689697, | |
| "logps/chosen": -6.57697057723999, | |
| "logps/rejected": -30.82279396057129, | |
| "loss": 0.6938097476959229, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23730693757534027, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.24900805950164795, | |
| "rewards/margins": 1.5996767282485962, | |
| "rewards/rejected": -1.3506686687469482, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.1874445299094728, | |
| "grad_norm": 2.659550428390503, | |
| "learning_rate": 0.0001999212547668523, | |
| "logits/chosen": -0.6610513925552368, | |
| "logits/rejected": -0.6650281548500061, | |
| "logps/chosen": -7.570089817047119, | |
| "logps/rejected": -41.5615348815918, | |
| "loss": 0.521258533000946, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34517771005630493, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28127947449684143, | |
| "rewards/margins": 2.645756244659424, | |
| "rewards/rejected": -2.3644769191741943, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.18933790899946748, | |
| "grad_norm": 12.499390602111816, | |
| "learning_rate": 0.00019991274890139774, | |
| "logits/chosen": -0.5981582403182983, | |
| "logits/rejected": -0.5984249114990234, | |
| "logps/chosen": -5.772880554199219, | |
| "logps/rejected": -36.335723876953125, | |
| "loss": 0.5674217939376831, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3134133517742157, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3456924557685852, | |
| "rewards/margins": 2.240718364715576, | |
| "rewards/rejected": -1.8950259685516357, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.19123128808946216, | |
| "grad_norm": 8.361610412597656, | |
| "learning_rate": 0.00019990380709784743, | |
| "logits/chosen": -0.6467748880386353, | |
| "logits/rejected": -0.6568058133125305, | |
| "logps/chosen": -6.142106056213379, | |
| "logps/rejected": -42.85158920288086, | |
| "loss": 0.7210798859596252, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.48578304052352905, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24581415951251984, | |
| "rewards/margins": 2.62912917137146, | |
| "rewards/rejected": -2.383315086364746, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.19312466717945684, | |
| "grad_norm": 8.87897777557373, | |
| "learning_rate": 0.00019989442939521602, | |
| "logits/chosen": -0.6422844529151917, | |
| "logits/rejected": -0.6491110324859619, | |
| "logps/chosen": -4.283577919006348, | |
| "logps/rejected": -44.210323333740234, | |
| "loss": 0.4512465298175812, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18845491111278534, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2913907766342163, | |
| "rewards/margins": 2.8169469833374023, | |
| "rewards/rejected": -2.5255563259124756, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.19501804626945152, | |
| "grad_norm": 5.385126113891602, | |
| "learning_rate": 0.0001998846158344203, | |
| "logits/chosen": -0.6668524742126465, | |
| "logits/rejected": -0.6711164712905884, | |
| "logps/chosen": -8.307709693908691, | |
| "logps/rejected": -46.651424407958984, | |
| "loss": 0.5795091986656189, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2871760427951813, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2825217843055725, | |
| "rewards/margins": 3.175206422805786, | |
| "rewards/rejected": -2.8926849365234375, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.1969114253594462, | |
| "grad_norm": 5.178345680236816, | |
| "learning_rate": 0.0001998743664582786, | |
| "logits/chosen": -0.6665439009666443, | |
| "logits/rejected": -0.6732444763183594, | |
| "logps/chosen": -6.044788360595703, | |
| "logps/rejected": -49.20276641845703, | |
| "loss": 0.5723894834518433, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30348485708236694, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.4383161664009094, | |
| "rewards/margins": 3.547417402267456, | |
| "rewards/rejected": -3.1091012954711914, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.19880480444944088, | |
| "grad_norm": 13.239428520202637, | |
| "learning_rate": 0.00019986368131151086, | |
| "logits/chosen": -0.6453922390937805, | |
| "logits/rejected": -0.6535012125968933, | |
| "logps/chosen": -6.758315086364746, | |
| "logps/rejected": -47.57633590698242, | |
| "loss": 0.8193904161453247, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.48707395792007446, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.25950154662132263, | |
| "rewards/margins": 2.7850496768951416, | |
| "rewards/rejected": -2.5255484580993652, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.20069818353943553, | |
| "grad_norm": 8.258339881896973, | |
| "learning_rate": 0.00019985256044073848, | |
| "logits/chosen": -0.6464555263519287, | |
| "logits/rejected": -0.6525677442550659, | |
| "logps/chosen": -8.009160995483398, | |
| "logps/rejected": -44.356807708740234, | |
| "loss": 0.8658470511436462, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.40163958072662354, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08035992085933685, | |
| "rewards/margins": 2.636491537094116, | |
| "rewards/rejected": -2.556131601333618, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.2025915626294302, | |
| "grad_norm": 5.688174247741699, | |
| "learning_rate": 0.0001998410038944838, | |
| "logits/chosen": -0.6843658685684204, | |
| "logits/rejected": -0.6876212358474731, | |
| "logps/chosen": -2.5727243423461914, | |
| "logps/rejected": -29.177391052246094, | |
| "loss": 0.4456700086593628, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15025635063648224, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.46042385697364807, | |
| "rewards/margins": 1.8946454524993896, | |
| "rewards/rejected": -1.434221863746643, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.20448494171942488, | |
| "grad_norm": 2.6327826976776123, | |
| "learning_rate": 0.00019982901172317031, | |
| "logits/chosen": -0.6323860287666321, | |
| "logits/rejected": -0.6346494555473328, | |
| "logps/chosen": -8.630059242248535, | |
| "logps/rejected": -31.78713035583496, | |
| "loss": 0.6648795008659363, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2702806890010834, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19947871565818787, | |
| "rewards/margins": 1.5066046714782715, | |
| "rewards/rejected": -1.3071260452270508, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.20637832080941956, | |
| "grad_norm": 2.5843868255615234, | |
| "learning_rate": 0.000199816583979122, | |
| "logits/chosen": -0.5910162329673767, | |
| "logits/rejected": -0.5975123047828674, | |
| "logps/chosen": -3.9122486114501953, | |
| "logps/rejected": -28.35757064819336, | |
| "loss": 0.6974324584007263, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3021320104598999, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3400159180164337, | |
| "rewards/margins": 1.3856966495513916, | |
| "rewards/rejected": -1.0456807613372803, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.20827169989941424, | |
| "grad_norm": 5.559172630310059, | |
| "learning_rate": 0.00019980372071656352, | |
| "logits/chosen": -0.6566262245178223, | |
| "logits/rejected": -0.6621754169464111, | |
| "logps/chosen": -6.803584575653076, | |
| "logps/rejected": -29.84942626953125, | |
| "loss": 0.84231036901474, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.47532981634140015, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.30856069922447205, | |
| "rewards/margins": 1.5043147802352905, | |
| "rewards/rejected": -1.195754051208496, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.21016507898940892, | |
| "grad_norm": 3.415010929107666, | |
| "learning_rate": 0.0001997904219916197, | |
| "logits/chosen": -0.6346056461334229, | |
| "logits/rejected": -0.6350025534629822, | |
| "logps/chosen": -11.599414825439453, | |
| "logps/rejected": -30.610013961791992, | |
| "loss": 0.7572425007820129, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36608272790908813, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2624809741973877, | |
| "rewards/margins": 1.713860034942627, | |
| "rewards/rejected": -1.4513791799545288, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.21205845807940357, | |
| "grad_norm": 3.41812801361084, | |
| "learning_rate": 0.00019977668786231534, | |
| "logits/chosen": -0.6841356754302979, | |
| "logits/rejected": -0.6936293840408325, | |
| "logps/chosen": -5.25693416595459, | |
| "logps/rejected": -32.669185638427734, | |
| "loss": 0.741496741771698, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.313353031873703, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.24570311605930328, | |
| "rewards/margins": 1.6960662603378296, | |
| "rewards/rejected": -1.450363278388977, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.21395183716939825, | |
| "grad_norm": 2.2650668621063232, | |
| "learning_rate": 0.00019976251838857502, | |
| "logits/chosen": -0.7449254393577576, | |
| "logits/rejected": -0.75071120262146, | |
| "logps/chosen": -4.380943298339844, | |
| "logps/rejected": -35.95576858520508, | |
| "loss": 0.4989684820175171, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22844262421131134, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.36053481698036194, | |
| "rewards/margins": 2.2524986267089844, | |
| "rewards/rejected": -1.8919636011123657, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.21584521625939293, | |
| "grad_norm": 4.310145378112793, | |
| "learning_rate": 0.0001997479136322229, | |
| "logits/chosen": -0.7409523129463196, | |
| "logits/rejected": -0.7497206330299377, | |
| "logps/chosen": -4.750667572021484, | |
| "logps/rejected": -48.04157638549805, | |
| "loss": 0.6291773915290833, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25920921564102173, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.24817335605621338, | |
| "rewards/margins": 3.173919677734375, | |
| "rewards/rejected": -2.925746202468872, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.2177385953493876, | |
| "grad_norm": 49.79676818847656, | |
| "learning_rate": 0.00019973287365698217, | |
| "logits/chosen": -0.6885964274406433, | |
| "logits/rejected": -0.6920081973075867, | |
| "logps/chosen": -8.995617866516113, | |
| "logps/rejected": -50.670982360839844, | |
| "loss": 0.8429219722747803, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6063740849494934, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.02555127628147602, | |
| "rewards/margins": 3.5049619674682617, | |
| "rewards/rejected": -3.530513286590576, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.2196319744393823, | |
| "grad_norm": 24.369260787963867, | |
| "learning_rate": 0.00019971739852847514, | |
| "logits/chosen": -0.7350776791572571, | |
| "logits/rejected": -0.7412790656089783, | |
| "logps/chosen": -11.02401065826416, | |
| "logps/rejected": -58.75929260253906, | |
| "loss": 1.4918644428253174, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 1.1034432649612427, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.35152652859687805, | |
| "rewards/margins": 3.6628317832946777, | |
| "rewards/rejected": -4.0143585205078125, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.22152535352937697, | |
| "grad_norm": 5.370579719543457, | |
| "learning_rate": 0.00019970148831422265, | |
| "logits/chosen": -0.7471648454666138, | |
| "logits/rejected": -0.7545170187950134, | |
| "logps/chosen": -8.818143844604492, | |
| "logps/rejected": -56.34012985229492, | |
| "loss": 0.5391644239425659, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3180984854698181, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.27325814962387085, | |
| "rewards/margins": 3.91802978515625, | |
| "rewards/rejected": -3.6447718143463135, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.22341873261937165, | |
| "grad_norm": 3.5595195293426514, | |
| "learning_rate": 0.00019968514308364398, | |
| "logits/chosen": -0.7581095099449158, | |
| "logits/rejected": -0.7644103765487671, | |
| "logps/chosen": -5.872043609619141, | |
| "logps/rejected": -59.083518981933594, | |
| "loss": 0.5253903865814209, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2678287923336029, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3531153202056885, | |
| "rewards/margins": 4.330952167510986, | |
| "rewards/rejected": -3.977836847305298, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.2253121117093663, | |
| "grad_norm": 5.7043280601501465, | |
| "learning_rate": 0.00019966836290805648, | |
| "logits/chosen": -0.7545002102851868, | |
| "logits/rejected": -0.7589887380599976, | |
| "logps/chosen": -5.470965385437012, | |
| "logps/rejected": -45.09376525878906, | |
| "loss": 0.5245931148529053, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3320286273956299, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1665220558643341, | |
| "rewards/margins": 2.904370069503784, | |
| "rewards/rejected": -2.7378478050231934, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.22720549079936098, | |
| "grad_norm": 9.95584774017334, | |
| "learning_rate": 0.00019965114786067516, | |
| "logits/chosen": -0.7246638536453247, | |
| "logits/rejected": -0.7372928261756897, | |
| "logps/chosen": -9.260250091552734, | |
| "logps/rejected": -49.462730407714844, | |
| "loss": 0.6747857928276062, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.39999300241470337, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3001291751861572, | |
| "rewards/margins": 3.218559980392456, | |
| "rewards/rejected": -2.918430805206299, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.22909886988935566, | |
| "grad_norm": 3.724515676498413, | |
| "learning_rate": 0.00019963349801661252, | |
| "logits/chosen": -0.772263765335083, | |
| "logits/rejected": -0.7768078446388245, | |
| "logps/chosen": -3.9073729515075684, | |
| "logps/rejected": -37.0045051574707, | |
| "loss": 0.4512227177619934, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22428500652313232, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24837777018547058, | |
| "rewards/margins": 2.6941304206848145, | |
| "rewards/rejected": -2.4457523822784424, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.23099224897935033, | |
| "grad_norm": 3.838991403579712, | |
| "learning_rate": 0.00019961541345287815, | |
| "logits/chosen": -0.7484467029571533, | |
| "logits/rejected": -0.7612442374229431, | |
| "logps/chosen": -5.860817909240723, | |
| "logps/rejected": -57.7578125, | |
| "loss": 0.6650333404541016, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.44994574785232544, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3677416145801544, | |
| "rewards/margins": 3.3471570014953613, | |
| "rewards/rejected": -2.9794154167175293, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.232885628069345, | |
| "grad_norm": 8.47818374633789, | |
| "learning_rate": 0.0001995968942483784, | |
| "logits/chosen": -0.7861376404762268, | |
| "logits/rejected": -0.7918702960014343, | |
| "logps/chosen": -6.540744304656982, | |
| "logps/rejected": -44.694793701171875, | |
| "loss": 0.686521053314209, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3082555830478668, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.23747095465660095, | |
| "rewards/margins": 3.017436981201172, | |
| "rewards/rejected": -2.779966115951538, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.2347790071593397, | |
| "grad_norm": 4.60905647277832, | |
| "learning_rate": 0.00019957794048391602, | |
| "logits/chosen": -0.7763262391090393, | |
| "logits/rejected": -0.7869465947151184, | |
| "logps/chosen": -3.775228261947632, | |
| "logps/rejected": -50.85580062866211, | |
| "loss": 0.4823143184185028, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18497991561889648, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3380104899406433, | |
| "rewards/margins": 3.654966115951538, | |
| "rewards/rejected": -3.316955089569092, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.23667238624933437, | |
| "grad_norm": 8.420757293701172, | |
| "learning_rate": 0.00019955855224218985, | |
| "logits/chosen": -0.7525299787521362, | |
| "logits/rejected": -0.7635971903800964, | |
| "logps/chosen": -6.437612533569336, | |
| "logps/rejected": -38.99058532714844, | |
| "loss": 0.8981273174285889, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4748547673225403, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.15252822637557983, | |
| "rewards/margins": 2.468339443206787, | |
| "rewards/rejected": -2.3158111572265625, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.23856576533932902, | |
| "grad_norm": 4.813470363616943, | |
| "learning_rate": 0.00019953872960779445, | |
| "logits/chosen": -0.7726767063140869, | |
| "logits/rejected": -0.7802519202232361, | |
| "logps/chosen": -8.317635536193848, | |
| "logps/rejected": -43.16456985473633, | |
| "loss": 0.8319203853607178, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31651198863983154, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.013967695645987988, | |
| "rewards/margins": 2.4464800357818604, | |
| "rewards/rejected": -2.4325122833251953, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.2404591444293237, | |
| "grad_norm": 3.016392469406128, | |
| "learning_rate": 0.0001995184726672197, | |
| "logits/chosen": -0.7210108637809753, | |
| "logits/rejected": -0.7305353283882141, | |
| "logps/chosen": -6.296525478363037, | |
| "logps/rejected": -46.77278137207031, | |
| "loss": 0.6447858214378357, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3108886778354645, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26448336243629456, | |
| "rewards/margins": 2.491849660873413, | |
| "rewards/rejected": -2.2273662090301514, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.24235252351931838, | |
| "grad_norm": 1.984066128730774, | |
| "learning_rate": 0.00019949778150885042, | |
| "logits/chosen": -0.7717783451080322, | |
| "logits/rejected": -0.7797784805297852, | |
| "logps/chosen": -3.87850022315979, | |
| "logps/rejected": -53.567745208740234, | |
| "loss": 0.31897497177124023, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15310946106910706, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2823570668697357, | |
| "rewards/margins": 3.53421688079834, | |
| "rewards/rejected": -3.2518601417541504, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.24424590260931306, | |
| "grad_norm": 2.775517225265503, | |
| "learning_rate": 0.00019947665622296602, | |
| "logits/chosen": -0.721402645111084, | |
| "logits/rejected": -0.7311292886734009, | |
| "logps/chosen": -3.766075611114502, | |
| "logps/rejected": -40.414039611816406, | |
| "loss": 0.5010823011398315, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24178192019462585, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3318912386894226, | |
| "rewards/margins": 2.27069091796875, | |
| "rewards/rejected": -1.9387996196746826, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.24613928169930774, | |
| "grad_norm": 3.1850295066833496, | |
| "learning_rate": 0.00019945509690174012, | |
| "logits/chosen": -0.7250795960426331, | |
| "logits/rejected": -0.7257798910140991, | |
| "logps/chosen": -6.547388553619385, | |
| "logps/rejected": -31.564491271972656, | |
| "loss": 0.6416950821876526, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2817922532558441, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.25322476029396057, | |
| "rewards/margins": 1.9835402965545654, | |
| "rewards/rejected": -1.7303153276443481, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.24803266078930242, | |
| "grad_norm": 3.2285263538360596, | |
| "learning_rate": 0.00019943310363924007, | |
| "logits/chosen": -0.7049883604049683, | |
| "logits/rejected": -0.7214145064353943, | |
| "logps/chosen": -7.687161445617676, | |
| "logps/rejected": -48.23120880126953, | |
| "loss": 0.5076671838760376, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29537200927734375, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3577454090118408, | |
| "rewards/margins": 2.9845407009124756, | |
| "rewards/rejected": -2.6267952919006348, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.2499260398792971, | |
| "grad_norm": 3.9876368045806885, | |
| "learning_rate": 0.00019941067653142657, | |
| "logits/chosen": -0.7751510143280029, | |
| "logits/rejected": -0.779951274394989, | |
| "logps/chosen": -5.9425530433654785, | |
| "logps/rejected": -44.56589126586914, | |
| "loss": 0.7343396544456482, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.40883925557136536, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.26840847730636597, | |
| "rewards/margins": 2.8791656494140625, | |
| "rewards/rejected": -2.6107571125030518, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.2518194189692918, | |
| "grad_norm": 3.382171869277954, | |
| "learning_rate": 0.00019938781567615336, | |
| "logits/chosen": -0.7755506038665771, | |
| "logits/rejected": -0.7845891714096069, | |
| "logps/chosen": -7.24715518951416, | |
| "logps/rejected": -44.12371063232422, | |
| "loss": 0.6991584300994873, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.410519003868103, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21389470994472504, | |
| "rewards/margins": 2.8707995414733887, | |
| "rewards/rejected": -2.65690541267395, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.2537127980592864, | |
| "grad_norm": 5.093874931335449, | |
| "learning_rate": 0.00019936452117316663, | |
| "logits/chosen": -0.8056867718696594, | |
| "logits/rejected": -0.809194803237915, | |
| "logps/chosen": -9.516021728515625, | |
| "logps/rejected": -56.02266311645508, | |
| "loss": 0.6206343770027161, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3526919484138489, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2024693489074707, | |
| "rewards/margins": 4.063340187072754, | |
| "rewards/rejected": -3.860870838165283, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.25560617714928113, | |
| "grad_norm": 4.6863226890563965, | |
| "learning_rate": 0.00019934079312410467, | |
| "logits/chosen": -0.8240848183631897, | |
| "logits/rejected": -0.8471858501434326, | |
| "logps/chosen": -3.86633563041687, | |
| "logps/rejected": -100.45770263671875, | |
| "loss": 0.33894628286361694, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22375458478927612, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.31900501251220703, | |
| "rewards/margins": 7.854244232177734, | |
| "rewards/rejected": -7.535239219665527, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.2574995562392758, | |
| "grad_norm": 3.567854404449463, | |
| "learning_rate": 0.00019931663163249742, | |
| "logits/chosen": -0.8480275273323059, | |
| "logits/rejected": -0.8538500070571899, | |
| "logps/chosen": -9.888245582580566, | |
| "logps/rejected": -45.75389099121094, | |
| "loss": 0.6490932106971741, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3520674705505371, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.28484463691711426, | |
| "rewards/margins": 3.3431763648986816, | |
| "rewards/rejected": -3.0583324432373047, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.25939293532927044, | |
| "grad_norm": 4.430754661560059, | |
| "learning_rate": 0.000199292036803766, | |
| "logits/chosen": -0.8859494924545288, | |
| "logits/rejected": -0.8960965275764465, | |
| "logps/chosen": -10.031050682067871, | |
| "logps/rejected": -64.34874725341797, | |
| "loss": 0.6498712301254272, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4804614186286926, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3784683644771576, | |
| "rewards/margins": 5.330948352813721, | |
| "rewards/rejected": -4.952479839324951, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.26128631441926514, | |
| "grad_norm": 7.582626819610596, | |
| "learning_rate": 0.00019926700874522228, | |
| "logits/chosen": -0.8495133519172668, | |
| "logits/rejected": -0.8645675778388977, | |
| "logps/chosen": -8.528069496154785, | |
| "logps/rejected": -57.99681854248047, | |
| "loss": 1.0912293195724487, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8290497064590454, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18979007005691528, | |
| "rewards/margins": 4.3057451248168945, | |
| "rewards/rejected": -4.115954399108887, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.2631796935092598, | |
| "grad_norm": 23.314302444458008, | |
| "learning_rate": 0.00019924154756606837, | |
| "logits/chosen": -0.8541093468666077, | |
| "logits/rejected": -0.8688046932220459, | |
| "logps/chosen": -5.522783279418945, | |
| "logps/rejected": -79.18603515625, | |
| "loss": 0.5735315084457397, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3679307699203491, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20842784643173218, | |
| "rewards/margins": 6.1773834228515625, | |
| "rewards/rejected": -5.9689555168151855, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.2650730725992545, | |
| "grad_norm": 12.074163436889648, | |
| "learning_rate": 0.0001992156533773962, | |
| "logits/chosen": -0.8475787043571472, | |
| "logits/rejected": -0.8581144213676453, | |
| "logps/chosen": -4.404082298278809, | |
| "logps/rejected": -69.51590728759766, | |
| "loss": 0.6005671620368958, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41126585006713867, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.12076976895332336, | |
| "rewards/margins": 5.504639148712158, | |
| "rewards/rejected": -5.383869171142578, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.26696645168924915, | |
| "grad_norm": 14.37826156616211, | |
| "learning_rate": 0.00019918932629218693, | |
| "logits/chosen": -0.7814698219299316, | |
| "logits/rejected": -0.7934913039207458, | |
| "logps/chosen": -7.017152309417725, | |
| "logps/rejected": -53.27716827392578, | |
| "loss": 1.1257140636444092, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8658289909362793, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10481896996498108, | |
| "rewards/margins": 3.3784234523773193, | |
| "rewards/rejected": -3.273604393005371, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.26885983077924386, | |
| "grad_norm": 5.494270324707031, | |
| "learning_rate": 0.00019916256642531064, | |
| "logits/chosen": -0.7829540371894836, | |
| "logits/rejected": -0.7963675856590271, | |
| "logps/chosen": -8.385337829589844, | |
| "logps/rejected": -51.070316314697266, | |
| "loss": 0.7671561241149902, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5193882584571838, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04612942785024643, | |
| "rewards/margins": 3.2342934608459473, | |
| "rewards/rejected": -3.188163995742798, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.2707532098692385, | |
| "grad_norm": 10.173422813415527, | |
| "learning_rate": 0.00019913537389352565, | |
| "logits/chosen": -0.7792036533355713, | |
| "logits/rejected": -0.7820754647254944, | |
| "logps/chosen": -11.546073913574219, | |
| "logps/rejected": -36.85886001586914, | |
| "loss": 1.2373579740524292, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7483444809913635, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11113296449184418, | |
| "rewards/margins": 2.2868616580963135, | |
| "rewards/rejected": -2.1757285594940186, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.27264658895923316, | |
| "grad_norm": 10.165970802307129, | |
| "learning_rate": 0.000199107748815478, | |
| "logits/chosen": -0.7335910201072693, | |
| "logits/rejected": -0.7423563599586487, | |
| "logps/chosen": -5.789748668670654, | |
| "logps/rejected": -51.16117858886719, | |
| "loss": 0.5209447741508484, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26225852966308594, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.34096524119377136, | |
| "rewards/margins": 3.562436103820801, | |
| "rewards/rejected": -3.221470832824707, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.27453996804922787, | |
| "grad_norm": 3.7743449211120605, | |
| "learning_rate": 0.00019907969131170123, | |
| "logits/chosen": -0.6795719861984253, | |
| "logits/rejected": -0.687801718711853, | |
| "logps/chosen": -5.778347969055176, | |
| "logps/rejected": -36.02931213378906, | |
| "loss": 0.746212363243103, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41548293828964233, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.17704080045223236, | |
| "rewards/margins": 2.0213520526885986, | |
| "rewards/rejected": -1.8443111181259155, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.2764333471392225, | |
| "grad_norm": 8.021881103515625, | |
| "learning_rate": 0.0001990512015046154, | |
| "logits/chosen": -0.7164587378501892, | |
| "logits/rejected": -0.724740207195282, | |
| "logps/chosen": -11.131789207458496, | |
| "logps/rejected": -47.94390869140625, | |
| "loss": 0.7136993408203125, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.46022000908851624, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19410860538482666, | |
| "rewards/margins": 3.1541659832000732, | |
| "rewards/rejected": -2.960057497024536, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.2783267262292172, | |
| "grad_norm": 2.5674595832824707, | |
| "learning_rate": 0.00019902227951852693, | |
| "logits/chosen": -0.6974028944969177, | |
| "logits/rejected": -0.7133046984672546, | |
| "logps/chosen": -5.312131881713867, | |
| "logps/rejected": -56.97577667236328, | |
| "loss": 0.546694815158844, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2678171694278717, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3132306933403015, | |
| "rewards/margins": 3.396456003189087, | |
| "rewards/rejected": -3.0832252502441406, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.2802201053192119, | |
| "grad_norm": 2.6228554248809814, | |
| "learning_rate": 0.00019899292547962788, | |
| "logits/chosen": -0.6645054221153259, | |
| "logits/rejected": -0.6710233092308044, | |
| "logps/chosen": -5.465825080871582, | |
| "logps/rejected": -34.39421463012695, | |
| "loss": 0.5485950112342834, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24020352959632874, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2989718019962311, | |
| "rewards/margins": 1.9927932024002075, | |
| "rewards/rejected": -1.6938214302062988, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.2821134844092066, | |
| "grad_norm": 3.143923759460449, | |
| "learning_rate": 0.0001989631395159954, | |
| "logits/chosen": -0.6561654806137085, | |
| "logits/rejected": -0.6622195243835449, | |
| "logps/chosen": -4.917874813079834, | |
| "logps/rejected": -40.90203094482422, | |
| "loss": 0.47251078486442566, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18277724087238312, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.34272196888923645, | |
| "rewards/margins": 2.234957695007324, | |
| "rewards/rejected": -1.892235517501831, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.28400686349920123, | |
| "grad_norm": 2.255929946899414, | |
| "learning_rate": 0.00019893292175759131, | |
| "logits/chosen": -0.700336754322052, | |
| "logits/rejected": -0.7083441615104675, | |
| "logps/chosen": -6.8965606689453125, | |
| "logps/rejected": -33.876731872558594, | |
| "loss": 0.5560379028320312, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23617547750473022, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3127138316631317, | |
| "rewards/margins": 1.6684951782226562, | |
| "rewards/rejected": -1.3557813167572021, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.2859002425891959, | |
| "grad_norm": 3.593722105026245, | |
| "learning_rate": 0.00019890227233626133, | |
| "logits/chosen": -0.6745707392692566, | |
| "logits/rejected": -0.6865944862365723, | |
| "logps/chosen": -6.157535076141357, | |
| "logps/rejected": -43.30187225341797, | |
| "loss": 0.5548833012580872, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3123031556606293, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37635695934295654, | |
| "rewards/margins": 2.288217306137085, | |
| "rewards/rejected": -1.911860466003418, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.2877936216791906, | |
| "grad_norm": 3.031252861022949, | |
| "learning_rate": 0.0001988711913857346, | |
| "logits/chosen": -0.6861976385116577, | |
| "logits/rejected": -0.6901456713676453, | |
| "logps/chosen": -6.361867427825928, | |
| "logps/rejected": -32.86566162109375, | |
| "loss": 0.6771292090415955, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35346654057502747, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.26746034622192383, | |
| "rewards/margins": 1.8923015594482422, | |
| "rewards/rejected": -1.6248412132263184, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.28968700076918524, | |
| "grad_norm": 3.878405809402466, | |
| "learning_rate": 0.00019883967904162325, | |
| "logits/chosen": -0.7064144611358643, | |
| "logits/rejected": -0.7097403407096863, | |
| "logps/chosen": -4.3548808097839355, | |
| "logps/rejected": -32.47248458862305, | |
| "loss": 0.5777835249900818, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2289128601551056, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3213263750076294, | |
| "rewards/margins": 2.1042110919952393, | |
| "rewards/rejected": -1.7828848361968994, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.29158037985917995, | |
| "grad_norm": 3.498708724975586, | |
| "learning_rate": 0.00019880773544142148, | |
| "logits/chosen": -0.7486563324928284, | |
| "logits/rejected": -0.7543911933898926, | |
| "logps/chosen": -5.338995933532715, | |
| "logps/rejected": -37.15753173828125, | |
| "loss": 0.46198132634162903, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21741318702697754, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.388688325881958, | |
| "rewards/margins": 2.447216033935547, | |
| "rewards/rejected": -2.058527708053589, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.2934737589491746, | |
| "grad_norm": 4.984945297241211, | |
| "learning_rate": 0.00019877536072450527, | |
| "logits/chosen": -0.7390610575675964, | |
| "logits/rejected": -0.7399532794952393, | |
| "logps/chosen": -10.968379020690918, | |
| "logps/rejected": -33.57049560546875, | |
| "loss": 0.718737006187439, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3964201509952545, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.036715492606163025, | |
| "rewards/margins": 1.7534269094467163, | |
| "rewards/rejected": -1.7167115211486816, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.29536713803916925, | |
| "grad_norm": 7.5653076171875, | |
| "learning_rate": 0.00019874255503213152, | |
| "logits/chosen": -0.7588214874267578, | |
| "logits/rejected": -0.7610840797424316, | |
| "logps/chosen": -5.5218400955200195, | |
| "logps/rejected": -35.822601318359375, | |
| "loss": 0.6484081745147705, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2997969686985016, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3626272678375244, | |
| "rewards/margins": 2.2176332473754883, | |
| "rewards/rejected": -1.8550057411193848, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.29726051712916396, | |
| "grad_norm": 5.305218696594238, | |
| "learning_rate": 0.0001987093185074377, | |
| "logits/chosen": -0.7636702656745911, | |
| "logits/rejected": -0.7821192145347595, | |
| "logps/chosen": -6.363223552703857, | |
| "logps/rejected": -50.883975982666016, | |
| "loss": 0.7150736451148987, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.47810113430023193, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28776872158050537, | |
| "rewards/margins": 2.793571710586548, | |
| "rewards/rejected": -2.505803108215332, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.2991538962191586, | |
| "grad_norm": 5.158674716949463, | |
| "learning_rate": 0.00019867565129544096, | |
| "logits/chosen": -0.7358605861663818, | |
| "logits/rejected": -0.7439287900924683, | |
| "logps/chosen": -7.443007469177246, | |
| "logps/rejected": -38.113685607910156, | |
| "loss": 0.6584007740020752, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.46212419867515564, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1576625108718872, | |
| "rewards/margins": 2.456287384033203, | |
| "rewards/rejected": -2.2986247539520264, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.3010472753091533, | |
| "grad_norm": 1.6912269592285156, | |
| "learning_rate": 0.00019864155354303774, | |
| "logits/chosen": -0.7355219125747681, | |
| "logits/rejected": -0.7489408850669861, | |
| "logps/chosen": -6.299466133117676, | |
| "logps/rejected": -53.93749237060547, | |
| "loss": 0.4212099313735962, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3141719102859497, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.42553815245628357, | |
| "rewards/margins": 3.6282081604003906, | |
| "rewards/rejected": -3.202670097351074, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.30294065439914797, | |
| "grad_norm": 2.9518110752105713, | |
| "learning_rate": 0.00019860702539900287, | |
| "logits/chosen": -0.7960153818130493, | |
| "logits/rejected": -0.8071813583374023, | |
| "logps/chosen": -3.6753034591674805, | |
| "logps/rejected": -49.42953872680664, | |
| "loss": 0.40266910195350647, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17762762308120728, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2651080787181854, | |
| "rewards/margins": 3.387268304824829, | |
| "rewards/rejected": -3.1221606731414795, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.3048340334891427, | |
| "grad_norm": 3.5469512939453125, | |
| "learning_rate": 0.00019857206701398916, | |
| "logits/chosen": -0.8305792808532715, | |
| "logits/rejected": -0.8400905728340149, | |
| "logps/chosen": -5.762335300445557, | |
| "logps/rejected": -47.677391052246094, | |
| "loss": 0.5519442558288574, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2981826364994049, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3638038635253906, | |
| "rewards/margins": 3.451838493347168, | |
| "rewards/rejected": -3.0880346298217773, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.3067274125791373, | |
| "grad_norm": 2.6079318523406982, | |
| "learning_rate": 0.00019853667854052663, | |
| "logits/chosen": -0.8280395865440369, | |
| "logits/rejected": -0.8434029221534729, | |
| "logps/chosen": -4.625239849090576, | |
| "logps/rejected": -66.49324798583984, | |
| "loss": 0.4290291368961334, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20821890234947205, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.35179567337036133, | |
| "rewards/margins": 4.545844078063965, | |
| "rewards/rejected": -4.1940484046936035, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.308620791669132, | |
| "grad_norm": 2.6247661113739014, | |
| "learning_rate": 0.00019850086013302177, | |
| "logits/chosen": -0.8385536074638367, | |
| "logits/rejected": -0.8439200520515442, | |
| "logps/chosen": -5.475846290588379, | |
| "logps/rejected": -41.36055374145508, | |
| "loss": 0.5085667371749878, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22582083940505981, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.21153010427951813, | |
| "rewards/margins": 2.7622647285461426, | |
| "rewards/rejected": -2.550734519958496, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3105141707591267, | |
| "grad_norm": 4.81837797164917, | |
| "learning_rate": 0.00019846461194775712, | |
| "logits/chosen": -0.8339718580245972, | |
| "logits/rejected": -0.8418379426002502, | |
| "logps/chosen": -6.669006824493408, | |
| "logps/rejected": -50.45562744140625, | |
| "loss": 0.44998225569725037, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24861308932304382, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22774268686771393, | |
| "rewards/margins": 3.316464900970459, | |
| "rewards/rejected": -3.0887222290039062, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.31240754984912134, | |
| "grad_norm": 18.49859619140625, | |
| "learning_rate": 0.00019842793414289025, | |
| "logits/chosen": -0.8581401109695435, | |
| "logits/rejected": -0.8685382008552551, | |
| "logps/chosen": -8.510130882263184, | |
| "logps/rejected": -42.820594787597656, | |
| "loss": 1.1465768814086914, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8463043570518494, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06564593315124512, | |
| "rewards/margins": 2.910576343536377, | |
| "rewards/rejected": -2.844930410385132, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.31430092893911604, | |
| "grad_norm": 3.5281901359558105, | |
| "learning_rate": 0.00019839082687845335, | |
| "logits/chosen": -0.8467564582824707, | |
| "logits/rejected": -0.8614873886108398, | |
| "logps/chosen": -4.1369709968566895, | |
| "logps/rejected": -45.932647705078125, | |
| "loss": 0.5405523180961609, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36477237939834595, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.43693381547927856, | |
| "rewards/margins": 2.8673934936523438, | |
| "rewards/rejected": -2.430459499359131, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.3161943080291107, | |
| "grad_norm": 6.309659481048584, | |
| "learning_rate": 0.00019835329031635236, | |
| "logits/chosen": -0.875261664390564, | |
| "logits/rejected": -0.8817040920257568, | |
| "logps/chosen": -6.334891319274902, | |
| "logps/rejected": -44.5136604309082, | |
| "loss": 0.6270987391471863, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4417693614959717, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2866978049278259, | |
| "rewards/margins": 3.0005598068237305, | |
| "rewards/rejected": -2.7138617038726807, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.3180876871191054, | |
| "grad_norm": 2.7777206897735596, | |
| "learning_rate": 0.00019831532462036636, | |
| "logits/chosen": -0.8659749031066895, | |
| "logits/rejected": -0.8756385445594788, | |
| "logps/chosen": -4.664763450622559, | |
| "logps/rejected": -47.90147399902344, | |
| "loss": 0.40055564045906067, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19673526287078857, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.26774388551712036, | |
| "rewards/margins": 3.2054920196533203, | |
| "rewards/rejected": -2.9377481937408447, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.31998106620910005, | |
| "grad_norm": 3.458099126815796, | |
| "learning_rate": 0.00019827692995614684, | |
| "logits/chosen": -0.8792099952697754, | |
| "logits/rejected": -0.9006062150001526, | |
| "logps/chosen": -3.765416383743286, | |
| "logps/rejected": -60.21432113647461, | |
| "loss": 0.2773051857948303, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18920491635799408, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4749259054660797, | |
| "rewards/margins": 4.124298572540283, | |
| "rewards/rejected": -3.6493725776672363, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3218744452990947, | |
| "grad_norm": 8.359429359436035, | |
| "learning_rate": 0.00019823810649121688, | |
| "logits/chosen": -0.8826816082000732, | |
| "logits/rejected": -0.8891168832778931, | |
| "logps/chosen": -8.386528968811035, | |
| "logps/rejected": -48.619346618652344, | |
| "loss": 0.778719425201416, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31902748346328735, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09863989800214767, | |
| "rewards/margins": 3.2789182662963867, | |
| "rewards/rejected": -3.1802785396575928, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.3237678243890894, | |
| "grad_norm": 13.873231887817383, | |
| "learning_rate": 0.00019819885439497064, | |
| "logits/chosen": -0.9619755744934082, | |
| "logits/rejected": -0.9695166349411011, | |
| "logps/chosen": -5.436773300170898, | |
| "logps/rejected": -59.05510711669922, | |
| "loss": 0.5205389261245728, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34230145812034607, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24220561981201172, | |
| "rewards/margins": 4.29957914352417, | |
| "rewards/rejected": -4.057373046875, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.32566120347908406, | |
| "grad_norm": 3.8463759422302246, | |
| "learning_rate": 0.0001981591738386723, | |
| "logits/chosen": -0.9225479960441589, | |
| "logits/rejected": -0.9369975924491882, | |
| "logps/chosen": -8.551187515258789, | |
| "logps/rejected": -47.00754165649414, | |
| "loss": 0.6620715260505676, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4425104558467865, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32423532009124756, | |
| "rewards/margins": 3.5909903049468994, | |
| "rewards/rejected": -3.2667555809020996, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.32755458256907877, | |
| "grad_norm": 3.727912425994873, | |
| "learning_rate": 0.00019811906499545562, | |
| "logits/chosen": -0.9073245525360107, | |
| "logits/rejected": -0.9162495732307434, | |
| "logps/chosen": -5.982071876525879, | |
| "logps/rejected": -50.51770782470703, | |
| "loss": 0.5481733083724976, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3087068498134613, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.32423850893974304, | |
| "rewards/margins": 3.5125081539154053, | |
| "rewards/rejected": -3.188269853591919, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3294479616590734, | |
| "grad_norm": 2.11468505859375, | |
| "learning_rate": 0.00019807852804032305, | |
| "logits/chosen": -0.9244458079338074, | |
| "logits/rejected": -0.933106541633606, | |
| "logps/chosen": -4.452414035797119, | |
| "logps/rejected": -54.93663787841797, | |
| "loss": 0.40622979402542114, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24508938193321228, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4698372185230255, | |
| "rewards/margins": 4.054183006286621, | |
| "rewards/rejected": -3.584345817565918, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3313413407490681, | |
| "grad_norm": 2.2816247940063477, | |
| "learning_rate": 0.0001980375631501449, | |
| "logits/chosen": -0.8938907980918884, | |
| "logits/rejected": -0.9044409990310669, | |
| "logps/chosen": -6.407214164733887, | |
| "logps/rejected": -41.67128372192383, | |
| "loss": 0.517264187335968, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23160898685455322, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.16628842055797577, | |
| "rewards/margins": 2.5896196365356445, | |
| "rewards/rejected": -2.4233314990997314, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.3332347198390628, | |
| "grad_norm": 8.774862289428711, | |
| "learning_rate": 0.0001979961705036587, | |
| "logits/chosen": -0.9432955384254456, | |
| "logits/rejected": -0.9490511417388916, | |
| "logps/chosen": -9.636987686157227, | |
| "logps/rejected": -32.12892150878906, | |
| "loss": 0.8658261299133301, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4186471104621887, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2648793160915375, | |
| "rewards/margins": 1.9339655637741089, | |
| "rewards/rejected": -1.6690863370895386, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.3351280989290574, | |
| "grad_norm": 2.58535099029541, | |
| "learning_rate": 0.00019795435028146832, | |
| "logits/chosen": -0.9230942130088806, | |
| "logits/rejected": -0.9304215312004089, | |
| "logps/chosen": -5.531979084014893, | |
| "logps/rejected": -39.95973205566406, | |
| "loss": 0.517862856388092, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21315467357635498, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.38708987832069397, | |
| "rewards/margins": 2.6242735385894775, | |
| "rewards/rejected": -2.2371835708618164, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.33702147801905213, | |
| "grad_norm": 2.765552520751953, | |
| "learning_rate": 0.00019791210266604327, | |
| "logits/chosen": -0.9633134007453918, | |
| "logits/rejected": -0.9681880474090576, | |
| "logps/chosen": -9.997314453125, | |
| "logps/rejected": -49.51629638671875, | |
| "loss": 0.5439927577972412, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3282304108142853, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16391798853874207, | |
| "rewards/margins": 3.436600685119629, | |
| "rewards/rejected": -3.2726829051971436, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3389148571090468, | |
| "grad_norm": 6.450003623962402, | |
| "learning_rate": 0.00019786942784171782, | |
| "logits/chosen": -0.9957299828529358, | |
| "logits/rejected": -1.0053359270095825, | |
| "logps/chosen": -5.161239147186279, | |
| "logps/rejected": -50.02446365356445, | |
| "loss": 0.6050621271133423, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35807108879089355, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.34535130858421326, | |
| "rewards/margins": 3.329792022705078, | |
| "rewards/rejected": -2.984440565109253, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3408082361990415, | |
| "grad_norm": 13.34005355834961, | |
| "learning_rate": 0.0001978263259946903, | |
| "logits/chosen": -0.9830922484397888, | |
| "logits/rejected": -0.9981817603111267, | |
| "logps/chosen": -5.311959266662598, | |
| "logps/rejected": -53.79689025878906, | |
| "loss": 0.7078217267990112, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4622059464454651, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2304527461528778, | |
| "rewards/margins": 3.5389761924743652, | |
| "rewards/rejected": -3.308523654937744, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.34270161528903614, | |
| "grad_norm": 2.397674798965454, | |
| "learning_rate": 0.00019778279731302208, | |
| "logits/chosen": -1.0014008283615112, | |
| "logits/rejected": -1.0088224411010742, | |
| "logps/chosen": -3.664111852645874, | |
| "logps/rejected": -58.612579345703125, | |
| "loss": 0.4614037573337555, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28485679626464844, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.29827213287353516, | |
| "rewards/margins": 4.444318771362305, | |
| "rewards/rejected": -4.1460466384887695, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.34459499437903085, | |
| "grad_norm": 3.9618663787841797, | |
| "learning_rate": 0.00019773884198663702, | |
| "logits/chosen": -1.0462435483932495, | |
| "logits/rejected": -1.0496163368225098, | |
| "logps/chosen": -5.64785623550415, | |
| "logps/rejected": -44.06422805786133, | |
| "loss": 0.4265408515930176, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28328245878219604, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3340551257133484, | |
| "rewards/margins": 3.536937952041626, | |
| "rewards/rejected": -3.202882766723633, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.3464883734690255, | |
| "grad_norm": 17.443655014038086, | |
| "learning_rate": 0.0001976944602073205, | |
| "logits/chosen": -1.0237135887145996, | |
| "logits/rejected": -1.035752296447754, | |
| "logps/chosen": -6.11564302444458, | |
| "logps/rejected": -62.04539108276367, | |
| "loss": 0.6523773074150085, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4753287136554718, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09037357568740845, | |
| "rewards/margins": 4.670170783996582, | |
| "rewards/rejected": -4.57979679107666, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.34838175255902015, | |
| "grad_norm": 5.512650966644287, | |
| "learning_rate": 0.00019764965216871846, | |
| "logits/chosen": -1.0302878618240356, | |
| "logits/rejected": -1.0458002090454102, | |
| "logps/chosen": -3.419121742248535, | |
| "logps/rejected": -63.38270950317383, | |
| "loss": 0.49930378794670105, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3524174690246582, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2955472469329834, | |
| "rewards/margins": 4.947563648223877, | |
| "rewards/rejected": -4.6520161628723145, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.35027513164901486, | |
| "grad_norm": 6.747854232788086, | |
| "learning_rate": 0.0001976044180663369, | |
| "logits/chosen": -1.0561788082122803, | |
| "logits/rejected": -1.0584559440612793, | |
| "logps/chosen": -8.470739364624023, | |
| "logps/rejected": -50.98492431640625, | |
| "loss": 0.6530550718307495, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5211396813392639, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.29809102416038513, | |
| "rewards/margins": 3.9881184101104736, | |
| "rewards/rejected": -3.6900272369384766, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.3521685107390095, | |
| "grad_norm": 6.5586652755737305, | |
| "learning_rate": 0.00019755875809754068, | |
| "logits/chosen": -1.0228182077407837, | |
| "logits/rejected": -1.0410220623016357, | |
| "logps/chosen": -7.406016826629639, | |
| "logps/rejected": -69.44340515136719, | |
| "loss": 0.6502223610877991, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5331264734268188, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19563554227352142, | |
| "rewards/margins": 4.833287239074707, | |
| "rewards/rejected": -4.6376519203186035, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.3540618898290042, | |
| "grad_norm": 5.859078407287598, | |
| "learning_rate": 0.0001975126724615528, | |
| "logits/chosen": -1.0921781063079834, | |
| "logits/rejected": -1.1058279275894165, | |
| "logps/chosen": -5.384334564208984, | |
| "logps/rejected": -77.71084594726562, | |
| "loss": 0.4395386874675751, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31949254870414734, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4337487518787384, | |
| "rewards/margins": 6.361716270446777, | |
| "rewards/rejected": -5.927967071533203, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.35595526891899887, | |
| "grad_norm": 15.831610679626465, | |
| "learning_rate": 0.00019746616135945356, | |
| "logits/chosen": -1.0272451639175415, | |
| "logits/rejected": -1.0303428173065186, | |
| "logps/chosen": -12.975401878356934, | |
| "logps/rejected": -74.52774810791016, | |
| "loss": 1.1604161262512207, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6281093955039978, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.2834433913230896, | |
| "rewards/margins": 5.4041290283203125, | |
| "rewards/rejected": -5.687572002410889, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.3578486480089936, | |
| "grad_norm": 18.28084373474121, | |
| "learning_rate": 0.00019741922499417967, | |
| "logits/chosen": -1.0908275842666626, | |
| "logits/rejected": -1.1018905639648438, | |
| "logps/chosen": -11.791484832763672, | |
| "logps/rejected": -81.34092712402344, | |
| "loss": 0.8243842124938965, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.48044607043266296, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.19179318845272064, | |
| "rewards/margins": 6.231574058532715, | |
| "rewards/rejected": -6.423367500305176, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.3597420270989882, | |
| "grad_norm": 5.565955638885498, | |
| "learning_rate": 0.00019737186357052323, | |
| "logits/chosen": -1.049489140510559, | |
| "logits/rejected": -1.0638219118118286, | |
| "logps/chosen": -11.849400520324707, | |
| "logps/rejected": -77.38867950439453, | |
| "loss": 0.8963607549667358, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4650379419326782, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.17283156514167786, | |
| "rewards/margins": 5.426693916320801, | |
| "rewards/rejected": -5.5995259284973145, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.3616354061889829, | |
| "grad_norm": 14.447429656982422, | |
| "learning_rate": 0.00019732407729513107, | |
| "logits/chosen": -0.9934099912643433, | |
| "logits/rejected": -1.0042476654052734, | |
| "logps/chosen": -7.797165393829346, | |
| "logps/rejected": -61.078086853027344, | |
| "loss": 0.9133828282356262, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5914595127105713, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.22981007397174835, | |
| "rewards/margins": 4.205626964569092, | |
| "rewards/rejected": -3.975816488265991, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.3635287852789776, | |
| "grad_norm": 3.4415605068206787, | |
| "learning_rate": 0.00019727586637650373, | |
| "logits/chosen": -0.938055694103241, | |
| "logits/rejected": -0.9400723576545715, | |
| "logps/chosen": -8.713332176208496, | |
| "logps/rejected": -31.563758850097656, | |
| "loss": 0.8647351264953613, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3555485010147095, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.26367247104644775, | |
| "rewards/margins": 1.897101879119873, | |
| "rewards/rejected": -1.6334295272827148, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.36542216436897224, | |
| "grad_norm": 2.8079140186309814, | |
| "learning_rate": 0.00019722723102499445, | |
| "logits/chosen": -0.9127380847930908, | |
| "logits/rejected": -0.9193118810653687, | |
| "logps/chosen": -9.860222816467285, | |
| "logps/rejected": -32.82182312011719, | |
| "loss": 0.7513078451156616, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45012104511260986, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.39801499247550964, | |
| "rewards/margins": 1.9368736743927002, | |
| "rewards/rejected": -1.5388586521148682, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.36731554345896694, | |
| "grad_norm": 2.0083696842193604, | |
| "learning_rate": 0.00019717817145280844, | |
| "logits/chosen": -0.8076668381690979, | |
| "logits/rejected": -0.8209682703018188, | |
| "logps/chosen": -4.274347305297852, | |
| "logps/rejected": -33.934600830078125, | |
| "loss": 0.4636756479740143, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23125851154327393, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4366719722747803, | |
| "rewards/margins": 1.8356088399887085, | |
| "rewards/rejected": -1.3989369869232178, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.3692089225489616, | |
| "grad_norm": 2.961672782897949, | |
| "learning_rate": 0.0001971286878740018, | |
| "logits/chosen": -0.8038672804832458, | |
| "logits/rejected": -0.8188544511795044, | |
| "logps/chosen": -5.464829921722412, | |
| "logps/rejected": -35.65196990966797, | |
| "loss": 0.5770344138145447, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28108230233192444, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41526705026626587, | |
| "rewards/margins": 1.6502375602722168, | |
| "rewards/rejected": -1.2349704504013062, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.3711023016389563, | |
| "grad_norm": 2.441650867462158, | |
| "learning_rate": 0.0001970787805044807, | |
| "logits/chosen": -0.7855252027511597, | |
| "logits/rejected": -0.7945607900619507, | |
| "logps/chosen": -5.450367450714111, | |
| "logps/rejected": -29.437000274658203, | |
| "loss": 0.729956328868866, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3391174077987671, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.34154844284057617, | |
| "rewards/margins": 1.204176664352417, | |
| "rewards/rejected": -0.8626283407211304, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.37299568072895095, | |
| "grad_norm": 2.670504570007324, | |
| "learning_rate": 0.0001970284495620004, | |
| "logits/chosen": -0.7562150359153748, | |
| "logits/rejected": -0.7687780857086182, | |
| "logps/chosen": -5.965810775756836, | |
| "logps/rejected": -28.51659393310547, | |
| "loss": 0.649283230304718, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24607613682746887, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.30883094668388367, | |
| "rewards/margins": 1.3016407489776611, | |
| "rewards/rejected": -0.9928098320960999, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.3748890598189456, | |
| "grad_norm": 2.004596710205078, | |
| "learning_rate": 0.0001969776952661642, | |
| "logits/chosen": -0.7988819479942322, | |
| "logits/rejected": -0.8083655834197998, | |
| "logps/chosen": -3.273776054382324, | |
| "logps/rejected": -36.80686569213867, | |
| "loss": 0.399419903755188, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.09559443593025208, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.32672712206840515, | |
| "rewards/margins": 2.123263120651245, | |
| "rewards/rejected": -1.7965359687805176, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.3767824389089403, | |
| "grad_norm": 3.9536526203155518, | |
| "learning_rate": 0.00019692651783842266, | |
| "logits/chosen": -0.847248911857605, | |
| "logits/rejected": -0.855591893196106, | |
| "logps/chosen": -5.48413610458374, | |
| "logps/rejected": -42.407466888427734, | |
| "loss": 0.744387149810791, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.44560301303863525, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3550267219543457, | |
| "rewards/margins": 2.79954195022583, | |
| "rewards/rejected": -2.4445152282714844, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.37867581799893496, | |
| "grad_norm": 3.1670258045196533, | |
| "learning_rate": 0.00019687491750207254, | |
| "logits/chosen": -0.8439433574676514, | |
| "logits/rejected": -0.8627237677574158, | |
| "logps/chosen": -7.741463661193848, | |
| "logps/rejected": -68.83930206298828, | |
| "loss": 0.5499181747436523, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.43246734142303467, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2407217025756836, | |
| "rewards/margins": 4.725229263305664, | |
| "rewards/rejected": -4.4845075607299805, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.38056919708892967, | |
| "grad_norm": 2.094644069671631, | |
| "learning_rate": 0.00019682289448225574, | |
| "logits/chosen": -0.8863729238510132, | |
| "logits/rejected": -0.8907830715179443, | |
| "logps/chosen": -7.671055316925049, | |
| "logps/rejected": -44.41012954711914, | |
| "loss": 0.4959008991718292, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26474902033805847, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3542103171348572, | |
| "rewards/margins": 3.474036693572998, | |
| "rewards/rejected": -3.119826555252075, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.3824625761789243, | |
| "grad_norm": 11.448583602905273, | |
| "learning_rate": 0.00019677044900595853, | |
| "logits/chosen": -0.8807945251464844, | |
| "logits/rejected": -0.8872815370559692, | |
| "logps/chosen": -11.44729995727539, | |
| "logps/rejected": -62.735740661621094, | |
| "loss": 1.1596614122390747, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.688713014125824, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.03281363099813461, | |
| "rewards/margins": 4.351940155029297, | |
| "rewards/rejected": -4.384753704071045, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.384355955268919, | |
| "grad_norm": 6.370971202850342, | |
| "learning_rate": 0.00019671758130201033, | |
| "logits/chosen": -0.8891761898994446, | |
| "logits/rejected": -0.893890917301178, | |
| "logps/chosen": -12.073139190673828, | |
| "logps/rejected": -69.95759582519531, | |
| "loss": 0.7996310591697693, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.44943156838417053, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06105910986661911, | |
| "rewards/margins": 5.00841760635376, | |
| "rewards/rejected": -4.94735860824585, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.3862493343589137, | |
| "grad_norm": 15.760053634643555, | |
| "learning_rate": 0.0001966642916010829, | |
| "logits/chosen": -0.815875768661499, | |
| "logits/rejected": -0.8287965655326843, | |
| "logps/chosen": -7.0843329429626465, | |
| "logps/rejected": -74.68546295166016, | |
| "loss": 1.1046340465545654, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.742209792137146, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12297496199607849, | |
| "rewards/margins": 5.271447658538818, | |
| "rewards/rejected": -5.148472785949707, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.3881427134489083, | |
| "grad_norm": 6.462108135223389, | |
| "learning_rate": 0.0001966105801356892, | |
| "logits/chosen": -0.8428470492362976, | |
| "logits/rejected": -0.8488373160362244, | |
| "logps/chosen": -5.4728593826293945, | |
| "logps/rejected": -46.639549255371094, | |
| "loss": 0.5182836055755615, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28622910380363464, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.32224246859550476, | |
| "rewards/margins": 3.5525856018066406, | |
| "rewards/rejected": -3.2303428649902344, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.39003609253890303, | |
| "grad_norm": 10.162330627441406, | |
| "learning_rate": 0.00019655644714018243, | |
| "logits/chosen": -0.8311890959739685, | |
| "logits/rejected": -0.8424821496009827, | |
| "logps/chosen": -8.355030059814453, | |
| "logps/rejected": -51.8420295715332, | |
| "loss": 0.6847360730171204, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3994583189487457, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.22317469120025635, | |
| "rewards/margins": 3.7131669521331787, | |
| "rewards/rejected": -3.489992141723633, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.3919294716288977, | |
| "grad_norm": 46.052215576171875, | |
| "learning_rate": 0.00019650189285075508, | |
| "logits/chosen": -0.8170652389526367, | |
| "logits/rejected": -0.8271661400794983, | |
| "logps/chosen": -4.059424877166748, | |
| "logps/rejected": -59.41645431518555, | |
| "loss": 0.48422518372535706, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34698107838630676, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3219386041164398, | |
| "rewards/margins": 4.430522918701172, | |
| "rewards/rejected": -4.108584403991699, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.3938228507188924, | |
| "grad_norm": 6.666492938995361, | |
| "learning_rate": 0.00019644691750543767, | |
| "logits/chosen": -0.7725352048873901, | |
| "logits/rejected": -0.7822741270065308, | |
| "logps/chosen": -5.679694175720215, | |
| "logps/rejected": -48.45197296142578, | |
| "loss": 0.4621519148349762, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2669067084789276, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2976520359516144, | |
| "rewards/margins": 3.225492238998413, | |
| "rewards/rejected": -2.9278407096862793, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.39571622980888704, | |
| "grad_norm": 5.6893768310546875, | |
| "learning_rate": 0.00019639152134409804, | |
| "logits/chosen": -0.735471785068512, | |
| "logits/rejected": -0.7498069405555725, | |
| "logps/chosen": -6.4797258377075195, | |
| "logps/rejected": -64.09175872802734, | |
| "loss": 0.4735986888408661, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3434915244579315, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32974106073379517, | |
| "rewards/margins": 3.6602020263671875, | |
| "rewards/rejected": -3.330461025238037, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.39760960889888175, | |
| "grad_norm": 16.44124984741211, | |
| "learning_rate": 0.00019633570460844002, | |
| "logits/chosen": -0.7513502836227417, | |
| "logits/rejected": -0.7627707719802856, | |
| "logps/chosen": -7.414983749389648, | |
| "logps/rejected": -51.88617706298828, | |
| "loss": 0.6197516918182373, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45195478200912476, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.28587087988853455, | |
| "rewards/margins": 3.576326847076416, | |
| "rewards/rejected": -3.2904555797576904, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.3995029879888764, | |
| "grad_norm": 5.624166965484619, | |
| "learning_rate": 0.00019627946754200253, | |
| "logits/chosen": -0.7246634364128113, | |
| "logits/rejected": -0.7336344718933105, | |
| "logps/chosen": -8.098308563232422, | |
| "logps/rejected": -55.1407356262207, | |
| "loss": 0.48521894216537476, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3496650457382202, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3241997957229614, | |
| "rewards/margins": 3.7958688735961914, | |
| "rewards/rejected": -3.4716691970825195, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.40139636707887105, | |
| "grad_norm": 1.7889741659164429, | |
| "learning_rate": 0.00019622281039015843, | |
| "logits/chosen": -0.7441357374191284, | |
| "logits/rejected": -0.7580739855766296, | |
| "logps/chosen": -3.684328556060791, | |
| "logps/rejected": -56.209293365478516, | |
| "loss": 0.33327439427375793, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20535799860954285, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.30587002635002136, | |
| "rewards/margins": 3.881227970123291, | |
| "rewards/rejected": -3.5753583908081055, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.40328974616886576, | |
| "grad_norm": 2.787834882736206, | |
| "learning_rate": 0.00019616573340011355, | |
| "logits/chosen": -0.7508048415184021, | |
| "logits/rejected": -0.7553164958953857, | |
| "logps/chosen": -4.937004089355469, | |
| "logps/rejected": -43.78971862792969, | |
| "loss": 0.5410025119781494, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29258573055267334, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.41944828629493713, | |
| "rewards/margins": 3.099458694458008, | |
| "rewards/rejected": -2.6800098419189453, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.4051831252588604, | |
| "grad_norm": 12.853190422058105, | |
| "learning_rate": 0.0001961082368209055, | |
| "logits/chosen": -0.7836991548538208, | |
| "logits/rejected": -0.7966538667678833, | |
| "logps/chosen": -4.6951093673706055, | |
| "logps/rejected": -51.65924835205078, | |
| "loss": 0.9481589794158936, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.49695920944213867, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.05445462837815285, | |
| "rewards/margins": 3.114589214324951, | |
| "rewards/rejected": -3.0601344108581543, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.4070765043488551, | |
| "grad_norm": 5.1839704513549805, | |
| "learning_rate": 0.00019605032090340267, | |
| "logits/chosen": -0.8062314987182617, | |
| "logits/rejected": -0.8129691481590271, | |
| "logps/chosen": -4.397279739379883, | |
| "logps/rejected": -42.56846237182617, | |
| "loss": 0.7058886289596558, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34186726808547974, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12627288699150085, | |
| "rewards/margins": 2.8559820652008057, | |
| "rewards/rejected": -2.7297093868255615, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.40896988343884977, | |
| "grad_norm": 2.8434062004089355, | |
| "learning_rate": 0.0001959919859003031, | |
| "logits/chosen": -0.7388439178466797, | |
| "logits/rejected": -0.7492343187332153, | |
| "logps/chosen": -3.2313055992126465, | |
| "logps/rejected": -54.10618591308594, | |
| "loss": 0.33251953125, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20878179371356964, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.42627185583114624, | |
| "rewards/margins": 3.7635509967803955, | |
| "rewards/rejected": -3.3372793197631836, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4108632625288444, | |
| "grad_norm": 3.8040099143981934, | |
| "learning_rate": 0.00019593323206613331, | |
| "logits/chosen": -0.7919730544090271, | |
| "logits/rejected": -0.8036046028137207, | |
| "logps/chosen": -7.406411647796631, | |
| "logps/rejected": -57.45484924316406, | |
| "loss": 0.6115871667861938, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32974275946617126, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.29590100049972534, | |
| "rewards/margins": 3.664919376373291, | |
| "rewards/rejected": -3.369018077850342, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4127566416188391, | |
| "grad_norm": 2.7392921447753906, | |
| "learning_rate": 0.0001958740596572474, | |
| "logits/chosen": -0.7719218730926514, | |
| "logits/rejected": -0.7802299857139587, | |
| "logps/chosen": -2.140526056289673, | |
| "logps/rejected": -53.021087646484375, | |
| "loss": 0.328443706035614, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12891747057437897, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3535212278366089, | |
| "rewards/margins": 3.531355381011963, | |
| "rewards/rejected": -3.1778340339660645, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4146500207088338, | |
| "grad_norm": 2.372682809829712, | |
| "learning_rate": 0.00019581446893182565, | |
| "logits/chosen": -0.7669311165809631, | |
| "logits/rejected": -0.7759067416191101, | |
| "logps/chosen": -4.876304626464844, | |
| "logps/rejected": -45.05213928222656, | |
| "loss": 0.42399588227272034, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17316851019859314, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3615014851093292, | |
| "rewards/margins": 2.848667621612549, | |
| "rewards/rejected": -2.487166166305542, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4165433997988285, | |
| "grad_norm": 2.5566980838775635, | |
| "learning_rate": 0.00019575446014987363, | |
| "logits/chosen": -0.7663781046867371, | |
| "logits/rejected": -0.7778026461601257, | |
| "logps/chosen": -9.037557601928711, | |
| "logps/rejected": -41.32817459106445, | |
| "loss": 0.670400857925415, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3820984661579132, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2986691892147064, | |
| "rewards/margins": 2.576287031173706, | |
| "rewards/rejected": -2.2776176929473877, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.41843677888882314, | |
| "grad_norm": 2.0137414932250977, | |
| "learning_rate": 0.0001956940335732209, | |
| "logits/chosen": -0.7961980104446411, | |
| "logits/rejected": -0.8072370290756226, | |
| "logps/chosen": -5.287474632263184, | |
| "logps/rejected": -52.39486312866211, | |
| "loss": 0.4247521758079529, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2258274108171463, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.46624377369880676, | |
| "rewards/margins": 3.2418112754821777, | |
| "rewards/rejected": -2.7755677700042725, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.42033015797881784, | |
| "grad_norm": 9.485119819641113, | |
| "learning_rate": 0.00019563318946551998, | |
| "logits/chosen": -0.7868661880493164, | |
| "logits/rejected": -0.7932162880897522, | |
| "logps/chosen": -4.125566482543945, | |
| "logps/rejected": -41.510528564453125, | |
| "loss": 0.45158693194389343, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2398645132780075, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3339860439300537, | |
| "rewards/margins": 2.9751968383789062, | |
| "rewards/rejected": -2.6412105560302734, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.4222235370688125, | |
| "grad_norm": 1.728522777557373, | |
| "learning_rate": 0.00019557192809224513, | |
| "logits/chosen": -0.8158318996429443, | |
| "logits/rejected": -0.8269481062889099, | |
| "logps/chosen": -6.187929630279541, | |
| "logps/rejected": -65.49488830566406, | |
| "loss": 0.3769925534725189, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20739418268203735, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.5454128980636597, | |
| "rewards/margins": 3.809990882873535, | |
| "rewards/rejected": -3.264577865600586, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.42411691615880714, | |
| "grad_norm": 3.2084922790527344, | |
| "learning_rate": 0.00019551024972069126, | |
| "logits/chosen": -0.765777051448822, | |
| "logits/rejected": -0.7758392095565796, | |
| "logps/chosen": -5.901573181152344, | |
| "logps/rejected": -52.30465316772461, | |
| "loss": 0.618301272392273, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3325042426586151, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.33851462602615356, | |
| "rewards/margins": 2.8817224502563477, | |
| "rewards/rejected": -2.5432076454162598, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.42601029524880185, | |
| "grad_norm": 3.7956161499023438, | |
| "learning_rate": 0.00019544815461997264, | |
| "logits/chosen": -0.8206179141998291, | |
| "logits/rejected": -0.8290830850601196, | |
| "logps/chosen": -5.066240310668945, | |
| "logps/rejected": -51.627464294433594, | |
| "loss": 0.5323878526687622, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34584906697273254, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36647719144821167, | |
| "rewards/margins": 3.2682008743286133, | |
| "rewards/rejected": -2.9017233848571777, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4279036743387965, | |
| "grad_norm": 6.160758972167969, | |
| "learning_rate": 0.00019538564306102195, | |
| "logits/chosen": -0.8133172988891602, | |
| "logits/rejected": -0.8209658861160278, | |
| "logps/chosen": -7.938709259033203, | |
| "logps/rejected": -49.04197311401367, | |
| "loss": 0.6256651878356934, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45015066862106323, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21895331144332886, | |
| "rewards/margins": 3.475795269012451, | |
| "rewards/rejected": -3.2568421363830566, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4297970534287912, | |
| "grad_norm": 3.3720943927764893, | |
| "learning_rate": 0.00019532271531658878, | |
| "logits/chosen": -0.8342875242233276, | |
| "logits/rejected": -0.8426697254180908, | |
| "logps/chosen": -5.65493106842041, | |
| "logps/rejected": -56.189483642578125, | |
| "loss": 0.550865888595581, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32167327404022217, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18321865797042847, | |
| "rewards/margins": 4.062854766845703, | |
| "rewards/rejected": -3.879636287689209, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.43169043251878586, | |
| "grad_norm": 7.045608043670654, | |
| "learning_rate": 0.00019525937166123877, | |
| "logits/chosen": -0.8390461802482605, | |
| "logits/rejected": -0.848449170589447, | |
| "logps/chosen": -4.815664768218994, | |
| "logps/rejected": -59.5663948059082, | |
| "loss": 0.5792067050933838, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35179653763771057, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.08492806553840637, | |
| "rewards/margins": 3.999222993850708, | |
| "rewards/rejected": -3.914294719696045, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.43358381160878057, | |
| "grad_norm": 3.3884899616241455, | |
| "learning_rate": 0.00019519561237135214, | |
| "logits/chosen": -0.8333678841590881, | |
| "logits/rejected": -0.8382862210273743, | |
| "logps/chosen": -6.737687110900879, | |
| "logps/rejected": -47.592185974121094, | |
| "loss": 0.46553468704223633, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2802257835865021, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3542218804359436, | |
| "rewards/margins": 3.4753262996673584, | |
| "rewards/rejected": -3.1211044788360596, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4354771906987752, | |
| "grad_norm": 1.4453233480453491, | |
| "learning_rate": 0.00019513143772512267, | |
| "logits/chosen": -0.8504279851913452, | |
| "logits/rejected": -0.8653618097305298, | |
| "logps/chosen": -6.069849491119385, | |
| "logps/rejected": -61.96661376953125, | |
| "loss": 0.35670334100723267, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27682676911354065, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4068211615085602, | |
| "rewards/margins": 4.582265853881836, | |
| "rewards/rejected": -4.175444602966309, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.43737056978876987, | |
| "grad_norm": 2.451911687850952, | |
| "learning_rate": 0.0001950668480025564, | |
| "logits/chosen": -0.8143424391746521, | |
| "logits/rejected": -0.820701003074646, | |
| "logps/chosen": -5.882935047149658, | |
| "logps/rejected": -41.83823013305664, | |
| "loss": 0.413090318441391, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25027984380722046, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4448525905609131, | |
| "rewards/margins": 3.033524990081787, | |
| "rewards/rejected": -2.588672637939453, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.4392639488787646, | |
| "grad_norm": 3.493765354156494, | |
| "learning_rate": 0.00019500184348547042, | |
| "logits/chosen": -0.8186232447624207, | |
| "logits/rejected": -0.8271446228027344, | |
| "logps/chosen": -5.602138042449951, | |
| "logps/rejected": -53.67842102050781, | |
| "loss": 0.523601233959198, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30448588728904724, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.284013032913208, | |
| "rewards/margins": 3.9659247398376465, | |
| "rewards/rejected": -3.6819119453430176, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4411573279687592, | |
| "grad_norm": 2.912060260772705, | |
| "learning_rate": 0.00019493642445749166, | |
| "logits/chosen": -0.842425525188446, | |
| "logits/rejected": -0.8589853644371033, | |
| "logps/chosen": -3.74099063873291, | |
| "logps/rejected": -57.953006744384766, | |
| "loss": 0.36314085125923157, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2760802209377289, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.443424254655838, | |
| "rewards/margins": 4.425593852996826, | |
| "rewards/rejected": -3.9821696281433105, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.44305070705875393, | |
| "grad_norm": 12.398122787475586, | |
| "learning_rate": 0.0001948705912040556, | |
| "logits/chosen": -0.7788976430892944, | |
| "logits/rejected": -0.7920855283737183, | |
| "logps/chosen": -9.004324913024902, | |
| "logps/rejected": -57.34058380126953, | |
| "loss": 0.47224855422973633, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3402937054634094, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19586092233657837, | |
| "rewards/margins": 3.8706259727478027, | |
| "rewards/rejected": -3.67476487159729, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4449440861487486, | |
| "grad_norm": 4.74459981918335, | |
| "learning_rate": 0.00019480434401240512, | |
| "logits/chosen": -0.8051593899726868, | |
| "logits/rejected": -0.8183260560035706, | |
| "logps/chosen": -6.355615615844727, | |
| "logps/rejected": -56.04167938232422, | |
| "loss": 0.5707345008850098, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34050434827804565, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.33054211735725403, | |
| "rewards/margins": 3.9471776485443115, | |
| "rewards/rejected": -3.616635799407959, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.4468374652387433, | |
| "grad_norm": 6.874378681182861, | |
| "learning_rate": 0.0001947376831715892, | |
| "logits/chosen": -0.7758195400238037, | |
| "logits/rejected": -0.788472592830658, | |
| "logps/chosen": -5.814244270324707, | |
| "logps/rejected": -54.79585266113281, | |
| "loss": 0.5337939262390137, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3693539500236511, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13278648257255554, | |
| "rewards/margins": 3.429861545562744, | |
| "rewards/rejected": -3.297075033187866, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.44873084432873794, | |
| "grad_norm": 5.422703742980957, | |
| "learning_rate": 0.00019467060897246157, | |
| "logits/chosen": -0.7782034277915955, | |
| "logits/rejected": -0.7840334177017212, | |
| "logps/chosen": -8.718152046203613, | |
| "logps/rejected": -41.60744857788086, | |
| "loss": 0.7435796856880188, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4146505296230316, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09374925494194031, | |
| "rewards/margins": 2.6359703540802, | |
| "rewards/rejected": -2.5422208309173584, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4506242234187326, | |
| "grad_norm": 2.3289687633514404, | |
| "learning_rate": 0.00019460312170767956, | |
| "logits/chosen": -0.7645810842514038, | |
| "logits/rejected": -0.7797269821166992, | |
| "logps/chosen": -5.059871673583984, | |
| "logps/rejected": -64.65418243408203, | |
| "loss": 0.3661719858646393, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25765132904052734, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.39239248633384705, | |
| "rewards/margins": 4.386118412017822, | |
| "rewards/rejected": -3.9937262535095215, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4525176025087273, | |
| "grad_norm": 1.4744064807891846, | |
| "learning_rate": 0.0001945352216717028, | |
| "logits/chosen": -0.831943154335022, | |
| "logits/rejected": -0.8483419418334961, | |
| "logps/chosen": -5.389368534088135, | |
| "logps/rejected": -62.634124755859375, | |
| "loss": 0.29625532031059265, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19564969837665558, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4885157346725464, | |
| "rewards/margins": 4.1885905265808105, | |
| "rewards/rejected": -3.700075149536133, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.45441098159872195, | |
| "grad_norm": 10.076432228088379, | |
| "learning_rate": 0.0001944669091607919, | |
| "logits/chosen": -0.7903633117675781, | |
| "logits/rejected": -0.796679675579071, | |
| "logps/chosen": -6.789815902709961, | |
| "logps/rejected": -46.970340728759766, | |
| "loss": 0.6889331340789795, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4780619740486145, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2585870325565338, | |
| "rewards/margins": 3.206406593322754, | |
| "rewards/rejected": -2.947819709777832, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.45630436068871666, | |
| "grad_norm": 3.162611961364746, | |
| "learning_rate": 0.00019439818447300716, | |
| "logits/chosen": -0.7782495617866516, | |
| "logits/rejected": -0.793842077255249, | |
| "logps/chosen": -6.149593353271484, | |
| "logps/rejected": -57.481685638427734, | |
| "loss": 0.35159918665885925, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26541072130203247, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4303516149520874, | |
| "rewards/margins": 3.7947804927825928, | |
| "rewards/rejected": -3.364428997039795, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.4581977397787113, | |
| "grad_norm": 2.6365225315093994, | |
| "learning_rate": 0.00019432904790820735, | |
| "logits/chosen": -0.779421329498291, | |
| "logits/rejected": -0.7866885662078857, | |
| "logps/chosen": -4.453818321228027, | |
| "logps/rejected": -48.04380798339844, | |
| "loss": 0.5028890371322632, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3481641113758087, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.17416518926620483, | |
| "rewards/margins": 3.206613063812256, | |
| "rewards/rejected": -3.0324478149414062, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.460091118868706, | |
| "grad_norm": 4.328489780426025, | |
| "learning_rate": 0.00019425949976804827, | |
| "logits/chosen": -0.7438924312591553, | |
| "logits/rejected": -0.7507935762405396, | |
| "logps/chosen": -10.080765724182129, | |
| "logps/rejected": -45.97163009643555, | |
| "loss": 0.5210501551628113, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32953721284866333, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3890751004219055, | |
| "rewards/margins": 3.2612807750701904, | |
| "rewards/rejected": -2.8722057342529297, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.46198449795870067, | |
| "grad_norm": 2.42315673828125, | |
| "learning_rate": 0.00019418954035598152, | |
| "logits/chosen": -0.8272375464439392, | |
| "logits/rejected": -0.8359189033508301, | |
| "logps/chosen": -6.97105073928833, | |
| "logps/rejected": -54.705596923828125, | |
| "loss": 0.39850807189941406, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23200449347496033, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2904537618160248, | |
| "rewards/margins": 3.9579145908355713, | |
| "rewards/rejected": -3.6674604415893555, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4638778770486953, | |
| "grad_norm": 11.622922897338867, | |
| "learning_rate": 0.00019411916997725314, | |
| "logits/chosen": -0.804512619972229, | |
| "logits/rejected": -0.8301945924758911, | |
| "logps/chosen": -5.534765243530273, | |
| "logps/rejected": -75.79460144042969, | |
| "loss": 0.3892122805118561, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2879936993122101, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24686971306800842, | |
| "rewards/margins": 5.173652172088623, | |
| "rewards/rejected": -4.926782608032227, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.46577125613869, | |
| "grad_norm": 29.126651763916016, | |
| "learning_rate": 0.00019404838893890235, | |
| "logits/chosen": -0.8384321928024292, | |
| "logits/rejected": -0.8446701169013977, | |
| "logps/chosen": -6.7067742347717285, | |
| "logps/rejected": -56.584373474121094, | |
| "loss": 0.4600946009159088, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27550381422042847, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.273784339427948, | |
| "rewards/margins": 3.861654281616211, | |
| "rewards/rejected": -3.587869882583618, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4676646352286847, | |
| "grad_norm": 1.977882981300354, | |
| "learning_rate": 0.0001939771975497601, | |
| "logits/chosen": -0.8426949977874756, | |
| "logits/rejected": -0.855405330657959, | |
| "logps/chosen": -8.002025604248047, | |
| "logps/rejected": -68.733154296875, | |
| "loss": 0.41115817427635193, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31340885162353516, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.39579659700393677, | |
| "rewards/margins": 5.0697808265686035, | |
| "rewards/rejected": -4.673984527587891, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.4695580143186794, | |
| "grad_norm": 6.719147205352783, | |
| "learning_rate": 0.0001939055961204478, | |
| "logits/chosen": -0.8593066334724426, | |
| "logits/rejected": -0.871523916721344, | |
| "logps/chosen": -8.719642639160156, | |
| "logps/rejected": -73.46538543701172, | |
| "loss": 0.5661371946334839, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28518250584602356, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1493295133113861, | |
| "rewards/margins": 5.667934417724609, | |
| "rewards/rejected": -5.5186052322387695, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.47145139340867404, | |
| "grad_norm": 3.4157960414886475, | |
| "learning_rate": 0.00019383358496337594, | |
| "logits/chosen": -0.8707897067070007, | |
| "logits/rejected": -0.8835899233818054, | |
| "logps/chosen": -8.206844329833984, | |
| "logps/rejected": -70.05189514160156, | |
| "loss": 0.5082112550735474, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3844239413738251, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40558338165283203, | |
| "rewards/margins": 5.734279155731201, | |
| "rewards/rejected": -5.328695297241211, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.47334477249866874, | |
| "grad_norm": 2.3171849250793457, | |
| "learning_rate": 0.00019376116439274275, | |
| "logits/chosen": -0.8690236210823059, | |
| "logits/rejected": -0.8809092044830322, | |
| "logps/chosen": -7.636664390563965, | |
| "logps/rejected": -67.01061248779297, | |
| "loss": 0.5090566873550415, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34755271673202515, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2747221887111664, | |
| "rewards/margins": 4.926432132720947, | |
| "rewards/rejected": -4.651710033416748, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.4752381515886634, | |
| "grad_norm": 5.929121494293213, | |
| "learning_rate": 0.00019368833472453275, | |
| "logits/chosen": -0.8622236847877502, | |
| "logits/rejected": -0.8675254583358765, | |
| "logps/chosen": -6.978309631347656, | |
| "logps/rejected": -59.03238296508789, | |
| "loss": 0.6428236365318298, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3348870873451233, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.00988294929265976, | |
| "rewards/margins": 4.309958457946777, | |
| "rewards/rejected": -4.300075531005859, | |
| "step": 251, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.47713153067865804, | |
| "grad_norm": 2.0272998809814453, | |
| "learning_rate": 0.00019361509627651547, | |
| "logits/chosen": -0.8882036805152893, | |
| "logits/rejected": -0.894838809967041, | |
| "logps/chosen": -5.545462608337402, | |
| "logps/rejected": -53.88817596435547, | |
| "loss": 0.3966207802295685, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2131766378879547, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.36596545577049255, | |
| "rewards/margins": 4.208477973937988, | |
| "rewards/rejected": -3.842512607574463, | |
| "step": 252, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.47902490976865275, | |
| "grad_norm": 5.7287468910217285, | |
| "learning_rate": 0.00019354144936824401, | |
| "logits/chosen": -0.8320537209510803, | |
| "logits/rejected": -0.8402711153030396, | |
| "logps/chosen": -6.792182445526123, | |
| "logps/rejected": -54.659339904785156, | |
| "loss": 0.4517640769481659, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3251955211162567, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.33542922139167786, | |
| "rewards/margins": 3.7679901123046875, | |
| "rewards/rejected": -3.432560920715332, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.4809182888586474, | |
| "grad_norm": 18.151660919189453, | |
| "learning_rate": 0.00019346739432105374, | |
| "logits/chosen": -0.8174375295639038, | |
| "logits/rejected": -0.8378430604934692, | |
| "logps/chosen": -8.57436466217041, | |
| "logps/rejected": -62.255455017089844, | |
| "loss": 0.7509753108024597, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6498162746429443, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.266471803188324, | |
| "rewards/margins": 3.990063428878784, | |
| "rewards/rejected": -3.7235915660858154, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.4828116679486421, | |
| "grad_norm": 12.132912635803223, | |
| "learning_rate": 0.00019339293145806066, | |
| "logits/chosen": -0.8464425802230835, | |
| "logits/rejected": -0.8538373708724976, | |
| "logps/chosen": -6.4575605392456055, | |
| "logps/rejected": -50.951087951660156, | |
| "loss": 0.4662426710128784, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3501847982406616, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22113488614559174, | |
| "rewards/margins": 3.7245137691497803, | |
| "rewards/rejected": -3.5033788681030273, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.48470504703863676, | |
| "grad_norm": 14.220233917236328, | |
| "learning_rate": 0.00019331806110416027, | |
| "logits/chosen": -0.8058353066444397, | |
| "logits/rejected": -0.8215208053588867, | |
| "logps/chosen": -6.208203315734863, | |
| "logps/rejected": -65.32124328613281, | |
| "loss": 0.9521104097366333, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7899406552314758, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07534287869930267, | |
| "rewards/margins": 3.819141387939453, | |
| "rewards/rejected": -3.7437989711761475, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.48659842612863147, | |
| "grad_norm": 5.3797173500061035, | |
| "learning_rate": 0.000193242783586026, | |
| "logits/chosen": -0.8115130066871643, | |
| "logits/rejected": -0.8261612057685852, | |
| "logps/chosen": -4.243943691253662, | |
| "logps/rejected": -64.59398651123047, | |
| "loss": 0.6993451714515686, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5960971117019653, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2801298499107361, | |
| "rewards/margins": 4.3589348793029785, | |
| "rewards/rejected": -4.078805446624756, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.4884918052186261, | |
| "grad_norm": 2.5662522315979004, | |
| "learning_rate": 0.00019316709923210775, | |
| "logits/chosen": -0.7943601608276367, | |
| "logits/rejected": -0.8015127182006836, | |
| "logps/chosen": -7.6889801025390625, | |
| "logps/rejected": -54.64246368408203, | |
| "loss": 0.7327463626861572, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45545923709869385, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.21556581556797028, | |
| "rewards/margins": 3.397770643234253, | |
| "rewards/rejected": -3.1822047233581543, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.49038518430862077, | |
| "grad_norm": 25.52183723449707, | |
| "learning_rate": 0.00019309100837263068, | |
| "logits/chosen": -0.7869693040847778, | |
| "logits/rejected": -0.7915991544723511, | |
| "logps/chosen": -8.936237335205078, | |
| "logps/rejected": -42.483360290527344, | |
| "loss": 0.5518508553504944, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35867419838905334, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36850929260253906, | |
| "rewards/margins": 3.0449368953704834, | |
| "rewards/rejected": -2.6764283180236816, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.4922785633986155, | |
| "grad_norm": 1.8457614183425903, | |
| "learning_rate": 0.0001930145113395934, | |
| "logits/chosen": -0.7611051797866821, | |
| "logits/rejected": -0.7706549167633057, | |
| "logps/chosen": -4.166028022766113, | |
| "logps/rejected": -42.88038635253906, | |
| "loss": 0.5326672196388245, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26256081461906433, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.31425848603248596, | |
| "rewards/margins": 3.049826145172119, | |
| "rewards/rejected": -2.735567808151245, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.4941719424886101, | |
| "grad_norm": 4.680253028869629, | |
| "learning_rate": 0.0001929376084667669, | |
| "logits/chosen": -0.7653763890266418, | |
| "logits/rejected": -0.7684553265571594, | |
| "logps/chosen": -11.641561508178711, | |
| "logps/rejected": -33.487953186035156, | |
| "loss": 0.8013095259666443, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5253302454948425, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.34696438908576965, | |
| "rewards/margins": 2.4490063190460205, | |
| "rewards/rejected": -2.102041721343994, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.49606532157860483, | |
| "grad_norm": 1.6427733898162842, | |
| "learning_rate": 0.00019286030008969283, | |
| "logits/chosen": -0.7503105401992798, | |
| "logits/rejected": -0.7532596588134766, | |
| "logps/chosen": -3.582320213317871, | |
| "logps/rejected": -44.282466888427734, | |
| "loss": 0.3885384798049927, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12933489680290222, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19427397847175598, | |
| "rewards/margins": 3.2359180450439453, | |
| "rewards/rejected": -3.041644334793091, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.4979587006685995, | |
| "grad_norm": 2.3090734481811523, | |
| "learning_rate": 0.00019278258654568218, | |
| "logits/chosen": -0.763583779335022, | |
| "logits/rejected": -0.7730581760406494, | |
| "logps/chosen": -9.824563980102539, | |
| "logps/rejected": -51.514068603515625, | |
| "loss": 0.5489881038665771, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3023039996623993, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.5053662061691284, | |
| "rewards/margins": 3.4952330589294434, | |
| "rewards/rejected": -2.9898667335510254, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.4998520797585942, | |
| "grad_norm": 1.4782931804656982, | |
| "learning_rate": 0.00019270446817381377, | |
| "logits/chosen": -0.7714170813560486, | |
| "logits/rejected": -0.7751628160476685, | |
| "logps/chosen": -7.587092399597168, | |
| "logps/rejected": -46.782779693603516, | |
| "loss": 0.5135377049446106, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3512042164802551, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40125563740730286, | |
| "rewards/margins": 3.7470357418060303, | |
| "rewards/rejected": -3.345780372619629, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5017454588485888, | |
| "grad_norm": 4.727572917938232, | |
| "learning_rate": 0.0001926259453149327, | |
| "logits/chosen": -0.7314101457595825, | |
| "logits/rejected": -0.7375609874725342, | |
| "logps/chosen": -5.705110549926758, | |
| "logps/rejected": -57.362266540527344, | |
| "loss": 0.5352091789245605, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34295836091041565, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.31562328338623047, | |
| "rewards/margins": 4.008930683135986, | |
| "rewards/rejected": -3.693307399749756, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5036388379385836, | |
| "grad_norm": 4.0496649742126465, | |
| "learning_rate": 0.00019254701831164893, | |
| "logits/chosen": -0.7853831648826599, | |
| "logits/rejected": -0.7986811995506287, | |
| "logps/chosen": -4.441198348999023, | |
| "logps/rejected": -53.076751708984375, | |
| "loss": 0.3684377670288086, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2579481899738312, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46632638573646545, | |
| "rewards/margins": 3.7940874099731445, | |
| "rewards/rejected": -3.327761173248291, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5055322170285782, | |
| "grad_norm": 5.552995204925537, | |
| "learning_rate": 0.00019246768750833586, | |
| "logits/chosen": -0.7842399477958679, | |
| "logits/rejected": -0.7948920130729675, | |
| "logps/chosen": -6.420162677764893, | |
| "logps/rejected": -59.88761520385742, | |
| "loss": 0.6227431297302246, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41716307401657104, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4504700005054474, | |
| "rewards/margins": 4.746631622314453, | |
| "rewards/rejected": -4.296161651611328, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.5074255961185729, | |
| "grad_norm": 5.908695697784424, | |
| "learning_rate": 0.0001923879532511287, | |
| "logits/chosen": -0.7927809953689575, | |
| "logits/rejected": -0.8063479065895081, | |
| "logps/chosen": -4.683359146118164, | |
| "logps/rejected": -72.5576400756836, | |
| "loss": 0.5436932444572449, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4655058979988098, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.26488012075424194, | |
| "rewards/margins": 5.25103759765625, | |
| "rewards/rejected": -4.986156940460205, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.5093189752085675, | |
| "grad_norm": 1.9154390096664429, | |
| "learning_rate": 0.00019230781588792294, | |
| "logits/chosen": -0.8069201111793518, | |
| "logits/rejected": -0.8189995884895325, | |
| "logps/chosen": -5.3705830574035645, | |
| "logps/rejected": -52.988075256347656, | |
| "loss": 0.3851671814918518, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21666651964187622, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3238618075847626, | |
| "rewards/margins": 3.722102642059326, | |
| "rewards/rejected": -3.398240327835083, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.5112123542985623, | |
| "grad_norm": 3.472141742706299, | |
| "learning_rate": 0.00019222727576837295, | |
| "logits/chosen": -0.8795083165168762, | |
| "logits/rejected": -0.8880424499511719, | |
| "logps/chosen": -4.646546363830566, | |
| "logps/rejected": -52.22845458984375, | |
| "loss": 0.4236709177494049, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2475687563419342, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.41008079051971436, | |
| "rewards/margins": 4.20516300201416, | |
| "rewards/rejected": -3.795081853866577, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.5131057333885569, | |
| "grad_norm": 5.411405563354492, | |
| "learning_rate": 0.00019214633324389046, | |
| "logits/chosen": -0.8955191969871521, | |
| "logits/rejected": -0.9028213620185852, | |
| "logps/chosen": -7.191625118255615, | |
| "logps/rejected": -64.41796112060547, | |
| "loss": 0.5999385118484497, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4318827986717224, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3819724917411804, | |
| "rewards/margins": 5.266749382019043, | |
| "rewards/rejected": -4.884777069091797, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.005605 | |
| }, | |
| { | |
| "epoch": 0.5149991124785516, | |
| "grad_norm": 2.4139254093170166, | |
| "learning_rate": 0.00019206498866764288, | |
| "logits/chosen": -0.892187774181366, | |
| "logits/rejected": -0.9053075909614563, | |
| "logps/chosen": -10.184382438659668, | |
| "logps/rejected": -61.766212463378906, | |
| "loss": 0.5961122512817383, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41012638807296753, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3639661967754364, | |
| "rewards/margins": 4.510526180267334, | |
| "rewards/rejected": -4.146560192108154, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5168924915685462, | |
| "grad_norm": 8.651139259338379, | |
| "learning_rate": 0.00019198324239455187, | |
| "logits/chosen": -0.8872772455215454, | |
| "logits/rejected": -0.9006874561309814, | |
| "logps/chosen": -8.185474395751953, | |
| "logps/rejected": -65.75993347167969, | |
| "loss": 0.8648337721824646, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3675552308559418, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.15013383328914642, | |
| "rewards/margins": 4.743319988250732, | |
| "rewards/rejected": -4.593186378479004, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5187858706585409, | |
| "grad_norm": 2.5142791271209717, | |
| "learning_rate": 0.0001919010947812918, | |
| "logits/chosen": -0.8946865200996399, | |
| "logits/rejected": -0.9012131690979004, | |
| "logps/chosen": -4.413853645324707, | |
| "logps/rejected": -56.88621520996094, | |
| "loss": 0.41415372490882874, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19099995493888855, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3928433954715729, | |
| "rewards/margins": 4.33311128616333, | |
| "rewards/rejected": -3.94026780128479, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5206792497485356, | |
| "grad_norm": 2.757438898086548, | |
| "learning_rate": 0.00019181854618628816, | |
| "logits/chosen": -0.8939404487609863, | |
| "logits/rejected": -0.9018977880477905, | |
| "logps/chosen": -6.882540702819824, | |
| "logps/rejected": -53.659786224365234, | |
| "loss": 0.5660197734832764, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31941333413124084, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27356964349746704, | |
| "rewards/margins": 3.988978147506714, | |
| "rewards/rejected": -3.7154083251953125, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5225726288385303, | |
| "grad_norm": 3.7840638160705566, | |
| "learning_rate": 0.00019173559696971594, | |
| "logits/chosen": -0.829815149307251, | |
| "logits/rejected": -0.8413034081459045, | |
| "logps/chosen": -5.10278844833374, | |
| "logps/rejected": -57.6441650390625, | |
| "loss": 0.4606822431087494, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2637704610824585, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.23584577441215515, | |
| "rewards/margins": 4.247429370880127, | |
| "rewards/rejected": -4.01158332824707, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5244660079285249, | |
| "grad_norm": 2.141832113265991, | |
| "learning_rate": 0.00019165224749349816, | |
| "logits/chosen": -0.8428906202316284, | |
| "logits/rejected": -0.8528401851654053, | |
| "logps/chosen": -5.591213703155518, | |
| "logps/rejected": -64.73967742919922, | |
| "loss": 0.2879190742969513, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20184285938739777, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3050042390823364, | |
| "rewards/margins": 4.54812479019165, | |
| "rewards/rejected": -4.2431206703186035, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5263593870185196, | |
| "grad_norm": 3.644115447998047, | |
| "learning_rate": 0.00019156849812130427, | |
| "logits/chosen": -0.8035122156143188, | |
| "logits/rejected": -0.8153725862503052, | |
| "logps/chosen": -12.309917449951172, | |
| "logps/rejected": -51.97355270385742, | |
| "loss": 0.5790233612060547, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3488881289958954, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5022516846656799, | |
| "rewards/margins": 3.658660888671875, | |
| "rewards/rejected": -3.1564090251922607, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5282527661085142, | |
| "grad_norm": 5.298548221588135, | |
| "learning_rate": 0.00019148434921854849, | |
| "logits/chosen": -0.8239580988883972, | |
| "logits/rejected": -0.8249148726463318, | |
| "logps/chosen": -6.91997766494751, | |
| "logps/rejected": -54.75133514404297, | |
| "loss": 0.4746522009372711, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2784557044506073, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1923876702785492, | |
| "rewards/margins": 3.716320276260376, | |
| "rewards/rejected": -3.523932695388794, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.530146145198509, | |
| "grad_norm": 4.2977800369262695, | |
| "learning_rate": 0.00019139980115238827, | |
| "logits/chosen": -0.7907276749610901, | |
| "logits/rejected": -0.7962623834609985, | |
| "logps/chosen": -6.527490615844727, | |
| "logps/rejected": -44.79871368408203, | |
| "loss": 0.47257882356643677, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35276007652282715, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2639794945716858, | |
| "rewards/margins": 2.987936019897461, | |
| "rewards/rejected": -2.723956346511841, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5320395242885037, | |
| "grad_norm": 3.901082754135132, | |
| "learning_rate": 0.00019131485429172278, | |
| "logits/chosen": -0.7934513092041016, | |
| "logits/rejected": -0.8078168630599976, | |
| "logps/chosen": -6.55319881439209, | |
| "logps/rejected": -61.66103744506836, | |
| "loss": 0.37024247646331787, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28827083110809326, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24689851701259613, | |
| "rewards/margins": 3.8940815925598145, | |
| "rewards/rejected": -3.647183418273926, | |
| "step": 281, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5339329033784983, | |
| "grad_norm": 2.530467987060547, | |
| "learning_rate": 0.0001912295090071911, | |
| "logits/chosen": -0.7923294901847839, | |
| "logits/rejected": -0.7994742393493652, | |
| "logps/chosen": -6.937150001525879, | |
| "logps/rejected": -56.21875, | |
| "loss": 0.5143358111381531, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3873366713523865, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.174740269780159, | |
| "rewards/margins": 4.219673156738281, | |
| "rewards/rejected": -4.044933319091797, | |
| "step": 282, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.535826282468493, | |
| "grad_norm": 2.29225754737854, | |
| "learning_rate": 0.00019114376567117074, | |
| "logits/chosen": -0.8077491521835327, | |
| "logits/rejected": -0.8139883279800415, | |
| "logps/chosen": -4.497866630554199, | |
| "logps/rejected": -47.65617370605469, | |
| "loss": 0.3458153009414673, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23723626136779785, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32140105962753296, | |
| "rewards/margins": 3.6276650428771973, | |
| "rewards/rejected": -3.3062644004821777, | |
| "step": 283, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5377196615584877, | |
| "grad_norm": 2.587045431137085, | |
| "learning_rate": 0.00019105762465777598, | |
| "logits/chosen": -0.76796555519104, | |
| "logits/rejected": -0.7804409265518188, | |
| "logps/chosen": -6.710290908813477, | |
| "logps/rejected": -55.04357147216797, | |
| "loss": 0.6548448204994202, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41518449783325195, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.23511014878749847, | |
| "rewards/margins": 3.4961049556732178, | |
| "rewards/rejected": -3.2609944343566895, | |
| "step": 284, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5396130406484824, | |
| "grad_norm": 2.1301791667938232, | |
| "learning_rate": 0.00019097108634285624, | |
| "logits/chosen": -0.7952322363853455, | |
| "logits/rejected": -0.8057968616485596, | |
| "logps/chosen": -5.858229637145996, | |
| "logps/rejected": -66.42866516113281, | |
| "loss": 0.37013787031173706, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2697468400001526, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23830053210258484, | |
| "rewards/margins": 4.619449615478516, | |
| "rewards/rejected": -4.381148815155029, | |
| "step": 285, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.541506419738477, | |
| "grad_norm": 14.95060920715332, | |
| "learning_rate": 0.00019088415110399444, | |
| "logits/chosen": -0.8046155571937561, | |
| "logits/rejected": -0.8122010827064514, | |
| "logps/chosen": -6.331181526184082, | |
| "logps/rejected": -64.72640228271484, | |
| "loss": 0.3927690088748932, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26214665174484253, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19679710268974304, | |
| "rewards/margins": 5.021756649017334, | |
| "rewards/rejected": -4.824959754943848, | |
| "step": 286, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5433997988284717, | |
| "grad_norm": 4.531976699829102, | |
| "learning_rate": 0.00019079681932050542, | |
| "logits/chosen": -0.7703898549079895, | |
| "logits/rejected": -0.7752258777618408, | |
| "logps/chosen": -5.728086471557617, | |
| "logps/rejected": -57.623958587646484, | |
| "loss": 0.4262126386165619, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27883288264274597, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2624058723449707, | |
| "rewards/margins": 4.643805503845215, | |
| "rewards/rejected": -4.3814005851745605, | |
| "step": 287, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5452931779184663, | |
| "grad_norm": 2.6767520904541016, | |
| "learning_rate": 0.00019070909137343408, | |
| "logits/chosen": -0.8187030553817749, | |
| "logits/rejected": -0.8257608413696289, | |
| "logps/chosen": -6.29841423034668, | |
| "logps/rejected": -66.14295959472656, | |
| "loss": 0.3371083736419678, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.210712268948555, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22904178500175476, | |
| "rewards/margins": 4.86109733581543, | |
| "rewards/rejected": -4.632055282592773, | |
| "step": 288, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5471865570084611, | |
| "grad_norm": 9.247986793518066, | |
| "learning_rate": 0.000190620967645554, | |
| "logits/chosen": -0.7456453442573547, | |
| "logits/rejected": -0.758894681930542, | |
| "logps/chosen": -5.9966888427734375, | |
| "logps/rejected": -89.31047821044922, | |
| "loss": 0.376960426568985, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32863202691078186, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40128135681152344, | |
| "rewards/margins": 6.478516578674316, | |
| "rewards/rejected": -6.077235221862793, | |
| "step": 289, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5490799360984557, | |
| "grad_norm": 4.125120162963867, | |
| "learning_rate": 0.00019053244852136554, | |
| "logits/chosen": -0.720355749130249, | |
| "logits/rejected": -0.7238030433654785, | |
| "logps/chosen": -7.328817367553711, | |
| "logps/rejected": -54.47208023071289, | |
| "loss": 0.5468963384628296, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.313761830329895, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.20256341993808746, | |
| "rewards/margins": 4.272522926330566, | |
| "rewards/rejected": -4.06995964050293, | |
| "step": 290, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5509733151884504, | |
| "grad_norm": 16.452295303344727, | |
| "learning_rate": 0.00019044353438709425, | |
| "logits/chosen": -0.7850386500358582, | |
| "logits/rejected": -0.7899038195610046, | |
| "logps/chosen": -8.804156303405762, | |
| "logps/rejected": -50.80997848510742, | |
| "loss": 0.41979584097862244, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2754655182361603, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2856299877166748, | |
| "rewards/margins": 3.883333206176758, | |
| "rewards/rejected": -3.597702980041504, | |
| "step": 291, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.552866694278445, | |
| "grad_norm": 1.7969173192977905, | |
| "learning_rate": 0.0001903542256306892, | |
| "logits/chosen": -0.7434848546981812, | |
| "logits/rejected": -0.7542124390602112, | |
| "logps/chosen": -5.325131416320801, | |
| "logps/rejected": -52.36528015136719, | |
| "loss": 0.3374747335910797, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18438780307769775, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2966896891593933, | |
| "rewards/margins": 3.624333381652832, | |
| "rewards/rejected": -3.327644109725952, | |
| "step": 292, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5547600733684397, | |
| "grad_norm": 1.3389047384262085, | |
| "learning_rate": 0.00019026452264182133, | |
| "logits/chosen": -0.7741931080818176, | |
| "logits/rejected": -0.7864500284194946, | |
| "logps/chosen": -3.9642157554626465, | |
| "logps/rejected": -56.372291564941406, | |
| "loss": 0.25577616691589355, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19787441194057465, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3570703864097595, | |
| "rewards/margins": 4.0897650718688965, | |
| "rewards/rejected": -3.732694149017334, | |
| "step": 293, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5566534524584345, | |
| "grad_norm": 19.48859977722168, | |
| "learning_rate": 0.0001901744258118816, | |
| "logits/chosen": -0.7488910555839539, | |
| "logits/rejected": -0.7564380764961243, | |
| "logps/chosen": -5.505663871765137, | |
| "logps/rejected": -47.65184020996094, | |
| "loss": 0.5035507082939148, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32677191495895386, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.395191490650177, | |
| "rewards/margins": 3.423536777496338, | |
| "rewards/rejected": -3.0283451080322266, | |
| "step": 294, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5585468315484291, | |
| "grad_norm": 2.008774518966675, | |
| "learning_rate": 0.00019008393553397938, | |
| "logits/chosen": -0.7502264976501465, | |
| "logits/rejected": -0.7578118443489075, | |
| "logps/chosen": -5.755902290344238, | |
| "logps/rejected": -68.1287841796875, | |
| "loss": 0.35803064703941345, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2247561663389206, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.33679965138435364, | |
| "rewards/margins": 5.233041763305664, | |
| "rewards/rejected": -4.896242618560791, | |
| "step": 295, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5604402106384238, | |
| "grad_norm": 1.3325504064559937, | |
| "learning_rate": 0.0001899930522029408, | |
| "logits/chosen": -0.8117009401321411, | |
| "logits/rejected": -0.8213991522789001, | |
| "logps/chosen": -6.647754669189453, | |
| "logps/rejected": -63.37158203125, | |
| "loss": 0.31900104880332947, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2485048770904541, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.528366208076477, | |
| "rewards/margins": 4.6781086921691895, | |
| "rewards/rejected": -4.149742603302002, | |
| "step": 296, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5623335897284184, | |
| "grad_norm": 2.195697784423828, | |
| "learning_rate": 0.00018990177621530687, | |
| "logits/chosen": -0.8317320346832275, | |
| "logits/rejected": -0.8371787071228027, | |
| "logps/chosen": -2.5732357501983643, | |
| "logps/rejected": -64.65092468261719, | |
| "loss": 0.21604421734809875, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14539764821529388, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33231592178344727, | |
| "rewards/margins": 5.368936061859131, | |
| "rewards/rejected": -5.036620140075684, | |
| "step": 297, | |
| "train_speed(iter/s)": 0.005607 | |
| }, | |
| { | |
| "epoch": 0.5642269688184132, | |
| "grad_norm": 3.2850587368011475, | |
| "learning_rate": 0.0001898101079693319, | |
| "logits/chosen": -0.8763929009437561, | |
| "logits/rejected": -0.8853050470352173, | |
| "logps/chosen": -7.0348052978515625, | |
| "logps/rejected": -73.10599517822266, | |
| "loss": 0.3883512616157532, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3356992304325104, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.44934678077697754, | |
| "rewards/margins": 5.959858417510986, | |
| "rewards/rejected": -5.510511875152588, | |
| "step": 298, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5661203479084078, | |
| "grad_norm": 73.654052734375, | |
| "learning_rate": 0.0001897180478649817, | |
| "logits/chosen": -0.8361641764640808, | |
| "logits/rejected": -0.8429641723632812, | |
| "logps/chosen": -3.9281766414642334, | |
| "logps/rejected": -61.438812255859375, | |
| "loss": 0.36019739508628845, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25969114899635315, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31078457832336426, | |
| "rewards/margins": 4.794025421142578, | |
| "rewards/rejected": -4.483240604400635, | |
| "step": 299, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5680137269984025, | |
| "grad_norm": 4.500136852264404, | |
| "learning_rate": 0.00018962559630393173, | |
| "logits/chosen": -0.8823038339614868, | |
| "logits/rejected": -0.8893939256668091, | |
| "logps/chosen": -10.261281967163086, | |
| "logps/rejected": -72.63387298583984, | |
| "loss": 0.5553180575370789, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.48980623483657837, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2931188941001892, | |
| "rewards/margins": 5.616513252258301, | |
| "rewards/rejected": -5.323395252227783, | |
| "step": 300, | |
| "train_speed(iter/s)": 0.005606 | |
| }, | |
| { | |
| "epoch": 0.5680137269984025, | |
| "eval_logits/chosen": -0.9059550762176514, | |
| "eval_logits/rejected": -0.9165492057800293, | |
| "eval_logps/chosen": -6.452853679656982, | |
| "eval_logps/rejected": -87.56333923339844, | |
| "eval_loss": 0.4157661497592926, | |
| "eval_nll_loss": 0.34246140718460083, | |
| "eval_rewards/accuracies": 0.9647058844566345, | |
| "eval_rewards/chosen": 0.3199980556964874, | |
| "eval_rewards/margins": 7.240695476531982, | |
| "eval_rewards/rejected": -6.920697212219238, | |
| "eval_runtime": 383.4477, | |
| "eval_samples_per_second": 0.443, | |
| "eval_steps_per_second": 0.443, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.5699071060883971, | |
| "grad_norm": 1.6478270292282104, | |
| "learning_rate": 0.00018953275368956555, | |
| "logits/chosen": -0.8683250546455383, | |
| "logits/rejected": -0.8765738010406494, | |
| "logps/chosen": -4.596683502197266, | |
| "logps/rejected": -71.82097625732422, | |
| "loss": 0.23614919185638428, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1724119931459427, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28458163142204285, | |
| "rewards/margins": 5.737771987915039, | |
| "rewards/rejected": -5.453190326690674, | |
| "step": 301, | |
| "train_speed(iter/s)": 0.005565 | |
| }, | |
| { | |
| "epoch": 0.5718004851783918, | |
| "grad_norm": 2.4366822242736816, | |
| "learning_rate": 0.00018943952042697296, | |
| "logits/chosen": -0.903656005859375, | |
| "logits/rejected": -0.9147554636001587, | |
| "logps/chosen": -6.1691365242004395, | |
| "logps/rejected": -98.06748962402344, | |
| "loss": 0.43336808681488037, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.37197959423065186, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45999443531036377, | |
| "rewards/margins": 8.3666353225708, | |
| "rewards/rejected": -7.906641006469727, | |
| "step": 302, | |
| "train_speed(iter/s)": 0.005565 | |
| }, | |
| { | |
| "epoch": 0.5736938642683865, | |
| "grad_norm": 6.613124847412109, | |
| "learning_rate": 0.00018934589692294818, | |
| "logits/chosen": -0.9739726781845093, | |
| "logits/rejected": -0.9870423674583435, | |
| "logps/chosen": -5.006122589111328, | |
| "logps/rejected": -110.79590606689453, | |
| "loss": 0.3391586244106293, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24201489984989166, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.352843701839447, | |
| "rewards/margins": 9.359478950500488, | |
| "rewards/rejected": -9.006634712219238, | |
| "step": 303, | |
| "train_speed(iter/s)": 0.005565 | |
| }, | |
| { | |
| "epoch": 0.5755872433583812, | |
| "grad_norm": 6.816748142242432, | |
| "learning_rate": 0.00018925188358598813, | |
| "logits/chosen": -0.962784469127655, | |
| "logits/rejected": -0.9713460206985474, | |
| "logps/chosen": -8.601051330566406, | |
| "logps/rejected": -93.97550964355469, | |
| "loss": 0.4550440311431885, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.331770122051239, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2643924951553345, | |
| "rewards/margins": 8.098273277282715, | |
| "rewards/rejected": -7.833880424499512, | |
| "step": 304, | |
| "train_speed(iter/s)": 0.005565 | |
| }, | |
| { | |
| "epoch": 0.5774806224483758, | |
| "grad_norm": 3.7295877933502197, | |
| "learning_rate": 0.0001891574808262907, | |
| "logits/chosen": -0.9686220288276672, | |
| "logits/rejected": -0.9826257228851318, | |
| "logps/chosen": -8.40042781829834, | |
| "logps/rejected": -118.83855438232422, | |
| "loss": 0.3994218707084656, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32849177718162537, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37062764167785645, | |
| "rewards/margins": 10.088976860046387, | |
| "rewards/rejected": -9.71834945678711, | |
| "step": 305, | |
| "train_speed(iter/s)": 0.005565 | |
| }, | |
| { | |
| "epoch": 0.5793740015383705, | |
| "grad_norm": 1.8573001623153687, | |
| "learning_rate": 0.00018906268905575285, | |
| "logits/chosen": -0.9196559190750122, | |
| "logits/rejected": -0.9327231645584106, | |
| "logps/chosen": -9.870383262634277, | |
| "logps/rejected": -115.3849868774414, | |
| "loss": 0.4931097626686096, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3947875499725342, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35478293895721436, | |
| "rewards/margins": 10.043420791625977, | |
| "rewards/rejected": -9.688638687133789, | |
| "step": 306, | |
| "train_speed(iter/s)": 0.005566 | |
| }, | |
| { | |
| "epoch": 0.5812673806283651, | |
| "grad_norm": 5.879184722900391, | |
| "learning_rate": 0.00018896750868796887, | |
| "logits/chosen": -0.8445271849632263, | |
| "logits/rejected": -0.8584895133972168, | |
| "logps/chosen": -7.785769939422607, | |
| "logps/rejected": -109.72542572021484, | |
| "loss": 0.3518598675727844, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29149600863456726, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4223713278770447, | |
| "rewards/margins": 9.426725387573242, | |
| "rewards/rejected": -9.004354476928711, | |
| "step": 307, | |
| "train_speed(iter/s)": 0.005566 | |
| }, | |
| { | |
| "epoch": 0.5831607597183599, | |
| "grad_norm": 10.44513988494873, | |
| "learning_rate": 0.00018887194013822862, | |
| "logits/chosen": -0.8841306567192078, | |
| "logits/rejected": -0.8950796127319336, | |
| "logps/chosen": -4.3363447189331055, | |
| "logps/rejected": -103.37335205078125, | |
| "loss": 0.4750944674015045, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.343455046415329, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2507314085960388, | |
| "rewards/margins": 8.82553482055664, | |
| "rewards/rejected": -8.574803352355957, | |
| "step": 308, | |
| "train_speed(iter/s)": 0.005566 | |
| }, | |
| { | |
| "epoch": 0.5850541388083546, | |
| "grad_norm": 34.57544708251953, | |
| "learning_rate": 0.0001887759838235156, | |
| "logits/chosen": -0.8739007115364075, | |
| "logits/rejected": -0.8843562602996826, | |
| "logps/chosen": -6.813051700592041, | |
| "logps/rejected": -107.06051635742188, | |
| "loss": 0.7519917488098145, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5681273341178894, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10883338749408722, | |
| "rewards/margins": 8.822795867919922, | |
| "rewards/rejected": -8.71396255493164, | |
| "step": 309, | |
| "train_speed(iter/s)": 0.005567 | |
| }, | |
| { | |
| "epoch": 0.5869475178983492, | |
| "grad_norm": 8.953110694885254, | |
| "learning_rate": 0.00018867964016250528, | |
| "logits/chosen": -0.8052958846092224, | |
| "logits/rejected": -0.8159947991371155, | |
| "logps/chosen": -6.318592548370361, | |
| "logps/rejected": -106.75569152832031, | |
| "loss": 0.3217519521713257, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24863341450691223, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.03278753161430359, | |
| "rewards/margins": 8.891491889953613, | |
| "rewards/rejected": -8.858704566955566, | |
| "step": 310, | |
| "train_speed(iter/s)": 0.005567 | |
| }, | |
| { | |
| "epoch": 0.5888408969883439, | |
| "grad_norm": 9.680059432983398, | |
| "learning_rate": 0.00018858290957556313, | |
| "logits/chosen": -0.8246707916259766, | |
| "logits/rejected": -0.8383605480194092, | |
| "logps/chosen": -5.819177150726318, | |
| "logps/rejected": -84.25653076171875, | |
| "loss": 0.4908764958381653, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3518160581588745, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2999556064605713, | |
| "rewards/margins": 6.772392272949219, | |
| "rewards/rejected": -6.472436904907227, | |
| "step": 311, | |
| "train_speed(iter/s)": 0.005567 | |
| }, | |
| { | |
| "epoch": 0.5907342760783385, | |
| "grad_norm": 1.4490282535552979, | |
| "learning_rate": 0.00018848579248474288, | |
| "logits/chosen": -0.7970471978187561, | |
| "logits/rejected": -0.8090251684188843, | |
| "logps/chosen": -2.809403896331787, | |
| "logps/rejected": -65.53295135498047, | |
| "loss": 0.23040540516376495, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14142940938472748, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.31414929032325745, | |
| "rewards/margins": 5.153748989105225, | |
| "rewards/rejected": -4.839599609375, | |
| "step": 312, | |
| "train_speed(iter/s)": 0.005568 | |
| }, | |
| { | |
| "epoch": 0.5926276551683333, | |
| "grad_norm": 11.067521095275879, | |
| "learning_rate": 0.00018838828931378463, | |
| "logits/chosen": -0.8277375102043152, | |
| "logits/rejected": -0.8391073942184448, | |
| "logps/chosen": -7.107628345489502, | |
| "logps/rejected": -77.02799987792969, | |
| "loss": 0.6485866904258728, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35685575008392334, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19486919045448303, | |
| "rewards/margins": 5.629068374633789, | |
| "rewards/rejected": -5.43419885635376, | |
| "step": 313, | |
| "train_speed(iter/s)": 0.005568 | |
| }, | |
| { | |
| "epoch": 0.5945210342583279, | |
| "grad_norm": 17.583600997924805, | |
| "learning_rate": 0.00018829040048811305, | |
| "logits/chosen": -0.8249818086624146, | |
| "logits/rejected": -0.8355417251586914, | |
| "logps/chosen": -10.383692741394043, | |
| "logps/rejected": -88.57411193847656, | |
| "loss": 1.1173313856124878, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8328571915626526, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.12180662155151367, | |
| "rewards/margins": 6.225827217102051, | |
| "rewards/rejected": -6.3476338386535645, | |
| "step": 314, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.5964144133483226, | |
| "grad_norm": 1.3052239418029785, | |
| "learning_rate": 0.0001881921264348355, | |
| "logits/chosen": -0.8118442893028259, | |
| "logits/rejected": -0.8303354978561401, | |
| "logps/chosen": -5.193848609924316, | |
| "logps/rejected": -78.52323913574219, | |
| "loss": 0.3948984444141388, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22238636016845703, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.4186479151248932, | |
| "rewards/margins": 5.8724188804626465, | |
| "rewards/rejected": -5.453771114349365, | |
| "step": 315, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.5983077924383172, | |
| "grad_norm": 4.303112983703613, | |
| "learning_rate": 0.00018809346758274012, | |
| "logits/chosen": -0.8591910004615784, | |
| "logits/rejected": -0.8673767447471619, | |
| "logps/chosen": -6.369632244110107, | |
| "logps/rejected": -72.42138671875, | |
| "loss": 0.3798455595970154, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2527866065502167, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.39195647835731506, | |
| "rewards/margins": 5.535797119140625, | |
| "rewards/rejected": -5.143840789794922, | |
| "step": 316, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.600201171528312, | |
| "grad_norm": 1.2503244876861572, | |
| "learning_rate": 0.00018799442436229403, | |
| "logits/chosen": -0.8667201399803162, | |
| "logits/rejected": -0.8784090876579285, | |
| "logps/chosen": -4.633861541748047, | |
| "logps/rejected": -93.7111587524414, | |
| "loss": 0.30663278698921204, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2311694324016571, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.48267802596092224, | |
| "rewards/margins": 8.00043773651123, | |
| "rewards/rejected": -7.517759323120117, | |
| "step": 317, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6020945506183066, | |
| "grad_norm": 6.858788967132568, | |
| "learning_rate": 0.00018789499720564136, | |
| "logits/chosen": -0.9277811646461487, | |
| "logits/rejected": -0.934998631477356, | |
| "logps/chosen": -6.271909236907959, | |
| "logps/rejected": -58.293670654296875, | |
| "loss": 0.5750719308853149, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3498351275920868, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1989549994468689, | |
| "rewards/margins": 4.847379207611084, | |
| "rewards/rejected": -4.64842414855957, | |
| "step": 318, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6039879297083013, | |
| "grad_norm": 4.458963394165039, | |
| "learning_rate": 0.00018779518654660153, | |
| "logits/chosen": -0.8746768236160278, | |
| "logits/rejected": -0.887937605381012, | |
| "logps/chosen": -5.970765113830566, | |
| "logps/rejected": -73.90641784667969, | |
| "loss": 0.5496221780776978, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4115613102912903, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2141362726688385, | |
| "rewards/margins": 5.52421236038208, | |
| "rewards/rejected": -5.310075759887695, | |
| "step": 319, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6058813087982959, | |
| "grad_norm": 4.74213981628418, | |
| "learning_rate": 0.00018769499282066717, | |
| "logits/chosen": -0.9022679328918457, | |
| "logits/rejected": -0.9067811965942383, | |
| "logps/chosen": -4.3401031494140625, | |
| "logps/rejected": -64.71338653564453, | |
| "loss": 0.46817266941070557, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2838274836540222, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.387113094329834, | |
| "rewards/margins": 5.29489278793335, | |
| "rewards/rejected": -4.907780170440674, | |
| "step": 320, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6077746878882906, | |
| "grad_norm": 1.5771666765213013, | |
| "learning_rate": 0.00018759441646500234, | |
| "logits/chosen": -0.9481390714645386, | |
| "logits/rejected": -0.960427463054657, | |
| "logps/chosen": -3.579497814178467, | |
| "logps/rejected": -90.05030822753906, | |
| "loss": 0.27988624572753906, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1971428096294403, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3307838439941406, | |
| "rewards/margins": 7.247364521026611, | |
| "rewards/rejected": -6.916580677032471, | |
| "step": 321, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6096680669782854, | |
| "grad_norm": 3.5266613960266113, | |
| "learning_rate": 0.0001874934579184406, | |
| "logits/chosen": -0.9149664640426636, | |
| "logits/rejected": -0.9217000007629395, | |
| "logps/chosen": -7.331539630889893, | |
| "logps/rejected": -62.536720275878906, | |
| "loss": 0.2879345715045929, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2096707969903946, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19104890525341034, | |
| "rewards/margins": 4.760408401489258, | |
| "rewards/rejected": -4.56935977935791, | |
| "step": 322, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.61156144606828, | |
| "grad_norm": 17.796716690063477, | |
| "learning_rate": 0.000187392117621483, | |
| "logits/chosen": -0.9241886734962463, | |
| "logits/rejected": -0.9360665082931519, | |
| "logps/chosen": -3.9619576930999756, | |
| "logps/rejected": -81.54830169677734, | |
| "loss": 0.29742905497550964, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21862103044986725, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4049226641654968, | |
| "rewards/margins": 6.298480033874512, | |
| "rewards/rejected": -5.893557548522949, | |
| "step": 323, | |
| "train_speed(iter/s)": 0.005568 | |
| }, | |
| { | |
| "epoch": 0.6134548251582747, | |
| "grad_norm": 3.629298210144043, | |
| "learning_rate": 0.00018729039601629634, | |
| "logits/chosen": -0.888552725315094, | |
| "logits/rejected": -0.8931864500045776, | |
| "logps/chosen": -8.97883129119873, | |
| "logps/rejected": -53.001277923583984, | |
| "loss": 0.4431394934654236, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27529340982437134, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.27515706419944763, | |
| "rewards/margins": 3.8233470916748047, | |
| "rewards/rejected": -3.548189878463745, | |
| "step": 324, | |
| "train_speed(iter/s)": 0.005568 | |
| }, | |
| { | |
| "epoch": 0.6153482042482693, | |
| "grad_norm": 22.506664276123047, | |
| "learning_rate": 0.00018718829354671113, | |
| "logits/chosen": -0.935386061668396, | |
| "logits/rejected": -0.946205735206604, | |
| "logps/chosen": -4.333962917327881, | |
| "logps/rejected": -69.80958557128906, | |
| "loss": 0.38010165095329285, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27887049317359924, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41510555148124695, | |
| "rewards/margins": 5.503192901611328, | |
| "rewards/rejected": -5.088087558746338, | |
| "step": 325, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.617241583338264, | |
| "grad_norm": 3.3655357360839844, | |
| "learning_rate": 0.00018708581065821954, | |
| "logits/chosen": -0.9429974555969238, | |
| "logits/rejected": -0.9552821516990662, | |
| "logps/chosen": -5.25839900970459, | |
| "logps/rejected": -56.73838424682617, | |
| "loss": 0.5094978213310242, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.446816086769104, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38630491495132446, | |
| "rewards/margins": 4.239760398864746, | |
| "rewards/rejected": -3.8534557819366455, | |
| "step": 326, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6191349624282587, | |
| "grad_norm": 2.8727710247039795, | |
| "learning_rate": 0.0001869829477979737, | |
| "logits/chosen": -0.8893756866455078, | |
| "logits/rejected": -0.8951653242111206, | |
| "logps/chosen": -4.583832263946533, | |
| "logps/rejected": -55.753257751464844, | |
| "loss": 0.2895621359348297, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19121912121772766, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.40792274475097656, | |
| "rewards/margins": 4.444224834442139, | |
| "rewards/rejected": -4.03630256652832, | |
| "step": 327, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.6210283415182534, | |
| "grad_norm": 2.481173515319824, | |
| "learning_rate": 0.00018687970541478364, | |
| "logits/chosen": -0.9552744030952454, | |
| "logits/rejected": -0.9592955112457275, | |
| "logps/chosen": -6.099732875823975, | |
| "logps/rejected": -55.62705993652344, | |
| "loss": 0.3935054838657379, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2654397785663605, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3739722669124603, | |
| "rewards/margins": 4.395190238952637, | |
| "rewards/rejected": -4.021218299865723, | |
| "step": 328, | |
| "train_speed(iter/s)": 0.005569 | |
| }, | |
| { | |
| "epoch": 0.622921720608248, | |
| "grad_norm": 0.932902991771698, | |
| "learning_rate": 0.00018677608395911526, | |
| "logits/chosen": -0.9515609741210938, | |
| "logits/rejected": -0.9636331796646118, | |
| "logps/chosen": -5.270691871643066, | |
| "logps/rejected": -69.07537841796875, | |
| "loss": 0.1866064816713333, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1546114981174469, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43455418944358826, | |
| "rewards/margins": 5.497076034545898, | |
| "rewards/rejected": -5.062521934509277, | |
| "step": 329, | |
| "train_speed(iter/s)": 0.00557 | |
| }, | |
| { | |
| "epoch": 0.6248150996982427, | |
| "grad_norm": 56.31227493286133, | |
| "learning_rate": 0.00018667208388308841, | |
| "logits/chosen": -0.9246232509613037, | |
| "logits/rejected": -0.9359687566757202, | |
| "logps/chosen": -5.232905864715576, | |
| "logps/rejected": -61.79796600341797, | |
| "loss": 0.4251781404018402, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3015526831150055, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32587265968322754, | |
| "rewards/margins": 4.692801475524902, | |
| "rewards/rejected": -4.366928577423096, | |
| "step": 330, | |
| "train_speed(iter/s)": 0.00557 | |
| }, | |
| { | |
| "epoch": 0.6267084787882374, | |
| "grad_norm": 4.163169860839844, | |
| "learning_rate": 0.00018656770564047496, | |
| "logits/chosen": -0.9365993142127991, | |
| "logits/rejected": -0.9441806674003601, | |
| "logps/chosen": -5.937311172485352, | |
| "logps/rejected": -64.2382583618164, | |
| "loss": 0.4102782905101776, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21538400650024414, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.27078527212142944, | |
| "rewards/margins": 5.3102803230285645, | |
| "rewards/rejected": -5.03949499130249, | |
| "step": 331, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6286018578782321, | |
| "grad_norm": 23.430564880371094, | |
| "learning_rate": 0.00018646294968669685, | |
| "logits/chosen": -0.9300607442855835, | |
| "logits/rejected": -0.9476884603500366, | |
| "logps/chosen": -5.615139007568359, | |
| "logps/rejected": -77.03141784667969, | |
| "loss": 0.6246126890182495, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4357287287712097, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3221561312675476, | |
| "rewards/margins": 5.601375579833984, | |
| "rewards/rejected": -5.2792205810546875, | |
| "step": 332, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6304952369682267, | |
| "grad_norm": 3.6118054389953613, | |
| "learning_rate": 0.0001863578164788239, | |
| "logits/chosen": -0.9302395582199097, | |
| "logits/rejected": -0.9413833022117615, | |
| "logps/chosen": -7.32153844833374, | |
| "logps/rejected": -66.94845581054688, | |
| "loss": 0.7131233811378479, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4995349049568176, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04812576249241829, | |
| "rewards/margins": 5.103006362915039, | |
| "rewards/rejected": -5.0548810958862305, | |
| "step": 333, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6323886160582214, | |
| "grad_norm": 2.5514726638793945, | |
| "learning_rate": 0.00018625230647557217, | |
| "logits/chosen": -0.9299983978271484, | |
| "logits/rejected": -0.940325915813446, | |
| "logps/chosen": -6.139636039733887, | |
| "logps/rejected": -66.79703521728516, | |
| "loss": 0.38100895285606384, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2833740711212158, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.39727550745010376, | |
| "rewards/margins": 5.418885231018066, | |
| "rewards/rejected": -5.021610260009766, | |
| "step": 334, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.634281995148216, | |
| "grad_norm": 7.410953998565674, | |
| "learning_rate": 0.0001861464201373015, | |
| "logits/chosen": -0.9981006979942322, | |
| "logits/rejected": -1.0123075246810913, | |
| "logps/chosen": -3.0750880241394043, | |
| "logps/rejected": -89.65264892578125, | |
| "loss": 0.23634791374206543, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14243003726005554, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37372106313705444, | |
| "rewards/margins": 7.329642295837402, | |
| "rewards/rejected": -6.955921173095703, | |
| "step": 335, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6361753742382108, | |
| "grad_norm": 2.460972547531128, | |
| "learning_rate": 0.00018604015792601396, | |
| "logits/chosen": -0.926382303237915, | |
| "logits/rejected": -0.9328540563583374, | |
| "logps/chosen": -6.227597713470459, | |
| "logps/rejected": -58.30305480957031, | |
| "loss": 0.2906293272972107, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1831737905740738, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3218955993652344, | |
| "rewards/margins": 4.378249645233154, | |
| "rewards/rejected": -4.05635404586792, | |
| "step": 336, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6380687533282055, | |
| "grad_norm": 2.0313737392425537, | |
| "learning_rate": 0.0001859335203053515, | |
| "logits/chosen": -0.9640895128250122, | |
| "logits/rejected": -0.9761223196983337, | |
| "logps/chosen": -5.581124305725098, | |
| "logps/rejected": -63.39913558959961, | |
| "loss": 0.5718323588371277, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3999195396900177, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.213788241147995, | |
| "rewards/margins": 5.133645534515381, | |
| "rewards/rejected": -4.919857025146484, | |
| "step": 337, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6399621324182001, | |
| "grad_norm": 4.065624713897705, | |
| "learning_rate": 0.0001858265077405941, | |
| "logits/chosen": -0.8603492379188538, | |
| "logits/rejected": -0.870326578617096, | |
| "logps/chosen": -5.7338457107543945, | |
| "logps/rejected": -69.25128936767578, | |
| "loss": 0.34140416979789734, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2584512233734131, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32439491152763367, | |
| "rewards/margins": 5.536102294921875, | |
| "rewards/rejected": -5.21170711517334, | |
| "step": 338, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6418555115081948, | |
| "grad_norm": 2.9222512245178223, | |
| "learning_rate": 0.00018571912069865776, | |
| "logits/chosen": -0.8618049621582031, | |
| "logits/rejected": -0.870703935623169, | |
| "logps/chosen": -7.246155261993408, | |
| "logps/rejected": -51.38260269165039, | |
| "loss": 0.4438958466053009, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27844953536987305, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2594514489173889, | |
| "rewards/margins": 3.721580982208252, | |
| "rewards/rejected": -3.462129592895508, | |
| "step": 339, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6437488905981894, | |
| "grad_norm": 11.053990364074707, | |
| "learning_rate": 0.00018561135964809223, | |
| "logits/chosen": -0.8574349880218506, | |
| "logits/rejected": -0.8660771250724792, | |
| "logps/chosen": -2.8028204441070557, | |
| "logps/rejected": -60.271385192871094, | |
| "loss": 0.2936401665210724, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2107047736644745, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37268757820129395, | |
| "rewards/margins": 4.701450824737549, | |
| "rewards/rejected": -4.328763484954834, | |
| "step": 340, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6456422696881842, | |
| "grad_norm": 33.189571380615234, | |
| "learning_rate": 0.00018550322505907923, | |
| "logits/chosen": -0.7724344730377197, | |
| "logits/rejected": -0.7846801280975342, | |
| "logps/chosen": -6.443312644958496, | |
| "logps/rejected": -63.350616455078125, | |
| "loss": 0.8022756576538086, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5788527131080627, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21350334584712982, | |
| "rewards/margins": 4.397084712982178, | |
| "rewards/rejected": -4.183581352233887, | |
| "step": 341, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6475356487781788, | |
| "grad_norm": 12.396661758422852, | |
| "learning_rate": 0.00018539471740343033, | |
| "logits/chosen": -0.8222888708114624, | |
| "logits/rejected": -0.8293163180351257, | |
| "logps/chosen": -4.639364242553711, | |
| "logps/rejected": -57.1859016418457, | |
| "loss": 0.6142297387123108, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4827613830566406, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2849894165992737, | |
| "rewards/margins": 4.214752197265625, | |
| "rewards/rejected": -3.929762601852417, | |
| "step": 342, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6494290278681735, | |
| "grad_norm": 2.387334108352661, | |
| "learning_rate": 0.0001852858371545848, | |
| "logits/chosen": -0.7581778764724731, | |
| "logits/rejected": -0.7650014758110046, | |
| "logps/chosen": -7.369527816772461, | |
| "logps/rejected": -59.144012451171875, | |
| "loss": 0.3893844187259674, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.33146339654922485, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4411081373691559, | |
| "rewards/margins": 4.799034118652344, | |
| "rewards/rejected": -4.357925891876221, | |
| "step": 343, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6513224069581681, | |
| "grad_norm": 2.518702745437622, | |
| "learning_rate": 0.0001851765847876076, | |
| "logits/chosen": -0.8135807514190674, | |
| "logits/rejected": -0.8240830898284912, | |
| "logps/chosen": -3.35158109664917, | |
| "logps/rejected": -54.54274368286133, | |
| "loss": 0.25894394516944885, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15596656501293182, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3464549779891968, | |
| "rewards/margins": 4.198663234710693, | |
| "rewards/rejected": -3.852208137512207, | |
| "step": 344, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6532157860481629, | |
| "grad_norm": 6.995054244995117, | |
| "learning_rate": 0.00018506696077918742, | |
| "logits/chosen": -0.8065057992935181, | |
| "logits/rejected": -0.814572811126709, | |
| "logps/chosen": -4.734983921051025, | |
| "logps/rejected": -58.506385803222656, | |
| "loss": 0.45452654361724854, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29960596561431885, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23975589871406555, | |
| "rewards/margins": 4.3970513343811035, | |
| "rewards/rejected": -4.157295227050781, | |
| "step": 345, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6551091651381575, | |
| "grad_norm": 1.396971344947815, | |
| "learning_rate": 0.00018495696560763428, | |
| "logits/chosen": -0.8346060514450073, | |
| "logits/rejected": -0.8455590009689331, | |
| "logps/chosen": -6.954171657562256, | |
| "logps/rejected": -58.36876678466797, | |
| "loss": 0.41100573539733887, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3312125504016876, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3940037786960602, | |
| "rewards/margins": 4.3294878005981445, | |
| "rewards/rejected": -3.935483932495117, | |
| "step": 346, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6570025442281522, | |
| "grad_norm": 4.642291069030762, | |
| "learning_rate": 0.00018484659975287788, | |
| "logits/chosen": -0.8456770777702332, | |
| "logits/rejected": -0.8482322692871094, | |
| "logps/chosen": -10.749929428100586, | |
| "logps/rejected": -61.98844909667969, | |
| "loss": 0.3847033679485321, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25482821464538574, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3538522720336914, | |
| "rewards/margins": 4.825608253479004, | |
| "rewards/rejected": -4.4717559814453125, | |
| "step": 347, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6588959233181468, | |
| "grad_norm": 2.9362223148345947, | |
| "learning_rate": 0.00018473586369646512, | |
| "logits/chosen": -0.8183330297470093, | |
| "logits/rejected": -0.8273117542266846, | |
| "logps/chosen": -3.4568326473236084, | |
| "logps/rejected": -69.13544464111328, | |
| "loss": 0.35661450028419495, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1939859688282013, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36636775732040405, | |
| "rewards/margins": 5.597408771514893, | |
| "rewards/rejected": -5.231040954589844, | |
| "step": 348, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6607893024081415, | |
| "grad_norm": 8.023280143737793, | |
| "learning_rate": 0.00018462475792155824, | |
| "logits/chosen": -0.775278627872467, | |
| "logits/rejected": -0.7894055247306824, | |
| "logps/chosen": -4.536966323852539, | |
| "logps/rejected": -65.62297821044922, | |
| "loss": 0.2713961899280548, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19426655769348145, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4155954420566559, | |
| "rewards/margins": 5.086872577667236, | |
| "rewards/rejected": -4.671277046203613, | |
| "step": 349, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6626826814981363, | |
| "grad_norm": 2.4450321197509766, | |
| "learning_rate": 0.00018451328291293264, | |
| "logits/chosen": -0.7985575795173645, | |
| "logits/rejected": -0.808333694934845, | |
| "logps/chosen": -6.013537883758545, | |
| "logps/rejected": -75.55121612548828, | |
| "loss": 0.3190026879310608, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.274376779794693, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37852659821510315, | |
| "rewards/margins": 5.885116100311279, | |
| "rewards/rejected": -5.506588935852051, | |
| "step": 350, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6645760605881309, | |
| "grad_norm": 11.652441024780273, | |
| "learning_rate": 0.0001844014391569747, | |
| "logits/chosen": -0.8393977284431458, | |
| "logits/rejected": -0.8486717939376831, | |
| "logps/chosen": -8.01746940612793, | |
| "logps/rejected": -66.04694366455078, | |
| "loss": 0.5918421745300293, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4767189025878906, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.20049431920051575, | |
| "rewards/margins": 5.253631591796875, | |
| "rewards/rejected": -5.053136825561523, | |
| "step": 351, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6664694396781256, | |
| "grad_norm": 3.3374173641204834, | |
| "learning_rate": 0.0001842892271416797, | |
| "logits/chosen": -0.828509509563446, | |
| "logits/rejected": -0.8383011221885681, | |
| "logps/chosen": -7.521579742431641, | |
| "logps/rejected": -65.2198486328125, | |
| "loss": 0.4373883008956909, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38811227679252625, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3511880338191986, | |
| "rewards/margins": 5.433207035064697, | |
| "rewards/rejected": -5.082019329071045, | |
| "step": 352, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6683628187681202, | |
| "grad_norm": 1.81625235080719, | |
| "learning_rate": 0.00018417664735664985, | |
| "logits/chosen": -0.7870513200759888, | |
| "logits/rejected": -0.7983162999153137, | |
| "logps/chosen": -6.6251020431518555, | |
| "logps/rejected": -69.36129760742188, | |
| "loss": 0.30411848425865173, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23931153118610382, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.46187031269073486, | |
| "rewards/margins": 5.455815315246582, | |
| "rewards/rejected": -4.9939446449279785, | |
| "step": 353, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6702561978581149, | |
| "grad_norm": 5.95273494720459, | |
| "learning_rate": 0.0001840637002930918, | |
| "logits/chosen": -0.7893354892730713, | |
| "logits/rejected": -0.7926087975502014, | |
| "logps/chosen": -3.356367588043213, | |
| "logps/rejected": -54.068214416503906, | |
| "loss": 0.23361176252365112, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16138066351413727, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3823690414428711, | |
| "rewards/margins": 4.487397193908691, | |
| "rewards/rejected": -4.1050286293029785, | |
| "step": 354, | |
| "train_speed(iter/s)": 0.005571 | |
| }, | |
| { | |
| "epoch": 0.6721495769481096, | |
| "grad_norm": 2.7681703567504883, | |
| "learning_rate": 0.00018395038644381488, | |
| "logits/chosen": -0.8022831678390503, | |
| "logits/rejected": -0.8161917924880981, | |
| "logps/chosen": -7.168720245361328, | |
| "logps/rejected": -60.850887298583984, | |
| "loss": 0.6297565698623657, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5241124629974365, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3222300112247467, | |
| "rewards/margins": 4.561849117279053, | |
| "rewards/rejected": -4.239619255065918, | |
| "step": 355, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6740429560381043, | |
| "grad_norm": 1.745928406715393, | |
| "learning_rate": 0.00018383670630322865, | |
| "logits/chosen": -0.8162990212440491, | |
| "logits/rejected": -0.8287326097488403, | |
| "logps/chosen": -5.697843551635742, | |
| "logps/rejected": -72.2893295288086, | |
| "loss": 0.3242051899433136, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19369246065616608, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.39551740884780884, | |
| "rewards/margins": 5.45540189743042, | |
| "rewards/rejected": -5.059884071350098, | |
| "step": 356, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6759363351280989, | |
| "grad_norm": 1.5724689960479736, | |
| "learning_rate": 0.00018372266036734098, | |
| "logits/chosen": -0.7709946036338806, | |
| "logits/rejected": -0.7820452451705933, | |
| "logps/chosen": -7.69317102432251, | |
| "logps/rejected": -63.20610809326172, | |
| "loss": 0.4046747088432312, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26361504197120667, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.44556182622909546, | |
| "rewards/margins": 4.433609962463379, | |
| "rewards/rejected": -3.9880480766296387, | |
| "step": 357, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6778297142180936, | |
| "grad_norm": 0.8649733662605286, | |
| "learning_rate": 0.00018360824913375568, | |
| "logits/chosen": -0.8018120527267456, | |
| "logits/rejected": -0.8122223019599915, | |
| "logps/chosen": -5.195913314819336, | |
| "logps/rejected": -69.43289947509766, | |
| "loss": 0.1661713868379593, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12944738566875458, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3514459729194641, | |
| "rewards/margins": 5.306279182434082, | |
| "rewards/rejected": -4.954833030700684, | |
| "step": 358, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6797230933080883, | |
| "grad_norm": 1.0646100044250488, | |
| "learning_rate": 0.00018349347310167046, | |
| "logits/chosen": -0.7723908424377441, | |
| "logits/rejected": -0.7902077436447144, | |
| "logps/chosen": -4.268543243408203, | |
| "logps/rejected": -75.9552001953125, | |
| "loss": 0.23154988884925842, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17301858961582184, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5057197213172913, | |
| "rewards/margins": 5.4032464027404785, | |
| "rewards/rejected": -4.897526741027832, | |
| "step": 359, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.681616472398083, | |
| "grad_norm": 1.2381056547164917, | |
| "learning_rate": 0.00018337833277187472, | |
| "logits/chosen": -0.8530025482177734, | |
| "logits/rejected": -0.8602923154830933, | |
| "logps/chosen": -3.5304064750671387, | |
| "logps/rejected": -69.44783782958984, | |
| "loss": 0.27017509937286377, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24506865441799164, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34460416436195374, | |
| "rewards/margins": 5.07497501373291, | |
| "rewards/rejected": -4.73037052154541, | |
| "step": 360, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6835098514880776, | |
| "grad_norm": 51.11272048950195, | |
| "learning_rate": 0.00018326282864674734, | |
| "logits/chosen": -0.8346350193023682, | |
| "logits/rejected": -0.847761332988739, | |
| "logps/chosen": -4.418249607086182, | |
| "logps/rejected": -72.58184051513672, | |
| "loss": 0.548991858959198, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.39672714471817017, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2148188203573227, | |
| "rewards/margins": 5.45236873626709, | |
| "rewards/rejected": -5.237550258636475, | |
| "step": 361, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6854032305780723, | |
| "grad_norm": 3.5835256576538086, | |
| "learning_rate": 0.00018314696123025454, | |
| "logits/chosen": -0.8421773314476013, | |
| "logits/rejected": -0.8487293124198914, | |
| "logps/chosen": -9.384542465209961, | |
| "logps/rejected": -66.58482360839844, | |
| "loss": 0.5891345739364624, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5249395370483398, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3435335159301758, | |
| "rewards/margins": 5.227488994598389, | |
| "rewards/rejected": -4.883955001831055, | |
| "step": 362, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6872966096680669, | |
| "grad_norm": 2.492431163787842, | |
| "learning_rate": 0.0001830307310279476, | |
| "logits/chosen": -0.877526581287384, | |
| "logits/rejected": -0.8845463991165161, | |
| "logps/chosen": -5.337737083435059, | |
| "logps/rejected": -63.96607971191406, | |
| "loss": 0.4151839017868042, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2992326319217682, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3732222020626068, | |
| "rewards/margins": 5.134644508361816, | |
| "rewards/rejected": -4.761421203613281, | |
| "step": 363, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6891899887580617, | |
| "grad_norm": 1.5654759407043457, | |
| "learning_rate": 0.00018291413854696077, | |
| "logits/chosen": -0.8303389549255371, | |
| "logits/rejected": -0.8396271467208862, | |
| "logps/chosen": -9.332134246826172, | |
| "logps/rejected": -57.97529602050781, | |
| "loss": 0.48519501090049744, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.37487462162971497, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.45280930399894714, | |
| "rewards/margins": 4.4484758377075195, | |
| "rewards/rejected": -3.995666742324829, | |
| "step": 364, | |
| "train_speed(iter/s)": 0.005573 | |
| }, | |
| { | |
| "epoch": 0.6910833678480564, | |
| "grad_norm": 21.09276580810547, | |
| "learning_rate": 0.0001827971842960089, | |
| "logits/chosen": -0.864224910736084, | |
| "logits/rejected": -0.8757129311561584, | |
| "logps/chosen": -6.988122940063477, | |
| "logps/rejected": -66.54647064208984, | |
| "loss": 0.662355899810791, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4306182265281677, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.004866257309913635, | |
| "rewards/margins": 4.913517475128174, | |
| "rewards/rejected": -4.918384075164795, | |
| "step": 365, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.692976746938051, | |
| "grad_norm": 1.0892640352249146, | |
| "learning_rate": 0.00018267986878538545, | |
| "logits/chosen": -0.917788028717041, | |
| "logits/rejected": -0.9294503927230835, | |
| "logps/chosen": -3.470579147338867, | |
| "logps/rejected": -78.84397888183594, | |
| "loss": 0.20548279583454132, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14263419806957245, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4148893356323242, | |
| "rewards/margins": 6.348430156707764, | |
| "rewards/rejected": -5.9335408210754395, | |
| "step": 366, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6948701260280457, | |
| "grad_norm": 5.015666484832764, | |
| "learning_rate": 0.00018256219252695994, | |
| "logits/chosen": -0.9198713302612305, | |
| "logits/rejected": -0.9371796250343323, | |
| "logps/chosen": -9.38389778137207, | |
| "logps/rejected": -91.02330780029297, | |
| "loss": 0.3265993297100067, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2348761260509491, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09129352122545242, | |
| "rewards/margins": 6.925175666809082, | |
| "rewards/rejected": -6.8338823318481445, | |
| "step": 367, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6967635051180403, | |
| "grad_norm": 6.3433518409729, | |
| "learning_rate": 0.00018244415603417603, | |
| "logits/chosen": -0.8368143439292908, | |
| "logits/rejected": -0.8486584424972534, | |
| "logps/chosen": -6.600013732910156, | |
| "logps/rejected": -63.1298942565918, | |
| "loss": 0.6284315586090088, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4247177243232727, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.37347325682640076, | |
| "rewards/margins": 4.725260257720947, | |
| "rewards/rejected": -4.3517866134643555, | |
| "step": 368, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.6986568842080351, | |
| "grad_norm": 7.823058128356934, | |
| "learning_rate": 0.00018232575982204914, | |
| "logits/chosen": -0.9267025589942932, | |
| "logits/rejected": -0.9404476284980774, | |
| "logps/chosen": -5.923476219177246, | |
| "logps/rejected": -87.72044372558594, | |
| "loss": 0.4384441375732422, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3303898870944977, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2169867604970932, | |
| "rewards/margins": 6.883980751037598, | |
| "rewards/rejected": -6.666994571685791, | |
| "step": 369, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.7005502632980297, | |
| "grad_norm": 9.935714721679688, | |
| "learning_rate": 0.00018220700440716413, | |
| "logits/chosen": -0.9617865681648254, | |
| "logits/rejected": -0.9780336022377014, | |
| "logps/chosen": -5.394845962524414, | |
| "logps/rejected": -81.97534942626953, | |
| "loss": 0.3096768260002136, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22962169349193573, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36911681294441223, | |
| "rewards/margins": 6.486654758453369, | |
| "rewards/rejected": -6.1175384521484375, | |
| "step": 370, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.7024436423880244, | |
| "grad_norm": 2.1283838748931885, | |
| "learning_rate": 0.00018208789030767325, | |
| "logits/chosen": -0.931568443775177, | |
| "logits/rejected": -0.9491530656814575, | |
| "logps/chosen": -5.131685256958008, | |
| "logps/rejected": -83.98279571533203, | |
| "loss": 0.32068467140197754, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25166767835617065, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.40735071897506714, | |
| "rewards/margins": 6.204363822937012, | |
| "rewards/rejected": -5.797012805938721, | |
| "step": 371, | |
| "train_speed(iter/s)": 0.005572 | |
| }, | |
| { | |
| "epoch": 0.704337021478019, | |
| "grad_norm": 2.4540481567382812, | |
| "learning_rate": 0.00018196841804329368, | |
| "logits/chosen": -0.9263602495193481, | |
| "logits/rejected": -0.9327493906021118, | |
| "logps/chosen": -8.066591262817383, | |
| "logps/rejected": -75.68155670166016, | |
| "loss": 0.3130130469799042, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2522437274456024, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.31773021817207336, | |
| "rewards/margins": 6.315546035766602, | |
| "rewards/rejected": -5.99781608581543, | |
| "step": 372, | |
| "train_speed(iter/s)": 0.005573 | |
| }, | |
| { | |
| "epoch": 0.7062304005680137, | |
| "grad_norm": 1.692391276359558, | |
| "learning_rate": 0.00018184858813530532, | |
| "logits/chosen": -0.9145341515541077, | |
| "logits/rejected": -0.9194747805595398, | |
| "logps/chosen": -7.334906578063965, | |
| "logps/rejected": -73.05682373046875, | |
| "loss": 0.3234623968601227, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2537417709827423, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24510082602500916, | |
| "rewards/margins": 5.801229476928711, | |
| "rewards/rejected": -5.55612850189209, | |
| "step": 373, | |
| "train_speed(iter/s)": 0.005573 | |
| }, | |
| { | |
| "epoch": 0.7081237796580084, | |
| "grad_norm": 36.44214630126953, | |
| "learning_rate": 0.00018172840110654862, | |
| "logits/chosen": -0.9754062294960022, | |
| "logits/rejected": -0.991508960723877, | |
| "logps/chosen": -6.064601421356201, | |
| "logps/rejected": -89.70690155029297, | |
| "loss": 0.5042046904563904, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4545992314815521, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1555050164461136, | |
| "rewards/margins": 7.101882457733154, | |
| "rewards/rejected": -6.946377754211426, | |
| "step": 374, | |
| "train_speed(iter/s)": 0.005573 | |
| }, | |
| { | |
| "epoch": 0.7100171587480031, | |
| "grad_norm": 2.978787899017334, | |
| "learning_rate": 0.00018160785748142213, | |
| "logits/chosen": -0.9359906315803528, | |
| "logits/rejected": -0.9400643110275269, | |
| "logps/chosen": -8.096701622009277, | |
| "logps/rejected": -72.11371612548828, | |
| "loss": 0.32742807269096375, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25164440274238586, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.05610913783311844, | |
| "rewards/margins": 5.611598491668701, | |
| "rewards/rejected": -5.555489540100098, | |
| "step": 375, | |
| "train_speed(iter/s)": 0.005573 | |
| }, | |
| { | |
| "epoch": 0.7119105378379977, | |
| "grad_norm": 14.366015434265137, | |
| "learning_rate": 0.00018148695778588033, | |
| "logits/chosen": -0.956476628780365, | |
| "logits/rejected": -0.9655558466911316, | |
| "logps/chosen": -4.012333393096924, | |
| "logps/rejected": -62.51438903808594, | |
| "loss": 0.3993355333805084, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29191824793815613, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3031947910785675, | |
| "rewards/margins": 5.061457633972168, | |
| "rewards/rejected": -4.758262634277344, | |
| "step": 376, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7138039169279924, | |
| "grad_norm": 3.066188335418701, | |
| "learning_rate": 0.0001813657025474314, | |
| "logits/chosen": -0.9844723343849182, | |
| "logits/rejected": -0.9966791868209839, | |
| "logps/chosen": -4.741098880767822, | |
| "logps/rejected": -71.6838150024414, | |
| "loss": 0.3621368706226349, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2202376276254654, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3772399425506592, | |
| "rewards/margins": 5.600998878479004, | |
| "rewards/rejected": -5.223758220672607, | |
| "step": 377, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7156972960179872, | |
| "grad_norm": 11.998395919799805, | |
| "learning_rate": 0.00018124409229513462, | |
| "logits/chosen": -0.9505751729011536, | |
| "logits/rejected": -0.9621790647506714, | |
| "logps/chosen": -7.32084846496582, | |
| "logps/rejected": -74.40185546875, | |
| "loss": 0.6046153903007507, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4943448007106781, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3040057122707367, | |
| "rewards/margins": 5.977365970611572, | |
| "rewards/rejected": -5.6733598709106445, | |
| "step": 378, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7175906751079818, | |
| "grad_norm": 1.9508522748947144, | |
| "learning_rate": 0.0001811221275595984, | |
| "logits/chosen": -0.9317912459373474, | |
| "logits/rejected": -0.9388425350189209, | |
| "logps/chosen": -5.765390872955322, | |
| "logps/rejected": -62.51669692993164, | |
| "loss": 0.4143444895744324, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31946519017219543, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39909541606903076, | |
| "rewards/margins": 5.322498321533203, | |
| "rewards/rejected": -4.923402309417725, | |
| "step": 379, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7194840541979765, | |
| "grad_norm": 6.575671195983887, | |
| "learning_rate": 0.00018099980887297781, | |
| "logits/chosen": -0.9164581298828125, | |
| "logits/rejected": -0.9194830656051636, | |
| "logps/chosen": -6.478179931640625, | |
| "logps/rejected": -49.975425720214844, | |
| "loss": 0.44688597321510315, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2767287492752075, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.5000704526901245, | |
| "rewards/margins": 4.214252948760986, | |
| "rewards/rejected": -3.7141826152801514, | |
| "step": 380, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7213774332879711, | |
| "grad_norm": 10.62743854522705, | |
| "learning_rate": 0.00018087713676897226, | |
| "logits/chosen": -0.9223384261131287, | |
| "logits/rejected": -0.938324511051178, | |
| "logps/chosen": -2.1367008686065674, | |
| "logps/rejected": -82.99889373779297, | |
| "loss": 0.20312689244747162, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15922902524471283, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43284815549850464, | |
| "rewards/margins": 6.020846843719482, | |
| "rewards/rejected": -5.58799934387207, | |
| "step": 381, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7232708123779658, | |
| "grad_norm": 5.026012420654297, | |
| "learning_rate": 0.0001807541117828232, | |
| "logits/chosen": -0.8925135731697083, | |
| "logits/rejected": -0.9032195210456848, | |
| "logps/chosen": -4.171497821807861, | |
| "logps/rejected": -69.82553100585938, | |
| "loss": 0.4734829068183899, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3503991365432739, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2768786549568176, | |
| "rewards/margins": 5.154216766357422, | |
| "rewards/rejected": -4.877338409423828, | |
| "step": 382, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7251641914679605, | |
| "grad_norm": 2.993335485458374, | |
| "learning_rate": 0.00018063073445131168, | |
| "logits/chosen": -0.8994606137275696, | |
| "logits/rejected": -0.9080754518508911, | |
| "logps/chosen": -5.122469902038574, | |
| "logps/rejected": -61.14916229248047, | |
| "loss": 0.2968669831752777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21081849932670593, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.38207852840423584, | |
| "rewards/margins": 4.733161926269531, | |
| "rewards/rejected": -4.351083755493164, | |
| "step": 383, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7270575705579552, | |
| "grad_norm": 1.0400865077972412, | |
| "learning_rate": 0.0001805070053127563, | |
| "logits/chosen": -0.901731550693512, | |
| "logits/rejected": -0.9139244556427002, | |
| "logps/chosen": -2.863340377807617, | |
| "logps/rejected": -68.22149658203125, | |
| "loss": 0.18375320732593536, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11174498498439789, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.430495947599411, | |
| "rewards/margins": 5.3512468338012695, | |
| "rewards/rejected": -4.920751094818115, | |
| "step": 384, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7289509496479498, | |
| "grad_norm": 1.6904346942901611, | |
| "learning_rate": 0.00018038292490701047, | |
| "logits/chosen": -0.9130061268806458, | |
| "logits/rejected": -0.9136845469474792, | |
| "logps/chosen": -9.056621551513672, | |
| "logps/rejected": -46.760475158691406, | |
| "loss": 0.48324084281921387, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34024232625961304, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.42201292514801025, | |
| "rewards/margins": 3.9340808391571045, | |
| "rewards/rejected": -3.512068271636963, | |
| "step": 385, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7308443287379445, | |
| "grad_norm": 1.1459290981292725, | |
| "learning_rate": 0.00018025849377546033, | |
| "logits/chosen": -0.9257358908653259, | |
| "logits/rejected": -0.9371558427810669, | |
| "logps/chosen": -2.7692415714263916, | |
| "logps/rejected": -71.15418243408203, | |
| "loss": 0.2346101850271225, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1666901409626007, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.46027594804763794, | |
| "rewards/margins": 5.177318572998047, | |
| "rewards/rejected": -4.717042922973633, | |
| "step": 386, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7327377078279391, | |
| "grad_norm": 10.089129447937012, | |
| "learning_rate": 0.00018013371246102227, | |
| "logits/chosen": -0.8970749378204346, | |
| "logits/rejected": -0.9004898071289062, | |
| "logps/chosen": -5.8673787117004395, | |
| "logps/rejected": -60.121673583984375, | |
| "loss": 0.3606058955192566, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2795240879058838, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.447785347700119, | |
| "rewards/margins": 5.038176536560059, | |
| "rewards/rejected": -4.590391159057617, | |
| "step": 387, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7346310869179339, | |
| "grad_norm": 1.2866895198822021, | |
| "learning_rate": 0.0001800085815081406, | |
| "logits/chosen": -0.9037926197052002, | |
| "logits/rejected": -0.9107275009155273, | |
| "logps/chosen": -4.869014739990234, | |
| "logps/rejected": -57.07670974731445, | |
| "loss": 0.2692682445049286, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1857883632183075, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4257521331310272, | |
| "rewards/margins": 4.402857780456543, | |
| "rewards/rejected": -3.9771053791046143, | |
| "step": 388, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7365244660079285, | |
| "grad_norm": 3.418945550918579, | |
| "learning_rate": 0.00017988310146278523, | |
| "logits/chosen": -0.9708212614059448, | |
| "logits/rejected": -0.9790508151054382, | |
| "logps/chosen": -2.9867353439331055, | |
| "logps/rejected": -64.79772186279297, | |
| "loss": 0.25667768716812134, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1426447629928589, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.34653186798095703, | |
| "rewards/margins": 5.321665287017822, | |
| "rewards/rejected": -4.975133895874023, | |
| "step": 389, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7384178450979232, | |
| "grad_norm": 4.090985298156738, | |
| "learning_rate": 0.00017975727287244914, | |
| "logits/chosen": -1.037940263748169, | |
| "logits/rejected": -1.0541801452636719, | |
| "logps/chosen": -4.899912357330322, | |
| "logps/rejected": -75.53579711914062, | |
| "loss": 0.35355865955352783, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2508485019207001, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3642263412475586, | |
| "rewards/margins": 5.843046188354492, | |
| "rewards/rejected": -5.478819847106934, | |
| "step": 390, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7403112241879178, | |
| "grad_norm": 1.0435255765914917, | |
| "learning_rate": 0.00017963109628614613, | |
| "logits/chosen": -1.0441638231277466, | |
| "logits/rejected": -1.0574573278427124, | |
| "logps/chosen": -3.3426506519317627, | |
| "logps/rejected": -63.72442626953125, | |
| "loss": 0.23277787864208221, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20041929185390472, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4242357015609741, | |
| "rewards/margins": 5.191644191741943, | |
| "rewards/rejected": -4.767408847808838, | |
| "step": 391, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7422046032779126, | |
| "grad_norm": 0.7653146386146545, | |
| "learning_rate": 0.0001795045722544083, | |
| "logits/chosen": -0.999144434928894, | |
| "logits/rejected": -1.0147640705108643, | |
| "logps/chosen": -2.727332592010498, | |
| "logps/rejected": -78.85921478271484, | |
| "loss": 0.13891945779323578, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1272052526473999, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.646836519241333, | |
| "rewards/margins": 6.576606750488281, | |
| "rewards/rejected": -5.929770469665527, | |
| "step": 392, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7440979823679073, | |
| "grad_norm": 9.776786804199219, | |
| "learning_rate": 0.00017937770132928383, | |
| "logits/chosen": -1.0467562675476074, | |
| "logits/rejected": -1.0627236366271973, | |
| "logps/chosen": -6.933349609375, | |
| "logps/rejected": -73.26114654541016, | |
| "loss": 0.7141088247299194, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5707842111587524, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17063282430171967, | |
| "rewards/margins": 5.584632396697998, | |
| "rewards/rejected": -5.413999557495117, | |
| "step": 393, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7459913614579019, | |
| "grad_norm": 1.990278720855713, | |
| "learning_rate": 0.00017925048406433437, | |
| "logits/chosen": -1.0911043882369995, | |
| "logits/rejected": -1.1038135290145874, | |
| "logps/chosen": -6.190121650695801, | |
| "logps/rejected": -80.86822509765625, | |
| "loss": 0.2924405038356781, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2574291527271271, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2957814037799835, | |
| "rewards/margins": 6.825494289398193, | |
| "rewards/rejected": -6.5297136306762695, | |
| "step": 394, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7478847405478966, | |
| "grad_norm": 17.2550106048584, | |
| "learning_rate": 0.0001791229210146328, | |
| "logits/chosen": -1.0845831632614136, | |
| "logits/rejected": -1.0984985828399658, | |
| "logps/chosen": -7.322081565856934, | |
| "logps/rejected": -84.80224609375, | |
| "loss": 0.37159523367881775, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2948389947414398, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.30554482340812683, | |
| "rewards/margins": 6.833071708679199, | |
| "rewards/rejected": -6.527526378631592, | |
| "step": 395, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7497781196378912, | |
| "grad_norm": 0.8952667117118835, | |
| "learning_rate": 0.0001789950127367606, | |
| "logits/chosen": -1.050929307937622, | |
| "logits/rejected": -1.0651614665985107, | |
| "logps/chosen": -3.8682401180267334, | |
| "logps/rejected": -84.12080383300781, | |
| "loss": 0.18135719001293182, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.142669215798378, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3838658928871155, | |
| "rewards/margins": 6.844507217407227, | |
| "rewards/rejected": -6.460641384124756, | |
| "step": 396, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.751671498727886, | |
| "grad_norm": 2.4551334381103516, | |
| "learning_rate": 0.00017886675978880565, | |
| "logits/chosen": -1.037245273590088, | |
| "logits/rejected": -1.0525448322296143, | |
| "logps/chosen": -11.067987442016602, | |
| "logps/rejected": -78.05215454101562, | |
| "loss": 0.5026216506958008, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41904473304748535, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.319905161857605, | |
| "rewards/margins": 6.043320655822754, | |
| "rewards/rejected": -5.723415374755859, | |
| "step": 397, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7535648778178806, | |
| "grad_norm": 8.531716346740723, | |
| "learning_rate": 0.0001787381627303597, | |
| "logits/chosen": -1.0312135219573975, | |
| "logits/rejected": -1.0378743410110474, | |
| "logps/chosen": -4.678598880767822, | |
| "logps/rejected": -78.02084350585938, | |
| "loss": 0.42119985818862915, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34666430950164795, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24222567677497864, | |
| "rewards/margins": 6.521797180175781, | |
| "rewards/rejected": -6.279571533203125, | |
| "step": 398, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7554582569078753, | |
| "grad_norm": 3.705852508544922, | |
| "learning_rate": 0.00017860922212251579, | |
| "logits/chosen": -1.0187020301818848, | |
| "logits/rejected": -1.0253901481628418, | |
| "logps/chosen": -8.070443153381348, | |
| "logps/rejected": -69.82466125488281, | |
| "loss": 0.2855599522590637, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21128731966018677, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09387722611427307, | |
| "rewards/margins": 5.497537612915039, | |
| "rewards/rejected": -5.403660297393799, | |
| "step": 399, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.7573516359978699, | |
| "grad_norm": 28.791128158569336, | |
| "learning_rate": 0.0001784799385278661, | |
| "logits/chosen": -0.9633829593658447, | |
| "logits/rejected": -0.9697256088256836, | |
| "logps/chosen": -7.547330379486084, | |
| "logps/rejected": -61.4130744934082, | |
| "loss": 0.7181084156036377, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.538273274898529, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18001368641853333, | |
| "rewards/margins": 5.022581577301025, | |
| "rewards/rejected": -4.842568397521973, | |
| "step": 400, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.7592450150878646, | |
| "grad_norm": 23.678117752075195, | |
| "learning_rate": 0.00017835031251049922, | |
| "logits/chosen": -0.9481673240661621, | |
| "logits/rejected": -0.9688194394111633, | |
| "logps/chosen": -3.7135748863220215, | |
| "logps/rejected": -74.0098648071289, | |
| "loss": 0.2994523346424103, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25903573632240295, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44725221395492554, | |
| "rewards/margins": 5.681788921356201, | |
| "rewards/rejected": -5.234536170959473, | |
| "step": 401, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7611383941778593, | |
| "grad_norm": 5.658694744110107, | |
| "learning_rate": 0.00017822034463599778, | |
| "logits/chosen": -0.9763189554214478, | |
| "logits/rejected": -0.9897902011871338, | |
| "logps/chosen": -4.176187515258789, | |
| "logps/rejected": -79.24385070800781, | |
| "loss": 0.3210103213787079, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22857408225536346, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3976101875305176, | |
| "rewards/margins": 6.241819858551025, | |
| "rewards/rejected": -5.84420919418335, | |
| "step": 402, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.763031773267854, | |
| "grad_norm": 1.2923495769500732, | |
| "learning_rate": 0.00017809003547143612, | |
| "logits/chosen": -0.907258927822113, | |
| "logits/rejected": -0.917163074016571, | |
| "logps/chosen": -6.157055377960205, | |
| "logps/rejected": -68.08614349365234, | |
| "loss": 0.24948692321777344, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21286801993846893, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4159366488456726, | |
| "rewards/margins": 5.365114212036133, | |
| "rewards/rejected": -4.9491777420043945, | |
| "step": 403, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7649251523578486, | |
| "grad_norm": 1.8167670965194702, | |
| "learning_rate": 0.00017795938558537753, | |
| "logits/chosen": -0.9293066263198853, | |
| "logits/rejected": -0.9362936019897461, | |
| "logps/chosen": -6.498391628265381, | |
| "logps/rejected": -60.98576736450195, | |
| "loss": 0.4341224730014801, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36389267444610596, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40591150522232056, | |
| "rewards/margins": 4.675572395324707, | |
| "rewards/rejected": -4.269660472869873, | |
| "step": 404, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7668185314478433, | |
| "grad_norm": 1.2195301055908203, | |
| "learning_rate": 0.00017782839554787204, | |
| "logits/chosen": -0.8840275406837463, | |
| "logits/rejected": -0.8963786363601685, | |
| "logps/chosen": -4.563403129577637, | |
| "logps/rejected": -70.3100814819336, | |
| "loss": 0.29657843708992004, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22001734375953674, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41886448860168457, | |
| "rewards/margins": 5.402155876159668, | |
| "rewards/rejected": -4.983292102813721, | |
| "step": 405, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.768711910537838, | |
| "grad_norm": 0.9042125344276428, | |
| "learning_rate": 0.0001776970659304538, | |
| "logits/chosen": -0.9276862144470215, | |
| "logits/rejected": -0.9463416934013367, | |
| "logps/chosen": -2.721170425415039, | |
| "logps/rejected": -77.12850952148438, | |
| "loss": 0.16812542080879211, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12775033712387085, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5595777630805969, | |
| "rewards/margins": 5.493441104888916, | |
| "rewards/rejected": -4.933863639831543, | |
| "step": 406, | |
| "train_speed(iter/s)": 0.005574 | |
| }, | |
| { | |
| "epoch": 0.7706052896278327, | |
| "grad_norm": 6.283580303192139, | |
| "learning_rate": 0.0001775653973061386, | |
| "logits/chosen": -0.8509265780448914, | |
| "logits/rejected": -0.8639415502548218, | |
| "logps/chosen": -4.486887454986572, | |
| "logps/rejected": -56.64537048339844, | |
| "loss": 0.6943869590759277, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4812234044075012, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1978735774755478, | |
| "rewards/margins": 4.130608558654785, | |
| "rewards/rejected": -3.9327352046966553, | |
| "step": 407, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7724986687178274, | |
| "grad_norm": 2.473437786102295, | |
| "learning_rate": 0.00017743339024942135, | |
| "logits/chosen": -0.8597152233123779, | |
| "logits/rejected": -0.8724321126937866, | |
| "logps/chosen": -3.882218837738037, | |
| "logps/rejected": -59.771484375, | |
| "loss": 0.3383080065250397, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24344521760940552, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43006354570388794, | |
| "rewards/margins": 4.42924690246582, | |
| "rewards/rejected": -3.99918270111084, | |
| "step": 408, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.774392047807822, | |
| "grad_norm": 1.8906275033950806, | |
| "learning_rate": 0.0001773010453362737, | |
| "logits/chosen": -0.8703848123550415, | |
| "logits/rejected": -0.8756015300750732, | |
| "logps/chosen": -5.282890319824219, | |
| "logps/rejected": -49.80982208251953, | |
| "loss": 0.3379298746585846, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23951074481010437, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.365540087223053, | |
| "rewards/margins": 4.006491661071777, | |
| "rewards/rejected": -3.6409518718719482, | |
| "step": 409, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7762854268978167, | |
| "grad_norm": 7.051182270050049, | |
| "learning_rate": 0.00017716836314414137, | |
| "logits/chosen": -0.8841079473495483, | |
| "logits/rejected": -0.8995672464370728, | |
| "logps/chosen": -4.768126964569092, | |
| "logps/rejected": -57.94666290283203, | |
| "loss": 0.7324269413948059, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.41325533390045166, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.18045026063919067, | |
| "rewards/margins": 4.116349220275879, | |
| "rewards/rejected": -3.935899496078491, | |
| "step": 410, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7781788059878114, | |
| "grad_norm": 9.723516464233398, | |
| "learning_rate": 0.00017703534425194162, | |
| "logits/chosen": -0.9590765237808228, | |
| "logits/rejected": -0.978516697883606, | |
| "logps/chosen": -3.969177484512329, | |
| "logps/rejected": -77.96525573730469, | |
| "loss": 0.19977864623069763, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11787045001983643, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41094639897346497, | |
| "rewards/margins": 5.471322059631348, | |
| "rewards/rejected": -5.060375690460205, | |
| "step": 411, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7800721850778061, | |
| "grad_norm": 3.833841323852539, | |
| "learning_rate": 0.00017690198924006097, | |
| "logits/chosen": -0.8818249702453613, | |
| "logits/rejected": -0.8868318200111389, | |
| "logps/chosen": -9.053668022155762, | |
| "logps/rejected": -51.70756149291992, | |
| "loss": 0.8266224265098572, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5343714356422424, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2412976324558258, | |
| "rewards/margins": 4.036813735961914, | |
| "rewards/rejected": -3.7955162525177, | |
| "step": 412, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7819655641678007, | |
| "grad_norm": 1.554246187210083, | |
| "learning_rate": 0.00017676829869035232, | |
| "logits/chosen": -0.9043519496917725, | |
| "logits/rejected": -0.9118601083755493, | |
| "logps/chosen": -10.494165420532227, | |
| "logps/rejected": -70.82110595703125, | |
| "loss": 0.42945966124534607, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3161766827106476, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.29031792283058167, | |
| "rewards/margins": 5.651849746704102, | |
| "rewards/rejected": -5.361531734466553, | |
| "step": 413, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7838589432577954, | |
| "grad_norm": 7.9514079093933105, | |
| "learning_rate": 0.0001766342731861327, | |
| "logits/chosen": -0.9233826994895935, | |
| "logits/rejected": -0.9361361265182495, | |
| "logps/chosen": -3.67756986618042, | |
| "logps/rejected": -73.57920837402344, | |
| "loss": 0.21047185361385345, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13145719468593597, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2930607497692108, | |
| "rewards/margins": 5.711090564727783, | |
| "rewards/rejected": -5.41802978515625, | |
| "step": 414, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.78575232234779, | |
| "grad_norm": 8.199553489685059, | |
| "learning_rate": 0.00017649991331218051, | |
| "logits/chosen": -0.9082167148590088, | |
| "logits/rejected": -0.9135277271270752, | |
| "logps/chosen": -6.026224613189697, | |
| "logps/rejected": -63.22338104248047, | |
| "loss": 0.25728654861450195, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.219262033700943, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2262103408575058, | |
| "rewards/margins": 5.247284889221191, | |
| "rewards/rejected": -5.0210747718811035, | |
| "step": 415, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7876457014377848, | |
| "grad_norm": 1.4603794813156128, | |
| "learning_rate": 0.00017636521965473323, | |
| "logits/chosen": -0.9447462558746338, | |
| "logits/rejected": -0.9523710012435913, | |
| "logps/chosen": -5.464984893798828, | |
| "logps/rejected": -70.84123229980469, | |
| "loss": 0.3190080225467682, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23086979985237122, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4398874342441559, | |
| "rewards/margins": 5.966001987457275, | |
| "rewards/rejected": -5.526113986968994, | |
| "step": 416, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7895390805277794, | |
| "grad_norm": 2.0953357219696045, | |
| "learning_rate": 0.00017623019280148445, | |
| "logits/chosen": -0.9457417130470276, | |
| "logits/rejected": -0.9614331722259521, | |
| "logps/chosen": -6.09683895111084, | |
| "logps/rejected": -71.07952880859375, | |
| "loss": 0.30602532625198364, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23463232815265656, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4258151054382324, | |
| "rewards/margins": 5.393369674682617, | |
| "rewards/rejected": -4.967555046081543, | |
| "step": 417, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7914324596177741, | |
| "grad_norm": 3.631746530532837, | |
| "learning_rate": 0.00017609483334158181, | |
| "logits/chosen": -0.8911413550376892, | |
| "logits/rejected": -0.9076879620552063, | |
| "logps/chosen": -3.185537576675415, | |
| "logps/rejected": -73.76860809326172, | |
| "loss": 0.27826330065727234, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17217418551445007, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3891518712043762, | |
| "rewards/margins": 5.921802520751953, | |
| "rewards/rejected": -5.532650947570801, | |
| "step": 418, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7933258387077687, | |
| "grad_norm": 2.356017827987671, | |
| "learning_rate": 0.00017595914186562407, | |
| "logits/chosen": -0.9325594902038574, | |
| "logits/rejected": -0.9440548419952393, | |
| "logps/chosen": -4.001617908477783, | |
| "logps/rejected": -73.55976867675781, | |
| "loss": 0.42719385027885437, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26717454195022583, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3177154064178467, | |
| "rewards/margins": 5.908562183380127, | |
| "rewards/rejected": -5.590847015380859, | |
| "step": 419, | |
| "train_speed(iter/s)": 0.005575 | |
| }, | |
| { | |
| "epoch": 0.7952192177977635, | |
| "grad_norm": 2.385035514831543, | |
| "learning_rate": 0.00017582311896565856, | |
| "logits/chosen": -0.9272701740264893, | |
| "logits/rejected": -0.9425795674324036, | |
| "logps/chosen": -5.3703532218933105, | |
| "logps/rejected": -79.19388580322266, | |
| "loss": 0.366239070892334, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28597089648246765, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23774051666259766, | |
| "rewards/margins": 6.523024082183838, | |
| "rewards/rejected": -6.285284042358398, | |
| "step": 420, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.7971125968877582, | |
| "grad_norm": 1.515577793121338, | |
| "learning_rate": 0.00017568676523517878, | |
| "logits/chosen": -0.9449001550674438, | |
| "logits/rejected": -0.9685764908790588, | |
| "logps/chosen": -3.0468153953552246, | |
| "logps/rejected": -99.55249786376953, | |
| "loss": 0.2705683708190918, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23674362897872925, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36185410618782043, | |
| "rewards/margins": 8.01712417602539, | |
| "rewards/rejected": -7.655271053314209, | |
| "step": 421, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.7990059759777528, | |
| "grad_norm": 4.03458833694458, | |
| "learning_rate": 0.00017555008126912168, | |
| "logits/chosen": -0.9106298685073853, | |
| "logits/rejected": -0.9396368861198425, | |
| "logps/chosen": -3.947406768798828, | |
| "logps/rejected": -102.24916076660156, | |
| "loss": 0.4227983355522156, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2840198278427124, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3644457161426544, | |
| "rewards/margins": 7.7836761474609375, | |
| "rewards/rejected": -7.419230937957764, | |
| "step": 422, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8008993550677475, | |
| "grad_norm": 1.4805070161819458, | |
| "learning_rate": 0.00017541306766386512, | |
| "logits/chosen": -0.8955278396606445, | |
| "logits/rejected": -0.9099395871162415, | |
| "logps/chosen": -3.7780051231384277, | |
| "logps/rejected": -91.8361587524414, | |
| "loss": 0.2600992023944855, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15484608709812164, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.31357866525650024, | |
| "rewards/margins": 7.206130504608154, | |
| "rewards/rejected": -6.892551422119141, | |
| "step": 423, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8027927341577421, | |
| "grad_norm": 7.871303081512451, | |
| "learning_rate": 0.00017527572501722512, | |
| "logits/chosen": -0.9275432229042053, | |
| "logits/rejected": -0.9326556324958801, | |
| "logps/chosen": -5.747369766235352, | |
| "logps/rejected": -84.74732208251953, | |
| "loss": 0.3905383348464966, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30991342663764954, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14356550574302673, | |
| "rewards/margins": 6.889118671417236, | |
| "rewards/rejected": -6.745552062988281, | |
| "step": 424, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8046861132477369, | |
| "grad_norm": 4.8259477615356445, | |
| "learning_rate": 0.00017513805392845356, | |
| "logits/chosen": -0.93051677942276, | |
| "logits/rejected": -0.9383388757705688, | |
| "logps/chosen": -6.837670803070068, | |
| "logps/rejected": -88.047119140625, | |
| "loss": 0.4115247428417206, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24050895869731903, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.09084747731685638, | |
| "rewards/margins": 7.040899753570557, | |
| "rewards/rejected": -6.950051784515381, | |
| "step": 425, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8065794923377315, | |
| "grad_norm": 1.4630215167999268, | |
| "learning_rate": 0.00017500005499823519, | |
| "logits/chosen": -0.8715620636940002, | |
| "logits/rejected": -0.8803263306617737, | |
| "logps/chosen": -7.669510841369629, | |
| "logps/rejected": -83.8923568725586, | |
| "loss": 0.37616875767707825, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2779691219329834, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3295210897922516, | |
| "rewards/margins": 7.212647438049316, | |
| "rewards/rejected": -6.883126258850098, | |
| "step": 426, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8084728714277262, | |
| "grad_norm": 7.37748908996582, | |
| "learning_rate": 0.0001748617288286853, | |
| "logits/chosen": -0.9009289741516113, | |
| "logits/rejected": -0.9088554978370667, | |
| "logps/chosen": -7.394189357757568, | |
| "logps/rejected": -108.95574951171875, | |
| "loss": 0.33651089668273926, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2095419317483902, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22998183965682983, | |
| "rewards/margins": 9.595008850097656, | |
| "rewards/rejected": -9.365028381347656, | |
| "step": 427, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8103662505177208, | |
| "grad_norm": 6.123429298400879, | |
| "learning_rate": 0.00017472307602334693, | |
| "logits/chosen": -0.89423668384552, | |
| "logits/rejected": -0.9038995504379272, | |
| "logps/chosen": -8.802855491638184, | |
| "logps/rejected": -88.23287200927734, | |
| "loss": 0.4874518811702728, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3115327060222626, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11184003949165344, | |
| "rewards/margins": 7.504295825958252, | |
| "rewards/rejected": -7.392455577850342, | |
| "step": 428, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8122596296077155, | |
| "grad_norm": 6.689691543579102, | |
| "learning_rate": 0.00017458409718718834, | |
| "logits/chosen": -0.8707554340362549, | |
| "logits/rejected": -0.886796772480011, | |
| "logps/chosen": -4.8936262130737305, | |
| "logps/rejected": -88.58076477050781, | |
| "loss": 0.5303760170936584, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4417770802974701, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15029491484165192, | |
| "rewards/margins": 7.341009140014648, | |
| "rewards/rejected": -7.190713405609131, | |
| "step": 429, | |
| "train_speed(iter/s)": 0.005576 | |
| }, | |
| { | |
| "epoch": 0.8141530086977102, | |
| "grad_norm": 8.597928047180176, | |
| "learning_rate": 0.0001744447929266003, | |
| "logits/chosen": -0.8662844896316528, | |
| "logits/rejected": -0.8829063773155212, | |
| "logps/chosen": -5.029667377471924, | |
| "logps/rejected": -87.51130676269531, | |
| "loss": 0.39819207787513733, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.28675615787506104, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22954146564006805, | |
| "rewards/margins": 6.7957072257995605, | |
| "rewards/rejected": -6.566165924072266, | |
| "step": 430, | |
| "train_speed(iter/s)": 0.005577 | |
| }, | |
| { | |
| "epoch": 0.8160463877877049, | |
| "grad_norm": 2.8258883953094482, | |
| "learning_rate": 0.00017430516384939345, | |
| "logits/chosen": -0.826620876789093, | |
| "logits/rejected": -0.833583414554596, | |
| "logps/chosen": -6.807863235473633, | |
| "logps/rejected": -74.75788879394531, | |
| "loss": 0.524578869342804, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4435310363769531, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2683424651622772, | |
| "rewards/margins": 6.224869728088379, | |
| "rewards/rejected": -5.956527233123779, | |
| "step": 431, | |
| "train_speed(iter/s)": 0.005577 | |
| }, | |
| { | |
| "epoch": 0.8179397668776995, | |
| "grad_norm": 24.219331741333008, | |
| "learning_rate": 0.00017416521056479577, | |
| "logits/chosen": -0.815615177154541, | |
| "logits/rejected": -0.8294793367385864, | |
| "logps/chosen": -5.088006496429443, | |
| "logps/rejected": -85.76319122314453, | |
| "loss": 0.4257265627384186, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.39785972237586975, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33022740483283997, | |
| "rewards/margins": 6.924592018127441, | |
| "rewards/rejected": -6.594364166259766, | |
| "step": 432, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.8198331459676942, | |
| "grad_norm": 9.516819953918457, | |
| "learning_rate": 0.00017402493368344965, | |
| "logits/chosen": -0.7762714624404907, | |
| "logits/rejected": -0.7849063277244568, | |
| "logps/chosen": -6.736428260803223, | |
| "logps/rejected": -70.95455169677734, | |
| "loss": 0.4678858518600464, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3948495388031006, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13923215866088867, | |
| "rewards/margins": 5.282342433929443, | |
| "rewards/rejected": -5.143110275268555, | |
| "step": 433, | |
| "train_speed(iter/s)": 0.005577 | |
| }, | |
| { | |
| "epoch": 0.8217265250576888, | |
| "grad_norm": 7.945901393890381, | |
| "learning_rate": 0.00017388433381740952, | |
| "logits/chosen": -0.7900452613830566, | |
| "logits/rejected": -0.7998518347740173, | |
| "logps/chosen": -6.878015041351318, | |
| "logps/rejected": -73.27943420410156, | |
| "loss": 0.40994495153427124, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3519839644432068, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4654313027858734, | |
| "rewards/margins": 6.1711835861206055, | |
| "rewards/rejected": -5.705752849578857, | |
| "step": 434, | |
| "train_speed(iter/s)": 0.005577 | |
| }, | |
| { | |
| "epoch": 0.8236199041476836, | |
| "grad_norm": 1.621781349182129, | |
| "learning_rate": 0.00017374341158013897, | |
| "logits/chosen": -0.7397841215133667, | |
| "logits/rejected": -0.7477171421051025, | |
| "logps/chosen": -8.785954475402832, | |
| "logps/rejected": -74.62800598144531, | |
| "loss": 0.3700712323188782, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29524165391921997, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4034354090690613, | |
| "rewards/margins": 5.8851189613342285, | |
| "rewards/rejected": -5.481683731079102, | |
| "step": 435, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.8255132832376783, | |
| "grad_norm": 11.901042938232422, | |
| "learning_rate": 0.00017360216758650828, | |
| "logits/chosen": -0.7307888269424438, | |
| "logits/rejected": -0.73638516664505, | |
| "logps/chosen": -8.413528442382812, | |
| "logps/rejected": -62.19019317626953, | |
| "loss": 0.4531805217266083, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3570531904697418, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.39727261662483215, | |
| "rewards/margins": 4.906312465667725, | |
| "rewards/rejected": -4.509039878845215, | |
| "step": 436, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.8274066623276729, | |
| "grad_norm": 12.022588729858398, | |
| "learning_rate": 0.00017346060245279147, | |
| "logits/chosen": -0.7360296249389648, | |
| "logits/rejected": -0.7512168288230896, | |
| "logps/chosen": -5.395040035247803, | |
| "logps/rejected": -66.02803802490234, | |
| "loss": 0.2887762784957886, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22481848299503326, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2582862079143524, | |
| "rewards/margins": 4.8272881507873535, | |
| "rewards/rejected": -4.5690016746521, | |
| "step": 437, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.8293000414176676, | |
| "grad_norm": 5.518744945526123, | |
| "learning_rate": 0.0001733187167966638, | |
| "logits/chosen": -0.7701220512390137, | |
| "logits/rejected": -0.7844356298446655, | |
| "logps/chosen": -2.579286575317383, | |
| "logps/rejected": -66.53873443603516, | |
| "loss": 0.3727279603481293, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2864982485771179, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4387655556201935, | |
| "rewards/margins": 5.002132415771484, | |
| "rewards/rejected": -4.563366413116455, | |
| "step": 438, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.8311934205076623, | |
| "grad_norm": 3.2701282501220703, | |
| "learning_rate": 0.00017317651123719912, | |
| "logits/chosen": -0.7506716251373291, | |
| "logits/rejected": -0.7568422555923462, | |
| "logps/chosen": -11.24153995513916, | |
| "logps/rejected": -60.69418716430664, | |
| "loss": 0.5295559763908386, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45408472418785095, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36308178305625916, | |
| "rewards/margins": 4.746029853820801, | |
| "rewards/rejected": -4.38294792175293, | |
| "step": 439, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.833086799597657, | |
| "grad_norm": 1.1384278535842896, | |
| "learning_rate": 0.00017303398639486695, | |
| "logits/chosen": -0.731947660446167, | |
| "logits/rejected": -0.7437530755996704, | |
| "logps/chosen": -9.611553192138672, | |
| "logps/rejected": -76.5805892944336, | |
| "loss": 0.2904091775417328, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2315519154071808, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.531777024269104, | |
| "rewards/margins": 5.823252201080322, | |
| "rewards/rejected": -5.291475772857666, | |
| "step": 440, | |
| "train_speed(iter/s)": 0.005578 | |
| }, | |
| { | |
| "epoch": 0.8349801786876516, | |
| "grad_norm": 0.8361400365829468, | |
| "learning_rate": 0.00017289114289152996, | |
| "logits/chosen": -0.7166184186935425, | |
| "logits/rejected": -0.734869122505188, | |
| "logps/chosen": -5.195431232452393, | |
| "logps/rejected": -79.26923370361328, | |
| "loss": 0.25895360112190247, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21112824976444244, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6189270615577698, | |
| "rewards/margins": 6.133816242218018, | |
| "rewards/rejected": -5.514889240264893, | |
| "step": 441, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8368735577776463, | |
| "grad_norm": 2.4993669986724854, | |
| "learning_rate": 0.00017274798135044118, | |
| "logits/chosen": -0.790854811668396, | |
| "logits/rejected": -0.8087242841720581, | |
| "logps/chosen": -3.1484498977661133, | |
| "logps/rejected": -92.63924407958984, | |
| "loss": 0.17340044677257538, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11792504787445068, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.323365181684494, | |
| "rewards/margins": 7.355247497558594, | |
| "rewards/rejected": -7.0318827629089355, | |
| "step": 442, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8387669368676409, | |
| "grad_norm": 1.7912027835845947, | |
| "learning_rate": 0.00017260450239624136, | |
| "logits/chosen": -0.7304463982582092, | |
| "logits/rejected": -0.7448377013206482, | |
| "logps/chosen": -5.269331932067871, | |
| "logps/rejected": -84.68616485595703, | |
| "loss": 0.2722683548927307, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19279897212982178, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2668758034706116, | |
| "rewards/margins": 6.523564338684082, | |
| "rewards/rejected": -6.256688117980957, | |
| "step": 443, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8406603159576357, | |
| "grad_norm": 2.5274224281311035, | |
| "learning_rate": 0.00017246070665495608, | |
| "logits/chosen": -0.754114031791687, | |
| "logits/rejected": -0.7749913930892944, | |
| "logps/chosen": -4.680078506469727, | |
| "logps/rejected": -90.58206939697266, | |
| "loss": 0.2556043863296509, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2013716846704483, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5823894739151001, | |
| "rewards/margins": 7.6140594482421875, | |
| "rewards/rejected": -7.031670570373535, | |
| "step": 444, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8425536950476303, | |
| "grad_norm": 1.2107690572738647, | |
| "learning_rate": 0.00017231659475399323, | |
| "logits/chosen": -0.7979104518890381, | |
| "logits/rejected": -0.8069046139717102, | |
| "logps/chosen": -4.9781174659729, | |
| "logps/rejected": -66.70126342773438, | |
| "loss": 0.30611103773117065, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23165598511695862, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4561145305633545, | |
| "rewards/margins": 5.505497455596924, | |
| "rewards/rejected": -5.04938268661499, | |
| "step": 445, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.844447074137625, | |
| "grad_norm": 4.050295829772949, | |
| "learning_rate": 0.0001721721673221401, | |
| "logits/chosen": -0.7885401248931885, | |
| "logits/rejected": -0.8013665676116943, | |
| "logps/chosen": -6.65448522567749, | |
| "logps/rejected": -85.34944152832031, | |
| "loss": 0.3965107798576355, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25117045640945435, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4342056214809418, | |
| "rewards/margins": 7.116891860961914, | |
| "rewards/rejected": -6.682686805725098, | |
| "step": 446, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8463404532276196, | |
| "grad_norm": 1.9369865655899048, | |
| "learning_rate": 0.00017202742498956066, | |
| "logits/chosen": -0.8296957612037659, | |
| "logits/rejected": -0.8483850359916687, | |
| "logps/chosen": -5.465951442718506, | |
| "logps/rejected": -83.44580078125, | |
| "loss": 0.29229405522346497, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2555358409881592, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34571531414985657, | |
| "rewards/margins": 6.757546901702881, | |
| "rewards/rejected": -6.411831855773926, | |
| "step": 447, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8482338323176143, | |
| "grad_norm": 1.0717179775238037, | |
| "learning_rate": 0.00017188236838779295, | |
| "logits/chosen": -0.8507705926895142, | |
| "logits/rejected": -0.8675693273544312, | |
| "logps/chosen": -3.8401472568511963, | |
| "logps/rejected": -105.99805450439453, | |
| "loss": 0.2020038366317749, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15445975959300995, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43529555201530457, | |
| "rewards/margins": 8.494356155395508, | |
| "rewards/rejected": -8.059060096740723, | |
| "step": 448, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.850127211407609, | |
| "grad_norm": 1.2371408939361572, | |
| "learning_rate": 0.00017173699814974615, | |
| "logits/chosen": -0.8888499140739441, | |
| "logits/rejected": -0.8976138234138489, | |
| "logps/chosen": -6.716226100921631, | |
| "logps/rejected": -81.250732421875, | |
| "loss": 0.3499948978424072, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29640763998031616, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4713817238807678, | |
| "rewards/margins": 7.038424491882324, | |
| "rewards/rejected": -6.567043304443359, | |
| "step": 449, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8520205904976037, | |
| "grad_norm": 1.0314913988113403, | |
| "learning_rate": 0.00017159131490969797, | |
| "logits/chosen": -0.8845159411430359, | |
| "logits/rejected": -0.897428035736084, | |
| "logps/chosen": -7.58637809753418, | |
| "logps/rejected": -90.65620422363281, | |
| "loss": 0.22296631336212158, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1991596817970276, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3203076124191284, | |
| "rewards/margins": 7.438530921936035, | |
| "rewards/rejected": -7.118223667144775, | |
| "step": 450, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8539139695875984, | |
| "grad_norm": 14.719244003295898, | |
| "learning_rate": 0.0001714453193032917, | |
| "logits/chosen": -0.8827124834060669, | |
| "logits/rejected": -0.893791675567627, | |
| "logps/chosen": -4.368500232696533, | |
| "logps/rejected": -82.19820404052734, | |
| "loss": 0.31974878907203674, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24097216129302979, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.44965288043022156, | |
| "rewards/margins": 6.721735000610352, | |
| "rewards/rejected": -6.2720818519592285, | |
| "step": 451, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.855807348677593, | |
| "grad_norm": 36.062278747558594, | |
| "learning_rate": 0.00017129901196753363, | |
| "logits/chosen": -0.9345687627792358, | |
| "logits/rejected": -0.9502599835395813, | |
| "logps/chosen": -5.315582275390625, | |
| "logps/rejected": -83.8296127319336, | |
| "loss": 0.34316593408584595, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2703927457332611, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2453213632106781, | |
| "rewards/margins": 6.990170955657959, | |
| "rewards/rejected": -6.744849681854248, | |
| "step": 452, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8577007277675878, | |
| "grad_norm": 1.541624903678894, | |
| "learning_rate": 0.00017115239354079017, | |
| "logits/chosen": -0.9115346074104309, | |
| "logits/rejected": -0.9224709868431091, | |
| "logps/chosen": -9.181022644042969, | |
| "logps/rejected": -101.25410461425781, | |
| "loss": 0.34988313913345337, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3383327126502991, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34222501516342163, | |
| "rewards/margins": 8.531024932861328, | |
| "rewards/rejected": -8.188799858093262, | |
| "step": 453, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8595941068575824, | |
| "grad_norm": 3.925374746322632, | |
| "learning_rate": 0.00017100546466278504, | |
| "logits/chosen": -0.9633154273033142, | |
| "logits/rejected": -0.9739294648170471, | |
| "logps/chosen": -4.56303071975708, | |
| "logps/rejected": -88.93602752685547, | |
| "loss": 0.25692471861839294, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2111371010541916, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45011770725250244, | |
| "rewards/margins": 7.744128227233887, | |
| "rewards/rejected": -7.294011116027832, | |
| "step": 454, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8614874859475771, | |
| "grad_norm": 1.6003632545471191, | |
| "learning_rate": 0.00017085822597459656, | |
| "logits/chosen": -0.9982748627662659, | |
| "logits/rejected": -1.014983892440796, | |
| "logps/chosen": -4.145792484283447, | |
| "logps/rejected": -106.2919921875, | |
| "loss": 0.3255295157432556, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18978404998779297, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3449160158634186, | |
| "rewards/margins": 8.899467468261719, | |
| "rewards/rejected": -8.554551124572754, | |
| "step": 455, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8633808650375717, | |
| "grad_norm": 1.9852300882339478, | |
| "learning_rate": 0.00017071067811865476, | |
| "logits/chosen": -0.9765909910202026, | |
| "logits/rejected": -0.9930113554000854, | |
| "logps/chosen": -7.842015266418457, | |
| "logps/rejected": -123.04806518554688, | |
| "loss": 0.32382023334503174, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31453680992126465, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43028274178504944, | |
| "rewards/margins": 10.73808765411377, | |
| "rewards/rejected": -10.307806015014648, | |
| "step": 456, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8652742441275664, | |
| "grad_norm": 1.2360267639160156, | |
| "learning_rate": 0.00017056282173873868, | |
| "logits/chosen": -0.9575759768486023, | |
| "logits/rejected": -0.9700069427490234, | |
| "logps/chosen": -10.015963554382324, | |
| "logps/rejected": -102.37469482421875, | |
| "loss": 0.3883022665977478, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3106726109981537, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5499778389930725, | |
| "rewards/margins": 8.473649024963379, | |
| "rewards/rejected": -7.923670291900635, | |
| "step": 457, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8671676232175611, | |
| "grad_norm": 1.6001282930374146, | |
| "learning_rate": 0.00017041465747997349, | |
| "logits/chosen": -0.9415493011474609, | |
| "logits/rejected": -0.9562855958938599, | |
| "logps/chosen": -9.043622016906738, | |
| "logps/rejected": -96.49923706054688, | |
| "loss": 0.4010081887245178, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3429657518863678, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36076611280441284, | |
| "rewards/margins": 7.912264823913574, | |
| "rewards/rejected": -7.551499366760254, | |
| "step": 458, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8690610023075558, | |
| "grad_norm": 4.4591827392578125, | |
| "learning_rate": 0.00017026618598882766, | |
| "logits/chosen": -0.8824436068534851, | |
| "logits/rejected": -0.9026194214820862, | |
| "logps/chosen": -5.729236602783203, | |
| "logps/rejected": -98.84695434570312, | |
| "loss": 0.6645115613937378, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5048111081123352, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15461787581443787, | |
| "rewards/margins": 8.146541595458984, | |
| "rewards/rejected": -7.991923809051514, | |
| "step": 459, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 0.8709543813975504, | |
| "grad_norm": 4.195268630981445, | |
| "learning_rate": 0.00017011740791311026, | |
| "logits/chosen": -0.9580066800117493, | |
| "logits/rejected": -0.9738634824752808, | |
| "logps/chosen": -8.056970596313477, | |
| "logps/rejected": -81.84449005126953, | |
| "loss": 0.43963536620140076, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26443713903427124, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40618056058883667, | |
| "rewards/margins": 6.734289646148682, | |
| "rewards/rejected": -6.328108787536621, | |
| "step": 460, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8728477604875451, | |
| "grad_norm": 1.0153616666793823, | |
| "learning_rate": 0.00016996832390196793, | |
| "logits/chosen": -0.8880928158760071, | |
| "logits/rejected": -0.8997581601142883, | |
| "logps/chosen": -6.155505657196045, | |
| "logps/rejected": -90.45980834960938, | |
| "loss": 0.25239306688308716, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20010052621364594, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5011169910430908, | |
| "rewards/margins": 7.597998142242432, | |
| "rewards/rejected": -7.09688138961792, | |
| "step": 461, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8747411395775397, | |
| "grad_norm": 1.5598828792572021, | |
| "learning_rate": 0.00016981893460588223, | |
| "logits/chosen": -0.9450682401657104, | |
| "logits/rejected": -0.9603253602981567, | |
| "logps/chosen": -5.602974891662598, | |
| "logps/rejected": -77.44328308105469, | |
| "loss": 0.2963503897190094, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19901219010353088, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3095168471336365, | |
| "rewards/margins": 6.423759937286377, | |
| "rewards/rejected": -6.114243507385254, | |
| "step": 462, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8766345186675345, | |
| "grad_norm": 1.6015018224716187, | |
| "learning_rate": 0.00016966924067666675, | |
| "logits/chosen": -0.9075458645820618, | |
| "logits/rejected": -0.9180577397346497, | |
| "logps/chosen": -5.821288108825684, | |
| "logps/rejected": -82.2751235961914, | |
| "loss": 0.4034554958343506, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32892781496047974, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.50316321849823, | |
| "rewards/margins": 7.111847400665283, | |
| "rewards/rejected": -6.608684539794922, | |
| "step": 463, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8785278977575292, | |
| "grad_norm": 1.3844958543777466, | |
| "learning_rate": 0.00016951924276746425, | |
| "logits/chosen": -0.9798877239227295, | |
| "logits/rejected": -0.9947710633277893, | |
| "logps/chosen": -4.286856651306152, | |
| "logps/rejected": -95.45182037353516, | |
| "loss": 0.24686779081821442, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19889356195926666, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41103440523147583, | |
| "rewards/margins": 8.060623168945312, | |
| "rewards/rejected": -7.649588584899902, | |
| "step": 464, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8804212768475238, | |
| "grad_norm": 0.8604599833488464, | |
| "learning_rate": 0.0001693689415327437, | |
| "logits/chosen": -0.9294370412826538, | |
| "logits/rejected": -0.944360077381134, | |
| "logps/chosen": -3.5297131538391113, | |
| "logps/rejected": -95.1581039428711, | |
| "loss": 0.15934985876083374, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.09140884131193161, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4215770959854126, | |
| "rewards/margins": 8.435728073120117, | |
| "rewards/rejected": -8.014151573181152, | |
| "step": 465, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8823146559375185, | |
| "grad_norm": 1.621468186378479, | |
| "learning_rate": 0.00016921833762829772, | |
| "logits/chosen": -0.9183394312858582, | |
| "logits/rejected": -0.9399121403694153, | |
| "logps/chosen": -3.055697441101074, | |
| "logps/rejected": -108.91096496582031, | |
| "loss": 0.22333787381649017, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14798688888549805, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5031476616859436, | |
| "rewards/margins": 9.055591583251953, | |
| "rewards/rejected": -8.552444458007812, | |
| "step": 466, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8842080350275132, | |
| "grad_norm": 0.7695557475090027, | |
| "learning_rate": 0.00016906743171123942, | |
| "logits/chosen": -0.9076614379882812, | |
| "logits/rejected": -0.937860906124115, | |
| "logps/chosen": -3.8487682342529297, | |
| "logps/rejected": -115.37907409667969, | |
| "loss": 0.2175092250108719, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20558762550354004, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4292341470718384, | |
| "rewards/margins": 9.0150146484375, | |
| "rewards/rejected": -8.585780143737793, | |
| "step": 467, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8861014141175079, | |
| "grad_norm": 22.37851333618164, | |
| "learning_rate": 0.00016891622443999965, | |
| "logits/chosen": -0.938933789730072, | |
| "logits/rejected": -0.9588154554367065, | |
| "logps/chosen": -4.282645225524902, | |
| "logps/rejected": -119.61936950683594, | |
| "loss": 0.28716757893562317, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1910058856010437, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4263598322868347, | |
| "rewards/margins": 10.150740623474121, | |
| "rewards/rejected": -9.724381446838379, | |
| "step": 468, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8879947932075025, | |
| "grad_norm": 2.1868958473205566, | |
| "learning_rate": 0.00016876471647432414, | |
| "logits/chosen": -0.9410998225212097, | |
| "logits/rejected": -0.9753378629684448, | |
| "logps/chosen": -2.8839712142944336, | |
| "logps/rejected": -123.82636260986328, | |
| "loss": 0.30020710825920105, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16036656498908997, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36097994446754456, | |
| "rewards/margins": 9.432804107666016, | |
| "rewards/rejected": -9.071824073791504, | |
| "step": 469, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8898881722974972, | |
| "grad_norm": 1.1966303586959839, | |
| "learning_rate": 0.00016861290847527066, | |
| "logits/chosen": -0.9341630935668945, | |
| "logits/rejected": -0.9561231732368469, | |
| "logps/chosen": -4.715222358703613, | |
| "logps/rejected": -99.74626922607422, | |
| "loss": 0.2830410897731781, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26199036836624146, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5495744943618774, | |
| "rewards/margins": 8.375075340270996, | |
| "rewards/rejected": -7.825501441955566, | |
| "step": 470, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8917815513874918, | |
| "grad_norm": 5.522665977478027, | |
| "learning_rate": 0.00016846080110520593, | |
| "logits/chosen": -0.8682283759117126, | |
| "logits/rejected": -0.8838706016540527, | |
| "logps/chosen": -7.110651969909668, | |
| "logps/rejected": -98.35552215576172, | |
| "loss": 0.5406176447868347, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3845999240875244, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2689996361732483, | |
| "rewards/margins": 8.083311080932617, | |
| "rewards/rejected": -7.814311504364014, | |
| "step": 471, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8936749304774866, | |
| "grad_norm": 0.9458474516868591, | |
| "learning_rate": 0.0001683083950278031, | |
| "logits/chosen": -0.9151694178581238, | |
| "logits/rejected": -0.9346402883529663, | |
| "logps/chosen": -4.737029075622559, | |
| "logps/rejected": -121.00469970703125, | |
| "loss": 0.2966020405292511, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2277030497789383, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4393775463104248, | |
| "rewards/margins": 10.670300483703613, | |
| "rewards/rejected": -10.23092269897461, | |
| "step": 472, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8955683095674812, | |
| "grad_norm": 7.999751091003418, | |
| "learning_rate": 0.00016815569090803845, | |
| "logits/chosen": -0.8978246450424194, | |
| "logits/rejected": -0.9048880934715271, | |
| "logps/chosen": -7.204007148742676, | |
| "logps/rejected": -87.66303253173828, | |
| "loss": 0.42673900723457336, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35650965571403503, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3317716717720032, | |
| "rewards/margins": 7.524182319641113, | |
| "rewards/rejected": -7.192410469055176, | |
| "step": 473, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8974616886574759, | |
| "grad_norm": 0.7010167837142944, | |
| "learning_rate": 0.00016800268941218876, | |
| "logits/chosen": -0.8622817397117615, | |
| "logits/rejected": -0.8864709138870239, | |
| "logps/chosen": -4.245789051055908, | |
| "logps/rejected": -120.96448516845703, | |
| "loss": 0.1819450557231903, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14287763833999634, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41072070598602295, | |
| "rewards/margins": 10.304065704345703, | |
| "rewards/rejected": -9.89334487915039, | |
| "step": 474, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 0.8993550677474705, | |
| "grad_norm": 7.6167731285095215, | |
| "learning_rate": 0.0001678493912078283, | |
| "logits/chosen": -0.8571869730949402, | |
| "logits/rejected": -0.8682100772857666, | |
| "logps/chosen": -6.5908732414245605, | |
| "logps/rejected": -90.01347351074219, | |
| "loss": 0.3374626636505127, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2244843989610672, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3946775496006012, | |
| "rewards/margins": 7.9344305992126465, | |
| "rewards/rejected": -7.539752006530762, | |
| "step": 475, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.9012484468374652, | |
| "grad_norm": 3.698955774307251, | |
| "learning_rate": 0.00016769579696382597, | |
| "logits/chosen": -0.8630130887031555, | |
| "logits/rejected": -0.8758262991905212, | |
| "logps/chosen": -4.464090347290039, | |
| "logps/rejected": -84.8655014038086, | |
| "loss": 0.24113307893276215, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19968506693840027, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5144667625427246, | |
| "rewards/margins": 7.58385705947876, | |
| "rewards/rejected": -7.069390296936035, | |
| "step": 476, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.90314182592746, | |
| "grad_norm": 1.0875921249389648, | |
| "learning_rate": 0.00016754190735034232, | |
| "logits/chosen": -0.8026514649391174, | |
| "logits/rejected": -0.8109226226806641, | |
| "logps/chosen": -7.072743892669678, | |
| "logps/rejected": -81.69027709960938, | |
| "loss": 0.3926900029182434, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32436299324035645, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.42420172691345215, | |
| "rewards/margins": 7.307297706604004, | |
| "rewards/rejected": -6.883096694946289, | |
| "step": 477, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.9050352050174546, | |
| "grad_norm": 12.628859519958496, | |
| "learning_rate": 0.00016738772303882658, | |
| "logits/chosen": -0.8218420743942261, | |
| "logits/rejected": -0.8415544033050537, | |
| "logps/chosen": -3.9710536003112793, | |
| "logps/rejected": -114.25907897949219, | |
| "loss": 0.285603404045105, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2653937041759491, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3051114082336426, | |
| "rewards/margins": 9.78807544708252, | |
| "rewards/rejected": -9.482963562011719, | |
| "step": 478, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.9069285841074493, | |
| "grad_norm": 3.7553205490112305, | |
| "learning_rate": 0.00016723324470201394, | |
| "logits/chosen": -0.8214201927185059, | |
| "logits/rejected": -0.8359025716781616, | |
| "logps/chosen": -7.0973076820373535, | |
| "logps/rejected": -96.85978698730469, | |
| "loss": 0.2682635188102722, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21152906119823456, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.429471880197525, | |
| "rewards/margins": 8.366806983947754, | |
| "rewards/rejected": -7.937335968017578, | |
| "step": 479, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.9088219631974439, | |
| "grad_norm": 5.100663661956787, | |
| "learning_rate": 0.00016707847301392236, | |
| "logits/chosen": -0.8678508996963501, | |
| "logits/rejected": -0.886093258857727, | |
| "logps/chosen": -4.311007976531982, | |
| "logps/rejected": -87.9342269897461, | |
| "loss": 0.3412279784679413, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16602440178394318, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21858087182044983, | |
| "rewards/margins": 6.955101490020752, | |
| "rewards/rejected": -6.736520767211914, | |
| "step": 480, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.9107153422874387, | |
| "grad_norm": 2.6578102111816406, | |
| "learning_rate": 0.0001669234086498498, | |
| "logits/chosen": -0.8269668817520142, | |
| "logits/rejected": -0.8376889824867249, | |
| "logps/chosen": -6.732077598571777, | |
| "logps/rejected": -84.00537109375, | |
| "loss": 0.5132743716239929, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4207915961742401, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21707794070243835, | |
| "rewards/margins": 6.86088752746582, | |
| "rewards/rejected": -6.643810272216797, | |
| "step": 481, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.9126087213774333, | |
| "grad_norm": 7.355591773986816, | |
| "learning_rate": 0.00016676805228637128, | |
| "logits/chosen": -0.7974196672439575, | |
| "logits/rejected": -0.8050395250320435, | |
| "logps/chosen": -9.839652061462402, | |
| "logps/rejected": -77.39722442626953, | |
| "loss": 0.3702613115310669, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3158036768436432, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.38017088174819946, | |
| "rewards/margins": 6.458867073059082, | |
| "rewards/rejected": -6.078695774078369, | |
| "step": 482, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 0.914502100467428, | |
| "grad_norm": 1.2167003154754639, | |
| "learning_rate": 0.0001666124046013357, | |
| "logits/chosen": -0.8047705292701721, | |
| "logits/rejected": -0.821438193321228, | |
| "logps/chosen": -4.215728759765625, | |
| "logps/rejected": -84.90574645996094, | |
| "loss": 0.2564030885696411, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17464032769203186, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.36784717440605164, | |
| "rewards/margins": 6.691460132598877, | |
| "rewards/rejected": -6.323612689971924, | |
| "step": 483, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 0.9163954795574226, | |
| "grad_norm": 1.4329453706741333, | |
| "learning_rate": 0.0001664564662738632, | |
| "logits/chosen": -0.8270524144172668, | |
| "logits/rejected": -0.843065619468689, | |
| "logps/chosen": -3.869436502456665, | |
| "logps/rejected": -82.40938568115234, | |
| "loss": 0.32981476187705994, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24593578279018402, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4524030089378357, | |
| "rewards/margins": 6.6524176597595215, | |
| "rewards/rejected": -6.200014591217041, | |
| "step": 484, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 0.9182888586474173, | |
| "grad_norm": 1.2793928384780884, | |
| "learning_rate": 0.00016630023798434206, | |
| "logits/chosen": -0.8093842267990112, | |
| "logits/rejected": -0.8249430656433105, | |
| "logps/chosen": -3.626284122467041, | |
| "logps/rejected": -91.00061798095703, | |
| "loss": 0.26968449354171753, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18248513340950012, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5210257768630981, | |
| "rewards/margins": 7.8323211669921875, | |
| "rewards/rejected": -7.311295509338379, | |
| "step": 485, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 0.920182237737412, | |
| "grad_norm": 1.2872005701065063, | |
| "learning_rate": 0.0001661437204144256, | |
| "logits/chosen": -0.8859755396842957, | |
| "logits/rejected": -0.9020763635635376, | |
| "logps/chosen": -3.142106771469116, | |
| "logps/rejected": -110.82911682128906, | |
| "loss": 0.23602813482284546, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17257589101791382, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2963697910308838, | |
| "rewards/margins": 9.594768524169922, | |
| "rewards/rejected": -9.2983980178833, | |
| "step": 486, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 0.9220756168274067, | |
| "grad_norm": 1.0377421379089355, | |
| "learning_rate": 0.00016598691424702937, | |
| "logits/chosen": -0.8930898904800415, | |
| "logits/rejected": -0.9027186036109924, | |
| "logps/chosen": -8.572845458984375, | |
| "logps/rejected": -103.29754638671875, | |
| "loss": 0.34422510862350464, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31612199544906616, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.42877423763275146, | |
| "rewards/margins": 9.359115600585938, | |
| "rewards/rejected": -8.930340766906738, | |
| "step": 487, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9239689959174013, | |
| "grad_norm": 5.561287879943848, | |
| "learning_rate": 0.00016582982016632818, | |
| "logits/chosen": -0.9102674126625061, | |
| "logits/rejected": -0.9301952123641968, | |
| "logps/chosen": -5.624942302703857, | |
| "logps/rejected": -136.92950439453125, | |
| "loss": 0.411335289478302, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3478354811668396, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.40333279967308044, | |
| "rewards/margins": 12.023845672607422, | |
| "rewards/rejected": -11.620512962341309, | |
| "step": 488, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.925862375007396, | |
| "grad_norm": 1.0229040384292603, | |
| "learning_rate": 0.000165672438857753, | |
| "logits/chosen": -0.9191131591796875, | |
| "logits/rejected": -0.924005389213562, | |
| "logps/chosen": -7.766480922698975, | |
| "logps/rejected": -100.96819305419922, | |
| "loss": 0.3040256202220917, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26725876331329346, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4234240651130676, | |
| "rewards/margins": 9.132671356201172, | |
| "rewards/rejected": -8.709247589111328, | |
| "step": 489, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9277557540973906, | |
| "grad_norm": 19.993261337280273, | |
| "learning_rate": 0.00016551477100798805, | |
| "logits/chosen": -0.9173243045806885, | |
| "logits/rejected": -0.931130051612854, | |
| "logps/chosen": -9.224342346191406, | |
| "logps/rejected": -119.46231079101562, | |
| "loss": 0.6596160531044006, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5873731374740601, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28087401390075684, | |
| "rewards/margins": 9.973217010498047, | |
| "rewards/rejected": -9.692342758178711, | |
| "step": 490, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9296491331873854, | |
| "grad_norm": 1.2866884469985962, | |
| "learning_rate": 0.00016535681730496778, | |
| "logits/chosen": -0.9484301805496216, | |
| "logits/rejected": -0.9697479605674744, | |
| "logps/chosen": -7.1799516677856445, | |
| "logps/rejected": -141.3379364013672, | |
| "loss": 0.28797227144241333, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25906774401664734, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5529451370239258, | |
| "rewards/margins": 12.745800971984863, | |
| "rewards/rejected": -12.192853927612305, | |
| "step": 491, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.93154251227738, | |
| "grad_norm": 1.1486427783966064, | |
| "learning_rate": 0.00016519857843787388, | |
| "logits/chosen": -0.8829447627067566, | |
| "logits/rejected": -0.8954159021377563, | |
| "logps/chosen": -3.612278938293457, | |
| "logps/rejected": -104.1048583984375, | |
| "loss": 0.24075637757778168, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17766651511192322, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.39927470684051514, | |
| "rewards/margins": 9.08088493347168, | |
| "rewards/rejected": -8.681610107421875, | |
| "step": 492, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9334358913673747, | |
| "grad_norm": 6.187593460083008, | |
| "learning_rate": 0.00016504005509713227, | |
| "logits/chosen": -0.9053263068199158, | |
| "logits/rejected": -0.9288167357444763, | |
| "logps/chosen": -7.226568222045898, | |
| "logps/rejected": -149.4182586669922, | |
| "loss": 1.2350273132324219, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 1.0333458185195923, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1103183850646019, | |
| "rewards/margins": 12.931726455688477, | |
| "rewards/rejected": -12.821407318115234, | |
| "step": 493, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9353292704573694, | |
| "grad_norm": 4.0292534828186035, | |
| "learning_rate": 0.00016488124797441004, | |
| "logits/chosen": -0.896517813205719, | |
| "logits/rejected": -0.9123057126998901, | |
| "logps/chosen": -3.1331238746643066, | |
| "logps/rejected": -122.09529113769531, | |
| "loss": 0.26523512601852417, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22852984070777893, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41106387972831726, | |
| "rewards/margins": 11.093954086303711, | |
| "rewards/rejected": -10.682888984680176, | |
| "step": 494, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.937222649547364, | |
| "grad_norm": 3.866851329803467, | |
| "learning_rate": 0.00016472215776261256, | |
| "logits/chosen": -0.8998519778251648, | |
| "logits/rejected": -0.9100637435913086, | |
| "logps/chosen": -6.161553382873535, | |
| "logps/rejected": -91.67127990722656, | |
| "loss": 0.32430458068847656, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29789990186691284, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37541043758392334, | |
| "rewards/margins": 7.9647979736328125, | |
| "rewards/rejected": -7.589386940002441, | |
| "step": 495, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9391160286373588, | |
| "grad_norm": 1.5745933055877686, | |
| "learning_rate": 0.00016456278515588024, | |
| "logits/chosen": -0.9250640869140625, | |
| "logits/rejected": -0.9345837831497192, | |
| "logps/chosen": -3.4266815185546875, | |
| "logps/rejected": -95.2527084350586, | |
| "loss": 0.22486472129821777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14442774653434753, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35136106610298157, | |
| "rewards/margins": 8.68508243560791, | |
| "rewards/rejected": -8.333721160888672, | |
| "step": 496, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9410094077273534, | |
| "grad_norm": 2.027763843536377, | |
| "learning_rate": 0.00016440313084958578, | |
| "logits/chosen": -0.8975878953933716, | |
| "logits/rejected": -0.9132086038589478, | |
| "logps/chosen": -4.722578525543213, | |
| "logps/rejected": -108.40174865722656, | |
| "loss": 0.2619985342025757, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22499336302280426, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.31465330719947815, | |
| "rewards/margins": 9.058952331542969, | |
| "rewards/rejected": -8.744298934936523, | |
| "step": 497, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9429027868173481, | |
| "grad_norm": 31.387229919433594, | |
| "learning_rate": 0.00016424319554033084, | |
| "logits/chosen": -0.8927862048149109, | |
| "logits/rejected": -0.9180783629417419, | |
| "logps/chosen": -3.2301762104034424, | |
| "logps/rejected": -132.96664428710938, | |
| "loss": 0.3428140878677368, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.303774356842041, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41509026288986206, | |
| "rewards/margins": 11.307497024536133, | |
| "rewards/rejected": -10.89240550994873, | |
| "step": 498, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9447961659073427, | |
| "grad_norm": 0.9289922714233398, | |
| "learning_rate": 0.0001640829799259433, | |
| "logits/chosen": -0.9254931807518005, | |
| "logits/rejected": -0.9433070421218872, | |
| "logps/chosen": -1.6293895244598389, | |
| "logps/rejected": -97.64047241210938, | |
| "loss": 0.15687072277069092, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13367648422718048, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4715469181537628, | |
| "rewards/margins": 8.527523040771484, | |
| "rewards/rejected": -8.055976867675781, | |
| "step": 499, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9466895449973375, | |
| "grad_norm": 2.5266456604003906, | |
| "learning_rate": 0.00016392248470547394, | |
| "logits/chosen": -0.8945059776306152, | |
| "logits/rejected": -0.9079508781433105, | |
| "logps/chosen": -4.099118709564209, | |
| "logps/rejected": -92.66238403320312, | |
| "loss": 0.30788105726242065, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.255858838558197, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23659808933734894, | |
| "rewards/margins": 7.956408500671387, | |
| "rewards/rejected": -7.719810485839844, | |
| "step": 500, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9485829240873321, | |
| "grad_norm": 6.29925012588501, | |
| "learning_rate": 0.00016376171057919358, | |
| "logits/chosen": -0.9756448268890381, | |
| "logits/rejected": -0.9866229891777039, | |
| "logps/chosen": -4.4007415771484375, | |
| "logps/rejected": -88.4787368774414, | |
| "loss": 0.5212814211845398, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.49678102135658264, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5291932225227356, | |
| "rewards/margins": 8.009785652160645, | |
| "rewards/rejected": -7.480591773986816, | |
| "step": 501, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9504763031773268, | |
| "grad_norm": 14.686606407165527, | |
| "learning_rate": 0.00016360065824858993, | |
| "logits/chosen": -0.8657544851303101, | |
| "logits/rejected": -0.8791153430938721, | |
| "logps/chosen": -5.418216705322266, | |
| "logps/rejected": -87.16682434082031, | |
| "loss": 0.5172737240791321, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4656076729297638, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30911099910736084, | |
| "rewards/margins": 7.13665771484375, | |
| "rewards/rejected": -6.827547073364258, | |
| "step": 502, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9523696822673214, | |
| "grad_norm": 0.8342228531837463, | |
| "learning_rate": 0.00016343932841636456, | |
| "logits/chosen": -0.9093836545944214, | |
| "logits/rejected": -0.9287516474723816, | |
| "logps/chosen": -4.357170104980469, | |
| "logps/rejected": -101.34312438964844, | |
| "loss": 0.23222270607948303, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16751480102539062, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3810700476169586, | |
| "rewards/margins": 8.414416313171387, | |
| "rewards/rejected": -8.033347129821777, | |
| "step": 503, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9542630613573161, | |
| "grad_norm": 2.5457377433776855, | |
| "learning_rate": 0.00016327772178642986, | |
| "logits/chosen": -0.9070831537246704, | |
| "logits/rejected": -0.9166555404663086, | |
| "logps/chosen": -7.324579238891602, | |
| "logps/rejected": -86.09144592285156, | |
| "loss": 0.4546603858470917, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3363542854785919, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4323062300682068, | |
| "rewards/margins": 7.224738597869873, | |
| "rewards/rejected": -6.79243278503418, | |
| "step": 504, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9561564404473109, | |
| "grad_norm": 1.2815897464752197, | |
| "learning_rate": 0.00016311583906390592, | |
| "logits/chosen": -0.9519956707954407, | |
| "logits/rejected": -0.9706866145133972, | |
| "logps/chosen": -4.026782989501953, | |
| "logps/rejected": -92.71136474609375, | |
| "loss": 0.2715020179748535, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20830240845680237, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.504820704460144, | |
| "rewards/margins": 7.9874420166015625, | |
| "rewards/rejected": -7.482622146606445, | |
| "step": 505, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9580498195373055, | |
| "grad_norm": 1.0361456871032715, | |
| "learning_rate": 0.00016295368095511746, | |
| "logits/chosen": -0.9036988615989685, | |
| "logits/rejected": -0.9219734072685242, | |
| "logps/chosen": -8.218575477600098, | |
| "logps/rejected": -93.13555908203125, | |
| "loss": 0.29020407795906067, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26319992542266846, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4894104301929474, | |
| "rewards/margins": 7.870117664337158, | |
| "rewards/rejected": -7.380707263946533, | |
| "step": 506, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 0.9599431986273002, | |
| "grad_norm": 1.8414019346237183, | |
| "learning_rate": 0.0001627912481675908, | |
| "logits/chosen": -0.8823158144950867, | |
| "logits/rejected": -0.898427426815033, | |
| "logps/chosen": -7.699591636657715, | |
| "logps/rejected": -80.27245330810547, | |
| "loss": 0.7505689263343811, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5265831351280212, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19867704808712006, | |
| "rewards/margins": 6.069255828857422, | |
| "rewards/rejected": -5.870578765869141, | |
| "step": 507, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9618365777172948, | |
| "grad_norm": 4.019859790802002, | |
| "learning_rate": 0.0001626285414100507, | |
| "logits/chosen": -0.8857368230819702, | |
| "logits/rejected": -0.8978668451309204, | |
| "logps/chosen": -4.504330635070801, | |
| "logps/rejected": -81.92082214355469, | |
| "loss": 0.3514907658100128, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21580490469932556, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3438741862773895, | |
| "rewards/margins": 6.67080020904541, | |
| "rewards/rejected": -6.326925754547119, | |
| "step": 508, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9637299568072895, | |
| "grad_norm": 1.0069034099578857, | |
| "learning_rate": 0.00016246556139241726, | |
| "logits/chosen": -0.8332890272140503, | |
| "logits/rejected": -0.8481358885765076, | |
| "logps/chosen": -5.350769519805908, | |
| "logps/rejected": -90.37372589111328, | |
| "loss": 0.30022063851356506, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19650080800056458, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4888809323310852, | |
| "rewards/margins": 7.104846954345703, | |
| "rewards/rejected": -6.615966796875, | |
| "step": 509, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9656233358972842, | |
| "grad_norm": 1.631832242012024, | |
| "learning_rate": 0.00016230230882580303, | |
| "logits/chosen": -0.9425424337387085, | |
| "logits/rejected": -0.952564537525177, | |
| "logps/chosen": -3.654702663421631, | |
| "logps/rejected": -69.78423309326172, | |
| "loss": 0.3088323771953583, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19460514187812805, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.4093857407569885, | |
| "rewards/margins": 5.899824142456055, | |
| "rewards/rejected": -5.490438461303711, | |
| "step": 510, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9675167149872789, | |
| "grad_norm": 13.144497871398926, | |
| "learning_rate": 0.00016213878442250954, | |
| "logits/chosen": -0.9134064316749573, | |
| "logits/rejected": -0.9225355386734009, | |
| "logps/chosen": -10.128987312316895, | |
| "logps/rejected": -73.52391052246094, | |
| "loss": 0.49284934997558594, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2897854149341583, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.02852116897702217, | |
| "rewards/margins": 5.512090682983398, | |
| "rewards/rejected": -5.483569622039795, | |
| "step": 511, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9694100940772735, | |
| "grad_norm": 5.9472761154174805, | |
| "learning_rate": 0.00016197498889602448, | |
| "logits/chosen": -0.9309385418891907, | |
| "logits/rejected": -0.9506005048751831, | |
| "logps/chosen": -5.9269938468933105, | |
| "logps/rejected": -94.47163391113281, | |
| "loss": 0.34433653950691223, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25453051924705505, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4299897253513336, | |
| "rewards/margins": 8.080008506774902, | |
| "rewards/rejected": -7.650019645690918, | |
| "step": 512, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9713034731672682, | |
| "grad_norm": 1.6089311838150024, | |
| "learning_rate": 0.0001618109229610186, | |
| "logits/chosen": -0.9268408417701721, | |
| "logits/rejected": -0.937603235244751, | |
| "logps/chosen": -7.795493125915527, | |
| "logps/rejected": -76.06086730957031, | |
| "loss": 0.3525398075580597, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2876393496990204, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4603784680366516, | |
| "rewards/margins": 6.2412896156311035, | |
| "rewards/rejected": -5.780911445617676, | |
| "step": 513, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 0.9731968522572629, | |
| "grad_norm": 1.1773451566696167, | |
| "learning_rate": 0.0001616465873333423, | |
| "logits/chosen": -0.9452431201934814, | |
| "logits/rejected": -0.9670403599739075, | |
| "logps/chosen": -4.365338325500488, | |
| "logps/rejected": -87.41246032714844, | |
| "loss": 0.22716665267944336, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19295459985733032, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46086013317108154, | |
| "rewards/margins": 7.090925693511963, | |
| "rewards/rejected": -6.630065441131592, | |
| "step": 514, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.9750902313472576, | |
| "grad_norm": 1.8114774227142334, | |
| "learning_rate": 0.00016148198273002287, | |
| "logits/chosen": -0.906434953212738, | |
| "logits/rejected": -0.9241432547569275, | |
| "logps/chosen": -4.319371700286865, | |
| "logps/rejected": -76.49603271484375, | |
| "loss": 0.2575733959674835, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23216064274311066, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6431917548179626, | |
| "rewards/margins": 6.2898454666137695, | |
| "rewards/rejected": -5.646653652191162, | |
| "step": 515, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.9769836104372522, | |
| "grad_norm": 1.0340324640274048, | |
| "learning_rate": 0.00016131710986926108, | |
| "logits/chosen": -0.936368465423584, | |
| "logits/rejected": -0.9526094794273376, | |
| "logps/chosen": -3.4732229709625244, | |
| "logps/rejected": -81.12310791015625, | |
| "loss": 0.20995403826236725, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18944348394870758, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5206528902053833, | |
| "rewards/margins": 6.727083206176758, | |
| "rewards/rejected": -6.206429481506348, | |
| "step": 516, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.9788769895272469, | |
| "grad_norm": 3.1034345626831055, | |
| "learning_rate": 0.0001611519694704282, | |
| "logits/chosen": -0.9805644154548645, | |
| "logits/rejected": -0.9963036775588989, | |
| "logps/chosen": -4.623378753662109, | |
| "logps/rejected": -77.49845123291016, | |
| "loss": 0.3559991419315338, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2764490246772766, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3371025025844574, | |
| "rewards/margins": 6.5251383781433105, | |
| "rewards/rejected": -6.18803596496582, | |
| "step": 517, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.9807703686172415, | |
| "grad_norm": 4.58514928817749, | |
| "learning_rate": 0.00016098656225406287, | |
| "logits/chosen": -0.9553229212760925, | |
| "logits/rejected": -0.9597129225730896, | |
| "logps/chosen": -7.885223388671875, | |
| "logps/rejected": -72.13860321044922, | |
| "loss": 0.4449266791343689, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3402749300003052, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.264324426651001, | |
| "rewards/margins": 5.985879898071289, | |
| "rewards/rejected": -5.721555709838867, | |
| "step": 518, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.9826637477072363, | |
| "grad_norm": 0.9089112281799316, | |
| "learning_rate": 0.00016082088894186778, | |
| "logits/chosen": -0.9573476314544678, | |
| "logits/rejected": -0.9719171524047852, | |
| "logps/chosen": -3.7913498878479004, | |
| "logps/rejected": -79.99372863769531, | |
| "loss": 0.27717337012290955, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23127052187919617, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4175718426704407, | |
| "rewards/margins": 6.348897933959961, | |
| "rewards/rejected": -5.931325912475586, | |
| "step": 519, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.984557126797231, | |
| "grad_norm": 17.343408584594727, | |
| "learning_rate": 0.00016065495025670675, | |
| "logits/chosen": -0.9993346929550171, | |
| "logits/rejected": -1.015330195426941, | |
| "logps/chosen": -3.9948267936706543, | |
| "logps/rejected": -84.67949676513672, | |
| "loss": 0.44340285658836365, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2410781979560852, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18794837594032288, | |
| "rewards/margins": 6.663022518157959, | |
| "rewards/rejected": -6.475074291229248, | |
| "step": 520, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 0.9864505058872256, | |
| "grad_norm": 1.0182690620422363, | |
| "learning_rate": 0.00016048874692260149, | |
| "logits/chosen": -1.0138598680496216, | |
| "logits/rejected": -1.0335602760314941, | |
| "logps/chosen": -5.567783355712891, | |
| "logps/rejected": -90.43717956542969, | |
| "loss": 0.2480800896883011, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20226755738258362, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3979242146015167, | |
| "rewards/margins": 7.263826370239258, | |
| "rewards/rejected": -6.865901470184326, | |
| "step": 521, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.9883438849772203, | |
| "grad_norm": 0.6683632731437683, | |
| "learning_rate": 0.00016032227966472827, | |
| "logits/chosen": -0.9863166809082031, | |
| "logits/rejected": -1.0132988691329956, | |
| "logps/chosen": -3.0443716049194336, | |
| "logps/rejected": -98.99560546875, | |
| "loss": 0.15996497869491577, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1395530253648758, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.53858482837677, | |
| "rewards/margins": 8.103957176208496, | |
| "rewards/rejected": -7.565372943878174, | |
| "step": 522, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.9902372640672149, | |
| "grad_norm": 1.112196445465088, | |
| "learning_rate": 0.0001601555492094151, | |
| "logits/chosen": -1.0361038446426392, | |
| "logits/rejected": -1.0564793348312378, | |
| "logps/chosen": -3.820387363433838, | |
| "logps/rejected": -85.76795196533203, | |
| "loss": 0.2085203379392624, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1832592487335205, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5125322937965393, | |
| "rewards/margins": 7.044062614440918, | |
| "rewards/rejected": -6.531529903411865, | |
| "step": 523, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.9921306431572097, | |
| "grad_norm": 2.029463529586792, | |
| "learning_rate": 0.00015998855628413823, | |
| "logits/chosen": -1.0319892168045044, | |
| "logits/rejected": -1.0529518127441406, | |
| "logps/chosen": -4.808176517486572, | |
| "logps/rejected": -84.97135162353516, | |
| "loss": 0.21726690232753754, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1616971641778946, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.28862282633781433, | |
| "rewards/margins": 6.925485610961914, | |
| "rewards/rejected": -6.636862277984619, | |
| "step": 524, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.9940240222472043, | |
| "grad_norm": 3.0579190254211426, | |
| "learning_rate": 0.00015982130161751922, | |
| "logits/chosen": -0.9786304235458374, | |
| "logits/rejected": -0.9961691498756409, | |
| "logps/chosen": -10.302689552307129, | |
| "logps/rejected": -89.45677185058594, | |
| "loss": 0.5347995162010193, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4095235764980316, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21495375037193298, | |
| "rewards/margins": 6.500909328460693, | |
| "rewards/rejected": -6.285955429077148, | |
| "step": 525, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.995917401337199, | |
| "grad_norm": 1.0815080404281616, | |
| "learning_rate": 0.00015965378593932157, | |
| "logits/chosen": -1.0681151151657104, | |
| "logits/rejected": -1.0940450429916382, | |
| "logps/chosen": -2.94252872467041, | |
| "logps/rejected": -87.89140319824219, | |
| "loss": 0.22619354724884033, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16631841659545898, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5529903769493103, | |
| "rewards/margins": 7.263401031494141, | |
| "rewards/rejected": -6.710411071777344, | |
| "step": 526, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.9978107804271936, | |
| "grad_norm": 38.966758728027344, | |
| "learning_rate": 0.00015948600998044765, | |
| "logits/chosen": -1.0475246906280518, | |
| "logits/rejected": -1.080329179763794, | |
| "logps/chosen": -8.313323974609375, | |
| "logps/rejected": -90.39398956298828, | |
| "loss": 0.7874181270599365, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6002381443977356, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.44292813539505005, | |
| "rewards/margins": 6.95076322555542, | |
| "rewards/rejected": -6.507835388183594, | |
| "step": 527, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 0.9997041595171884, | |
| "grad_norm": 4.178254127502441, | |
| "learning_rate": 0.00015931797447293552, | |
| "logits/chosen": -1.0808571577072144, | |
| "logits/rejected": -1.1031514406204224, | |
| "logps/chosen": -3.7605037689208984, | |
| "logps/rejected": -98.75016021728516, | |
| "loss": 0.2028055489063263, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13626113533973694, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3011845648288727, | |
| "rewards/margins": 8.235344886779785, | |
| "rewards/rejected": -7.934159755706787, | |
| "step": 528, | |
| "train_speed(iter/s)": 0.005586 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 4.178254127502441, | |
| "learning_rate": 0.00015914968014995567, | |
| "logits/chosen": -1.1427804231643677, | |
| "logits/rejected": -1.1405260562896729, | |
| "logps/chosen": -2.7054977416992188, | |
| "logps/rejected": -56.67396926879883, | |
| "loss": 0.038843873888254166, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12972064316272736, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3542119860649109, | |
| "rewards/margins": 4.969267845153809, | |
| "rewards/rejected": -4.615056037902832, | |
| "step": 529, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0018933790899947, | |
| "grad_norm": 50.89724349975586, | |
| "learning_rate": 0.00015898112774580784, | |
| "logits/chosen": -1.1593101024627686, | |
| "logits/rejected": -1.168821096420288, | |
| "logps/chosen": -6.839245796203613, | |
| "logps/rejected": -88.95535278320312, | |
| "loss": 0.6083638072013855, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4864938259124756, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19008603692054749, | |
| "rewards/margins": 7.390456676483154, | |
| "rewards/rejected": -7.200370788574219, | |
| "step": 530, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0037867581799893, | |
| "grad_norm": 1.4983274936676025, | |
| "learning_rate": 0.00015881231799591783, | |
| "logits/chosen": -1.1478654146194458, | |
| "logits/rejected": -1.160862922668457, | |
| "logps/chosen": -5.944678783416748, | |
| "logps/rejected": -110.5527114868164, | |
| "loss": 0.2588149607181549, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1914646476507187, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.39623722434043884, | |
| "rewards/margins": 9.497812271118164, | |
| "rewards/rejected": -9.101574897766113, | |
| "step": 531, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.005680137269984, | |
| "grad_norm": 1.2377827167510986, | |
| "learning_rate": 0.00015864325163683431, | |
| "logits/chosen": -1.1823019981384277, | |
| "logits/rejected": -1.1935970783233643, | |
| "logps/chosen": -5.829947471618652, | |
| "logps/rejected": -96.11874389648438, | |
| "loss": 0.2351379096508026, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21910277009010315, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6932865381240845, | |
| "rewards/margins": 8.259093284606934, | |
| "rewards/rejected": -7.5658063888549805, | |
| "step": 532, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0075735163599786, | |
| "grad_norm": 6.626506328582764, | |
| "learning_rate": 0.00015847392940622555, | |
| "logits/chosen": -1.2572100162506104, | |
| "logits/rejected": -1.2743322849273682, | |
| "logps/chosen": -5.158469200134277, | |
| "logps/rejected": -102.89447021484375, | |
| "loss": 0.43753018975257874, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3763510584831238, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37863367795944214, | |
| "rewards/margins": 9.09069538116455, | |
| "rewards/rejected": -8.712060928344727, | |
| "step": 533, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0094668954499735, | |
| "grad_norm": 9.237115859985352, | |
| "learning_rate": 0.00015830435204287628, | |
| "logits/chosen": -1.2432606220245361, | |
| "logits/rejected": -1.2568538188934326, | |
| "logps/chosen": -5.230342388153076, | |
| "logps/rejected": -125.57969665527344, | |
| "loss": 0.320054829120636, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1863236427307129, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.5029672384262085, | |
| "rewards/margins": 11.315177917480469, | |
| "rewards/rejected": -10.812210083007812, | |
| "step": 534, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0113602745399681, | |
| "grad_norm": 2.3910863399505615, | |
| "learning_rate": 0.0001581345202866844, | |
| "logits/chosen": -1.2545768022537231, | |
| "logits/rejected": -1.2814122438430786, | |
| "logps/chosen": -4.037993431091309, | |
| "logps/rejected": -119.29512023925781, | |
| "loss": 0.2895146310329437, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19089049100875854, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3177344799041748, | |
| "rewards/margins": 10.372758865356445, | |
| "rewards/rejected": -10.055024147033691, | |
| "step": 535, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0132536536299628, | |
| "grad_norm": 11.799864768981934, | |
| "learning_rate": 0.00015796443487865776, | |
| "logits/chosen": -1.2704317569732666, | |
| "logits/rejected": -1.2862308025360107, | |
| "logps/chosen": -3.8405699729919434, | |
| "logps/rejected": -101.06300354003906, | |
| "loss": 0.3045562505722046, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2211739867925644, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4603561460971832, | |
| "rewards/margins": 9.070082664489746, | |
| "rewards/rejected": -8.609726905822754, | |
| "step": 536, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0151470327199574, | |
| "grad_norm": 1.1523226499557495, | |
| "learning_rate": 0.00015779409656091096, | |
| "logits/chosen": -1.2223632335662842, | |
| "logits/rejected": -1.2454135417938232, | |
| "logps/chosen": -3.3703105449676514, | |
| "logps/rejected": -114.88744354248047, | |
| "loss": 0.23221755027770996, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2025429606437683, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6476104855537415, | |
| "rewards/margins": 10.323287963867188, | |
| "rewards/rejected": -9.675678253173828, | |
| "step": 537, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.017040411809952, | |
| "grad_norm": 1.1821354627609253, | |
| "learning_rate": 0.00015762350607666204, | |
| "logits/chosen": -1.2749884128570557, | |
| "logits/rejected": -1.2943077087402344, | |
| "logps/chosen": -8.302059173583984, | |
| "logps/rejected": -98.96806335449219, | |
| "loss": 0.2986391484737396, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2838631868362427, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5527027249336243, | |
| "rewards/margins": 8.528514862060547, | |
| "rewards/rejected": -7.975813388824463, | |
| "step": 538, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0189337908999467, | |
| "grad_norm": 19.518661499023438, | |
| "learning_rate": 0.0001574526641702294, | |
| "logits/chosen": -1.2305980920791626, | |
| "logits/rejected": -1.2421363592147827, | |
| "logps/chosen": -4.4403533935546875, | |
| "logps/rejected": -96.62861633300781, | |
| "loss": 0.3891787827014923, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2562548518180847, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3143804967403412, | |
| "rewards/margins": 8.539346694946289, | |
| "rewards/rejected": -8.224966049194336, | |
| "step": 539, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0208271699899414, | |
| "grad_norm": 9.813395500183105, | |
| "learning_rate": 0.00015728157158702833, | |
| "logits/chosen": -1.2191518545150757, | |
| "logits/rejected": -1.2443480491638184, | |
| "logps/chosen": -5.321511268615723, | |
| "logps/rejected": -100.6253890991211, | |
| "loss": 0.38886359333992004, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3503781855106354, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4170704782009125, | |
| "rewards/margins": 7.897201061248779, | |
| "rewards/rejected": -7.480130672454834, | |
| "step": 540, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.022720549079936, | |
| "grad_norm": 5.502192974090576, | |
| "learning_rate": 0.00015711022907356794, | |
| "logits/chosen": -1.2725385427474976, | |
| "logits/rejected": -1.281760573387146, | |
| "logps/chosen": -5.788969039916992, | |
| "logps/rejected": -83.48539733886719, | |
| "loss": 0.2782316207885742, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2644944489002228, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6322579979896545, | |
| "rewards/margins": 7.397380352020264, | |
| "rewards/rejected": -6.765121936798096, | |
| "step": 541, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0246139281699307, | |
| "grad_norm": 1.0033241510391235, | |
| "learning_rate": 0.0001569386373774478, | |
| "logits/chosen": -1.2947453260421753, | |
| "logits/rejected": -1.3235821723937988, | |
| "logps/chosen": -2.1399617195129395, | |
| "logps/rejected": -99.05345153808594, | |
| "loss": 0.18756692111492157, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.10680165886878967, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4721769094467163, | |
| "rewards/margins": 8.319814682006836, | |
| "rewards/rejected": -7.84763765335083, | |
| "step": 542, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0265073072599253, | |
| "grad_norm": 2.2815518379211426, | |
| "learning_rate": 0.00015676679724735475, | |
| "logits/chosen": -1.2527762651443481, | |
| "logits/rejected": -1.2706432342529297, | |
| "logps/chosen": -3.529473304748535, | |
| "logps/rejected": -102.44934844970703, | |
| "loss": 0.19709157943725586, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16788038611412048, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39325255155563354, | |
| "rewards/margins": 8.873687744140625, | |
| "rewards/rejected": -8.48043441772461, | |
| "step": 543, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0284006863499202, | |
| "grad_norm": 0.9781432747840881, | |
| "learning_rate": 0.00015659470943305955, | |
| "logits/chosen": -1.3074346780776978, | |
| "logits/rejected": -1.3225350379943848, | |
| "logps/chosen": -3.6736319065093994, | |
| "logps/rejected": -99.07704162597656, | |
| "loss": 0.24773047864437103, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20028436183929443, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5773366689682007, | |
| "rewards/margins": 8.81675910949707, | |
| "rewards/rejected": -8.239421844482422, | |
| "step": 544, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0302940654399149, | |
| "grad_norm": 3.2625584602355957, | |
| "learning_rate": 0.0001564223746854136, | |
| "logits/chosen": -1.2451472282409668, | |
| "logits/rejected": -1.2746459245681763, | |
| "logps/chosen": -2.6118361949920654, | |
| "logps/rejected": -106.3071517944336, | |
| "loss": 0.18340322375297546, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16001468896865845, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5671020150184631, | |
| "rewards/margins": 9.123932838439941, | |
| "rewards/rejected": -8.556831359863281, | |
| "step": 545, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0321874445299095, | |
| "grad_norm": 11.41080379486084, | |
| "learning_rate": 0.00015624979375634588, | |
| "logits/chosen": -1.2669609785079956, | |
| "logits/rejected": -1.285220742225647, | |
| "logps/chosen": -6.25026798248291, | |
| "logps/rejected": -104.86439514160156, | |
| "loss": 0.36971619725227356, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26008346676826477, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.31941547989845276, | |
| "rewards/margins": 8.899809837341309, | |
| "rewards/rejected": -8.580394744873047, | |
| "step": 546, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0340808236199042, | |
| "grad_norm": 23.427906036376953, | |
| "learning_rate": 0.00015607696739885934, | |
| "logits/chosen": -1.2728469371795654, | |
| "logits/rejected": -1.292362093925476, | |
| "logps/chosen": -6.034543037414551, | |
| "logps/rejected": -88.89381408691406, | |
| "loss": 0.7123737335205078, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6033825278282166, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26061975955963135, | |
| "rewards/margins": 7.074716567993164, | |
| "rewards/rejected": -6.8140974044799805, | |
| "step": 547, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0359742027098988, | |
| "grad_norm": 1.0424782037734985, | |
| "learning_rate": 0.0001559038963670279, | |
| "logits/chosen": -1.263490080833435, | |
| "logits/rejected": -1.2818467617034912, | |
| "logps/chosen": -4.806588172912598, | |
| "logps/rejected": -109.88215637207031, | |
| "loss": 0.2099330872297287, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19888734817504883, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7063236832618713, | |
| "rewards/margins": 9.634958267211914, | |
| "rewards/rejected": -8.928633689880371, | |
| "step": 548, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0378675817998935, | |
| "grad_norm": 1.565426230430603, | |
| "learning_rate": 0.00015573058141599296, | |
| "logits/chosen": -1.3012843132019043, | |
| "logits/rejected": -1.3339687585830688, | |
| "logps/chosen": -3.8335983753204346, | |
| "logps/rejected": -109.77323913574219, | |
| "loss": 0.22731725871562958, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18710672855377197, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6432173252105713, | |
| "rewards/margins": 9.041927337646484, | |
| "rewards/rejected": -8.398711204528809, | |
| "step": 549, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0397609608898881, | |
| "grad_norm": 1.0922037363052368, | |
| "learning_rate": 0.00015555702330196023, | |
| "logits/chosen": -1.2561464309692383, | |
| "logits/rejected": -1.2797656059265137, | |
| "logps/chosen": -4.883576393127441, | |
| "logps/rejected": -94.83533477783203, | |
| "loss": 0.18200495839118958, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13938182592391968, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5235949158668518, | |
| "rewards/margins": 8.185545921325684, | |
| "rewards/rejected": -7.661951065063477, | |
| "step": 550, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0416543399798828, | |
| "grad_norm": 1.1942391395568848, | |
| "learning_rate": 0.00015538322278219638, | |
| "logits/chosen": -1.327378749847412, | |
| "logits/rejected": -1.3506507873535156, | |
| "logps/chosen": -2.917591094970703, | |
| "logps/rejected": -94.31072235107422, | |
| "loss": 0.2088836431503296, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13950389623641968, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.48478469252586365, | |
| "rewards/margins": 8.057584762573242, | |
| "rewards/rejected": -7.572801113128662, | |
| "step": 551, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0435477190698774, | |
| "grad_norm": 1.8847681283950806, | |
| "learning_rate": 0.00015520918061502569, | |
| "logits/chosen": -1.3219040632247925, | |
| "logits/rejected": -1.3375160694122314, | |
| "logps/chosen": -3.741983413696289, | |
| "logps/rejected": -94.9761962890625, | |
| "loss": 0.21428059041500092, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17732422053813934, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6145517230033875, | |
| "rewards/margins": 8.826709747314453, | |
| "rewards/rejected": -8.212158203125, | |
| "step": 552, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0454410981598723, | |
| "grad_norm": 3.402707099914551, | |
| "learning_rate": 0.00015503489755982686, | |
| "logits/chosen": -1.3000562191009521, | |
| "logits/rejected": -1.303682565689087, | |
| "logps/chosen": -5.613664150238037, | |
| "logps/rejected": -80.0399169921875, | |
| "loss": 0.40057235956192017, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35176751017570496, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3800576329231262, | |
| "rewards/margins": 7.2210588455200195, | |
| "rewards/rejected": -6.841001033782959, | |
| "step": 553, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.047334477249867, | |
| "grad_norm": 1.0752265453338623, | |
| "learning_rate": 0.0001548603743770296, | |
| "logits/chosen": -1.355738878250122, | |
| "logits/rejected": -1.37424898147583, | |
| "logps/chosen": -3.0492472648620605, | |
| "logps/rejected": -108.67159271240234, | |
| "loss": 0.13657376170158386, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.10331787168979645, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4870010018348694, | |
| "rewards/margins": 9.527022361755371, | |
| "rewards/rejected": -9.040020942687988, | |
| "step": 554, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0492278563398616, | |
| "grad_norm": 5.314583778381348, | |
| "learning_rate": 0.0001546856118281114, | |
| "logits/chosen": -1.3520063161849976, | |
| "logits/rejected": -1.3624749183654785, | |
| "logps/chosen": -6.195893287658691, | |
| "logps/rejected": -94.56097412109375, | |
| "loss": 0.30682989954948425, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27029889822006226, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3668309152126312, | |
| "rewards/margins": 8.312253952026367, | |
| "rewards/rejected": -7.945422172546387, | |
| "step": 555, | |
| "train_speed(iter/s)": 0.005596 | |
| }, | |
| { | |
| "epoch": 1.0511212354298562, | |
| "grad_norm": 20.930891036987305, | |
| "learning_rate": 0.000154510610675594, | |
| "logits/chosen": -1.327778697013855, | |
| "logits/rejected": -1.3483771085739136, | |
| "logps/chosen": -3.625875473022461, | |
| "logps/rejected": -97.228271484375, | |
| "loss": 0.3087195158004761, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2725326120853424, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.294748455286026, | |
| "rewards/margins": 7.920544147491455, | |
| "rewards/rejected": -7.625795841217041, | |
| "step": 556, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.053014614519851, | |
| "grad_norm": 2.161787748336792, | |
| "learning_rate": 0.00015433537168304038, | |
| "logits/chosen": -1.3243646621704102, | |
| "logits/rejected": -1.3322596549987793, | |
| "logps/chosen": -5.126698017120361, | |
| "logps/rejected": -71.53412628173828, | |
| "loss": 0.250238835811615, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20904159545898438, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5107704997062683, | |
| "rewards/margins": 6.104798793792725, | |
| "rewards/rejected": -5.594027996063232, | |
| "step": 557, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0549079936098456, | |
| "grad_norm": 1.0270330905914307, | |
| "learning_rate": 0.00015415989561505118, | |
| "logits/chosen": -1.334947109222412, | |
| "logits/rejected": -1.3445045948028564, | |
| "logps/chosen": -8.810266494750977, | |
| "logps/rejected": -87.59201049804688, | |
| "loss": 0.26200586557388306, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2543470859527588, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8190967440605164, | |
| "rewards/margins": 7.7875471115112305, | |
| "rewards/rejected": -6.968450546264648, | |
| "step": 558, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0568013726998402, | |
| "grad_norm": 0.8429592251777649, | |
| "learning_rate": 0.00015398418323726146, | |
| "logits/chosen": -1.3177508115768433, | |
| "logits/rejected": -1.3297425508499146, | |
| "logps/chosen": -4.267469882965088, | |
| "logps/rejected": -99.88289642333984, | |
| "loss": 0.2590307593345642, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21612831950187683, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4924696385860443, | |
| "rewards/margins": 8.744771957397461, | |
| "rewards/rejected": -8.252302169799805, | |
| "step": 559, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0586947517898349, | |
| "grad_norm": 1.2864187955856323, | |
| "learning_rate": 0.00015380823531633729, | |
| "logits/chosen": -1.3363707065582275, | |
| "logits/rejected": -1.3560690879821777, | |
| "logps/chosen": -6.6727423667907715, | |
| "logps/rejected": -105.22146606445312, | |
| "loss": 0.25500863790512085, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2455504983663559, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4451357424259186, | |
| "rewards/margins": 8.943872451782227, | |
| "rewards/rejected": -8.498737335205078, | |
| "step": 560, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0605881308798295, | |
| "grad_norm": 1.5146949291229248, | |
| "learning_rate": 0.00015363205261997254, | |
| "logits/chosen": -1.3046088218688965, | |
| "logits/rejected": -1.3203272819519043, | |
| "logps/chosen": -4.633506774902344, | |
| "logps/rejected": -88.37890625, | |
| "loss": 0.259783536195755, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2198258489370346, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4317323565483093, | |
| "rewards/margins": 7.1905717849731445, | |
| "rewards/rejected": -6.758839130401611, | |
| "step": 561, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.0624815099698244, | |
| "grad_norm": 1.078278660774231, | |
| "learning_rate": 0.0001534556359168854, | |
| "logits/chosen": -1.3316317796707153, | |
| "logits/rejected": -1.3745862245559692, | |
| "logps/chosen": -2.4428582191467285, | |
| "logps/rejected": -138.22593688964844, | |
| "loss": 0.08312231302261353, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.06975560635328293, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3613326847553253, | |
| "rewards/margins": 11.056950569152832, | |
| "rewards/rejected": -10.695618629455566, | |
| "step": 562, | |
| "train_speed(iter/s)": 0.005597 | |
| }, | |
| { | |
| "epoch": 1.064374889059819, | |
| "grad_norm": 2.635319948196411, | |
| "learning_rate": 0.00015327898597681516, | |
| "logits/chosen": -1.3323938846588135, | |
| "logits/rejected": -1.3507311344146729, | |
| "logps/chosen": -3.511697769165039, | |
| "logps/rejected": -95.56913757324219, | |
| "loss": 0.19266293942928314, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17116276919841766, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4276401996612549, | |
| "rewards/margins": 8.056602478027344, | |
| "rewards/rejected": -7.628961563110352, | |
| "step": 563, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0662682681498137, | |
| "grad_norm": 1.3077629804611206, | |
| "learning_rate": 0.00015310210357051863, | |
| "logits/chosen": -1.2944490909576416, | |
| "logits/rejected": -1.3115651607513428, | |
| "logps/chosen": -3.241935968399048, | |
| "logps/rejected": -98.64260864257812, | |
| "loss": 0.251848042011261, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20104049146175385, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5110239386558533, | |
| "rewards/margins": 8.376340866088867, | |
| "rewards/rejected": -7.865316390991211, | |
| "step": 564, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0681616472398083, | |
| "grad_norm": 0.9010938405990601, | |
| "learning_rate": 0.000152924989469767, | |
| "logits/chosen": -1.2769780158996582, | |
| "logits/rejected": -1.2927641868591309, | |
| "logps/chosen": -6.640301704406738, | |
| "logps/rejected": -88.61182403564453, | |
| "loss": 0.25189408659935, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24645669758319855, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 1.0925995111465454, | |
| "rewards/margins": 8.120665550231934, | |
| "rewards/rejected": -7.0280656814575195, | |
| "step": 565, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.070055026329803, | |
| "grad_norm": 19.70159149169922, | |
| "learning_rate": 0.00015274764444734234, | |
| "logits/chosen": -1.244207501411438, | |
| "logits/rejected": -1.259688138961792, | |
| "logps/chosen": -6.578207969665527, | |
| "logps/rejected": -106.03319549560547, | |
| "loss": 0.3873708248138428, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35074567794799805, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40361860394477844, | |
| "rewards/margins": 9.156301498413086, | |
| "rewards/rejected": -8.752683639526367, | |
| "step": 566, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0719484054197976, | |
| "grad_norm": 3.134403944015503, | |
| "learning_rate": 0.0001525700692770344, | |
| "logits/chosen": -1.2441952228546143, | |
| "logits/rejected": -1.2602890729904175, | |
| "logps/chosen": -3.320517063140869, | |
| "logps/rejected": -106.19863891601562, | |
| "loss": 0.15019084513187408, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12886883318424225, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.32790637016296387, | |
| "rewards/margins": 9.072044372558594, | |
| "rewards/rejected": -8.744136810302734, | |
| "step": 567, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0738417845097923, | |
| "grad_norm": 0.787064790725708, | |
| "learning_rate": 0.00015239226473363687, | |
| "logits/chosen": -1.2932322025299072, | |
| "logits/rejected": -1.3016360998153687, | |
| "logps/chosen": -4.699370861053467, | |
| "logps/rejected": -105.18386840820312, | |
| "loss": 0.2008758783340454, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16714823246002197, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4735586643218994, | |
| "rewards/margins": 9.312126159667969, | |
| "rewards/rejected": -8.838567733764648, | |
| "step": 568, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.075735163599787, | |
| "grad_norm": 1.0752480030059814, | |
| "learning_rate": 0.0001522142315929445, | |
| "logits/chosen": -1.336026668548584, | |
| "logits/rejected": -1.350561499595642, | |
| "logps/chosen": -6.8737311363220215, | |
| "logps/rejected": -91.298583984375, | |
| "loss": 0.33137187361717224, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25478339195251465, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5015548467636108, | |
| "rewards/margins": 7.741572856903076, | |
| "rewards/rejected": -7.240017890930176, | |
| "step": 569, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0776285426897816, | |
| "grad_norm": 1.0518560409545898, | |
| "learning_rate": 0.0001520359706317493, | |
| "logits/chosen": -1.3285919427871704, | |
| "logits/rejected": -1.3354926109313965, | |
| "logps/chosen": -5.613513469696045, | |
| "logps/rejected": -103.08087158203125, | |
| "loss": 0.25189992785453796, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2361432909965515, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38287657499313354, | |
| "rewards/margins": 9.170334815979004, | |
| "rewards/rejected": -8.787456512451172, | |
| "step": 570, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0795219217797762, | |
| "grad_norm": 2.020385980606079, | |
| "learning_rate": 0.0001518574826278373, | |
| "logits/chosen": -1.347183346748352, | |
| "logits/rejected": -1.3727235794067383, | |
| "logps/chosen": -3.2963013648986816, | |
| "logps/rejected": -125.87289428710938, | |
| "loss": 0.19588108360767365, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16800087690353394, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6195613741874695, | |
| "rewards/margins": 10.826133728027344, | |
| "rewards/rejected": -10.206572532653809, | |
| "step": 571, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0814153008697711, | |
| "grad_norm": 0.9883559942245483, | |
| "learning_rate": 0.00015167876835998524, | |
| "logits/chosen": -1.3224377632141113, | |
| "logits/rejected": -1.353177785873413, | |
| "logps/chosen": -3.696470022201538, | |
| "logps/rejected": -137.7168426513672, | |
| "loss": 0.16710160672664642, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14809738099575043, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6114938855171204, | |
| "rewards/margins": 11.972872734069824, | |
| "rewards/rejected": -11.361379623413086, | |
| "step": 572, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0833086799597658, | |
| "grad_norm": 0.9463618993759155, | |
| "learning_rate": 0.00015149982860795702, | |
| "logits/chosen": -1.3223044872283936, | |
| "logits/rejected": -1.3528592586517334, | |
| "logps/chosen": -2.193894386291504, | |
| "logps/rejected": -142.0426483154297, | |
| "loss": 0.09805414825677872, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.08482219278812408, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4664475917816162, | |
| "rewards/margins": 12.09679889678955, | |
| "rewards/rejected": -11.630352020263672, | |
| "step": 573, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0852020590497604, | |
| "grad_norm": 1.1137388944625854, | |
| "learning_rate": 0.00015132066415250042, | |
| "logits/chosen": -1.318729043006897, | |
| "logits/rejected": -1.3286855220794678, | |
| "logps/chosen": -6.172143459320068, | |
| "logps/rejected": -121.0008544921875, | |
| "loss": 0.2336159348487854, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19225838780403137, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5859619379043579, | |
| "rewards/margins": 10.895280838012695, | |
| "rewards/rejected": -10.309318542480469, | |
| "step": 574, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.087095438139755, | |
| "grad_norm": 2.3039913177490234, | |
| "learning_rate": 0.00015114127577534357, | |
| "logits/chosen": -1.2611424922943115, | |
| "logits/rejected": -1.2765283584594727, | |
| "logps/chosen": -6.725334644317627, | |
| "logps/rejected": -115.01373291015625, | |
| "loss": 0.2680964767932892, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21015194058418274, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.36756518483161926, | |
| "rewards/margins": 10.524402618408203, | |
| "rewards/rejected": -10.156837463378906, | |
| "step": 575, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0889888172297497, | |
| "grad_norm": 0.801198422908783, | |
| "learning_rate": 0.00015096166425919175, | |
| "logits/chosen": -1.2074100971221924, | |
| "logits/rejected": -1.2279514074325562, | |
| "logps/chosen": -5.492415904998779, | |
| "logps/rejected": -110.50377655029297, | |
| "loss": 0.2561566233634949, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23524636030197144, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.545266330242157, | |
| "rewards/margins": 9.796957015991211, | |
| "rewards/rejected": -9.251690864562988, | |
| "step": 576, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.0908821963197444, | |
| "grad_norm": 0.8023693561553955, | |
| "learning_rate": 0.00015078183038772368, | |
| "logits/chosen": -1.2201210260391235, | |
| "logits/rejected": -1.239213466644287, | |
| "logps/chosen": -3.4091765880584717, | |
| "logps/rejected": -110.39087677001953, | |
| "loss": 0.15457846224308014, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13152047991752625, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5018508434295654, | |
| "rewards/margins": 9.737335205078125, | |
| "rewards/rejected": -9.23548412322998, | |
| "step": 577, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.092775575409739, | |
| "grad_norm": 10.036036491394043, | |
| "learning_rate": 0.0001506017749455884, | |
| "logits/chosen": -1.2568118572235107, | |
| "logits/rejected": -1.274863839149475, | |
| "logps/chosen": -4.811936378479004, | |
| "logps/rejected": -107.5451889038086, | |
| "loss": 0.3094099164009094, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2990308701992035, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6428719162940979, | |
| "rewards/margins": 9.620796203613281, | |
| "rewards/rejected": -8.977926254272461, | |
| "step": 578, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0946689544997337, | |
| "grad_norm": 2.8122897148132324, | |
| "learning_rate": 0.00015042149871840157, | |
| "logits/chosen": -1.2904918193817139, | |
| "logits/rejected": -1.3019131422042847, | |
| "logps/chosen": -4.516243934631348, | |
| "logps/rejected": -104.33990478515625, | |
| "loss": 0.2950717508792877, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21373407542705536, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6212645769119263, | |
| "rewards/margins": 9.591170310974121, | |
| "rewards/rejected": -8.969905853271484, | |
| "step": 579, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.0965623335897283, | |
| "grad_norm": 1.7572249174118042, | |
| "learning_rate": 0.00015024100249274227, | |
| "logits/chosen": -1.2378251552581787, | |
| "logits/rejected": -1.2591315507888794, | |
| "logps/chosen": -6.137165069580078, | |
| "logps/rejected": -146.08526611328125, | |
| "loss": 0.2149486243724823, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17733576893806458, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6879799365997314, | |
| "rewards/margins": 13.418159484863281, | |
| "rewards/rejected": -12.730178833007812, | |
| "step": 580, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.0984557126797232, | |
| "grad_norm": 1.0533857345581055, | |
| "learning_rate": 0.00015006028705614942, | |
| "logits/chosen": -1.251503348350525, | |
| "logits/rejected": -1.2591009140014648, | |
| "logps/chosen": -4.528883457183838, | |
| "logps/rejected": -114.74151611328125, | |
| "loss": 0.21506644785404205, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19855085015296936, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4429333209991455, | |
| "rewards/margins": 10.232474327087402, | |
| "rewards/rejected": -9.789541244506836, | |
| "step": 581, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.1003490917697178, | |
| "grad_norm": 1.5791045427322388, | |
| "learning_rate": 0.00014987935319711842, | |
| "logits/chosen": -1.226974606513977, | |
| "logits/rejected": -1.257514238357544, | |
| "logps/chosen": -3.320363759994507, | |
| "logps/rejected": -167.9702606201172, | |
| "loss": 0.15922771394252777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15475928783416748, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4842221140861511, | |
| "rewards/margins": 14.752422332763672, | |
| "rewards/rejected": -14.268199920654297, | |
| "step": 582, | |
| "train_speed(iter/s)": 0.005598 | |
| }, | |
| { | |
| "epoch": 1.1022424708597125, | |
| "grad_norm": 1.8434008359909058, | |
| "learning_rate": 0.00014969820170509775, | |
| "logits/chosen": -1.2599531412124634, | |
| "logits/rejected": -1.2809091806411743, | |
| "logps/chosen": -5.004319667816162, | |
| "logps/rejected": -122.86878967285156, | |
| "loss": 0.2221767008304596, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14954842627048492, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.8574638962745667, | |
| "rewards/margins": 11.233372688293457, | |
| "rewards/rejected": -10.375908851623535, | |
| "step": 583, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1041358499497071, | |
| "grad_norm": 0.8550779819488525, | |
| "learning_rate": 0.00014951683337048537, | |
| "logits/chosen": -1.2449126243591309, | |
| "logits/rejected": -1.2596272230148315, | |
| "logps/chosen": -1.8333827257156372, | |
| "logps/rejected": -109.7436294555664, | |
| "loss": 0.14426660537719727, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12021489441394806, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5166503190994263, | |
| "rewards/margins": 9.900659561157227, | |
| "rewards/rejected": -9.384010314941406, | |
| "step": 584, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1060292290397018, | |
| "grad_norm": 0.7879387140274048, | |
| "learning_rate": 0.0001493352489846254, | |
| "logits/chosen": -1.24300217628479, | |
| "logits/rejected": -1.260710597038269, | |
| "logps/chosen": -4.432990074157715, | |
| "logps/rejected": -107.72745513916016, | |
| "loss": 0.18139131367206573, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1617611199617386, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4947144389152527, | |
| "rewards/margins": 9.030978202819824, | |
| "rewards/rejected": -8.536263465881348, | |
| "step": 585, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1079226081296965, | |
| "grad_norm": 0.7365395426750183, | |
| "learning_rate": 0.0001491534493398046, | |
| "logits/chosen": -1.2553640604019165, | |
| "logits/rejected": -1.2758809328079224, | |
| "logps/chosen": -3.403491497039795, | |
| "logps/rejected": -105.79845428466797, | |
| "loss": 0.16256746649742126, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15543223917484283, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6307507753372192, | |
| "rewards/margins": 9.163625717163086, | |
| "rewards/rejected": -8.53287410736084, | |
| "step": 586, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.109815987219691, | |
| "grad_norm": 12.859845161437988, | |
| "learning_rate": 0.0001489714352292491, | |
| "logits/chosen": -1.254917860031128, | |
| "logits/rejected": -1.2662553787231445, | |
| "logps/chosen": -5.313860893249512, | |
| "logps/rejected": -96.21810913085938, | |
| "loss": 0.4549526572227478, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3455367684364319, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3554072082042694, | |
| "rewards/margins": 8.50544548034668, | |
| "rewards/rejected": -8.150038719177246, | |
| "step": 587, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1117093663096858, | |
| "grad_norm": 1.2317994832992554, | |
| "learning_rate": 0.0001487892074471205, | |
| "logits/chosen": -1.2423638105392456, | |
| "logits/rejected": -1.2684507369995117, | |
| "logps/chosen": -3.429466485977173, | |
| "logps/rejected": -92.40089416503906, | |
| "loss": 0.22674602270126343, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1670750081539154, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5393322706222534, | |
| "rewards/margins": 7.976922512054443, | |
| "rewards/rejected": -7.4375901222229, | |
| "step": 588, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1136027453996804, | |
| "grad_norm": 10.093466758728027, | |
| "learning_rate": 0.00014860676678851294, | |
| "logits/chosen": -1.2574409246444702, | |
| "logits/rejected": -1.273606300354004, | |
| "logps/chosen": -5.608072757720947, | |
| "logps/rejected": -99.13803100585938, | |
| "loss": 0.39078086614608765, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3612406253814697, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6365304589271545, | |
| "rewards/margins": 8.688333511352539, | |
| "rewards/rejected": -8.051802635192871, | |
| "step": 589, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1154961244896753, | |
| "grad_norm": 9.636011123657227, | |
| "learning_rate": 0.00014842411404944927, | |
| "logits/chosen": -1.286845088005066, | |
| "logits/rejected": -1.3059313297271729, | |
| "logps/chosen": -7.7975311279296875, | |
| "logps/rejected": -106.14432525634766, | |
| "loss": 0.9191125631332397, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8574790358543396, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21184280514717102, | |
| "rewards/margins": 8.63295841217041, | |
| "rewards/rejected": -8.421114921569824, | |
| "step": 590, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.11738950357967, | |
| "grad_norm": 2.9925789833068848, | |
| "learning_rate": 0.00014824125002687772, | |
| "logits/chosen": -1.3378455638885498, | |
| "logits/rejected": -1.37661874294281, | |
| "logps/chosen": -4.0678205490112305, | |
| "logps/rejected": -126.1729965209961, | |
| "loss": 0.5300029516220093, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3785613775253296, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33407914638519287, | |
| "rewards/margins": 10.628999710083008, | |
| "rewards/rejected": -10.294920921325684, | |
| "step": 591, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1192828826696646, | |
| "grad_norm": 2.0460188388824463, | |
| "learning_rate": 0.00014805817551866838, | |
| "logits/chosen": -1.315762996673584, | |
| "logits/rejected": -1.3334267139434814, | |
| "logps/chosen": -6.571153163909912, | |
| "logps/rejected": -87.01092529296875, | |
| "loss": 0.2811226546764374, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23497222363948822, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3480154275894165, | |
| "rewards/margins": 7.635659217834473, | |
| "rewards/rejected": -7.287643909454346, | |
| "step": 592, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1211762617596592, | |
| "grad_norm": 0.971920907497406, | |
| "learning_rate": 0.00014787489132360974, | |
| "logits/chosen": -1.3045918941497803, | |
| "logits/rejected": -1.3217551708221436, | |
| "logps/chosen": -6.293361186981201, | |
| "logps/rejected": -105.55299377441406, | |
| "loss": 0.23011934757232666, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1706216186285019, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3878113925457001, | |
| "rewards/margins": 8.775679588317871, | |
| "rewards/rejected": -8.38786792755127, | |
| "step": 593, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1230696408496539, | |
| "grad_norm": 5.00411319732666, | |
| "learning_rate": 0.00014769139824140516, | |
| "logits/chosen": -1.3342088460922241, | |
| "logits/rejected": -1.3560993671417236, | |
| "logps/chosen": -3.8638527393341064, | |
| "logps/rejected": -90.72246551513672, | |
| "loss": 0.309597909450531, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.248661071062088, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3779904246330261, | |
| "rewards/margins": 7.73700475692749, | |
| "rewards/rejected": -7.35901403427124, | |
| "step": 594, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1249630199396485, | |
| "grad_norm": 1.8497488498687744, | |
| "learning_rate": 0.0001475076970726694, | |
| "logits/chosen": -1.3347439765930176, | |
| "logits/rejected": -1.3567668199539185, | |
| "logps/chosen": -4.323431015014648, | |
| "logps/rejected": -99.05289459228516, | |
| "loss": 0.31018275022506714, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2699596583843231, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4811839461326599, | |
| "rewards/margins": 8.345390319824219, | |
| "rewards/rejected": -7.864206314086914, | |
| "step": 595, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1268563990296432, | |
| "grad_norm": 2.490046501159668, | |
| "learning_rate": 0.00014732378861892525, | |
| "logits/chosen": -1.3427214622497559, | |
| "logits/rejected": -1.3540985584259033, | |
| "logps/chosen": -4.136582851409912, | |
| "logps/rejected": -108.85411071777344, | |
| "loss": 0.2530824840068817, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2168596386909485, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.47699812054634094, | |
| "rewards/margins": 9.652837753295898, | |
| "rewards/rejected": -9.175840377807617, | |
| "step": 596, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1287497781196378, | |
| "grad_norm": 0.9580318927764893, | |
| "learning_rate": 0.0001471396736825998, | |
| "logits/chosen": -1.351408839225769, | |
| "logits/rejected": -1.365317940711975, | |
| "logps/chosen": -4.171363353729248, | |
| "logps/rejected": -128.09634399414062, | |
| "loss": 0.1587587147951126, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14957861602306366, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38554343581199646, | |
| "rewards/margins": 10.911967277526855, | |
| "rewards/rejected": -10.526424407958984, | |
| "step": 597, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.1306431572096325, | |
| "grad_norm": 0.7954278588294983, | |
| "learning_rate": 0.00014695535306702109, | |
| "logits/chosen": -1.353016972541809, | |
| "logits/rejected": -1.3709743022918701, | |
| "logps/chosen": -4.011623859405518, | |
| "logps/rejected": -109.84175109863281, | |
| "loss": 0.1796695441007614, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16843344271183014, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5847711563110352, | |
| "rewards/margins": 9.300955772399902, | |
| "rewards/rejected": -8.716184616088867, | |
| "step": 598, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.1325365362996274, | |
| "grad_norm": 1.2315398454666138, | |
| "learning_rate": 0.00014677082757641463, | |
| "logits/chosen": -1.3229308128356934, | |
| "logits/rejected": -1.3372865915298462, | |
| "logps/chosen": -4.83215856552124, | |
| "logps/rejected": -100.4617691040039, | |
| "loss": 0.25171154737472534, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17117245495319366, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.46751469373703003, | |
| "rewards/margins": 8.871299743652344, | |
| "rewards/rejected": -8.403785705566406, | |
| "step": 599, | |
| "train_speed(iter/s)": 0.0056 | |
| }, | |
| { | |
| "epoch": 1.134429915389622, | |
| "grad_norm": 2.3959968090057373, | |
| "learning_rate": 0.00014658609801589982, | |
| "logits/chosen": -1.3001402616500854, | |
| "logits/rejected": -1.3274784088134766, | |
| "logps/chosen": -3.039743185043335, | |
| "logps/rejected": -124.06808471679688, | |
| "loss": 0.19401244819164276, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13560381531715393, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4775664508342743, | |
| "rewards/margins": 10.630762100219727, | |
| "rewards/rejected": -10.153194427490234, | |
| "step": 600, | |
| "train_speed(iter/s)": 0.005599 | |
| }, | |
| { | |
| "epoch": 1.134429915389622, | |
| "eval_logits/chosen": -1.2894256114959717, | |
| "eval_logits/rejected": -1.3079851865768433, | |
| "eval_logps/chosen": -5.3323974609375, | |
| "eval_logps/rejected": -111.4054946899414, | |
| "eval_loss": 0.301040917634964, | |
| "eval_nll_loss": 0.2509084641933441, | |
| "eval_rewards/accuracies": 0.970588207244873, | |
| "eval_rewards/chosen": 0.43204373121261597, | |
| "eval_rewards/margins": 9.736958503723145, | |
| "eval_rewards/rejected": -9.304915428161621, | |
| "eval_runtime": 382.4328, | |
| "eval_samples_per_second": 0.445, | |
| "eval_steps_per_second": 0.445, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.1363232944796167, | |
| "grad_norm": 2.15849232673645, | |
| "learning_rate": 0.0001464011651914864, | |
| "logits/chosen": -1.3066818714141846, | |
| "logits/rejected": -1.3111045360565186, | |
| "logps/chosen": -5.026226043701172, | |
| "logps/rejected": -83.13053894042969, | |
| "loss": 0.32173430919647217, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27388620376586914, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6003259420394897, | |
| "rewards/margins": 7.298637390136719, | |
| "rewards/rejected": -6.698311805725098, | |
| "step": 601, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 1.1382166735696113, | |
| "grad_norm": 1.3094327449798584, | |
| "learning_rate": 0.0001462160299100711, | |
| "logits/chosen": -1.253884196281433, | |
| "logits/rejected": -1.275226354598999, | |
| "logps/chosen": -3.2981009483337402, | |
| "logps/rejected": -118.21580505371094, | |
| "loss": 0.2262260913848877, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17337152361869812, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5595407485961914, | |
| "rewards/margins": 10.254971504211426, | |
| "rewards/rejected": -9.695430755615234, | |
| "step": 602, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 1.140110052659606, | |
| "grad_norm": 1.0693010091781616, | |
| "learning_rate": 0.00014603069297943383, | |
| "logits/chosen": -1.1947200298309326, | |
| "logits/rejected": -1.2207998037338257, | |
| "logps/chosen": -5.210245609283447, | |
| "logps/rejected": -121.29008483886719, | |
| "loss": 0.26592108607292175, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2492990344762802, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5870697498321533, | |
| "rewards/margins": 10.30087661743164, | |
| "rewards/rejected": -9.713807106018066, | |
| "step": 603, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1420034317496006, | |
| "grad_norm": 0.8486844301223755, | |
| "learning_rate": 0.00014584515520823453, | |
| "logits/chosen": -1.2308590412139893, | |
| "logits/rejected": -1.2505226135253906, | |
| "logps/chosen": -2.348849058151245, | |
| "logps/rejected": -127.62843322753906, | |
| "loss": 0.21631911396980286, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11859283596277237, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.5035842061042786, | |
| "rewards/margins": 11.000757217407227, | |
| "rewards/rejected": -10.497172355651855, | |
| "step": 604, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1438968108395953, | |
| "grad_norm": 4.024954319000244, | |
| "learning_rate": 0.00014565941740600933, | |
| "logits/chosen": -1.2393971681594849, | |
| "logits/rejected": -1.2759772539138794, | |
| "logps/chosen": -4.519779205322266, | |
| "logps/rejected": -139.6679229736328, | |
| "loss": 0.34041982889175415, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2741459906101227, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2945583462715149, | |
| "rewards/margins": 11.51474380493164, | |
| "rewards/rejected": -11.220185279846191, | |
| "step": 605, | |
| "train_speed(iter/s)": 0.005579 | |
| }, | |
| { | |
| "epoch": 1.14579018992959, | |
| "grad_norm": 0.4649512469768524, | |
| "learning_rate": 0.00014547348038316713, | |
| "logits/chosen": -1.2851876020431519, | |
| "logits/rejected": -1.311815619468689, | |
| "logps/chosen": -3.730963945388794, | |
| "logps/rejected": -136.5504913330078, | |
| "loss": 0.11688469350337982, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11342987418174744, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5621517896652222, | |
| "rewards/margins": 12.048606872558594, | |
| "rewards/rejected": -11.486455917358398, | |
| "step": 606, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1476835690195846, | |
| "grad_norm": 0.6240984201431274, | |
| "learning_rate": 0.00014528734495098612, | |
| "logits/chosen": -1.2574249505996704, | |
| "logits/rejected": -1.289762020111084, | |
| "logps/chosen": -2.7826473712921143, | |
| "logps/rejected": -154.68235778808594, | |
| "loss": 0.13110938668251038, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12355895340442657, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5258219838142395, | |
| "rewards/margins": 13.26880931854248, | |
| "rewards/rejected": -12.742988586425781, | |
| "step": 607, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1495769481095792, | |
| "grad_norm": 9.865966796875, | |
| "learning_rate": 0.00014510101192161018, | |
| "logits/chosen": -1.3318796157836914, | |
| "logits/rejected": -1.3524816036224365, | |
| "logps/chosen": -1.951794147491455, | |
| "logps/rejected": -139.08607482910156, | |
| "loss": 0.15863743424415588, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.10350289195775986, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4276507496833801, | |
| "rewards/margins": 12.455421447753906, | |
| "rewards/rejected": -12.02777099609375, | |
| "step": 608, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1514703271995739, | |
| "grad_norm": 0.9074051976203918, | |
| "learning_rate": 0.00014491448210804533, | |
| "logits/chosen": -1.2468656301498413, | |
| "logits/rejected": -1.274411916732788, | |
| "logps/chosen": -2.7470922470092773, | |
| "logps/rejected": -136.74620056152344, | |
| "loss": 0.20206348598003387, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1475079357624054, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5379533171653748, | |
| "rewards/margins": 12.279942512512207, | |
| "rewards/rejected": -11.741988182067871, | |
| "step": 609, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1533637062895687, | |
| "grad_norm": 28.569091796875, | |
| "learning_rate": 0.00014472775632415615, | |
| "logits/chosen": -1.286940097808838, | |
| "logits/rejected": -1.3069936037063599, | |
| "logps/chosen": -3.2979979515075684, | |
| "logps/rejected": -138.9271240234375, | |
| "loss": 0.2696467936038971, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25612494349479675, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4200615882873535, | |
| "rewards/margins": 12.597105026245117, | |
| "rewards/rejected": -12.177042007446289, | |
| "step": 610, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1552570853795634, | |
| "grad_norm": 0.8472843766212463, | |
| "learning_rate": 0.00014454083538466232, | |
| "logits/chosen": -1.250975251197815, | |
| "logits/rejected": -1.2794559001922607, | |
| "logps/chosen": -3.220829486846924, | |
| "logps/rejected": -124.9334945678711, | |
| "loss": 0.15973174571990967, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12067501991987228, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4378184378147125, | |
| "rewards/margins": 10.894189834594727, | |
| "rewards/rejected": -10.456371307373047, | |
| "step": 611, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.157150464469558, | |
| "grad_norm": 1.6857807636260986, | |
| "learning_rate": 0.00014435372010513509, | |
| "logits/chosen": -1.2885514497756958, | |
| "logits/rejected": -1.3083856105804443, | |
| "logps/chosen": -4.843531608581543, | |
| "logps/rejected": -142.25416564941406, | |
| "loss": 0.2124728113412857, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18952128291130066, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8398178815841675, | |
| "rewards/margins": 13.268404960632324, | |
| "rewards/rejected": -12.428586959838867, | |
| "step": 612, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1590438435595527, | |
| "grad_norm": 2.1635098457336426, | |
| "learning_rate": 0.00014416641130199348, | |
| "logits/chosen": -1.2934908866882324, | |
| "logits/rejected": -1.3176602125167847, | |
| "logps/chosen": -2.5755224227905273, | |
| "logps/rejected": -130.80252075195312, | |
| "loss": 0.14858324825763702, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.0918111577630043, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.46725374460220337, | |
| "rewards/margins": 11.65639591217041, | |
| "rewards/rejected": -11.189140319824219, | |
| "step": 613, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1609372226495474, | |
| "grad_norm": 0.7229548096656799, | |
| "learning_rate": 0.00014397890979250108, | |
| "logits/chosen": -1.3669577836990356, | |
| "logits/rejected": -1.3880679607391357, | |
| "logps/chosen": -2.74421763420105, | |
| "logps/rejected": -147.63467407226562, | |
| "loss": 0.14499099552631378, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13768450915813446, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5143299698829651, | |
| "rewards/margins": 13.366703033447266, | |
| "rewards/rejected": -12.852371215820312, | |
| "step": 614, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.162830601739542, | |
| "grad_norm": 2.729567766189575, | |
| "learning_rate": 0.00014379121639476215, | |
| "logits/chosen": -1.4184008836746216, | |
| "logits/rejected": -1.4347777366638184, | |
| "logps/chosen": -4.132072448730469, | |
| "logps/rejected": -138.54647827148438, | |
| "loss": 0.2683996260166168, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17208775877952576, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.29247456789016724, | |
| "rewards/margins": 12.408050537109375, | |
| "rewards/rejected": -12.11557674407959, | |
| "step": 615, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1647239808295367, | |
| "grad_norm": 2.1155970096588135, | |
| "learning_rate": 0.0001436033319277183, | |
| "logits/chosen": -1.3942526578903198, | |
| "logits/rejected": -1.4128817319869995, | |
| "logps/chosen": -4.156976699829102, | |
| "logps/rejected": -128.30084228515625, | |
| "loss": 0.2736564576625824, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19724150002002716, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45423924922943115, | |
| "rewards/margins": 11.601901054382324, | |
| "rewards/rejected": -11.147662162780762, | |
| "step": 616, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1666173599195313, | |
| "grad_norm": 0.8983713984489441, | |
| "learning_rate": 0.0001434152572111447, | |
| "logits/chosen": -1.3567776679992676, | |
| "logits/rejected": -1.3857258558273315, | |
| "logps/chosen": -4.764517784118652, | |
| "logps/rejected": -148.31007385253906, | |
| "loss": 0.23424586653709412, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17179971933364868, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.58805912733078, | |
| "rewards/margins": 13.08167839050293, | |
| "rewards/rejected": -12.493619918823242, | |
| "step": 617, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.168510739009526, | |
| "grad_norm": 29.474414825439453, | |
| "learning_rate": 0.00014322699306564668, | |
| "logits/chosen": -1.4533697366714478, | |
| "logits/rejected": -1.4785865545272827, | |
| "logps/chosen": -4.931976795196533, | |
| "logps/rejected": -175.3928985595703, | |
| "loss": 0.3418967127799988, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19013942778110504, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.34835898876190186, | |
| "rewards/margins": 15.95287036895752, | |
| "rewards/rejected": -15.604512214660645, | |
| "step": 618, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1704041180995208, | |
| "grad_norm": 1.0662310123443604, | |
| "learning_rate": 0.00014303854031265614, | |
| "logits/chosen": -1.3845001459121704, | |
| "logits/rejected": -1.4054373502731323, | |
| "logps/chosen": -7.603452205657959, | |
| "logps/rejected": -147.59339904785156, | |
| "loss": 0.279501348733902, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2728596031665802, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6738547086715698, | |
| "rewards/margins": 13.407675743103027, | |
| "rewards/rejected": -12.733820915222168, | |
| "step": 619, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1722974971895155, | |
| "grad_norm": 0.6584770083427429, | |
| "learning_rate": 0.0001428498997744278, | |
| "logits/chosen": -1.3540077209472656, | |
| "logits/rejected": -1.3758193254470825, | |
| "logps/chosen": -5.209235668182373, | |
| "logps/rejected": -154.4058074951172, | |
| "loss": 0.19960321485996246, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1905829906463623, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5462955832481384, | |
| "rewards/margins": 13.737914085388184, | |
| "rewards/rejected": -13.191617965698242, | |
| "step": 620, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1741908762795101, | |
| "grad_norm": 3.4600303173065186, | |
| "learning_rate": 0.0001426610722740358, | |
| "logits/chosen": -1.3978145122528076, | |
| "logits/rejected": -1.417238712310791, | |
| "logps/chosen": -4.0614776611328125, | |
| "logps/rejected": -153.81399536132812, | |
| "loss": 0.22619248926639557, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18299546837806702, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3758312165737152, | |
| "rewards/margins": 14.089869499206543, | |
| "rewards/rejected": -13.714038848876953, | |
| "step": 621, | |
| "train_speed(iter/s)": 0.00558 | |
| }, | |
| { | |
| "epoch": 1.1760842553695048, | |
| "grad_norm": 1.2220512628555298, | |
| "learning_rate": 0.00014247205863536996, | |
| "logits/chosen": -1.387900948524475, | |
| "logits/rejected": -1.399329662322998, | |
| "logps/chosen": -3.232072114944458, | |
| "logps/rejected": -139.4011688232422, | |
| "loss": 0.2432737946510315, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19621756672859192, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.48939788341522217, | |
| "rewards/margins": 13.003323554992676, | |
| "rewards/rejected": -12.51392650604248, | |
| "step": 622, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1779776344594994, | |
| "grad_norm": 14.152691841125488, | |
| "learning_rate": 0.00014228285968313236, | |
| "logits/chosen": -1.3739328384399414, | |
| "logits/rejected": -1.409564733505249, | |
| "logps/chosen": -1.8794363737106323, | |
| "logps/rejected": -161.13742065429688, | |
| "loss": 0.3040890693664551, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2211679369211197, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3907140791416168, | |
| "rewards/margins": 14.480472564697266, | |
| "rewards/rejected": -14.089759826660156, | |
| "step": 623, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.179871013549494, | |
| "grad_norm": 1.134121060371399, | |
| "learning_rate": 0.0001420934762428335, | |
| "logits/chosen": -1.3690139055252075, | |
| "logits/rejected": -1.3873157501220703, | |
| "logps/chosen": -4.1531476974487305, | |
| "logps/rejected": -147.33445739746094, | |
| "loss": 0.18056610226631165, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1357978731393814, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49936407804489136, | |
| "rewards/margins": 13.393208503723145, | |
| "rewards/rejected": -12.893844604492188, | |
| "step": 624, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1817643926394887, | |
| "grad_norm": 0.7700979113578796, | |
| "learning_rate": 0.000141903909140789, | |
| "logits/chosen": -1.3152154684066772, | |
| "logits/rejected": -1.3336371183395386, | |
| "logps/chosen": -2.753535032272339, | |
| "logps/rejected": -146.24029541015625, | |
| "loss": 0.14292775094509125, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12083562463521957, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4257271885871887, | |
| "rewards/margins": 13.148740768432617, | |
| "rewards/rejected": -12.723015785217285, | |
| "step": 625, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1836577717294834, | |
| "grad_norm": 0.9010930061340332, | |
| "learning_rate": 0.00014171415920411566, | |
| "logits/chosen": -1.2387850284576416, | |
| "logits/rejected": -1.2547930479049683, | |
| "logps/chosen": -4.986386775970459, | |
| "logps/rejected": -110.98575592041016, | |
| "loss": 0.24002321064472198, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20919182896614075, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5843397378921509, | |
| "rewards/margins": 9.915672302246094, | |
| "rewards/rejected": -9.331332206726074, | |
| "step": 626, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.185551150819478, | |
| "grad_norm": 1.0032802820205688, | |
| "learning_rate": 0.00014152422726072816, | |
| "logits/chosen": -1.2714622020721436, | |
| "logits/rejected": -1.2804292440414429, | |
| "logps/chosen": -6.319892406463623, | |
| "logps/rejected": -106.84049987792969, | |
| "loss": 0.27855637669563293, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23598721623420715, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.696945071220398, | |
| "rewards/margins": 9.756473541259766, | |
| "rewards/rejected": -9.059529304504395, | |
| "step": 627, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.187444529909473, | |
| "grad_norm": 0.8959448933601379, | |
| "learning_rate": 0.00014133411413933523, | |
| "logits/chosen": -1.3523356914520264, | |
| "logits/rejected": -1.382279634475708, | |
| "logps/chosen": -2.0693681240081787, | |
| "logps/rejected": -150.83078002929688, | |
| "loss": 0.12720414996147156, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11241940408945084, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5900616645812988, | |
| "rewards/margins": 13.786452293395996, | |
| "rewards/rejected": -13.196392059326172, | |
| "step": 628, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1893379089994676, | |
| "grad_norm": 19.023563385009766, | |
| "learning_rate": 0.00014114382066943618, | |
| "logits/chosen": -1.2807756662368774, | |
| "logits/rejected": -1.3037108182907104, | |
| "logps/chosen": -6.60006046295166, | |
| "logps/rejected": -135.55589294433594, | |
| "loss": 0.3288038969039917, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3017730116844177, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18927210569381714, | |
| "rewards/margins": 11.776759147644043, | |
| "rewards/rejected": -11.58748722076416, | |
| "step": 629, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1912312880894622, | |
| "grad_norm": 1.1239473819732666, | |
| "learning_rate": 0.0001409533476813171, | |
| "logits/chosen": -1.3297996520996094, | |
| "logits/rejected": -1.3480398654937744, | |
| "logps/chosen": -5.556182861328125, | |
| "logps/rejected": -143.35040283203125, | |
| "loss": 0.23849260807037354, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19322925806045532, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5474792718887329, | |
| "rewards/margins": 13.075397491455078, | |
| "rewards/rejected": -12.527918815612793, | |
| "step": 630, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.1931246671794569, | |
| "grad_norm": 0.8637579679489136, | |
| "learning_rate": 0.00014076269600604748, | |
| "logits/chosen": -1.2814322710037231, | |
| "logits/rejected": -1.3097827434539795, | |
| "logps/chosen": -2.7755789756774902, | |
| "logps/rejected": -165.87844848632812, | |
| "loss": 0.18964631855487823, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16508126258850098, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6472874879837036, | |
| "rewards/margins": 14.968192100524902, | |
| "rewards/rejected": -14.320903778076172, | |
| "step": 631, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.1950180462694515, | |
| "grad_norm": 35.91895294189453, | |
| "learning_rate": 0.0001405718664754764, | |
| "logits/chosen": -1.2617077827453613, | |
| "logits/rejected": -1.291745662689209, | |
| "logps/chosen": -5.865665435791016, | |
| "logps/rejected": -139.880859375, | |
| "loss": 0.2276858538389206, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19169428944587708, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31476259231567383, | |
| "rewards/margins": 12.022266387939453, | |
| "rewards/rejected": -11.707503318786621, | |
| "step": 632, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.1969114253594462, | |
| "grad_norm": 3.695615291595459, | |
| "learning_rate": 0.0001403808599222289, | |
| "logits/chosen": -1.2897461652755737, | |
| "logits/rejected": -1.3059349060058594, | |
| "logps/chosen": -5.9791765213012695, | |
| "logps/rejected": -137.66943359375, | |
| "loss": 0.22073869407176971, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21946173906326294, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7112911343574524, | |
| "rewards/margins": 12.674735069274902, | |
| "rewards/rejected": -11.9634428024292, | |
| "step": 633, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.1988048044494408, | |
| "grad_norm": 1.971228837966919, | |
| "learning_rate": 0.00014018967717970254, | |
| "logits/chosen": -1.300931692123413, | |
| "logits/rejected": -1.3245811462402344, | |
| "logps/chosen": -4.173644542694092, | |
| "logps/rejected": -140.01991271972656, | |
| "loss": 0.24654018878936768, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24364623427391052, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3556899130344391, | |
| "rewards/margins": 12.488964080810547, | |
| "rewards/rejected": -12.13327407836914, | |
| "step": 634, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.2006981835394355, | |
| "grad_norm": 1.9012233018875122, | |
| "learning_rate": 0.0001399983190820635, | |
| "logits/chosen": -1.302451729774475, | |
| "logits/rejected": -1.33121919631958, | |
| "logps/chosen": -2.868640422821045, | |
| "logps/rejected": -171.15383911132812, | |
| "loss": 0.18641558289527893, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12313997745513916, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.48267343640327454, | |
| "rewards/margins": 15.43280029296875, | |
| "rewards/rejected": -14.950126647949219, | |
| "step": 635, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2025915626294301, | |
| "grad_norm": 2.096956729888916, | |
| "learning_rate": 0.0001398067864642431, | |
| "logits/chosen": -1.2636353969573975, | |
| "logits/rejected": -1.2825238704681396, | |
| "logps/chosen": -5.219088554382324, | |
| "logps/rejected": -133.4476318359375, | |
| "loss": 0.2759723663330078, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2651902437210083, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6040548086166382, | |
| "rewards/margins": 12.336801528930664, | |
| "rewards/rejected": -11.732746124267578, | |
| "step": 636, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.204484941719425, | |
| "grad_norm": 0.7150812149047852, | |
| "learning_rate": 0.00013961508016193416, | |
| "logits/chosen": -1.230392336845398, | |
| "logits/rejected": -1.2499421834945679, | |
| "logps/chosen": -3.6723968982696533, | |
| "logps/rejected": -131.15306091308594, | |
| "loss": 0.20008526742458344, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1471841037273407, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5768845677375793, | |
| "rewards/margins": 11.497173309326172, | |
| "rewards/rejected": -10.920289039611816, | |
| "step": 637, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2063783208094196, | |
| "grad_norm": 2.1268279552459717, | |
| "learning_rate": 0.00013942320101158732, | |
| "logits/chosen": -1.215066909790039, | |
| "logits/rejected": -1.2379679679870605, | |
| "logps/chosen": -3.8959691524505615, | |
| "logps/rejected": -145.33799743652344, | |
| "loss": 0.17703424394130707, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17233292758464813, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2276427000761032, | |
| "rewards/margins": 12.982682228088379, | |
| "rewards/rejected": -12.75503921508789, | |
| "step": 638, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2082716998994143, | |
| "grad_norm": 1.3078527450561523, | |
| "learning_rate": 0.00013923114985040733, | |
| "logits/chosen": -1.2039527893066406, | |
| "logits/rejected": -1.2280265092849731, | |
| "logps/chosen": -3.3238728046417236, | |
| "logps/rejected": -127.83318328857422, | |
| "loss": 0.18549729883670807, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13051187992095947, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5606825947761536, | |
| "rewards/margins": 11.299223899841309, | |
| "rewards/rejected": -10.738540649414062, | |
| "step": 639, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.210165078989409, | |
| "grad_norm": 1.6217330694198608, | |
| "learning_rate": 0.00013903892751634947, | |
| "logits/chosen": -1.2137424945831299, | |
| "logits/rejected": -1.21882164478302, | |
| "logps/chosen": -4.9762983322143555, | |
| "logps/rejected": -101.02047729492188, | |
| "loss": 0.27594050765037537, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17926731705665588, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28640735149383545, | |
| "rewards/margins": 9.02888298034668, | |
| "rewards/rejected": -8.742474555969238, | |
| "step": 640, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2120584580794036, | |
| "grad_norm": 7.413793087005615, | |
| "learning_rate": 0.000138846534848116, | |
| "logits/chosen": -1.141318917274475, | |
| "logits/rejected": -1.1606910228729248, | |
| "logps/chosen": -5.451035499572754, | |
| "logps/rejected": -101.37506103515625, | |
| "loss": 0.31164583563804626, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27093198895454407, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6124750971794128, | |
| "rewards/margins": 8.550021171569824, | |
| "rewards/rejected": -7.937546730041504, | |
| "step": 641, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2139518371693983, | |
| "grad_norm": 0.9872555732727051, | |
| "learning_rate": 0.00013865397268515215, | |
| "logits/chosen": -1.103111743927002, | |
| "logits/rejected": -1.1166858673095703, | |
| "logps/chosen": -5.7832255363464355, | |
| "logps/rejected": -87.32723236083984, | |
| "loss": 0.31326529383659363, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23107054829597473, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4298703670501709, | |
| "rewards/margins": 7.514644622802734, | |
| "rewards/rejected": -7.084774494171143, | |
| "step": 642, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.215845216259393, | |
| "grad_norm": 4.625118732452393, | |
| "learning_rate": 0.0001384612418676429, | |
| "logits/chosen": -1.0852738618850708, | |
| "logits/rejected": -1.1021206378936768, | |
| "logps/chosen": -4.508449554443359, | |
| "logps/rejected": -104.58615112304688, | |
| "loss": 0.363935649394989, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3228420615196228, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3612232804298401, | |
| "rewards/margins": 8.754815101623535, | |
| "rewards/rejected": -8.393592834472656, | |
| "step": 643, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2177385953493876, | |
| "grad_norm": 3.9486324787139893, | |
| "learning_rate": 0.000138268343236509, | |
| "logits/chosen": -1.0697134733200073, | |
| "logits/rejected": -1.0845346450805664, | |
| "logps/chosen": -5.405340194702148, | |
| "logps/rejected": -81.9689712524414, | |
| "loss": 0.24942205846309662, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18678025901317596, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.7587069869041443, | |
| "rewards/margins": 6.866741180419922, | |
| "rewards/rejected": -6.108034133911133, | |
| "step": 644, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2196319744393822, | |
| "grad_norm": 1.8781797885894775, | |
| "learning_rate": 0.0001380752776334034, | |
| "logits/chosen": -1.063079833984375, | |
| "logits/rejected": -1.0907819271087646, | |
| "logps/chosen": -4.9822845458984375, | |
| "logps/rejected": -98.52869415283203, | |
| "loss": 0.48380017280578613, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3868637979030609, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45160090923309326, | |
| "rewards/margins": 7.476816177368164, | |
| "rewards/rejected": -7.025215148925781, | |
| "step": 645, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.221525353529377, | |
| "grad_norm": 1.285443663597107, | |
| "learning_rate": 0.00013788204590070764, | |
| "logits/chosen": -1.0937983989715576, | |
| "logits/rejected": -1.097926139831543, | |
| "logps/chosen": -4.647152423858643, | |
| "logps/rejected": -70.02279663085938, | |
| "loss": 0.3429650664329529, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2989942133426666, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5649895668029785, | |
| "rewards/margins": 6.161919116973877, | |
| "rewards/rejected": -5.596929550170898, | |
| "step": 646, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2234187326193717, | |
| "grad_norm": 10.317179679870605, | |
| "learning_rate": 0.000137688648881528, | |
| "logits/chosen": -1.1082532405853271, | |
| "logits/rejected": -1.1164014339447021, | |
| "logps/chosen": -5.854452610015869, | |
| "logps/rejected": -72.38533782958984, | |
| "loss": 0.5907310247421265, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4151501953601837, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.6598876118659973, | |
| "rewards/margins": 6.241320610046387, | |
| "rewards/rejected": -5.581433296203613, | |
| "step": 647, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2253121117093664, | |
| "grad_norm": 1.430675745010376, | |
| "learning_rate": 0.00013749508741969213, | |
| "logits/chosen": -1.1150786876678467, | |
| "logits/rejected": -1.1341830492019653, | |
| "logps/chosen": -2.883854627609253, | |
| "logps/rejected": -87.04833221435547, | |
| "loss": 0.2859303057193756, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2183929681777954, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.44854816794395447, | |
| "rewards/margins": 7.2965617179870605, | |
| "rewards/rejected": -6.848013877868652, | |
| "step": 648, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.227205490799361, | |
| "grad_norm": 0.6251242756843567, | |
| "learning_rate": 0.00013730136235974493, | |
| "logits/chosen": -1.0749518871307373, | |
| "logits/rejected": -1.1022703647613525, | |
| "logps/chosen": -3.4674556255340576, | |
| "logps/rejected": -94.43933868408203, | |
| "loss": 0.19341430068016052, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16188928484916687, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5625832676887512, | |
| "rewards/margins": 7.256820201873779, | |
| "rewards/rejected": -6.69423770904541, | |
| "step": 649, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2290988698893557, | |
| "grad_norm": 0.854637086391449, | |
| "learning_rate": 0.00013710747454694536, | |
| "logits/chosen": -1.1327743530273438, | |
| "logits/rejected": -1.1492671966552734, | |
| "logps/chosen": -3.158024787902832, | |
| "logps/rejected": -92.56230926513672, | |
| "loss": 0.16373629868030548, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13652028143405914, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6151731610298157, | |
| "rewards/margins": 7.690463066101074, | |
| "rewards/rejected": -7.075289249420166, | |
| "step": 650, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2309922489793503, | |
| "grad_norm": 1.0111662149429321, | |
| "learning_rate": 0.00013691342482726227, | |
| "logits/chosen": -1.164562463760376, | |
| "logits/rejected": -1.1749894618988037, | |
| "logps/chosen": -3.864534854888916, | |
| "logps/rejected": -85.07794189453125, | |
| "loss": 0.19850535690784454, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14427503943443298, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.435876727104187, | |
| "rewards/margins": 7.181488037109375, | |
| "rewards/rejected": -6.745611667633057, | |
| "step": 651, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.232885628069345, | |
| "grad_norm": 0.6544408798217773, | |
| "learning_rate": 0.0001367192140473711, | |
| "logits/chosen": -1.1733068227767944, | |
| "logits/rejected": -1.1924707889556885, | |
| "logps/chosen": -2.2992167472839355, | |
| "logps/rejected": -92.77910614013672, | |
| "loss": 0.13127104938030243, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11011791974306107, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5089115500450134, | |
| "rewards/margins": 8.034041404724121, | |
| "rewards/rejected": -7.525129795074463, | |
| "step": 652, | |
| "train_speed(iter/s)": 0.005581 | |
| }, | |
| { | |
| "epoch": 1.2347790071593396, | |
| "grad_norm": 0.8594977259635925, | |
| "learning_rate": 0.00013652484305464994, | |
| "logits/chosen": -1.2025909423828125, | |
| "logits/rejected": -1.2214899063110352, | |
| "logps/chosen": -5.194190979003906, | |
| "logps/rejected": -102.56082153320312, | |
| "loss": 0.2433939427137375, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.196023091673851, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37284529209136963, | |
| "rewards/margins": 8.817720413208008, | |
| "rewards/rejected": -8.444875717163086, | |
| "step": 653, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2366723862493343, | |
| "grad_norm": 4.11221170425415, | |
| "learning_rate": 0.000136330312697176, | |
| "logits/chosen": -1.2391037940979004, | |
| "logits/rejected": -1.257367730140686, | |
| "logps/chosen": -3.074094533920288, | |
| "logps/rejected": -107.96156311035156, | |
| "loss": 0.17748232185840607, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12704119086265564, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45895522832870483, | |
| "rewards/margins": 9.096002578735352, | |
| "rewards/rejected": -8.637046813964844, | |
| "step": 654, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.238565765339329, | |
| "grad_norm": 13.602038383483887, | |
| "learning_rate": 0.00013613562382372175, | |
| "logits/chosen": -1.2747328281402588, | |
| "logits/rejected": -1.2887108325958252, | |
| "logps/chosen": -4.994225978851318, | |
| "logps/rejected": -111.89958190917969, | |
| "loss": 0.22689774632453918, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19176575541496277, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6112773418426514, | |
| "rewards/margins": 9.564874649047852, | |
| "rewards/rejected": -8.953597068786621, | |
| "step": 655, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2404591444293236, | |
| "grad_norm": 1.4164304733276367, | |
| "learning_rate": 0.00013594077728375128, | |
| "logits/chosen": -1.2002649307250977, | |
| "logits/rejected": -1.2172743082046509, | |
| "logps/chosen": -2.0340259075164795, | |
| "logps/rejected": -100.03349304199219, | |
| "loss": 0.15853197872638702, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14140553772449493, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39426544308662415, | |
| "rewards/margins": 8.667793273925781, | |
| "rewards/rejected": -8.273527145385742, | |
| "step": 656, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2423525235193185, | |
| "grad_norm": 1.2055261135101318, | |
| "learning_rate": 0.00013574577392741675, | |
| "logits/chosen": -1.1947505474090576, | |
| "logits/rejected": -1.2100290060043335, | |
| "logps/chosen": -3.4151129722595215, | |
| "logps/rejected": -87.28324890136719, | |
| "loss": 0.25436219573020935, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21079185605049133, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3687793016433716, | |
| "rewards/margins": 7.392486572265625, | |
| "rewards/rejected": -7.023707389831543, | |
| "step": 657, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2442459026093131, | |
| "grad_norm": 0.7824620008468628, | |
| "learning_rate": 0.00013555061460555437, | |
| "logits/chosen": -1.2751868963241577, | |
| "logits/rejected": -1.2890942096710205, | |
| "logps/chosen": -5.6683349609375, | |
| "logps/rejected": -94.01497650146484, | |
| "loss": 0.22607284784317017, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18028336763381958, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5186669230461121, | |
| "rewards/margins": 8.202751159667969, | |
| "rewards/rejected": -7.684084892272949, | |
| "step": 658, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2461392816993078, | |
| "grad_norm": 10.540384292602539, | |
| "learning_rate": 0.00013535530016968095, | |
| "logits/chosen": -1.224336862564087, | |
| "logits/rejected": -1.234197735786438, | |
| "logps/chosen": -4.465878963470459, | |
| "logps/rejected": -78.70198822021484, | |
| "loss": 0.3276776671409607, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2578147053718567, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.48812490701675415, | |
| "rewards/margins": 6.712148666381836, | |
| "rewards/rejected": -6.224023818969727, | |
| "step": 659, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2480326607893024, | |
| "grad_norm": 1.0541977882385254, | |
| "learning_rate": 0.00013515983147199007, | |
| "logits/chosen": -1.263400673866272, | |
| "logits/rejected": -1.2767853736877441, | |
| "logps/chosen": -4.78371000289917, | |
| "logps/rejected": -91.89421081542969, | |
| "loss": 0.2207237035036087, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21213196218013763, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40188920497894287, | |
| "rewards/margins": 7.835195541381836, | |
| "rewards/rejected": -7.433306694030762, | |
| "step": 660, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.249926039879297, | |
| "grad_norm": 1.1346842050552368, | |
| "learning_rate": 0.00013496420936534839, | |
| "logits/chosen": -1.2140860557556152, | |
| "logits/rejected": -1.2262767553329468, | |
| "logps/chosen": -4.072805881500244, | |
| "logps/rejected": -83.90109252929688, | |
| "loss": 0.29052406549453735, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20386162400245667, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5836110711097717, | |
| "rewards/margins": 7.275147914886475, | |
| "rewards/rejected": -6.691536903381348, | |
| "step": 661, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2518194189692917, | |
| "grad_norm": 1.0119054317474365, | |
| "learning_rate": 0.0001347684347032919, | |
| "logits/chosen": -1.2601851224899292, | |
| "logits/rejected": -1.2733888626098633, | |
| "logps/chosen": -3.0143775939941406, | |
| "logps/rejected": -83.3037109375, | |
| "loss": 0.1853754073381424, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16816890239715576, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4909835159778595, | |
| "rewards/margins": 7.277222156524658, | |
| "rewards/rejected": -6.786238670349121, | |
| "step": 662, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2537127980592864, | |
| "grad_norm": 1.772426724433899, | |
| "learning_rate": 0.00013457250834002227, | |
| "logits/chosen": -1.259223461151123, | |
| "logits/rejected": -1.2752642631530762, | |
| "logps/chosen": -6.449353218078613, | |
| "logps/rejected": -77.19977569580078, | |
| "loss": 0.3121209740638733, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2732515037059784, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48688846826553345, | |
| "rewards/margins": 6.596216678619385, | |
| "rewards/rejected": -6.109328746795654, | |
| "step": 663, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2556061771492812, | |
| "grad_norm": 0.834148645401001, | |
| "learning_rate": 0.00013437643113040301, | |
| "logits/chosen": -1.2490071058273315, | |
| "logits/rejected": -1.2806060314178467, | |
| "logps/chosen": -2.3923885822296143, | |
| "logps/rejected": -112.9473876953125, | |
| "loss": 0.12270709872245789, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11919470131397247, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5832490921020508, | |
| "rewards/margins": 9.47195816040039, | |
| "rewards/rejected": -8.888710021972656, | |
| "step": 664, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2574995562392757, | |
| "grad_norm": 0.6280990242958069, | |
| "learning_rate": 0.0001341802039299558, | |
| "logits/chosen": -1.2498441934585571, | |
| "logits/rejected": -1.2767866849899292, | |
| "logps/chosen": -1.147368311882019, | |
| "logps/rejected": -101.53812408447266, | |
| "loss": 0.09030965715646744, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.08374150097370148, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41601359844207764, | |
| "rewards/margins": 8.669894218444824, | |
| "rewards/rejected": -8.25387954711914, | |
| "step": 665, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2593929353292705, | |
| "grad_norm": 7.9262776374816895, | |
| "learning_rate": 0.00013398382759485683, | |
| "logits/chosen": -1.2408939599990845, | |
| "logits/rejected": -1.2566684484481812, | |
| "logps/chosen": -2.6536943912506104, | |
| "logps/rejected": -89.7925033569336, | |
| "loss": 0.21182867884635925, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18399737775325775, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.467414915561676, | |
| "rewards/margins": 7.703207969665527, | |
| "rewards/rejected": -7.23579216003418, | |
| "step": 666, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2612863144192652, | |
| "grad_norm": 2.1628665924072266, | |
| "learning_rate": 0.00013378730298193293, | |
| "logits/chosen": -1.2686347961425781, | |
| "logits/rejected": -1.2850341796875, | |
| "logps/chosen": -2.91650128364563, | |
| "logps/rejected": -98.89842224121094, | |
| "loss": 0.12062933295965195, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.09240053594112396, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44848957657814026, | |
| "rewards/margins": 8.455171585083008, | |
| "rewards/rejected": -8.006681442260742, | |
| "step": 667, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2631796935092598, | |
| "grad_norm": 1.5882667303085327, | |
| "learning_rate": 0.0001335906309486579, | |
| "logits/chosen": -1.2118374109268188, | |
| "logits/rejected": -1.228037714958191, | |
| "logps/chosen": -4.291105270385742, | |
| "logps/rejected": -93.77169799804688, | |
| "loss": 0.23226000368595123, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17540231347084045, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5786739587783813, | |
| "rewards/margins": 8.085977554321289, | |
| "rewards/rejected": -7.507303237915039, | |
| "step": 668, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2650730725992545, | |
| "grad_norm": 0.7664045691490173, | |
| "learning_rate": 0.00013339381235314877, | |
| "logits/chosen": -1.2171658277511597, | |
| "logits/rejected": -1.2381665706634521, | |
| "logps/chosen": -2.144977569580078, | |
| "logps/rejected": -104.58934783935547, | |
| "loss": 0.1646273136138916, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15552210807800293, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5437726974487305, | |
| "rewards/margins": 9.003692626953125, | |
| "rewards/rejected": -8.459919929504395, | |
| "step": 669, | |
| "train_speed(iter/s)": 0.005582 | |
| }, | |
| { | |
| "epoch": 1.2669664516892492, | |
| "grad_norm": 0.997371256351471, | |
| "learning_rate": 0.00013319684805416208, | |
| "logits/chosen": -1.2663860321044922, | |
| "logits/rejected": -1.2850096225738525, | |
| "logps/chosen": -3.7030885219573975, | |
| "logps/rejected": -94.42146301269531, | |
| "loss": 0.19464686512947083, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1695374846458435, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6468212008476257, | |
| "rewards/margins": 8.09141731262207, | |
| "rewards/rejected": -7.444596290588379, | |
| "step": 670, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2688598307792438, | |
| "grad_norm": 1.922092080116272, | |
| "learning_rate": 0.00013299973891109002, | |
| "logits/chosen": -1.2253403663635254, | |
| "logits/rejected": -1.244078278541565, | |
| "logps/chosen": -3.8278942108154297, | |
| "logps/rejected": -102.39065551757812, | |
| "loss": 0.20534221827983856, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18800829350948334, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6005682945251465, | |
| "rewards/margins": 8.945769309997559, | |
| "rewards/rejected": -8.345200538635254, | |
| "step": 671, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2707532098692385, | |
| "grad_norm": 0.8352254033088684, | |
| "learning_rate": 0.0001328024857839569, | |
| "logits/chosen": -1.2455424070358276, | |
| "logits/rejected": -1.2553379535675049, | |
| "logps/chosen": -4.562953472137451, | |
| "logps/rejected": -100.60092163085938, | |
| "loss": 0.20486782491207123, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18330179154872894, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49509212374687195, | |
| "rewards/margins": 8.774545669555664, | |
| "rewards/rejected": -8.27945327758789, | |
| "step": 672, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.272646588959233, | |
| "grad_norm": 2.8604531288146973, | |
| "learning_rate": 0.00013260508953341513, | |
| "logits/chosen": -1.2760071754455566, | |
| "logits/rejected": -1.2919646501541138, | |
| "logps/chosen": -4.311322212219238, | |
| "logps/rejected": -109.21879577636719, | |
| "loss": 0.25504687428474426, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18772965669631958, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7696996927261353, | |
| "rewards/margins": 9.808104515075684, | |
| "rewards/rejected": -9.038405418395996, | |
| "step": 673, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2745399680492278, | |
| "grad_norm": 3.490610361099243, | |
| "learning_rate": 0.00013240755102074162, | |
| "logits/chosen": -1.2782739400863647, | |
| "logits/rejected": -1.2971439361572266, | |
| "logps/chosen": -6.547723293304443, | |
| "logps/rejected": -123.92678833007812, | |
| "loss": 0.27842605113983154, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21907608211040497, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5699790120124817, | |
| "rewards/margins": 10.686688423156738, | |
| "rewards/rejected": -10.11670970916748, | |
| "step": 674, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2764333471392226, | |
| "grad_norm": 0.6559191346168518, | |
| "learning_rate": 0.00013220987110783405, | |
| "logits/chosen": -1.3302873373031616, | |
| "logits/rejected": -1.3444199562072754, | |
| "logps/chosen": -3.099641799926758, | |
| "logps/rejected": -100.66400146484375, | |
| "loss": 0.13532628118991852, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11194542795419693, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4563906788825989, | |
| "rewards/margins": 8.841947555541992, | |
| "rewards/rejected": -8.3855562210083, | |
| "step": 675, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2783267262292173, | |
| "grad_norm": 0.6219284534454346, | |
| "learning_rate": 0.00013201205065720698, | |
| "logits/chosen": -1.2828350067138672, | |
| "logits/rejected": -1.3093940019607544, | |
| "logps/chosen": -2.723968029022217, | |
| "logps/rejected": -119.10283660888672, | |
| "loss": 0.13384726643562317, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11944205313920975, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.644302487373352, | |
| "rewards/margins": 10.407089233398438, | |
| "rewards/rejected": -9.762786865234375, | |
| "step": 676, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.280220105319212, | |
| "grad_norm": 4.198030471801758, | |
| "learning_rate": 0.00013181409053198822, | |
| "logits/chosen": -1.2754874229431152, | |
| "logits/rejected": -1.2981709241867065, | |
| "logps/chosen": -3.2714099884033203, | |
| "logps/rejected": -102.00110626220703, | |
| "loss": 0.16418549418449402, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15923593938350677, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3782915472984314, | |
| "rewards/margins": 8.629867553710938, | |
| "rewards/rejected": -8.251575469970703, | |
| "step": 677, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2821134844092066, | |
| "grad_norm": 0.7027133107185364, | |
| "learning_rate": 0.00013161599159591502, | |
| "logits/chosen": -1.3214412927627563, | |
| "logits/rejected": -1.3430482149124146, | |
| "logps/chosen": -2.828273296356201, | |
| "logps/rejected": -122.728271484375, | |
| "loss": 0.16940374672412872, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16672328114509583, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6937204599380493, | |
| "rewards/margins": 10.843151092529297, | |
| "rewards/rejected": -10.149429321289062, | |
| "step": 678, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2840068634992012, | |
| "grad_norm": 0.4566222131252289, | |
| "learning_rate": 0.00013141775471333023, | |
| "logits/chosen": -1.2488141059875488, | |
| "logits/rejected": -1.2712870836257935, | |
| "logps/chosen": -1.4968810081481934, | |
| "logps/rejected": -115.5900650024414, | |
| "loss": 0.07236362993717194, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.06065154820680618, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5558494329452515, | |
| "rewards/margins": 10.079120635986328, | |
| "rewards/rejected": -9.523271560668945, | |
| "step": 679, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2859002425891959, | |
| "grad_norm": 7.306726455688477, | |
| "learning_rate": 0.00013121938074917865, | |
| "logits/chosen": -1.3081672191619873, | |
| "logits/rejected": -1.3317952156066895, | |
| "logps/chosen": -2.5203912258148193, | |
| "logps/rejected": -124.57064819335938, | |
| "loss": 0.14741453528404236, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12144798040390015, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.49395012855529785, | |
| "rewards/margins": 10.88518238067627, | |
| "rewards/rejected": -10.391231536865234, | |
| "step": 680, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2877936216791905, | |
| "grad_norm": 0.7193635702133179, | |
| "learning_rate": 0.00013102087056900312, | |
| "logits/chosen": -1.361487627029419, | |
| "logits/rejected": -1.3688561916351318, | |
| "logps/chosen": -3.718552350997925, | |
| "logps/rejected": -90.23562622070312, | |
| "loss": 0.1710875928401947, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1185617595911026, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.38218656182289124, | |
| "rewards/margins": 7.945744037628174, | |
| "rewards/rejected": -7.563557147979736, | |
| "step": 681, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2896870007691852, | |
| "grad_norm": 1.750275731086731, | |
| "learning_rate": 0.00013082222503894085, | |
| "logits/chosen": -1.328383207321167, | |
| "logits/rejected": -1.3390076160430908, | |
| "logps/chosen": -4.469247341156006, | |
| "logps/rejected": -99.45858764648438, | |
| "loss": 0.24831274151802063, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2337150275707245, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5493384599685669, | |
| "rewards/margins": 9.164920806884766, | |
| "rewards/rejected": -8.615582466125488, | |
| "step": 682, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2915803798591798, | |
| "grad_norm": 1.4674733877182007, | |
| "learning_rate": 0.0001306234450257196, | |
| "logits/chosen": -1.3304932117462158, | |
| "logits/rejected": -1.354658842086792, | |
| "logps/chosen": -3.1954829692840576, | |
| "logps/rejected": -115.50567626953125, | |
| "loss": 0.16422712802886963, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16022494435310364, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5024171471595764, | |
| "rewards/margins": 9.925741195678711, | |
| "rewards/rejected": -9.423324584960938, | |
| "step": 683, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2934737589491747, | |
| "grad_norm": 3.6834020614624023, | |
| "learning_rate": 0.00013042453139665397, | |
| "logits/chosen": -1.3059653043746948, | |
| "logits/rejected": -1.3349957466125488, | |
| "logps/chosen": -7.1290788650512695, | |
| "logps/rejected": -118.19027709960938, | |
| "loss": 0.5577002167701721, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5272465348243713, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2190469354391098, | |
| "rewards/margins": 9.950216293334961, | |
| "rewards/rejected": -9.731169700622559, | |
| "step": 684, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2953671380391691, | |
| "grad_norm": 0.9725119471549988, | |
| "learning_rate": 0.00013022548501964148, | |
| "logits/chosen": -1.2843022346496582, | |
| "logits/rejected": -1.3074129819869995, | |
| "logps/chosen": -4.139756202697754, | |
| "logps/rejected": -121.79645538330078, | |
| "loss": 0.21320319175720215, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1927129179239273, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6416595578193665, | |
| "rewards/margins": 11.054458618164062, | |
| "rewards/rejected": -10.412799835205078, | |
| "step": 685, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.297260517129164, | |
| "grad_norm": 0.9142606258392334, | |
| "learning_rate": 0.00013002630676315884, | |
| "logits/chosen": -1.297221064567566, | |
| "logits/rejected": -1.313838243484497, | |
| "logps/chosen": -3.9657680988311768, | |
| "logps/rejected": -108.65413665771484, | |
| "loss": 0.16495384275913239, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13814619183540344, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5089263319969177, | |
| "rewards/margins": 9.599608421325684, | |
| "rewards/rejected": -9.090682029724121, | |
| "step": 686, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.2991538962191587, | |
| "grad_norm": 0.8316473364830017, | |
| "learning_rate": 0.00012982699749625821, | |
| "logits/chosen": -1.2407358884811401, | |
| "logits/rejected": -1.2609210014343262, | |
| "logps/chosen": -7.802042484283447, | |
| "logps/rejected": -116.04839324951172, | |
| "loss": 0.31111985445022583, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2776601016521454, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5655537843704224, | |
| "rewards/margins": 10.247386932373047, | |
| "rewards/rejected": -9.681832313537598, | |
| "step": 687, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3010472753091533, | |
| "grad_norm": 0.7703730463981628, | |
| "learning_rate": 0.00012962755808856342, | |
| "logits/chosen": -1.2796357870101929, | |
| "logits/rejected": -1.2995810508728027, | |
| "logps/chosen": -4.099747657775879, | |
| "logps/rejected": -121.5992431640625, | |
| "loss": 0.17581507563591003, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1654597371816635, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6910482048988342, | |
| "rewards/margins": 10.691566467285156, | |
| "rewards/rejected": -10.000518798828125, | |
| "step": 688, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.302940654399148, | |
| "grad_norm": 1.3358616828918457, | |
| "learning_rate": 0.000129427989410266, | |
| "logits/chosen": -1.302721381187439, | |
| "logits/rejected": -1.3264588117599487, | |
| "logps/chosen": -5.364765167236328, | |
| "logps/rejected": -98.9963607788086, | |
| "loss": 0.5656005144119263, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.42210423946380615, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4461752772331238, | |
| "rewards/margins": 8.554890632629395, | |
| "rewards/rejected": -8.108715057373047, | |
| "step": 689, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3048340334891426, | |
| "grad_norm": 19.095157623291016, | |
| "learning_rate": 0.00012922829233212165, | |
| "logits/chosen": -1.3093451261520386, | |
| "logits/rejected": -1.3238065242767334, | |
| "logps/chosen": -4.750430583953857, | |
| "logps/rejected": -109.75341796875, | |
| "loss": 0.2108265459537506, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18970412015914917, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2624005675315857, | |
| "rewards/margins": 9.519784927368164, | |
| "rewards/rejected": -9.257384300231934, | |
| "step": 690, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3067274125791373, | |
| "grad_norm": 0.773473858833313, | |
| "learning_rate": 0.00012902846772544624, | |
| "logits/chosen": -1.2952555418014526, | |
| "logits/rejected": -1.3154966831207275, | |
| "logps/chosen": -5.129486083984375, | |
| "logps/rejected": -127.95144653320312, | |
| "loss": 0.19911812245845795, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16275183856487274, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37549078464508057, | |
| "rewards/margins": 10.62497329711914, | |
| "rewards/rejected": -10.249483108520508, | |
| "step": 691, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.308620791669132, | |
| "grad_norm": 1.073358416557312, | |
| "learning_rate": 0.00012882851646211206, | |
| "logits/chosen": -1.2766900062561035, | |
| "logits/rejected": -1.2928975820541382, | |
| "logps/chosen": -7.992812156677246, | |
| "logps/rejected": -116.97691345214844, | |
| "loss": 0.2699803411960602, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2624160349369049, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5498393774032593, | |
| "rewards/margins": 10.348921775817871, | |
| "rewards/rejected": -9.799081802368164, | |
| "step": 692, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3105141707591268, | |
| "grad_norm": 0.6758482456207275, | |
| "learning_rate": 0.00012862843941454402, | |
| "logits/chosen": -1.254409670829773, | |
| "logits/rejected": -1.2667585611343384, | |
| "logps/chosen": -5.230801105499268, | |
| "logps/rejected": -113.11685943603516, | |
| "loss": 0.20469366014003754, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1763952076435089, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3384644091129303, | |
| "rewards/margins": 9.77762508392334, | |
| "rewards/rejected": -9.439160346984863, | |
| "step": 693, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3124075498491212, | |
| "grad_norm": 5.1062445640563965, | |
| "learning_rate": 0.00012842823745571588, | |
| "logits/chosen": -1.2632169723510742, | |
| "logits/rejected": -1.285363793373108, | |
| "logps/chosen": -3.2440667152404785, | |
| "logps/rejected": -129.44454956054688, | |
| "loss": 0.20233389735221863, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12110748142004013, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5933730006217957, | |
| "rewards/margins": 11.818197250366211, | |
| "rewards/rejected": -11.224824905395508, | |
| "step": 694, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.314300928939116, | |
| "grad_norm": 4.967945098876953, | |
| "learning_rate": 0.00012822791145914643, | |
| "logits/chosen": -1.3190865516662598, | |
| "logits/rejected": -1.322510838508606, | |
| "logps/chosen": -6.946662425994873, | |
| "logps/rejected": -99.20793151855469, | |
| "loss": 0.22520855069160461, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20360182225704193, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4464600384235382, | |
| "rewards/margins": 8.819591522216797, | |
| "rewards/rejected": -8.37313175201416, | |
| "step": 695, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3161943080291107, | |
| "grad_norm": 0.7528690695762634, | |
| "learning_rate": 0.00012802746229889563, | |
| "logits/chosen": -1.2697570323944092, | |
| "logits/rejected": -1.2890403270721436, | |
| "logps/chosen": -4.18599796295166, | |
| "logps/rejected": -116.47010040283203, | |
| "loss": 0.12717163562774658, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12329236418008804, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39391693472862244, | |
| "rewards/margins": 10.161079406738281, | |
| "rewards/rejected": -9.767163276672363, | |
| "step": 696, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3180876871191054, | |
| "grad_norm": 4.968014240264893, | |
| "learning_rate": 0.00012782689084956078, | |
| "logits/chosen": -1.3118584156036377, | |
| "logits/rejected": -1.320459008216858, | |
| "logps/chosen": -5.031144142150879, | |
| "logps/rejected": -111.54464721679688, | |
| "loss": 0.27862486243247986, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.15949955582618713, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4624725878238678, | |
| "rewards/margins": 9.712789535522461, | |
| "rewards/rejected": -9.250316619873047, | |
| "step": 697, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3199810662091, | |
| "grad_norm": 2.0111641883850098, | |
| "learning_rate": 0.00012762619798627282, | |
| "logits/chosen": -1.2476155757904053, | |
| "logits/rejected": -1.260296106338501, | |
| "logps/chosen": -4.611104965209961, | |
| "logps/rejected": -103.76033020019531, | |
| "loss": 0.17496375739574432, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16747039556503296, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5656296014785767, | |
| "rewards/margins": 8.926993370056152, | |
| "rewards/rejected": -8.361364364624023, | |
| "step": 698, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3218744452990947, | |
| "grad_norm": 0.7398191094398499, | |
| "learning_rate": 0.00012742538458469246, | |
| "logits/chosen": -1.2478125095367432, | |
| "logits/rejected": -1.2548859119415283, | |
| "logps/chosen": -3.8168303966522217, | |
| "logps/rejected": -97.06517791748047, | |
| "loss": 0.14771857857704163, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1390731930732727, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5594909191131592, | |
| "rewards/margins": 8.748406410217285, | |
| "rewards/rejected": -8.188915252685547, | |
| "step": 699, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3237678243890894, | |
| "grad_norm": 0.8066232800483704, | |
| "learning_rate": 0.00012722445152100624, | |
| "logits/chosen": -1.2417348623275757, | |
| "logits/rejected": -1.2570741176605225, | |
| "logps/chosen": -2.389744997024536, | |
| "logps/rejected": -86.6338882446289, | |
| "loss": 0.16380390524864197, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12720054388046265, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.570247232913971, | |
| "rewards/margins": 7.321161270141602, | |
| "rewards/rejected": -6.750914096832275, | |
| "step": 700, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.325661203479084, | |
| "grad_norm": 1.1527165174484253, | |
| "learning_rate": 0.00012702339967192292, | |
| "logits/chosen": -1.2916889190673828, | |
| "logits/rejected": -1.3003627061843872, | |
| "logps/chosen": -3.0451269149780273, | |
| "logps/rejected": -91.65868377685547, | |
| "loss": 0.1978881061077118, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16753852367401123, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5230326056480408, | |
| "rewards/margins": 8.209744453430176, | |
| "rewards/rejected": -7.686711311340332, | |
| "step": 701, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3275545825690789, | |
| "grad_norm": 1.0912978649139404, | |
| "learning_rate": 0.00012682222991466948, | |
| "logits/chosen": -1.2573422193527222, | |
| "logits/rejected": -1.2747260332107544, | |
| "logps/chosen": -2.7481446266174316, | |
| "logps/rejected": -103.978515625, | |
| "loss": 0.14063449203968048, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13063806295394897, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.47163817286491394, | |
| "rewards/margins": 8.745121002197266, | |
| "rewards/rejected": -8.273482322692871, | |
| "step": 702, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3294479616590733, | |
| "grad_norm": 22.729263305664062, | |
| "learning_rate": 0.00012662094312698735, | |
| "logits/chosen": -1.2921996116638184, | |
| "logits/rejected": -1.2991044521331787, | |
| "logps/chosen": -5.945530414581299, | |
| "logps/rejected": -76.7307357788086, | |
| "loss": 0.2982117533683777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.27566850185394287, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3026009798049927, | |
| "rewards/margins": 6.646614074707031, | |
| "rewards/rejected": -6.344013214111328, | |
| "step": 703, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3313413407490682, | |
| "grad_norm": 0.9101666212081909, | |
| "learning_rate": 0.00012641954018712863, | |
| "logits/chosen": -1.2816362380981445, | |
| "logits/rejected": -1.306016445159912, | |
| "logps/chosen": -2.3992016315460205, | |
| "logps/rejected": -104.89875030517578, | |
| "loss": 0.21880419552326202, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17376631498336792, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5566422939300537, | |
| "rewards/margins": 8.900392532348633, | |
| "rewards/rejected": -8.34375, | |
| "step": 704, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3332347198390628, | |
| "grad_norm": 0.7675183415412903, | |
| "learning_rate": 0.00012621802197385212, | |
| "logits/chosen": -1.2347376346588135, | |
| "logits/rejected": -1.2482961416244507, | |
| "logps/chosen": -3.8751392364501953, | |
| "logps/rejected": -100.11812591552734, | |
| "loss": 0.1806536465883255, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1367262303829193, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.564403772354126, | |
| "rewards/margins": 8.214317321777344, | |
| "rewards/rejected": -7.649913787841797, | |
| "step": 705, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3351280989290575, | |
| "grad_norm": 0.995285153388977, | |
| "learning_rate": 0.00012601638936641976, | |
| "logits/chosen": -1.270362138748169, | |
| "logits/rejected": -1.2847920656204224, | |
| "logps/chosen": -3.295135021209717, | |
| "logps/rejected": -82.77586364746094, | |
| "loss": 0.19705501198768616, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1198456883430481, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.49801748991012573, | |
| "rewards/margins": 7.20506477355957, | |
| "rewards/rejected": -6.707046985626221, | |
| "step": 706, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3370214780190521, | |
| "grad_norm": 1.0535005331039429, | |
| "learning_rate": 0.0001258146432445924, | |
| "logits/chosen": -1.3396191596984863, | |
| "logits/rejected": -1.356287956237793, | |
| "logps/chosen": -3.8445959091186523, | |
| "logps/rejected": -90.25233459472656, | |
| "loss": 0.2341512143611908, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1896001696586609, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.495680570602417, | |
| "rewards/margins": 7.917792320251465, | |
| "rewards/rejected": -7.422112464904785, | |
| "step": 707, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3389148571090468, | |
| "grad_norm": 1.5458048582077026, | |
| "learning_rate": 0.00012561278448862634, | |
| "logits/chosen": -1.3336971998214722, | |
| "logits/rejected": -1.3589318990707397, | |
| "logps/chosen": -1.9345256090164185, | |
| "logps/rejected": -104.30036163330078, | |
| "loss": 0.1311199814081192, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.10932604968547821, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5588750243186951, | |
| "rewards/margins": 9.301870346069336, | |
| "rewards/rejected": -8.742996215820312, | |
| "step": 708, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3408082361990414, | |
| "grad_norm": 0.8339555263519287, | |
| "learning_rate": 0.00012541081397926925, | |
| "logits/chosen": -1.3096569776535034, | |
| "logits/rejected": -1.3302487134933472, | |
| "logps/chosen": -3.6992669105529785, | |
| "logps/rejected": -118.5272216796875, | |
| "loss": 0.14296677708625793, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12727825343608856, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6764388680458069, | |
| "rewards/margins": 10.035237312316895, | |
| "rewards/rejected": -9.358798027038574, | |
| "step": 709, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.342701615289036, | |
| "grad_norm": 15.578758239746094, | |
| "learning_rate": 0.00012520873259775636, | |
| "logits/chosen": -1.37481689453125, | |
| "logits/rejected": -1.3919589519500732, | |
| "logps/chosen": -3.958169460296631, | |
| "logps/rejected": -109.35943603515625, | |
| "loss": 0.4203401207923889, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34680628776550293, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18485558032989502, | |
| "rewards/margins": 9.556227684020996, | |
| "rewards/rejected": -9.37137222290039, | |
| "step": 710, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.344594994379031, | |
| "grad_norm": 0.9837526679039001, | |
| "learning_rate": 0.00012500654122580675, | |
| "logits/chosen": -1.4348475933074951, | |
| "logits/rejected": -1.456255316734314, | |
| "logps/chosen": -1.9943851232528687, | |
| "logps/rejected": -137.81805419921875, | |
| "loss": 0.09225192666053772, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.07782280445098877, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44493988156318665, | |
| "rewards/margins": 12.162233352661133, | |
| "rewards/rejected": -11.717293739318848, | |
| "step": 711, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3464883734690254, | |
| "grad_norm": 2.581824779510498, | |
| "learning_rate": 0.00012480424074561933, | |
| "logits/chosen": -1.3822526931762695, | |
| "logits/rejected": -1.4020648002624512, | |
| "logps/chosen": -4.550716400146484, | |
| "logps/rejected": -103.86782836914062, | |
| "loss": 0.28442901372909546, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24876733124256134, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4810265600681305, | |
| "rewards/margins": 9.237351417541504, | |
| "rewards/rejected": -8.756324768066406, | |
| "step": 712, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3483817525590203, | |
| "grad_norm": 2.6685738563537598, | |
| "learning_rate": 0.00012460183203986917, | |
| "logits/chosen": -1.4334018230438232, | |
| "logits/rejected": -1.4540126323699951, | |
| "logps/chosen": -5.17223596572876, | |
| "logps/rejected": -127.40531158447266, | |
| "loss": 0.24820397794246674, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21534302830696106, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.533196747303009, | |
| "rewards/margins": 11.388389587402344, | |
| "rewards/rejected": -10.855192184448242, | |
| "step": 713, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.350275131649015, | |
| "grad_norm": 3.6330223083496094, | |
| "learning_rate": 0.00012439931599170342, | |
| "logits/chosen": -1.3965675830841064, | |
| "logits/rejected": -1.4132789373397827, | |
| "logps/chosen": -5.910233020782471, | |
| "logps/rejected": -115.43537902832031, | |
| "loss": 0.22887299954891205, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2144639939069748, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4336181581020355, | |
| "rewards/margins": 10.194890022277832, | |
| "rewards/rejected": -9.761272430419922, | |
| "step": 714, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3521685107390096, | |
| "grad_norm": 1.252068042755127, | |
| "learning_rate": 0.0001241966934847377, | |
| "logits/chosen": -1.4876632690429688, | |
| "logits/rejected": -1.5106892585754395, | |
| "logps/chosen": -4.912591934204102, | |
| "logps/rejected": -130.63931274414062, | |
| "loss": 0.2556398808956146, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19699408113956451, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.49190080165863037, | |
| "rewards/margins": 11.174872398376465, | |
| "rewards/rejected": -10.682971954345703, | |
| "step": 715, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3540618898290042, | |
| "grad_norm": 0.47095194458961487, | |
| "learning_rate": 0.00012399396540305205, | |
| "logits/chosen": -1.5109764337539673, | |
| "logits/rejected": -1.5408351421356201, | |
| "logps/chosen": -1.663557767868042, | |
| "logps/rejected": -182.84844970703125, | |
| "loss": 0.08118365705013275, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.07808937877416611, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.562421441078186, | |
| "rewards/margins": 16.441465377807617, | |
| "rewards/rejected": -15.879043579101562, | |
| "step": 716, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3559552689189989, | |
| "grad_norm": 2.3887813091278076, | |
| "learning_rate": 0.00012379113263118717, | |
| "logits/chosen": -1.5092129707336426, | |
| "logits/rejected": -1.5265885591506958, | |
| "logps/chosen": -4.671719551086426, | |
| "logps/rejected": -130.737548828125, | |
| "loss": 0.3565371334552765, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3507789671421051, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38416343927383423, | |
| "rewards/margins": 11.713521003723145, | |
| "rewards/rejected": -11.32935619354248, | |
| "step": 717, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3578486480089935, | |
| "grad_norm": 13.596844673156738, | |
| "learning_rate": 0.0001235881960541405, | |
| "logits/chosen": -1.4459404945373535, | |
| "logits/rejected": -1.4728071689605713, | |
| "logps/chosen": -3.910332679748535, | |
| "logps/rejected": -169.46316528320312, | |
| "loss": 0.21092525124549866, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19290146231651306, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5652647018432617, | |
| "rewards/margins": 15.016708374023438, | |
| "rewards/rejected": -14.451443672180176, | |
| "step": 718, | |
| "train_speed(iter/s)": 0.005583 | |
| }, | |
| { | |
| "epoch": 1.3597420270989882, | |
| "grad_norm": 1.977660894393921, | |
| "learning_rate": 0.0001233851565573626, | |
| "logits/chosen": -1.4575848579406738, | |
| "logits/rejected": -1.4886194467544556, | |
| "logps/chosen": -3.429673671722412, | |
| "logps/rejected": -176.4278106689453, | |
| "loss": 0.21111251413822174, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20513850450515747, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4268459379673004, | |
| "rewards/margins": 16.01671600341797, | |
| "rewards/rejected": -15.589868545532227, | |
| "step": 719, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3616354061889828, | |
| "grad_norm": 0.8643395304679871, | |
| "learning_rate": 0.00012318201502675285, | |
| "logits/chosen": -1.4632608890533447, | |
| "logits/rejected": -1.496609091758728, | |
| "logps/chosen": -2.374844551086426, | |
| "logps/rejected": -159.74131774902344, | |
| "loss": 0.14827243983745575, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11705812066793442, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.46328988671302795, | |
| "rewards/margins": 13.929129600524902, | |
| "rewards/rejected": -13.465839385986328, | |
| "step": 720, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3635287852789775, | |
| "grad_norm": 0.8877068161964417, | |
| "learning_rate": 0.00012297877234865588, | |
| "logits/chosen": -1.4121975898742676, | |
| "logits/rejected": -1.420471429824829, | |
| "logps/chosen": -7.728551864624023, | |
| "logps/rejected": -122.19908905029297, | |
| "loss": 0.2621362805366516, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2564736008644104, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8202823400497437, | |
| "rewards/margins": 10.843989372253418, | |
| "rewards/rejected": -10.02370548248291, | |
| "step": 721, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3654221643689723, | |
| "grad_norm": 0.8817264437675476, | |
| "learning_rate": 0.00012277542940985779, | |
| "logits/chosen": -1.4238308668136597, | |
| "logits/rejected": -1.4451203346252441, | |
| "logps/chosen": -4.689065456390381, | |
| "logps/rejected": -126.12505340576172, | |
| "loss": 0.20782385766506195, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19612634181976318, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6051958799362183, | |
| "rewards/margins": 11.33012580871582, | |
| "rewards/rejected": -10.724929809570312, | |
| "step": 722, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.367315543458967, | |
| "grad_norm": 1.012028455734253, | |
| "learning_rate": 0.00012257198709758195, | |
| "logits/chosen": -1.430659532546997, | |
| "logits/rejected": -1.455889105796814, | |
| "logps/chosen": -2.4323935508728027, | |
| "logps/rejected": -160.52789306640625, | |
| "loss": 0.15415363013744354, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12620654702186584, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5517710447311401, | |
| "rewards/margins": 14.274921417236328, | |
| "rewards/rejected": -13.723150253295898, | |
| "step": 723, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3692089225489616, | |
| "grad_norm": 1.9171146154403687, | |
| "learning_rate": 0.00012236844629948538, | |
| "logits/chosen": -1.3615983724594116, | |
| "logits/rejected": -1.3914395570755005, | |
| "logps/chosen": -5.449278831481934, | |
| "logps/rejected": -129.47451782226562, | |
| "loss": 0.2664668560028076, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2412000298500061, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.679523229598999, | |
| "rewards/margins": 11.65814208984375, | |
| "rewards/rejected": -10.978619575500488, | |
| "step": 724, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3711023016389563, | |
| "grad_norm": 0.5200458765029907, | |
| "learning_rate": 0.00012216480790365488, | |
| "logits/chosen": -1.3722385168075562, | |
| "logits/rejected": -1.4049911499023438, | |
| "logps/chosen": -3.476780891418457, | |
| "logps/rejected": -159.24119567871094, | |
| "loss": 0.19099539518356323, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16211548447608948, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41306477785110474, | |
| "rewards/margins": 14.28917121887207, | |
| "rewards/rejected": -13.876106262207031, | |
| "step": 725, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.372995680728951, | |
| "grad_norm": 3.351590156555176, | |
| "learning_rate": 0.00012196107279860301, | |
| "logits/chosen": -1.3456298112869263, | |
| "logits/rejected": -1.3633019924163818, | |
| "logps/chosen": -5.894962310791016, | |
| "logps/rejected": -127.60720825195312, | |
| "loss": 0.497927188873291, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45556724071502686, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2950041890144348, | |
| "rewards/margins": 10.873826026916504, | |
| "rewards/rejected": -10.578822135925293, | |
| "step": 726, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3748890598189456, | |
| "grad_norm": 0.7161403894424438, | |
| "learning_rate": 0.00012175724187326428, | |
| "logits/chosen": -1.351697325706482, | |
| "logits/rejected": -1.3736845254898071, | |
| "logps/chosen": -3.959686517715454, | |
| "logps/rejected": -154.29759216308594, | |
| "loss": 0.19538988173007965, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1853979378938675, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5529553294181824, | |
| "rewards/margins": 13.636305809020996, | |
| "rewards/rejected": -13.083351135253906, | |
| "step": 727, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3767824389089403, | |
| "grad_norm": 1.0838693380355835, | |
| "learning_rate": 0.00012155331601699136, | |
| "logits/chosen": -1.3614987134933472, | |
| "logits/rejected": -1.3678171634674072, | |
| "logps/chosen": -11.347692489624023, | |
| "logps/rejected": -108.63534545898438, | |
| "loss": 0.3933212459087372, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35364362597465515, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7163238525390625, | |
| "rewards/margins": 9.661209106445312, | |
| "rewards/rejected": -8.94488525390625, | |
| "step": 728, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.378675817998935, | |
| "grad_norm": 0.7250790596008301, | |
| "learning_rate": 0.00012134929611955109, | |
| "logits/chosen": -1.360811471939087, | |
| "logits/rejected": -1.3907039165496826, | |
| "logps/chosen": -2.4135990142822266, | |
| "logps/rejected": -160.8827667236328, | |
| "loss": 0.1475839763879776, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11929626762866974, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49388089776039124, | |
| "rewards/margins": 13.924455642700195, | |
| "rewards/rejected": -13.430574417114258, | |
| "step": 729, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3805691970889296, | |
| "grad_norm": 1.2542954683303833, | |
| "learning_rate": 0.00012114518307112053, | |
| "logits/chosen": -1.3999381065368652, | |
| "logits/rejected": -1.4196140766143799, | |
| "logps/chosen": -2.968822479248047, | |
| "logps/rejected": -147.8498077392578, | |
| "loss": 0.1501389890909195, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13163243234157562, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.47122716903686523, | |
| "rewards/margins": 13.5759859085083, | |
| "rewards/rejected": -13.104759216308594, | |
| "step": 730, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3824625761789244, | |
| "grad_norm": 0.6328426003456116, | |
| "learning_rate": 0.00012094097776228335, | |
| "logits/chosen": -1.3374364376068115, | |
| "logits/rejected": -1.3639745712280273, | |
| "logps/chosen": -3.418973445892334, | |
| "logps/rejected": -139.9619903564453, | |
| "loss": 0.149828240275383, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.11651848256587982, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.544003963470459, | |
| "rewards/margins": 12.12524700164795, | |
| "rewards/rejected": -11.581243515014648, | |
| "step": 731, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.384355955268919, | |
| "grad_norm": 0.8515809178352356, | |
| "learning_rate": 0.00012073668108402565, | |
| "logits/chosen": -1.404557704925537, | |
| "logits/rejected": -1.4227296113967896, | |
| "logps/chosen": -5.3266801834106445, | |
| "logps/rejected": -127.69633483886719, | |
| "loss": 0.23115482926368713, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16876675188541412, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5588371753692627, | |
| "rewards/margins": 11.65122127532959, | |
| "rewards/rejected": -11.092384338378906, | |
| "step": 732, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3862493343589137, | |
| "grad_norm": 1.035111904144287, | |
| "learning_rate": 0.0001205322939277322, | |
| "logits/chosen": -1.3675159215927124, | |
| "logits/rejected": -1.377406358718872, | |
| "logps/chosen": -7.57385778427124, | |
| "logps/rejected": -113.66754150390625, | |
| "loss": 0.5253475904464722, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5173190832138062, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6031939387321472, | |
| "rewards/margins": 10.4005708694458, | |
| "rewards/rejected": -9.79737663269043, | |
| "step": 733, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3881427134489084, | |
| "grad_norm": 0.7137688398361206, | |
| "learning_rate": 0.00012032781718518257, | |
| "logits/chosen": -1.400411605834961, | |
| "logits/rejected": -1.4152530431747437, | |
| "logps/chosen": -7.439002990722656, | |
| "logps/rejected": -134.11846923828125, | |
| "loss": 0.17674262821674347, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1659688949584961, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8982738256454468, | |
| "rewards/margins": 12.587785720825195, | |
| "rewards/rejected": -11.689512252807617, | |
| "step": 734, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.390036092538903, | |
| "grad_norm": 1.0638463497161865, | |
| "learning_rate": 0.00012012325174854724, | |
| "logits/chosen": -1.381399393081665, | |
| "logits/rejected": -1.417229413986206, | |
| "logps/chosen": -4.133545398712158, | |
| "logps/rejected": -165.7884979248047, | |
| "loss": 0.1909055858850479, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1588495373725891, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3287806212902069, | |
| "rewards/margins": 13.795286178588867, | |
| "rewards/rejected": -13.46650505065918, | |
| "step": 735, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3919294716288977, | |
| "grad_norm": 3.916788339614868, | |
| "learning_rate": 0.0001199185985103836, | |
| "logits/chosen": -1.3574695587158203, | |
| "logits/rejected": -1.3903796672821045, | |
| "logps/chosen": -4.943059921264648, | |
| "logps/rejected": -145.6674041748047, | |
| "loss": 0.3422682583332062, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30081629753112793, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.46855008602142334, | |
| "rewards/margins": 12.823249816894531, | |
| "rewards/rejected": -12.35469913482666, | |
| "step": 736, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3938228507188923, | |
| "grad_norm": 0.7496212720870972, | |
| "learning_rate": 0.00011971385836363223, | |
| "logits/chosen": -1.3401854038238525, | |
| "logits/rejected": -1.3637409210205078, | |
| "logps/chosen": -3.160003662109375, | |
| "logps/rejected": -148.8011016845703, | |
| "loss": 0.13967886567115784, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1187189519405365, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6559804677963257, | |
| "rewards/margins": 13.016501426696777, | |
| "rewards/rejected": -12.360520362854004, | |
| "step": 737, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.395716229808887, | |
| "grad_norm": 0.8836220502853394, | |
| "learning_rate": 0.00011950903220161285, | |
| "logits/chosen": -1.2783434391021729, | |
| "logits/rejected": -1.291855812072754, | |
| "logps/chosen": -5.08381462097168, | |
| "logps/rejected": -125.47669982910156, | |
| "loss": 0.23457510769367218, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22920887172222137, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.725649356842041, | |
| "rewards/margins": 11.28402328491211, | |
| "rewards/rejected": -10.558374404907227, | |
| "step": 738, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3976096088988816, | |
| "grad_norm": 0.9596480131149292, | |
| "learning_rate": 0.00011930412091802044, | |
| "logits/chosen": -1.23847234249115, | |
| "logits/rejected": -1.2562484741210938, | |
| "logps/chosen": -6.178463935852051, | |
| "logps/rejected": -124.13822174072266, | |
| "loss": 0.2189672887325287, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21428486704826355, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5073556303977966, | |
| "rewards/margins": 11.04176139831543, | |
| "rewards/rejected": -10.534406661987305, | |
| "step": 739, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.3995029879888765, | |
| "grad_norm": 1.186428189277649, | |
| "learning_rate": 0.00011909912540692148, | |
| "logits/chosen": -1.2327266931533813, | |
| "logits/rejected": -1.2502973079681396, | |
| "logps/chosen": -3.5932505130767822, | |
| "logps/rejected": -124.90965270996094, | |
| "loss": 0.2263035923242569, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.17550766468048096, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.47944796085357666, | |
| "rewards/margins": 11.442840576171875, | |
| "rewards/rejected": -10.963393211364746, | |
| "step": 740, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.401396367078871, | |
| "grad_norm": 0.9400050640106201, | |
| "learning_rate": 0.00011889404656274985, | |
| "logits/chosen": -1.2746970653533936, | |
| "logits/rejected": -1.301072359085083, | |
| "logps/chosen": -4.578012943267822, | |
| "logps/rejected": -143.21412658691406, | |
| "loss": 0.14633478224277496, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.14389167726039886, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4045856297016144, | |
| "rewards/margins": 12.573046684265137, | |
| "rewards/rejected": -12.168460845947266, | |
| "step": 741, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.4032897461688658, | |
| "grad_norm": 12.828886032104492, | |
| "learning_rate": 0.00011868888528030312, | |
| "logits/chosen": -1.290102481842041, | |
| "logits/rejected": -1.3054649829864502, | |
| "logps/chosen": -7.718609809875488, | |
| "logps/rejected": -142.0688934326172, | |
| "loss": 1.2448090314865112, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6703987121582031, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.06796294450759888, | |
| "rewards/margins": 12.493032455444336, | |
| "rewards/rejected": -12.560995101928711, | |
| "step": 742, | |
| "train_speed(iter/s)": 0.005584 | |
| }, | |
| { | |
| "epoch": 1.4051831252588605, | |
| "grad_norm": 2.3734612464904785, | |
| "learning_rate": 0.00011848364245473851, | |
| "logits/chosen": -1.277733325958252, | |
| "logits/rejected": -1.2968937158584595, | |
| "logps/chosen": -5.408899784088135, | |
| "logps/rejected": -135.39718627929688, | |
| "loss": 0.4479808509349823, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.44413915276527405, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3601748049259186, | |
| "rewards/margins": 11.691971778869629, | |
| "rewards/rejected": -11.331796646118164, | |
| "step": 743, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.4070765043488551, | |
| "grad_norm": 0.9128540754318237, | |
| "learning_rate": 0.00011827831898156905, | |
| "logits/chosen": -1.227461814880371, | |
| "logits/rejected": -1.2495135068893433, | |
| "logps/chosen": -1.9151227474212646, | |
| "logps/rejected": -136.8602752685547, | |
| "loss": 0.14868707954883575, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12404179573059082, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5372089147567749, | |
| "rewards/margins": 12.386828422546387, | |
| "rewards/rejected": -11.849618911743164, | |
| "step": 744, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.4089698834388498, | |
| "grad_norm": 1.1429063081741333, | |
| "learning_rate": 0.0001180729157566596, | |
| "logits/chosen": -1.2368712425231934, | |
| "logits/rejected": -1.2416596412658691, | |
| "logps/chosen": -4.958278179168701, | |
| "logps/rejected": -103.30583190917969, | |
| "loss": 0.21024346351623535, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1912650763988495, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3631391227245331, | |
| "rewards/margins": 9.275796890258789, | |
| "rewards/rejected": -8.912657737731934, | |
| "step": 745, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.4108632625288444, | |
| "grad_norm": 1.0790748596191406, | |
| "learning_rate": 0.00011786743367622301, | |
| "logits/chosen": -1.1736490726470947, | |
| "logits/rejected": -1.1861443519592285, | |
| "logps/chosen": -2.616354465484619, | |
| "logps/rejected": -102.14070129394531, | |
| "loss": 0.19070766866207123, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1813308298587799, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3258036971092224, | |
| "rewards/margins": 8.927370071411133, | |
| "rewards/rejected": -8.601566314697266, | |
| "step": 746, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.412756641618839, | |
| "grad_norm": 0.5030332803726196, | |
| "learning_rate": 0.00011766187363681622, | |
| "logits/chosen": -1.1803619861602783, | |
| "logits/rejected": -1.1944257020950317, | |
| "logps/chosen": -4.902136325836182, | |
| "logps/rejected": -123.20097351074219, | |
| "loss": 0.14166034758090973, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.13693617284297943, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4183957576751709, | |
| "rewards/margins": 10.870806694030762, | |
| "rewards/rejected": -10.452409744262695, | |
| "step": 747, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.4146500207088337, | |
| "grad_norm": 15.55799388885498, | |
| "learning_rate": 0.00011745623653533633, | |
| "logits/chosen": -1.242021083831787, | |
| "logits/rejected": -1.266333818435669, | |
| "logps/chosen": -4.228762149810791, | |
| "logps/rejected": -99.54964447021484, | |
| "loss": 0.4001218378543854, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31423306465148926, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.49108681082725525, | |
| "rewards/margins": 8.478590965270996, | |
| "rewards/rejected": -7.987504959106445, | |
| "step": 748, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.4165433997988286, | |
| "grad_norm": 0.9360311627388, | |
| "learning_rate": 0.00011725052326901662, | |
| "logits/chosen": -1.2178735733032227, | |
| "logits/rejected": -1.2292119264602661, | |
| "logps/chosen": -5.197657585144043, | |
| "logps/rejected": -93.74435424804688, | |
| "loss": 0.22836686670780182, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18862150609493256, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4481957256793976, | |
| "rewards/margins": 8.137001037597656, | |
| "rewards/rejected": -7.688804626464844, | |
| "step": 749, | |
| "train_speed(iter/s)": 0.005585 | |
| }, | |
| { | |
| "epoch": 1.418436778888823, | |
| "grad_norm": 0.9867538809776306, | |
| "learning_rate": 0.0001170447347354227, | |
| "logits/chosen": -1.2246237993240356, | |
| "logits/rejected": -1.2385095357894897, | |
| "logps/chosen": -2.0182390213012695, | |
| "logps/rejected": -94.68486022949219, | |
| "loss": 0.13907429575920105, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.12384593486785889, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5055228471755981, | |
| "rewards/margins": 8.253795623779297, | |
| "rewards/rejected": -7.7482733726501465, | |
| "step": 750, | |
| "train_speed(iter/s)": 0.005585 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1584, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.260421268267598e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |