Instructions to use cragtmp/2gt5-100 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/2gt5-100 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/2gt5-100") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.18933790899946748, | |
| "eval_steps": 300, | |
| "global_step": 100, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0018933790899946748, | |
| "grad_norm": 12.48285961151123, | |
| "learning_rate": 2.5e-06, | |
| "logits/chosen": -0.600911557674408, | |
| "logits/rejected": -0.6057144403457642, | |
| "logps/chosen": -8.623997688293457, | |
| "logps/rejected": -21.27922248840332, | |
| "loss": 1.5083240270614624, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8151768445968628, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005677 | |
| }, | |
| { | |
| "epoch": 0.0037867581799893497, | |
| "grad_norm": 12.232138633728027, | |
| "learning_rate": 5e-06, | |
| "logits/chosen": -0.6421620845794678, | |
| "logits/rejected": -0.6454498767852783, | |
| "logps/chosen": -10.60006046295166, | |
| "logps/rejected": -13.605328559875488, | |
| "loss": 1.547582983970642, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.8544361591339111, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005654 | |
| }, | |
| { | |
| "epoch": 0.005680137269984025, | |
| "grad_norm": 14.417566299438477, | |
| "learning_rate": 7.5e-06, | |
| "logits/chosen": -0.664191484451294, | |
| "logits/rejected": -0.6654082536697388, | |
| "logps/chosen": -11.958788871765137, | |
| "logps/rejected": -13.785713195800781, | |
| "loss": 1.6179333925247192, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.9271513819694519, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.003109893761575222, | |
| "rewards/margins": 0.0048811971209943295, | |
| "rewards/rejected": -0.0017713033594191074, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.007573516359978699, | |
| "grad_norm": 8.840044975280762, | |
| "learning_rate": 1e-05, | |
| "logits/chosen": -0.6362882256507874, | |
| "logits/rejected": -0.6385632753372192, | |
| "logps/chosen": -9.689570426940918, | |
| "logps/rejected": -18.226909637451172, | |
| "loss": 1.4001612663269043, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7101836204528809, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.005959533154964447, | |
| "rewards/margins": 0.00653040548786521, | |
| "rewards/rejected": -0.0005708730313926935, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005654 | |
| }, | |
| { | |
| "epoch": 0.009466895449973374, | |
| "grad_norm": 12.643730163574219, | |
| "learning_rate": 1.25e-05, | |
| "logits/chosen": -0.6108935475349426, | |
| "logits/rejected": -0.6125737428665161, | |
| "logps/chosen": -10.900370597839355, | |
| "logps/rejected": -16.267436981201172, | |
| "loss": 1.5408352613449097, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.853638768196106, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.018230972811579704, | |
| "rewards/margins": 0.01212537381798029, | |
| "rewards/rejected": 0.006105600390583277, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005633 | |
| }, | |
| { | |
| "epoch": 0.01136027453996805, | |
| "grad_norm": 13.595820426940918, | |
| "learning_rate": 1.5e-05, | |
| "logits/chosen": -0.6641858220100403, | |
| "logits/rejected": -0.6705058217048645, | |
| "logps/chosen": -7.528585910797119, | |
| "logps/rejected": -18.073911666870117, | |
| "loss": 1.4404857158660889, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7598920464515686, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.034823305904865265, | |
| "rewards/margins": 0.026311496272683144, | |
| "rewards/rejected": 0.008511810563504696, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005634 | |
| }, | |
| { | |
| "epoch": 0.013253653629962723, | |
| "grad_norm": 13.2615385055542, | |
| "learning_rate": 1.75e-05, | |
| "logits/chosen": -0.6327687501907349, | |
| "logits/rejected": -0.637922465801239, | |
| "logps/chosen": -8.100177764892578, | |
| "logps/rejected": -22.4697322845459, | |
| "loss": 1.310943603515625, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6429428458213806, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07164613902568817, | |
| "rewards/margins": 0.053715869784355164, | |
| "rewards/rejected": 0.017930276691913605, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005641 | |
| }, | |
| { | |
| "epoch": 0.015147032719957399, | |
| "grad_norm": 9.518823623657227, | |
| "learning_rate": 2e-05, | |
| "logits/chosen": -0.6458379626274109, | |
| "logits/rejected": -0.6480465531349182, | |
| "logps/chosen": -8.227258682250977, | |
| "logps/rejected": -15.074575424194336, | |
| "loss": 1.2895722389221191, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6121883392333984, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.11458335816860199, | |
| "rewards/margins": 0.04461951553821564, | |
| "rewards/rejected": 0.06996384263038635, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005657 | |
| }, | |
| { | |
| "epoch": 0.017040411809952073, | |
| "grad_norm": 5.971006393432617, | |
| "learning_rate": 2.25e-05, | |
| "logits/chosen": -0.6322387456893921, | |
| "logits/rejected": -0.6355814933776855, | |
| "logps/chosen": -6.8561859130859375, | |
| "logps/rejected": -16.394319534301758, | |
| "loss": 1.1358637809753418, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4396786093711853, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.126601442694664, | |
| "rewards/margins": 0.027468431740999222, | |
| "rewards/rejected": 0.09913301467895508, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005656 | |
| }, | |
| { | |
| "epoch": 0.018933790899946748, | |
| "grad_norm": 4.615151405334473, | |
| "learning_rate": 2.5e-05, | |
| "logits/chosen": -0.6353996992111206, | |
| "logits/rejected": -0.6420772075653076, | |
| "logps/chosen": -4.39181661605835, | |
| "logps/rejected": -19.73300552368164, | |
| "loss": 0.98687344789505, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38576164841651917, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.196926087141037, | |
| "rewards/margins": 0.274502158164978, | |
| "rewards/rejected": -0.07757607102394104, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005651 | |
| }, | |
| { | |
| "epoch": 0.020827169989941424, | |
| "grad_norm": 3.6985604763031006, | |
| "learning_rate": 2.7500000000000004e-05, | |
| "logits/chosen": -0.6321280002593994, | |
| "logits/rejected": -0.6365548968315125, | |
| "logps/chosen": -7.2246904373168945, | |
| "logps/rejected": -19.404216766357422, | |
| "loss": 0.9879567623138428, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36671119928359985, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.12358222156763077, | |
| "rewards/margins": 0.28244268894195557, | |
| "rewards/rejected": -0.1588604599237442, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005662 | |
| }, | |
| { | |
| "epoch": 0.0227205490799361, | |
| "grad_norm": 7.83486270904541, | |
| "learning_rate": 3e-05, | |
| "logits/chosen": -0.6391905546188354, | |
| "logits/rejected": -0.6451292634010315, | |
| "logps/chosen": -8.3941011428833, | |
| "logps/rejected": -24.687467575073242, | |
| "loss": 1.1386761665344238, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3862188458442688, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.004531089216470718, | |
| "rewards/margins": 0.17587248980998993, | |
| "rewards/rejected": -0.18040357530117035, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005646 | |
| }, | |
| { | |
| "epoch": 0.024613928169930775, | |
| "grad_norm": 5.917618274688721, | |
| "learning_rate": 3.2500000000000004e-05, | |
| "logits/chosen": -0.6517987251281738, | |
| "logits/rejected": -0.658316969871521, | |
| "logps/chosen": -6.573670387268066, | |
| "logps/rejected": -19.874000549316406, | |
| "loss": 1.050663948059082, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.40407559275627136, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.10255793482065201, | |
| "rewards/margins": 0.36497071385383606, | |
| "rewards/rejected": -0.26241275668144226, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.00565 | |
| }, | |
| { | |
| "epoch": 0.026507307259925447, | |
| "grad_norm": 4.1237287521362305, | |
| "learning_rate": 3.5e-05, | |
| "logits/chosen": -0.61805260181427, | |
| "logits/rejected": -0.6224305033683777, | |
| "logps/chosen": -5.8840789794921875, | |
| "logps/rejected": -29.290557861328125, | |
| "loss": 0.9034114480018616, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.33107179403305054, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.13439905643463135, | |
| "rewards/margins": 0.5032773017883301, | |
| "rewards/rejected": -0.36887818574905396, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005633 | |
| }, | |
| { | |
| "epoch": 0.028400686349920122, | |
| "grad_norm": 2.141984701156616, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "logits/chosen": -0.6251233816146851, | |
| "logits/rejected": -0.6291872262954712, | |
| "logps/chosen": -5.3556623458862305, | |
| "logps/rejected": -22.30205535888672, | |
| "loss": 0.7756511569023132, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22363990545272827, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21060410141944885, | |
| "rewards/margins": 0.5203964710235596, | |
| "rewards/rejected": -0.30979233980178833, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005622 | |
| }, | |
| { | |
| "epoch": 0.030294065439914798, | |
| "grad_norm": 6.157620906829834, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.6184762716293335, | |
| "logits/rejected": -0.6184364557266235, | |
| "logps/chosen": -10.368714332580566, | |
| "logps/rejected": -12.033210754394531, | |
| "loss": 1.4029701948165894, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6103286743164062, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.020060203969478607, | |
| "rewards/margins": -0.03359239548444748, | |
| "rewards/rejected": 0.013532169163227081, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.03218744452990947, | |
| "grad_norm": 2.690070152282715, | |
| "learning_rate": 4.25e-05, | |
| "logits/chosen": -0.6329092383384705, | |
| "logits/rejected": -0.6367439031600952, | |
| "logps/chosen": -6.010343551635742, | |
| "logps/rejected": -17.85470199584961, | |
| "loss": 0.8949607610702515, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3054018020629883, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.25051170587539673, | |
| "rewards/margins": 0.37515202164649963, | |
| "rewards/rejected": -0.12464030832052231, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.00562 | |
| }, | |
| { | |
| "epoch": 0.034080823619904145, | |
| "grad_norm": 2.8276467323303223, | |
| "learning_rate": 4.5e-05, | |
| "logits/chosen": -0.6264123320579529, | |
| "logits/rejected": -0.6279273629188538, | |
| "logps/chosen": -9.41238021850586, | |
| "logps/rejected": -18.639442443847656, | |
| "loss": 1.0180559158325195, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3220836818218231, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.1841900646686554, | |
| "rewards/margins": 0.13813874125480652, | |
| "rewards/rejected": 0.04605132341384888, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.035974202709898824, | |
| "grad_norm": 2.10530161857605, | |
| "learning_rate": 4.75e-05, | |
| "logits/chosen": -0.6376557946205139, | |
| "logits/rejected": -0.6416239738464355, | |
| "logps/chosen": -5.7143964767456055, | |
| "logps/rejected": -16.784849166870117, | |
| "loss": 0.9154303669929504, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2545720934867859, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.24181872606277466, | |
| "rewards/margins": 0.18784700334072113, | |
| "rewards/rejected": 0.05397173762321472, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.00562 | |
| }, | |
| { | |
| "epoch": 0.037867581799893496, | |
| "grad_norm": 2.357306480407715, | |
| "learning_rate": 5e-05, | |
| "logits/chosen": -0.6326904296875, | |
| "logits/rejected": -0.6354666352272034, | |
| "logps/chosen": -5.867492198944092, | |
| "logps/rejected": -13.818038940429688, | |
| "loss": 0.9468417167663574, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3124926686286926, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.3217320740222931, | |
| "rewards/margins": 0.22124268114566803, | |
| "rewards/rejected": 0.10048942267894745, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005628 | |
| }, | |
| { | |
| "epoch": 0.039760960889888175, | |
| "grad_norm": 2.5859196186065674, | |
| "learning_rate": 5.25e-05, | |
| "logits/chosen": -0.6597320437431335, | |
| "logits/rejected": -0.6610896587371826, | |
| "logps/chosen": -7.943680286407471, | |
| "logps/rejected": -11.634421348571777, | |
| "loss": 1.0064345598220825, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3732220232486725, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.3646732270717621, | |
| "rewards/margins": 0.21462492644786835, | |
| "rewards/rejected": 0.15004827082157135, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.04165433997988285, | |
| "grad_norm": 2.20487642288208, | |
| "learning_rate": 5.500000000000001e-05, | |
| "logits/chosen": -0.6439244151115417, | |
| "logits/rejected": -0.6464219093322754, | |
| "logps/chosen": -4.180229187011719, | |
| "logps/rejected": -19.56499481201172, | |
| "loss": 0.9136227369308472, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22558730840682983, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.25369688868522644, | |
| "rewards/margins": 0.14792592823505402, | |
| "rewards/rejected": 0.10577096790075302, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.00562 | |
| }, | |
| { | |
| "epoch": 0.04354771906987752, | |
| "grad_norm": 2.80965518951416, | |
| "learning_rate": 5.7499999999999995e-05, | |
| "logits/chosen": -0.5748096108436584, | |
| "logits/rejected": -0.5799225568771362, | |
| "logps/chosen": -5.921882629394531, | |
| "logps/rejected": -22.432538986206055, | |
| "loss": 0.9860997796058655, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3462521731853485, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.24639810621738434, | |
| "rewards/margins": 0.1898707151412964, | |
| "rewards/rejected": 0.05652741342782974, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005621 | |
| }, | |
| { | |
| "epoch": 0.0454410981598722, | |
| "grad_norm": 2.9503355026245117, | |
| "learning_rate": 6e-05, | |
| "logits/chosen": -0.6007645726203918, | |
| "logits/rejected": -0.6086101531982422, | |
| "logps/chosen": -5.338952541351318, | |
| "logps/rejected": -26.883895874023438, | |
| "loss": 0.9453619122505188, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3667706847190857, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.392182856798172, | |
| "rewards/margins": 0.36902523040771484, | |
| "rewards/rejected": 0.02315761335194111, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.04733447724986687, | |
| "grad_norm": 2.2843515872955322, | |
| "learning_rate": 6.25e-05, | |
| "logits/chosen": -0.6047165393829346, | |
| "logits/rejected": -0.608917772769928, | |
| "logps/chosen": -6.276377201080322, | |
| "logps/rejected": -21.095470428466797, | |
| "loss": 0.914051353931427, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3292374610900879, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.3036147356033325, | |
| "rewards/margins": 0.32923099398612976, | |
| "rewards/rejected": -0.025616232305765152, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.04922785633986155, | |
| "grad_norm": 2.7294957637786865, | |
| "learning_rate": 6.500000000000001e-05, | |
| "logits/chosen": -0.6337023377418518, | |
| "logits/rejected": -0.6374361515045166, | |
| "logps/chosen": -7.032902240753174, | |
| "logps/rejected": -24.937816619873047, | |
| "loss": 0.8451516032218933, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.25359871983528137, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.24989479780197144, | |
| "rewards/margins": 0.3727536201477051, | |
| "rewards/rejected": -0.12285882234573364, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.05112123542985622, | |
| "grad_norm": 1.9816867113113403, | |
| "learning_rate": 6.750000000000001e-05, | |
| "logits/chosen": -0.6674913167953491, | |
| "logits/rejected": -0.6716790795326233, | |
| "logps/chosen": -3.894029378890991, | |
| "logps/rejected": -19.461292266845703, | |
| "loss": 0.720669686794281, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.1943943053483963, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.40334552526474, | |
| "rewards/margins": 0.5223954319953918, | |
| "rewards/rejected": -0.11904986202716827, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.05301461451985089, | |
| "grad_norm": 1.9561638832092285, | |
| "learning_rate": 7e-05, | |
| "logits/chosen": -0.6560395359992981, | |
| "logits/rejected": -0.6615370512008667, | |
| "logps/chosen": -3.828300952911377, | |
| "logps/rejected": -27.646583557128906, | |
| "loss": 0.7324035167694092, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18986308574676514, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2855417728424072, | |
| "rewards/margins": 0.5658388733863831, | |
| "rewards/rejected": -0.28029707074165344, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.05490799360984557, | |
| "grad_norm": 2.197960376739502, | |
| "learning_rate": 7.25e-05, | |
| "logits/chosen": -0.6013461351394653, | |
| "logits/rejected": -0.6078683733940125, | |
| "logps/chosen": -5.841001987457275, | |
| "logps/rejected": -28.59882926940918, | |
| "loss": 0.763361930847168, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29682645201683044, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.33854252099990845, | |
| "rewards/margins": 0.7552333474159241, | |
| "rewards/rejected": -0.416690856218338, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005603 | |
| }, | |
| { | |
| "epoch": 0.056801372699840244, | |
| "grad_norm": 4.102924823760986, | |
| "learning_rate": 7.500000000000001e-05, | |
| "logits/chosen": -0.6362655758857727, | |
| "logits/rejected": -0.6371059417724609, | |
| "logps/chosen": -6.047646522521973, | |
| "logps/rejected": -16.402286529541016, | |
| "loss": 0.930861234664917, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.33219844102859497, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2280413955450058, | |
| "rewards/margins": 0.48401153087615967, | |
| "rewards/rejected": -0.25597015023231506, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005604 | |
| }, | |
| { | |
| "epoch": 0.05869475178983492, | |
| "grad_norm": 2.643806219100952, | |
| "learning_rate": 7.75e-05, | |
| "logits/chosen": -0.6917952299118042, | |
| "logits/rejected": -0.6954830884933472, | |
| "logps/chosen": -4.5008368492126465, | |
| "logps/rejected": -25.313228607177734, | |
| "loss": 0.7698233127593994, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.21702390909194946, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2267376184463501, | |
| "rewards/margins": 0.6824056506156921, | |
| "rewards/rejected": -0.4556680917739868, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005603 | |
| }, | |
| { | |
| "epoch": 0.060588130879829595, | |
| "grad_norm": 3.9089903831481934, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.6848002672195435, | |
| "logits/rejected": -0.6877056360244751, | |
| "logps/chosen": -9.047338485717773, | |
| "logps/rejected": -25.891061782836914, | |
| "loss": 0.9844011068344116, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3213033378124237, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.13390681147575378, | |
| "rewards/margins": 0.6111294031143188, | |
| "rewards/rejected": -0.4772225618362427, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005603 | |
| }, | |
| { | |
| "epoch": 0.062481509969824274, | |
| "grad_norm": 3.631053924560547, | |
| "learning_rate": 8.25e-05, | |
| "logits/chosen": -0.6787916421890259, | |
| "logits/rejected": -0.681725025177002, | |
| "logps/chosen": -11.23558521270752, | |
| "logps/rejected": -24.226280212402344, | |
| "loss": 1.1201726198196411, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5571246147155762, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2192046195268631, | |
| "rewards/margins": 0.6016167402267456, | |
| "rewards/rejected": -0.3824121356010437, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.06437488905981895, | |
| "grad_norm": 2.667919158935547, | |
| "learning_rate": 8.5e-05, | |
| "logits/chosen": -0.7005462646484375, | |
| "logits/rejected": -0.7055037021636963, | |
| "logps/chosen": -3.1784541606903076, | |
| "logps/rejected": -23.535545349121094, | |
| "loss": 0.638558566570282, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23515944182872772, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.27606871724128723, | |
| "rewards/margins": 1.0784178972244263, | |
| "rewards/rejected": -0.8023491501808167, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.06626826814981363, | |
| "grad_norm": 4.037520408630371, | |
| "learning_rate": 8.75e-05, | |
| "logits/chosen": -0.7001099586486816, | |
| "logits/rejected": -0.7051636576652527, | |
| "logps/chosen": -6.665594577789307, | |
| "logps/rejected": -30.973716735839844, | |
| "loss": 0.848934531211853, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38612014055252075, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15037909150123596, | |
| "rewards/margins": 1.0571930408477783, | |
| "rewards/rejected": -0.9068138599395752, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.06816164723980829, | |
| "grad_norm": 3.6542232036590576, | |
| "learning_rate": 9e-05, | |
| "logits/chosen": -0.7070563435554504, | |
| "logits/rejected": -0.7053466439247131, | |
| "logps/chosen": -5.064585208892822, | |
| "logps/rejected": -19.19178581237793, | |
| "loss": 0.7724434733390808, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26881077885627747, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2176203727722168, | |
| "rewards/margins": 0.7342812418937683, | |
| "rewards/rejected": -0.5166608095169067, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.07005502632980297, | |
| "grad_norm": 3.4213714599609375, | |
| "learning_rate": 9.250000000000001e-05, | |
| "logits/chosen": -0.7090893387794495, | |
| "logits/rejected": -0.7106159329414368, | |
| "logps/chosen": -10.25515365600586, | |
| "logps/rejected": -24.033281326293945, | |
| "loss": 0.9920384883880615, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.46471139788627625, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0965394526720047, | |
| "rewards/margins": 0.8922154307365417, | |
| "rewards/rejected": -0.7956759929656982, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.07194840541979765, | |
| "grad_norm": 5.325904846191406, | |
| "learning_rate": 9.5e-05, | |
| "logits/chosen": -0.657074511051178, | |
| "logits/rejected": -0.6611977815628052, | |
| "logps/chosen": -11.612046241760254, | |
| "logps/rejected": -27.249744415283203, | |
| "loss": 0.8334037065505981, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3489510715007782, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.12560953199863434, | |
| "rewards/margins": 0.9447187781333923, | |
| "rewards/rejected": -0.819109320640564, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005622 | |
| }, | |
| { | |
| "epoch": 0.07384178450979231, | |
| "grad_norm": 2.9407873153686523, | |
| "learning_rate": 9.75e-05, | |
| "logits/chosen": -0.7148993611335754, | |
| "logits/rejected": -0.7166731357574463, | |
| "logps/chosen": -7.349883079528809, | |
| "logps/rejected": -25.866724014282227, | |
| "loss": 0.7971550822257996, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3317265808582306, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1786963939666748, | |
| "rewards/margins": 0.9361187815666199, | |
| "rewards/rejected": -0.7574224472045898, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005621 | |
| }, | |
| { | |
| "epoch": 0.07573516359978699, | |
| "grad_norm": 7.271725654602051, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.6494594216346741, | |
| "logits/rejected": -0.6519922018051147, | |
| "logps/chosen": -10.921842575073242, | |
| "logps/rejected": -26.213640213012695, | |
| "loss": 1.3029272556304932, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7071102261543274, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04726380109786987, | |
| "rewards/margins": 0.7260035276412964, | |
| "rewards/rejected": -0.6787396669387817, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005622 | |
| }, | |
| { | |
| "epoch": 0.07762854268978167, | |
| "grad_norm": 2.3149876594543457, | |
| "learning_rate": 0.0001025, | |
| "logits/chosen": -0.6998907327651978, | |
| "logits/rejected": -0.7039870023727417, | |
| "logps/chosen": -4.173505783081055, | |
| "logps/rejected": -23.617250442504883, | |
| "loss": 0.5567827224731445, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22731299698352814, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3785739839076996, | |
| "rewards/margins": 1.2282123565673828, | |
| "rewards/rejected": -0.8496384620666504, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.07952192177977635, | |
| "grad_norm": 2.81628155708313, | |
| "learning_rate": 0.000105, | |
| "logits/chosen": -0.7065268754959106, | |
| "logits/rejected": -0.7109476923942566, | |
| "logps/chosen": -7.945868492126465, | |
| "logps/rejected": -28.209381103515625, | |
| "loss": 0.9143926501274109, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45929795503616333, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.14874038100242615, | |
| "rewards/margins": 0.9704731702804565, | |
| "rewards/rejected": -0.8217328786849976, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005624 | |
| }, | |
| { | |
| "epoch": 0.08141530086977102, | |
| "grad_norm": 5.763336658477783, | |
| "learning_rate": 0.0001075, | |
| "logits/chosen": -0.6870285868644714, | |
| "logits/rejected": -0.6968757510185242, | |
| "logps/chosen": -5.37760066986084, | |
| "logps/rejected": -30.209644317626953, | |
| "loss": 1.0033479928970337, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.5952383279800415, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.25675737857818604, | |
| "rewards/margins": 1.0465596914291382, | |
| "rewards/rejected": -0.7898023128509521, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005627 | |
| }, | |
| { | |
| "epoch": 0.0833086799597657, | |
| "grad_norm": 5.945868015289307, | |
| "learning_rate": 0.00011000000000000002, | |
| "logits/chosen": -0.6680281758308411, | |
| "logits/rejected": -0.6685014963150024, | |
| "logps/chosen": -11.777937889099121, | |
| "logps/rejected": -14.195478439331055, | |
| "loss": 1.2500255107879639, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6744679808616638, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2654823362827301, | |
| "rewards/margins": 0.44828659296035767, | |
| "rewards/rejected": -0.18280424177646637, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005626 | |
| }, | |
| { | |
| "epoch": 0.08520205904976037, | |
| "grad_norm": 3.6887738704681396, | |
| "learning_rate": 0.00011250000000000001, | |
| "logits/chosen": -0.6420993804931641, | |
| "logits/rejected": -0.649295449256897, | |
| "logps/chosen": -5.845967769622803, | |
| "logps/rejected": -29.958538055419922, | |
| "loss": 0.8367453217506409, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.40336742997169495, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.25286757946014404, | |
| "rewards/margins": 0.9195659160614014, | |
| "rewards/rejected": -0.6666983962059021, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005627 | |
| }, | |
| { | |
| "epoch": 0.08709543813975504, | |
| "grad_norm": 2.1550676822662354, | |
| "learning_rate": 0.00011499999999999999, | |
| "logits/chosen": -0.6583084464073181, | |
| "logits/rejected": -0.6640565395355225, | |
| "logps/chosen": -2.7918519973754883, | |
| "logps/rejected": -30.053329467773438, | |
| "loss": 0.6384420394897461, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16433243453502655, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.33078277111053467, | |
| "rewards/margins": 0.8035537004470825, | |
| "rewards/rejected": -0.4727708697319031, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005628 | |
| }, | |
| { | |
| "epoch": 0.08898881722974972, | |
| "grad_norm": 1.9267369508743286, | |
| "learning_rate": 0.00011750000000000001, | |
| "logits/chosen": -0.6443086266517639, | |
| "logits/rejected": -0.6484851837158203, | |
| "logps/chosen": -6.4907331466674805, | |
| "logps/rejected": -26.10548973083496, | |
| "loss": 0.8166890740394592, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2826446294784546, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.33410829305648804, | |
| "rewards/margins": 0.7130259275436401, | |
| "rewards/rejected": -0.3789176642894745, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005627 | |
| }, | |
| { | |
| "epoch": 0.0908821963197444, | |
| "grad_norm": 2.238929510116577, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.6500992774963379, | |
| "logits/rejected": -0.6550747156143188, | |
| "logps/chosen": -6.974908351898193, | |
| "logps/rejected": -25.759687423706055, | |
| "loss": 0.8363897800445557, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.26740241050720215, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.2779407501220703, | |
| "rewards/margins": 0.71395343542099, | |
| "rewards/rejected": -0.43601274490356445, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.09277557540973908, | |
| "grad_norm": 2.5497782230377197, | |
| "learning_rate": 0.00012250000000000002, | |
| "logits/chosen": -0.676102876663208, | |
| "logits/rejected": -0.676883339881897, | |
| "logps/chosen": -6.410519599914551, | |
| "logps/rejected": -17.417396545410156, | |
| "loss": 0.9155470728874207, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3170667886734009, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.24874374270439148, | |
| "rewards/margins": 0.6556647419929504, | |
| "rewards/rejected": -0.40692102909088135, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.09466895449973374, | |
| "grad_norm": 2.275879144668579, | |
| "learning_rate": 0.000125, | |
| "logits/chosen": -0.6682412028312683, | |
| "logits/rejected": -0.6694232225418091, | |
| "logps/chosen": -7.84281587600708, | |
| "logps/rejected": -18.11672019958496, | |
| "loss": 0.8602735996246338, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.342671662569046, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.16426895558834076, | |
| "rewards/margins": 0.6373977065086365, | |
| "rewards/rejected": -0.47312870621681213, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.005623 | |
| }, | |
| { | |
| "epoch": 0.09656233358972842, | |
| "grad_norm": 2.448835611343384, | |
| "learning_rate": 0.0001275, | |
| "logits/chosen": -0.7030003070831299, | |
| "logits/rejected": -0.702628493309021, | |
| "logps/chosen": -7.209776401519775, | |
| "logps/rejected": -24.76384162902832, | |
| "loss": 0.7324039340019226, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22679060697555542, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2451048642396927, | |
| "rewards/margins": 0.9410224556922913, | |
| "rewards/rejected": -0.695917546749115, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.0984557126797231, | |
| "grad_norm": 2.4740657806396484, | |
| "learning_rate": 0.00013000000000000002, | |
| "logits/chosen": -0.7383002042770386, | |
| "logits/rejected": -0.7460674047470093, | |
| "logps/chosen": -4.4354424476623535, | |
| "logps/rejected": -26.271957397460938, | |
| "loss": 0.738042414188385, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30589190125465393, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.35504794120788574, | |
| "rewards/margins": 1.1514215469360352, | |
| "rewards/rejected": -0.7963736057281494, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.10034909176971776, | |
| "grad_norm": 3.1427273750305176, | |
| "learning_rate": 0.0001325, | |
| "logits/chosen": -0.7910199165344238, | |
| "logits/rejected": -0.7956037521362305, | |
| "logps/chosen": -5.2786359786987305, | |
| "logps/rejected": -27.01905632019043, | |
| "loss": 0.7005700469017029, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2977657616138458, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.32858696579933167, | |
| "rewards/margins": 1.1505931615829468, | |
| "rewards/rejected": -0.8220062255859375, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.10224247085971244, | |
| "grad_norm": 2.710829973220825, | |
| "learning_rate": 0.00013500000000000003, | |
| "logits/chosen": -0.7300952672958374, | |
| "logits/rejected": -0.7392382621765137, | |
| "logps/chosen": -4.204522132873535, | |
| "logps/rejected": -35.52387237548828, | |
| "loss": 0.5068414211273193, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18188302218914032, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3228433430194855, | |
| "rewards/margins": 1.5467703342437744, | |
| "rewards/rejected": -1.2239267826080322, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.10413584994970712, | |
| "grad_norm": 2.6672115325927734, | |
| "learning_rate": 0.0001375, | |
| "logits/chosen": -0.7622752785682678, | |
| "logits/rejected": -0.7692346572875977, | |
| "logps/chosen": -5.656646728515625, | |
| "logps/rejected": -36.99287033081055, | |
| "loss": 0.6165193319320679, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2455344796180725, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21251262724399567, | |
| "rewards/margins": 1.7865149974822998, | |
| "rewards/rejected": -1.5740022659301758, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.10602922903970179, | |
| "grad_norm": 7.261322975158691, | |
| "learning_rate": 0.00014, | |
| "logits/chosen": -0.8227823376655579, | |
| "logits/rejected": -0.8353255391120911, | |
| "logps/chosen": -7.420350551605225, | |
| "logps/rejected": -42.59074401855469, | |
| "loss": 0.8744301199913025, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.49042099714279175, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.23873600363731384, | |
| "rewards/margins": 2.152242422103882, | |
| "rewards/rejected": -1.9135063886642456, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.10792260812969647, | |
| "grad_norm": 3.6271088123321533, | |
| "learning_rate": 0.00014250000000000002, | |
| "logits/chosen": -0.8145865201950073, | |
| "logits/rejected": -0.8213882446289062, | |
| "logps/chosen": -4.568179130554199, | |
| "logps/rejected": -37.50999450683594, | |
| "loss": 0.6209616661071777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29730865359306335, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.26820147037506104, | |
| "rewards/margins": 2.114492893218994, | |
| "rewards/rejected": -1.8462913036346436, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.10981598721969114, | |
| "grad_norm": 3.6261045932769775, | |
| "learning_rate": 0.000145, | |
| "logits/chosen": -0.7670393586158752, | |
| "logits/rejected": -0.7794223427772522, | |
| "logps/chosen": -8.460503578186035, | |
| "logps/rejected": -43.186954498291016, | |
| "loss": 0.6528911590576172, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30593881011009216, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.28572511672973633, | |
| "rewards/margins": 2.0398354530334473, | |
| "rewards/rejected": -1.75411057472229, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.11170936630968582, | |
| "grad_norm": 2.79728364944458, | |
| "learning_rate": 0.0001475, | |
| "logits/chosen": -0.8239770531654358, | |
| "logits/rejected": -0.8207590579986572, | |
| "logps/chosen": -12.058256149291992, | |
| "logps/rejected": -25.070674896240234, | |
| "loss": 0.8349239230155945, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4342367947101593, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2961112856864929, | |
| "rewards/margins": 1.2313449382781982, | |
| "rewards/rejected": -0.9352336525917053, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.11360274539968049, | |
| "grad_norm": 3.0574796199798584, | |
| "learning_rate": 0.00015000000000000001, | |
| "logits/chosen": -0.810753345489502, | |
| "logits/rejected": -0.8193599581718445, | |
| "logps/chosen": -5.105385780334473, | |
| "logps/rejected": -29.203344345092773, | |
| "loss": 0.6070073843002319, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.24924401938915253, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.5035626292228699, | |
| "rewards/margins": 1.4562283754348755, | |
| "rewards/rejected": -0.9526655077934265, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005609 | |
| }, | |
| { | |
| "epoch": 0.11549612448967517, | |
| "grad_norm": 5.350250720977783, | |
| "learning_rate": 0.0001525, | |
| "logits/chosen": -0.815939724445343, | |
| "logits/rejected": -0.826446533203125, | |
| "logps/chosen": -2.3785085678100586, | |
| "logps/rejected": -34.224422454833984, | |
| "loss": 0.7174049019813538, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.38427019119262695, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.4009089469909668, | |
| "rewards/margins": 1.891708254814148, | |
| "rewards/rejected": -1.4907994270324707, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005608 | |
| }, | |
| { | |
| "epoch": 0.11738950357966985, | |
| "grad_norm": 2.239091157913208, | |
| "learning_rate": 0.000155, | |
| "logits/chosen": -0.8229139447212219, | |
| "logits/rejected": -0.8320141434669495, | |
| "logps/chosen": -4.586618900299072, | |
| "logps/rejected": -32.01433181762695, | |
| "loss": 0.6079644560813904, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.20739667117595673, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26031073927879333, | |
| "rewards/margins": 1.4821346998214722, | |
| "rewards/rejected": -1.2218239307403564, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.11928288266966451, | |
| "grad_norm": 4.1209940910339355, | |
| "learning_rate": 0.0001575, | |
| "logits/chosen": -0.8513484597206116, | |
| "logits/rejected": -0.8552687168121338, | |
| "logps/chosen": -9.33289909362793, | |
| "logps/rejected": -29.56768226623535, | |
| "loss": 1.0120337009429932, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4378553628921509, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.14417365193367004, | |
| "rewards/margins": 1.3170634508132935, | |
| "rewards/rejected": -1.1728898286819458, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.12117626175965919, | |
| "grad_norm": 4.230152606964111, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.7943696975708008, | |
| "logits/rejected": -0.8050058484077454, | |
| "logps/chosen": -6.4711594581604, | |
| "logps/rejected": -42.82871627807617, | |
| "loss": 0.5924439430236816, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23330256342887878, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16898760199546814, | |
| "rewards/margins": 1.992952585220337, | |
| "rewards/rejected": -1.823965072631836, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.00561 | |
| }, | |
| { | |
| "epoch": 0.12306964084965387, | |
| "grad_norm": 2.351702928543091, | |
| "learning_rate": 0.00016250000000000002, | |
| "logits/chosen": -0.8158823251724243, | |
| "logits/rejected": -0.8219522833824158, | |
| "logps/chosen": -4.3665313720703125, | |
| "logps/rejected": -28.09051513671875, | |
| "loss": 0.7134827375411987, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22144050896167755, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.3041003942489624, | |
| "rewards/margins": 1.2433838844299316, | |
| "rewards/rejected": -0.9392834305763245, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.12496301993964855, | |
| "grad_norm": 3.1737756729125977, | |
| "learning_rate": 0.000165, | |
| "logits/chosen": -0.8072597980499268, | |
| "logits/rejected": -0.8171340823173523, | |
| "logps/chosen": -5.0343122482299805, | |
| "logps/rejected": -32.46968460083008, | |
| "loss": 0.63325434923172, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29483139514923096, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.29814648628234863, | |
| "rewards/margins": 1.4677376747131348, | |
| "rewards/rejected": -1.1695910692214966, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.1268563990296432, | |
| "grad_norm": 2.5199668407440186, | |
| "learning_rate": 0.0001675, | |
| "logits/chosen": -0.8106119632720947, | |
| "logits/rejected": -0.8191246390342712, | |
| "logps/chosen": -8.389342308044434, | |
| "logps/rejected": -36.18731689453125, | |
| "loss": 0.7148120403289795, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.31000831723213196, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2828730642795563, | |
| "rewards/margins": 1.7046067714691162, | |
| "rewards/rejected": -1.4217336177825928, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.1287497781196379, | |
| "grad_norm": 3.428029775619507, | |
| "learning_rate": 0.00017, | |
| "logits/chosen": -0.8391574621200562, | |
| "logits/rejected": -0.8546858429908752, | |
| "logps/chosen": -8.799811363220215, | |
| "logps/rejected": -37.64997863769531, | |
| "loss": 0.7224959135055542, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4090877175331116, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3909546434879303, | |
| "rewards/margins": 1.7023922204971313, | |
| "rewards/rejected": -1.3114374876022339, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.13064315720963257, | |
| "grad_norm": 3.7791826725006104, | |
| "learning_rate": 0.00017250000000000002, | |
| "logits/chosen": -0.8618558049201965, | |
| "logits/rejected": -0.86772221326828, | |
| "logps/chosen": -8.02017879486084, | |
| "logps/rejected": -28.318117141723633, | |
| "loss": 0.8481130003929138, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.32193318009376526, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.07287055253982544, | |
| "rewards/margins": 1.3111273050308228, | |
| "rewards/rejected": -1.2382566928863525, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.13253653629962725, | |
| "grad_norm": 3.5219051837921143, | |
| "learning_rate": 0.000175, | |
| "logits/chosen": -0.8731855154037476, | |
| "logits/rejected": -0.8781698346138, | |
| "logps/chosen": -8.205753326416016, | |
| "logps/rejected": -23.05510902404785, | |
| "loss": 0.9284813404083252, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4099024832248688, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.26493778824806213, | |
| "rewards/margins": 1.1318817138671875, | |
| "rewards/rejected": -0.866943895816803, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.13442991538962193, | |
| "grad_norm": 2.412374973297119, | |
| "learning_rate": 0.0001775, | |
| "logits/chosen": -0.8586634993553162, | |
| "logits/rejected": -0.8701040744781494, | |
| "logps/chosen": -3.7027158737182617, | |
| "logps/rejected": -42.672996520996094, | |
| "loss": 0.5218284130096436, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2169719785451889, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.371543824672699, | |
| "rewards/margins": 2.3614425659179688, | |
| "rewards/rejected": -1.989898920059204, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.13632329447961658, | |
| "grad_norm": 1.723345160484314, | |
| "learning_rate": 0.00018, | |
| "logits/chosen": -0.8107991814613342, | |
| "logits/rejected": -0.8227972388267517, | |
| "logps/chosen": -4.743021488189697, | |
| "logps/rejected": -38.795711517333984, | |
| "loss": 0.4607815742492676, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.18950311839580536, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.36083462834358215, | |
| "rewards/margins": 2.311211585998535, | |
| "rewards/rejected": -1.9503768682479858, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.13821667356961126, | |
| "grad_norm": 4.164133548736572, | |
| "learning_rate": 0.0001825, | |
| "logits/chosen": -0.9086084365844727, | |
| "logits/rejected": -0.9208739995956421, | |
| "logps/chosen": -13.34437084197998, | |
| "logps/rejected": -53.04572296142578, | |
| "loss": 0.6920671463012695, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.43207526206970215, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.031513512134552, | |
| "rewards/margins": 3.146587371826172, | |
| "rewards/rejected": -3.1150739192962646, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.14011005265960594, | |
| "grad_norm": 6.1999382972717285, | |
| "learning_rate": 0.00018500000000000002, | |
| "logits/chosen": -0.8234269618988037, | |
| "logits/rejected": -0.8303597569465637, | |
| "logps/chosen": -8.394856452941895, | |
| "logps/rejected": -41.975399017333984, | |
| "loss": 1.1737077236175537, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.7135495543479919, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.14376360177993774, | |
| "rewards/margins": 2.6206157207489014, | |
| "rewards/rejected": -2.4768521785736084, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.14200343174960062, | |
| "grad_norm": 6.218433856964111, | |
| "learning_rate": 0.0001875, | |
| "logits/chosen": -0.8009334802627563, | |
| "logits/rejected": -0.8051450848579407, | |
| "logps/chosen": -12.022541046142578, | |
| "logps/rejected": -38.48487091064453, | |
| "loss": 0.9869168400764465, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.45167890191078186, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.010723039507865906, | |
| "rewards/margins": 1.8775376081466675, | |
| "rewards/rejected": -1.8882607221603394, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.1438968108395953, | |
| "grad_norm": 1.9325371980667114, | |
| "learning_rate": 0.00019, | |
| "logits/chosen": -0.7815489768981934, | |
| "logits/rejected": -0.7896750569343567, | |
| "logps/chosen": -6.42656946182251, | |
| "logps/rejected": -33.38284683227539, | |
| "loss": 0.6605334281921387, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30029603838920593, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.31539270281791687, | |
| "rewards/margins": 1.6843116283416748, | |
| "rewards/rejected": -1.368919014930725, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.005619 | |
| }, | |
| { | |
| "epoch": 0.14579018992958998, | |
| "grad_norm": 5.768399238586426, | |
| "learning_rate": 0.00019250000000000002, | |
| "logits/chosen": -0.7157012820243835, | |
| "logits/rejected": -0.7218092679977417, | |
| "logps/chosen": -5.720545291900635, | |
| "logps/rejected": -32.14387512207031, | |
| "loss": 0.9388673901557922, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.49579885601997375, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2496451437473297, | |
| "rewards/margins": 1.3803541660308838, | |
| "rewards/rejected": -1.130708932876587, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005618 | |
| }, | |
| { | |
| "epoch": 0.14768356901958463, | |
| "grad_norm": 2.978989601135254, | |
| "learning_rate": 0.000195, | |
| "logits/chosen": -0.7398240566253662, | |
| "logits/rejected": -0.74552983045578, | |
| "logps/chosen": -6.459310054779053, | |
| "logps/rejected": -28.873746871948242, | |
| "loss": 0.6721470952033997, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2696229815483093, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.28077179193496704, | |
| "rewards/margins": 1.547407865524292, | |
| "rewards/rejected": -1.2666360139846802, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005617 | |
| }, | |
| { | |
| "epoch": 0.1495769481095793, | |
| "grad_norm": 2.109548568725586, | |
| "learning_rate": 0.00019750000000000003, | |
| "logits/chosen": -0.7017478942871094, | |
| "logits/rejected": -0.7096887826919556, | |
| "logps/chosen": -4.097768783569336, | |
| "logps/rejected": -31.799213409423828, | |
| "loss": 0.5941745042800903, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.19475214183330536, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.4046904742717743, | |
| "rewards/margins": 1.6549233198165894, | |
| "rewards/rejected": -1.2502328157424927, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.005616 | |
| }, | |
| { | |
| "epoch": 0.15147032719957398, | |
| "grad_norm": 3.9734411239624023, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.6862869262695312, | |
| "logits/rejected": -0.6942235827445984, | |
| "logps/chosen": -8.900280952453613, | |
| "logps/rejected": -41.978641510009766, | |
| "loss": 0.7803151607513428, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3115917146205902, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1415846347808838, | |
| "rewards/margins": 2.006580352783203, | |
| "rewards/rejected": -1.8649954795837402, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.15336370628956866, | |
| "grad_norm": 6.735928535461426, | |
| "learning_rate": 0.00019999978184060562, | |
| "logits/chosen": -0.7448083162307739, | |
| "logits/rejected": -0.7499798536300659, | |
| "logps/chosen": -5.58134126663208, | |
| "logps/rejected": -42.04484939575195, | |
| "loss": 0.9395004510879517, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.515042245388031, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.24552975594997406, | |
| "rewards/margins": 2.421520233154297, | |
| "rewards/rejected": -2.175990343093872, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.15525708537956334, | |
| "grad_norm": 4.143361568450928, | |
| "learning_rate": 0.00019999912736337437, | |
| "logits/chosen": -0.7276468873023987, | |
| "logits/rejected": -0.741879940032959, | |
| "logps/chosen": -3.295543670654297, | |
| "logps/rejected": -54.32012939453125, | |
| "loss": 0.660046398639679, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.42805707454681396, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2942177951335907, | |
| "rewards/margins": 3.302980661392212, | |
| "rewards/rejected": -3.008762836456299, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.15715046446955802, | |
| "grad_norm": 4.713730812072754, | |
| "learning_rate": 0.00019999803657116188, | |
| "logits/chosen": -0.7310099601745605, | |
| "logits/rejected": -0.7400019764900208, | |
| "logps/chosen": -6.529958248138428, | |
| "logps/rejected": -39.906105041503906, | |
| "loss": 0.7617413997650146, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.422638475894928, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2212720513343811, | |
| "rewards/margins": 2.413503885269165, | |
| "rewards/rejected": -2.1922316551208496, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.1590438435595527, | |
| "grad_norm": 4.658056735992432, | |
| "learning_rate": 0.00019999650946872738, | |
| "logits/chosen": -0.7134297490119934, | |
| "logits/rejected": -0.7193505764007568, | |
| "logps/chosen": -5.202678680419922, | |
| "logps/rejected": -33.255706787109375, | |
| "loss": 0.6914293766021729, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.2725370526313782, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.29689377546310425, | |
| "rewards/margins": 1.9401971101760864, | |
| "rewards/rejected": -1.6433032751083374, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.16093722264954735, | |
| "grad_norm": 2.288125991821289, | |
| "learning_rate": 0.00019999454606273404, | |
| "logits/chosen": -0.6521891951560974, | |
| "logits/rejected": -0.6597902774810791, | |
| "logps/chosen": -6.535229206085205, | |
| "logps/rejected": -33.92669677734375, | |
| "loss": 0.5946552157402039, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29953494668006897, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3503923714160919, | |
| "rewards/margins": 1.96759831905365, | |
| "rewards/rejected": -1.61720609664917, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.16283060173954203, | |
| "grad_norm": 6.193369388580322, | |
| "learning_rate": 0.00019999214636174845, | |
| "logits/chosen": -0.7137624025344849, | |
| "logits/rejected": -0.7180912494659424, | |
| "logps/chosen": -6.647699356079102, | |
| "logps/rejected": -31.25023078918457, | |
| "loss": 0.9301581382751465, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.46883538365364075, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.29692143201828003, | |
| "rewards/margins": 1.745566964149475, | |
| "rewards/rejected": -1.4486457109451294, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.1647239808295367, | |
| "grad_norm": 3.9115772247314453, | |
| "learning_rate": 0.00019998931037624104, | |
| "logits/chosen": -0.6435313820838928, | |
| "logits/rejected": -0.6480632424354553, | |
| "logps/chosen": -6.559725284576416, | |
| "logps/rejected": -34.3360481262207, | |
| "loss": 0.7339984178543091, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3988235890865326, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2545357048511505, | |
| "rewards/margins": 1.8583070039749146, | |
| "rewards/rejected": -1.603771448135376, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.1666173599195314, | |
| "grad_norm": 2.725975751876831, | |
| "learning_rate": 0.00019998603811858571, | |
| "logits/chosen": -0.6484612822532654, | |
| "logits/rejected": -0.6513442993164062, | |
| "logps/chosen": -5.939992427825928, | |
| "logps/rejected": -30.691526412963867, | |
| "loss": 0.6261233687400818, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.30717653036117554, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3799961507320404, | |
| "rewards/margins": 1.8060214519500732, | |
| "rewards/rejected": -1.426025390625, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.16851073900952607, | |
| "grad_norm": 3.1483325958251953, | |
| "learning_rate": 0.00019998232960305993, | |
| "logits/chosen": -0.640424907207489, | |
| "logits/rejected": -0.6445133090019226, | |
| "logps/chosen": -10.158927917480469, | |
| "logps/rejected": -31.649131774902344, | |
| "loss": 0.7713112235069275, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.4013857841491699, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2583284080028534, | |
| "rewards/margins": 1.7178279161453247, | |
| "rewards/rejected": -1.4594995975494385, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.005615 | |
| }, | |
| { | |
| "epoch": 0.17040411809952075, | |
| "grad_norm": 9.671393394470215, | |
| "learning_rate": 0.0001999781848458447, | |
| "logits/chosen": -0.6384307146072388, | |
| "logits/rejected": -0.6467083692550659, | |
| "logps/chosen": -5.6327433586120605, | |
| "logps/rejected": -33.724124908447266, | |
| "loss": 1.136250615119934, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.6182616353034973, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12717147171497345, | |
| "rewards/margins": 1.5072848796844482, | |
| "rewards/rejected": -1.3801133632659912, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.17229749718951543, | |
| "grad_norm": 3.9667158126831055, | |
| "learning_rate": 0.0001999736038650243, | |
| "logits/chosen": -0.6727519035339355, | |
| "logits/rejected": -0.678146243095398, | |
| "logps/chosen": -3.9062070846557617, | |
| "logps/rejected": -40.605716705322266, | |
| "loss": 0.5808683633804321, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.29070931673049927, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3750736713409424, | |
| "rewards/margins": 2.2590668201446533, | |
| "rewards/rejected": -1.883993148803711, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.17419087627951008, | |
| "grad_norm": 2.966646909713745, | |
| "learning_rate": 0.00019996858668058646, | |
| "logits/chosen": -0.6560570597648621, | |
| "logits/rejected": -0.6633113622665405, | |
| "logps/chosen": -6.821100234985352, | |
| "logps/rejected": -35.842308044433594, | |
| "loss": 0.5389344096183777, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.22853048145771027, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.33146628737449646, | |
| "rewards/margins": 2.221740484237671, | |
| "rewards/rejected": -1.8902742862701416, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.17608425536950476, | |
| "grad_norm": 4.352930068969727, | |
| "learning_rate": 0.0001999631333144221, | |
| "logits/chosen": -0.6744297742843628, | |
| "logits/rejected": -0.6817238926887512, | |
| "logps/chosen": -10.121214866638184, | |
| "logps/rejected": -45.07015609741211, | |
| "loss": 0.7165765166282654, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.36157098412513733, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3100533187389374, | |
| "rewards/margins": 2.3896117210388184, | |
| "rewards/rejected": -2.0795583724975586, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.17797763445949943, | |
| "grad_norm": 3.650033473968506, | |
| "learning_rate": 0.00019995724379032526, | |
| "logits/chosen": -0.6463199257850647, | |
| "logits/rejected": -0.6561610102653503, | |
| "logps/chosen": -5.5554704666137695, | |
| "logps/rejected": -39.192264556884766, | |
| "loss": 0.7099438309669495, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3186087906360626, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28469714522361755, | |
| "rewards/margins": 2.1725757122039795, | |
| "rewards/rejected": -1.887878656387329, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.1798710135494941, | |
| "grad_norm": 3.6392762660980225, | |
| "learning_rate": 0.00019995091813399305, | |
| "logits/chosen": -0.6218971014022827, | |
| "logits/rejected": -0.6236589550971985, | |
| "logps/chosen": -9.031105041503906, | |
| "logps/rejected": -29.54071044921875, | |
| "loss": 0.7348965406417847, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.35691019892692566, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3281153440475464, | |
| "rewards/margins": 1.6330987215042114, | |
| "rewards/rejected": -1.3049836158752441, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005611 | |
| }, | |
| { | |
| "epoch": 0.1817643926394888, | |
| "grad_norm": 4.513101100921631, | |
| "learning_rate": 0.00019994415637302547, | |
| "logits/chosen": -0.6518260836601257, | |
| "logits/rejected": -0.6591805815696716, | |
| "logps/chosen": -3.454824447631836, | |
| "logps/rejected": -40.539100646972656, | |
| "loss": 0.4428410232067108, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.16427120566368103, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.29650911688804626, | |
| "rewards/margins": 1.9197403192520142, | |
| "rewards/rejected": -1.623231053352356, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005612 | |
| }, | |
| { | |
| "epoch": 0.18365777172948347, | |
| "grad_norm": 3.081139087677002, | |
| "learning_rate": 0.00019993695853692537, | |
| "logits/chosen": -0.6301771402359009, | |
| "logits/rejected": -0.6361221671104431, | |
| "logps/chosen": -5.919186592102051, | |
| "logps/rejected": -33.726078033447266, | |
| "loss": 0.6770766377449036, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3173068165779114, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.288848340511322, | |
| "rewards/margins": 1.7297114133834839, | |
| "rewards/rejected": -1.4408631324768066, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005613 | |
| }, | |
| { | |
| "epoch": 0.18555115081947815, | |
| "grad_norm": 5.967331409454346, | |
| "learning_rate": 0.0001999293246570983, | |
| "logits/chosen": -0.6614546179771423, | |
| "logits/rejected": -0.6638529300689697, | |
| "logps/chosen": -6.57697057723999, | |
| "logps/rejected": -30.82279396057129, | |
| "loss": 0.6938097476959229, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.23730693757534027, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.24900805950164795, | |
| "rewards/margins": 1.5996767282485962, | |
| "rewards/rejected": -1.3506686687469482, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.1874445299094728, | |
| "grad_norm": 2.659550428390503, | |
| "learning_rate": 0.0001999212547668523, | |
| "logits/chosen": -0.6610513925552368, | |
| "logits/rejected": -0.6650281548500061, | |
| "logps/chosen": -7.570089817047119, | |
| "logps/rejected": -41.5615348815918, | |
| "loss": 0.521258533000946, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.34517771005630493, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28127947449684143, | |
| "rewards/margins": 2.645756244659424, | |
| "rewards/rejected": -2.3644769191741943, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005614 | |
| }, | |
| { | |
| "epoch": 0.18933790899946748, | |
| "grad_norm": 12.499390602111816, | |
| "learning_rate": 0.00019991274890139774, | |
| "logits/chosen": -0.5981582403182983, | |
| "logits/rejected": -0.5984249114990234, | |
| "logps/chosen": -5.772880554199219, | |
| "logps/rejected": -36.335723876953125, | |
| "loss": 0.5674217939376831, | |
| "memory(GiB)": 45.96, | |
| "nll_loss": 0.3134133517742157, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3456924557685852, | |
| "rewards/margins": 2.240718364715576, | |
| "rewards/rejected": -1.8950259685516357, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005613 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1584, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.025223996853453e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |