PEFT
Safetensors
2gt5-750 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
b2e175d verified
Raw
History Blame Contribute Delete
479 kB
{
"best_global_step": 600,
"best_metric": 0.30104092,
"best_model_checkpoint": "/data2/kdd/crag/cjz/output/task2_dpo_absgt0_taskgt5__pari0.3_no_cheat/v0-20250606-011515/checkpoint-600",
"epoch": 1.418436778888823,
"eval_steps": 300,
"global_step": 750,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0018933790899946748,
"grad_norm": 12.48285961151123,
"learning_rate": 2.5e-06,
"logits/chosen": -0.600911557674408,
"logits/rejected": -0.6057144403457642,
"logps/chosen": -8.623997688293457,
"logps/rejected": -21.27922248840332,
"loss": 1.5083240270614624,
"memory(GiB)": 45.96,
"nll_loss": 0.8151768445968628,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005677
},
{
"epoch": 0.0037867581799893497,
"grad_norm": 12.232138633728027,
"learning_rate": 5e-06,
"logits/chosen": -0.6421620845794678,
"logits/rejected": -0.6454498767852783,
"logps/chosen": -10.60006046295166,
"logps/rejected": -13.605328559875488,
"loss": 1.547582983970642,
"memory(GiB)": 45.96,
"nll_loss": 0.8544361591339111,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005654
},
{
"epoch": 0.005680137269984025,
"grad_norm": 14.417566299438477,
"learning_rate": 7.5e-06,
"logits/chosen": -0.664191484451294,
"logits/rejected": -0.6654082536697388,
"logps/chosen": -11.958788871765137,
"logps/rejected": -13.785713195800781,
"loss": 1.6179333925247192,
"memory(GiB)": 45.96,
"nll_loss": 0.9271513819694519,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.003109893761575222,
"rewards/margins": 0.0048811971209943295,
"rewards/rejected": -0.0017713033594191074,
"step": 3,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.007573516359978699,
"grad_norm": 8.840044975280762,
"learning_rate": 1e-05,
"logits/chosen": -0.6362882256507874,
"logits/rejected": -0.6385632753372192,
"logps/chosen": -9.689570426940918,
"logps/rejected": -18.226909637451172,
"loss": 1.4001612663269043,
"memory(GiB)": 45.96,
"nll_loss": 0.7101836204528809,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.005959533154964447,
"rewards/margins": 0.00653040548786521,
"rewards/rejected": -0.0005708730313926935,
"step": 4,
"train_speed(iter/s)": 0.005654
},
{
"epoch": 0.009466895449973374,
"grad_norm": 12.643730163574219,
"learning_rate": 1.25e-05,
"logits/chosen": -0.6108935475349426,
"logits/rejected": -0.6125737428665161,
"logps/chosen": -10.900370597839355,
"logps/rejected": -16.267436981201172,
"loss": 1.5408352613449097,
"memory(GiB)": 45.96,
"nll_loss": 0.853638768196106,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.018230972811579704,
"rewards/margins": 0.01212537381798029,
"rewards/rejected": 0.006105600390583277,
"step": 5,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.01136027453996805,
"grad_norm": 13.595820426940918,
"learning_rate": 1.5e-05,
"logits/chosen": -0.6641858220100403,
"logits/rejected": -0.6705058217048645,
"logps/chosen": -7.528585910797119,
"logps/rejected": -18.073911666870117,
"loss": 1.4404857158660889,
"memory(GiB)": 45.96,
"nll_loss": 0.7598920464515686,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.034823305904865265,
"rewards/margins": 0.026311496272683144,
"rewards/rejected": 0.008511810563504696,
"step": 6,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.013253653629962723,
"grad_norm": 13.2615385055542,
"learning_rate": 1.75e-05,
"logits/chosen": -0.6327687501907349,
"logits/rejected": -0.637922465801239,
"logps/chosen": -8.100177764892578,
"logps/rejected": -22.4697322845459,
"loss": 1.310943603515625,
"memory(GiB)": 45.96,
"nll_loss": 0.6429428458213806,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07164613902568817,
"rewards/margins": 0.053715869784355164,
"rewards/rejected": 0.017930276691913605,
"step": 7,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.015147032719957399,
"grad_norm": 9.518823623657227,
"learning_rate": 2e-05,
"logits/chosen": -0.6458379626274109,
"logits/rejected": -0.6480465531349182,
"logps/chosen": -8.227258682250977,
"logps/rejected": -15.074575424194336,
"loss": 1.2895722389221191,
"memory(GiB)": 45.96,
"nll_loss": 0.6121883392333984,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.11458335816860199,
"rewards/margins": 0.04461951553821564,
"rewards/rejected": 0.06996384263038635,
"step": 8,
"train_speed(iter/s)": 0.005657
},
{
"epoch": 0.017040411809952073,
"grad_norm": 5.971006393432617,
"learning_rate": 2.25e-05,
"logits/chosen": -0.6322387456893921,
"logits/rejected": -0.6355814933776855,
"logps/chosen": -6.8561859130859375,
"logps/rejected": -16.394319534301758,
"loss": 1.1358637809753418,
"memory(GiB)": 45.96,
"nll_loss": 0.4396786093711853,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.126601442694664,
"rewards/margins": 0.027468431740999222,
"rewards/rejected": 0.09913301467895508,
"step": 9,
"train_speed(iter/s)": 0.005656
},
{
"epoch": 0.018933790899946748,
"grad_norm": 4.615151405334473,
"learning_rate": 2.5e-05,
"logits/chosen": -0.6353996992111206,
"logits/rejected": -0.6420772075653076,
"logps/chosen": -4.39181661605835,
"logps/rejected": -19.73300552368164,
"loss": 0.98687344789505,
"memory(GiB)": 45.96,
"nll_loss": 0.38576164841651917,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.196926087141037,
"rewards/margins": 0.274502158164978,
"rewards/rejected": -0.07757607102394104,
"step": 10,
"train_speed(iter/s)": 0.005651
},
{
"epoch": 0.020827169989941424,
"grad_norm": 3.6985604763031006,
"learning_rate": 2.7500000000000004e-05,
"logits/chosen": -0.6321280002593994,
"logits/rejected": -0.6365548968315125,
"logps/chosen": -7.2246904373168945,
"logps/rejected": -19.404216766357422,
"loss": 0.9879567623138428,
"memory(GiB)": 45.96,
"nll_loss": 0.36671119928359985,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.12358222156763077,
"rewards/margins": 0.28244268894195557,
"rewards/rejected": -0.1588604599237442,
"step": 11,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 0.0227205490799361,
"grad_norm": 7.83486270904541,
"learning_rate": 3e-05,
"logits/chosen": -0.6391905546188354,
"logits/rejected": -0.6451292634010315,
"logps/chosen": -8.3941011428833,
"logps/rejected": -24.687467575073242,
"loss": 1.1386761665344238,
"memory(GiB)": 45.96,
"nll_loss": 0.3862188458442688,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.004531089216470718,
"rewards/margins": 0.17587248980998993,
"rewards/rejected": -0.18040357530117035,
"step": 12,
"train_speed(iter/s)": 0.005646
},
{
"epoch": 0.024613928169930775,
"grad_norm": 5.917618274688721,
"learning_rate": 3.2500000000000004e-05,
"logits/chosen": -0.6517987251281738,
"logits/rejected": -0.658316969871521,
"logps/chosen": -6.573670387268066,
"logps/rejected": -19.874000549316406,
"loss": 1.050663948059082,
"memory(GiB)": 45.96,
"nll_loss": 0.40407559275627136,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.10255793482065201,
"rewards/margins": 0.36497071385383606,
"rewards/rejected": -0.26241275668144226,
"step": 13,
"train_speed(iter/s)": 0.00565
},
{
"epoch": 0.026507307259925447,
"grad_norm": 4.1237287521362305,
"learning_rate": 3.5e-05,
"logits/chosen": -0.61805260181427,
"logits/rejected": -0.6224305033683777,
"logps/chosen": -5.8840789794921875,
"logps/rejected": -29.290557861328125,
"loss": 0.9034114480018616,
"memory(GiB)": 45.96,
"nll_loss": 0.33107179403305054,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.13439905643463135,
"rewards/margins": 0.5032773017883301,
"rewards/rejected": -0.36887818574905396,
"step": 14,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.028400686349920122,
"grad_norm": 2.141984701156616,
"learning_rate": 3.7500000000000003e-05,
"logits/chosen": -0.6251233816146851,
"logits/rejected": -0.6291872262954712,
"logps/chosen": -5.3556623458862305,
"logps/rejected": -22.30205535888672,
"loss": 0.7756511569023132,
"memory(GiB)": 45.96,
"nll_loss": 0.22363990545272827,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21060410141944885,
"rewards/margins": 0.5203964710235596,
"rewards/rejected": -0.30979233980178833,
"step": 15,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.030294065439914798,
"grad_norm": 6.157620906829834,
"learning_rate": 4e-05,
"logits/chosen": -0.6184762716293335,
"logits/rejected": -0.6184364557266235,
"logps/chosen": -10.368714332580566,
"logps/rejected": -12.033210754394531,
"loss": 1.4029701948165894,
"memory(GiB)": 45.96,
"nll_loss": 0.6103286743164062,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.020060203969478607,
"rewards/margins": -0.03359239548444748,
"rewards/rejected": 0.013532169163227081,
"step": 16,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.03218744452990947,
"grad_norm": 2.690070152282715,
"learning_rate": 4.25e-05,
"logits/chosen": -0.6329092383384705,
"logits/rejected": -0.6367439031600952,
"logps/chosen": -6.010343551635742,
"logps/rejected": -17.85470199584961,
"loss": 0.8949607610702515,
"memory(GiB)": 45.96,
"nll_loss": 0.3054018020629883,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.25051170587539673,
"rewards/margins": 0.37515202164649963,
"rewards/rejected": -0.12464030832052231,
"step": 17,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.034080823619904145,
"grad_norm": 2.8276467323303223,
"learning_rate": 4.5e-05,
"logits/chosen": -0.6264123320579529,
"logits/rejected": -0.6279273629188538,
"logps/chosen": -9.41238021850586,
"logps/rejected": -18.639442443847656,
"loss": 1.0180559158325195,
"memory(GiB)": 45.96,
"nll_loss": 0.3220836818218231,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.1841900646686554,
"rewards/margins": 0.13813874125480652,
"rewards/rejected": 0.04605132341384888,
"step": 18,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.035974202709898824,
"grad_norm": 2.10530161857605,
"learning_rate": 4.75e-05,
"logits/chosen": -0.6376557946205139,
"logits/rejected": -0.6416239738464355,
"logps/chosen": -5.7143964767456055,
"logps/rejected": -16.784849166870117,
"loss": 0.9154303669929504,
"memory(GiB)": 45.96,
"nll_loss": 0.2545720934867859,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.24181872606277466,
"rewards/margins": 0.18784700334072113,
"rewards/rejected": 0.05397173762321472,
"step": 19,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.037867581799893496,
"grad_norm": 2.357306480407715,
"learning_rate": 5e-05,
"logits/chosen": -0.6326904296875,
"logits/rejected": -0.6354666352272034,
"logps/chosen": -5.867492198944092,
"logps/rejected": -13.818038940429688,
"loss": 0.9468417167663574,
"memory(GiB)": 45.96,
"nll_loss": 0.3124926686286926,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.3217320740222931,
"rewards/margins": 0.22124268114566803,
"rewards/rejected": 0.10048942267894745,
"step": 20,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.039760960889888175,
"grad_norm": 2.5859196186065674,
"learning_rate": 5.25e-05,
"logits/chosen": -0.6597320437431335,
"logits/rejected": -0.6610896587371826,
"logps/chosen": -7.943680286407471,
"logps/rejected": -11.634421348571777,
"loss": 1.0064345598220825,
"memory(GiB)": 45.96,
"nll_loss": 0.3732220232486725,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3646732270717621,
"rewards/margins": 0.21462492644786835,
"rewards/rejected": 0.15004827082157135,
"step": 21,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.04165433997988285,
"grad_norm": 2.20487642288208,
"learning_rate": 5.500000000000001e-05,
"logits/chosen": -0.6439244151115417,
"logits/rejected": -0.6464219093322754,
"logps/chosen": -4.180229187011719,
"logps/rejected": -19.56499481201172,
"loss": 0.9136227369308472,
"memory(GiB)": 45.96,
"nll_loss": 0.22558730840682983,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.25369688868522644,
"rewards/margins": 0.14792592823505402,
"rewards/rejected": 0.10577096790075302,
"step": 22,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.04354771906987752,
"grad_norm": 2.80965518951416,
"learning_rate": 5.7499999999999995e-05,
"logits/chosen": -0.5748096108436584,
"logits/rejected": -0.5799225568771362,
"logps/chosen": -5.921882629394531,
"logps/rejected": -22.432538986206055,
"loss": 0.9860997796058655,
"memory(GiB)": 45.96,
"nll_loss": 0.3462521731853485,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.24639810621738434,
"rewards/margins": 0.1898707151412964,
"rewards/rejected": 0.05652741342782974,
"step": 23,
"train_speed(iter/s)": 0.005621
},
{
"epoch": 0.0454410981598722,
"grad_norm": 2.9503355026245117,
"learning_rate": 6e-05,
"logits/chosen": -0.6007645726203918,
"logits/rejected": -0.6086101531982422,
"logps/chosen": -5.338952541351318,
"logps/rejected": -26.883895874023438,
"loss": 0.9453619122505188,
"memory(GiB)": 45.96,
"nll_loss": 0.3667706847190857,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.392182856798172,
"rewards/margins": 0.36902523040771484,
"rewards/rejected": 0.02315761335194111,
"step": 24,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.04733447724986687,
"grad_norm": 2.2843515872955322,
"learning_rate": 6.25e-05,
"logits/chosen": -0.6047165393829346,
"logits/rejected": -0.608917772769928,
"logps/chosen": -6.276377201080322,
"logps/rejected": -21.095470428466797,
"loss": 0.914051353931427,
"memory(GiB)": 45.96,
"nll_loss": 0.3292374610900879,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3036147356033325,
"rewards/margins": 0.32923099398612976,
"rewards/rejected": -0.025616232305765152,
"step": 25,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.04922785633986155,
"grad_norm": 2.7294957637786865,
"learning_rate": 6.500000000000001e-05,
"logits/chosen": -0.6337023377418518,
"logits/rejected": -0.6374361515045166,
"logps/chosen": -7.032902240753174,
"logps/rejected": -24.937816619873047,
"loss": 0.8451516032218933,
"memory(GiB)": 45.96,
"nll_loss": 0.25359871983528137,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.24989479780197144,
"rewards/margins": 0.3727536201477051,
"rewards/rejected": -0.12285882234573364,
"step": 26,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.05112123542985622,
"grad_norm": 1.9816867113113403,
"learning_rate": 6.750000000000001e-05,
"logits/chosen": -0.6674913167953491,
"logits/rejected": -0.6716790795326233,
"logps/chosen": -3.894029378890991,
"logps/rejected": -19.461292266845703,
"loss": 0.720669686794281,
"memory(GiB)": 45.96,
"nll_loss": 0.1943943053483963,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.40334552526474,
"rewards/margins": 0.5223954319953918,
"rewards/rejected": -0.11904986202716827,
"step": 27,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.05301461451985089,
"grad_norm": 1.9561638832092285,
"learning_rate": 7e-05,
"logits/chosen": -0.6560395359992981,
"logits/rejected": -0.6615370512008667,
"logps/chosen": -3.828300952911377,
"logps/rejected": -27.646583557128906,
"loss": 0.7324035167694092,
"memory(GiB)": 45.96,
"nll_loss": 0.18986308574676514,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2855417728424072,
"rewards/margins": 0.5658388733863831,
"rewards/rejected": -0.28029707074165344,
"step": 28,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.05490799360984557,
"grad_norm": 2.197960376739502,
"learning_rate": 7.25e-05,
"logits/chosen": -0.6013461351394653,
"logits/rejected": -0.6078683733940125,
"logps/chosen": -5.841001987457275,
"logps/rejected": -28.59882926940918,
"loss": 0.763361930847168,
"memory(GiB)": 45.96,
"nll_loss": 0.29682645201683044,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.33854252099990845,
"rewards/margins": 0.7552333474159241,
"rewards/rejected": -0.416690856218338,
"step": 29,
"train_speed(iter/s)": 0.005603
},
{
"epoch": 0.056801372699840244,
"grad_norm": 4.102924823760986,
"learning_rate": 7.500000000000001e-05,
"logits/chosen": -0.6362655758857727,
"logits/rejected": -0.6371059417724609,
"logps/chosen": -6.047646522521973,
"logps/rejected": -16.402286529541016,
"loss": 0.930861234664917,
"memory(GiB)": 45.96,
"nll_loss": 0.33219844102859497,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2280413955450058,
"rewards/margins": 0.48401153087615967,
"rewards/rejected": -0.25597015023231506,
"step": 30,
"train_speed(iter/s)": 0.005604
},
{
"epoch": 0.05869475178983492,
"grad_norm": 2.643806219100952,
"learning_rate": 7.75e-05,
"logits/chosen": -0.6917952299118042,
"logits/rejected": -0.6954830884933472,
"logps/chosen": -4.5008368492126465,
"logps/rejected": -25.313228607177734,
"loss": 0.7698233127593994,
"memory(GiB)": 45.96,
"nll_loss": 0.21702390909194946,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2267376184463501,
"rewards/margins": 0.6824056506156921,
"rewards/rejected": -0.4556680917739868,
"step": 31,
"train_speed(iter/s)": 0.005603
},
{
"epoch": 0.060588130879829595,
"grad_norm": 3.9089903831481934,
"learning_rate": 8e-05,
"logits/chosen": -0.6848002672195435,
"logits/rejected": -0.6877056360244751,
"logps/chosen": -9.047338485717773,
"logps/rejected": -25.891061782836914,
"loss": 0.9844011068344116,
"memory(GiB)": 45.96,
"nll_loss": 0.3213033378124237,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.13390681147575378,
"rewards/margins": 0.6111294031143188,
"rewards/rejected": -0.4772225618362427,
"step": 32,
"train_speed(iter/s)": 0.005603
},
{
"epoch": 0.062481509969824274,
"grad_norm": 3.631053924560547,
"learning_rate": 8.25e-05,
"logits/chosen": -0.6787916421890259,
"logits/rejected": -0.681725025177002,
"logps/chosen": -11.23558521270752,
"logps/rejected": -24.226280212402344,
"loss": 1.1201726198196411,
"memory(GiB)": 45.96,
"nll_loss": 0.5571246147155762,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2192046195268631,
"rewards/margins": 0.6016167402267456,
"rewards/rejected": -0.3824121356010437,
"step": 33,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.06437488905981895,
"grad_norm": 2.667919158935547,
"learning_rate": 8.5e-05,
"logits/chosen": -0.7005462646484375,
"logits/rejected": -0.7055037021636963,
"logps/chosen": -3.1784541606903076,
"logps/rejected": -23.535545349121094,
"loss": 0.638558566570282,
"memory(GiB)": 45.96,
"nll_loss": 0.23515944182872772,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.27606871724128723,
"rewards/margins": 1.0784178972244263,
"rewards/rejected": -0.8023491501808167,
"step": 34,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.06626826814981363,
"grad_norm": 4.037520408630371,
"learning_rate": 8.75e-05,
"logits/chosen": -0.7001099586486816,
"logits/rejected": -0.7051636576652527,
"logps/chosen": -6.665594577789307,
"logps/rejected": -30.973716735839844,
"loss": 0.848934531211853,
"memory(GiB)": 45.96,
"nll_loss": 0.38612014055252075,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15037909150123596,
"rewards/margins": 1.0571930408477783,
"rewards/rejected": -0.9068138599395752,
"step": 35,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.06816164723980829,
"grad_norm": 3.6542232036590576,
"learning_rate": 9e-05,
"logits/chosen": -0.7070563435554504,
"logits/rejected": -0.7053466439247131,
"logps/chosen": -5.064585208892822,
"logps/rejected": -19.19178581237793,
"loss": 0.7724434733390808,
"memory(GiB)": 45.96,
"nll_loss": 0.26881077885627747,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2176203727722168,
"rewards/margins": 0.7342812418937683,
"rewards/rejected": -0.5166608095169067,
"step": 36,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.07005502632980297,
"grad_norm": 3.4213714599609375,
"learning_rate": 9.250000000000001e-05,
"logits/chosen": -0.7090893387794495,
"logits/rejected": -0.7106159329414368,
"logps/chosen": -10.25515365600586,
"logps/rejected": -24.033281326293945,
"loss": 0.9920384883880615,
"memory(GiB)": 45.96,
"nll_loss": 0.46471139788627625,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0965394526720047,
"rewards/margins": 0.8922154307365417,
"rewards/rejected": -0.7956759929656982,
"step": 37,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.07194840541979765,
"grad_norm": 5.325904846191406,
"learning_rate": 9.5e-05,
"logits/chosen": -0.657074511051178,
"logits/rejected": -0.6611977815628052,
"logps/chosen": -11.612046241760254,
"logps/rejected": -27.249744415283203,
"loss": 0.8334037065505981,
"memory(GiB)": 45.96,
"nll_loss": 0.3489510715007782,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12560953199863434,
"rewards/margins": 0.9447187781333923,
"rewards/rejected": -0.819109320640564,
"step": 38,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.07384178450979231,
"grad_norm": 2.9407873153686523,
"learning_rate": 9.75e-05,
"logits/chosen": -0.7148993611335754,
"logits/rejected": -0.7166731357574463,
"logps/chosen": -7.349883079528809,
"logps/rejected": -25.866724014282227,
"loss": 0.7971550822257996,
"memory(GiB)": 45.96,
"nll_loss": 0.3317265808582306,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1786963939666748,
"rewards/margins": 0.9361187815666199,
"rewards/rejected": -0.7574224472045898,
"step": 39,
"train_speed(iter/s)": 0.005621
},
{
"epoch": 0.07573516359978699,
"grad_norm": 7.271725654602051,
"learning_rate": 0.0001,
"logits/chosen": -0.6494594216346741,
"logits/rejected": -0.6519922018051147,
"logps/chosen": -10.921842575073242,
"logps/rejected": -26.213640213012695,
"loss": 1.3029272556304932,
"memory(GiB)": 45.96,
"nll_loss": 0.7071102261543274,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04726380109786987,
"rewards/margins": 0.7260035276412964,
"rewards/rejected": -0.6787396669387817,
"step": 40,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.07762854268978167,
"grad_norm": 2.3149876594543457,
"learning_rate": 0.0001025,
"logits/chosen": -0.6998907327651978,
"logits/rejected": -0.7039870023727417,
"logps/chosen": -4.173505783081055,
"logps/rejected": -23.617250442504883,
"loss": 0.5567827224731445,
"memory(GiB)": 45.96,
"nll_loss": 0.22731299698352814,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3785739839076996,
"rewards/margins": 1.2282123565673828,
"rewards/rejected": -0.8496384620666504,
"step": 41,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.07952192177977635,
"grad_norm": 2.81628155708313,
"learning_rate": 0.000105,
"logits/chosen": -0.7065268754959106,
"logits/rejected": -0.7109476923942566,
"logps/chosen": -7.945868492126465,
"logps/rejected": -28.209381103515625,
"loss": 0.9143926501274109,
"memory(GiB)": 45.96,
"nll_loss": 0.45929795503616333,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.14874038100242615,
"rewards/margins": 0.9704731702804565,
"rewards/rejected": -0.8217328786849976,
"step": 42,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.08141530086977102,
"grad_norm": 5.763336658477783,
"learning_rate": 0.0001075,
"logits/chosen": -0.6870285868644714,
"logits/rejected": -0.6968757510185242,
"logps/chosen": -5.37760066986084,
"logps/rejected": -30.209644317626953,
"loss": 1.0033479928970337,
"memory(GiB)": 45.96,
"nll_loss": 0.5952383279800415,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.25675737857818604,
"rewards/margins": 1.0465596914291382,
"rewards/rejected": -0.7898023128509521,
"step": 43,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.0833086799597657,
"grad_norm": 5.945868015289307,
"learning_rate": 0.00011000000000000002,
"logits/chosen": -0.6680281758308411,
"logits/rejected": -0.6685014963150024,
"logps/chosen": -11.777937889099121,
"logps/rejected": -14.195478439331055,
"loss": 1.2500255107879639,
"memory(GiB)": 45.96,
"nll_loss": 0.6744679808616638,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2654823362827301,
"rewards/margins": 0.44828659296035767,
"rewards/rejected": -0.18280424177646637,
"step": 44,
"train_speed(iter/s)": 0.005626
},
{
"epoch": 0.08520205904976037,
"grad_norm": 3.6887738704681396,
"learning_rate": 0.00011250000000000001,
"logits/chosen": -0.6420993804931641,
"logits/rejected": -0.649295449256897,
"logps/chosen": -5.845967769622803,
"logps/rejected": -29.958538055419922,
"loss": 0.8367453217506409,
"memory(GiB)": 45.96,
"nll_loss": 0.40336742997169495,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.25286757946014404,
"rewards/margins": 0.9195659160614014,
"rewards/rejected": -0.6666983962059021,
"step": 45,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.08709543813975504,
"grad_norm": 2.1550676822662354,
"learning_rate": 0.00011499999999999999,
"logits/chosen": -0.6583084464073181,
"logits/rejected": -0.6640565395355225,
"logps/chosen": -2.7918519973754883,
"logps/rejected": -30.053329467773438,
"loss": 0.6384420394897461,
"memory(GiB)": 45.96,
"nll_loss": 0.16433243453502655,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.33078277111053467,
"rewards/margins": 0.8035537004470825,
"rewards/rejected": -0.4727708697319031,
"step": 46,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.08898881722974972,
"grad_norm": 1.9267369508743286,
"learning_rate": 0.00011750000000000001,
"logits/chosen": -0.6443086266517639,
"logits/rejected": -0.6484851837158203,
"logps/chosen": -6.4907331466674805,
"logps/rejected": -26.10548973083496,
"loss": 0.8166890740394592,
"memory(GiB)": 45.96,
"nll_loss": 0.2826446294784546,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.33410829305648804,
"rewards/margins": 0.7130259275436401,
"rewards/rejected": -0.3789176642894745,
"step": 47,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.0908821963197444,
"grad_norm": 2.238929510116577,
"learning_rate": 0.00012,
"logits/chosen": -0.6500992774963379,
"logits/rejected": -0.6550747156143188,
"logps/chosen": -6.974908351898193,
"logps/rejected": -25.759687423706055,
"loss": 0.8363897800445557,
"memory(GiB)": 45.96,
"nll_loss": 0.26740241050720215,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.2779407501220703,
"rewards/margins": 0.71395343542099,
"rewards/rejected": -0.43601274490356445,
"step": 48,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.09277557540973908,
"grad_norm": 2.5497782230377197,
"learning_rate": 0.00012250000000000002,
"logits/chosen": -0.676102876663208,
"logits/rejected": -0.676883339881897,
"logps/chosen": -6.410519599914551,
"logps/rejected": -17.417396545410156,
"loss": 0.9155470728874207,
"memory(GiB)": 45.96,
"nll_loss": 0.3170667886734009,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.24874374270439148,
"rewards/margins": 0.6556647419929504,
"rewards/rejected": -0.40692102909088135,
"step": 49,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.09466895449973374,
"grad_norm": 2.275879144668579,
"learning_rate": 0.000125,
"logits/chosen": -0.6682412028312683,
"logits/rejected": -0.6694232225418091,
"logps/chosen": -7.84281587600708,
"logps/rejected": -18.11672019958496,
"loss": 0.8602735996246338,
"memory(GiB)": 45.96,
"nll_loss": 0.342671662569046,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.16426895558834076,
"rewards/margins": 0.6373977065086365,
"rewards/rejected": -0.47312870621681213,
"step": 50,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.09656233358972842,
"grad_norm": 2.448835611343384,
"learning_rate": 0.0001275,
"logits/chosen": -0.7030003070831299,
"logits/rejected": -0.702628493309021,
"logps/chosen": -7.209776401519775,
"logps/rejected": -24.76384162902832,
"loss": 0.7324039340019226,
"memory(GiB)": 45.96,
"nll_loss": 0.22679060697555542,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2451048642396927,
"rewards/margins": 0.9410224556922913,
"rewards/rejected": -0.695917546749115,
"step": 51,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.0984557126797231,
"grad_norm": 2.4740657806396484,
"learning_rate": 0.00013000000000000002,
"logits/chosen": -0.7383002042770386,
"logits/rejected": -0.7460674047470093,
"logps/chosen": -4.4354424476623535,
"logps/rejected": -26.271957397460938,
"loss": 0.738042414188385,
"memory(GiB)": 45.96,
"nll_loss": 0.30589190125465393,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.35504794120788574,
"rewards/margins": 1.1514215469360352,
"rewards/rejected": -0.7963736057281494,
"step": 52,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.10034909176971776,
"grad_norm": 3.1427273750305176,
"learning_rate": 0.0001325,
"logits/chosen": -0.7910199165344238,
"logits/rejected": -0.7956037521362305,
"logps/chosen": -5.2786359786987305,
"logps/rejected": -27.01905632019043,
"loss": 0.7005700469017029,
"memory(GiB)": 45.96,
"nll_loss": 0.2977657616138458,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.32858696579933167,
"rewards/margins": 1.1505931615829468,
"rewards/rejected": -0.8220062255859375,
"step": 53,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.10224247085971244,
"grad_norm": 2.710829973220825,
"learning_rate": 0.00013500000000000003,
"logits/chosen": -0.7300952672958374,
"logits/rejected": -0.7392382621765137,
"logps/chosen": -4.204522132873535,
"logps/rejected": -35.52387237548828,
"loss": 0.5068414211273193,
"memory(GiB)": 45.96,
"nll_loss": 0.18188302218914032,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3228433430194855,
"rewards/margins": 1.5467703342437744,
"rewards/rejected": -1.2239267826080322,
"step": 54,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.10413584994970712,
"grad_norm": 2.6672115325927734,
"learning_rate": 0.0001375,
"logits/chosen": -0.7622752785682678,
"logits/rejected": -0.7692346572875977,
"logps/chosen": -5.656646728515625,
"logps/rejected": -36.99287033081055,
"loss": 0.6165193319320679,
"memory(GiB)": 45.96,
"nll_loss": 0.2455344796180725,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21251262724399567,
"rewards/margins": 1.7865149974822998,
"rewards/rejected": -1.5740022659301758,
"step": 55,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.10602922903970179,
"grad_norm": 7.261322975158691,
"learning_rate": 0.00014,
"logits/chosen": -0.8227823376655579,
"logits/rejected": -0.8353255391120911,
"logps/chosen": -7.420350551605225,
"logps/rejected": -42.59074401855469,
"loss": 0.8744301199913025,
"memory(GiB)": 45.96,
"nll_loss": 0.49042099714279175,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.23873600363731384,
"rewards/margins": 2.152242422103882,
"rewards/rejected": -1.9135063886642456,
"step": 56,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.10792260812969647,
"grad_norm": 3.6271088123321533,
"learning_rate": 0.00014250000000000002,
"logits/chosen": -0.8145865201950073,
"logits/rejected": -0.8213882446289062,
"logps/chosen": -4.568179130554199,
"logps/rejected": -37.50999450683594,
"loss": 0.6209616661071777,
"memory(GiB)": 45.96,
"nll_loss": 0.29730865359306335,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26820147037506104,
"rewards/margins": 2.114492893218994,
"rewards/rejected": -1.8462913036346436,
"step": 57,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.10981598721969114,
"grad_norm": 3.6261045932769775,
"learning_rate": 0.000145,
"logits/chosen": -0.7670393586158752,
"logits/rejected": -0.7794223427772522,
"logps/chosen": -8.460503578186035,
"logps/rejected": -43.186954498291016,
"loss": 0.6528911590576172,
"memory(GiB)": 45.96,
"nll_loss": 0.30593881011009216,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.28572511672973633,
"rewards/margins": 2.0398354530334473,
"rewards/rejected": -1.75411057472229,
"step": 58,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.11170936630968582,
"grad_norm": 2.79728364944458,
"learning_rate": 0.0001475,
"logits/chosen": -0.8239770531654358,
"logits/rejected": -0.8207590579986572,
"logps/chosen": -12.058256149291992,
"logps/rejected": -25.070674896240234,
"loss": 0.8349239230155945,
"memory(GiB)": 45.96,
"nll_loss": 0.4342367947101593,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2961112856864929,
"rewards/margins": 1.2313449382781982,
"rewards/rejected": -0.9352336525917053,
"step": 59,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.11360274539968049,
"grad_norm": 3.0574796199798584,
"learning_rate": 0.00015000000000000001,
"logits/chosen": -0.810753345489502,
"logits/rejected": -0.8193599581718445,
"logps/chosen": -5.105385780334473,
"logps/rejected": -29.203344345092773,
"loss": 0.6070073843002319,
"memory(GiB)": 45.96,
"nll_loss": 0.24924401938915253,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.5035626292228699,
"rewards/margins": 1.4562283754348755,
"rewards/rejected": -0.9526655077934265,
"step": 60,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.11549612448967517,
"grad_norm": 5.350250720977783,
"learning_rate": 0.0001525,
"logits/chosen": -0.815939724445343,
"logits/rejected": -0.826446533203125,
"logps/chosen": -2.3785085678100586,
"logps/rejected": -34.224422454833984,
"loss": 0.7174049019813538,
"memory(GiB)": 45.96,
"nll_loss": 0.38427019119262695,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.4009089469909668,
"rewards/margins": 1.891708254814148,
"rewards/rejected": -1.4907994270324707,
"step": 61,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.11738950357966985,
"grad_norm": 2.239091157913208,
"learning_rate": 0.000155,
"logits/chosen": -0.8229139447212219,
"logits/rejected": -0.8320141434669495,
"logps/chosen": -4.586618900299072,
"logps/rejected": -32.01433181762695,
"loss": 0.6079644560813904,
"memory(GiB)": 45.96,
"nll_loss": 0.20739667117595673,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26031073927879333,
"rewards/margins": 1.4821346998214722,
"rewards/rejected": -1.2218239307403564,
"step": 62,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.11928288266966451,
"grad_norm": 4.1209940910339355,
"learning_rate": 0.0001575,
"logits/chosen": -0.8513484597206116,
"logits/rejected": -0.8552687168121338,
"logps/chosen": -9.33289909362793,
"logps/rejected": -29.56768226623535,
"loss": 1.0120337009429932,
"memory(GiB)": 45.96,
"nll_loss": 0.4378553628921509,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.14417365193367004,
"rewards/margins": 1.3170634508132935,
"rewards/rejected": -1.1728898286819458,
"step": 63,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.12117626175965919,
"grad_norm": 4.230152606964111,
"learning_rate": 0.00016,
"logits/chosen": -0.7943696975708008,
"logits/rejected": -0.8050058484077454,
"logps/chosen": -6.4711594581604,
"logps/rejected": -42.82871627807617,
"loss": 0.5924439430236816,
"memory(GiB)": 45.96,
"nll_loss": 0.23330256342887878,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16898760199546814,
"rewards/margins": 1.992952585220337,
"rewards/rejected": -1.823965072631836,
"step": 64,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.12306964084965387,
"grad_norm": 2.351702928543091,
"learning_rate": 0.00016250000000000002,
"logits/chosen": -0.8158823251724243,
"logits/rejected": -0.8219522833824158,
"logps/chosen": -4.3665313720703125,
"logps/rejected": -28.09051513671875,
"loss": 0.7134827375411987,
"memory(GiB)": 45.96,
"nll_loss": 0.22144050896167755,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.3041003942489624,
"rewards/margins": 1.2433838844299316,
"rewards/rejected": -0.9392834305763245,
"step": 65,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.12496301993964855,
"grad_norm": 3.1737756729125977,
"learning_rate": 0.000165,
"logits/chosen": -0.8072597980499268,
"logits/rejected": -0.8171340823173523,
"logps/chosen": -5.0343122482299805,
"logps/rejected": -32.46968460083008,
"loss": 0.63325434923172,
"memory(GiB)": 45.96,
"nll_loss": 0.29483139514923096,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.29814648628234863,
"rewards/margins": 1.4677376747131348,
"rewards/rejected": -1.1695910692214966,
"step": 66,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.1268563990296432,
"grad_norm": 2.5199668407440186,
"learning_rate": 0.0001675,
"logits/chosen": -0.8106119632720947,
"logits/rejected": -0.8191246390342712,
"logps/chosen": -8.389342308044434,
"logps/rejected": -36.18731689453125,
"loss": 0.7148120403289795,
"memory(GiB)": 45.96,
"nll_loss": 0.31000831723213196,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2828730642795563,
"rewards/margins": 1.7046067714691162,
"rewards/rejected": -1.4217336177825928,
"step": 67,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.1287497781196379,
"grad_norm": 3.428029775619507,
"learning_rate": 0.00017,
"logits/chosen": -0.8391574621200562,
"logits/rejected": -0.8546858429908752,
"logps/chosen": -8.799811363220215,
"logps/rejected": -37.64997863769531,
"loss": 0.7224959135055542,
"memory(GiB)": 45.96,
"nll_loss": 0.4090877175331116,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3909546434879303,
"rewards/margins": 1.7023922204971313,
"rewards/rejected": -1.3114374876022339,
"step": 68,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.13064315720963257,
"grad_norm": 3.7791826725006104,
"learning_rate": 0.00017250000000000002,
"logits/chosen": -0.8618558049201965,
"logits/rejected": -0.86772221326828,
"logps/chosen": -8.02017879486084,
"logps/rejected": -28.318117141723633,
"loss": 0.8481130003929138,
"memory(GiB)": 45.96,
"nll_loss": 0.32193318009376526,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.07287055253982544,
"rewards/margins": 1.3111273050308228,
"rewards/rejected": -1.2382566928863525,
"step": 69,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.13253653629962725,
"grad_norm": 3.5219051837921143,
"learning_rate": 0.000175,
"logits/chosen": -0.8731855154037476,
"logits/rejected": -0.8781698346138,
"logps/chosen": -8.205753326416016,
"logps/rejected": -23.05510902404785,
"loss": 0.9284813404083252,
"memory(GiB)": 45.96,
"nll_loss": 0.4099024832248688,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.26493778824806213,
"rewards/margins": 1.1318817138671875,
"rewards/rejected": -0.866943895816803,
"step": 70,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.13442991538962193,
"grad_norm": 2.412374973297119,
"learning_rate": 0.0001775,
"logits/chosen": -0.8586634993553162,
"logits/rejected": -0.8701040744781494,
"logps/chosen": -3.7027158737182617,
"logps/rejected": -42.672996520996094,
"loss": 0.5218284130096436,
"memory(GiB)": 45.96,
"nll_loss": 0.2169719785451889,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.371543824672699,
"rewards/margins": 2.3614425659179688,
"rewards/rejected": -1.989898920059204,
"step": 71,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.13632329447961658,
"grad_norm": 1.723345160484314,
"learning_rate": 0.00018,
"logits/chosen": -0.8107991814613342,
"logits/rejected": -0.8227972388267517,
"logps/chosen": -4.743021488189697,
"logps/rejected": -38.795711517333984,
"loss": 0.4607815742492676,
"memory(GiB)": 45.96,
"nll_loss": 0.18950311839580536,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.36083462834358215,
"rewards/margins": 2.311211585998535,
"rewards/rejected": -1.9503768682479858,
"step": 72,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.13821667356961126,
"grad_norm": 4.164133548736572,
"learning_rate": 0.0001825,
"logits/chosen": -0.9086084365844727,
"logits/rejected": -0.9208739995956421,
"logps/chosen": -13.34437084197998,
"logps/rejected": -53.04572296142578,
"loss": 0.6920671463012695,
"memory(GiB)": 45.96,
"nll_loss": 0.43207526206970215,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.031513512134552,
"rewards/margins": 3.146587371826172,
"rewards/rejected": -3.1150739192962646,
"step": 73,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.14011005265960594,
"grad_norm": 6.1999382972717285,
"learning_rate": 0.00018500000000000002,
"logits/chosen": -0.8234269618988037,
"logits/rejected": -0.8303597569465637,
"logps/chosen": -8.394856452941895,
"logps/rejected": -41.975399017333984,
"loss": 1.1737077236175537,
"memory(GiB)": 45.96,
"nll_loss": 0.7135495543479919,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14376360177993774,
"rewards/margins": 2.6206157207489014,
"rewards/rejected": -2.4768521785736084,
"step": 74,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.14200343174960062,
"grad_norm": 6.218433856964111,
"learning_rate": 0.0001875,
"logits/chosen": -0.8009334802627563,
"logits/rejected": -0.8051450848579407,
"logps/chosen": -12.022541046142578,
"logps/rejected": -38.48487091064453,
"loss": 0.9869168400764465,
"memory(GiB)": 45.96,
"nll_loss": 0.45167890191078186,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.010723039507865906,
"rewards/margins": 1.8775376081466675,
"rewards/rejected": -1.8882607221603394,
"step": 75,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.1438968108395953,
"grad_norm": 1.9325371980667114,
"learning_rate": 0.00019,
"logits/chosen": -0.7815489768981934,
"logits/rejected": -0.7896750569343567,
"logps/chosen": -6.42656946182251,
"logps/rejected": -33.38284683227539,
"loss": 0.6605334281921387,
"memory(GiB)": 45.96,
"nll_loss": 0.30029603838920593,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31539270281791687,
"rewards/margins": 1.6843116283416748,
"rewards/rejected": -1.368919014930725,
"step": 76,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.14579018992958998,
"grad_norm": 5.768399238586426,
"learning_rate": 0.00019250000000000002,
"logits/chosen": -0.7157012820243835,
"logits/rejected": -0.7218092679977417,
"logps/chosen": -5.720545291900635,
"logps/rejected": -32.14387512207031,
"loss": 0.9388673901557922,
"memory(GiB)": 45.96,
"nll_loss": 0.49579885601997375,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2496451437473297,
"rewards/margins": 1.3803541660308838,
"rewards/rejected": -1.130708932876587,
"step": 77,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.14768356901958463,
"grad_norm": 2.978989601135254,
"learning_rate": 0.000195,
"logits/chosen": -0.7398240566253662,
"logits/rejected": -0.74552983045578,
"logps/chosen": -6.459310054779053,
"logps/rejected": -28.873746871948242,
"loss": 0.6721470952033997,
"memory(GiB)": 45.96,
"nll_loss": 0.2696229815483093,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.28077179193496704,
"rewards/margins": 1.547407865524292,
"rewards/rejected": -1.2666360139846802,
"step": 78,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.1495769481095793,
"grad_norm": 2.109548568725586,
"learning_rate": 0.00019750000000000003,
"logits/chosen": -0.7017478942871094,
"logits/rejected": -0.7096887826919556,
"logps/chosen": -4.097768783569336,
"logps/rejected": -31.799213409423828,
"loss": 0.5941745042800903,
"memory(GiB)": 45.96,
"nll_loss": 0.19475214183330536,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.4046904742717743,
"rewards/margins": 1.6549233198165894,
"rewards/rejected": -1.2502328157424927,
"step": 79,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.15147032719957398,
"grad_norm": 3.9734411239624023,
"learning_rate": 0.0002,
"logits/chosen": -0.6862869262695312,
"logits/rejected": -0.6942235827445984,
"logps/chosen": -8.900280952453613,
"logps/rejected": -41.978641510009766,
"loss": 0.7803151607513428,
"memory(GiB)": 45.96,
"nll_loss": 0.3115917146205902,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1415846347808838,
"rewards/margins": 2.006580352783203,
"rewards/rejected": -1.8649954795837402,
"step": 80,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.15336370628956866,
"grad_norm": 6.735928535461426,
"learning_rate": 0.00019999978184060562,
"logits/chosen": -0.7448083162307739,
"logits/rejected": -0.7499798536300659,
"logps/chosen": -5.58134126663208,
"logps/rejected": -42.04484939575195,
"loss": 0.9395004510879517,
"memory(GiB)": 45.96,
"nll_loss": 0.515042245388031,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.24552975594997406,
"rewards/margins": 2.421520233154297,
"rewards/rejected": -2.175990343093872,
"step": 81,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.15525708537956334,
"grad_norm": 4.143361568450928,
"learning_rate": 0.00019999912736337437,
"logits/chosen": -0.7276468873023987,
"logits/rejected": -0.741879940032959,
"logps/chosen": -3.295543670654297,
"logps/rejected": -54.32012939453125,
"loss": 0.660046398639679,
"memory(GiB)": 45.96,
"nll_loss": 0.42805707454681396,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2942177951335907,
"rewards/margins": 3.302980661392212,
"rewards/rejected": -3.008762836456299,
"step": 82,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.15715046446955802,
"grad_norm": 4.713730812072754,
"learning_rate": 0.00019999803657116188,
"logits/chosen": -0.7310099601745605,
"logits/rejected": -0.7400019764900208,
"logps/chosen": -6.529958248138428,
"logps/rejected": -39.906105041503906,
"loss": 0.7617413997650146,
"memory(GiB)": 45.96,
"nll_loss": 0.422638475894928,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2212720513343811,
"rewards/margins": 2.413503885269165,
"rewards/rejected": -2.1922316551208496,
"step": 83,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.1590438435595527,
"grad_norm": 4.658056735992432,
"learning_rate": 0.00019999650946872738,
"logits/chosen": -0.7134297490119934,
"logits/rejected": -0.7193505764007568,
"logps/chosen": -5.202678680419922,
"logps/rejected": -33.255706787109375,
"loss": 0.6914293766021729,
"memory(GiB)": 45.96,
"nll_loss": 0.2725370526313782,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.29689377546310425,
"rewards/margins": 1.9401971101760864,
"rewards/rejected": -1.6433032751083374,
"step": 84,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.16093722264954735,
"grad_norm": 2.288125991821289,
"learning_rate": 0.00019999454606273404,
"logits/chosen": -0.6521891951560974,
"logits/rejected": -0.6597902774810791,
"logps/chosen": -6.535229206085205,
"logps/rejected": -33.92669677734375,
"loss": 0.5946552157402039,
"memory(GiB)": 45.96,
"nll_loss": 0.29953494668006897,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3503923714160919,
"rewards/margins": 1.96759831905365,
"rewards/rejected": -1.61720609664917,
"step": 85,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.16283060173954203,
"grad_norm": 6.193369388580322,
"learning_rate": 0.00019999214636174845,
"logits/chosen": -0.7137624025344849,
"logits/rejected": -0.7180912494659424,
"logps/chosen": -6.647699356079102,
"logps/rejected": -31.25023078918457,
"loss": 0.9301581382751465,
"memory(GiB)": 45.96,
"nll_loss": 0.46883538365364075,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.29692143201828003,
"rewards/margins": 1.745566964149475,
"rewards/rejected": -1.4486457109451294,
"step": 86,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.1647239808295367,
"grad_norm": 3.9115772247314453,
"learning_rate": 0.00019998931037624104,
"logits/chosen": -0.6435313820838928,
"logits/rejected": -0.6480632424354553,
"logps/chosen": -6.559725284576416,
"logps/rejected": -34.3360481262207,
"loss": 0.7339984178543091,
"memory(GiB)": 45.96,
"nll_loss": 0.3988235890865326,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2545357048511505,
"rewards/margins": 1.8583070039749146,
"rewards/rejected": -1.603771448135376,
"step": 87,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.1666173599195314,
"grad_norm": 2.725975751876831,
"learning_rate": 0.00019998603811858571,
"logits/chosen": -0.6484612822532654,
"logits/rejected": -0.6513442993164062,
"logps/chosen": -5.939992427825928,
"logps/rejected": -30.691526412963867,
"loss": 0.6261233687400818,
"memory(GiB)": 45.96,
"nll_loss": 0.30717653036117554,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3799961507320404,
"rewards/margins": 1.8060214519500732,
"rewards/rejected": -1.426025390625,
"step": 88,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.16851073900952607,
"grad_norm": 3.1483325958251953,
"learning_rate": 0.00019998232960305993,
"logits/chosen": -0.640424907207489,
"logits/rejected": -0.6445133090019226,
"logps/chosen": -10.158927917480469,
"logps/rejected": -31.649131774902344,
"loss": 0.7713112235069275,
"memory(GiB)": 45.96,
"nll_loss": 0.4013857841491699,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2583284080028534,
"rewards/margins": 1.7178279161453247,
"rewards/rejected": -1.4594995975494385,
"step": 89,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.17040411809952075,
"grad_norm": 9.671393394470215,
"learning_rate": 0.0001999781848458447,
"logits/chosen": -0.6384307146072388,
"logits/rejected": -0.6467083692550659,
"logps/chosen": -5.6327433586120605,
"logps/rejected": -33.724124908447266,
"loss": 1.136250615119934,
"memory(GiB)": 45.96,
"nll_loss": 0.6182616353034973,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12717147171497345,
"rewards/margins": 1.5072848796844482,
"rewards/rejected": -1.3801133632659912,
"step": 90,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.17229749718951543,
"grad_norm": 3.9667158126831055,
"learning_rate": 0.0001999736038650243,
"logits/chosen": -0.6727519035339355,
"logits/rejected": -0.678146243095398,
"logps/chosen": -3.9062070846557617,
"logps/rejected": -40.605716705322266,
"loss": 0.5808683633804321,
"memory(GiB)": 45.96,
"nll_loss": 0.29070931673049927,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3750736713409424,
"rewards/margins": 2.2590668201446533,
"rewards/rejected": -1.883993148803711,
"step": 91,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.17419087627951008,
"grad_norm": 2.966646909713745,
"learning_rate": 0.00019996858668058646,
"logits/chosen": -0.6560570597648621,
"logits/rejected": -0.6633113622665405,
"logps/chosen": -6.821100234985352,
"logps/rejected": -35.842308044433594,
"loss": 0.5389344096183777,
"memory(GiB)": 45.96,
"nll_loss": 0.22853048145771027,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.33146628737449646,
"rewards/margins": 2.221740484237671,
"rewards/rejected": -1.8902742862701416,
"step": 92,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.17608425536950476,
"grad_norm": 4.352930068969727,
"learning_rate": 0.0001999631333144221,
"logits/chosen": -0.6744297742843628,
"logits/rejected": -0.6817238926887512,
"logps/chosen": -10.121214866638184,
"logps/rejected": -45.07015609741211,
"loss": 0.7165765166282654,
"memory(GiB)": 45.96,
"nll_loss": 0.36157098412513733,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3100533187389374,
"rewards/margins": 2.3896117210388184,
"rewards/rejected": -2.0795583724975586,
"step": 93,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.17797763445949943,
"grad_norm": 3.650033473968506,
"learning_rate": 0.00019995724379032526,
"logits/chosen": -0.6463199257850647,
"logits/rejected": -0.6561610102653503,
"logps/chosen": -5.5554704666137695,
"logps/rejected": -39.192264556884766,
"loss": 0.7099438309669495,
"memory(GiB)": 45.96,
"nll_loss": 0.3186087906360626,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28469714522361755,
"rewards/margins": 2.1725757122039795,
"rewards/rejected": -1.887878656387329,
"step": 94,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.1798710135494941,
"grad_norm": 3.6392762660980225,
"learning_rate": 0.00019995091813399305,
"logits/chosen": -0.6218971014022827,
"logits/rejected": -0.6236589550971985,
"logps/chosen": -9.031105041503906,
"logps/rejected": -29.54071044921875,
"loss": 0.7348965406417847,
"memory(GiB)": 45.96,
"nll_loss": 0.35691019892692566,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3281153440475464,
"rewards/margins": 1.6330987215042114,
"rewards/rejected": -1.3049836158752441,
"step": 95,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.1817643926394888,
"grad_norm": 4.513101100921631,
"learning_rate": 0.00019994415637302547,
"logits/chosen": -0.6518260836601257,
"logits/rejected": -0.6591805815696716,
"logps/chosen": -3.454824447631836,
"logps/rejected": -40.539100646972656,
"loss": 0.4428410232067108,
"memory(GiB)": 45.96,
"nll_loss": 0.16427120566368103,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29650911688804626,
"rewards/margins": 1.9197403192520142,
"rewards/rejected": -1.623231053352356,
"step": 96,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.18365777172948347,
"grad_norm": 3.081139087677002,
"learning_rate": 0.00019993695853692537,
"logits/chosen": -0.6301771402359009,
"logits/rejected": -0.6361221671104431,
"logps/chosen": -5.919186592102051,
"logps/rejected": -33.726078033447266,
"loss": 0.6770766377449036,
"memory(GiB)": 45.96,
"nll_loss": 0.3173068165779114,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.288848340511322,
"rewards/margins": 1.7297114133834839,
"rewards/rejected": -1.4408631324768066,
"step": 97,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.18555115081947815,
"grad_norm": 5.967331409454346,
"learning_rate": 0.0001999293246570983,
"logits/chosen": -0.6614546179771423,
"logits/rejected": -0.6638529300689697,
"logps/chosen": -6.57697057723999,
"logps/rejected": -30.82279396057129,
"loss": 0.6938097476959229,
"memory(GiB)": 45.96,
"nll_loss": 0.23730693757534027,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.24900805950164795,
"rewards/margins": 1.5996767282485962,
"rewards/rejected": -1.3506686687469482,
"step": 98,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.1874445299094728,
"grad_norm": 2.659550428390503,
"learning_rate": 0.0001999212547668523,
"logits/chosen": -0.6610513925552368,
"logits/rejected": -0.6650281548500061,
"logps/chosen": -7.570089817047119,
"logps/rejected": -41.5615348815918,
"loss": 0.521258533000946,
"memory(GiB)": 45.96,
"nll_loss": 0.34517771005630493,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28127947449684143,
"rewards/margins": 2.645756244659424,
"rewards/rejected": -2.3644769191741943,
"step": 99,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.18933790899946748,
"grad_norm": 12.499390602111816,
"learning_rate": 0.00019991274890139774,
"logits/chosen": -0.5981582403182983,
"logits/rejected": -0.5984249114990234,
"logps/chosen": -5.772880554199219,
"logps/rejected": -36.335723876953125,
"loss": 0.5674217939376831,
"memory(GiB)": 45.96,
"nll_loss": 0.3134133517742157,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3456924557685852,
"rewards/margins": 2.240718364715576,
"rewards/rejected": -1.8950259685516357,
"step": 100,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.19123128808946216,
"grad_norm": 8.361610412597656,
"learning_rate": 0.00019990380709784743,
"logits/chosen": -0.6467748880386353,
"logits/rejected": -0.6568058133125305,
"logps/chosen": -6.142106056213379,
"logps/rejected": -42.85158920288086,
"loss": 0.7210798859596252,
"memory(GiB)": 45.96,
"nll_loss": 0.48578304052352905,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24581415951251984,
"rewards/margins": 2.62912917137146,
"rewards/rejected": -2.383315086364746,
"step": 101,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.19312466717945684,
"grad_norm": 8.87897777557373,
"learning_rate": 0.00019989442939521602,
"logits/chosen": -0.6422844529151917,
"logits/rejected": -0.6491110324859619,
"logps/chosen": -4.283577919006348,
"logps/rejected": -44.210323333740234,
"loss": 0.4512465298175812,
"memory(GiB)": 45.96,
"nll_loss": 0.18845491111278534,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2913907766342163,
"rewards/margins": 2.8169469833374023,
"rewards/rejected": -2.5255563259124756,
"step": 102,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.19501804626945152,
"grad_norm": 5.385126113891602,
"learning_rate": 0.0001998846158344203,
"logits/chosen": -0.6668524742126465,
"logits/rejected": -0.6711164712905884,
"logps/chosen": -8.307709693908691,
"logps/rejected": -46.651424407958984,
"loss": 0.5795091986656189,
"memory(GiB)": 45.96,
"nll_loss": 0.2871760427951813,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2825217843055725,
"rewards/margins": 3.175206422805786,
"rewards/rejected": -2.8926849365234375,
"step": 103,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.1969114253594462,
"grad_norm": 5.178345680236816,
"learning_rate": 0.0001998743664582786,
"logits/chosen": -0.6665439009666443,
"logits/rejected": -0.6732444763183594,
"logps/chosen": -6.044788360595703,
"logps/rejected": -49.20276641845703,
"loss": 0.5723894834518433,
"memory(GiB)": 45.96,
"nll_loss": 0.30348485708236694,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.4383161664009094,
"rewards/margins": 3.547417402267456,
"rewards/rejected": -3.1091012954711914,
"step": 104,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.19880480444944088,
"grad_norm": 13.239428520202637,
"learning_rate": 0.00019986368131151086,
"logits/chosen": -0.6453922390937805,
"logits/rejected": -0.6535012125968933,
"logps/chosen": -6.758315086364746,
"logps/rejected": -47.57633590698242,
"loss": 0.8193904161453247,
"memory(GiB)": 45.96,
"nll_loss": 0.48707395792007446,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.25950154662132263,
"rewards/margins": 2.7850496768951416,
"rewards/rejected": -2.5255484580993652,
"step": 105,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.20069818353943553,
"grad_norm": 8.258339881896973,
"learning_rate": 0.00019985256044073848,
"logits/chosen": -0.6464555263519287,
"logits/rejected": -0.6525677442550659,
"logps/chosen": -8.009160995483398,
"logps/rejected": -44.356807708740234,
"loss": 0.8658470511436462,
"memory(GiB)": 45.96,
"nll_loss": 0.40163958072662354,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08035992085933685,
"rewards/margins": 2.636491537094116,
"rewards/rejected": -2.556131601333618,
"step": 106,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.2025915626294302,
"grad_norm": 5.688174247741699,
"learning_rate": 0.0001998410038944838,
"logits/chosen": -0.6843658685684204,
"logits/rejected": -0.6876212358474731,
"logps/chosen": -2.5727243423461914,
"logps/rejected": -29.177391052246094,
"loss": 0.4456700086593628,
"memory(GiB)": 45.96,
"nll_loss": 0.15025635063648224,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.46042385697364807,
"rewards/margins": 1.8946454524993896,
"rewards/rejected": -1.434221863746643,
"step": 107,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.20448494171942488,
"grad_norm": 2.6327826976776123,
"learning_rate": 0.00019982901172317031,
"logits/chosen": -0.6323860287666321,
"logits/rejected": -0.6346494555473328,
"logps/chosen": -8.630059242248535,
"logps/rejected": -31.78713035583496,
"loss": 0.6648795008659363,
"memory(GiB)": 45.96,
"nll_loss": 0.2702806890010834,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19947871565818787,
"rewards/margins": 1.5066046714782715,
"rewards/rejected": -1.3071260452270508,
"step": 108,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.20637832080941956,
"grad_norm": 2.5843868255615234,
"learning_rate": 0.000199816583979122,
"logits/chosen": -0.5910162329673767,
"logits/rejected": -0.5975123047828674,
"logps/chosen": -3.9122486114501953,
"logps/rejected": -28.35757064819336,
"loss": 0.6974324584007263,
"memory(GiB)": 45.96,
"nll_loss": 0.3021320104598999,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3400159180164337,
"rewards/margins": 1.3856966495513916,
"rewards/rejected": -1.0456807613372803,
"step": 109,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.20827169989941424,
"grad_norm": 5.559172630310059,
"learning_rate": 0.00019980372071656352,
"logits/chosen": -0.6566262245178223,
"logits/rejected": -0.6621754169464111,
"logps/chosen": -6.803584575653076,
"logps/rejected": -29.84942626953125,
"loss": 0.84231036901474,
"memory(GiB)": 45.96,
"nll_loss": 0.47532981634140015,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.30856069922447205,
"rewards/margins": 1.5043147802352905,
"rewards/rejected": -1.195754051208496,
"step": 110,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.21016507898940892,
"grad_norm": 3.415010929107666,
"learning_rate": 0.0001997904219916197,
"logits/chosen": -0.6346056461334229,
"logits/rejected": -0.6350025534629822,
"logps/chosen": -11.599414825439453,
"logps/rejected": -30.610013961791992,
"loss": 0.7572425007820129,
"memory(GiB)": 45.96,
"nll_loss": 0.36608272790908813,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2624809741973877,
"rewards/margins": 1.713860034942627,
"rewards/rejected": -1.4513791799545288,
"step": 111,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.21205845807940357,
"grad_norm": 3.41812801361084,
"learning_rate": 0.00019977668786231534,
"logits/chosen": -0.6841356754302979,
"logits/rejected": -0.6936293840408325,
"logps/chosen": -5.25693416595459,
"logps/rejected": -32.669185638427734,
"loss": 0.741496741771698,
"memory(GiB)": 45.96,
"nll_loss": 0.313353031873703,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.24570311605930328,
"rewards/margins": 1.6960662603378296,
"rewards/rejected": -1.450363278388977,
"step": 112,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.21395183716939825,
"grad_norm": 2.2650668621063232,
"learning_rate": 0.00019976251838857502,
"logits/chosen": -0.7449254393577576,
"logits/rejected": -0.75071120262146,
"logps/chosen": -4.380943298339844,
"logps/rejected": -35.95576858520508,
"loss": 0.4989684820175171,
"memory(GiB)": 45.96,
"nll_loss": 0.22844262421131134,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.36053481698036194,
"rewards/margins": 2.2524986267089844,
"rewards/rejected": -1.8919636011123657,
"step": 113,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.21584521625939293,
"grad_norm": 4.310145378112793,
"learning_rate": 0.0001997479136322229,
"logits/chosen": -0.7409523129463196,
"logits/rejected": -0.7497206330299377,
"logps/chosen": -4.750667572021484,
"logps/rejected": -48.04157638549805,
"loss": 0.6291773915290833,
"memory(GiB)": 45.96,
"nll_loss": 0.25920921564102173,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.24817335605621338,
"rewards/margins": 3.173919677734375,
"rewards/rejected": -2.925746202468872,
"step": 114,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.2177385953493876,
"grad_norm": 49.79676818847656,
"learning_rate": 0.00019973287365698217,
"logits/chosen": -0.6885964274406433,
"logits/rejected": -0.6920081973075867,
"logps/chosen": -8.995617866516113,
"logps/rejected": -50.670982360839844,
"loss": 0.8429219722747803,
"memory(GiB)": 45.96,
"nll_loss": 0.6063740849494934,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.02555127628147602,
"rewards/margins": 3.5049619674682617,
"rewards/rejected": -3.530513286590576,
"step": 115,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.2196319744393823,
"grad_norm": 24.369260787963867,
"learning_rate": 0.00019971739852847514,
"logits/chosen": -0.7350776791572571,
"logits/rejected": -0.7412790656089783,
"logps/chosen": -11.02401065826416,
"logps/rejected": -58.75929260253906,
"loss": 1.4918644428253174,
"memory(GiB)": 45.96,
"nll_loss": 1.1034432649612427,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.35152652859687805,
"rewards/margins": 3.6628317832946777,
"rewards/rejected": -4.0143585205078125,
"step": 116,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.22152535352937697,
"grad_norm": 5.370579719543457,
"learning_rate": 0.00019970148831422265,
"logits/chosen": -0.7471648454666138,
"logits/rejected": -0.7545170187950134,
"logps/chosen": -8.818143844604492,
"logps/rejected": -56.34012985229492,
"loss": 0.5391644239425659,
"memory(GiB)": 45.96,
"nll_loss": 0.3180984854698181,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.27325814962387085,
"rewards/margins": 3.91802978515625,
"rewards/rejected": -3.6447718143463135,
"step": 117,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.22341873261937165,
"grad_norm": 3.5595195293426514,
"learning_rate": 0.00019968514308364398,
"logits/chosen": -0.7581095099449158,
"logits/rejected": -0.7644103765487671,
"logps/chosen": -5.872043609619141,
"logps/rejected": -59.083518981933594,
"loss": 0.5253903865814209,
"memory(GiB)": 45.96,
"nll_loss": 0.2678287923336029,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3531153202056885,
"rewards/margins": 4.330952167510986,
"rewards/rejected": -3.977836847305298,
"step": 118,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.2253121117093663,
"grad_norm": 5.7043280601501465,
"learning_rate": 0.00019966836290805648,
"logits/chosen": -0.7545002102851868,
"logits/rejected": -0.7589887380599976,
"logps/chosen": -5.470965385437012,
"logps/rejected": -45.09376525878906,
"loss": 0.5245931148529053,
"memory(GiB)": 45.96,
"nll_loss": 0.3320286273956299,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1665220558643341,
"rewards/margins": 2.904370069503784,
"rewards/rejected": -2.7378478050231934,
"step": 119,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.22720549079936098,
"grad_norm": 9.95584774017334,
"learning_rate": 0.00019965114786067516,
"logits/chosen": -0.7246638536453247,
"logits/rejected": -0.7372928261756897,
"logps/chosen": -9.260250091552734,
"logps/rejected": -49.462730407714844,
"loss": 0.6747857928276062,
"memory(GiB)": 45.96,
"nll_loss": 0.39999300241470337,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3001291751861572,
"rewards/margins": 3.218559980392456,
"rewards/rejected": -2.918430805206299,
"step": 120,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.22909886988935566,
"grad_norm": 3.724515676498413,
"learning_rate": 0.00019963349801661252,
"logits/chosen": -0.772263765335083,
"logits/rejected": -0.7768078446388245,
"logps/chosen": -3.9073729515075684,
"logps/rejected": -37.0045051574707,
"loss": 0.4512227177619934,
"memory(GiB)": 45.96,
"nll_loss": 0.22428500652313232,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24837777018547058,
"rewards/margins": 2.6941304206848145,
"rewards/rejected": -2.4457523822784424,
"step": 121,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.23099224897935033,
"grad_norm": 3.838991403579712,
"learning_rate": 0.00019961541345287815,
"logits/chosen": -0.7484467029571533,
"logits/rejected": -0.7612442374229431,
"logps/chosen": -5.860817909240723,
"logps/rejected": -57.7578125,
"loss": 0.6650333404541016,
"memory(GiB)": 45.96,
"nll_loss": 0.44994574785232544,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3677416145801544,
"rewards/margins": 3.3471570014953613,
"rewards/rejected": -2.9794154167175293,
"step": 122,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.232885628069345,
"grad_norm": 8.47818374633789,
"learning_rate": 0.0001995968942483784,
"logits/chosen": -0.7861376404762268,
"logits/rejected": -0.7918702960014343,
"logps/chosen": -6.540744304656982,
"logps/rejected": -44.694793701171875,
"loss": 0.686521053314209,
"memory(GiB)": 45.96,
"nll_loss": 0.3082555830478668,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.23747095465660095,
"rewards/margins": 3.017436981201172,
"rewards/rejected": -2.779966115951538,
"step": 123,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.2347790071593397,
"grad_norm": 4.60905647277832,
"learning_rate": 0.00019957794048391602,
"logits/chosen": -0.7763262391090393,
"logits/rejected": -0.7869465947151184,
"logps/chosen": -3.775228261947632,
"logps/rejected": -50.85580062866211,
"loss": 0.4823143184185028,
"memory(GiB)": 45.96,
"nll_loss": 0.18497991561889648,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3380104899406433,
"rewards/margins": 3.654966115951538,
"rewards/rejected": -3.316955089569092,
"step": 124,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.23667238624933437,
"grad_norm": 8.420757293701172,
"learning_rate": 0.00019955855224218985,
"logits/chosen": -0.7525299787521362,
"logits/rejected": -0.7635971903800964,
"logps/chosen": -6.437612533569336,
"logps/rejected": -38.99058532714844,
"loss": 0.8981273174285889,
"memory(GiB)": 45.96,
"nll_loss": 0.4748547673225403,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15252822637557983,
"rewards/margins": 2.468339443206787,
"rewards/rejected": -2.3158111572265625,
"step": 125,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.23856576533932902,
"grad_norm": 4.813470363616943,
"learning_rate": 0.00019953872960779445,
"logits/chosen": -0.7726767063140869,
"logits/rejected": -0.7802519202232361,
"logps/chosen": -8.317635536193848,
"logps/rejected": -43.16456985473633,
"loss": 0.8319203853607178,
"memory(GiB)": 45.96,
"nll_loss": 0.31651198863983154,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.013967695645987988,
"rewards/margins": 2.4464800357818604,
"rewards/rejected": -2.4325122833251953,
"step": 126,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.2404591444293237,
"grad_norm": 3.016392469406128,
"learning_rate": 0.0001995184726672197,
"logits/chosen": -0.7210108637809753,
"logits/rejected": -0.7305353283882141,
"logps/chosen": -6.296525478363037,
"logps/rejected": -46.77278137207031,
"loss": 0.6447858214378357,
"memory(GiB)": 45.96,
"nll_loss": 0.3108886778354645,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26448336243629456,
"rewards/margins": 2.491849660873413,
"rewards/rejected": -2.2273662090301514,
"step": 127,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.24235252351931838,
"grad_norm": 1.984066128730774,
"learning_rate": 0.00019949778150885042,
"logits/chosen": -0.7717783451080322,
"logits/rejected": -0.7797784805297852,
"logps/chosen": -3.87850022315979,
"logps/rejected": -53.567745208740234,
"loss": 0.31897497177124023,
"memory(GiB)": 45.96,
"nll_loss": 0.15310946106910706,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2823570668697357,
"rewards/margins": 3.53421688079834,
"rewards/rejected": -3.2518601417541504,
"step": 128,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.24424590260931306,
"grad_norm": 2.775517225265503,
"learning_rate": 0.00019947665622296602,
"logits/chosen": -0.721402645111084,
"logits/rejected": -0.7311292886734009,
"logps/chosen": -3.766075611114502,
"logps/rejected": -40.414039611816406,
"loss": 0.5010823011398315,
"memory(GiB)": 45.96,
"nll_loss": 0.24178192019462585,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3318912386894226,
"rewards/margins": 2.27069091796875,
"rewards/rejected": -1.9387996196746826,
"step": 129,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.24613928169930774,
"grad_norm": 3.1850295066833496,
"learning_rate": 0.00019945509690174012,
"logits/chosen": -0.7250795960426331,
"logits/rejected": -0.7257798910140991,
"logps/chosen": -6.547388553619385,
"logps/rejected": -31.564491271972656,
"loss": 0.6416950821876526,
"memory(GiB)": 45.96,
"nll_loss": 0.2817922532558441,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.25322476029396057,
"rewards/margins": 1.9835402965545654,
"rewards/rejected": -1.7303153276443481,
"step": 130,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.24803266078930242,
"grad_norm": 3.2285263538360596,
"learning_rate": 0.00019943310363924007,
"logits/chosen": -0.7049883604049683,
"logits/rejected": -0.7214145064353943,
"logps/chosen": -7.687161445617676,
"logps/rejected": -48.23120880126953,
"loss": 0.5076671838760376,
"memory(GiB)": 45.96,
"nll_loss": 0.29537200927734375,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3577454090118408,
"rewards/margins": 2.9845407009124756,
"rewards/rejected": -2.6267952919006348,
"step": 131,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.2499260398792971,
"grad_norm": 3.9876368045806885,
"learning_rate": 0.00019941067653142657,
"logits/chosen": -0.7751510143280029,
"logits/rejected": -0.779951274394989,
"logps/chosen": -5.9425530433654785,
"logps/rejected": -44.56589126586914,
"loss": 0.7343396544456482,
"memory(GiB)": 45.96,
"nll_loss": 0.40883925557136536,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.26840847730636597,
"rewards/margins": 2.8791656494140625,
"rewards/rejected": -2.6107571125030518,
"step": 132,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.2518194189692918,
"grad_norm": 3.382171869277954,
"learning_rate": 0.00019938781567615336,
"logits/chosen": -0.7755506038665771,
"logits/rejected": -0.7845891714096069,
"logps/chosen": -7.24715518951416,
"logps/rejected": -44.12371063232422,
"loss": 0.6991584300994873,
"memory(GiB)": 45.96,
"nll_loss": 0.410519003868103,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21389470994472504,
"rewards/margins": 2.8707995414733887,
"rewards/rejected": -2.65690541267395,
"step": 133,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.2537127980592864,
"grad_norm": 5.093874931335449,
"learning_rate": 0.00019936452117316663,
"logits/chosen": -0.8056867718696594,
"logits/rejected": -0.809194803237915,
"logps/chosen": -9.516021728515625,
"logps/rejected": -56.02266311645508,
"loss": 0.6206343770027161,
"memory(GiB)": 45.96,
"nll_loss": 0.3526919484138489,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2024693489074707,
"rewards/margins": 4.063340187072754,
"rewards/rejected": -3.860870838165283,
"step": 134,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.25560617714928113,
"grad_norm": 4.6863226890563965,
"learning_rate": 0.00019934079312410467,
"logits/chosen": -0.8240848183631897,
"logits/rejected": -0.8471858501434326,
"logps/chosen": -3.86633563041687,
"logps/rejected": -100.45770263671875,
"loss": 0.33894628286361694,
"memory(GiB)": 45.96,
"nll_loss": 0.22375458478927612,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.31900501251220703,
"rewards/margins": 7.854244232177734,
"rewards/rejected": -7.535239219665527,
"step": 135,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.2574995562392758,
"grad_norm": 3.567854404449463,
"learning_rate": 0.00019931663163249742,
"logits/chosen": -0.8480275273323059,
"logits/rejected": -0.8538500070571899,
"logps/chosen": -9.888245582580566,
"logps/rejected": -45.75389099121094,
"loss": 0.6490932106971741,
"memory(GiB)": 45.96,
"nll_loss": 0.3520674705505371,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.28484463691711426,
"rewards/margins": 3.3431763648986816,
"rewards/rejected": -3.0583324432373047,
"step": 136,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.25939293532927044,
"grad_norm": 4.430754661560059,
"learning_rate": 0.000199292036803766,
"logits/chosen": -0.8859494924545288,
"logits/rejected": -0.8960965275764465,
"logps/chosen": -10.031050682067871,
"logps/rejected": -64.34874725341797,
"loss": 0.6498712301254272,
"memory(GiB)": 45.96,
"nll_loss": 0.4804614186286926,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3784683644771576,
"rewards/margins": 5.330948352813721,
"rewards/rejected": -4.952479839324951,
"step": 137,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.26128631441926514,
"grad_norm": 7.582626819610596,
"learning_rate": 0.00019926700874522228,
"logits/chosen": -0.8495133519172668,
"logits/rejected": -0.8645675778388977,
"logps/chosen": -8.528069496154785,
"logps/rejected": -57.99681854248047,
"loss": 1.0912293195724487,
"memory(GiB)": 45.96,
"nll_loss": 0.8290497064590454,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18979007005691528,
"rewards/margins": 4.3057451248168945,
"rewards/rejected": -4.115954399108887,
"step": 138,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.2631796935092598,
"grad_norm": 23.314302444458008,
"learning_rate": 0.00019924154756606837,
"logits/chosen": -0.8541093468666077,
"logits/rejected": -0.8688046932220459,
"logps/chosen": -5.522783279418945,
"logps/rejected": -79.18603515625,
"loss": 0.5735315084457397,
"memory(GiB)": 45.96,
"nll_loss": 0.3679307699203491,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20842784643173218,
"rewards/margins": 6.1773834228515625,
"rewards/rejected": -5.9689555168151855,
"step": 139,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.2650730725992545,
"grad_norm": 12.074163436889648,
"learning_rate": 0.0001992156533773962,
"logits/chosen": -0.8475787043571472,
"logits/rejected": -0.8581144213676453,
"logps/chosen": -4.404082298278809,
"logps/rejected": -69.51590728759766,
"loss": 0.6005671620368958,
"memory(GiB)": 45.96,
"nll_loss": 0.41126585006713867,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.12076976895332336,
"rewards/margins": 5.504639148712158,
"rewards/rejected": -5.383869171142578,
"step": 140,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.26696645168924915,
"grad_norm": 14.37826156616211,
"learning_rate": 0.00019918932629218693,
"logits/chosen": -0.7814698219299316,
"logits/rejected": -0.7934913039207458,
"logps/chosen": -7.017152309417725,
"logps/rejected": -53.27716827392578,
"loss": 1.1257140636444092,
"memory(GiB)": 45.96,
"nll_loss": 0.8658289909362793,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10481896996498108,
"rewards/margins": 3.3784234523773193,
"rewards/rejected": -3.273604393005371,
"step": 141,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.26885983077924386,
"grad_norm": 5.494270324707031,
"learning_rate": 0.00019916256642531064,
"logits/chosen": -0.7829540371894836,
"logits/rejected": -0.7963675856590271,
"logps/chosen": -8.385337829589844,
"logps/rejected": -51.070316314697266,
"loss": 0.7671561241149902,
"memory(GiB)": 45.96,
"nll_loss": 0.5193882584571838,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.04612942785024643,
"rewards/margins": 3.2342934608459473,
"rewards/rejected": -3.188163995742798,
"step": 142,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.2707532098692385,
"grad_norm": 10.173422813415527,
"learning_rate": 0.00019913537389352565,
"logits/chosen": -0.7792036533355713,
"logits/rejected": -0.7820754647254944,
"logps/chosen": -11.546073913574219,
"logps/rejected": -36.85886001586914,
"loss": 1.2373579740524292,
"memory(GiB)": 45.96,
"nll_loss": 0.7483444809913635,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11113296449184418,
"rewards/margins": 2.2868616580963135,
"rewards/rejected": -2.1757285594940186,
"step": 143,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.27264658895923316,
"grad_norm": 10.165970802307129,
"learning_rate": 0.000199107748815478,
"logits/chosen": -0.7335910201072693,
"logits/rejected": -0.7423563599586487,
"logps/chosen": -5.789748668670654,
"logps/rejected": -51.16117858886719,
"loss": 0.5209447741508484,
"memory(GiB)": 45.96,
"nll_loss": 0.26225852966308594,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34096524119377136,
"rewards/margins": 3.562436103820801,
"rewards/rejected": -3.221470832824707,
"step": 144,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.27453996804922787,
"grad_norm": 3.7743449211120605,
"learning_rate": 0.00019907969131170123,
"logits/chosen": -0.6795719861984253,
"logits/rejected": -0.687801718711853,
"logps/chosen": -5.778347969055176,
"logps/rejected": -36.02931213378906,
"loss": 0.746212363243103,
"memory(GiB)": 45.96,
"nll_loss": 0.41548293828964233,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.17704080045223236,
"rewards/margins": 2.0213520526885986,
"rewards/rejected": -1.8443111181259155,
"step": 145,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.2764333471392225,
"grad_norm": 8.021881103515625,
"learning_rate": 0.0001990512015046154,
"logits/chosen": -0.7164587378501892,
"logits/rejected": -0.724740207195282,
"logps/chosen": -11.131789207458496,
"logps/rejected": -47.94390869140625,
"loss": 0.7136993408203125,
"memory(GiB)": 45.96,
"nll_loss": 0.46022000908851624,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19410860538482666,
"rewards/margins": 3.1541659832000732,
"rewards/rejected": -2.960057497024536,
"step": 146,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.2783267262292172,
"grad_norm": 2.5674595832824707,
"learning_rate": 0.00019902227951852693,
"logits/chosen": -0.6974028944969177,
"logits/rejected": -0.7133046984672546,
"logps/chosen": -5.312131881713867,
"logps/rejected": -56.97577667236328,
"loss": 0.546694815158844,
"memory(GiB)": 45.96,
"nll_loss": 0.2678171694278717,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3132306933403015,
"rewards/margins": 3.396456003189087,
"rewards/rejected": -3.0832252502441406,
"step": 147,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.2802201053192119,
"grad_norm": 2.6228554248809814,
"learning_rate": 0.00019899292547962788,
"logits/chosen": -0.6645054221153259,
"logits/rejected": -0.6710233092308044,
"logps/chosen": -5.465825080871582,
"logps/rejected": -34.39421463012695,
"loss": 0.5485950112342834,
"memory(GiB)": 45.96,
"nll_loss": 0.24020352959632874,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2989718019962311,
"rewards/margins": 1.9927932024002075,
"rewards/rejected": -1.6938214302062988,
"step": 148,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.2821134844092066,
"grad_norm": 3.143923759460449,
"learning_rate": 0.0001989631395159954,
"logits/chosen": -0.6561654806137085,
"logits/rejected": -0.6622195243835449,
"logps/chosen": -4.917874813079834,
"logps/rejected": -40.90203094482422,
"loss": 0.47251078486442566,
"memory(GiB)": 45.96,
"nll_loss": 0.18277724087238312,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.34272196888923645,
"rewards/margins": 2.234957695007324,
"rewards/rejected": -1.892235517501831,
"step": 149,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.28400686349920123,
"grad_norm": 2.255929946899414,
"learning_rate": 0.00019893292175759131,
"logits/chosen": -0.700336754322052,
"logits/rejected": -0.7083441615104675,
"logps/chosen": -6.8965606689453125,
"logps/rejected": -33.876731872558594,
"loss": 0.5560379028320312,
"memory(GiB)": 45.96,
"nll_loss": 0.23617547750473022,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3127138316631317,
"rewards/margins": 1.6684951782226562,
"rewards/rejected": -1.3557813167572021,
"step": 150,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.2859002425891959,
"grad_norm": 3.593722105026245,
"learning_rate": 0.00019890227233626133,
"logits/chosen": -0.6745707392692566,
"logits/rejected": -0.6865944862365723,
"logps/chosen": -6.157535076141357,
"logps/rejected": -43.30187225341797,
"loss": 0.5548833012580872,
"memory(GiB)": 45.96,
"nll_loss": 0.3123031556606293,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37635695934295654,
"rewards/margins": 2.288217306137085,
"rewards/rejected": -1.911860466003418,
"step": 151,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.2877936216791906,
"grad_norm": 3.031252861022949,
"learning_rate": 0.0001988711913857346,
"logits/chosen": -0.6861976385116577,
"logits/rejected": -0.6901456713676453,
"logps/chosen": -6.361867427825928,
"logps/rejected": -32.86566162109375,
"loss": 0.6771292090415955,
"memory(GiB)": 45.96,
"nll_loss": 0.35346654057502747,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26746034622192383,
"rewards/margins": 1.8923015594482422,
"rewards/rejected": -1.6248412132263184,
"step": 152,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.28968700076918524,
"grad_norm": 3.878405809402466,
"learning_rate": 0.00019883967904162325,
"logits/chosen": -0.7064144611358643,
"logits/rejected": -0.7097403407096863,
"logps/chosen": -4.3548808097839355,
"logps/rejected": -32.47248458862305,
"loss": 0.5777835249900818,
"memory(GiB)": 45.96,
"nll_loss": 0.2289128601551056,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3213263750076294,
"rewards/margins": 2.1042110919952393,
"rewards/rejected": -1.7828848361968994,
"step": 153,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.29158037985917995,
"grad_norm": 3.498708724975586,
"learning_rate": 0.00019880773544142148,
"logits/chosen": -0.7486563324928284,
"logits/rejected": -0.7543911933898926,
"logps/chosen": -5.338995933532715,
"logps/rejected": -37.15753173828125,
"loss": 0.46198132634162903,
"memory(GiB)": 45.96,
"nll_loss": 0.21741318702697754,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.388688325881958,
"rewards/margins": 2.447216033935547,
"rewards/rejected": -2.058527708053589,
"step": 154,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.2934737589491746,
"grad_norm": 4.984945297241211,
"learning_rate": 0.00019877536072450527,
"logits/chosen": -0.7390610575675964,
"logits/rejected": -0.7399532794952393,
"logps/chosen": -10.968379020690918,
"logps/rejected": -33.57049560546875,
"loss": 0.718737006187439,
"memory(GiB)": 45.96,
"nll_loss": 0.3964201509952545,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.036715492606163025,
"rewards/margins": 1.7534269094467163,
"rewards/rejected": -1.7167115211486816,
"step": 155,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.29536713803916925,
"grad_norm": 7.5653076171875,
"learning_rate": 0.00019874255503213152,
"logits/chosen": -0.7588214874267578,
"logits/rejected": -0.7610840797424316,
"logps/chosen": -5.5218400955200195,
"logps/rejected": -35.822601318359375,
"loss": 0.6484081745147705,
"memory(GiB)": 45.96,
"nll_loss": 0.2997969686985016,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3626272678375244,
"rewards/margins": 2.2176332473754883,
"rewards/rejected": -1.8550057411193848,
"step": 156,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.29726051712916396,
"grad_norm": 5.305218696594238,
"learning_rate": 0.0001987093185074377,
"logits/chosen": -0.7636702656745911,
"logits/rejected": -0.7821192145347595,
"logps/chosen": -6.363223552703857,
"logps/rejected": -50.883975982666016,
"loss": 0.7150736451148987,
"memory(GiB)": 45.96,
"nll_loss": 0.47810113430023193,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28776872158050537,
"rewards/margins": 2.793571710586548,
"rewards/rejected": -2.505803108215332,
"step": 157,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.2991538962191586,
"grad_norm": 5.158674716949463,
"learning_rate": 0.00019867565129544096,
"logits/chosen": -0.7358605861663818,
"logits/rejected": -0.7439287900924683,
"logps/chosen": -7.443007469177246,
"logps/rejected": -38.113685607910156,
"loss": 0.6584007740020752,
"memory(GiB)": 45.96,
"nll_loss": 0.46212419867515564,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1576625108718872,
"rewards/margins": 2.456287384033203,
"rewards/rejected": -2.2986247539520264,
"step": 158,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.3010472753091533,
"grad_norm": 1.6912269592285156,
"learning_rate": 0.00019864155354303774,
"logits/chosen": -0.7355219125747681,
"logits/rejected": -0.7489408850669861,
"logps/chosen": -6.299466133117676,
"logps/rejected": -53.93749237060547,
"loss": 0.4212099313735962,
"memory(GiB)": 45.96,
"nll_loss": 0.3141719102859497,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.42553815245628357,
"rewards/margins": 3.6282081604003906,
"rewards/rejected": -3.202670097351074,
"step": 159,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.30294065439914797,
"grad_norm": 2.9518110752105713,
"learning_rate": 0.00019860702539900287,
"logits/chosen": -0.7960153818130493,
"logits/rejected": -0.8071813583374023,
"logps/chosen": -3.6753034591674805,
"logps/rejected": -49.42953872680664,
"loss": 0.40266910195350647,
"memory(GiB)": 45.96,
"nll_loss": 0.17762762308120728,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2651080787181854,
"rewards/margins": 3.387268304824829,
"rewards/rejected": -3.1221606731414795,
"step": 160,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.3048340334891427,
"grad_norm": 3.5469512939453125,
"learning_rate": 0.00019857206701398916,
"logits/chosen": -0.8305792808532715,
"logits/rejected": -0.8400905728340149,
"logps/chosen": -5.762335300445557,
"logps/rejected": -47.677391052246094,
"loss": 0.5519442558288574,
"memory(GiB)": 45.96,
"nll_loss": 0.2981826364994049,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3638038635253906,
"rewards/margins": 3.451838493347168,
"rewards/rejected": -3.0880346298217773,
"step": 161,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.3067274125791373,
"grad_norm": 2.6079318523406982,
"learning_rate": 0.00019853667854052663,
"logits/chosen": -0.8280395865440369,
"logits/rejected": -0.8434029221534729,
"logps/chosen": -4.625239849090576,
"logps/rejected": -66.49324798583984,
"loss": 0.4290291368961334,
"memory(GiB)": 45.96,
"nll_loss": 0.20821890234947205,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.35179567337036133,
"rewards/margins": 4.545844078063965,
"rewards/rejected": -4.1940484046936035,
"step": 162,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.308620791669132,
"grad_norm": 2.6247661113739014,
"learning_rate": 0.00019850086013302177,
"logits/chosen": -0.8385536074638367,
"logits/rejected": -0.8439200520515442,
"logps/chosen": -5.475846290588379,
"logps/rejected": -41.36055374145508,
"loss": 0.5085667371749878,
"memory(GiB)": 45.96,
"nll_loss": 0.22582083940505981,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.21153010427951813,
"rewards/margins": 2.7622647285461426,
"rewards/rejected": -2.550734519958496,
"step": 163,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3105141707591267,
"grad_norm": 4.81837797164917,
"learning_rate": 0.00019846461194775712,
"logits/chosen": -0.8339718580245972,
"logits/rejected": -0.8418379426002502,
"logps/chosen": -6.669006824493408,
"logps/rejected": -50.45562744140625,
"loss": 0.44998225569725037,
"memory(GiB)": 45.96,
"nll_loss": 0.24861308932304382,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22774268686771393,
"rewards/margins": 3.316464900970459,
"rewards/rejected": -3.0887222290039062,
"step": 164,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.31240754984912134,
"grad_norm": 18.49859619140625,
"learning_rate": 0.00019842793414289025,
"logits/chosen": -0.8581401109695435,
"logits/rejected": -0.8685382008552551,
"logps/chosen": -8.510130882263184,
"logps/rejected": -42.820594787597656,
"loss": 1.1465768814086914,
"memory(GiB)": 45.96,
"nll_loss": 0.8463043570518494,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06564593315124512,
"rewards/margins": 2.910576343536377,
"rewards/rejected": -2.844930410385132,
"step": 165,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.31430092893911604,
"grad_norm": 3.5281901359558105,
"learning_rate": 0.00019839082687845335,
"logits/chosen": -0.8467564582824707,
"logits/rejected": -0.8614873886108398,
"logps/chosen": -4.1369709968566895,
"logps/rejected": -45.932647705078125,
"loss": 0.5405523180961609,
"memory(GiB)": 45.96,
"nll_loss": 0.36477237939834595,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.43693381547927856,
"rewards/margins": 2.8673934936523438,
"rewards/rejected": -2.430459499359131,
"step": 166,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.3161943080291107,
"grad_norm": 6.309659481048584,
"learning_rate": 0.00019835329031635236,
"logits/chosen": -0.875261664390564,
"logits/rejected": -0.8817040920257568,
"logps/chosen": -6.334891319274902,
"logps/rejected": -44.5136604309082,
"loss": 0.6270987391471863,
"memory(GiB)": 45.96,
"nll_loss": 0.4417693614959717,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2866978049278259,
"rewards/margins": 3.0005598068237305,
"rewards/rejected": -2.7138617038726807,
"step": 167,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.3180876871191054,
"grad_norm": 2.7777206897735596,
"learning_rate": 0.00019831532462036636,
"logits/chosen": -0.8659749031066895,
"logits/rejected": -0.8756385445594788,
"logps/chosen": -4.664763450622559,
"logps/rejected": -47.90147399902344,
"loss": 0.40055564045906067,
"memory(GiB)": 45.96,
"nll_loss": 0.19673526287078857,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26774388551712036,
"rewards/margins": 3.2054920196533203,
"rewards/rejected": -2.9377481937408447,
"step": 168,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.31998106620910005,
"grad_norm": 3.458099126815796,
"learning_rate": 0.00019827692995614684,
"logits/chosen": -0.8792099952697754,
"logits/rejected": -0.9006062150001526,
"logps/chosen": -3.765416383743286,
"logps/rejected": -60.21432113647461,
"loss": 0.2773051857948303,
"memory(GiB)": 45.96,
"nll_loss": 0.18920491635799408,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4749259054660797,
"rewards/margins": 4.124298572540283,
"rewards/rejected": -3.6493725776672363,
"step": 169,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3218744452990947,
"grad_norm": 8.359429359436035,
"learning_rate": 0.00019823810649121688,
"logits/chosen": -0.8826816082000732,
"logits/rejected": -0.8891168832778931,
"logps/chosen": -8.386528968811035,
"logps/rejected": -48.619346618652344,
"loss": 0.778719425201416,
"memory(GiB)": 45.96,
"nll_loss": 0.31902748346328735,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09863989800214767,
"rewards/margins": 3.2789182662963867,
"rewards/rejected": -3.1802785396575928,
"step": 170,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.3237678243890894,
"grad_norm": 13.873231887817383,
"learning_rate": 0.00019819885439497064,
"logits/chosen": -0.9619755744934082,
"logits/rejected": -0.9695166349411011,
"logps/chosen": -5.436773300170898,
"logps/rejected": -59.05510711669922,
"loss": 0.5205389261245728,
"memory(GiB)": 45.96,
"nll_loss": 0.34230145812034607,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24220561981201172,
"rewards/margins": 4.29957914352417,
"rewards/rejected": -4.057373046875,
"step": 171,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.32566120347908406,
"grad_norm": 3.8463759422302246,
"learning_rate": 0.0001981591738386723,
"logits/chosen": -0.9225479960441589,
"logits/rejected": -0.9369975924491882,
"logps/chosen": -8.551187515258789,
"logps/rejected": -47.00754165649414,
"loss": 0.6620715260505676,
"memory(GiB)": 45.96,
"nll_loss": 0.4425104558467865,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32423532009124756,
"rewards/margins": 3.5909903049468994,
"rewards/rejected": -3.2667555809020996,
"step": 172,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.32755458256907877,
"grad_norm": 3.727912425994873,
"learning_rate": 0.00019811906499545562,
"logits/chosen": -0.9073245525360107,
"logits/rejected": -0.9162495732307434,
"logps/chosen": -5.982071876525879,
"logps/rejected": -50.51770782470703,
"loss": 0.5481733083724976,
"memory(GiB)": 45.96,
"nll_loss": 0.3087068498134613,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.32423850893974304,
"rewards/margins": 3.5125081539154053,
"rewards/rejected": -3.188269853591919,
"step": 173,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3294479616590734,
"grad_norm": 2.11468505859375,
"learning_rate": 0.00019807852804032305,
"logits/chosen": -0.9244458079338074,
"logits/rejected": -0.933106541633606,
"logps/chosen": -4.452414035797119,
"logps/rejected": -54.93663787841797,
"loss": 0.40622979402542114,
"memory(GiB)": 45.96,
"nll_loss": 0.24508938193321228,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4698372185230255,
"rewards/margins": 4.054183006286621,
"rewards/rejected": -3.584345817565918,
"step": 174,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3313413407490681,
"grad_norm": 2.2816247940063477,
"learning_rate": 0.0001980375631501449,
"logits/chosen": -0.8938907980918884,
"logits/rejected": -0.9044409990310669,
"logps/chosen": -6.407214164733887,
"logps/rejected": -41.67128372192383,
"loss": 0.517264187335968,
"memory(GiB)": 45.96,
"nll_loss": 0.23160898685455322,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16628842055797577,
"rewards/margins": 2.5896196365356445,
"rewards/rejected": -2.4233314990997314,
"step": 175,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.3332347198390628,
"grad_norm": 8.774862289428711,
"learning_rate": 0.0001979961705036587,
"logits/chosen": -0.9432955384254456,
"logits/rejected": -0.9490511417388916,
"logps/chosen": -9.636987686157227,
"logps/rejected": -32.12892150878906,
"loss": 0.8658261299133301,
"memory(GiB)": 45.96,
"nll_loss": 0.4186471104621887,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2648793160915375,
"rewards/margins": 1.9339655637741089,
"rewards/rejected": -1.6690863370895386,
"step": 176,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.3351280989290574,
"grad_norm": 2.58535099029541,
"learning_rate": 0.00019795435028146832,
"logits/chosen": -0.9230942130088806,
"logits/rejected": -0.9304215312004089,
"logps/chosen": -5.531979084014893,
"logps/rejected": -39.95973205566406,
"loss": 0.517862856388092,
"memory(GiB)": 45.96,
"nll_loss": 0.21315467357635498,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.38708987832069397,
"rewards/margins": 2.6242735385894775,
"rewards/rejected": -2.2371835708618164,
"step": 177,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.33702147801905213,
"grad_norm": 2.765552520751953,
"learning_rate": 0.00019791210266604327,
"logits/chosen": -0.9633134007453918,
"logits/rejected": -0.9681880474090576,
"logps/chosen": -9.997314453125,
"logps/rejected": -49.51629638671875,
"loss": 0.5439927577972412,
"memory(GiB)": 45.96,
"nll_loss": 0.3282304108142853,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16391798853874207,
"rewards/margins": 3.436600685119629,
"rewards/rejected": -3.2726829051971436,
"step": 178,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3389148571090468,
"grad_norm": 6.450003623962402,
"learning_rate": 0.00019786942784171782,
"logits/chosen": -0.9957299828529358,
"logits/rejected": -1.0053359270095825,
"logps/chosen": -5.161239147186279,
"logps/rejected": -50.02446365356445,
"loss": 0.6050621271133423,
"memory(GiB)": 45.96,
"nll_loss": 0.35807108879089355,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34535130858421326,
"rewards/margins": 3.329792022705078,
"rewards/rejected": -2.984440565109253,
"step": 179,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3408082361990415,
"grad_norm": 13.34005355834961,
"learning_rate": 0.0001978263259946903,
"logits/chosen": -0.9830922484397888,
"logits/rejected": -0.9981817603111267,
"logps/chosen": -5.311959266662598,
"logps/rejected": -53.79689025878906,
"loss": 0.7078217267990112,
"memory(GiB)": 45.96,
"nll_loss": 0.4622059464454651,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2304527461528778,
"rewards/margins": 3.5389761924743652,
"rewards/rejected": -3.308523654937744,
"step": 180,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.34270161528903614,
"grad_norm": 2.397674798965454,
"learning_rate": 0.00019778279731302208,
"logits/chosen": -1.0014008283615112,
"logits/rejected": -1.0088224411010742,
"logps/chosen": -3.664111852645874,
"logps/rejected": -58.612579345703125,
"loss": 0.4614037573337555,
"memory(GiB)": 45.96,
"nll_loss": 0.28485679626464844,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29827213287353516,
"rewards/margins": 4.444318771362305,
"rewards/rejected": -4.1460466384887695,
"step": 181,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.34459499437903085,
"grad_norm": 3.9618663787841797,
"learning_rate": 0.00019773884198663702,
"logits/chosen": -1.0462435483932495,
"logits/rejected": -1.0496163368225098,
"logps/chosen": -5.64785623550415,
"logps/rejected": -44.06422805786133,
"loss": 0.4265408515930176,
"memory(GiB)": 45.96,
"nll_loss": 0.28328245878219604,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3340551257133484,
"rewards/margins": 3.536937952041626,
"rewards/rejected": -3.202882766723633,
"step": 182,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.3464883734690255,
"grad_norm": 17.443655014038086,
"learning_rate": 0.0001976944602073205,
"logits/chosen": -1.0237135887145996,
"logits/rejected": -1.035752296447754,
"logps/chosen": -6.11564302444458,
"logps/rejected": -62.04539108276367,
"loss": 0.6523773074150085,
"memory(GiB)": 45.96,
"nll_loss": 0.4753287136554718,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09037357568740845,
"rewards/margins": 4.670170783996582,
"rewards/rejected": -4.57979679107666,
"step": 183,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.34838175255902015,
"grad_norm": 5.512650966644287,
"learning_rate": 0.00019764965216871846,
"logits/chosen": -1.0302878618240356,
"logits/rejected": -1.0458002090454102,
"logps/chosen": -3.419121742248535,
"logps/rejected": -63.38270950317383,
"loss": 0.49930378794670105,
"memory(GiB)": 45.96,
"nll_loss": 0.3524174690246582,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2955472469329834,
"rewards/margins": 4.947563648223877,
"rewards/rejected": -4.6520161628723145,
"step": 184,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.35027513164901486,
"grad_norm": 6.747854232788086,
"learning_rate": 0.0001976044180663369,
"logits/chosen": -1.0561788082122803,
"logits/rejected": -1.0584559440612793,
"logps/chosen": -8.470739364624023,
"logps/rejected": -50.98492431640625,
"loss": 0.6530550718307495,
"memory(GiB)": 45.96,
"nll_loss": 0.5211396813392639,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.29809102416038513,
"rewards/margins": 3.9881184101104736,
"rewards/rejected": -3.6900272369384766,
"step": 185,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.3521685107390095,
"grad_norm": 6.5586652755737305,
"learning_rate": 0.00019755875809754068,
"logits/chosen": -1.0228182077407837,
"logits/rejected": -1.0410220623016357,
"logps/chosen": -7.406016826629639,
"logps/rejected": -69.44340515136719,
"loss": 0.6502223610877991,
"memory(GiB)": 45.96,
"nll_loss": 0.5331264734268188,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.19563554227352142,
"rewards/margins": 4.833287239074707,
"rewards/rejected": -4.6376519203186035,
"step": 186,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.3540618898290042,
"grad_norm": 5.859078407287598,
"learning_rate": 0.0001975126724615528,
"logits/chosen": -1.0921781063079834,
"logits/rejected": -1.1058279275894165,
"logps/chosen": -5.384334564208984,
"logps/rejected": -77.71084594726562,
"loss": 0.4395386874675751,
"memory(GiB)": 45.96,
"nll_loss": 0.31949254870414734,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4337487518787384,
"rewards/margins": 6.361716270446777,
"rewards/rejected": -5.927967071533203,
"step": 187,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.35595526891899887,
"grad_norm": 15.831610679626465,
"learning_rate": 0.00019746616135945356,
"logits/chosen": -1.0272451639175415,
"logits/rejected": -1.0303428173065186,
"logps/chosen": -12.975401878356934,
"logps/rejected": -74.52774810791016,
"loss": 1.1604161262512207,
"memory(GiB)": 45.96,
"nll_loss": 0.6281093955039978,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2834433913230896,
"rewards/margins": 5.4041290283203125,
"rewards/rejected": -5.687572002410889,
"step": 188,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.3578486480089936,
"grad_norm": 18.28084373474121,
"learning_rate": 0.00019741922499417967,
"logits/chosen": -1.0908275842666626,
"logits/rejected": -1.1018905639648438,
"logps/chosen": -11.791484832763672,
"logps/rejected": -81.34092712402344,
"loss": 0.8243842124938965,
"memory(GiB)": 45.96,
"nll_loss": 0.48044607043266296,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.19179318845272064,
"rewards/margins": 6.231574058532715,
"rewards/rejected": -6.423367500305176,
"step": 189,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.3597420270989882,
"grad_norm": 5.565955638885498,
"learning_rate": 0.00019737186357052323,
"logits/chosen": -1.049489140510559,
"logits/rejected": -1.0638219118118286,
"logps/chosen": -11.849400520324707,
"logps/rejected": -77.38867950439453,
"loss": 0.8963607549667358,
"memory(GiB)": 45.96,
"nll_loss": 0.4650379419326782,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.17283156514167786,
"rewards/margins": 5.426693916320801,
"rewards/rejected": -5.5995259284973145,
"step": 190,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.3616354061889829,
"grad_norm": 14.447429656982422,
"learning_rate": 0.00019732407729513107,
"logits/chosen": -0.9934099912643433,
"logits/rejected": -1.0042476654052734,
"logps/chosen": -7.797165393829346,
"logps/rejected": -61.078086853027344,
"loss": 0.9133828282356262,
"memory(GiB)": 45.96,
"nll_loss": 0.5914595127105713,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.22981007397174835,
"rewards/margins": 4.205626964569092,
"rewards/rejected": -3.975816488265991,
"step": 191,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.3635287852789776,
"grad_norm": 3.4415605068206787,
"learning_rate": 0.00019727586637650373,
"logits/chosen": -0.938055694103241,
"logits/rejected": -0.9400723576545715,
"logps/chosen": -8.713332176208496,
"logps/rejected": -31.563758850097656,
"loss": 0.8647351264953613,
"memory(GiB)": 45.96,
"nll_loss": 0.3555485010147095,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.26367247104644775,
"rewards/margins": 1.897101879119873,
"rewards/rejected": -1.6334295272827148,
"step": 192,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.36542216436897224,
"grad_norm": 2.8079140186309814,
"learning_rate": 0.00019722723102499445,
"logits/chosen": -0.9127380847930908,
"logits/rejected": -0.9193118810653687,
"logps/chosen": -9.860222816467285,
"logps/rejected": -32.82182312011719,
"loss": 0.7513078451156616,
"memory(GiB)": 45.96,
"nll_loss": 0.45012104511260986,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.39801499247550964,
"rewards/margins": 1.9368736743927002,
"rewards/rejected": -1.5388586521148682,
"step": 193,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.36731554345896694,
"grad_norm": 2.0083696842193604,
"learning_rate": 0.00019717817145280844,
"logits/chosen": -0.8076668381690979,
"logits/rejected": -0.8209682703018188,
"logps/chosen": -4.274347305297852,
"logps/rejected": -33.934600830078125,
"loss": 0.4636756479740143,
"memory(GiB)": 45.96,
"nll_loss": 0.23125851154327393,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4366719722747803,
"rewards/margins": 1.8356088399887085,
"rewards/rejected": -1.3989369869232178,
"step": 194,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.3692089225489616,
"grad_norm": 2.961672782897949,
"learning_rate": 0.0001971286878740018,
"logits/chosen": -0.8038672804832458,
"logits/rejected": -0.8188544511795044,
"logps/chosen": -5.464829921722412,
"logps/rejected": -35.65196990966797,
"loss": 0.5770344138145447,
"memory(GiB)": 45.96,
"nll_loss": 0.28108230233192444,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41526705026626587,
"rewards/margins": 1.6502375602722168,
"rewards/rejected": -1.2349704504013062,
"step": 195,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.3711023016389563,
"grad_norm": 2.441650867462158,
"learning_rate": 0.0001970787805044807,
"logits/chosen": -0.7855252027511597,
"logits/rejected": -0.7945607900619507,
"logps/chosen": -5.450367450714111,
"logps/rejected": -29.437000274658203,
"loss": 0.729956328868866,
"memory(GiB)": 45.96,
"nll_loss": 0.3391174077987671,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.34154844284057617,
"rewards/margins": 1.204176664352417,
"rewards/rejected": -0.8626283407211304,
"step": 196,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.37299568072895095,
"grad_norm": 2.670504570007324,
"learning_rate": 0.0001970284495620004,
"logits/chosen": -0.7562150359153748,
"logits/rejected": -0.7687780857086182,
"logps/chosen": -5.965810775756836,
"logps/rejected": -28.51659393310547,
"loss": 0.649283230304718,
"memory(GiB)": 45.96,
"nll_loss": 0.24607613682746887,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.30883094668388367,
"rewards/margins": 1.3016407489776611,
"rewards/rejected": -0.9928098320960999,
"step": 197,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.3748890598189456,
"grad_norm": 2.004596710205078,
"learning_rate": 0.0001969776952661642,
"logits/chosen": -0.7988819479942322,
"logits/rejected": -0.8083655834197998,
"logps/chosen": -3.273776054382324,
"logps/rejected": -36.80686569213867,
"loss": 0.399419903755188,
"memory(GiB)": 45.96,
"nll_loss": 0.09559443593025208,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.32672712206840515,
"rewards/margins": 2.123263120651245,
"rewards/rejected": -1.7965359687805176,
"step": 198,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.3767824389089403,
"grad_norm": 3.9536526203155518,
"learning_rate": 0.00019692651783842266,
"logits/chosen": -0.847248911857605,
"logits/rejected": -0.855591893196106,
"logps/chosen": -5.48413610458374,
"logps/rejected": -42.407466888427734,
"loss": 0.744387149810791,
"memory(GiB)": 45.96,
"nll_loss": 0.44560301303863525,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3550267219543457,
"rewards/margins": 2.79954195022583,
"rewards/rejected": -2.4445152282714844,
"step": 199,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.37867581799893496,
"grad_norm": 3.1670258045196533,
"learning_rate": 0.00019687491750207254,
"logits/chosen": -0.8439433574676514,
"logits/rejected": -0.8627237677574158,
"logps/chosen": -7.741463661193848,
"logps/rejected": -68.83930206298828,
"loss": 0.5499181747436523,
"memory(GiB)": 45.96,
"nll_loss": 0.43246734142303467,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2407217025756836,
"rewards/margins": 4.725229263305664,
"rewards/rejected": -4.4845075607299805,
"step": 200,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.38056919708892967,
"grad_norm": 2.094644069671631,
"learning_rate": 0.00019682289448225574,
"logits/chosen": -0.8863729238510132,
"logits/rejected": -0.8907830715179443,
"logps/chosen": -7.671055316925049,
"logps/rejected": -44.41012954711914,
"loss": 0.4959008991718292,
"memory(GiB)": 45.96,
"nll_loss": 0.26474902033805847,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3542103171348572,
"rewards/margins": 3.474036693572998,
"rewards/rejected": -3.119826555252075,
"step": 201,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.3824625761789243,
"grad_norm": 11.448583602905273,
"learning_rate": 0.00019677044900595853,
"logits/chosen": -0.8807945251464844,
"logits/rejected": -0.8872815370559692,
"logps/chosen": -11.44729995727539,
"logps/rejected": -62.735740661621094,
"loss": 1.1596614122390747,
"memory(GiB)": 45.96,
"nll_loss": 0.688713014125824,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.03281363099813461,
"rewards/margins": 4.351940155029297,
"rewards/rejected": -4.384753704071045,
"step": 202,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.384355955268919,
"grad_norm": 6.370971202850342,
"learning_rate": 0.00019671758130201033,
"logits/chosen": -0.8891761898994446,
"logits/rejected": -0.893890917301178,
"logps/chosen": -12.073139190673828,
"logps/rejected": -69.95759582519531,
"loss": 0.7996310591697693,
"memory(GiB)": 45.96,
"nll_loss": 0.44943156838417053,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06105910986661911,
"rewards/margins": 5.00841760635376,
"rewards/rejected": -4.94735860824585,
"step": 203,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.3862493343589137,
"grad_norm": 15.760053634643555,
"learning_rate": 0.0001966642916010829,
"logits/chosen": -0.815875768661499,
"logits/rejected": -0.8287965655326843,
"logps/chosen": -7.0843329429626465,
"logps/rejected": -74.68546295166016,
"loss": 1.1046340465545654,
"memory(GiB)": 45.96,
"nll_loss": 0.742209792137146,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12297496199607849,
"rewards/margins": 5.271447658538818,
"rewards/rejected": -5.148472785949707,
"step": 204,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.3881427134489083,
"grad_norm": 6.462108135223389,
"learning_rate": 0.0001966105801356892,
"logits/chosen": -0.8428470492362976,
"logits/rejected": -0.8488373160362244,
"logps/chosen": -5.4728593826293945,
"logps/rejected": -46.639549255371094,
"loss": 0.5182836055755615,
"memory(GiB)": 45.96,
"nll_loss": 0.28622910380363464,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.32224246859550476,
"rewards/margins": 3.5525856018066406,
"rewards/rejected": -3.2303428649902344,
"step": 205,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.39003609253890303,
"grad_norm": 10.162330627441406,
"learning_rate": 0.00019655644714018243,
"logits/chosen": -0.8311890959739685,
"logits/rejected": -0.8424821496009827,
"logps/chosen": -8.355030059814453,
"logps/rejected": -51.8420295715332,
"loss": 0.6847360730171204,
"memory(GiB)": 45.96,
"nll_loss": 0.3994583189487457,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.22317469120025635,
"rewards/margins": 3.7131669521331787,
"rewards/rejected": -3.489992141723633,
"step": 206,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.3919294716288977,
"grad_norm": 46.052215576171875,
"learning_rate": 0.00019650189285075508,
"logits/chosen": -0.8170652389526367,
"logits/rejected": -0.8271661400794983,
"logps/chosen": -4.059424877166748,
"logps/rejected": -59.41645431518555,
"loss": 0.48422518372535706,
"memory(GiB)": 45.96,
"nll_loss": 0.34698107838630676,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3219386041164398,
"rewards/margins": 4.430522918701172,
"rewards/rejected": -4.108584403991699,
"step": 207,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.3938228507188924,
"grad_norm": 6.666492938995361,
"learning_rate": 0.00019644691750543767,
"logits/chosen": -0.7725352048873901,
"logits/rejected": -0.7822741270065308,
"logps/chosen": -5.679694175720215,
"logps/rejected": -48.45197296142578,
"loss": 0.4621519148349762,
"memory(GiB)": 45.96,
"nll_loss": 0.2669067084789276,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2976520359516144,
"rewards/margins": 3.225492238998413,
"rewards/rejected": -2.9278407096862793,
"step": 208,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.39571622980888704,
"grad_norm": 5.6893768310546875,
"learning_rate": 0.00019639152134409804,
"logits/chosen": -0.735471785068512,
"logits/rejected": -0.7498069405555725,
"logps/chosen": -6.4797258377075195,
"logps/rejected": -64.09175872802734,
"loss": 0.4735986888408661,
"memory(GiB)": 45.96,
"nll_loss": 0.3434915244579315,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32974106073379517,
"rewards/margins": 3.6602020263671875,
"rewards/rejected": -3.330461025238037,
"step": 209,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.39760960889888175,
"grad_norm": 16.44124984741211,
"learning_rate": 0.00019633570460844002,
"logits/chosen": -0.7513502836227417,
"logits/rejected": -0.7627707719802856,
"logps/chosen": -7.414983749389648,
"logps/rejected": -51.88617706298828,
"loss": 0.6197516918182373,
"memory(GiB)": 45.96,
"nll_loss": 0.45195478200912476,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.28587087988853455,
"rewards/margins": 3.576326847076416,
"rewards/rejected": -3.2904555797576904,
"step": 210,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.3995029879888764,
"grad_norm": 5.624166965484619,
"learning_rate": 0.00019627946754200253,
"logits/chosen": -0.7246634364128113,
"logits/rejected": -0.7336344718933105,
"logps/chosen": -8.098308563232422,
"logps/rejected": -55.1407356262207,
"loss": 0.48521894216537476,
"memory(GiB)": 45.96,
"nll_loss": 0.3496650457382202,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3241997957229614,
"rewards/margins": 3.7958688735961914,
"rewards/rejected": -3.4716691970825195,
"step": 211,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.40139636707887105,
"grad_norm": 1.7889741659164429,
"learning_rate": 0.00019622281039015843,
"logits/chosen": -0.7441357374191284,
"logits/rejected": -0.7580739855766296,
"logps/chosen": -3.684328556060791,
"logps/rejected": -56.209293365478516,
"loss": 0.33327439427375793,
"memory(GiB)": 45.96,
"nll_loss": 0.20535799860954285,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.30587002635002136,
"rewards/margins": 3.881227970123291,
"rewards/rejected": -3.5753583908081055,
"step": 212,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.40328974616886576,
"grad_norm": 2.787834882736206,
"learning_rate": 0.00019616573340011355,
"logits/chosen": -0.7508048415184021,
"logits/rejected": -0.7553164958953857,
"logps/chosen": -4.937004089355469,
"logps/rejected": -43.78971862792969,
"loss": 0.5410025119781494,
"memory(GiB)": 45.96,
"nll_loss": 0.29258573055267334,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.41944828629493713,
"rewards/margins": 3.099458694458008,
"rewards/rejected": -2.6800098419189453,
"step": 213,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.4051831252588604,
"grad_norm": 12.853190422058105,
"learning_rate": 0.0001961082368209055,
"logits/chosen": -0.7836991548538208,
"logits/rejected": -0.7966538667678833,
"logps/chosen": -4.6951093673706055,
"logps/rejected": -51.65924835205078,
"loss": 0.9481589794158936,
"memory(GiB)": 45.96,
"nll_loss": 0.49695920944213867,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.05445462837815285,
"rewards/margins": 3.114589214324951,
"rewards/rejected": -3.0601344108581543,
"step": 214,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.4070765043488551,
"grad_norm": 5.1839704513549805,
"learning_rate": 0.00019605032090340267,
"logits/chosen": -0.8062314987182617,
"logits/rejected": -0.8129691481590271,
"logps/chosen": -4.397279739379883,
"logps/rejected": -42.56846237182617,
"loss": 0.7058886289596558,
"memory(GiB)": 45.96,
"nll_loss": 0.34186726808547974,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12627288699150085,
"rewards/margins": 2.8559820652008057,
"rewards/rejected": -2.7297093868255615,
"step": 215,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.40896988343884977,
"grad_norm": 2.8434062004089355,
"learning_rate": 0.0001959919859003031,
"logits/chosen": -0.7388439178466797,
"logits/rejected": -0.7492343187332153,
"logps/chosen": -3.2313055992126465,
"logps/rejected": -54.10618591308594,
"loss": 0.33251953125,
"memory(GiB)": 45.96,
"nll_loss": 0.20878179371356964,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.42627185583114624,
"rewards/margins": 3.7635509967803955,
"rewards/rejected": -3.3372793197631836,
"step": 216,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4108632625288444,
"grad_norm": 3.8040099143981934,
"learning_rate": 0.00019593323206613331,
"logits/chosen": -0.7919730544090271,
"logits/rejected": -0.8036046028137207,
"logps/chosen": -7.406411647796631,
"logps/rejected": -57.45484924316406,
"loss": 0.6115871667861938,
"memory(GiB)": 45.96,
"nll_loss": 0.32974275946617126,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.29590100049972534,
"rewards/margins": 3.664919376373291,
"rewards/rejected": -3.369018077850342,
"step": 217,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4127566416188391,
"grad_norm": 2.7392921447753906,
"learning_rate": 0.0001958740596572474,
"logits/chosen": -0.7719218730926514,
"logits/rejected": -0.7802299857139587,
"logps/chosen": -2.140526056289673,
"logps/rejected": -53.021087646484375,
"loss": 0.328443706035614,
"memory(GiB)": 45.96,
"nll_loss": 0.12891747057437897,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3535212278366089,
"rewards/margins": 3.531355381011963,
"rewards/rejected": -3.1778340339660645,
"step": 218,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4146500207088338,
"grad_norm": 2.372682809829712,
"learning_rate": 0.00019581446893182565,
"logits/chosen": -0.7669311165809631,
"logits/rejected": -0.7759067416191101,
"logps/chosen": -4.876304626464844,
"logps/rejected": -45.05213928222656,
"loss": 0.42399588227272034,
"memory(GiB)": 45.96,
"nll_loss": 0.17316851019859314,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3615014851093292,
"rewards/margins": 2.848667621612549,
"rewards/rejected": -2.487166166305542,
"step": 219,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4165433997988285,
"grad_norm": 2.5566980838775635,
"learning_rate": 0.00019575446014987363,
"logits/chosen": -0.7663781046867371,
"logits/rejected": -0.7778026461601257,
"logps/chosen": -9.037557601928711,
"logps/rejected": -41.32817459106445,
"loss": 0.670400857925415,
"memory(GiB)": 45.96,
"nll_loss": 0.3820984661579132,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2986691892147064,
"rewards/margins": 2.576287031173706,
"rewards/rejected": -2.2776176929473877,
"step": 220,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.41843677888882314,
"grad_norm": 2.0137414932250977,
"learning_rate": 0.0001956940335732209,
"logits/chosen": -0.7961980104446411,
"logits/rejected": -0.8072370290756226,
"logps/chosen": -5.287474632263184,
"logps/rejected": -52.39486312866211,
"loss": 0.4247521758079529,
"memory(GiB)": 45.96,
"nll_loss": 0.2258274108171463,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.46624377369880676,
"rewards/margins": 3.2418112754821777,
"rewards/rejected": -2.7755677700042725,
"step": 221,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.42033015797881784,
"grad_norm": 9.485119819641113,
"learning_rate": 0.00019563318946551998,
"logits/chosen": -0.7868661880493164,
"logits/rejected": -0.7932162880897522,
"logps/chosen": -4.125566482543945,
"logps/rejected": -41.510528564453125,
"loss": 0.45158693194389343,
"memory(GiB)": 45.96,
"nll_loss": 0.2398645132780075,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3339860439300537,
"rewards/margins": 2.9751968383789062,
"rewards/rejected": -2.6412105560302734,
"step": 222,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.4222235370688125,
"grad_norm": 1.728522777557373,
"learning_rate": 0.00019557192809224513,
"logits/chosen": -0.8158318996429443,
"logits/rejected": -0.8269481062889099,
"logps/chosen": -6.187929630279541,
"logps/rejected": -65.49488830566406,
"loss": 0.3769925534725189,
"memory(GiB)": 45.96,
"nll_loss": 0.20739418268203735,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.5454128980636597,
"rewards/margins": 3.809990882873535,
"rewards/rejected": -3.264577865600586,
"step": 223,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.42411691615880714,
"grad_norm": 3.2084922790527344,
"learning_rate": 0.00019551024972069126,
"logits/chosen": -0.765777051448822,
"logits/rejected": -0.7758392095565796,
"logps/chosen": -5.901573181152344,
"logps/rejected": -52.30465316772461,
"loss": 0.618301272392273,
"memory(GiB)": 45.96,
"nll_loss": 0.3325042426586151,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.33851462602615356,
"rewards/margins": 2.8817224502563477,
"rewards/rejected": -2.5432076454162598,
"step": 224,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.42601029524880185,
"grad_norm": 3.7956161499023438,
"learning_rate": 0.00019544815461997264,
"logits/chosen": -0.8206179141998291,
"logits/rejected": -0.8290830850601196,
"logps/chosen": -5.066240310668945,
"logps/rejected": -51.627464294433594,
"loss": 0.5323878526687622,
"memory(GiB)": 45.96,
"nll_loss": 0.34584906697273254,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36647719144821167,
"rewards/margins": 3.2682008743286133,
"rewards/rejected": -2.9017233848571777,
"step": 225,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4279036743387965,
"grad_norm": 6.160758972167969,
"learning_rate": 0.00019538564306102195,
"logits/chosen": -0.8133172988891602,
"logits/rejected": -0.8209658861160278,
"logps/chosen": -7.938709259033203,
"logps/rejected": -49.04197311401367,
"loss": 0.6256651878356934,
"memory(GiB)": 45.96,
"nll_loss": 0.45015066862106323,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21895331144332886,
"rewards/margins": 3.475795269012451,
"rewards/rejected": -3.2568421363830566,
"step": 226,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4297970534287912,
"grad_norm": 3.3720943927764893,
"learning_rate": 0.00019532271531658878,
"logits/chosen": -0.8342875242233276,
"logits/rejected": -0.8426697254180908,
"logps/chosen": -5.65493106842041,
"logps/rejected": -56.189483642578125,
"loss": 0.550865888595581,
"memory(GiB)": 45.96,
"nll_loss": 0.32167327404022217,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18321865797042847,
"rewards/margins": 4.062854766845703,
"rewards/rejected": -3.879636287689209,
"step": 227,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.43169043251878586,
"grad_norm": 7.045608043670654,
"learning_rate": 0.00019525937166123877,
"logits/chosen": -0.8390461802482605,
"logits/rejected": -0.848449170589447,
"logps/chosen": -4.815664768218994,
"logps/rejected": -59.5663948059082,
"loss": 0.5792067050933838,
"memory(GiB)": 45.96,
"nll_loss": 0.35179653763771057,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08492806553840637,
"rewards/margins": 3.999222993850708,
"rewards/rejected": -3.914294719696045,
"step": 228,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.43358381160878057,
"grad_norm": 3.3884899616241455,
"learning_rate": 0.00019519561237135214,
"logits/chosen": -0.8333678841590881,
"logits/rejected": -0.8382862210273743,
"logps/chosen": -6.737687110900879,
"logps/rejected": -47.592185974121094,
"loss": 0.46553468704223633,
"memory(GiB)": 45.96,
"nll_loss": 0.2802257835865021,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3542218804359436,
"rewards/margins": 3.4753262996673584,
"rewards/rejected": -3.1211044788360596,
"step": 229,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4354771906987752,
"grad_norm": 1.4453233480453491,
"learning_rate": 0.00019513143772512267,
"logits/chosen": -0.8504279851913452,
"logits/rejected": -0.8653618097305298,
"logps/chosen": -6.069849491119385,
"logps/rejected": -61.96661376953125,
"loss": 0.35670334100723267,
"memory(GiB)": 45.96,
"nll_loss": 0.27682676911354065,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4068211615085602,
"rewards/margins": 4.582265853881836,
"rewards/rejected": -4.175444602966309,
"step": 230,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.43737056978876987,
"grad_norm": 2.451911687850952,
"learning_rate": 0.0001950668480025564,
"logits/chosen": -0.8143424391746521,
"logits/rejected": -0.820701003074646,
"logps/chosen": -5.882935047149658,
"logps/rejected": -41.83823013305664,
"loss": 0.413090318441391,
"memory(GiB)": 45.96,
"nll_loss": 0.25027984380722046,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4448525905609131,
"rewards/margins": 3.033524990081787,
"rewards/rejected": -2.588672637939453,
"step": 231,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.4392639488787646,
"grad_norm": 3.493765354156494,
"learning_rate": 0.00019500184348547042,
"logits/chosen": -0.8186232447624207,
"logits/rejected": -0.8271446228027344,
"logps/chosen": -5.602138042449951,
"logps/rejected": -53.67842102050781,
"loss": 0.523601233959198,
"memory(GiB)": 45.96,
"nll_loss": 0.30448588728904724,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.284013032913208,
"rewards/margins": 3.9659247398376465,
"rewards/rejected": -3.6819119453430176,
"step": 232,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4411573279687592,
"grad_norm": 2.912060260772705,
"learning_rate": 0.00019493642445749166,
"logits/chosen": -0.842425525188446,
"logits/rejected": -0.8589853644371033,
"logps/chosen": -3.74099063873291,
"logps/rejected": -57.953006744384766,
"loss": 0.36314085125923157,
"memory(GiB)": 45.96,
"nll_loss": 0.2760802209377289,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.443424254655838,
"rewards/margins": 4.425593852996826,
"rewards/rejected": -3.9821696281433105,
"step": 233,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.44305070705875393,
"grad_norm": 12.398122787475586,
"learning_rate": 0.0001948705912040556,
"logits/chosen": -0.7788976430892944,
"logits/rejected": -0.7920855283737183,
"logps/chosen": -9.004324913024902,
"logps/rejected": -57.34058380126953,
"loss": 0.47224855422973633,
"memory(GiB)": 45.96,
"nll_loss": 0.3402937054634094,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19586092233657837,
"rewards/margins": 3.8706259727478027,
"rewards/rejected": -3.67476487159729,
"step": 234,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4449440861487486,
"grad_norm": 4.74459981918335,
"learning_rate": 0.00019480434401240512,
"logits/chosen": -0.8051593899726868,
"logits/rejected": -0.8183260560035706,
"logps/chosen": -6.355615615844727,
"logps/rejected": -56.04167938232422,
"loss": 0.5707345008850098,
"memory(GiB)": 45.96,
"nll_loss": 0.34050434827804565,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.33054211735725403,
"rewards/margins": 3.9471776485443115,
"rewards/rejected": -3.616635799407959,
"step": 235,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.4468374652387433,
"grad_norm": 6.874378681182861,
"learning_rate": 0.0001947376831715892,
"logits/chosen": -0.7758195400238037,
"logits/rejected": -0.788472592830658,
"logps/chosen": -5.814244270324707,
"logps/rejected": -54.79585266113281,
"loss": 0.5337939262390137,
"memory(GiB)": 45.96,
"nll_loss": 0.3693539500236511,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13278648257255554,
"rewards/margins": 3.429861545562744,
"rewards/rejected": -3.297075033187866,
"step": 236,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.44873084432873794,
"grad_norm": 5.422703742980957,
"learning_rate": 0.00019467060897246157,
"logits/chosen": -0.7782034277915955,
"logits/rejected": -0.7840334177017212,
"logps/chosen": -8.718152046203613,
"logps/rejected": -41.60744857788086,
"loss": 0.7435796856880188,
"memory(GiB)": 45.96,
"nll_loss": 0.4146505296230316,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09374925494194031,
"rewards/margins": 2.6359703540802,
"rewards/rejected": -2.5422208309173584,
"step": 237,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4506242234187326,
"grad_norm": 2.3289687633514404,
"learning_rate": 0.00019460312170767956,
"logits/chosen": -0.7645810842514038,
"logits/rejected": -0.7797269821166992,
"logps/chosen": -5.059871673583984,
"logps/rejected": -64.65418243408203,
"loss": 0.3661719858646393,
"memory(GiB)": 45.96,
"nll_loss": 0.25765132904052734,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.39239248633384705,
"rewards/margins": 4.386118412017822,
"rewards/rejected": -3.9937262535095215,
"step": 238,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4525176025087273,
"grad_norm": 1.4744064807891846,
"learning_rate": 0.0001945352216717028,
"logits/chosen": -0.831943154335022,
"logits/rejected": -0.8483419418334961,
"logps/chosen": -5.389368534088135,
"logps/rejected": -62.634124755859375,
"loss": 0.29625532031059265,
"memory(GiB)": 45.96,
"nll_loss": 0.19564969837665558,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4885157346725464,
"rewards/margins": 4.1885905265808105,
"rewards/rejected": -3.700075149536133,
"step": 239,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.45441098159872195,
"grad_norm": 10.076432228088379,
"learning_rate": 0.0001944669091607919,
"logits/chosen": -0.7903633117675781,
"logits/rejected": -0.796679675579071,
"logps/chosen": -6.789815902709961,
"logps/rejected": -46.970340728759766,
"loss": 0.6889331340789795,
"memory(GiB)": 45.96,
"nll_loss": 0.4780619740486145,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2585870325565338,
"rewards/margins": 3.206406593322754,
"rewards/rejected": -2.947819709777832,
"step": 240,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.45630436068871666,
"grad_norm": 3.162611961364746,
"learning_rate": 0.00019439818447300716,
"logits/chosen": -0.7782495617866516,
"logits/rejected": -0.793842077255249,
"logps/chosen": -6.149593353271484,
"logps/rejected": -57.481685638427734,
"loss": 0.35159918665885925,
"memory(GiB)": 45.96,
"nll_loss": 0.26541072130203247,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4303516149520874,
"rewards/margins": 3.7947804927825928,
"rewards/rejected": -3.364428997039795,
"step": 241,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.4581977397787113,
"grad_norm": 2.6365225315093994,
"learning_rate": 0.00019432904790820735,
"logits/chosen": -0.779421329498291,
"logits/rejected": -0.7866885662078857,
"logps/chosen": -4.453818321228027,
"logps/rejected": -48.04380798339844,
"loss": 0.5028890371322632,
"memory(GiB)": 45.96,
"nll_loss": 0.3481641113758087,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17416518926620483,
"rewards/margins": 3.206613063812256,
"rewards/rejected": -3.0324478149414062,
"step": 242,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.460091118868706,
"grad_norm": 4.328489780426025,
"learning_rate": 0.00019425949976804827,
"logits/chosen": -0.7438924312591553,
"logits/rejected": -0.7507935762405396,
"logps/chosen": -10.080765724182129,
"logps/rejected": -45.97163009643555,
"loss": 0.5210501551628113,
"memory(GiB)": 45.96,
"nll_loss": 0.32953721284866333,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3890751004219055,
"rewards/margins": 3.2612807750701904,
"rewards/rejected": -2.8722057342529297,
"step": 243,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.46198449795870067,
"grad_norm": 2.42315673828125,
"learning_rate": 0.00019418954035598152,
"logits/chosen": -0.8272375464439392,
"logits/rejected": -0.8359189033508301,
"logps/chosen": -6.97105073928833,
"logps/rejected": -54.705596923828125,
"loss": 0.39850807189941406,
"memory(GiB)": 45.96,
"nll_loss": 0.23200449347496033,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2904537618160248,
"rewards/margins": 3.9579145908355713,
"rewards/rejected": -3.6674604415893555,
"step": 244,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4638778770486953,
"grad_norm": 11.622922897338867,
"learning_rate": 0.00019411916997725314,
"logits/chosen": -0.804512619972229,
"logits/rejected": -0.8301945924758911,
"logps/chosen": -5.534765243530273,
"logps/rejected": -75.79460144042969,
"loss": 0.3892122805118561,
"memory(GiB)": 45.96,
"nll_loss": 0.2879936993122101,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24686971306800842,
"rewards/margins": 5.173652172088623,
"rewards/rejected": -4.926782608032227,
"step": 245,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.46577125613869,
"grad_norm": 29.126651763916016,
"learning_rate": 0.00019404838893890235,
"logits/chosen": -0.8384321928024292,
"logits/rejected": -0.8446701169013977,
"logps/chosen": -6.7067742347717285,
"logps/rejected": -56.584373474121094,
"loss": 0.4600946009159088,
"memory(GiB)": 45.96,
"nll_loss": 0.27550381422042847,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.273784339427948,
"rewards/margins": 3.861654281616211,
"rewards/rejected": -3.587869882583618,
"step": 246,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4676646352286847,
"grad_norm": 1.977882981300354,
"learning_rate": 0.0001939771975497601,
"logits/chosen": -0.8426949977874756,
"logits/rejected": -0.855405330657959,
"logps/chosen": -8.002025604248047,
"logps/rejected": -68.733154296875,
"loss": 0.41115817427635193,
"memory(GiB)": 45.96,
"nll_loss": 0.31340885162353516,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.39579659700393677,
"rewards/margins": 5.0697808265686035,
"rewards/rejected": -4.673984527587891,
"step": 247,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.4695580143186794,
"grad_norm": 6.719147205352783,
"learning_rate": 0.0001939055961204478,
"logits/chosen": -0.8593066334724426,
"logits/rejected": -0.871523916721344,
"logps/chosen": -8.719642639160156,
"logps/rejected": -73.46538543701172,
"loss": 0.5661371946334839,
"memory(GiB)": 45.96,
"nll_loss": 0.28518250584602356,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1493295133113861,
"rewards/margins": 5.667934417724609,
"rewards/rejected": -5.5186052322387695,
"step": 248,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.47145139340867404,
"grad_norm": 3.4157960414886475,
"learning_rate": 0.00019383358496337594,
"logits/chosen": -0.8707897067070007,
"logits/rejected": -0.8835899233818054,
"logps/chosen": -8.206844329833984,
"logps/rejected": -70.05189514160156,
"loss": 0.5082112550735474,
"memory(GiB)": 45.96,
"nll_loss": 0.3844239413738251,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.40558338165283203,
"rewards/margins": 5.734279155731201,
"rewards/rejected": -5.328695297241211,
"step": 249,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.47334477249866874,
"grad_norm": 2.3171849250793457,
"learning_rate": 0.00019376116439274275,
"logits/chosen": -0.8690236210823059,
"logits/rejected": -0.8809092044830322,
"logps/chosen": -7.636664390563965,
"logps/rejected": -67.01061248779297,
"loss": 0.5090566873550415,
"memory(GiB)": 45.96,
"nll_loss": 0.34755271673202515,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2747221887111664,
"rewards/margins": 4.926432132720947,
"rewards/rejected": -4.651710033416748,
"step": 250,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.4752381515886634,
"grad_norm": 5.929121494293213,
"learning_rate": 0.00019368833472453275,
"logits/chosen": -0.8622236847877502,
"logits/rejected": -0.8675254583358765,
"logps/chosen": -6.978309631347656,
"logps/rejected": -59.03238296508789,
"loss": 0.6428236365318298,
"memory(GiB)": 45.96,
"nll_loss": 0.3348870873451233,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.00988294929265976,
"rewards/margins": 4.309958457946777,
"rewards/rejected": -4.300075531005859,
"step": 251,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.47713153067865804,
"grad_norm": 2.0272998809814453,
"learning_rate": 0.00019361509627651547,
"logits/chosen": -0.8882036805152893,
"logits/rejected": -0.894838809967041,
"logps/chosen": -5.545462608337402,
"logps/rejected": -53.88817596435547,
"loss": 0.3966207802295685,
"memory(GiB)": 45.96,
"nll_loss": 0.2131766378879547,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.36596545577049255,
"rewards/margins": 4.208477973937988,
"rewards/rejected": -3.842512607574463,
"step": 252,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.47902490976865275,
"grad_norm": 5.7287468910217285,
"learning_rate": 0.00019354144936824401,
"logits/chosen": -0.8320537209510803,
"logits/rejected": -0.8402711153030396,
"logps/chosen": -6.792182445526123,
"logps/rejected": -54.659339904785156,
"loss": 0.4517640769481659,
"memory(GiB)": 45.96,
"nll_loss": 0.3251955211162567,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.33542922139167786,
"rewards/margins": 3.7679901123046875,
"rewards/rejected": -3.432560920715332,
"step": 253,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.4809182888586474,
"grad_norm": 18.151660919189453,
"learning_rate": 0.00019346739432105374,
"logits/chosen": -0.8174375295639038,
"logits/rejected": -0.8378430604934692,
"logps/chosen": -8.57436466217041,
"logps/rejected": -62.255455017089844,
"loss": 0.7509753108024597,
"memory(GiB)": 45.96,
"nll_loss": 0.6498162746429443,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.266471803188324,
"rewards/margins": 3.990063428878784,
"rewards/rejected": -3.7235915660858154,
"step": 254,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.4828116679486421,
"grad_norm": 12.132912635803223,
"learning_rate": 0.00019339293145806066,
"logits/chosen": -0.8464425802230835,
"logits/rejected": -0.8538373708724976,
"logps/chosen": -6.4575605392456055,
"logps/rejected": -50.951087951660156,
"loss": 0.4662426710128784,
"memory(GiB)": 45.96,
"nll_loss": 0.3501847982406616,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.22113488614559174,
"rewards/margins": 3.7245137691497803,
"rewards/rejected": -3.5033788681030273,
"step": 255,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.48470504703863676,
"grad_norm": 14.220233917236328,
"learning_rate": 0.00019331806110416027,
"logits/chosen": -0.8058353066444397,
"logits/rejected": -0.8215208053588867,
"logps/chosen": -6.208203315734863,
"logps/rejected": -65.32124328613281,
"loss": 0.9521104097366333,
"memory(GiB)": 45.96,
"nll_loss": 0.7899406552314758,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07534287869930267,
"rewards/margins": 3.819141387939453,
"rewards/rejected": -3.7437989711761475,
"step": 256,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.48659842612863147,
"grad_norm": 5.3797173500061035,
"learning_rate": 0.000193242783586026,
"logits/chosen": -0.8115130066871643,
"logits/rejected": -0.8261612057685852,
"logps/chosen": -4.243943691253662,
"logps/rejected": -64.59398651123047,
"loss": 0.6993451714515686,
"memory(GiB)": 45.96,
"nll_loss": 0.5960971117019653,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2801298499107361,
"rewards/margins": 4.3589348793029785,
"rewards/rejected": -4.078805446624756,
"step": 257,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.4884918052186261,
"grad_norm": 2.5662522315979004,
"learning_rate": 0.00019316709923210775,
"logits/chosen": -0.7943601608276367,
"logits/rejected": -0.8015127182006836,
"logps/chosen": -7.6889801025390625,
"logps/rejected": -54.64246368408203,
"loss": 0.7327463626861572,
"memory(GiB)": 45.96,
"nll_loss": 0.45545923709869385,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21556581556797028,
"rewards/margins": 3.397770643234253,
"rewards/rejected": -3.1822047233581543,
"step": 258,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.49038518430862077,
"grad_norm": 25.52183723449707,
"learning_rate": 0.00019309100837263068,
"logits/chosen": -0.7869693040847778,
"logits/rejected": -0.7915991544723511,
"logps/chosen": -8.936237335205078,
"logps/rejected": -42.483360290527344,
"loss": 0.5518508553504944,
"memory(GiB)": 45.96,
"nll_loss": 0.35867419838905334,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36850929260253906,
"rewards/margins": 3.0449368953704834,
"rewards/rejected": -2.6764283180236816,
"step": 259,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.4922785633986155,
"grad_norm": 1.8457614183425903,
"learning_rate": 0.0001930145113395934,
"logits/chosen": -0.7611051797866821,
"logits/rejected": -0.7706549167633057,
"logps/chosen": -4.166028022766113,
"logps/rejected": -42.88038635253906,
"loss": 0.5326672196388245,
"memory(GiB)": 45.96,
"nll_loss": 0.26256081461906433,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.31425848603248596,
"rewards/margins": 3.049826145172119,
"rewards/rejected": -2.735567808151245,
"step": 260,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.4941719424886101,
"grad_norm": 4.680253028869629,
"learning_rate": 0.0001929376084667669,
"logits/chosen": -0.7653763890266418,
"logits/rejected": -0.7684553265571594,
"logps/chosen": -11.641561508178711,
"logps/rejected": -33.487953186035156,
"loss": 0.8013095259666443,
"memory(GiB)": 45.96,
"nll_loss": 0.5253302454948425,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.34696438908576965,
"rewards/margins": 2.4490063190460205,
"rewards/rejected": -2.102041721343994,
"step": 261,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.49606532157860483,
"grad_norm": 1.6427733898162842,
"learning_rate": 0.00019286030008969283,
"logits/chosen": -0.7503105401992798,
"logits/rejected": -0.7532596588134766,
"logps/chosen": -3.582320213317871,
"logps/rejected": -44.282466888427734,
"loss": 0.3885384798049927,
"memory(GiB)": 45.96,
"nll_loss": 0.12933489680290222,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19427397847175598,
"rewards/margins": 3.2359180450439453,
"rewards/rejected": -3.041644334793091,
"step": 262,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.4979587006685995,
"grad_norm": 2.3090734481811523,
"learning_rate": 0.00019278258654568218,
"logits/chosen": -0.763583779335022,
"logits/rejected": -0.7730581760406494,
"logps/chosen": -9.824563980102539,
"logps/rejected": -51.514068603515625,
"loss": 0.5489881038665771,
"memory(GiB)": 45.96,
"nll_loss": 0.3023039996623993,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.5053662061691284,
"rewards/margins": 3.4952330589294434,
"rewards/rejected": -2.9898667335510254,
"step": 263,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.4998520797585942,
"grad_norm": 1.4782931804656982,
"learning_rate": 0.00019270446817381377,
"logits/chosen": -0.7714170813560486,
"logits/rejected": -0.7751628160476685,
"logps/chosen": -7.587092399597168,
"logps/rejected": -46.782779693603516,
"loss": 0.5135377049446106,
"memory(GiB)": 45.96,
"nll_loss": 0.3512042164802551,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.40125563740730286,
"rewards/margins": 3.7470357418060303,
"rewards/rejected": -3.345780372619629,
"step": 264,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5017454588485888,
"grad_norm": 4.727572917938232,
"learning_rate": 0.0001926259453149327,
"logits/chosen": -0.7314101457595825,
"logits/rejected": -0.7375609874725342,
"logps/chosen": -5.705110549926758,
"logps/rejected": -57.362266540527344,
"loss": 0.5352091789245605,
"memory(GiB)": 45.96,
"nll_loss": 0.34295836091041565,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31562328338623047,
"rewards/margins": 4.008930683135986,
"rewards/rejected": -3.693307399749756,
"step": 265,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5036388379385836,
"grad_norm": 4.0496649742126465,
"learning_rate": 0.00019254701831164893,
"logits/chosen": -0.7853831648826599,
"logits/rejected": -0.7986811995506287,
"logps/chosen": -4.441198348999023,
"logps/rejected": -53.076751708984375,
"loss": 0.3684377670288086,
"memory(GiB)": 45.96,
"nll_loss": 0.2579481899738312,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.46632638573646545,
"rewards/margins": 3.7940874099731445,
"rewards/rejected": -3.327761173248291,
"step": 266,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5055322170285782,
"grad_norm": 5.552995204925537,
"learning_rate": 0.00019246768750833586,
"logits/chosen": -0.7842399477958679,
"logits/rejected": -0.7948920130729675,
"logps/chosen": -6.420162677764893,
"logps/rejected": -59.88761520385742,
"loss": 0.6227431297302246,
"memory(GiB)": 45.96,
"nll_loss": 0.41716307401657104,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4504700005054474,
"rewards/margins": 4.746631622314453,
"rewards/rejected": -4.296161651611328,
"step": 267,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.5074255961185729,
"grad_norm": 5.908695697784424,
"learning_rate": 0.0001923879532511287,
"logits/chosen": -0.7927809953689575,
"logits/rejected": -0.8063479065895081,
"logps/chosen": -4.683359146118164,
"logps/rejected": -72.5576400756836,
"loss": 0.5436932444572449,
"memory(GiB)": 45.96,
"nll_loss": 0.4655058979988098,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.26488012075424194,
"rewards/margins": 5.25103759765625,
"rewards/rejected": -4.986156940460205,
"step": 268,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.5093189752085675,
"grad_norm": 1.9154390096664429,
"learning_rate": 0.00019230781588792294,
"logits/chosen": -0.8069201111793518,
"logits/rejected": -0.8189995884895325,
"logps/chosen": -5.3705830574035645,
"logps/rejected": -52.988075256347656,
"loss": 0.3851671814918518,
"memory(GiB)": 45.96,
"nll_loss": 0.21666651964187622,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3238618075847626,
"rewards/margins": 3.722102642059326,
"rewards/rejected": -3.398240327835083,
"step": 269,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.5112123542985623,
"grad_norm": 3.472141742706299,
"learning_rate": 0.00019222727576837295,
"logits/chosen": -0.8795083165168762,
"logits/rejected": -0.8880424499511719,
"logps/chosen": -4.646546363830566,
"logps/rejected": -52.22845458984375,
"loss": 0.4236709177494049,
"memory(GiB)": 45.96,
"nll_loss": 0.2475687563419342,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.41008079051971436,
"rewards/margins": 4.20516300201416,
"rewards/rejected": -3.795081853866577,
"step": 270,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.5131057333885569,
"grad_norm": 5.411405563354492,
"learning_rate": 0.00019214633324389046,
"logits/chosen": -0.8955191969871521,
"logits/rejected": -0.9028213620185852,
"logps/chosen": -7.191625118255615,
"logps/rejected": -64.41796112060547,
"loss": 0.5999385118484497,
"memory(GiB)": 45.96,
"nll_loss": 0.4318827986717224,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3819724917411804,
"rewards/margins": 5.266749382019043,
"rewards/rejected": -4.884777069091797,
"step": 271,
"train_speed(iter/s)": 0.005605
},
{
"epoch": 0.5149991124785516,
"grad_norm": 2.4139254093170166,
"learning_rate": 0.00019206498866764288,
"logits/chosen": -0.892187774181366,
"logits/rejected": -0.9053075909614563,
"logps/chosen": -10.184382438659668,
"logps/rejected": -61.766212463378906,
"loss": 0.5961122512817383,
"memory(GiB)": 45.96,
"nll_loss": 0.41012638807296753,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3639661967754364,
"rewards/margins": 4.510526180267334,
"rewards/rejected": -4.146560192108154,
"step": 272,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5168924915685462,
"grad_norm": 8.651139259338379,
"learning_rate": 0.00019198324239455187,
"logits/chosen": -0.8872772455215454,
"logits/rejected": -0.9006874561309814,
"logps/chosen": -8.185474395751953,
"logps/rejected": -65.75993347167969,
"loss": 0.8648337721824646,
"memory(GiB)": 45.96,
"nll_loss": 0.3675552308559418,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15013383328914642,
"rewards/margins": 4.743319988250732,
"rewards/rejected": -4.593186378479004,
"step": 273,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5187858706585409,
"grad_norm": 2.5142791271209717,
"learning_rate": 0.0001919010947812918,
"logits/chosen": -0.8946865200996399,
"logits/rejected": -0.9012131690979004,
"logps/chosen": -4.413853645324707,
"logps/rejected": -56.88621520996094,
"loss": 0.41415372490882874,
"memory(GiB)": 45.96,
"nll_loss": 0.19099995493888855,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3928433954715729,
"rewards/margins": 4.33311128616333,
"rewards/rejected": -3.94026780128479,
"step": 274,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5206792497485356,
"grad_norm": 2.757438898086548,
"learning_rate": 0.00019181854618628816,
"logits/chosen": -0.8939404487609863,
"logits/rejected": -0.9018977880477905,
"logps/chosen": -6.882540702819824,
"logps/rejected": -53.659786224365234,
"loss": 0.5660197734832764,
"memory(GiB)": 45.96,
"nll_loss": 0.31941333413124084,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27356964349746704,
"rewards/margins": 3.988978147506714,
"rewards/rejected": -3.7154083251953125,
"step": 275,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5225726288385303,
"grad_norm": 3.7840638160705566,
"learning_rate": 0.00019173559696971594,
"logits/chosen": -0.829815149307251,
"logits/rejected": -0.8413034081459045,
"logps/chosen": -5.10278844833374,
"logps/rejected": -57.6441650390625,
"loss": 0.4606822431087494,
"memory(GiB)": 45.96,
"nll_loss": 0.2637704610824585,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.23584577441215515,
"rewards/margins": 4.247429370880127,
"rewards/rejected": -4.01158332824707,
"step": 276,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5244660079285249,
"grad_norm": 2.141832113265991,
"learning_rate": 0.00019165224749349816,
"logits/chosen": -0.8428906202316284,
"logits/rejected": -0.8528401851654053,
"logps/chosen": -5.591213703155518,
"logps/rejected": -64.73967742919922,
"loss": 0.2879190742969513,
"memory(GiB)": 45.96,
"nll_loss": 0.20184285938739777,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3050042390823364,
"rewards/margins": 4.54812479019165,
"rewards/rejected": -4.2431206703186035,
"step": 277,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5263593870185196,
"grad_norm": 3.644115447998047,
"learning_rate": 0.00019156849812130427,
"logits/chosen": -0.8035122156143188,
"logits/rejected": -0.8153725862503052,
"logps/chosen": -12.309917449951172,
"logps/rejected": -51.97355270385742,
"loss": 0.5790233612060547,
"memory(GiB)": 45.96,
"nll_loss": 0.3488881289958954,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5022516846656799,
"rewards/margins": 3.658660888671875,
"rewards/rejected": -3.1564090251922607,
"step": 278,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5282527661085142,
"grad_norm": 5.298548221588135,
"learning_rate": 0.00019148434921854849,
"logits/chosen": -0.8239580988883972,
"logits/rejected": -0.8249148726463318,
"logps/chosen": -6.91997766494751,
"logps/rejected": -54.75133514404297,
"loss": 0.4746522009372711,
"memory(GiB)": 45.96,
"nll_loss": 0.2784557044506073,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1923876702785492,
"rewards/margins": 3.716320276260376,
"rewards/rejected": -3.523932695388794,
"step": 279,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.530146145198509,
"grad_norm": 4.2977800369262695,
"learning_rate": 0.00019139980115238827,
"logits/chosen": -0.7907276749610901,
"logits/rejected": -0.7962623834609985,
"logps/chosen": -6.527490615844727,
"logps/rejected": -44.79871368408203,
"loss": 0.47257882356643677,
"memory(GiB)": 45.96,
"nll_loss": 0.35276007652282715,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2639794945716858,
"rewards/margins": 2.987936019897461,
"rewards/rejected": -2.723956346511841,
"step": 280,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5320395242885037,
"grad_norm": 3.901082754135132,
"learning_rate": 0.00019131485429172278,
"logits/chosen": -0.7934513092041016,
"logits/rejected": -0.8078168630599976,
"logps/chosen": -6.55319881439209,
"logps/rejected": -61.66103744506836,
"loss": 0.37024247646331787,
"memory(GiB)": 45.96,
"nll_loss": 0.28827083110809326,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.24689851701259613,
"rewards/margins": 3.8940815925598145,
"rewards/rejected": -3.647183418273926,
"step": 281,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5339329033784983,
"grad_norm": 2.530467987060547,
"learning_rate": 0.0001912295090071911,
"logits/chosen": -0.7923294901847839,
"logits/rejected": -0.7994742393493652,
"logps/chosen": -6.937150001525879,
"logps/rejected": -56.21875,
"loss": 0.5143358111381531,
"memory(GiB)": 45.96,
"nll_loss": 0.3873366713523865,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.174740269780159,
"rewards/margins": 4.219673156738281,
"rewards/rejected": -4.044933319091797,
"step": 282,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.535826282468493,
"grad_norm": 2.29225754737854,
"learning_rate": 0.00019114376567117074,
"logits/chosen": -0.8077491521835327,
"logits/rejected": -0.8139883279800415,
"logps/chosen": -4.497866630554199,
"logps/rejected": -47.65617370605469,
"loss": 0.3458153009414673,
"memory(GiB)": 45.96,
"nll_loss": 0.23723626136779785,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32140105962753296,
"rewards/margins": 3.6276650428771973,
"rewards/rejected": -3.3062644004821777,
"step": 283,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5377196615584877,
"grad_norm": 2.587045431137085,
"learning_rate": 0.00019105762465777598,
"logits/chosen": -0.76796555519104,
"logits/rejected": -0.7804409265518188,
"logps/chosen": -6.710290908813477,
"logps/rejected": -55.04357147216797,
"loss": 0.6548448204994202,
"memory(GiB)": 45.96,
"nll_loss": 0.41518449783325195,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.23511014878749847,
"rewards/margins": 3.4961049556732178,
"rewards/rejected": -3.2609944343566895,
"step": 284,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5396130406484824,
"grad_norm": 2.1301791667938232,
"learning_rate": 0.00019097108634285624,
"logits/chosen": -0.7952322363853455,
"logits/rejected": -0.8057968616485596,
"logps/chosen": -5.858229637145996,
"logps/rejected": -66.42866516113281,
"loss": 0.37013787031173706,
"memory(GiB)": 45.96,
"nll_loss": 0.2697468400001526,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23830053210258484,
"rewards/margins": 4.619449615478516,
"rewards/rejected": -4.381148815155029,
"step": 285,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.541506419738477,
"grad_norm": 14.95060920715332,
"learning_rate": 0.00019088415110399444,
"logits/chosen": -0.8046155571937561,
"logits/rejected": -0.8122010827064514,
"logps/chosen": -6.331181526184082,
"logps/rejected": -64.72640228271484,
"loss": 0.3927690088748932,
"memory(GiB)": 45.96,
"nll_loss": 0.26214665174484253,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19679710268974304,
"rewards/margins": 5.021756649017334,
"rewards/rejected": -4.824959754943848,
"step": 286,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5433997988284717,
"grad_norm": 4.531976699829102,
"learning_rate": 0.00019079681932050542,
"logits/chosen": -0.7703898549079895,
"logits/rejected": -0.7752258777618408,
"logps/chosen": -5.728086471557617,
"logps/rejected": -57.623958587646484,
"loss": 0.4262126386165619,
"memory(GiB)": 45.96,
"nll_loss": 0.27883288264274597,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2624058723449707,
"rewards/margins": 4.643805503845215,
"rewards/rejected": -4.3814005851745605,
"step": 287,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5452931779184663,
"grad_norm": 2.6767520904541016,
"learning_rate": 0.00019070909137343408,
"logits/chosen": -0.8187030553817749,
"logits/rejected": -0.8257608413696289,
"logps/chosen": -6.29841423034668,
"logps/rejected": -66.14295959472656,
"loss": 0.3371083736419678,
"memory(GiB)": 45.96,
"nll_loss": 0.210712268948555,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22904178500175476,
"rewards/margins": 4.86109733581543,
"rewards/rejected": -4.632055282592773,
"step": 288,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5471865570084611,
"grad_norm": 9.247986793518066,
"learning_rate": 0.000190620967645554,
"logits/chosen": -0.7456453442573547,
"logits/rejected": -0.758894681930542,
"logps/chosen": -5.9966888427734375,
"logps/rejected": -89.31047821044922,
"loss": 0.376960426568985,
"memory(GiB)": 45.96,
"nll_loss": 0.32863202691078186,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.40128135681152344,
"rewards/margins": 6.478516578674316,
"rewards/rejected": -6.077235221862793,
"step": 289,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5490799360984557,
"grad_norm": 4.125120162963867,
"learning_rate": 0.00019053244852136554,
"logits/chosen": -0.720355749130249,
"logits/rejected": -0.7238030433654785,
"logps/chosen": -7.328817367553711,
"logps/rejected": -54.47208023071289,
"loss": 0.5468963384628296,
"memory(GiB)": 45.96,
"nll_loss": 0.313761830329895,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20256341993808746,
"rewards/margins": 4.272522926330566,
"rewards/rejected": -4.06995964050293,
"step": 290,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5509733151884504,
"grad_norm": 16.452295303344727,
"learning_rate": 0.00019044353438709425,
"logits/chosen": -0.7850386500358582,
"logits/rejected": -0.7899038195610046,
"logps/chosen": -8.804156303405762,
"logps/rejected": -50.80997848510742,
"loss": 0.41979584097862244,
"memory(GiB)": 45.96,
"nll_loss": 0.2754655182361603,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2856299877166748,
"rewards/margins": 3.883333206176758,
"rewards/rejected": -3.597702980041504,
"step": 291,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.552866694278445,
"grad_norm": 1.7969173192977905,
"learning_rate": 0.0001903542256306892,
"logits/chosen": -0.7434848546981812,
"logits/rejected": -0.7542124390602112,
"logps/chosen": -5.325131416320801,
"logps/rejected": -52.36528015136719,
"loss": 0.3374747335910797,
"memory(GiB)": 45.96,
"nll_loss": 0.18438780307769775,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2966896891593933,
"rewards/margins": 3.624333381652832,
"rewards/rejected": -3.327644109725952,
"step": 292,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5547600733684397,
"grad_norm": 1.3389047384262085,
"learning_rate": 0.00019026452264182133,
"logits/chosen": -0.7741931080818176,
"logits/rejected": -0.7864500284194946,
"logps/chosen": -3.9642157554626465,
"logps/rejected": -56.372291564941406,
"loss": 0.25577616691589355,
"memory(GiB)": 45.96,
"nll_loss": 0.19787441194057465,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3570703864097595,
"rewards/margins": 4.0897650718688965,
"rewards/rejected": -3.732694149017334,
"step": 293,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5566534524584345,
"grad_norm": 19.48859977722168,
"learning_rate": 0.0001901744258118816,
"logits/chosen": -0.7488910555839539,
"logits/rejected": -0.7564380764961243,
"logps/chosen": -5.505663871765137,
"logps/rejected": -47.65184020996094,
"loss": 0.5035507082939148,
"memory(GiB)": 45.96,
"nll_loss": 0.32677191495895386,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.395191490650177,
"rewards/margins": 3.423536777496338,
"rewards/rejected": -3.0283451080322266,
"step": 294,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5585468315484291,
"grad_norm": 2.008774518966675,
"learning_rate": 0.00019008393553397938,
"logits/chosen": -0.7502264976501465,
"logits/rejected": -0.7578118443489075,
"logps/chosen": -5.755902290344238,
"logps/rejected": -68.1287841796875,
"loss": 0.35803064703941345,
"memory(GiB)": 45.96,
"nll_loss": 0.2247561663389206,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.33679965138435364,
"rewards/margins": 5.233041763305664,
"rewards/rejected": -4.896242618560791,
"step": 295,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5604402106384238,
"grad_norm": 1.3325504064559937,
"learning_rate": 0.0001899930522029408,
"logits/chosen": -0.8117009401321411,
"logits/rejected": -0.8213991522789001,
"logps/chosen": -6.647754669189453,
"logps/rejected": -63.37158203125,
"loss": 0.31900104880332947,
"memory(GiB)": 45.96,
"nll_loss": 0.2485048770904541,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.528366208076477,
"rewards/margins": 4.6781086921691895,
"rewards/rejected": -4.149742603302002,
"step": 296,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5623335897284184,
"grad_norm": 2.195697784423828,
"learning_rate": 0.00018990177621530687,
"logits/chosen": -0.8317320346832275,
"logits/rejected": -0.8371787071228027,
"logps/chosen": -2.5732357501983643,
"logps/rejected": -64.65092468261719,
"loss": 0.21604421734809875,
"memory(GiB)": 45.96,
"nll_loss": 0.14539764821529388,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.33231592178344727,
"rewards/margins": 5.368936061859131,
"rewards/rejected": -5.036620140075684,
"step": 297,
"train_speed(iter/s)": 0.005607
},
{
"epoch": 0.5642269688184132,
"grad_norm": 3.2850587368011475,
"learning_rate": 0.0001898101079693319,
"logits/chosen": -0.8763929009437561,
"logits/rejected": -0.8853050470352173,
"logps/chosen": -7.0348052978515625,
"logps/rejected": -73.10599517822266,
"loss": 0.3883512616157532,
"memory(GiB)": 45.96,
"nll_loss": 0.3356992304325104,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.44934678077697754,
"rewards/margins": 5.959858417510986,
"rewards/rejected": -5.510511875152588,
"step": 298,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5661203479084078,
"grad_norm": 73.654052734375,
"learning_rate": 0.0001897180478649817,
"logits/chosen": -0.8361641764640808,
"logits/rejected": -0.8429641723632812,
"logps/chosen": -3.9281766414642334,
"logps/rejected": -61.438812255859375,
"loss": 0.36019739508628845,
"memory(GiB)": 45.96,
"nll_loss": 0.25969114899635315,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31078457832336426,
"rewards/margins": 4.794025421142578,
"rewards/rejected": -4.483240604400635,
"step": 299,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5680137269984025,
"grad_norm": 4.500136852264404,
"learning_rate": 0.00018962559630393173,
"logits/chosen": -0.8823038339614868,
"logits/rejected": -0.8893939256668091,
"logps/chosen": -10.261281967163086,
"logps/rejected": -72.63387298583984,
"loss": 0.5553180575370789,
"memory(GiB)": 45.96,
"nll_loss": 0.48980623483657837,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2931188941001892,
"rewards/margins": 5.616513252258301,
"rewards/rejected": -5.323395252227783,
"step": 300,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.5680137269984025,
"eval_logits/chosen": -0.9059550762176514,
"eval_logits/rejected": -0.9165492057800293,
"eval_logps/chosen": -6.452853679656982,
"eval_logps/rejected": -87.56333923339844,
"eval_loss": 0.4157661497592926,
"eval_nll_loss": 0.34246140718460083,
"eval_rewards/accuracies": 0.9647058844566345,
"eval_rewards/chosen": 0.3199980556964874,
"eval_rewards/margins": 7.240695476531982,
"eval_rewards/rejected": -6.920697212219238,
"eval_runtime": 383.4477,
"eval_samples_per_second": 0.443,
"eval_steps_per_second": 0.443,
"step": 300
},
{
"epoch": 0.5699071060883971,
"grad_norm": 1.6478270292282104,
"learning_rate": 0.00018953275368956555,
"logits/chosen": -0.8683250546455383,
"logits/rejected": -0.8765738010406494,
"logps/chosen": -4.596683502197266,
"logps/rejected": -71.82097625732422,
"loss": 0.23614919185638428,
"memory(GiB)": 45.96,
"nll_loss": 0.1724119931459427,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28458163142204285,
"rewards/margins": 5.737771987915039,
"rewards/rejected": -5.453190326690674,
"step": 301,
"train_speed(iter/s)": 0.005565
},
{
"epoch": 0.5718004851783918,
"grad_norm": 2.4366822242736816,
"learning_rate": 0.00018943952042697296,
"logits/chosen": -0.903656005859375,
"logits/rejected": -0.9147554636001587,
"logps/chosen": -6.1691365242004395,
"logps/rejected": -98.06748962402344,
"loss": 0.43336808681488037,
"memory(GiB)": 45.96,
"nll_loss": 0.37197959423065186,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45999443531036377,
"rewards/margins": 8.3666353225708,
"rewards/rejected": -7.906641006469727,
"step": 302,
"train_speed(iter/s)": 0.005565
},
{
"epoch": 0.5736938642683865,
"grad_norm": 6.613124847412109,
"learning_rate": 0.00018934589692294818,
"logits/chosen": -0.9739726781845093,
"logits/rejected": -0.9870423674583435,
"logps/chosen": -5.006122589111328,
"logps/rejected": -110.79590606689453,
"loss": 0.3391586244106293,
"memory(GiB)": 45.96,
"nll_loss": 0.24201489984989166,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.352843701839447,
"rewards/margins": 9.359478950500488,
"rewards/rejected": -9.006634712219238,
"step": 303,
"train_speed(iter/s)": 0.005565
},
{
"epoch": 0.5755872433583812,
"grad_norm": 6.816748142242432,
"learning_rate": 0.00018925188358598813,
"logits/chosen": -0.962784469127655,
"logits/rejected": -0.9713460206985474,
"logps/chosen": -8.601051330566406,
"logps/rejected": -93.97550964355469,
"loss": 0.4550440311431885,
"memory(GiB)": 45.96,
"nll_loss": 0.331770122051239,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2643924951553345,
"rewards/margins": 8.098273277282715,
"rewards/rejected": -7.833880424499512,
"step": 304,
"train_speed(iter/s)": 0.005565
},
{
"epoch": 0.5774806224483758,
"grad_norm": 3.7295877933502197,
"learning_rate": 0.0001891574808262907,
"logits/chosen": -0.9686220288276672,
"logits/rejected": -0.9826257228851318,
"logps/chosen": -8.40042781829834,
"logps/rejected": -118.83855438232422,
"loss": 0.3994218707084656,
"memory(GiB)": 45.96,
"nll_loss": 0.32849177718162537,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37062764167785645,
"rewards/margins": 10.088976860046387,
"rewards/rejected": -9.71834945678711,
"step": 305,
"train_speed(iter/s)": 0.005565
},
{
"epoch": 0.5793740015383705,
"grad_norm": 1.8573001623153687,
"learning_rate": 0.00018906268905575285,
"logits/chosen": -0.9196559190750122,
"logits/rejected": -0.9327231645584106,
"logps/chosen": -9.870383262634277,
"logps/rejected": -115.3849868774414,
"loss": 0.4931097626686096,
"memory(GiB)": 45.96,
"nll_loss": 0.3947875499725342,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.35478293895721436,
"rewards/margins": 10.043420791625977,
"rewards/rejected": -9.688638687133789,
"step": 306,
"train_speed(iter/s)": 0.005566
},
{
"epoch": 0.5812673806283651,
"grad_norm": 5.879184722900391,
"learning_rate": 0.00018896750868796887,
"logits/chosen": -0.8445271849632263,
"logits/rejected": -0.8584895133972168,
"logps/chosen": -7.785769939422607,
"logps/rejected": -109.72542572021484,
"loss": 0.3518598675727844,
"memory(GiB)": 45.96,
"nll_loss": 0.29149600863456726,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4223713278770447,
"rewards/margins": 9.426725387573242,
"rewards/rejected": -9.004354476928711,
"step": 307,
"train_speed(iter/s)": 0.005566
},
{
"epoch": 0.5831607597183599,
"grad_norm": 10.44513988494873,
"learning_rate": 0.00018887194013822862,
"logits/chosen": -0.8841306567192078,
"logits/rejected": -0.8950796127319336,
"logps/chosen": -4.3363447189331055,
"logps/rejected": -103.37335205078125,
"loss": 0.4750944674015045,
"memory(GiB)": 45.96,
"nll_loss": 0.343455046415329,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2507314085960388,
"rewards/margins": 8.82553482055664,
"rewards/rejected": -8.574803352355957,
"step": 308,
"train_speed(iter/s)": 0.005566
},
{
"epoch": 0.5850541388083546,
"grad_norm": 34.57544708251953,
"learning_rate": 0.0001887759838235156,
"logits/chosen": -0.8739007115364075,
"logits/rejected": -0.8843562602996826,
"logps/chosen": -6.813051700592041,
"logps/rejected": -107.06051635742188,
"loss": 0.7519917488098145,
"memory(GiB)": 45.96,
"nll_loss": 0.5681273341178894,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10883338749408722,
"rewards/margins": 8.822795867919922,
"rewards/rejected": -8.71396255493164,
"step": 309,
"train_speed(iter/s)": 0.005567
},
{
"epoch": 0.5869475178983492,
"grad_norm": 8.953110694885254,
"learning_rate": 0.00018867964016250528,
"logits/chosen": -0.8052958846092224,
"logits/rejected": -0.8159947991371155,
"logps/chosen": -6.318592548370361,
"logps/rejected": -106.75569152832031,
"loss": 0.3217519521713257,
"memory(GiB)": 45.96,
"nll_loss": 0.24863341450691223,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.03278753161430359,
"rewards/margins": 8.891491889953613,
"rewards/rejected": -8.858704566955566,
"step": 310,
"train_speed(iter/s)": 0.005567
},
{
"epoch": 0.5888408969883439,
"grad_norm": 9.680059432983398,
"learning_rate": 0.00018858290957556313,
"logits/chosen": -0.8246707916259766,
"logits/rejected": -0.8383605480194092,
"logps/chosen": -5.819177150726318,
"logps/rejected": -84.25653076171875,
"loss": 0.4908764958381653,
"memory(GiB)": 45.96,
"nll_loss": 0.3518160581588745,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2999556064605713,
"rewards/margins": 6.772392272949219,
"rewards/rejected": -6.472436904907227,
"step": 311,
"train_speed(iter/s)": 0.005567
},
{
"epoch": 0.5907342760783385,
"grad_norm": 1.4490282535552979,
"learning_rate": 0.00018848579248474288,
"logits/chosen": -0.7970471978187561,
"logits/rejected": -0.8090251684188843,
"logps/chosen": -2.809403896331787,
"logps/rejected": -65.53295135498047,
"loss": 0.23040540516376495,
"memory(GiB)": 45.96,
"nll_loss": 0.14142940938472748,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31414929032325745,
"rewards/margins": 5.153748989105225,
"rewards/rejected": -4.839599609375,
"step": 312,
"train_speed(iter/s)": 0.005568
},
{
"epoch": 0.5926276551683333,
"grad_norm": 11.067521095275879,
"learning_rate": 0.00018838828931378463,
"logits/chosen": -0.8277375102043152,
"logits/rejected": -0.8391073942184448,
"logps/chosen": -7.107628345489502,
"logps/rejected": -77.02799987792969,
"loss": 0.6485866904258728,
"memory(GiB)": 45.96,
"nll_loss": 0.35685575008392334,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19486919045448303,
"rewards/margins": 5.629068374633789,
"rewards/rejected": -5.43419885635376,
"step": 313,
"train_speed(iter/s)": 0.005568
},
{
"epoch": 0.5945210342583279,
"grad_norm": 17.583600997924805,
"learning_rate": 0.00018829040048811305,
"logits/chosen": -0.8249818086624146,
"logits/rejected": -0.8355417251586914,
"logps/chosen": -10.383692741394043,
"logps/rejected": -88.57411193847656,
"loss": 1.1173313856124878,
"memory(GiB)": 45.96,
"nll_loss": 0.8328571915626526,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.12180662155151367,
"rewards/margins": 6.225827217102051,
"rewards/rejected": -6.3476338386535645,
"step": 314,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.5964144133483226,
"grad_norm": 1.3052239418029785,
"learning_rate": 0.0001881921264348355,
"logits/chosen": -0.8118442893028259,
"logits/rejected": -0.8303354978561401,
"logps/chosen": -5.193848609924316,
"logps/rejected": -78.52323913574219,
"loss": 0.3948984444141388,
"memory(GiB)": 45.96,
"nll_loss": 0.22238636016845703,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.4186479151248932,
"rewards/margins": 5.8724188804626465,
"rewards/rejected": -5.453771114349365,
"step": 315,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.5983077924383172,
"grad_norm": 4.303112983703613,
"learning_rate": 0.00018809346758274012,
"logits/chosen": -0.8591910004615784,
"logits/rejected": -0.8673767447471619,
"logps/chosen": -6.369632244110107,
"logps/rejected": -72.42138671875,
"loss": 0.3798455595970154,
"memory(GiB)": 45.96,
"nll_loss": 0.2527866065502167,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.39195647835731506,
"rewards/margins": 5.535797119140625,
"rewards/rejected": -5.143840789794922,
"step": 316,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.600201171528312,
"grad_norm": 1.2503244876861572,
"learning_rate": 0.00018799442436229403,
"logits/chosen": -0.8667201399803162,
"logits/rejected": -0.8784090876579285,
"logps/chosen": -4.633861541748047,
"logps/rejected": -93.7111587524414,
"loss": 0.30663278698921204,
"memory(GiB)": 45.96,
"nll_loss": 0.2311694324016571,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.48267802596092224,
"rewards/margins": 8.00043773651123,
"rewards/rejected": -7.517759323120117,
"step": 317,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6020945506183066,
"grad_norm": 6.858788967132568,
"learning_rate": 0.00018789499720564136,
"logits/chosen": -0.9277811646461487,
"logits/rejected": -0.934998631477356,
"logps/chosen": -6.271909236907959,
"logps/rejected": -58.293670654296875,
"loss": 0.5750719308853149,
"memory(GiB)": 45.96,
"nll_loss": 0.3498351275920868,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1989549994468689,
"rewards/margins": 4.847379207611084,
"rewards/rejected": -4.64842414855957,
"step": 318,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6039879297083013,
"grad_norm": 4.458963394165039,
"learning_rate": 0.00018779518654660153,
"logits/chosen": -0.8746768236160278,
"logits/rejected": -0.887937605381012,
"logps/chosen": -5.970765113830566,
"logps/rejected": -73.90641784667969,
"loss": 0.5496221780776978,
"memory(GiB)": 45.96,
"nll_loss": 0.4115613102912903,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2141362726688385,
"rewards/margins": 5.52421236038208,
"rewards/rejected": -5.310075759887695,
"step": 319,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6058813087982959,
"grad_norm": 4.74213981628418,
"learning_rate": 0.00018769499282066717,
"logits/chosen": -0.9022679328918457,
"logits/rejected": -0.9067811965942383,
"logps/chosen": -4.3401031494140625,
"logps/rejected": -64.71338653564453,
"loss": 0.46817266941070557,
"memory(GiB)": 45.96,
"nll_loss": 0.2838274836540222,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.387113094329834,
"rewards/margins": 5.29489278793335,
"rewards/rejected": -4.907780170440674,
"step": 320,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6077746878882906,
"grad_norm": 1.5771666765213013,
"learning_rate": 0.00018759441646500234,
"logits/chosen": -0.9481390714645386,
"logits/rejected": -0.960427463054657,
"logps/chosen": -3.579497814178467,
"logps/rejected": -90.05030822753906,
"loss": 0.27988624572753906,
"memory(GiB)": 45.96,
"nll_loss": 0.1971428096294403,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3307838439941406,
"rewards/margins": 7.247364521026611,
"rewards/rejected": -6.916580677032471,
"step": 321,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6096680669782854,
"grad_norm": 3.5266613960266113,
"learning_rate": 0.0001874934579184406,
"logits/chosen": -0.9149664640426636,
"logits/rejected": -0.9217000007629395,
"logps/chosen": -7.331539630889893,
"logps/rejected": -62.536720275878906,
"loss": 0.2879345715045929,
"memory(GiB)": 45.96,
"nll_loss": 0.2096707969903946,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.19104890525341034,
"rewards/margins": 4.760408401489258,
"rewards/rejected": -4.56935977935791,
"step": 322,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.61156144606828,
"grad_norm": 17.796716690063477,
"learning_rate": 0.000187392117621483,
"logits/chosen": -0.9241886734962463,
"logits/rejected": -0.9360665082931519,
"logps/chosen": -3.9619576930999756,
"logps/rejected": -81.54830169677734,
"loss": 0.29742905497550964,
"memory(GiB)": 45.96,
"nll_loss": 0.21862103044986725,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4049226641654968,
"rewards/margins": 6.298480033874512,
"rewards/rejected": -5.893557548522949,
"step": 323,
"train_speed(iter/s)": 0.005568
},
{
"epoch": 0.6134548251582747,
"grad_norm": 3.629298210144043,
"learning_rate": 0.00018729039601629634,
"logits/chosen": -0.888552725315094,
"logits/rejected": -0.8931864500045776,
"logps/chosen": -8.97883129119873,
"logps/rejected": -53.001277923583984,
"loss": 0.4431394934654236,
"memory(GiB)": 45.96,
"nll_loss": 0.27529340982437134,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.27515706419944763,
"rewards/margins": 3.8233470916748047,
"rewards/rejected": -3.548189878463745,
"step": 324,
"train_speed(iter/s)": 0.005568
},
{
"epoch": 0.6153482042482693,
"grad_norm": 22.506664276123047,
"learning_rate": 0.00018718829354671113,
"logits/chosen": -0.935386061668396,
"logits/rejected": -0.946205735206604,
"logps/chosen": -4.333962917327881,
"logps/rejected": -69.80958557128906,
"loss": 0.38010165095329285,
"memory(GiB)": 45.96,
"nll_loss": 0.27887049317359924,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41510555148124695,
"rewards/margins": 5.503192901611328,
"rewards/rejected": -5.088087558746338,
"step": 325,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.617241583338264,
"grad_norm": 3.3655357360839844,
"learning_rate": 0.00018708581065821954,
"logits/chosen": -0.9429974555969238,
"logits/rejected": -0.9552821516990662,
"logps/chosen": -5.25839900970459,
"logps/rejected": -56.73838424682617,
"loss": 0.5094978213310242,
"memory(GiB)": 45.96,
"nll_loss": 0.446816086769104,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.38630491495132446,
"rewards/margins": 4.239760398864746,
"rewards/rejected": -3.8534557819366455,
"step": 326,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6191349624282587,
"grad_norm": 2.8727710247039795,
"learning_rate": 0.0001869829477979737,
"logits/chosen": -0.8893756866455078,
"logits/rejected": -0.8951653242111206,
"logps/chosen": -4.583832263946533,
"logps/rejected": -55.753257751464844,
"loss": 0.2895621359348297,
"memory(GiB)": 45.96,
"nll_loss": 0.19121912121772766,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.40792274475097656,
"rewards/margins": 4.444224834442139,
"rewards/rejected": -4.03630256652832,
"step": 327,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.6210283415182534,
"grad_norm": 2.481173515319824,
"learning_rate": 0.00018687970541478364,
"logits/chosen": -0.9552744030952454,
"logits/rejected": -0.9592955112457275,
"logps/chosen": -6.099732875823975,
"logps/rejected": -55.62705993652344,
"loss": 0.3935054838657379,
"memory(GiB)": 45.96,
"nll_loss": 0.2654397785663605,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3739722669124603,
"rewards/margins": 4.395190238952637,
"rewards/rejected": -4.021218299865723,
"step": 328,
"train_speed(iter/s)": 0.005569
},
{
"epoch": 0.622921720608248,
"grad_norm": 0.932902991771698,
"learning_rate": 0.00018677608395911526,
"logits/chosen": -0.9515609741210938,
"logits/rejected": -0.9636331796646118,
"logps/chosen": -5.270691871643066,
"logps/rejected": -69.07537841796875,
"loss": 0.1866064816713333,
"memory(GiB)": 45.96,
"nll_loss": 0.1546114981174469,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.43455418944358826,
"rewards/margins": 5.497076034545898,
"rewards/rejected": -5.062521934509277,
"step": 329,
"train_speed(iter/s)": 0.00557
},
{
"epoch": 0.6248150996982427,
"grad_norm": 56.31227493286133,
"learning_rate": 0.00018667208388308841,
"logits/chosen": -0.9246232509613037,
"logits/rejected": -0.9359687566757202,
"logps/chosen": -5.232905864715576,
"logps/rejected": -61.79796600341797,
"loss": 0.4251781404018402,
"memory(GiB)": 45.96,
"nll_loss": 0.3015526831150055,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32587265968322754,
"rewards/margins": 4.692801475524902,
"rewards/rejected": -4.366928577423096,
"step": 330,
"train_speed(iter/s)": 0.00557
},
{
"epoch": 0.6267084787882374,
"grad_norm": 4.163169860839844,
"learning_rate": 0.00018656770564047496,
"logits/chosen": -0.9365993142127991,
"logits/rejected": -0.9441806674003601,
"logps/chosen": -5.937311172485352,
"logps/rejected": -64.2382583618164,
"loss": 0.4102782905101776,
"memory(GiB)": 45.96,
"nll_loss": 0.21538400650024414,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.27078527212142944,
"rewards/margins": 5.3102803230285645,
"rewards/rejected": -5.03949499130249,
"step": 331,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6286018578782321,
"grad_norm": 23.430564880371094,
"learning_rate": 0.00018646294968669685,
"logits/chosen": -0.9300607442855835,
"logits/rejected": -0.9476884603500366,
"logps/chosen": -5.615139007568359,
"logps/rejected": -77.03141784667969,
"loss": 0.6246126890182495,
"memory(GiB)": 45.96,
"nll_loss": 0.4357287287712097,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3221561312675476,
"rewards/margins": 5.601375579833984,
"rewards/rejected": -5.2792205810546875,
"step": 332,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6304952369682267,
"grad_norm": 3.6118054389953613,
"learning_rate": 0.0001863578164788239,
"logits/chosen": -0.9302395582199097,
"logits/rejected": -0.9413833022117615,
"logps/chosen": -7.32153844833374,
"logps/rejected": -66.94845581054688,
"loss": 0.7131233811378479,
"memory(GiB)": 45.96,
"nll_loss": 0.4995349049568176,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04812576249241829,
"rewards/margins": 5.103006362915039,
"rewards/rejected": -5.0548810958862305,
"step": 333,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6323886160582214,
"grad_norm": 2.5514726638793945,
"learning_rate": 0.00018625230647557217,
"logits/chosen": -0.9299983978271484,
"logits/rejected": -0.940325915813446,
"logps/chosen": -6.139636039733887,
"logps/rejected": -66.79703521728516,
"loss": 0.38100895285606384,
"memory(GiB)": 45.96,
"nll_loss": 0.2833740711212158,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.39727550745010376,
"rewards/margins": 5.418885231018066,
"rewards/rejected": -5.021610260009766,
"step": 334,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.634281995148216,
"grad_norm": 7.410953998565674,
"learning_rate": 0.0001861464201373015,
"logits/chosen": -0.9981006979942322,
"logits/rejected": -1.0123075246810913,
"logps/chosen": -3.0750880241394043,
"logps/rejected": -89.65264892578125,
"loss": 0.23634791374206543,
"memory(GiB)": 45.96,
"nll_loss": 0.14243003726005554,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37372106313705444,
"rewards/margins": 7.329642295837402,
"rewards/rejected": -6.955921173095703,
"step": 335,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6361753742382108,
"grad_norm": 2.460972547531128,
"learning_rate": 0.00018604015792601396,
"logits/chosen": -0.926382303237915,
"logits/rejected": -0.9328540563583374,
"logps/chosen": -6.227597713470459,
"logps/rejected": -58.30305480957031,
"loss": 0.2906293272972107,
"memory(GiB)": 45.96,
"nll_loss": 0.1831737905740738,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3218955993652344,
"rewards/margins": 4.378249645233154,
"rewards/rejected": -4.05635404586792,
"step": 336,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6380687533282055,
"grad_norm": 2.0313737392425537,
"learning_rate": 0.0001859335203053515,
"logits/chosen": -0.9640895128250122,
"logits/rejected": -0.9761223196983337,
"logps/chosen": -5.581124305725098,
"logps/rejected": -63.39913558959961,
"loss": 0.5718323588371277,
"memory(GiB)": 45.96,
"nll_loss": 0.3999195396900177,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.213788241147995,
"rewards/margins": 5.133645534515381,
"rewards/rejected": -4.919857025146484,
"step": 337,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6399621324182001,
"grad_norm": 4.065624713897705,
"learning_rate": 0.0001858265077405941,
"logits/chosen": -0.8603492379188538,
"logits/rejected": -0.870326578617096,
"logps/chosen": -5.7338457107543945,
"logps/rejected": -69.25128936767578,
"loss": 0.34140416979789734,
"memory(GiB)": 45.96,
"nll_loss": 0.2584512233734131,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32439491152763367,
"rewards/margins": 5.536102294921875,
"rewards/rejected": -5.21170711517334,
"step": 338,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6418555115081948,
"grad_norm": 2.9222512245178223,
"learning_rate": 0.00018571912069865776,
"logits/chosen": -0.8618049621582031,
"logits/rejected": -0.870703935623169,
"logps/chosen": -7.246155261993408,
"logps/rejected": -51.38260269165039,
"loss": 0.4438958466053009,
"memory(GiB)": 45.96,
"nll_loss": 0.27844953536987305,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2594514489173889,
"rewards/margins": 3.721580982208252,
"rewards/rejected": -3.462129592895508,
"step": 339,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6437488905981894,
"grad_norm": 11.053990364074707,
"learning_rate": 0.00018561135964809223,
"logits/chosen": -0.8574349880218506,
"logits/rejected": -0.8660771250724792,
"logps/chosen": -2.8028204441070557,
"logps/rejected": -60.271385192871094,
"loss": 0.2936401665210724,
"memory(GiB)": 45.96,
"nll_loss": 0.2107047736644745,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37268757820129395,
"rewards/margins": 4.701450824737549,
"rewards/rejected": -4.328763484954834,
"step": 340,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6456422696881842,
"grad_norm": 33.189571380615234,
"learning_rate": 0.00018550322505907923,
"logits/chosen": -0.7724344730377197,
"logits/rejected": -0.7846801280975342,
"logps/chosen": -6.443312644958496,
"logps/rejected": -63.350616455078125,
"loss": 0.8022756576538086,
"memory(GiB)": 45.96,
"nll_loss": 0.5788527131080627,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21350334584712982,
"rewards/margins": 4.397084712982178,
"rewards/rejected": -4.183581352233887,
"step": 341,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6475356487781788,
"grad_norm": 12.396661758422852,
"learning_rate": 0.00018539471740343033,
"logits/chosen": -0.8222888708114624,
"logits/rejected": -0.8293163180351257,
"logps/chosen": -4.639364242553711,
"logps/rejected": -57.1859016418457,
"loss": 0.6142297387123108,
"memory(GiB)": 45.96,
"nll_loss": 0.4827613830566406,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2849894165992737,
"rewards/margins": 4.214752197265625,
"rewards/rejected": -3.929762601852417,
"step": 342,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6494290278681735,
"grad_norm": 2.387334108352661,
"learning_rate": 0.0001852858371545848,
"logits/chosen": -0.7581778764724731,
"logits/rejected": -0.7650014758110046,
"logps/chosen": -7.369527816772461,
"logps/rejected": -59.144012451171875,
"loss": 0.3893844187259674,
"memory(GiB)": 45.96,
"nll_loss": 0.33146339654922485,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4411081373691559,
"rewards/margins": 4.799034118652344,
"rewards/rejected": -4.357925891876221,
"step": 343,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6513224069581681,
"grad_norm": 2.518702745437622,
"learning_rate": 0.0001851765847876076,
"logits/chosen": -0.8135807514190674,
"logits/rejected": -0.8240830898284912,
"logps/chosen": -3.35158109664917,
"logps/rejected": -54.54274368286133,
"loss": 0.25894394516944885,
"memory(GiB)": 45.96,
"nll_loss": 0.15596656501293182,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3464549779891968,
"rewards/margins": 4.198663234710693,
"rewards/rejected": -3.852208137512207,
"step": 344,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6532157860481629,
"grad_norm": 6.995054244995117,
"learning_rate": 0.00018506696077918742,
"logits/chosen": -0.8065057992935181,
"logits/rejected": -0.814572811126709,
"logps/chosen": -4.734983921051025,
"logps/rejected": -58.506385803222656,
"loss": 0.45452654361724854,
"memory(GiB)": 45.96,
"nll_loss": 0.29960596561431885,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23975589871406555,
"rewards/margins": 4.3970513343811035,
"rewards/rejected": -4.157295227050781,
"step": 345,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6551091651381575,
"grad_norm": 1.396971344947815,
"learning_rate": 0.00018495696560763428,
"logits/chosen": -0.8346060514450073,
"logits/rejected": -0.8455590009689331,
"logps/chosen": -6.954171657562256,
"logps/rejected": -58.36876678466797,
"loss": 0.41100573539733887,
"memory(GiB)": 45.96,
"nll_loss": 0.3312125504016876,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3940037786960602,
"rewards/margins": 4.3294878005981445,
"rewards/rejected": -3.935483932495117,
"step": 346,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6570025442281522,
"grad_norm": 4.642291069030762,
"learning_rate": 0.00018484659975287788,
"logits/chosen": -0.8456770777702332,
"logits/rejected": -0.8482322692871094,
"logps/chosen": -10.749929428100586,
"logps/rejected": -61.98844909667969,
"loss": 0.3847033679485321,
"memory(GiB)": 45.96,
"nll_loss": 0.25482821464538574,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3538522720336914,
"rewards/margins": 4.825608253479004,
"rewards/rejected": -4.4717559814453125,
"step": 347,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6588959233181468,
"grad_norm": 2.9362223148345947,
"learning_rate": 0.00018473586369646512,
"logits/chosen": -0.8183330297470093,
"logits/rejected": -0.8273117542266846,
"logps/chosen": -3.4568326473236084,
"logps/rejected": -69.13544464111328,
"loss": 0.35661450028419495,
"memory(GiB)": 45.96,
"nll_loss": 0.1939859688282013,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36636775732040405,
"rewards/margins": 5.597408771514893,
"rewards/rejected": -5.231040954589844,
"step": 348,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6607893024081415,
"grad_norm": 8.023280143737793,
"learning_rate": 0.00018462475792155824,
"logits/chosen": -0.775278627872467,
"logits/rejected": -0.7894055247306824,
"logps/chosen": -4.536966323852539,
"logps/rejected": -65.62297821044922,
"loss": 0.2713961899280548,
"memory(GiB)": 45.96,
"nll_loss": 0.19426655769348145,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4155954420566559,
"rewards/margins": 5.086872577667236,
"rewards/rejected": -4.671277046203613,
"step": 349,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6626826814981363,
"grad_norm": 2.4450321197509766,
"learning_rate": 0.00018451328291293264,
"logits/chosen": -0.7985575795173645,
"logits/rejected": -0.808333694934845,
"logps/chosen": -6.013537883758545,
"logps/rejected": -75.55121612548828,
"loss": 0.3190026879310608,
"memory(GiB)": 45.96,
"nll_loss": 0.274376779794693,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.37852659821510315,
"rewards/margins": 5.885116100311279,
"rewards/rejected": -5.506588935852051,
"step": 350,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6645760605881309,
"grad_norm": 11.652441024780273,
"learning_rate": 0.0001844014391569747,
"logits/chosen": -0.8393977284431458,
"logits/rejected": -0.8486717939376831,
"logps/chosen": -8.01746940612793,
"logps/rejected": -66.04694366455078,
"loss": 0.5918421745300293,
"memory(GiB)": 45.96,
"nll_loss": 0.4767189025878906,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.20049431920051575,
"rewards/margins": 5.253631591796875,
"rewards/rejected": -5.053136825561523,
"step": 351,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6664694396781256,
"grad_norm": 3.3374173641204834,
"learning_rate": 0.0001842892271416797,
"logits/chosen": -0.828509509563446,
"logits/rejected": -0.8383011221885681,
"logps/chosen": -7.521579742431641,
"logps/rejected": -65.2198486328125,
"loss": 0.4373883008956909,
"memory(GiB)": 45.96,
"nll_loss": 0.38811227679252625,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3511880338191986,
"rewards/margins": 5.433207035064697,
"rewards/rejected": -5.082019329071045,
"step": 352,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6683628187681202,
"grad_norm": 1.81625235080719,
"learning_rate": 0.00018417664735664985,
"logits/chosen": -0.7870513200759888,
"logits/rejected": -0.7983162999153137,
"logps/chosen": -6.6251020431518555,
"logps/rejected": -69.36129760742188,
"loss": 0.30411848425865173,
"memory(GiB)": 45.96,
"nll_loss": 0.23931153118610382,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.46187031269073486,
"rewards/margins": 5.455815315246582,
"rewards/rejected": -4.9939446449279785,
"step": 353,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6702561978581149,
"grad_norm": 5.95273494720459,
"learning_rate": 0.0001840637002930918,
"logits/chosen": -0.7893354892730713,
"logits/rejected": -0.7926087975502014,
"logps/chosen": -3.356367588043213,
"logps/rejected": -54.068214416503906,
"loss": 0.23361176252365112,
"memory(GiB)": 45.96,
"nll_loss": 0.16138066351413727,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3823690414428711,
"rewards/margins": 4.487397193908691,
"rewards/rejected": -4.1050286293029785,
"step": 354,
"train_speed(iter/s)": 0.005571
},
{
"epoch": 0.6721495769481096,
"grad_norm": 2.7681703567504883,
"learning_rate": 0.00018395038644381488,
"logits/chosen": -0.8022831678390503,
"logits/rejected": -0.8161917924880981,
"logps/chosen": -7.168720245361328,
"logps/rejected": -60.850887298583984,
"loss": 0.6297565698623657,
"memory(GiB)": 45.96,
"nll_loss": 0.5241124629974365,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3222300112247467,
"rewards/margins": 4.561849117279053,
"rewards/rejected": -4.239619255065918,
"step": 355,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6740429560381043,
"grad_norm": 1.745928406715393,
"learning_rate": 0.00018383670630322865,
"logits/chosen": -0.8162990212440491,
"logits/rejected": -0.8287326097488403,
"logps/chosen": -5.697843551635742,
"logps/rejected": -72.2893295288086,
"loss": 0.3242051899433136,
"memory(GiB)": 45.96,
"nll_loss": 0.19369246065616608,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.39551740884780884,
"rewards/margins": 5.45540189743042,
"rewards/rejected": -5.059884071350098,
"step": 356,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6759363351280989,
"grad_norm": 1.5724689960479736,
"learning_rate": 0.00018372266036734098,
"logits/chosen": -0.7709946036338806,
"logits/rejected": -0.7820452451705933,
"logps/chosen": -7.69317102432251,
"logps/rejected": -63.20610809326172,
"loss": 0.4046747088432312,
"memory(GiB)": 45.96,
"nll_loss": 0.26361504197120667,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.44556182622909546,
"rewards/margins": 4.433609962463379,
"rewards/rejected": -3.9880480766296387,
"step": 357,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6778297142180936,
"grad_norm": 0.8649733662605286,
"learning_rate": 0.00018360824913375568,
"logits/chosen": -0.8018120527267456,
"logits/rejected": -0.8122223019599915,
"logps/chosen": -5.195913314819336,
"logps/rejected": -69.43289947509766,
"loss": 0.1661713868379593,
"memory(GiB)": 45.96,
"nll_loss": 0.12944738566875458,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3514459729194641,
"rewards/margins": 5.306279182434082,
"rewards/rejected": -4.954833030700684,
"step": 358,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6797230933080883,
"grad_norm": 1.0646100044250488,
"learning_rate": 0.00018349347310167046,
"logits/chosen": -0.7723908424377441,
"logits/rejected": -0.7902077436447144,
"logps/chosen": -4.268543243408203,
"logps/rejected": -75.9552001953125,
"loss": 0.23154988884925842,
"memory(GiB)": 45.96,
"nll_loss": 0.17301858961582184,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5057197213172913,
"rewards/margins": 5.4032464027404785,
"rewards/rejected": -4.897526741027832,
"step": 359,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.681616472398083,
"grad_norm": 1.2381056547164917,
"learning_rate": 0.00018337833277187472,
"logits/chosen": -0.8530025482177734,
"logits/rejected": -0.8602923154830933,
"logps/chosen": -3.5304064750671387,
"logps/rejected": -69.44783782958984,
"loss": 0.27017509937286377,
"memory(GiB)": 45.96,
"nll_loss": 0.24506865441799164,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34460416436195374,
"rewards/margins": 5.07497501373291,
"rewards/rejected": -4.73037052154541,
"step": 360,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6835098514880776,
"grad_norm": 51.11272048950195,
"learning_rate": 0.00018326282864674734,
"logits/chosen": -0.8346350193023682,
"logits/rejected": -0.847761332988739,
"logps/chosen": -4.418249607086182,
"logps/rejected": -72.58184051513672,
"loss": 0.548991858959198,
"memory(GiB)": 45.96,
"nll_loss": 0.39672714471817017,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2148188203573227,
"rewards/margins": 5.45236873626709,
"rewards/rejected": -5.237550258636475,
"step": 361,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6854032305780723,
"grad_norm": 3.5835256576538086,
"learning_rate": 0.00018314696123025454,
"logits/chosen": -0.8421773314476013,
"logits/rejected": -0.8487293124198914,
"logps/chosen": -9.384542465209961,
"logps/rejected": -66.58482360839844,
"loss": 0.5891345739364624,
"memory(GiB)": 45.96,
"nll_loss": 0.5249395370483398,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3435335159301758,
"rewards/margins": 5.227488994598389,
"rewards/rejected": -4.883955001831055,
"step": 362,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6872966096680669,
"grad_norm": 2.492431163787842,
"learning_rate": 0.0001830307310279476,
"logits/chosen": -0.877526581287384,
"logits/rejected": -0.8845463991165161,
"logps/chosen": -5.337737083435059,
"logps/rejected": -63.96607971191406,
"loss": 0.4151839017868042,
"memory(GiB)": 45.96,
"nll_loss": 0.2992326319217682,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3732222020626068,
"rewards/margins": 5.134644508361816,
"rewards/rejected": -4.761421203613281,
"step": 363,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6891899887580617,
"grad_norm": 1.5654759407043457,
"learning_rate": 0.00018291413854696077,
"logits/chosen": -0.8303389549255371,
"logits/rejected": -0.8396271467208862,
"logps/chosen": -9.332134246826172,
"logps/rejected": -57.97529602050781,
"loss": 0.48519501090049744,
"memory(GiB)": 45.96,
"nll_loss": 0.37487462162971497,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.45280930399894714,
"rewards/margins": 4.4484758377075195,
"rewards/rejected": -3.995666742324829,
"step": 364,
"train_speed(iter/s)": 0.005573
},
{
"epoch": 0.6910833678480564,
"grad_norm": 21.09276580810547,
"learning_rate": 0.0001827971842960089,
"logits/chosen": -0.864224910736084,
"logits/rejected": -0.8757129311561584,
"logps/chosen": -6.988122940063477,
"logps/rejected": -66.54647064208984,
"loss": 0.662355899810791,
"memory(GiB)": 45.96,
"nll_loss": 0.4306182265281677,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.004866257309913635,
"rewards/margins": 4.913517475128174,
"rewards/rejected": -4.918384075164795,
"step": 365,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.692976746938051,
"grad_norm": 1.0892640352249146,
"learning_rate": 0.00018267986878538545,
"logits/chosen": -0.917788028717041,
"logits/rejected": -0.9294503927230835,
"logps/chosen": -3.470579147338867,
"logps/rejected": -78.84397888183594,
"loss": 0.20548279583454132,
"memory(GiB)": 45.96,
"nll_loss": 0.14263419806957245,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4148893356323242,
"rewards/margins": 6.348430156707764,
"rewards/rejected": -5.9335408210754395,
"step": 366,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6948701260280457,
"grad_norm": 5.015666484832764,
"learning_rate": 0.00018256219252695994,
"logits/chosen": -0.9198713302612305,
"logits/rejected": -0.9371796250343323,
"logps/chosen": -9.38389778137207,
"logps/rejected": -91.02330780029297,
"loss": 0.3265993297100067,
"memory(GiB)": 45.96,
"nll_loss": 0.2348761260509491,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09129352122545242,
"rewards/margins": 6.925175666809082,
"rewards/rejected": -6.8338823318481445,
"step": 367,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6967635051180403,
"grad_norm": 6.3433518409729,
"learning_rate": 0.00018244415603417603,
"logits/chosen": -0.8368143439292908,
"logits/rejected": -0.8486584424972534,
"logps/chosen": -6.600013732910156,
"logps/rejected": -63.1298942565918,
"loss": 0.6284315586090088,
"memory(GiB)": 45.96,
"nll_loss": 0.4247177243232727,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.37347325682640076,
"rewards/margins": 4.725260257720947,
"rewards/rejected": -4.3517866134643555,
"step": 368,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.6986568842080351,
"grad_norm": 7.823058128356934,
"learning_rate": 0.00018232575982204914,
"logits/chosen": -0.9267025589942932,
"logits/rejected": -0.9404476284980774,
"logps/chosen": -5.923476219177246,
"logps/rejected": -87.72044372558594,
"loss": 0.4384441375732422,
"memory(GiB)": 45.96,
"nll_loss": 0.3303898870944977,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2169867604970932,
"rewards/margins": 6.883980751037598,
"rewards/rejected": -6.666994571685791,
"step": 369,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.7005502632980297,
"grad_norm": 9.935714721679688,
"learning_rate": 0.00018220700440716413,
"logits/chosen": -0.9617865681648254,
"logits/rejected": -0.9780336022377014,
"logps/chosen": -5.394845962524414,
"logps/rejected": -81.97534942626953,
"loss": 0.3096768260002136,
"memory(GiB)": 45.96,
"nll_loss": 0.22962169349193573,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36911681294441223,
"rewards/margins": 6.486654758453369,
"rewards/rejected": -6.1175384521484375,
"step": 370,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.7024436423880244,
"grad_norm": 2.1283838748931885,
"learning_rate": 0.00018208789030767325,
"logits/chosen": -0.931568443775177,
"logits/rejected": -0.9491530656814575,
"logps/chosen": -5.131685256958008,
"logps/rejected": -83.98279571533203,
"loss": 0.32068467140197754,
"memory(GiB)": 45.96,
"nll_loss": 0.25166767835617065,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.40735071897506714,
"rewards/margins": 6.204363822937012,
"rewards/rejected": -5.797012805938721,
"step": 371,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.704337021478019,
"grad_norm": 2.4540481567382812,
"learning_rate": 0.00018196841804329368,
"logits/chosen": -0.9263602495193481,
"logits/rejected": -0.9327493906021118,
"logps/chosen": -8.066591262817383,
"logps/rejected": -75.68155670166016,
"loss": 0.3130130469799042,
"memory(GiB)": 45.96,
"nll_loss": 0.2522437274456024,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31773021817207336,
"rewards/margins": 6.315546035766602,
"rewards/rejected": -5.99781608581543,
"step": 372,
"train_speed(iter/s)": 0.005573
},
{
"epoch": 0.7062304005680137,
"grad_norm": 1.692391276359558,
"learning_rate": 0.00018184858813530532,
"logits/chosen": -0.9145341515541077,
"logits/rejected": -0.9194747805595398,
"logps/chosen": -7.334906578063965,
"logps/rejected": -73.05682373046875,
"loss": 0.3234623968601227,
"memory(GiB)": 45.96,
"nll_loss": 0.2537417709827423,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24510082602500916,
"rewards/margins": 5.801229476928711,
"rewards/rejected": -5.55612850189209,
"step": 373,
"train_speed(iter/s)": 0.005573
},
{
"epoch": 0.7081237796580084,
"grad_norm": 36.44214630126953,
"learning_rate": 0.00018172840110654862,
"logits/chosen": -0.9754062294960022,
"logits/rejected": -0.991508960723877,
"logps/chosen": -6.064601421356201,
"logps/rejected": -89.70690155029297,
"loss": 0.5042046904563904,
"memory(GiB)": 45.96,
"nll_loss": 0.4545992314815521,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1555050164461136,
"rewards/margins": 7.101882457733154,
"rewards/rejected": -6.946377754211426,
"step": 374,
"train_speed(iter/s)": 0.005573
},
{
"epoch": 0.7100171587480031,
"grad_norm": 2.978787899017334,
"learning_rate": 0.00018160785748142213,
"logits/chosen": -0.9359906315803528,
"logits/rejected": -0.9400643110275269,
"logps/chosen": -8.096701622009277,
"logps/rejected": -72.11371612548828,
"loss": 0.32742807269096375,
"memory(GiB)": 45.96,
"nll_loss": 0.25164440274238586,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.05610913783311844,
"rewards/margins": 5.611598491668701,
"rewards/rejected": -5.555489540100098,
"step": 375,
"train_speed(iter/s)": 0.005573
},
{
"epoch": 0.7119105378379977,
"grad_norm": 14.366015434265137,
"learning_rate": 0.00018148695778588033,
"logits/chosen": -0.956476628780365,
"logits/rejected": -0.9655558466911316,
"logps/chosen": -4.012333393096924,
"logps/rejected": -62.51438903808594,
"loss": 0.3993355333805084,
"memory(GiB)": 45.96,
"nll_loss": 0.29191824793815613,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3031947910785675,
"rewards/margins": 5.061457633972168,
"rewards/rejected": -4.758262634277344,
"step": 376,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7138039169279924,
"grad_norm": 3.066188335418701,
"learning_rate": 0.0001813657025474314,
"logits/chosen": -0.9844723343849182,
"logits/rejected": -0.9966791868209839,
"logps/chosen": -4.741098880767822,
"logps/rejected": -71.6838150024414,
"loss": 0.3621368706226349,
"memory(GiB)": 45.96,
"nll_loss": 0.2202376276254654,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3772399425506592,
"rewards/margins": 5.600998878479004,
"rewards/rejected": -5.223758220672607,
"step": 377,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7156972960179872,
"grad_norm": 11.998395919799805,
"learning_rate": 0.00018124409229513462,
"logits/chosen": -0.9505751729011536,
"logits/rejected": -0.9621790647506714,
"logps/chosen": -7.32084846496582,
"logps/rejected": -74.40185546875,
"loss": 0.6046153903007507,
"memory(GiB)": 45.96,
"nll_loss": 0.4943448007106781,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3040057122707367,
"rewards/margins": 5.977365970611572,
"rewards/rejected": -5.6733598709106445,
"step": 378,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7175906751079818,
"grad_norm": 1.9508522748947144,
"learning_rate": 0.0001811221275595984,
"logits/chosen": -0.9317912459373474,
"logits/rejected": -0.9388425350189209,
"logps/chosen": -5.765390872955322,
"logps/rejected": -62.51669692993164,
"loss": 0.4143444895744324,
"memory(GiB)": 45.96,
"nll_loss": 0.31946519017219543,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39909541606903076,
"rewards/margins": 5.322498321533203,
"rewards/rejected": -4.923402309417725,
"step": 379,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7194840541979765,
"grad_norm": 6.575671195983887,
"learning_rate": 0.00018099980887297781,
"logits/chosen": -0.9164581298828125,
"logits/rejected": -0.9194830656051636,
"logps/chosen": -6.478179931640625,
"logps/rejected": -49.975425720214844,
"loss": 0.44688597321510315,
"memory(GiB)": 45.96,
"nll_loss": 0.2767287492752075,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.5000704526901245,
"rewards/margins": 4.214252948760986,
"rewards/rejected": -3.7141826152801514,
"step": 380,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7213774332879711,
"grad_norm": 10.62743854522705,
"learning_rate": 0.00018087713676897226,
"logits/chosen": -0.9223384261131287,
"logits/rejected": -0.938324511051178,
"logps/chosen": -2.1367008686065674,
"logps/rejected": -82.99889373779297,
"loss": 0.20312689244747162,
"memory(GiB)": 45.96,
"nll_loss": 0.15922902524471283,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.43284815549850464,
"rewards/margins": 6.020846843719482,
"rewards/rejected": -5.58799934387207,
"step": 381,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7232708123779658,
"grad_norm": 5.026012420654297,
"learning_rate": 0.0001807541117828232,
"logits/chosen": -0.8925135731697083,
"logits/rejected": -0.9032195210456848,
"logps/chosen": -4.171497821807861,
"logps/rejected": -69.82553100585938,
"loss": 0.4734829068183899,
"memory(GiB)": 45.96,
"nll_loss": 0.3503991365432739,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2768786549568176,
"rewards/margins": 5.154216766357422,
"rewards/rejected": -4.877338409423828,
"step": 382,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7251641914679605,
"grad_norm": 2.993335485458374,
"learning_rate": 0.00018063073445131168,
"logits/chosen": -0.8994606137275696,
"logits/rejected": -0.9080754518508911,
"logps/chosen": -5.122469902038574,
"logps/rejected": -61.14916229248047,
"loss": 0.2968669831752777,
"memory(GiB)": 45.96,
"nll_loss": 0.21081849932670593,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.38207852840423584,
"rewards/margins": 4.733161926269531,
"rewards/rejected": -4.351083755493164,
"step": 383,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7270575705579552,
"grad_norm": 1.0400865077972412,
"learning_rate": 0.0001805070053127563,
"logits/chosen": -0.901731550693512,
"logits/rejected": -0.9139244556427002,
"logps/chosen": -2.863340377807617,
"logps/rejected": -68.22149658203125,
"loss": 0.18375320732593536,
"memory(GiB)": 45.96,
"nll_loss": 0.11174498498439789,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.430495947599411,
"rewards/margins": 5.3512468338012695,
"rewards/rejected": -4.920751094818115,
"step": 384,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7289509496479498,
"grad_norm": 1.6904346942901611,
"learning_rate": 0.00018038292490701047,
"logits/chosen": -0.9130061268806458,
"logits/rejected": -0.9136845469474792,
"logps/chosen": -9.056621551513672,
"logps/rejected": -46.760475158691406,
"loss": 0.48324084281921387,
"memory(GiB)": 45.96,
"nll_loss": 0.34024232625961304,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.42201292514801025,
"rewards/margins": 3.9340808391571045,
"rewards/rejected": -3.512068271636963,
"step": 385,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7308443287379445,
"grad_norm": 1.1459290981292725,
"learning_rate": 0.00018025849377546033,
"logits/chosen": -0.9257358908653259,
"logits/rejected": -0.9371558427810669,
"logps/chosen": -2.7692415714263916,
"logps/rejected": -71.15418243408203,
"loss": 0.2346101850271225,
"memory(GiB)": 45.96,
"nll_loss": 0.1666901409626007,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.46027594804763794,
"rewards/margins": 5.177318572998047,
"rewards/rejected": -4.717042922973633,
"step": 386,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7327377078279391,
"grad_norm": 10.089129447937012,
"learning_rate": 0.00018013371246102227,
"logits/chosen": -0.8970749378204346,
"logits/rejected": -0.9004898071289062,
"logps/chosen": -5.8673787117004395,
"logps/rejected": -60.121673583984375,
"loss": 0.3606058955192566,
"memory(GiB)": 45.96,
"nll_loss": 0.2795240879058838,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.447785347700119,
"rewards/margins": 5.038176536560059,
"rewards/rejected": -4.590391159057617,
"step": 387,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7346310869179339,
"grad_norm": 1.2866895198822021,
"learning_rate": 0.0001800085815081406,
"logits/chosen": -0.9037926197052002,
"logits/rejected": -0.9107275009155273,
"logps/chosen": -4.869014739990234,
"logps/rejected": -57.07670974731445,
"loss": 0.2692682445049286,
"memory(GiB)": 45.96,
"nll_loss": 0.1857883632183075,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4257521331310272,
"rewards/margins": 4.402857780456543,
"rewards/rejected": -3.9771053791046143,
"step": 388,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7365244660079285,
"grad_norm": 3.418945550918579,
"learning_rate": 0.00017988310146278523,
"logits/chosen": -0.9708212614059448,
"logits/rejected": -0.9790508151054382,
"logps/chosen": -2.9867353439331055,
"logps/rejected": -64.79772186279297,
"loss": 0.25667768716812134,
"memory(GiB)": 45.96,
"nll_loss": 0.1426447629928589,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.34653186798095703,
"rewards/margins": 5.321665287017822,
"rewards/rejected": -4.975133895874023,
"step": 389,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7384178450979232,
"grad_norm": 4.090985298156738,
"learning_rate": 0.00017975727287244914,
"logits/chosen": -1.037940263748169,
"logits/rejected": -1.0541801452636719,
"logps/chosen": -4.899912357330322,
"logps/rejected": -75.53579711914062,
"loss": 0.35355865955352783,
"memory(GiB)": 45.96,
"nll_loss": 0.2508485019207001,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3642263412475586,
"rewards/margins": 5.843046188354492,
"rewards/rejected": -5.478819847106934,
"step": 390,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7403112241879178,
"grad_norm": 1.0435255765914917,
"learning_rate": 0.00017963109628614613,
"logits/chosen": -1.0441638231277466,
"logits/rejected": -1.0574573278427124,
"logps/chosen": -3.3426506519317627,
"logps/rejected": -63.72442626953125,
"loss": 0.23277787864208221,
"memory(GiB)": 45.96,
"nll_loss": 0.20041929185390472,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4242357015609741,
"rewards/margins": 5.191644191741943,
"rewards/rejected": -4.767408847808838,
"step": 391,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7422046032779126,
"grad_norm": 0.7653146386146545,
"learning_rate": 0.0001795045722544083,
"logits/chosen": -0.999144434928894,
"logits/rejected": -1.0147640705108643,
"logps/chosen": -2.727332592010498,
"logps/rejected": -78.85921478271484,
"loss": 0.13891945779323578,
"memory(GiB)": 45.96,
"nll_loss": 0.1272052526473999,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.646836519241333,
"rewards/margins": 6.576606750488281,
"rewards/rejected": -5.929770469665527,
"step": 392,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7440979823679073,
"grad_norm": 9.776786804199219,
"learning_rate": 0.00017937770132928383,
"logits/chosen": -1.0467562675476074,
"logits/rejected": -1.0627236366271973,
"logps/chosen": -6.933349609375,
"logps/rejected": -73.26114654541016,
"loss": 0.7141088247299194,
"memory(GiB)": 45.96,
"nll_loss": 0.5707842111587524,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17063282430171967,
"rewards/margins": 5.584632396697998,
"rewards/rejected": -5.413999557495117,
"step": 393,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7459913614579019,
"grad_norm": 1.990278720855713,
"learning_rate": 0.00017925048406433437,
"logits/chosen": -1.0911043882369995,
"logits/rejected": -1.1038135290145874,
"logps/chosen": -6.190121650695801,
"logps/rejected": -80.86822509765625,
"loss": 0.2924405038356781,
"memory(GiB)": 45.96,
"nll_loss": 0.2574291527271271,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2957814037799835,
"rewards/margins": 6.825494289398193,
"rewards/rejected": -6.5297136306762695,
"step": 394,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7478847405478966,
"grad_norm": 17.2550106048584,
"learning_rate": 0.0001791229210146328,
"logits/chosen": -1.0845831632614136,
"logits/rejected": -1.0984985828399658,
"logps/chosen": -7.322081565856934,
"logps/rejected": -84.80224609375,
"loss": 0.37159523367881775,
"memory(GiB)": 45.96,
"nll_loss": 0.2948389947414398,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.30554482340812683,
"rewards/margins": 6.833071708679199,
"rewards/rejected": -6.527526378631592,
"step": 395,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7497781196378912,
"grad_norm": 0.8952667117118835,
"learning_rate": 0.0001789950127367606,
"logits/chosen": -1.050929307937622,
"logits/rejected": -1.0651614665985107,
"logps/chosen": -3.8682401180267334,
"logps/rejected": -84.12080383300781,
"loss": 0.18135719001293182,
"memory(GiB)": 45.96,
"nll_loss": 0.142669215798378,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3838658928871155,
"rewards/margins": 6.844507217407227,
"rewards/rejected": -6.460641384124756,
"step": 396,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.751671498727886,
"grad_norm": 2.4551334381103516,
"learning_rate": 0.00017886675978880565,
"logits/chosen": -1.037245273590088,
"logits/rejected": -1.0525448322296143,
"logps/chosen": -11.067987442016602,
"logps/rejected": -78.05215454101562,
"loss": 0.5026216506958008,
"memory(GiB)": 45.96,
"nll_loss": 0.41904473304748535,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.319905161857605,
"rewards/margins": 6.043320655822754,
"rewards/rejected": -5.723415374755859,
"step": 397,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7535648778178806,
"grad_norm": 8.531716346740723,
"learning_rate": 0.0001787381627303597,
"logits/chosen": -1.0312135219573975,
"logits/rejected": -1.0378743410110474,
"logps/chosen": -4.678598880767822,
"logps/rejected": -78.02084350585938,
"loss": 0.42119985818862915,
"memory(GiB)": 45.96,
"nll_loss": 0.34666430950164795,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24222567677497864,
"rewards/margins": 6.521797180175781,
"rewards/rejected": -6.279571533203125,
"step": 398,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7554582569078753,
"grad_norm": 3.705852508544922,
"learning_rate": 0.00017860922212251579,
"logits/chosen": -1.0187020301818848,
"logits/rejected": -1.0253901481628418,
"logps/chosen": -8.070443153381348,
"logps/rejected": -69.82466125488281,
"loss": 0.2855599522590637,
"memory(GiB)": 45.96,
"nll_loss": 0.21128731966018677,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.09387722611427307,
"rewards/margins": 5.497537612915039,
"rewards/rejected": -5.403660297393799,
"step": 399,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.7573516359978699,
"grad_norm": 28.791128158569336,
"learning_rate": 0.0001784799385278661,
"logits/chosen": -0.9633829593658447,
"logits/rejected": -0.9697256088256836,
"logps/chosen": -7.547330379486084,
"logps/rejected": -61.4130744934082,
"loss": 0.7181084156036377,
"memory(GiB)": 45.96,
"nll_loss": 0.538273274898529,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18001368641853333,
"rewards/margins": 5.022581577301025,
"rewards/rejected": -4.842568397521973,
"step": 400,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.7592450150878646,
"grad_norm": 23.678117752075195,
"learning_rate": 0.00017835031251049922,
"logits/chosen": -0.9481673240661621,
"logits/rejected": -0.9688194394111633,
"logps/chosen": -3.7135748863220215,
"logps/rejected": -74.0098648071289,
"loss": 0.2994523346424103,
"memory(GiB)": 45.96,
"nll_loss": 0.25903573632240295,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.44725221395492554,
"rewards/margins": 5.681788921356201,
"rewards/rejected": -5.234536170959473,
"step": 401,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7611383941778593,
"grad_norm": 5.658694744110107,
"learning_rate": 0.00017822034463599778,
"logits/chosen": -0.9763189554214478,
"logits/rejected": -0.9897902011871338,
"logps/chosen": -4.176187515258789,
"logps/rejected": -79.24385070800781,
"loss": 0.3210103213787079,
"memory(GiB)": 45.96,
"nll_loss": 0.22857408225536346,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3976101875305176,
"rewards/margins": 6.241819858551025,
"rewards/rejected": -5.84420919418335,
"step": 402,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.763031773267854,
"grad_norm": 1.2923495769500732,
"learning_rate": 0.00017809003547143612,
"logits/chosen": -0.907258927822113,
"logits/rejected": -0.917163074016571,
"logps/chosen": -6.157055377960205,
"logps/rejected": -68.08614349365234,
"loss": 0.24948692321777344,
"memory(GiB)": 45.96,
"nll_loss": 0.21286801993846893,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4159366488456726,
"rewards/margins": 5.365114212036133,
"rewards/rejected": -4.9491777420043945,
"step": 403,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7649251523578486,
"grad_norm": 1.8167670965194702,
"learning_rate": 0.00017795938558537753,
"logits/chosen": -0.9293066263198853,
"logits/rejected": -0.9362936019897461,
"logps/chosen": -6.498391628265381,
"logps/rejected": -60.98576736450195,
"loss": 0.4341224730014801,
"memory(GiB)": 45.96,
"nll_loss": 0.36389267444610596,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.40591150522232056,
"rewards/margins": 4.675572395324707,
"rewards/rejected": -4.269660472869873,
"step": 404,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7668185314478433,
"grad_norm": 1.2195301055908203,
"learning_rate": 0.00017782839554787204,
"logits/chosen": -0.8840275406837463,
"logits/rejected": -0.8963786363601685,
"logps/chosen": -4.563403129577637,
"logps/rejected": -70.3100814819336,
"loss": 0.29657843708992004,
"memory(GiB)": 45.96,
"nll_loss": 0.22001734375953674,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41886448860168457,
"rewards/margins": 5.402155876159668,
"rewards/rejected": -4.983292102813721,
"step": 405,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.768711910537838,
"grad_norm": 0.9042125344276428,
"learning_rate": 0.0001776970659304538,
"logits/chosen": -0.9276862144470215,
"logits/rejected": -0.9463416934013367,
"logps/chosen": -2.721170425415039,
"logps/rejected": -77.12850952148438,
"loss": 0.16812542080879211,
"memory(GiB)": 45.96,
"nll_loss": 0.12775033712387085,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5595777630805969,
"rewards/margins": 5.493441104888916,
"rewards/rejected": -4.933863639831543,
"step": 406,
"train_speed(iter/s)": 0.005574
},
{
"epoch": 0.7706052896278327,
"grad_norm": 6.283580303192139,
"learning_rate": 0.0001775653973061386,
"logits/chosen": -0.8509265780448914,
"logits/rejected": -0.8639415502548218,
"logps/chosen": -4.486887454986572,
"logps/rejected": -56.64537048339844,
"loss": 0.6943869590759277,
"memory(GiB)": 45.96,
"nll_loss": 0.4812234044075012,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1978735774755478,
"rewards/margins": 4.130608558654785,
"rewards/rejected": -3.9327352046966553,
"step": 407,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7724986687178274,
"grad_norm": 2.473437786102295,
"learning_rate": 0.00017743339024942135,
"logits/chosen": -0.8597152233123779,
"logits/rejected": -0.8724321126937866,
"logps/chosen": -3.882218837738037,
"logps/rejected": -59.771484375,
"loss": 0.3383080065250397,
"memory(GiB)": 45.96,
"nll_loss": 0.24344521760940552,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.43006354570388794,
"rewards/margins": 4.42924690246582,
"rewards/rejected": -3.99918270111084,
"step": 408,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.774392047807822,
"grad_norm": 1.8906275033950806,
"learning_rate": 0.0001773010453362737,
"logits/chosen": -0.8703848123550415,
"logits/rejected": -0.8756015300750732,
"logps/chosen": -5.282890319824219,
"logps/rejected": -49.80982208251953,
"loss": 0.3379298746585846,
"memory(GiB)": 45.96,
"nll_loss": 0.23951074481010437,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.365540087223053,
"rewards/margins": 4.006491661071777,
"rewards/rejected": -3.6409518718719482,
"step": 409,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7762854268978167,
"grad_norm": 7.051182270050049,
"learning_rate": 0.00017716836314414137,
"logits/chosen": -0.8841079473495483,
"logits/rejected": -0.8995672464370728,
"logps/chosen": -4.768126964569092,
"logps/rejected": -57.94666290283203,
"loss": 0.7324269413948059,
"memory(GiB)": 45.96,
"nll_loss": 0.41325533390045166,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18045026063919067,
"rewards/margins": 4.116349220275879,
"rewards/rejected": -3.935899496078491,
"step": 410,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7781788059878114,
"grad_norm": 9.723516464233398,
"learning_rate": 0.00017703534425194162,
"logits/chosen": -0.9590765237808228,
"logits/rejected": -0.978516697883606,
"logps/chosen": -3.969177484512329,
"logps/rejected": -77.96525573730469,
"loss": 0.19977864623069763,
"memory(GiB)": 45.96,
"nll_loss": 0.11787045001983643,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41094639897346497,
"rewards/margins": 5.471322059631348,
"rewards/rejected": -5.060375690460205,
"step": 411,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7800721850778061,
"grad_norm": 3.833841323852539,
"learning_rate": 0.00017690198924006097,
"logits/chosen": -0.8818249702453613,
"logits/rejected": -0.8868318200111389,
"logps/chosen": -9.053668022155762,
"logps/rejected": -51.70756149291992,
"loss": 0.8266224265098572,
"memory(GiB)": 45.96,
"nll_loss": 0.5343714356422424,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2412976324558258,
"rewards/margins": 4.036813735961914,
"rewards/rejected": -3.7955162525177,
"step": 412,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7819655641678007,
"grad_norm": 1.554246187210083,
"learning_rate": 0.00017676829869035232,
"logits/chosen": -0.9043519496917725,
"logits/rejected": -0.9118601083755493,
"logps/chosen": -10.494165420532227,
"logps/rejected": -70.82110595703125,
"loss": 0.42945966124534607,
"memory(GiB)": 45.96,
"nll_loss": 0.3161766827106476,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29031792283058167,
"rewards/margins": 5.651849746704102,
"rewards/rejected": -5.361531734466553,
"step": 413,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7838589432577954,
"grad_norm": 7.9514079093933105,
"learning_rate": 0.0001766342731861327,
"logits/chosen": -0.9233826994895935,
"logits/rejected": -0.9361361265182495,
"logps/chosen": -3.67756986618042,
"logps/rejected": -73.57920837402344,
"loss": 0.21047185361385345,
"memory(GiB)": 45.96,
"nll_loss": 0.13145719468593597,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2930607497692108,
"rewards/margins": 5.711090564727783,
"rewards/rejected": -5.41802978515625,
"step": 414,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.78575232234779,
"grad_norm": 8.199553489685059,
"learning_rate": 0.00017649991331218051,
"logits/chosen": -0.9082167148590088,
"logits/rejected": -0.9135277271270752,
"logps/chosen": -6.026224613189697,
"logps/rejected": -63.22338104248047,
"loss": 0.25728654861450195,
"memory(GiB)": 45.96,
"nll_loss": 0.219262033700943,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2262103408575058,
"rewards/margins": 5.247284889221191,
"rewards/rejected": -5.0210747718811035,
"step": 415,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7876457014377848,
"grad_norm": 1.4603794813156128,
"learning_rate": 0.00017636521965473323,
"logits/chosen": -0.9447462558746338,
"logits/rejected": -0.9523710012435913,
"logps/chosen": -5.464984893798828,
"logps/rejected": -70.84123229980469,
"loss": 0.3190080225467682,
"memory(GiB)": 45.96,
"nll_loss": 0.23086979985237122,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4398874342441559,
"rewards/margins": 5.966001987457275,
"rewards/rejected": -5.526113986968994,
"step": 416,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7895390805277794,
"grad_norm": 2.0953357219696045,
"learning_rate": 0.00017623019280148445,
"logits/chosen": -0.9457417130470276,
"logits/rejected": -0.9614331722259521,
"logps/chosen": -6.09683895111084,
"logps/rejected": -71.07952880859375,
"loss": 0.30602532625198364,
"memory(GiB)": 45.96,
"nll_loss": 0.23463232815265656,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4258151054382324,
"rewards/margins": 5.393369674682617,
"rewards/rejected": -4.967555046081543,
"step": 417,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7914324596177741,
"grad_norm": 3.631746530532837,
"learning_rate": 0.00017609483334158181,
"logits/chosen": -0.8911413550376892,
"logits/rejected": -0.9076879620552063,
"logps/chosen": -3.185537576675415,
"logps/rejected": -73.76860809326172,
"loss": 0.27826330065727234,
"memory(GiB)": 45.96,
"nll_loss": 0.17217418551445007,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3891518712043762,
"rewards/margins": 5.921802520751953,
"rewards/rejected": -5.532650947570801,
"step": 418,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7933258387077687,
"grad_norm": 2.356017827987671,
"learning_rate": 0.00017595914186562407,
"logits/chosen": -0.9325594902038574,
"logits/rejected": -0.9440548419952393,
"logps/chosen": -4.001617908477783,
"logps/rejected": -73.55976867675781,
"loss": 0.42719385027885437,
"memory(GiB)": 45.96,
"nll_loss": 0.26717454195022583,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3177154064178467,
"rewards/margins": 5.908562183380127,
"rewards/rejected": -5.590847015380859,
"step": 419,
"train_speed(iter/s)": 0.005575
},
{
"epoch": 0.7952192177977635,
"grad_norm": 2.385035514831543,
"learning_rate": 0.00017582311896565856,
"logits/chosen": -0.9272701740264893,
"logits/rejected": -0.9425795674324036,
"logps/chosen": -5.3703532218933105,
"logps/rejected": -79.19388580322266,
"loss": 0.366239070892334,
"memory(GiB)": 45.96,
"nll_loss": 0.28597089648246765,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23774051666259766,
"rewards/margins": 6.523024082183838,
"rewards/rejected": -6.285284042358398,
"step": 420,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.7971125968877582,
"grad_norm": 1.515577793121338,
"learning_rate": 0.00017568676523517878,
"logits/chosen": -0.9449001550674438,
"logits/rejected": -0.9685764908790588,
"logps/chosen": -3.0468153953552246,
"logps/rejected": -99.55249786376953,
"loss": 0.2705683708190918,
"memory(GiB)": 45.96,
"nll_loss": 0.23674362897872925,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.36185410618782043,
"rewards/margins": 8.01712417602539,
"rewards/rejected": -7.655271053314209,
"step": 421,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.7990059759777528,
"grad_norm": 4.03458833694458,
"learning_rate": 0.00017555008126912168,
"logits/chosen": -0.9106298685073853,
"logits/rejected": -0.9396368861198425,
"logps/chosen": -3.947406768798828,
"logps/rejected": -102.24916076660156,
"loss": 0.4227983355522156,
"memory(GiB)": 45.96,
"nll_loss": 0.2840198278427124,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3644457161426544,
"rewards/margins": 7.7836761474609375,
"rewards/rejected": -7.419230937957764,
"step": 422,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8008993550677475,
"grad_norm": 1.4805070161819458,
"learning_rate": 0.00017541306766386512,
"logits/chosen": -0.8955278396606445,
"logits/rejected": -0.9099395871162415,
"logps/chosen": -3.7780051231384277,
"logps/rejected": -91.8361587524414,
"loss": 0.2600992023944855,
"memory(GiB)": 45.96,
"nll_loss": 0.15484608709812164,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.31357866525650024,
"rewards/margins": 7.206130504608154,
"rewards/rejected": -6.892551422119141,
"step": 423,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8027927341577421,
"grad_norm": 7.871303081512451,
"learning_rate": 0.00017527572501722512,
"logits/chosen": -0.9275432229042053,
"logits/rejected": -0.9326556324958801,
"logps/chosen": -5.747369766235352,
"logps/rejected": -84.74732208251953,
"loss": 0.3905383348464966,
"memory(GiB)": 45.96,
"nll_loss": 0.30991342663764954,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14356550574302673,
"rewards/margins": 6.889118671417236,
"rewards/rejected": -6.745552062988281,
"step": 424,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8046861132477369,
"grad_norm": 4.8259477615356445,
"learning_rate": 0.00017513805392845356,
"logits/chosen": -0.93051677942276,
"logits/rejected": -0.9383388757705688,
"logps/chosen": -6.837670803070068,
"logps/rejected": -88.047119140625,
"loss": 0.4115247428417206,
"memory(GiB)": 45.96,
"nll_loss": 0.24050895869731903,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.09084747731685638,
"rewards/margins": 7.040899753570557,
"rewards/rejected": -6.950051784515381,
"step": 425,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8065794923377315,
"grad_norm": 1.4630215167999268,
"learning_rate": 0.00017500005499823519,
"logits/chosen": -0.8715620636940002,
"logits/rejected": -0.8803263306617737,
"logps/chosen": -7.669510841369629,
"logps/rejected": -83.8923568725586,
"loss": 0.37616875767707825,
"memory(GiB)": 45.96,
"nll_loss": 0.2779691219329834,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3295210897922516,
"rewards/margins": 7.212647438049316,
"rewards/rejected": -6.883126258850098,
"step": 426,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8084728714277262,
"grad_norm": 7.37748908996582,
"learning_rate": 0.0001748617288286853,
"logits/chosen": -0.9009289741516113,
"logits/rejected": -0.9088554978370667,
"logps/chosen": -7.394189357757568,
"logps/rejected": -108.95574951171875,
"loss": 0.33651089668273926,
"memory(GiB)": 45.96,
"nll_loss": 0.2095419317483902,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22998183965682983,
"rewards/margins": 9.595008850097656,
"rewards/rejected": -9.365028381347656,
"step": 427,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8103662505177208,
"grad_norm": 6.123429298400879,
"learning_rate": 0.00017472307602334693,
"logits/chosen": -0.89423668384552,
"logits/rejected": -0.9038995504379272,
"logps/chosen": -8.802855491638184,
"logps/rejected": -88.23287200927734,
"loss": 0.4874518811702728,
"memory(GiB)": 45.96,
"nll_loss": 0.3115327060222626,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.11184003949165344,
"rewards/margins": 7.504295825958252,
"rewards/rejected": -7.392455577850342,
"step": 428,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8122596296077155,
"grad_norm": 6.689691543579102,
"learning_rate": 0.00017458409718718834,
"logits/chosen": -0.8707554340362549,
"logits/rejected": -0.886796772480011,
"logps/chosen": -4.8936262130737305,
"logps/rejected": -88.58076477050781,
"loss": 0.5303760170936584,
"memory(GiB)": 45.96,
"nll_loss": 0.4417770802974701,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.15029491484165192,
"rewards/margins": 7.341009140014648,
"rewards/rejected": -7.190713405609131,
"step": 429,
"train_speed(iter/s)": 0.005576
},
{
"epoch": 0.8141530086977102,
"grad_norm": 8.597928047180176,
"learning_rate": 0.0001744447929266003,
"logits/chosen": -0.8662844896316528,
"logits/rejected": -0.8829063773155212,
"logps/chosen": -5.029667377471924,
"logps/rejected": -87.51130676269531,
"loss": 0.39819207787513733,
"memory(GiB)": 45.96,
"nll_loss": 0.28675615787506104,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.22954146564006805,
"rewards/margins": 6.7957072257995605,
"rewards/rejected": -6.566165924072266,
"step": 430,
"train_speed(iter/s)": 0.005577
},
{
"epoch": 0.8160463877877049,
"grad_norm": 2.8258883953094482,
"learning_rate": 0.00017430516384939345,
"logits/chosen": -0.826620876789093,
"logits/rejected": -0.833583414554596,
"logps/chosen": -6.807863235473633,
"logps/rejected": -74.75788879394531,
"loss": 0.524578869342804,
"memory(GiB)": 45.96,
"nll_loss": 0.4435310363769531,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2683424651622772,
"rewards/margins": 6.224869728088379,
"rewards/rejected": -5.956527233123779,
"step": 431,
"train_speed(iter/s)": 0.005577
},
{
"epoch": 0.8179397668776995,
"grad_norm": 24.219331741333008,
"learning_rate": 0.00017416521056479577,
"logits/chosen": -0.815615177154541,
"logits/rejected": -0.8294793367385864,
"logps/chosen": -5.088006496429443,
"logps/rejected": -85.76319122314453,
"loss": 0.4257265627384186,
"memory(GiB)": 45.96,
"nll_loss": 0.39785972237586975,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.33022740483283997,
"rewards/margins": 6.924592018127441,
"rewards/rejected": -6.594364166259766,
"step": 432,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.8198331459676942,
"grad_norm": 9.516819953918457,
"learning_rate": 0.00017402493368344965,
"logits/chosen": -0.7762714624404907,
"logits/rejected": -0.7849063277244568,
"logps/chosen": -6.736428260803223,
"logps/rejected": -70.95455169677734,
"loss": 0.4678858518600464,
"memory(GiB)": 45.96,
"nll_loss": 0.3948495388031006,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.13923215866088867,
"rewards/margins": 5.282342433929443,
"rewards/rejected": -5.143110275268555,
"step": 433,
"train_speed(iter/s)": 0.005577
},
{
"epoch": 0.8217265250576888,
"grad_norm": 7.945901393890381,
"learning_rate": 0.00017388433381740952,
"logits/chosen": -0.7900452613830566,
"logits/rejected": -0.7998518347740173,
"logps/chosen": -6.878015041351318,
"logps/rejected": -73.27943420410156,
"loss": 0.40994495153427124,
"memory(GiB)": 45.96,
"nll_loss": 0.3519839644432068,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4654313027858734,
"rewards/margins": 6.1711835861206055,
"rewards/rejected": -5.705752849578857,
"step": 434,
"train_speed(iter/s)": 0.005577
},
{
"epoch": 0.8236199041476836,
"grad_norm": 1.621781349182129,
"learning_rate": 0.00017374341158013897,
"logits/chosen": -0.7397841215133667,
"logits/rejected": -0.7477171421051025,
"logps/chosen": -8.785954475402832,
"logps/rejected": -74.62800598144531,
"loss": 0.3700712323188782,
"memory(GiB)": 45.96,
"nll_loss": 0.29524165391921997,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4034354090690613,
"rewards/margins": 5.8851189613342285,
"rewards/rejected": -5.481683731079102,
"step": 435,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.8255132832376783,
"grad_norm": 11.901042938232422,
"learning_rate": 0.00017360216758650828,
"logits/chosen": -0.7307888269424438,
"logits/rejected": -0.73638516664505,
"logps/chosen": -8.413528442382812,
"logps/rejected": -62.19019317626953,
"loss": 0.4531805217266083,
"memory(GiB)": 45.96,
"nll_loss": 0.3570531904697418,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.39727261662483215,
"rewards/margins": 4.906312465667725,
"rewards/rejected": -4.509039878845215,
"step": 436,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.8274066623276729,
"grad_norm": 12.022588729858398,
"learning_rate": 0.00017346060245279147,
"logits/chosen": -0.7360296249389648,
"logits/rejected": -0.7512168288230896,
"logps/chosen": -5.395040035247803,
"logps/rejected": -66.02803802490234,
"loss": 0.2887762784957886,
"memory(GiB)": 45.96,
"nll_loss": 0.22481848299503326,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2582862079143524,
"rewards/margins": 4.8272881507873535,
"rewards/rejected": -4.5690016746521,
"step": 437,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.8293000414176676,
"grad_norm": 5.518744945526123,
"learning_rate": 0.0001733187167966638,
"logits/chosen": -0.7701220512390137,
"logits/rejected": -0.7844356298446655,
"logps/chosen": -2.579286575317383,
"logps/rejected": -66.53873443603516,
"loss": 0.3727279603481293,
"memory(GiB)": 45.96,
"nll_loss": 0.2864982485771179,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4387655556201935,
"rewards/margins": 5.002132415771484,
"rewards/rejected": -4.563366413116455,
"step": 438,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.8311934205076623,
"grad_norm": 3.2701282501220703,
"learning_rate": 0.00017317651123719912,
"logits/chosen": -0.7506716251373291,
"logits/rejected": -0.7568422555923462,
"logps/chosen": -11.24153995513916,
"logps/rejected": -60.69418716430664,
"loss": 0.5295559763908386,
"memory(GiB)": 45.96,
"nll_loss": 0.45408472418785095,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.36308178305625916,
"rewards/margins": 4.746029853820801,
"rewards/rejected": -4.38294792175293,
"step": 439,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.833086799597657,
"grad_norm": 1.1384278535842896,
"learning_rate": 0.00017303398639486695,
"logits/chosen": -0.731947660446167,
"logits/rejected": -0.7437530755996704,
"logps/chosen": -9.611553192138672,
"logps/rejected": -76.5805892944336,
"loss": 0.2904091775417328,
"memory(GiB)": 45.96,
"nll_loss": 0.2315519154071808,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.531777024269104,
"rewards/margins": 5.823252201080322,
"rewards/rejected": -5.291475772857666,
"step": 440,
"train_speed(iter/s)": 0.005578
},
{
"epoch": 0.8349801786876516,
"grad_norm": 0.8361400365829468,
"learning_rate": 0.00017289114289152996,
"logits/chosen": -0.7166184186935425,
"logits/rejected": -0.734869122505188,
"logps/chosen": -5.195431232452393,
"logps/rejected": -79.26923370361328,
"loss": 0.25895360112190247,
"memory(GiB)": 45.96,
"nll_loss": 0.21112824976444244,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6189270615577698,
"rewards/margins": 6.133816242218018,
"rewards/rejected": -5.514889240264893,
"step": 441,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8368735577776463,
"grad_norm": 2.4993669986724854,
"learning_rate": 0.00017274798135044118,
"logits/chosen": -0.790854811668396,
"logits/rejected": -0.8087242841720581,
"logps/chosen": -3.1484498977661133,
"logps/rejected": -92.63924407958984,
"loss": 0.17340044677257538,
"memory(GiB)": 45.96,
"nll_loss": 0.11792504787445068,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.323365181684494,
"rewards/margins": 7.355247497558594,
"rewards/rejected": -7.0318827629089355,
"step": 442,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8387669368676409,
"grad_norm": 1.7912027835845947,
"learning_rate": 0.00017260450239624136,
"logits/chosen": -0.7304463982582092,
"logits/rejected": -0.7448377013206482,
"logps/chosen": -5.269331932067871,
"logps/rejected": -84.68616485595703,
"loss": 0.2722683548927307,
"memory(GiB)": 45.96,
"nll_loss": 0.19279897212982178,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2668758034706116,
"rewards/margins": 6.523564338684082,
"rewards/rejected": -6.256688117980957,
"step": 443,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8406603159576357,
"grad_norm": 2.5274224281311035,
"learning_rate": 0.00017246070665495608,
"logits/chosen": -0.754114031791687,
"logits/rejected": -0.7749913930892944,
"logps/chosen": -4.680078506469727,
"logps/rejected": -90.58206939697266,
"loss": 0.2556043863296509,
"memory(GiB)": 45.96,
"nll_loss": 0.2013716846704483,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5823894739151001,
"rewards/margins": 7.6140594482421875,
"rewards/rejected": -7.031670570373535,
"step": 444,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8425536950476303,
"grad_norm": 1.2107690572738647,
"learning_rate": 0.00017231659475399323,
"logits/chosen": -0.7979104518890381,
"logits/rejected": -0.8069046139717102,
"logps/chosen": -4.9781174659729,
"logps/rejected": -66.70126342773438,
"loss": 0.30611103773117065,
"memory(GiB)": 45.96,
"nll_loss": 0.23165598511695862,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4561145305633545,
"rewards/margins": 5.505497455596924,
"rewards/rejected": -5.04938268661499,
"step": 445,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.844447074137625,
"grad_norm": 4.050295829772949,
"learning_rate": 0.0001721721673221401,
"logits/chosen": -0.7885401248931885,
"logits/rejected": -0.8013665676116943,
"logps/chosen": -6.65448522567749,
"logps/rejected": -85.34944152832031,
"loss": 0.3965107798576355,
"memory(GiB)": 45.96,
"nll_loss": 0.25117045640945435,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4342056214809418,
"rewards/margins": 7.116891860961914,
"rewards/rejected": -6.682686805725098,
"step": 446,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8463404532276196,
"grad_norm": 1.9369865655899048,
"learning_rate": 0.00017202742498956066,
"logits/chosen": -0.8296957612037659,
"logits/rejected": -0.8483850359916687,
"logps/chosen": -5.465951442718506,
"logps/rejected": -83.44580078125,
"loss": 0.29229405522346497,
"memory(GiB)": 45.96,
"nll_loss": 0.2555358409881592,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34571531414985657,
"rewards/margins": 6.757546901702881,
"rewards/rejected": -6.411831855773926,
"step": 447,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8482338323176143,
"grad_norm": 1.0717179775238037,
"learning_rate": 0.00017188236838779295,
"logits/chosen": -0.8507705926895142,
"logits/rejected": -0.8675693273544312,
"logps/chosen": -3.8401472568511963,
"logps/rejected": -105.99805450439453,
"loss": 0.2020038366317749,
"memory(GiB)": 45.96,
"nll_loss": 0.15445975959300995,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.43529555201530457,
"rewards/margins": 8.494356155395508,
"rewards/rejected": -8.059060096740723,
"step": 448,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.850127211407609,
"grad_norm": 1.2371408939361572,
"learning_rate": 0.00017173699814974615,
"logits/chosen": -0.8888499140739441,
"logits/rejected": -0.8976138234138489,
"logps/chosen": -6.716226100921631,
"logps/rejected": -81.250732421875,
"loss": 0.3499948978424072,
"memory(GiB)": 45.96,
"nll_loss": 0.29640763998031616,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4713817238807678,
"rewards/margins": 7.038424491882324,
"rewards/rejected": -6.567043304443359,
"step": 449,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8520205904976037,
"grad_norm": 1.0314913988113403,
"learning_rate": 0.00017159131490969797,
"logits/chosen": -0.8845159411430359,
"logits/rejected": -0.897428035736084,
"logps/chosen": -7.58637809753418,
"logps/rejected": -90.65620422363281,
"loss": 0.22296631336212158,
"memory(GiB)": 45.96,
"nll_loss": 0.1991596817970276,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3203076124191284,
"rewards/margins": 7.438530921936035,
"rewards/rejected": -7.118223667144775,
"step": 450,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8539139695875984,
"grad_norm": 14.719244003295898,
"learning_rate": 0.0001714453193032917,
"logits/chosen": -0.8827124834060669,
"logits/rejected": -0.893791675567627,
"logps/chosen": -4.368500232696533,
"logps/rejected": -82.19820404052734,
"loss": 0.31974878907203674,
"memory(GiB)": 45.96,
"nll_loss": 0.24097216129302979,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.44965288043022156,
"rewards/margins": 6.721735000610352,
"rewards/rejected": -6.2720818519592285,
"step": 451,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.855807348677593,
"grad_norm": 36.062278747558594,
"learning_rate": 0.00017129901196753363,
"logits/chosen": -0.9345687627792358,
"logits/rejected": -0.9502599835395813,
"logps/chosen": -5.315582275390625,
"logps/rejected": -83.8296127319336,
"loss": 0.34316593408584595,
"memory(GiB)": 45.96,
"nll_loss": 0.2703927457332611,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2453213632106781,
"rewards/margins": 6.990170955657959,
"rewards/rejected": -6.744849681854248,
"step": 452,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8577007277675878,
"grad_norm": 1.541624903678894,
"learning_rate": 0.00017115239354079017,
"logits/chosen": -0.9115346074104309,
"logits/rejected": -0.9224709868431091,
"logps/chosen": -9.181022644042969,
"logps/rejected": -101.25410461425781,
"loss": 0.34988313913345337,
"memory(GiB)": 45.96,
"nll_loss": 0.3383327126502991,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34222501516342163,
"rewards/margins": 8.531024932861328,
"rewards/rejected": -8.188799858093262,
"step": 453,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8595941068575824,
"grad_norm": 3.925374746322632,
"learning_rate": 0.00017100546466278504,
"logits/chosen": -0.9633154273033142,
"logits/rejected": -0.9739294648170471,
"logps/chosen": -4.56303071975708,
"logps/rejected": -88.93602752685547,
"loss": 0.25692471861839294,
"memory(GiB)": 45.96,
"nll_loss": 0.2111371010541916,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45011770725250244,
"rewards/margins": 7.744128227233887,
"rewards/rejected": -7.294011116027832,
"step": 454,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8614874859475771,
"grad_norm": 1.6003632545471191,
"learning_rate": 0.00017085822597459656,
"logits/chosen": -0.9982748627662659,
"logits/rejected": -1.014983892440796,
"logps/chosen": -4.145792484283447,
"logps/rejected": -106.2919921875,
"loss": 0.3255295157432556,
"memory(GiB)": 45.96,
"nll_loss": 0.18978404998779297,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3449160158634186,
"rewards/margins": 8.899467468261719,
"rewards/rejected": -8.554551124572754,
"step": 455,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8633808650375717,
"grad_norm": 1.9852300882339478,
"learning_rate": 0.00017071067811865476,
"logits/chosen": -0.9765909910202026,
"logits/rejected": -0.9930113554000854,
"logps/chosen": -7.842015266418457,
"logps/rejected": -123.04806518554688,
"loss": 0.32382023334503174,
"memory(GiB)": 45.96,
"nll_loss": 0.31453680992126465,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.43028274178504944,
"rewards/margins": 10.73808765411377,
"rewards/rejected": -10.307806015014648,
"step": 456,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8652742441275664,
"grad_norm": 1.2360267639160156,
"learning_rate": 0.00017056282173873868,
"logits/chosen": -0.9575759768486023,
"logits/rejected": -0.9700069427490234,
"logps/chosen": -10.015963554382324,
"logps/rejected": -102.37469482421875,
"loss": 0.3883022665977478,
"memory(GiB)": 45.96,
"nll_loss": 0.3106726109981537,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5499778389930725,
"rewards/margins": 8.473649024963379,
"rewards/rejected": -7.923670291900635,
"step": 457,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8671676232175611,
"grad_norm": 1.6001282930374146,
"learning_rate": 0.00017041465747997349,
"logits/chosen": -0.9415493011474609,
"logits/rejected": -0.9562855958938599,
"logps/chosen": -9.043622016906738,
"logps/rejected": -96.49923706054688,
"loss": 0.4010081887245178,
"memory(GiB)": 45.96,
"nll_loss": 0.3429657518863678,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36076611280441284,
"rewards/margins": 7.912264823913574,
"rewards/rejected": -7.551499366760254,
"step": 458,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8690610023075558,
"grad_norm": 4.4591827392578125,
"learning_rate": 0.00017026618598882766,
"logits/chosen": -0.8824436068534851,
"logits/rejected": -0.9026194214820862,
"logps/chosen": -5.729236602783203,
"logps/rejected": -98.84695434570312,
"loss": 0.6645115613937378,
"memory(GiB)": 45.96,
"nll_loss": 0.5048111081123352,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.15461787581443787,
"rewards/margins": 8.146541595458984,
"rewards/rejected": -7.991923809051514,
"step": 459,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 0.8709543813975504,
"grad_norm": 4.195268630981445,
"learning_rate": 0.00017011740791311026,
"logits/chosen": -0.9580066800117493,
"logits/rejected": -0.9738634824752808,
"logps/chosen": -8.056970596313477,
"logps/rejected": -81.84449005126953,
"loss": 0.43963536620140076,
"memory(GiB)": 45.96,
"nll_loss": 0.26443713903427124,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.40618056058883667,
"rewards/margins": 6.734289646148682,
"rewards/rejected": -6.328108787536621,
"step": 460,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8728477604875451,
"grad_norm": 1.0153616666793823,
"learning_rate": 0.00016996832390196793,
"logits/chosen": -0.8880928158760071,
"logits/rejected": -0.8997581601142883,
"logps/chosen": -6.155505657196045,
"logps/rejected": -90.45980834960938,
"loss": 0.25239306688308716,
"memory(GiB)": 45.96,
"nll_loss": 0.20010052621364594,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5011169910430908,
"rewards/margins": 7.597998142242432,
"rewards/rejected": -7.09688138961792,
"step": 461,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8747411395775397,
"grad_norm": 1.5598828792572021,
"learning_rate": 0.00016981893460588223,
"logits/chosen": -0.9450682401657104,
"logits/rejected": -0.9603253602981567,
"logps/chosen": -5.602974891662598,
"logps/rejected": -77.44328308105469,
"loss": 0.2963503897190094,
"memory(GiB)": 45.96,
"nll_loss": 0.19901219010353088,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3095168471336365,
"rewards/margins": 6.423759937286377,
"rewards/rejected": -6.114243507385254,
"step": 462,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8766345186675345,
"grad_norm": 1.6015018224716187,
"learning_rate": 0.00016966924067666675,
"logits/chosen": -0.9075458645820618,
"logits/rejected": -0.9180577397346497,
"logps/chosen": -5.821288108825684,
"logps/rejected": -82.2751235961914,
"loss": 0.4034554958343506,
"memory(GiB)": 45.96,
"nll_loss": 0.32892781496047974,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.50316321849823,
"rewards/margins": 7.111847400665283,
"rewards/rejected": -6.608684539794922,
"step": 463,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8785278977575292,
"grad_norm": 1.3844958543777466,
"learning_rate": 0.00016951924276746425,
"logits/chosen": -0.9798877239227295,
"logits/rejected": -0.9947710633277893,
"logps/chosen": -4.286856651306152,
"logps/rejected": -95.45182037353516,
"loss": 0.24686779081821442,
"memory(GiB)": 45.96,
"nll_loss": 0.19889356195926666,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41103440523147583,
"rewards/margins": 8.060623168945312,
"rewards/rejected": -7.649588584899902,
"step": 464,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8804212768475238,
"grad_norm": 0.8604599833488464,
"learning_rate": 0.0001693689415327437,
"logits/chosen": -0.9294370412826538,
"logits/rejected": -0.944360077381134,
"logps/chosen": -3.5297131538391113,
"logps/rejected": -95.1581039428711,
"loss": 0.15934985876083374,
"memory(GiB)": 45.96,
"nll_loss": 0.09140884131193161,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4215770959854126,
"rewards/margins": 8.435728073120117,
"rewards/rejected": -8.014151573181152,
"step": 465,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8823146559375185,
"grad_norm": 1.621468186378479,
"learning_rate": 0.00016921833762829772,
"logits/chosen": -0.9183394312858582,
"logits/rejected": -0.9399121403694153,
"logps/chosen": -3.055697441101074,
"logps/rejected": -108.91096496582031,
"loss": 0.22333787381649017,
"memory(GiB)": 45.96,
"nll_loss": 0.14798688888549805,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5031476616859436,
"rewards/margins": 9.055591583251953,
"rewards/rejected": -8.552444458007812,
"step": 466,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8842080350275132,
"grad_norm": 0.7695557475090027,
"learning_rate": 0.00016906743171123942,
"logits/chosen": -0.9076614379882812,
"logits/rejected": -0.937860906124115,
"logps/chosen": -3.8487682342529297,
"logps/rejected": -115.37907409667969,
"loss": 0.2175092250108719,
"memory(GiB)": 45.96,
"nll_loss": 0.20558762550354004,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4292341470718384,
"rewards/margins": 9.0150146484375,
"rewards/rejected": -8.585780143737793,
"step": 467,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8861014141175079,
"grad_norm": 22.37851333618164,
"learning_rate": 0.00016891622443999965,
"logits/chosen": -0.938933789730072,
"logits/rejected": -0.9588154554367065,
"logps/chosen": -4.282645225524902,
"logps/rejected": -119.61936950683594,
"loss": 0.28716757893562317,
"memory(GiB)": 45.96,
"nll_loss": 0.1910058856010437,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4263598322868347,
"rewards/margins": 10.150740623474121,
"rewards/rejected": -9.724381446838379,
"step": 468,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8879947932075025,
"grad_norm": 2.1868958473205566,
"learning_rate": 0.00016876471647432414,
"logits/chosen": -0.9410998225212097,
"logits/rejected": -0.9753378629684448,
"logps/chosen": -2.8839712142944336,
"logps/rejected": -123.82636260986328,
"loss": 0.30020710825920105,
"memory(GiB)": 45.96,
"nll_loss": 0.16036656498908997,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36097994446754456,
"rewards/margins": 9.432804107666016,
"rewards/rejected": -9.071824073791504,
"step": 469,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8898881722974972,
"grad_norm": 1.1966303586959839,
"learning_rate": 0.00016861290847527066,
"logits/chosen": -0.9341630935668945,
"logits/rejected": -0.9561231732368469,
"logps/chosen": -4.715222358703613,
"logps/rejected": -99.74626922607422,
"loss": 0.2830410897731781,
"memory(GiB)": 45.96,
"nll_loss": 0.26199036836624146,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5495744943618774,
"rewards/margins": 8.375075340270996,
"rewards/rejected": -7.825501441955566,
"step": 470,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8917815513874918,
"grad_norm": 5.522665977478027,
"learning_rate": 0.00016846080110520593,
"logits/chosen": -0.8682283759117126,
"logits/rejected": -0.8838706016540527,
"logps/chosen": -7.110651969909668,
"logps/rejected": -98.35552215576172,
"loss": 0.5406176447868347,
"memory(GiB)": 45.96,
"nll_loss": 0.3845999240875244,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2689996361732483,
"rewards/margins": 8.083311080932617,
"rewards/rejected": -7.814311504364014,
"step": 471,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8936749304774866,
"grad_norm": 0.9458474516868591,
"learning_rate": 0.0001683083950278031,
"logits/chosen": -0.9151694178581238,
"logits/rejected": -0.9346402883529663,
"logps/chosen": -4.737029075622559,
"logps/rejected": -121.00469970703125,
"loss": 0.2966020405292511,
"memory(GiB)": 45.96,
"nll_loss": 0.2277030497789383,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4393775463104248,
"rewards/margins": 10.670300483703613,
"rewards/rejected": -10.23092269897461,
"step": 472,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8955683095674812,
"grad_norm": 7.999751091003418,
"learning_rate": 0.00016815569090803845,
"logits/chosen": -0.8978246450424194,
"logits/rejected": -0.9048880934715271,
"logps/chosen": -7.204007148742676,
"logps/rejected": -87.66303253173828,
"loss": 0.42673900723457336,
"memory(GiB)": 45.96,
"nll_loss": 0.35650965571403503,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3317716717720032,
"rewards/margins": 7.524182319641113,
"rewards/rejected": -7.192410469055176,
"step": 473,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8974616886574759,
"grad_norm": 0.7010167837142944,
"learning_rate": 0.00016800268941218876,
"logits/chosen": -0.8622817397117615,
"logits/rejected": -0.8864709138870239,
"logps/chosen": -4.245789051055908,
"logps/rejected": -120.96448516845703,
"loss": 0.1819450557231903,
"memory(GiB)": 45.96,
"nll_loss": 0.14287763833999634,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41072070598602295,
"rewards/margins": 10.304065704345703,
"rewards/rejected": -9.89334487915039,
"step": 474,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 0.8993550677474705,
"grad_norm": 7.6167731285095215,
"learning_rate": 0.0001678493912078283,
"logits/chosen": -0.8571869730949402,
"logits/rejected": -0.8682100772857666,
"logps/chosen": -6.5908732414245605,
"logps/rejected": -90.01347351074219,
"loss": 0.3374626636505127,
"memory(GiB)": 45.96,
"nll_loss": 0.2244843989610672,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3946775496006012,
"rewards/margins": 7.9344305992126465,
"rewards/rejected": -7.539752006530762,
"step": 475,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.9012484468374652,
"grad_norm": 3.698955774307251,
"learning_rate": 0.00016769579696382597,
"logits/chosen": -0.8630130887031555,
"logits/rejected": -0.8758262991905212,
"logps/chosen": -4.464090347290039,
"logps/rejected": -84.8655014038086,
"loss": 0.24113307893276215,
"memory(GiB)": 45.96,
"nll_loss": 0.19968506693840027,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5144667625427246,
"rewards/margins": 7.58385705947876,
"rewards/rejected": -7.069390296936035,
"step": 476,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.90314182592746,
"grad_norm": 1.0875921249389648,
"learning_rate": 0.00016754190735034232,
"logits/chosen": -0.8026514649391174,
"logits/rejected": -0.8109226226806641,
"logps/chosen": -7.072743892669678,
"logps/rejected": -81.69027709960938,
"loss": 0.3926900029182434,
"memory(GiB)": 45.96,
"nll_loss": 0.32436299324035645,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.42420172691345215,
"rewards/margins": 7.307297706604004,
"rewards/rejected": -6.883096694946289,
"step": 477,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.9050352050174546,
"grad_norm": 12.628859519958496,
"learning_rate": 0.00016738772303882658,
"logits/chosen": -0.8218420743942261,
"logits/rejected": -0.8415544033050537,
"logps/chosen": -3.9710536003112793,
"logps/rejected": -114.25907897949219,
"loss": 0.285603404045105,
"memory(GiB)": 45.96,
"nll_loss": 0.2653937041759491,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3051114082336426,
"rewards/margins": 9.78807544708252,
"rewards/rejected": -9.482963562011719,
"step": 478,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.9069285841074493,
"grad_norm": 3.7553205490112305,
"learning_rate": 0.00016723324470201394,
"logits/chosen": -0.8214201927185059,
"logits/rejected": -0.8359025716781616,
"logps/chosen": -7.0973076820373535,
"logps/rejected": -96.85978698730469,
"loss": 0.2682635188102722,
"memory(GiB)": 45.96,
"nll_loss": 0.21152906119823456,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.429471880197525,
"rewards/margins": 8.366806983947754,
"rewards/rejected": -7.937335968017578,
"step": 479,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.9088219631974439,
"grad_norm": 5.100663661956787,
"learning_rate": 0.00016707847301392236,
"logits/chosen": -0.8678508996963501,
"logits/rejected": -0.886093258857727,
"logps/chosen": -4.311007976531982,
"logps/rejected": -87.9342269897461,
"loss": 0.3412279784679413,
"memory(GiB)": 45.96,
"nll_loss": 0.16602440178394318,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21858087182044983,
"rewards/margins": 6.955101490020752,
"rewards/rejected": -6.736520767211914,
"step": 480,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.9107153422874387,
"grad_norm": 2.6578102111816406,
"learning_rate": 0.0001669234086498498,
"logits/chosen": -0.8269668817520142,
"logits/rejected": -0.8376889824867249,
"logps/chosen": -6.732077598571777,
"logps/rejected": -84.00537109375,
"loss": 0.5132743716239929,
"memory(GiB)": 45.96,
"nll_loss": 0.4207915961742401,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21707794070243835,
"rewards/margins": 6.86088752746582,
"rewards/rejected": -6.643810272216797,
"step": 481,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.9126087213774333,
"grad_norm": 7.355591773986816,
"learning_rate": 0.00016676805228637128,
"logits/chosen": -0.7974196672439575,
"logits/rejected": -0.8050395250320435,
"logps/chosen": -9.839652061462402,
"logps/rejected": -77.39722442626953,
"loss": 0.3702613115310669,
"memory(GiB)": 45.96,
"nll_loss": 0.3158036768436432,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.38017088174819946,
"rewards/margins": 6.458867073059082,
"rewards/rejected": -6.078695774078369,
"step": 482,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 0.914502100467428,
"grad_norm": 1.2167003154754639,
"learning_rate": 0.0001666124046013357,
"logits/chosen": -0.8047705292701721,
"logits/rejected": -0.821438193321228,
"logps/chosen": -4.215728759765625,
"logps/rejected": -84.90574645996094,
"loss": 0.2564030885696411,
"memory(GiB)": 45.96,
"nll_loss": 0.17464032769203186,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36784717440605164,
"rewards/margins": 6.691460132598877,
"rewards/rejected": -6.323612689971924,
"step": 483,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 0.9163954795574226,
"grad_norm": 1.4329453706741333,
"learning_rate": 0.0001664564662738632,
"logits/chosen": -0.8270524144172668,
"logits/rejected": -0.843065619468689,
"logps/chosen": -3.869436502456665,
"logps/rejected": -82.40938568115234,
"loss": 0.32981476187705994,
"memory(GiB)": 45.96,
"nll_loss": 0.24593578279018402,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4524030089378357,
"rewards/margins": 6.6524176597595215,
"rewards/rejected": -6.200014591217041,
"step": 484,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 0.9182888586474173,
"grad_norm": 1.2793928384780884,
"learning_rate": 0.00016630023798434206,
"logits/chosen": -0.8093842267990112,
"logits/rejected": -0.8249430656433105,
"logps/chosen": -3.626284122467041,
"logps/rejected": -91.00061798095703,
"loss": 0.26968449354171753,
"memory(GiB)": 45.96,
"nll_loss": 0.18248513340950012,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5210257768630981,
"rewards/margins": 7.8323211669921875,
"rewards/rejected": -7.311295509338379,
"step": 485,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 0.920182237737412,
"grad_norm": 1.2872005701065063,
"learning_rate": 0.0001661437204144256,
"logits/chosen": -0.8859755396842957,
"logits/rejected": -0.9020763635635376,
"logps/chosen": -3.142106771469116,
"logps/rejected": -110.82911682128906,
"loss": 0.23602813482284546,
"memory(GiB)": 45.96,
"nll_loss": 0.17257589101791382,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2963697910308838,
"rewards/margins": 9.594768524169922,
"rewards/rejected": -9.2983980178833,
"step": 486,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 0.9220756168274067,
"grad_norm": 1.0377421379089355,
"learning_rate": 0.00016598691424702937,
"logits/chosen": -0.8930898904800415,
"logits/rejected": -0.9027186036109924,
"logps/chosen": -8.572845458984375,
"logps/rejected": -103.29754638671875,
"loss": 0.34422510862350464,
"memory(GiB)": 45.96,
"nll_loss": 0.31612199544906616,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.42877423763275146,
"rewards/margins": 9.359115600585938,
"rewards/rejected": -8.930340766906738,
"step": 487,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9239689959174013,
"grad_norm": 5.561287879943848,
"learning_rate": 0.00016582982016632818,
"logits/chosen": -0.9102674126625061,
"logits/rejected": -0.9301952123641968,
"logps/chosen": -5.624942302703857,
"logps/rejected": -136.92950439453125,
"loss": 0.411335289478302,
"memory(GiB)": 45.96,
"nll_loss": 0.3478354811668396,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.40333279967308044,
"rewards/margins": 12.023845672607422,
"rewards/rejected": -11.620512962341309,
"step": 488,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.925862375007396,
"grad_norm": 1.0229040384292603,
"learning_rate": 0.000165672438857753,
"logits/chosen": -0.9191131591796875,
"logits/rejected": -0.924005389213562,
"logps/chosen": -7.766480922698975,
"logps/rejected": -100.96819305419922,
"loss": 0.3040256202220917,
"memory(GiB)": 45.96,
"nll_loss": 0.26725876331329346,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4234240651130676,
"rewards/margins": 9.132671356201172,
"rewards/rejected": -8.709247589111328,
"step": 489,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9277557540973906,
"grad_norm": 19.993261337280273,
"learning_rate": 0.00016551477100798805,
"logits/chosen": -0.9173243045806885,
"logits/rejected": -0.931130051612854,
"logps/chosen": -9.224342346191406,
"logps/rejected": -119.46231079101562,
"loss": 0.6596160531044006,
"memory(GiB)": 45.96,
"nll_loss": 0.5873731374740601,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28087401390075684,
"rewards/margins": 9.973217010498047,
"rewards/rejected": -9.692342758178711,
"step": 490,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9296491331873854,
"grad_norm": 1.2866884469985962,
"learning_rate": 0.00016535681730496778,
"logits/chosen": -0.9484301805496216,
"logits/rejected": -0.9697479605674744,
"logps/chosen": -7.1799516677856445,
"logps/rejected": -141.3379364013672,
"loss": 0.28797227144241333,
"memory(GiB)": 45.96,
"nll_loss": 0.25906774401664734,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5529451370239258,
"rewards/margins": 12.745800971984863,
"rewards/rejected": -12.192853927612305,
"step": 491,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.93154251227738,
"grad_norm": 1.1486427783966064,
"learning_rate": 0.00016519857843787388,
"logits/chosen": -0.8829447627067566,
"logits/rejected": -0.8954159021377563,
"logps/chosen": -3.612278938293457,
"logps/rejected": -104.1048583984375,
"loss": 0.24075637757778168,
"memory(GiB)": 45.96,
"nll_loss": 0.17766651511192322,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.39927470684051514,
"rewards/margins": 9.08088493347168,
"rewards/rejected": -8.681610107421875,
"step": 492,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9334358913673747,
"grad_norm": 6.187593460083008,
"learning_rate": 0.00016504005509713227,
"logits/chosen": -0.9053263068199158,
"logits/rejected": -0.9288167357444763,
"logps/chosen": -7.226568222045898,
"logps/rejected": -149.4182586669922,
"loss": 1.2350273132324219,
"memory(GiB)": 45.96,
"nll_loss": 1.0333458185195923,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1103183850646019,
"rewards/margins": 12.931726455688477,
"rewards/rejected": -12.821407318115234,
"step": 493,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9353292704573694,
"grad_norm": 4.0292534828186035,
"learning_rate": 0.00016488124797441004,
"logits/chosen": -0.896517813205719,
"logits/rejected": -0.9123057126998901,
"logps/chosen": -3.1331238746643066,
"logps/rejected": -122.09529113769531,
"loss": 0.26523512601852417,
"memory(GiB)": 45.96,
"nll_loss": 0.22852984070777893,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41106387972831726,
"rewards/margins": 11.093954086303711,
"rewards/rejected": -10.682888984680176,
"step": 494,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.937222649547364,
"grad_norm": 3.866851329803467,
"learning_rate": 0.00016472215776261256,
"logits/chosen": -0.8998519778251648,
"logits/rejected": -0.9100637435913086,
"logps/chosen": -6.161553382873535,
"logps/rejected": -91.67127990722656,
"loss": 0.32430458068847656,
"memory(GiB)": 45.96,
"nll_loss": 0.29789990186691284,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.37541043758392334,
"rewards/margins": 7.9647979736328125,
"rewards/rejected": -7.589386940002441,
"step": 495,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9391160286373588,
"grad_norm": 1.5745933055877686,
"learning_rate": 0.00016456278515588024,
"logits/chosen": -0.9250640869140625,
"logits/rejected": -0.9345837831497192,
"logps/chosen": -3.4266815185546875,
"logps/rejected": -95.2527084350586,
"loss": 0.22486472129821777,
"memory(GiB)": 45.96,
"nll_loss": 0.14442774653434753,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.35136106610298157,
"rewards/margins": 8.68508243560791,
"rewards/rejected": -8.333721160888672,
"step": 496,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9410094077273534,
"grad_norm": 2.027763843536377,
"learning_rate": 0.00016440313084958578,
"logits/chosen": -0.8975878953933716,
"logits/rejected": -0.9132086038589478,
"logps/chosen": -4.722578525543213,
"logps/rejected": -108.40174865722656,
"loss": 0.2619985342025757,
"memory(GiB)": 45.96,
"nll_loss": 0.22499336302280426,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31465330719947815,
"rewards/margins": 9.058952331542969,
"rewards/rejected": -8.744298934936523,
"step": 497,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9429027868173481,
"grad_norm": 31.387229919433594,
"learning_rate": 0.00016424319554033084,
"logits/chosen": -0.8927862048149109,
"logits/rejected": -0.9180783629417419,
"logps/chosen": -3.2301762104034424,
"logps/rejected": -132.96664428710938,
"loss": 0.3428140878677368,
"memory(GiB)": 45.96,
"nll_loss": 0.303774356842041,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41509026288986206,
"rewards/margins": 11.307497024536133,
"rewards/rejected": -10.89240550994873,
"step": 498,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9447961659073427,
"grad_norm": 0.9289922714233398,
"learning_rate": 0.0001640829799259433,
"logits/chosen": -0.9254931807518005,
"logits/rejected": -0.9433070421218872,
"logps/chosen": -1.6293895244598389,
"logps/rejected": -97.64047241210938,
"loss": 0.15687072277069092,
"memory(GiB)": 45.96,
"nll_loss": 0.13367648422718048,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4715469181537628,
"rewards/margins": 8.527523040771484,
"rewards/rejected": -8.055976867675781,
"step": 499,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9466895449973375,
"grad_norm": 2.5266456604003906,
"learning_rate": 0.00016392248470547394,
"logits/chosen": -0.8945059776306152,
"logits/rejected": -0.9079508781433105,
"logps/chosen": -4.099118709564209,
"logps/rejected": -92.66238403320312,
"loss": 0.30788105726242065,
"memory(GiB)": 45.96,
"nll_loss": 0.255858838558197,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23659808933734894,
"rewards/margins": 7.956408500671387,
"rewards/rejected": -7.719810485839844,
"step": 500,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9485829240873321,
"grad_norm": 6.29925012588501,
"learning_rate": 0.00016376171057919358,
"logits/chosen": -0.9756448268890381,
"logits/rejected": -0.9866229891777039,
"logps/chosen": -4.4007415771484375,
"logps/rejected": -88.4787368774414,
"loss": 0.5212814211845398,
"memory(GiB)": 45.96,
"nll_loss": 0.49678102135658264,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5291932225227356,
"rewards/margins": 8.009785652160645,
"rewards/rejected": -7.480591773986816,
"step": 501,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9504763031773268,
"grad_norm": 14.686606407165527,
"learning_rate": 0.00016360065824858993,
"logits/chosen": -0.8657544851303101,
"logits/rejected": -0.8791153430938721,
"logps/chosen": -5.418216705322266,
"logps/rejected": -87.16682434082031,
"loss": 0.5172737240791321,
"memory(GiB)": 45.96,
"nll_loss": 0.4656076729297638,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.30911099910736084,
"rewards/margins": 7.13665771484375,
"rewards/rejected": -6.827547073364258,
"step": 502,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9523696822673214,
"grad_norm": 0.8342228531837463,
"learning_rate": 0.00016343932841636456,
"logits/chosen": -0.9093836545944214,
"logits/rejected": -0.9287516474723816,
"logps/chosen": -4.357170104980469,
"logps/rejected": -101.34312438964844,
"loss": 0.23222270607948303,
"memory(GiB)": 45.96,
"nll_loss": 0.16751480102539062,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3810700476169586,
"rewards/margins": 8.414416313171387,
"rewards/rejected": -8.033347129821777,
"step": 503,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9542630613573161,
"grad_norm": 2.5457377433776855,
"learning_rate": 0.00016327772178642986,
"logits/chosen": -0.9070831537246704,
"logits/rejected": -0.9166555404663086,
"logps/chosen": -7.324579238891602,
"logps/rejected": -86.09144592285156,
"loss": 0.4546603858470917,
"memory(GiB)": 45.96,
"nll_loss": 0.3363542854785919,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4323062300682068,
"rewards/margins": 7.224738597869873,
"rewards/rejected": -6.79243278503418,
"step": 504,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9561564404473109,
"grad_norm": 1.2815897464752197,
"learning_rate": 0.00016311583906390592,
"logits/chosen": -0.9519956707954407,
"logits/rejected": -0.9706866145133972,
"logps/chosen": -4.026782989501953,
"logps/rejected": -92.71136474609375,
"loss": 0.2715020179748535,
"memory(GiB)": 45.96,
"nll_loss": 0.20830240845680237,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.504820704460144,
"rewards/margins": 7.9874420166015625,
"rewards/rejected": -7.482622146606445,
"step": 505,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9580498195373055,
"grad_norm": 1.0361456871032715,
"learning_rate": 0.00016295368095511746,
"logits/chosen": -0.9036988615989685,
"logits/rejected": -0.9219734072685242,
"logps/chosen": -8.218575477600098,
"logps/rejected": -93.13555908203125,
"loss": 0.29020407795906067,
"memory(GiB)": 45.96,
"nll_loss": 0.26319992542266846,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4894104301929474,
"rewards/margins": 7.870117664337158,
"rewards/rejected": -7.380707263946533,
"step": 506,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 0.9599431986273002,
"grad_norm": 1.8414019346237183,
"learning_rate": 0.0001627912481675908,
"logits/chosen": -0.8823158144950867,
"logits/rejected": -0.898427426815033,
"logps/chosen": -7.699591636657715,
"logps/rejected": -80.27245330810547,
"loss": 0.7505689263343811,
"memory(GiB)": 45.96,
"nll_loss": 0.5265831351280212,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19867704808712006,
"rewards/margins": 6.069255828857422,
"rewards/rejected": -5.870578765869141,
"step": 507,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9618365777172948,
"grad_norm": 4.019859790802002,
"learning_rate": 0.0001626285414100507,
"logits/chosen": -0.8857368230819702,
"logits/rejected": -0.8978668451309204,
"logps/chosen": -4.504330635070801,
"logps/rejected": -81.92082214355469,
"loss": 0.3514907658100128,
"memory(GiB)": 45.96,
"nll_loss": 0.21580490469932556,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3438741862773895,
"rewards/margins": 6.67080020904541,
"rewards/rejected": -6.326925754547119,
"step": 508,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9637299568072895,
"grad_norm": 1.0069034099578857,
"learning_rate": 0.00016246556139241726,
"logits/chosen": -0.8332890272140503,
"logits/rejected": -0.8481358885765076,
"logps/chosen": -5.350769519805908,
"logps/rejected": -90.37372589111328,
"loss": 0.30022063851356506,
"memory(GiB)": 45.96,
"nll_loss": 0.19650080800056458,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4888809323310852,
"rewards/margins": 7.104846954345703,
"rewards/rejected": -6.615966796875,
"step": 509,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9656233358972842,
"grad_norm": 1.631832242012024,
"learning_rate": 0.00016230230882580303,
"logits/chosen": -0.9425424337387085,
"logits/rejected": -0.952564537525177,
"logps/chosen": -3.654702663421631,
"logps/rejected": -69.78423309326172,
"loss": 0.3088323771953583,
"memory(GiB)": 45.96,
"nll_loss": 0.19460514187812805,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.4093857407569885,
"rewards/margins": 5.899824142456055,
"rewards/rejected": -5.490438461303711,
"step": 510,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9675167149872789,
"grad_norm": 13.144497871398926,
"learning_rate": 0.00016213878442250954,
"logits/chosen": -0.9134064316749573,
"logits/rejected": -0.9225355386734009,
"logps/chosen": -10.128987312316895,
"logps/rejected": -73.52391052246094,
"loss": 0.49284934997558594,
"memory(GiB)": 45.96,
"nll_loss": 0.2897854149341583,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.02852116897702217,
"rewards/margins": 5.512090682983398,
"rewards/rejected": -5.483569622039795,
"step": 511,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9694100940772735,
"grad_norm": 5.9472761154174805,
"learning_rate": 0.00016197498889602448,
"logits/chosen": -0.9309385418891907,
"logits/rejected": -0.9506005048751831,
"logps/chosen": -5.9269938468933105,
"logps/rejected": -94.47163391113281,
"loss": 0.34433653950691223,
"memory(GiB)": 45.96,
"nll_loss": 0.25453051924705505,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4299897253513336,
"rewards/margins": 8.080008506774902,
"rewards/rejected": -7.650019645690918,
"step": 512,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9713034731672682,
"grad_norm": 1.6089311838150024,
"learning_rate": 0.0001618109229610186,
"logits/chosen": -0.9268408417701721,
"logits/rejected": -0.937603235244751,
"logps/chosen": -7.795493125915527,
"logps/rejected": -76.06086730957031,
"loss": 0.3525398075580597,
"memory(GiB)": 45.96,
"nll_loss": 0.2876393496990204,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4603784680366516,
"rewards/margins": 6.2412896156311035,
"rewards/rejected": -5.780911445617676,
"step": 513,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 0.9731968522572629,
"grad_norm": 1.1773451566696167,
"learning_rate": 0.0001616465873333423,
"logits/chosen": -0.9452431201934814,
"logits/rejected": -0.9670403599739075,
"logps/chosen": -4.365338325500488,
"logps/rejected": -87.41246032714844,
"loss": 0.22716665267944336,
"memory(GiB)": 45.96,
"nll_loss": 0.19295459985733032,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.46086013317108154,
"rewards/margins": 7.090925693511963,
"rewards/rejected": -6.630065441131592,
"step": 514,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.9750902313472576,
"grad_norm": 1.8114774227142334,
"learning_rate": 0.00016148198273002287,
"logits/chosen": -0.906434953212738,
"logits/rejected": -0.9241432547569275,
"logps/chosen": -4.319371700286865,
"logps/rejected": -76.49603271484375,
"loss": 0.2575733959674835,
"memory(GiB)": 45.96,
"nll_loss": 0.23216064274311066,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6431917548179626,
"rewards/margins": 6.2898454666137695,
"rewards/rejected": -5.646653652191162,
"step": 515,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.9769836104372522,
"grad_norm": 1.0340324640274048,
"learning_rate": 0.00016131710986926108,
"logits/chosen": -0.936368465423584,
"logits/rejected": -0.9526094794273376,
"logps/chosen": -3.4732229709625244,
"logps/rejected": -81.12310791015625,
"loss": 0.20995403826236725,
"memory(GiB)": 45.96,
"nll_loss": 0.18944348394870758,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5206528902053833,
"rewards/margins": 6.727083206176758,
"rewards/rejected": -6.206429481506348,
"step": 516,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.9788769895272469,
"grad_norm": 3.1034345626831055,
"learning_rate": 0.0001611519694704282,
"logits/chosen": -0.9805644154548645,
"logits/rejected": -0.9963036775588989,
"logps/chosen": -4.623378753662109,
"logps/rejected": -77.49845123291016,
"loss": 0.3559991419315338,
"memory(GiB)": 45.96,
"nll_loss": 0.2764490246772766,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3371025025844574,
"rewards/margins": 6.5251383781433105,
"rewards/rejected": -6.18803596496582,
"step": 517,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.9807703686172415,
"grad_norm": 4.58514928817749,
"learning_rate": 0.00016098656225406287,
"logits/chosen": -0.9553229212760925,
"logits/rejected": -0.9597129225730896,
"logps/chosen": -7.885223388671875,
"logps/rejected": -72.13860321044922,
"loss": 0.4449266791343689,
"memory(GiB)": 45.96,
"nll_loss": 0.3402749300003052,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.264324426651001,
"rewards/margins": 5.985879898071289,
"rewards/rejected": -5.721555709838867,
"step": 518,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.9826637477072363,
"grad_norm": 0.9089112281799316,
"learning_rate": 0.00016082088894186778,
"logits/chosen": -0.9573476314544678,
"logits/rejected": -0.9719171524047852,
"logps/chosen": -3.7913498878479004,
"logps/rejected": -79.99372863769531,
"loss": 0.27717337012290955,
"memory(GiB)": 45.96,
"nll_loss": 0.23127052187919617,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4175718426704407,
"rewards/margins": 6.348897933959961,
"rewards/rejected": -5.931325912475586,
"step": 519,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.984557126797231,
"grad_norm": 17.343408584594727,
"learning_rate": 0.00016065495025670675,
"logits/chosen": -0.9993346929550171,
"logits/rejected": -1.015330195426941,
"logps/chosen": -3.9948267936706543,
"logps/rejected": -84.67949676513672,
"loss": 0.44340285658836365,
"memory(GiB)": 45.96,
"nll_loss": 0.2410781979560852,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18794837594032288,
"rewards/margins": 6.663022518157959,
"rewards/rejected": -6.475074291229248,
"step": 520,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 0.9864505058872256,
"grad_norm": 1.0182690620422363,
"learning_rate": 0.00016048874692260149,
"logits/chosen": -1.0138598680496216,
"logits/rejected": -1.0335602760314941,
"logps/chosen": -5.567783355712891,
"logps/rejected": -90.43717956542969,
"loss": 0.2480800896883011,
"memory(GiB)": 45.96,
"nll_loss": 0.20226755738258362,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3979242146015167,
"rewards/margins": 7.263826370239258,
"rewards/rejected": -6.865901470184326,
"step": 521,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.9883438849772203,
"grad_norm": 0.6683632731437683,
"learning_rate": 0.00016032227966472827,
"logits/chosen": -0.9863166809082031,
"logits/rejected": -1.0132988691329956,
"logps/chosen": -3.0443716049194336,
"logps/rejected": -98.99560546875,
"loss": 0.15996497869491577,
"memory(GiB)": 45.96,
"nll_loss": 0.1395530253648758,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.53858482837677,
"rewards/margins": 8.103957176208496,
"rewards/rejected": -7.565372943878174,
"step": 522,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.9902372640672149,
"grad_norm": 1.112196445465088,
"learning_rate": 0.0001601555492094151,
"logits/chosen": -1.0361038446426392,
"logits/rejected": -1.0564793348312378,
"logps/chosen": -3.820387363433838,
"logps/rejected": -85.76795196533203,
"loss": 0.2085203379392624,
"memory(GiB)": 45.96,
"nll_loss": 0.1832592487335205,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5125322937965393,
"rewards/margins": 7.044062614440918,
"rewards/rejected": -6.531529903411865,
"step": 523,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.9921306431572097,
"grad_norm": 2.029463529586792,
"learning_rate": 0.00015998855628413823,
"logits/chosen": -1.0319892168045044,
"logits/rejected": -1.0529518127441406,
"logps/chosen": -4.808176517486572,
"logps/rejected": -84.97135162353516,
"loss": 0.21726690232753754,
"memory(GiB)": 45.96,
"nll_loss": 0.1616971641778946,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.28862282633781433,
"rewards/margins": 6.925485610961914,
"rewards/rejected": -6.636862277984619,
"step": 524,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.9940240222472043,
"grad_norm": 3.0579190254211426,
"learning_rate": 0.00015982130161751922,
"logits/chosen": -0.9786304235458374,
"logits/rejected": -0.9961691498756409,
"logps/chosen": -10.302689552307129,
"logps/rejected": -89.45677185058594,
"loss": 0.5347995162010193,
"memory(GiB)": 45.96,
"nll_loss": 0.4095235764980316,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21495375037193298,
"rewards/margins": 6.500909328460693,
"rewards/rejected": -6.285955429077148,
"step": 525,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.995917401337199,
"grad_norm": 1.0815080404281616,
"learning_rate": 0.00015965378593932157,
"logits/chosen": -1.0681151151657104,
"logits/rejected": -1.0940450429916382,
"logps/chosen": -2.94252872467041,
"logps/rejected": -87.89140319824219,
"loss": 0.22619354724884033,
"memory(GiB)": 45.96,
"nll_loss": 0.16631841659545898,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5529903769493103,
"rewards/margins": 7.263401031494141,
"rewards/rejected": -6.710411071777344,
"step": 526,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.9978107804271936,
"grad_norm": 38.966758728027344,
"learning_rate": 0.00015948600998044765,
"logits/chosen": -1.0475246906280518,
"logits/rejected": -1.080329179763794,
"logps/chosen": -8.313323974609375,
"logps/rejected": -90.39398956298828,
"loss": 0.7874181270599365,
"memory(GiB)": 45.96,
"nll_loss": 0.6002381443977356,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.44292813539505005,
"rewards/margins": 6.95076322555542,
"rewards/rejected": -6.507835388183594,
"step": 527,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 0.9997041595171884,
"grad_norm": 4.178254127502441,
"learning_rate": 0.00015931797447293552,
"logits/chosen": -1.0808571577072144,
"logits/rejected": -1.1031514406204224,
"logps/chosen": -3.7605037689208984,
"logps/rejected": -98.75016021728516,
"loss": 0.2028055489063263,
"memory(GiB)": 45.96,
"nll_loss": 0.13626113533973694,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3011845648288727,
"rewards/margins": 8.235344886779785,
"rewards/rejected": -7.934159755706787,
"step": 528,
"train_speed(iter/s)": 0.005586
},
{
"epoch": 1.0,
"grad_norm": 4.178254127502441,
"learning_rate": 0.00015914968014995567,
"logits/chosen": -1.1427804231643677,
"logits/rejected": -1.1405260562896729,
"logps/chosen": -2.7054977416992188,
"logps/rejected": -56.67396926879883,
"loss": 0.038843873888254166,
"memory(GiB)": 45.96,
"nll_loss": 0.12972064316272736,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3542119860649109,
"rewards/margins": 4.969267845153809,
"rewards/rejected": -4.615056037902832,
"step": 529,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0018933790899947,
"grad_norm": 50.89724349975586,
"learning_rate": 0.00015898112774580784,
"logits/chosen": -1.1593101024627686,
"logits/rejected": -1.168821096420288,
"logps/chosen": -6.839245796203613,
"logps/rejected": -88.95535278320312,
"loss": 0.6083638072013855,
"memory(GiB)": 45.96,
"nll_loss": 0.4864938259124756,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19008603692054749,
"rewards/margins": 7.390456676483154,
"rewards/rejected": -7.200370788574219,
"step": 530,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0037867581799893,
"grad_norm": 1.4983274936676025,
"learning_rate": 0.00015881231799591783,
"logits/chosen": -1.1478654146194458,
"logits/rejected": -1.160862922668457,
"logps/chosen": -5.944678783416748,
"logps/rejected": -110.5527114868164,
"loss": 0.2588149607181549,
"memory(GiB)": 45.96,
"nll_loss": 0.1914646476507187,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.39623722434043884,
"rewards/margins": 9.497812271118164,
"rewards/rejected": -9.101574897766113,
"step": 531,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.005680137269984,
"grad_norm": 1.2377827167510986,
"learning_rate": 0.00015864325163683431,
"logits/chosen": -1.1823019981384277,
"logits/rejected": -1.1935970783233643,
"logps/chosen": -5.829947471618652,
"logps/rejected": -96.11874389648438,
"loss": 0.2351379096508026,
"memory(GiB)": 45.96,
"nll_loss": 0.21910277009010315,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6932865381240845,
"rewards/margins": 8.259093284606934,
"rewards/rejected": -7.5658063888549805,
"step": 532,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0075735163599786,
"grad_norm": 6.626506328582764,
"learning_rate": 0.00015847392940622555,
"logits/chosen": -1.2572100162506104,
"logits/rejected": -1.2743322849273682,
"logps/chosen": -5.158469200134277,
"logps/rejected": -102.89447021484375,
"loss": 0.43753018975257874,
"memory(GiB)": 45.96,
"nll_loss": 0.3763510584831238,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37863367795944214,
"rewards/margins": 9.09069538116455,
"rewards/rejected": -8.712060928344727,
"step": 533,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0094668954499735,
"grad_norm": 9.237115859985352,
"learning_rate": 0.00015830435204287628,
"logits/chosen": -1.2432606220245361,
"logits/rejected": -1.2568538188934326,
"logps/chosen": -5.230342388153076,
"logps/rejected": -125.57969665527344,
"loss": 0.320054829120636,
"memory(GiB)": 45.96,
"nll_loss": 0.1863236427307129,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.5029672384262085,
"rewards/margins": 11.315177917480469,
"rewards/rejected": -10.812210083007812,
"step": 534,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0113602745399681,
"grad_norm": 2.3910863399505615,
"learning_rate": 0.0001581345202866844,
"logits/chosen": -1.2545768022537231,
"logits/rejected": -1.2814122438430786,
"logps/chosen": -4.037993431091309,
"logps/rejected": -119.29512023925781,
"loss": 0.2895146310329437,
"memory(GiB)": 45.96,
"nll_loss": 0.19089049100875854,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3177344799041748,
"rewards/margins": 10.372758865356445,
"rewards/rejected": -10.055024147033691,
"step": 535,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0132536536299628,
"grad_norm": 11.799864768981934,
"learning_rate": 0.00015796443487865776,
"logits/chosen": -1.2704317569732666,
"logits/rejected": -1.2862308025360107,
"logps/chosen": -3.8405699729919434,
"logps/rejected": -101.06300354003906,
"loss": 0.3045562505722046,
"memory(GiB)": 45.96,
"nll_loss": 0.2211739867925644,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4603561460971832,
"rewards/margins": 9.070082664489746,
"rewards/rejected": -8.609726905822754,
"step": 536,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0151470327199574,
"grad_norm": 1.1523226499557495,
"learning_rate": 0.00015779409656091096,
"logits/chosen": -1.2223632335662842,
"logits/rejected": -1.2454135417938232,
"logps/chosen": -3.3703105449676514,
"logps/rejected": -114.88744354248047,
"loss": 0.23221755027770996,
"memory(GiB)": 45.96,
"nll_loss": 0.2025429606437683,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6476104855537415,
"rewards/margins": 10.323287963867188,
"rewards/rejected": -9.675678253173828,
"step": 537,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.017040411809952,
"grad_norm": 1.1821354627609253,
"learning_rate": 0.00015762350607666204,
"logits/chosen": -1.2749884128570557,
"logits/rejected": -1.2943077087402344,
"logps/chosen": -8.302059173583984,
"logps/rejected": -98.96806335449219,
"loss": 0.2986391484737396,
"memory(GiB)": 45.96,
"nll_loss": 0.2838631868362427,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5527027249336243,
"rewards/margins": 8.528514862060547,
"rewards/rejected": -7.975813388824463,
"step": 538,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0189337908999467,
"grad_norm": 19.518661499023438,
"learning_rate": 0.0001574526641702294,
"logits/chosen": -1.2305980920791626,
"logits/rejected": -1.2421363592147827,
"logps/chosen": -4.4403533935546875,
"logps/rejected": -96.62861633300781,
"loss": 0.3891787827014923,
"memory(GiB)": 45.96,
"nll_loss": 0.2562548518180847,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3143804967403412,
"rewards/margins": 8.539346694946289,
"rewards/rejected": -8.224966049194336,
"step": 539,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0208271699899414,
"grad_norm": 9.813395500183105,
"learning_rate": 0.00015728157158702833,
"logits/chosen": -1.2191518545150757,
"logits/rejected": -1.2443480491638184,
"logps/chosen": -5.321511268615723,
"logps/rejected": -100.6253890991211,
"loss": 0.38886359333992004,
"memory(GiB)": 45.96,
"nll_loss": 0.3503781855106354,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4170704782009125,
"rewards/margins": 7.897201061248779,
"rewards/rejected": -7.480130672454834,
"step": 540,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.022720549079936,
"grad_norm": 5.502192974090576,
"learning_rate": 0.00015711022907356794,
"logits/chosen": -1.2725385427474976,
"logits/rejected": -1.281760573387146,
"logps/chosen": -5.788969039916992,
"logps/rejected": -83.48539733886719,
"loss": 0.2782316207885742,
"memory(GiB)": 45.96,
"nll_loss": 0.2644944489002228,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6322579979896545,
"rewards/margins": 7.397380352020264,
"rewards/rejected": -6.765121936798096,
"step": 541,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0246139281699307,
"grad_norm": 1.0033241510391235,
"learning_rate": 0.0001569386373774478,
"logits/chosen": -1.2947453260421753,
"logits/rejected": -1.3235821723937988,
"logps/chosen": -2.1399617195129395,
"logps/rejected": -99.05345153808594,
"loss": 0.18756692111492157,
"memory(GiB)": 45.96,
"nll_loss": 0.10680165886878967,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4721769094467163,
"rewards/margins": 8.319814682006836,
"rewards/rejected": -7.84763765335083,
"step": 542,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0265073072599253,
"grad_norm": 2.2815518379211426,
"learning_rate": 0.00015676679724735475,
"logits/chosen": -1.2527762651443481,
"logits/rejected": -1.2706432342529297,
"logps/chosen": -3.529473304748535,
"logps/rejected": -102.44934844970703,
"loss": 0.19709157943725586,
"memory(GiB)": 45.96,
"nll_loss": 0.16788038611412048,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39325255155563354,
"rewards/margins": 8.873687744140625,
"rewards/rejected": -8.48043441772461,
"step": 543,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0284006863499202,
"grad_norm": 0.9781432747840881,
"learning_rate": 0.00015659470943305955,
"logits/chosen": -1.3074346780776978,
"logits/rejected": -1.3225350379943848,
"logps/chosen": -3.6736319065093994,
"logps/rejected": -99.07704162597656,
"loss": 0.24773047864437103,
"memory(GiB)": 45.96,
"nll_loss": 0.20028436183929443,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5773366689682007,
"rewards/margins": 8.81675910949707,
"rewards/rejected": -8.239421844482422,
"step": 544,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0302940654399149,
"grad_norm": 3.2625584602355957,
"learning_rate": 0.0001564223746854136,
"logits/chosen": -1.2451472282409668,
"logits/rejected": -1.2746459245681763,
"logps/chosen": -2.6118361949920654,
"logps/rejected": -106.3071517944336,
"loss": 0.18340322375297546,
"memory(GiB)": 45.96,
"nll_loss": 0.16001468896865845,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5671020150184631,
"rewards/margins": 9.123932838439941,
"rewards/rejected": -8.556831359863281,
"step": 545,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0321874445299095,
"grad_norm": 11.41080379486084,
"learning_rate": 0.00015624979375634588,
"logits/chosen": -1.2669609785079956,
"logits/rejected": -1.285220742225647,
"logps/chosen": -6.25026798248291,
"logps/rejected": -104.86439514160156,
"loss": 0.36971619725227356,
"memory(GiB)": 45.96,
"nll_loss": 0.26008346676826477,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31941547989845276,
"rewards/margins": 8.899809837341309,
"rewards/rejected": -8.580394744873047,
"step": 546,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0340808236199042,
"grad_norm": 23.427906036376953,
"learning_rate": 0.00015607696739885934,
"logits/chosen": -1.2728469371795654,
"logits/rejected": -1.292362093925476,
"logps/chosen": -6.034543037414551,
"logps/rejected": -88.89381408691406,
"loss": 0.7123737335205078,
"memory(GiB)": 45.96,
"nll_loss": 0.6033825278282166,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.26061975955963135,
"rewards/margins": 7.074716567993164,
"rewards/rejected": -6.8140974044799805,
"step": 547,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0359742027098988,
"grad_norm": 1.0424782037734985,
"learning_rate": 0.0001559038963670279,
"logits/chosen": -1.263490080833435,
"logits/rejected": -1.2818467617034912,
"logps/chosen": -4.806588172912598,
"logps/rejected": -109.88215637207031,
"loss": 0.2099330872297287,
"memory(GiB)": 45.96,
"nll_loss": 0.19888734817504883,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.7063236832618713,
"rewards/margins": 9.634958267211914,
"rewards/rejected": -8.928633689880371,
"step": 548,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0378675817998935,
"grad_norm": 1.565426230430603,
"learning_rate": 0.00015573058141599296,
"logits/chosen": -1.3012843132019043,
"logits/rejected": -1.3339687585830688,
"logps/chosen": -3.8335983753204346,
"logps/rejected": -109.77323913574219,
"loss": 0.22731725871562958,
"memory(GiB)": 45.96,
"nll_loss": 0.18710672855377197,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6432173252105713,
"rewards/margins": 9.041927337646484,
"rewards/rejected": -8.398711204528809,
"step": 549,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0397609608898881,
"grad_norm": 1.0922037363052368,
"learning_rate": 0.00015555702330196023,
"logits/chosen": -1.2561464309692383,
"logits/rejected": -1.2797656059265137,
"logps/chosen": -4.883576393127441,
"logps/rejected": -94.83533477783203,
"loss": 0.18200495839118958,
"memory(GiB)": 45.96,
"nll_loss": 0.13938182592391968,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5235949158668518,
"rewards/margins": 8.185545921325684,
"rewards/rejected": -7.661951065063477,
"step": 550,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0416543399798828,
"grad_norm": 1.1942391395568848,
"learning_rate": 0.00015538322278219638,
"logits/chosen": -1.327378749847412,
"logits/rejected": -1.3506507873535156,
"logps/chosen": -2.917591094970703,
"logps/rejected": -94.31072235107422,
"loss": 0.2088836431503296,
"memory(GiB)": 45.96,
"nll_loss": 0.13950389623641968,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.48478469252586365,
"rewards/margins": 8.057584762573242,
"rewards/rejected": -7.572801113128662,
"step": 551,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0435477190698774,
"grad_norm": 1.8847681283950806,
"learning_rate": 0.00015520918061502569,
"logits/chosen": -1.3219040632247925,
"logits/rejected": -1.3375160694122314,
"logps/chosen": -3.741983413696289,
"logps/rejected": -94.9761962890625,
"loss": 0.21428059041500092,
"memory(GiB)": 45.96,
"nll_loss": 0.17732422053813934,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6145517230033875,
"rewards/margins": 8.826709747314453,
"rewards/rejected": -8.212158203125,
"step": 552,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0454410981598723,
"grad_norm": 3.402707099914551,
"learning_rate": 0.00015503489755982686,
"logits/chosen": -1.3000562191009521,
"logits/rejected": -1.303682565689087,
"logps/chosen": -5.613664150238037,
"logps/rejected": -80.0399169921875,
"loss": 0.40057235956192017,
"memory(GiB)": 45.96,
"nll_loss": 0.35176751017570496,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3800576329231262,
"rewards/margins": 7.2210588455200195,
"rewards/rejected": -6.841001033782959,
"step": 553,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.047334477249867,
"grad_norm": 1.0752265453338623,
"learning_rate": 0.0001548603743770296,
"logits/chosen": -1.355738878250122,
"logits/rejected": -1.37424898147583,
"logps/chosen": -3.0492472648620605,
"logps/rejected": -108.67159271240234,
"loss": 0.13657376170158386,
"memory(GiB)": 45.96,
"nll_loss": 0.10331787168979645,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4870010018348694,
"rewards/margins": 9.527022361755371,
"rewards/rejected": -9.040020942687988,
"step": 554,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0492278563398616,
"grad_norm": 5.314583778381348,
"learning_rate": 0.0001546856118281114,
"logits/chosen": -1.3520063161849976,
"logits/rejected": -1.3624749183654785,
"logps/chosen": -6.195893287658691,
"logps/rejected": -94.56097412109375,
"loss": 0.30682989954948425,
"memory(GiB)": 45.96,
"nll_loss": 0.27029889822006226,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3668309152126312,
"rewards/margins": 8.312253952026367,
"rewards/rejected": -7.945422172546387,
"step": 555,
"train_speed(iter/s)": 0.005596
},
{
"epoch": 1.0511212354298562,
"grad_norm": 20.930891036987305,
"learning_rate": 0.000154510610675594,
"logits/chosen": -1.327778697013855,
"logits/rejected": -1.3483771085739136,
"logps/chosen": -3.625875473022461,
"logps/rejected": -97.228271484375,
"loss": 0.3087195158004761,
"memory(GiB)": 45.96,
"nll_loss": 0.2725326120853424,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.294748455286026,
"rewards/margins": 7.920544147491455,
"rewards/rejected": -7.625795841217041,
"step": 556,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.053014614519851,
"grad_norm": 2.161787748336792,
"learning_rate": 0.00015433537168304038,
"logits/chosen": -1.3243646621704102,
"logits/rejected": -1.3322596549987793,
"logps/chosen": -5.126698017120361,
"logps/rejected": -71.53412628173828,
"loss": 0.250238835811615,
"memory(GiB)": 45.96,
"nll_loss": 0.20904159545898438,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5107704997062683,
"rewards/margins": 6.104798793792725,
"rewards/rejected": -5.594027996063232,
"step": 557,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0549079936098456,
"grad_norm": 1.0270330905914307,
"learning_rate": 0.00015415989561505118,
"logits/chosen": -1.334947109222412,
"logits/rejected": -1.3445045948028564,
"logps/chosen": -8.810266494750977,
"logps/rejected": -87.59201049804688,
"loss": 0.26200586557388306,
"memory(GiB)": 45.96,
"nll_loss": 0.2543470859527588,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.8190967440605164,
"rewards/margins": 7.7875471115112305,
"rewards/rejected": -6.968450546264648,
"step": 558,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0568013726998402,
"grad_norm": 0.8429592251777649,
"learning_rate": 0.00015398418323726146,
"logits/chosen": -1.3177508115768433,
"logits/rejected": -1.3297425508499146,
"logps/chosen": -4.267469882965088,
"logps/rejected": -99.88289642333984,
"loss": 0.2590307593345642,
"memory(GiB)": 45.96,
"nll_loss": 0.21612831950187683,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4924696385860443,
"rewards/margins": 8.744771957397461,
"rewards/rejected": -8.252302169799805,
"step": 559,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0586947517898349,
"grad_norm": 1.2864187955856323,
"learning_rate": 0.00015380823531633729,
"logits/chosen": -1.3363707065582275,
"logits/rejected": -1.3560690879821777,
"logps/chosen": -6.6727423667907715,
"logps/rejected": -105.22146606445312,
"loss": 0.25500863790512085,
"memory(GiB)": 45.96,
"nll_loss": 0.2455504983663559,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4451357424259186,
"rewards/margins": 8.943872451782227,
"rewards/rejected": -8.498737335205078,
"step": 560,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0605881308798295,
"grad_norm": 1.5146949291229248,
"learning_rate": 0.00015363205261997254,
"logits/chosen": -1.3046088218688965,
"logits/rejected": -1.3203272819519043,
"logps/chosen": -4.633506774902344,
"logps/rejected": -88.37890625,
"loss": 0.259783536195755,
"memory(GiB)": 45.96,
"nll_loss": 0.2198258489370346,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4317323565483093,
"rewards/margins": 7.1905717849731445,
"rewards/rejected": -6.758839130401611,
"step": 561,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.0624815099698244,
"grad_norm": 1.078278660774231,
"learning_rate": 0.0001534556359168854,
"logits/chosen": -1.3316317796707153,
"logits/rejected": -1.3745862245559692,
"logps/chosen": -2.4428582191467285,
"logps/rejected": -138.22593688964844,
"loss": 0.08312231302261353,
"memory(GiB)": 45.96,
"nll_loss": 0.06975560635328293,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3613326847553253,
"rewards/margins": 11.056950569152832,
"rewards/rejected": -10.695618629455566,
"step": 562,
"train_speed(iter/s)": 0.005597
},
{
"epoch": 1.064374889059819,
"grad_norm": 2.635319948196411,
"learning_rate": 0.00015327898597681516,
"logits/chosen": -1.3323938846588135,
"logits/rejected": -1.3507311344146729,
"logps/chosen": -3.511697769165039,
"logps/rejected": -95.56913757324219,
"loss": 0.19266293942928314,
"memory(GiB)": 45.96,
"nll_loss": 0.17116276919841766,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4276401996612549,
"rewards/margins": 8.056602478027344,
"rewards/rejected": -7.628961563110352,
"step": 563,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0662682681498137,
"grad_norm": 1.3077629804611206,
"learning_rate": 0.00015310210357051863,
"logits/chosen": -1.2944490909576416,
"logits/rejected": -1.3115651607513428,
"logps/chosen": -3.241935968399048,
"logps/rejected": -98.64260864257812,
"loss": 0.251848042011261,
"memory(GiB)": 45.96,
"nll_loss": 0.20104049146175385,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5110239386558533,
"rewards/margins": 8.376340866088867,
"rewards/rejected": -7.865316390991211,
"step": 564,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0681616472398083,
"grad_norm": 0.9010938405990601,
"learning_rate": 0.000152924989469767,
"logits/chosen": -1.2769780158996582,
"logits/rejected": -1.2927641868591309,
"logps/chosen": -6.640301704406738,
"logps/rejected": -88.61182403564453,
"loss": 0.25189408659935,
"memory(GiB)": 45.96,
"nll_loss": 0.24645669758319855,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.0925995111465454,
"rewards/margins": 8.120665550231934,
"rewards/rejected": -7.0280656814575195,
"step": 565,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.070055026329803,
"grad_norm": 19.70159149169922,
"learning_rate": 0.00015274764444734234,
"logits/chosen": -1.244207501411438,
"logits/rejected": -1.259688138961792,
"logps/chosen": -6.578207969665527,
"logps/rejected": -106.03319549560547,
"loss": 0.3873708248138428,
"memory(GiB)": 45.96,
"nll_loss": 0.35074567794799805,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.40361860394477844,
"rewards/margins": 9.156301498413086,
"rewards/rejected": -8.752683639526367,
"step": 566,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0719484054197976,
"grad_norm": 3.134403944015503,
"learning_rate": 0.0001525700692770344,
"logits/chosen": -1.2441952228546143,
"logits/rejected": -1.2602890729904175,
"logps/chosen": -3.320517063140869,
"logps/rejected": -106.19863891601562,
"loss": 0.15019084513187408,
"memory(GiB)": 45.96,
"nll_loss": 0.12886883318424225,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.32790637016296387,
"rewards/margins": 9.072044372558594,
"rewards/rejected": -8.744136810302734,
"step": 567,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0738417845097923,
"grad_norm": 0.787064790725708,
"learning_rate": 0.00015239226473363687,
"logits/chosen": -1.2932322025299072,
"logits/rejected": -1.3016360998153687,
"logps/chosen": -4.699370861053467,
"logps/rejected": -105.18386840820312,
"loss": 0.2008758783340454,
"memory(GiB)": 45.96,
"nll_loss": 0.16714823246002197,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4735586643218994,
"rewards/margins": 9.312126159667969,
"rewards/rejected": -8.838567733764648,
"step": 568,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.075735163599787,
"grad_norm": 1.0752480030059814,
"learning_rate": 0.0001522142315929445,
"logits/chosen": -1.336026668548584,
"logits/rejected": -1.350561499595642,
"logps/chosen": -6.8737311363220215,
"logps/rejected": -91.298583984375,
"loss": 0.33137187361717224,
"memory(GiB)": 45.96,
"nll_loss": 0.25478339195251465,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5015548467636108,
"rewards/margins": 7.741572856903076,
"rewards/rejected": -7.240017890930176,
"step": 569,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0776285426897816,
"grad_norm": 1.0518560409545898,
"learning_rate": 0.0001520359706317493,
"logits/chosen": -1.3285919427871704,
"logits/rejected": -1.3354926109313965,
"logps/chosen": -5.613513469696045,
"logps/rejected": -103.08087158203125,
"loss": 0.25189992785453796,
"memory(GiB)": 45.96,
"nll_loss": 0.2361432909965515,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.38287657499313354,
"rewards/margins": 9.170334815979004,
"rewards/rejected": -8.787456512451172,
"step": 570,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0795219217797762,
"grad_norm": 2.020385980606079,
"learning_rate": 0.0001518574826278373,
"logits/chosen": -1.347183346748352,
"logits/rejected": -1.3727235794067383,
"logps/chosen": -3.2963013648986816,
"logps/rejected": -125.87289428710938,
"loss": 0.19588108360767365,
"memory(GiB)": 45.96,
"nll_loss": 0.16800087690353394,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6195613741874695,
"rewards/margins": 10.826133728027344,
"rewards/rejected": -10.206572532653809,
"step": 571,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0814153008697711,
"grad_norm": 0.9883559942245483,
"learning_rate": 0.00015167876835998524,
"logits/chosen": -1.3224377632141113,
"logits/rejected": -1.353177785873413,
"logps/chosen": -3.696470022201538,
"logps/rejected": -137.7168426513672,
"loss": 0.16710160672664642,
"memory(GiB)": 45.96,
"nll_loss": 0.14809738099575043,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6114938855171204,
"rewards/margins": 11.972872734069824,
"rewards/rejected": -11.361379623413086,
"step": 572,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0833086799597658,
"grad_norm": 0.9463618993759155,
"learning_rate": 0.00015149982860795702,
"logits/chosen": -1.3223044872283936,
"logits/rejected": -1.3528592586517334,
"logps/chosen": -2.193894386291504,
"logps/rejected": -142.0426483154297,
"loss": 0.09805414825677872,
"memory(GiB)": 45.96,
"nll_loss": 0.08482219278812408,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4664475917816162,
"rewards/margins": 12.09679889678955,
"rewards/rejected": -11.630352020263672,
"step": 573,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0852020590497604,
"grad_norm": 1.1137388944625854,
"learning_rate": 0.00015132066415250042,
"logits/chosen": -1.318729043006897,
"logits/rejected": -1.3286855220794678,
"logps/chosen": -6.172143459320068,
"logps/rejected": -121.0008544921875,
"loss": 0.2336159348487854,
"memory(GiB)": 45.96,
"nll_loss": 0.19225838780403137,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5859619379043579,
"rewards/margins": 10.895280838012695,
"rewards/rejected": -10.309318542480469,
"step": 574,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.087095438139755,
"grad_norm": 2.3039913177490234,
"learning_rate": 0.00015114127577534357,
"logits/chosen": -1.2611424922943115,
"logits/rejected": -1.2765283584594727,
"logps/chosen": -6.725334644317627,
"logps/rejected": -115.01373291015625,
"loss": 0.2680964767932892,
"memory(GiB)": 45.96,
"nll_loss": 0.21015194058418274,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36756518483161926,
"rewards/margins": 10.524402618408203,
"rewards/rejected": -10.156837463378906,
"step": 575,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0889888172297497,
"grad_norm": 0.801198422908783,
"learning_rate": 0.00015096166425919175,
"logits/chosen": -1.2074100971221924,
"logits/rejected": -1.2279514074325562,
"logps/chosen": -5.492415904998779,
"logps/rejected": -110.50377655029297,
"loss": 0.2561566233634949,
"memory(GiB)": 45.96,
"nll_loss": 0.23524636030197144,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.545266330242157,
"rewards/margins": 9.796957015991211,
"rewards/rejected": -9.251690864562988,
"step": 576,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.0908821963197444,
"grad_norm": 0.8023693561553955,
"learning_rate": 0.00015078183038772368,
"logits/chosen": -1.2201210260391235,
"logits/rejected": -1.239213466644287,
"logps/chosen": -3.4091765880584717,
"logps/rejected": -110.39087677001953,
"loss": 0.15457846224308014,
"memory(GiB)": 45.96,
"nll_loss": 0.13152047991752625,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5018508434295654,
"rewards/margins": 9.737335205078125,
"rewards/rejected": -9.23548412322998,
"step": 577,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.092775575409739,
"grad_norm": 10.036036491394043,
"learning_rate": 0.0001506017749455884,
"logits/chosen": -1.2568118572235107,
"logits/rejected": -1.274863839149475,
"logps/chosen": -4.811936378479004,
"logps/rejected": -107.5451889038086,
"loss": 0.3094099164009094,
"memory(GiB)": 45.96,
"nll_loss": 0.2990308701992035,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6428719162940979,
"rewards/margins": 9.620796203613281,
"rewards/rejected": -8.977926254272461,
"step": 578,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0946689544997337,
"grad_norm": 2.8122897148132324,
"learning_rate": 0.00015042149871840157,
"logits/chosen": -1.2904918193817139,
"logits/rejected": -1.3019131422042847,
"logps/chosen": -4.516243934631348,
"logps/rejected": -104.33990478515625,
"loss": 0.2950717508792877,
"memory(GiB)": 45.96,
"nll_loss": 0.21373407542705536,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6212645769119263,
"rewards/margins": 9.591170310974121,
"rewards/rejected": -8.969905853271484,
"step": 579,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.0965623335897283,
"grad_norm": 1.7572249174118042,
"learning_rate": 0.00015024100249274227,
"logits/chosen": -1.2378251552581787,
"logits/rejected": -1.2591315507888794,
"logps/chosen": -6.137165069580078,
"logps/rejected": -146.08526611328125,
"loss": 0.2149486243724823,
"memory(GiB)": 45.96,
"nll_loss": 0.17733576893806458,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6879799365997314,
"rewards/margins": 13.418159484863281,
"rewards/rejected": -12.730178833007812,
"step": 580,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.0984557126797232,
"grad_norm": 1.0533857345581055,
"learning_rate": 0.00015006028705614942,
"logits/chosen": -1.251503348350525,
"logits/rejected": -1.2591009140014648,
"logps/chosen": -4.528883457183838,
"logps/rejected": -114.74151611328125,
"loss": 0.21506644785404205,
"memory(GiB)": 45.96,
"nll_loss": 0.19855085015296936,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4429333209991455,
"rewards/margins": 10.232474327087402,
"rewards/rejected": -9.789541244506836,
"step": 581,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.1003490917697178,
"grad_norm": 1.5791045427322388,
"learning_rate": 0.00014987935319711842,
"logits/chosen": -1.226974606513977,
"logits/rejected": -1.257514238357544,
"logps/chosen": -3.320363759994507,
"logps/rejected": -167.9702606201172,
"loss": 0.15922771394252777,
"memory(GiB)": 45.96,
"nll_loss": 0.15475928783416748,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4842221140861511,
"rewards/margins": 14.752422332763672,
"rewards/rejected": -14.268199920654297,
"step": 582,
"train_speed(iter/s)": 0.005598
},
{
"epoch": 1.1022424708597125,
"grad_norm": 1.8434008359909058,
"learning_rate": 0.00014969820170509775,
"logits/chosen": -1.2599531412124634,
"logits/rejected": -1.2809091806411743,
"logps/chosen": -5.004319667816162,
"logps/rejected": -122.86878967285156,
"loss": 0.2221767008304596,
"memory(GiB)": 45.96,
"nll_loss": 0.14954842627048492,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.8574638962745667,
"rewards/margins": 11.233372688293457,
"rewards/rejected": -10.375908851623535,
"step": 583,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1041358499497071,
"grad_norm": 0.8550779819488525,
"learning_rate": 0.00014951683337048537,
"logits/chosen": -1.2449126243591309,
"logits/rejected": -1.2596272230148315,
"logps/chosen": -1.8333827257156372,
"logps/rejected": -109.7436294555664,
"loss": 0.14426660537719727,
"memory(GiB)": 45.96,
"nll_loss": 0.12021489441394806,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5166503190994263,
"rewards/margins": 9.900659561157227,
"rewards/rejected": -9.384010314941406,
"step": 584,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1060292290397018,
"grad_norm": 0.7879387140274048,
"learning_rate": 0.0001493352489846254,
"logits/chosen": -1.24300217628479,
"logits/rejected": -1.260710597038269,
"logps/chosen": -4.432990074157715,
"logps/rejected": -107.72745513916016,
"loss": 0.18139131367206573,
"memory(GiB)": 45.96,
"nll_loss": 0.1617611199617386,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4947144389152527,
"rewards/margins": 9.030978202819824,
"rewards/rejected": -8.536263465881348,
"step": 585,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1079226081296965,
"grad_norm": 0.7365395426750183,
"learning_rate": 0.0001491534493398046,
"logits/chosen": -1.2553640604019165,
"logits/rejected": -1.2758809328079224,
"logps/chosen": -3.403491497039795,
"logps/rejected": -105.79845428466797,
"loss": 0.16256746649742126,
"memory(GiB)": 45.96,
"nll_loss": 0.15543223917484283,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6307507753372192,
"rewards/margins": 9.163625717163086,
"rewards/rejected": -8.53287410736084,
"step": 586,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.109815987219691,
"grad_norm": 12.859845161437988,
"learning_rate": 0.0001489714352292491,
"logits/chosen": -1.254917860031128,
"logits/rejected": -1.2662553787231445,
"logps/chosen": -5.313860893249512,
"logps/rejected": -96.21810913085938,
"loss": 0.4549526572227478,
"memory(GiB)": 45.96,
"nll_loss": 0.3455367684364319,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3554072082042694,
"rewards/margins": 8.50544548034668,
"rewards/rejected": -8.150038719177246,
"step": 587,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1117093663096858,
"grad_norm": 1.2317994832992554,
"learning_rate": 0.0001487892074471205,
"logits/chosen": -1.2423638105392456,
"logits/rejected": -1.2684507369995117,
"logps/chosen": -3.429466485977173,
"logps/rejected": -92.40089416503906,
"loss": 0.22674602270126343,
"memory(GiB)": 45.96,
"nll_loss": 0.1670750081539154,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5393322706222534,
"rewards/margins": 7.976922512054443,
"rewards/rejected": -7.4375901222229,
"step": 588,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1136027453996804,
"grad_norm": 10.093466758728027,
"learning_rate": 0.00014860676678851294,
"logits/chosen": -1.2574409246444702,
"logits/rejected": -1.273606300354004,
"logps/chosen": -5.608072757720947,
"logps/rejected": -99.13803100585938,
"loss": 0.39078086614608765,
"memory(GiB)": 45.96,
"nll_loss": 0.3612406253814697,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6365304589271545,
"rewards/margins": 8.688333511352539,
"rewards/rejected": -8.051802635192871,
"step": 589,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1154961244896753,
"grad_norm": 9.636011123657227,
"learning_rate": 0.00014842411404944927,
"logits/chosen": -1.286845088005066,
"logits/rejected": -1.3059313297271729,
"logps/chosen": -7.7975311279296875,
"logps/rejected": -106.14432525634766,
"loss": 0.9191125631332397,
"memory(GiB)": 45.96,
"nll_loss": 0.8574790358543396,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.21184280514717102,
"rewards/margins": 8.63295841217041,
"rewards/rejected": -8.421114921569824,
"step": 590,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.11738950357967,
"grad_norm": 2.9925789833068848,
"learning_rate": 0.00014824125002687772,
"logits/chosen": -1.3378455638885498,
"logits/rejected": -1.37661874294281,
"logps/chosen": -4.0678205490112305,
"logps/rejected": -126.1729965209961,
"loss": 0.5300029516220093,
"memory(GiB)": 45.96,
"nll_loss": 0.3785613775253296,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.33407914638519287,
"rewards/margins": 10.628999710083008,
"rewards/rejected": -10.294920921325684,
"step": 591,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1192828826696646,
"grad_norm": 2.0460188388824463,
"learning_rate": 0.00014805817551866838,
"logits/chosen": -1.315762996673584,
"logits/rejected": -1.3334267139434814,
"logps/chosen": -6.571153163909912,
"logps/rejected": -87.01092529296875,
"loss": 0.2811226546764374,
"memory(GiB)": 45.96,
"nll_loss": 0.23497222363948822,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3480154275894165,
"rewards/margins": 7.635659217834473,
"rewards/rejected": -7.287643909454346,
"step": 592,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1211762617596592,
"grad_norm": 0.971920907497406,
"learning_rate": 0.00014787489132360974,
"logits/chosen": -1.3045918941497803,
"logits/rejected": -1.3217551708221436,
"logps/chosen": -6.293361186981201,
"logps/rejected": -105.55299377441406,
"loss": 0.23011934757232666,
"memory(GiB)": 45.96,
"nll_loss": 0.1706216186285019,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3878113925457001,
"rewards/margins": 8.775679588317871,
"rewards/rejected": -8.38786792755127,
"step": 593,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1230696408496539,
"grad_norm": 5.00411319732666,
"learning_rate": 0.00014769139824140516,
"logits/chosen": -1.3342088460922241,
"logits/rejected": -1.3560993671417236,
"logps/chosen": -3.8638527393341064,
"logps/rejected": -90.72246551513672,
"loss": 0.309597909450531,
"memory(GiB)": 45.96,
"nll_loss": 0.248661071062088,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3779904246330261,
"rewards/margins": 7.73700475692749,
"rewards/rejected": -7.35901403427124,
"step": 594,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1249630199396485,
"grad_norm": 1.8497488498687744,
"learning_rate": 0.0001475076970726694,
"logits/chosen": -1.3347439765930176,
"logits/rejected": -1.3567668199539185,
"logps/chosen": -4.323431015014648,
"logps/rejected": -99.05289459228516,
"loss": 0.31018275022506714,
"memory(GiB)": 45.96,
"nll_loss": 0.2699596583843231,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4811839461326599,
"rewards/margins": 8.345390319824219,
"rewards/rejected": -7.864206314086914,
"step": 595,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1268563990296432,
"grad_norm": 2.490046501159668,
"learning_rate": 0.00014732378861892525,
"logits/chosen": -1.3427214622497559,
"logits/rejected": -1.3540985584259033,
"logps/chosen": -4.136582851409912,
"logps/rejected": -108.85411071777344,
"loss": 0.2530824840068817,
"memory(GiB)": 45.96,
"nll_loss": 0.2168596386909485,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.47699812054634094,
"rewards/margins": 9.652837753295898,
"rewards/rejected": -9.175840377807617,
"step": 596,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1287497781196378,
"grad_norm": 0.9580318927764893,
"learning_rate": 0.0001471396736825998,
"logits/chosen": -1.351408839225769,
"logits/rejected": -1.365317940711975,
"logps/chosen": -4.171363353729248,
"logps/rejected": -128.09634399414062,
"loss": 0.1587587147951126,
"memory(GiB)": 45.96,
"nll_loss": 0.14957861602306366,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.38554343581199646,
"rewards/margins": 10.911967277526855,
"rewards/rejected": -10.526424407958984,
"step": 597,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.1306431572096325,
"grad_norm": 0.7954278588294983,
"learning_rate": 0.00014695535306702109,
"logits/chosen": -1.353016972541809,
"logits/rejected": -1.3709743022918701,
"logps/chosen": -4.011623859405518,
"logps/rejected": -109.84175109863281,
"loss": 0.1796695441007614,
"memory(GiB)": 45.96,
"nll_loss": 0.16843344271183014,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5847711563110352,
"rewards/margins": 9.300955772399902,
"rewards/rejected": -8.716184616088867,
"step": 598,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.1325365362996274,
"grad_norm": 1.2315398454666138,
"learning_rate": 0.00014677082757641463,
"logits/chosen": -1.3229308128356934,
"logits/rejected": -1.3372865915298462,
"logps/chosen": -4.83215856552124,
"logps/rejected": -100.4617691040039,
"loss": 0.25171154737472534,
"memory(GiB)": 45.96,
"nll_loss": 0.17117245495319366,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.46751469373703003,
"rewards/margins": 8.871299743652344,
"rewards/rejected": -8.403785705566406,
"step": 599,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 1.134429915389622,
"grad_norm": 2.3959968090057373,
"learning_rate": 0.00014658609801589982,
"logits/chosen": -1.3001402616500854,
"logits/rejected": -1.3274784088134766,
"logps/chosen": -3.039743185043335,
"logps/rejected": -124.06808471679688,
"loss": 0.19401244819164276,
"memory(GiB)": 45.96,
"nll_loss": 0.13560381531715393,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4775664508342743,
"rewards/margins": 10.630762100219727,
"rewards/rejected": -10.153194427490234,
"step": 600,
"train_speed(iter/s)": 0.005599
},
{
"epoch": 1.134429915389622,
"eval_logits/chosen": -1.2894256114959717,
"eval_logits/rejected": -1.3079851865768433,
"eval_logps/chosen": -5.3323974609375,
"eval_logps/rejected": -111.4054946899414,
"eval_loss": 0.301040917634964,
"eval_nll_loss": 0.2509084641933441,
"eval_rewards/accuracies": 0.970588207244873,
"eval_rewards/chosen": 0.43204373121261597,
"eval_rewards/margins": 9.736958503723145,
"eval_rewards/rejected": -9.304915428161621,
"eval_runtime": 382.4328,
"eval_samples_per_second": 0.445,
"eval_steps_per_second": 0.445,
"step": 600
},
{
"epoch": 1.1363232944796167,
"grad_norm": 2.15849232673645,
"learning_rate": 0.0001464011651914864,
"logits/chosen": -1.3066818714141846,
"logits/rejected": -1.3111045360565186,
"logps/chosen": -5.026226043701172,
"logps/rejected": -83.13053894042969,
"loss": 0.32173430919647217,
"memory(GiB)": 45.96,
"nll_loss": 0.27388620376586914,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6003259420394897,
"rewards/margins": 7.298637390136719,
"rewards/rejected": -6.698311805725098,
"step": 601,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 1.1382166735696113,
"grad_norm": 1.3094327449798584,
"learning_rate": 0.0001462160299100711,
"logits/chosen": -1.253884196281433,
"logits/rejected": -1.275226354598999,
"logps/chosen": -3.2981009483337402,
"logps/rejected": -118.21580505371094,
"loss": 0.2262260913848877,
"memory(GiB)": 45.96,
"nll_loss": 0.17337152361869812,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5595407485961914,
"rewards/margins": 10.254971504211426,
"rewards/rejected": -9.695430755615234,
"step": 602,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 1.140110052659606,
"grad_norm": 1.0693010091781616,
"learning_rate": 0.00014603069297943383,
"logits/chosen": -1.1947200298309326,
"logits/rejected": -1.2207998037338257,
"logps/chosen": -5.210245609283447,
"logps/rejected": -121.29008483886719,
"loss": 0.26592108607292175,
"memory(GiB)": 45.96,
"nll_loss": 0.2492990344762802,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5870697498321533,
"rewards/margins": 10.30087661743164,
"rewards/rejected": -9.713807106018066,
"step": 603,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1420034317496006,
"grad_norm": 0.8486844301223755,
"learning_rate": 0.00014584515520823453,
"logits/chosen": -1.2308590412139893,
"logits/rejected": -1.2505226135253906,
"logps/chosen": -2.348849058151245,
"logps/rejected": -127.62843322753906,
"loss": 0.21631911396980286,
"memory(GiB)": 45.96,
"nll_loss": 0.11859283596277237,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.5035842061042786,
"rewards/margins": 11.000757217407227,
"rewards/rejected": -10.497172355651855,
"step": 604,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1438968108395953,
"grad_norm": 4.024954319000244,
"learning_rate": 0.00014565941740600933,
"logits/chosen": -1.2393971681594849,
"logits/rejected": -1.2759772539138794,
"logps/chosen": -4.519779205322266,
"logps/rejected": -139.6679229736328,
"loss": 0.34041982889175415,
"memory(GiB)": 45.96,
"nll_loss": 0.2741459906101227,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2945583462715149,
"rewards/margins": 11.51474380493164,
"rewards/rejected": -11.220185279846191,
"step": 605,
"train_speed(iter/s)": 0.005579
},
{
"epoch": 1.14579018992959,
"grad_norm": 0.4649512469768524,
"learning_rate": 0.00014547348038316713,
"logits/chosen": -1.2851876020431519,
"logits/rejected": -1.311815619468689,
"logps/chosen": -3.730963945388794,
"logps/rejected": -136.5504913330078,
"loss": 0.11688469350337982,
"memory(GiB)": 45.96,
"nll_loss": 0.11342987418174744,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5621517896652222,
"rewards/margins": 12.048606872558594,
"rewards/rejected": -11.486455917358398,
"step": 606,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1476835690195846,
"grad_norm": 0.6240984201431274,
"learning_rate": 0.00014528734495098612,
"logits/chosen": -1.2574249505996704,
"logits/rejected": -1.289762020111084,
"logps/chosen": -2.7826473712921143,
"logps/rejected": -154.68235778808594,
"loss": 0.13110938668251038,
"memory(GiB)": 45.96,
"nll_loss": 0.12355895340442657,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5258219838142395,
"rewards/margins": 13.26880931854248,
"rewards/rejected": -12.742988586425781,
"step": 607,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1495769481095792,
"grad_norm": 9.865966796875,
"learning_rate": 0.00014510101192161018,
"logits/chosen": -1.3318796157836914,
"logits/rejected": -1.3524816036224365,
"logps/chosen": -1.951794147491455,
"logps/rejected": -139.08607482910156,
"loss": 0.15863743424415588,
"memory(GiB)": 45.96,
"nll_loss": 0.10350289195775986,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4276507496833801,
"rewards/margins": 12.455421447753906,
"rewards/rejected": -12.02777099609375,
"step": 608,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1514703271995739,
"grad_norm": 0.9074051976203918,
"learning_rate": 0.00014491448210804533,
"logits/chosen": -1.2468656301498413,
"logits/rejected": -1.274411916732788,
"logps/chosen": -2.7470922470092773,
"logps/rejected": -136.74620056152344,
"loss": 0.20206348598003387,
"memory(GiB)": 45.96,
"nll_loss": 0.1475079357624054,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5379533171653748,
"rewards/margins": 12.279942512512207,
"rewards/rejected": -11.741988182067871,
"step": 609,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1533637062895687,
"grad_norm": 28.569091796875,
"learning_rate": 0.00014472775632415615,
"logits/chosen": -1.286940097808838,
"logits/rejected": -1.3069936037063599,
"logps/chosen": -3.2979979515075684,
"logps/rejected": -138.9271240234375,
"loss": 0.2696467936038971,
"memory(GiB)": 45.96,
"nll_loss": 0.25612494349479675,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4200615882873535,
"rewards/margins": 12.597105026245117,
"rewards/rejected": -12.177042007446289,
"step": 610,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1552570853795634,
"grad_norm": 0.8472843766212463,
"learning_rate": 0.00014454083538466232,
"logits/chosen": -1.250975251197815,
"logits/rejected": -1.2794559001922607,
"logps/chosen": -3.220829486846924,
"logps/rejected": -124.9334945678711,
"loss": 0.15973174571990967,
"memory(GiB)": 45.96,
"nll_loss": 0.12067501991987228,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4378184378147125,
"rewards/margins": 10.894189834594727,
"rewards/rejected": -10.456371307373047,
"step": 611,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.157150464469558,
"grad_norm": 1.6857807636260986,
"learning_rate": 0.00014435372010513509,
"logits/chosen": -1.2885514497756958,
"logits/rejected": -1.3083856105804443,
"logps/chosen": -4.843531608581543,
"logps/rejected": -142.25416564941406,
"loss": 0.2124728113412857,
"memory(GiB)": 45.96,
"nll_loss": 0.18952128291130066,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.8398178815841675,
"rewards/margins": 13.268404960632324,
"rewards/rejected": -12.428586959838867,
"step": 612,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1590438435595527,
"grad_norm": 2.1635098457336426,
"learning_rate": 0.00014416641130199348,
"logits/chosen": -1.2934908866882324,
"logits/rejected": -1.3176602125167847,
"logps/chosen": -2.5755224227905273,
"logps/rejected": -130.80252075195312,
"loss": 0.14858324825763702,
"memory(GiB)": 45.96,
"nll_loss": 0.0918111577630043,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.46725374460220337,
"rewards/margins": 11.65639591217041,
"rewards/rejected": -11.189140319824219,
"step": 613,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1609372226495474,
"grad_norm": 0.7229548096656799,
"learning_rate": 0.00014397890979250108,
"logits/chosen": -1.3669577836990356,
"logits/rejected": -1.3880679607391357,
"logps/chosen": -2.74421763420105,
"logps/rejected": -147.63467407226562,
"loss": 0.14499099552631378,
"memory(GiB)": 45.96,
"nll_loss": 0.13768450915813446,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5143299698829651,
"rewards/margins": 13.366703033447266,
"rewards/rejected": -12.852371215820312,
"step": 614,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.162830601739542,
"grad_norm": 2.729567766189575,
"learning_rate": 0.00014379121639476215,
"logits/chosen": -1.4184008836746216,
"logits/rejected": -1.4347777366638184,
"logps/chosen": -4.132072448730469,
"logps/rejected": -138.54647827148438,
"loss": 0.2683996260166168,
"memory(GiB)": 45.96,
"nll_loss": 0.17208775877952576,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29247456789016724,
"rewards/margins": 12.408050537109375,
"rewards/rejected": -12.11557674407959,
"step": 615,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1647239808295367,
"grad_norm": 2.1155970096588135,
"learning_rate": 0.0001436033319277183,
"logits/chosen": -1.3942526578903198,
"logits/rejected": -1.4128817319869995,
"logps/chosen": -4.156976699829102,
"logps/rejected": -128.30084228515625,
"loss": 0.2736564576625824,
"memory(GiB)": 45.96,
"nll_loss": 0.19724150002002716,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45423924922943115,
"rewards/margins": 11.601901054382324,
"rewards/rejected": -11.147662162780762,
"step": 616,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1666173599195313,
"grad_norm": 0.8983713984489441,
"learning_rate": 0.0001434152572111447,
"logits/chosen": -1.3567776679992676,
"logits/rejected": -1.3857258558273315,
"logps/chosen": -4.764517784118652,
"logps/rejected": -148.31007385253906,
"loss": 0.23424586653709412,
"memory(GiB)": 45.96,
"nll_loss": 0.17179971933364868,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.58805912733078,
"rewards/margins": 13.08167839050293,
"rewards/rejected": -12.493619918823242,
"step": 617,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.168510739009526,
"grad_norm": 29.474414825439453,
"learning_rate": 0.00014322699306564668,
"logits/chosen": -1.4533697366714478,
"logits/rejected": -1.4785865545272827,
"logps/chosen": -4.931976795196533,
"logps/rejected": -175.3928985595703,
"loss": 0.3418967127799988,
"memory(GiB)": 45.96,
"nll_loss": 0.19013942778110504,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.34835898876190186,
"rewards/margins": 15.95287036895752,
"rewards/rejected": -15.604512214660645,
"step": 618,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1704041180995208,
"grad_norm": 1.0662310123443604,
"learning_rate": 0.00014303854031265614,
"logits/chosen": -1.3845001459121704,
"logits/rejected": -1.4054373502731323,
"logps/chosen": -7.603452205657959,
"logps/rejected": -147.59339904785156,
"loss": 0.279501348733902,
"memory(GiB)": 45.96,
"nll_loss": 0.2728596031665802,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6738547086715698,
"rewards/margins": 13.407675743103027,
"rewards/rejected": -12.733820915222168,
"step": 619,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1722974971895155,
"grad_norm": 0.6584770083427429,
"learning_rate": 0.0001428498997744278,
"logits/chosen": -1.3540077209472656,
"logits/rejected": -1.3758193254470825,
"logps/chosen": -5.209235668182373,
"logps/rejected": -154.4058074951172,
"loss": 0.19960321485996246,
"memory(GiB)": 45.96,
"nll_loss": 0.1905829906463623,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5462955832481384,
"rewards/margins": 13.737914085388184,
"rewards/rejected": -13.191617965698242,
"step": 620,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1741908762795101,
"grad_norm": 3.4600303173065186,
"learning_rate": 0.0001426610722740358,
"logits/chosen": -1.3978145122528076,
"logits/rejected": -1.417238712310791,
"logps/chosen": -4.0614776611328125,
"logps/rejected": -153.81399536132812,
"loss": 0.22619248926639557,
"memory(GiB)": 45.96,
"nll_loss": 0.18299546837806702,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3758312165737152,
"rewards/margins": 14.089869499206543,
"rewards/rejected": -13.714038848876953,
"step": 621,
"train_speed(iter/s)": 0.00558
},
{
"epoch": 1.1760842553695048,
"grad_norm": 1.2220512628555298,
"learning_rate": 0.00014247205863536996,
"logits/chosen": -1.387900948524475,
"logits/rejected": -1.399329662322998,
"logps/chosen": -3.232072114944458,
"logps/rejected": -139.4011688232422,
"loss": 0.2432737946510315,
"memory(GiB)": 45.96,
"nll_loss": 0.19621756672859192,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.48939788341522217,
"rewards/margins": 13.003323554992676,
"rewards/rejected": -12.51392650604248,
"step": 622,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1779776344594994,
"grad_norm": 14.152691841125488,
"learning_rate": 0.00014228285968313236,
"logits/chosen": -1.3739328384399414,
"logits/rejected": -1.409564733505249,
"logps/chosen": -1.8794363737106323,
"logps/rejected": -161.13742065429688,
"loss": 0.3040890693664551,
"memory(GiB)": 45.96,
"nll_loss": 0.2211679369211197,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3907140791416168,
"rewards/margins": 14.480472564697266,
"rewards/rejected": -14.089759826660156,
"step": 623,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.179871013549494,
"grad_norm": 1.134121060371399,
"learning_rate": 0.0001420934762428335,
"logits/chosen": -1.3690139055252075,
"logits/rejected": -1.3873157501220703,
"logps/chosen": -4.1531476974487305,
"logps/rejected": -147.33445739746094,
"loss": 0.18056610226631165,
"memory(GiB)": 45.96,
"nll_loss": 0.1357978731393814,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.49936407804489136,
"rewards/margins": 13.393208503723145,
"rewards/rejected": -12.893844604492188,
"step": 624,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1817643926394887,
"grad_norm": 0.7700979113578796,
"learning_rate": 0.000141903909140789,
"logits/chosen": -1.3152154684066772,
"logits/rejected": -1.3336371183395386,
"logps/chosen": -2.753535032272339,
"logps/rejected": -146.24029541015625,
"loss": 0.14292775094509125,
"memory(GiB)": 45.96,
"nll_loss": 0.12083562463521957,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4257271885871887,
"rewards/margins": 13.148740768432617,
"rewards/rejected": -12.723015785217285,
"step": 625,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1836577717294834,
"grad_norm": 0.9010930061340332,
"learning_rate": 0.00014171415920411566,
"logits/chosen": -1.2387850284576416,
"logits/rejected": -1.2547930479049683,
"logps/chosen": -4.986386775970459,
"logps/rejected": -110.98575592041016,
"loss": 0.24002321064472198,
"memory(GiB)": 45.96,
"nll_loss": 0.20919182896614075,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5843397378921509,
"rewards/margins": 9.915672302246094,
"rewards/rejected": -9.331332206726074,
"step": 626,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.185551150819478,
"grad_norm": 1.0032802820205688,
"learning_rate": 0.00014152422726072816,
"logits/chosen": -1.2714622020721436,
"logits/rejected": -1.2804292440414429,
"logps/chosen": -6.319892406463623,
"logps/rejected": -106.84049987792969,
"loss": 0.27855637669563293,
"memory(GiB)": 45.96,
"nll_loss": 0.23598721623420715,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.696945071220398,
"rewards/margins": 9.756473541259766,
"rewards/rejected": -9.059529304504395,
"step": 627,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.187444529909473,
"grad_norm": 0.8959448933601379,
"learning_rate": 0.00014133411413933523,
"logits/chosen": -1.3523356914520264,
"logits/rejected": -1.382279634475708,
"logps/chosen": -2.0693681240081787,
"logps/rejected": -150.83078002929688,
"loss": 0.12720414996147156,
"memory(GiB)": 45.96,
"nll_loss": 0.11241940408945084,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5900616645812988,
"rewards/margins": 13.786452293395996,
"rewards/rejected": -13.196392059326172,
"step": 628,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1893379089994676,
"grad_norm": 19.023563385009766,
"learning_rate": 0.00014114382066943618,
"logits/chosen": -1.2807756662368774,
"logits/rejected": -1.3037108182907104,
"logps/chosen": -6.60006046295166,
"logps/rejected": -135.55589294433594,
"loss": 0.3288038969039917,
"memory(GiB)": 45.96,
"nll_loss": 0.3017730116844177,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18927210569381714,
"rewards/margins": 11.776759147644043,
"rewards/rejected": -11.58748722076416,
"step": 629,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1912312880894622,
"grad_norm": 1.1239473819732666,
"learning_rate": 0.0001409533476813171,
"logits/chosen": -1.3297996520996094,
"logits/rejected": -1.3480398654937744,
"logps/chosen": -5.556182861328125,
"logps/rejected": -143.35040283203125,
"loss": 0.23849260807037354,
"memory(GiB)": 45.96,
"nll_loss": 0.19322925806045532,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5474792718887329,
"rewards/margins": 13.075397491455078,
"rewards/rejected": -12.527918815612793,
"step": 630,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.1931246671794569,
"grad_norm": 0.8637579679489136,
"learning_rate": 0.00014076269600604748,
"logits/chosen": -1.2814322710037231,
"logits/rejected": -1.3097827434539795,
"logps/chosen": -2.7755789756774902,
"logps/rejected": -165.87844848632812,
"loss": 0.18964631855487823,
"memory(GiB)": 45.96,
"nll_loss": 0.16508126258850098,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6472874879837036,
"rewards/margins": 14.968192100524902,
"rewards/rejected": -14.320903778076172,
"step": 631,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.1950180462694515,
"grad_norm": 35.91895294189453,
"learning_rate": 0.0001405718664754764,
"logits/chosen": -1.2617077827453613,
"logits/rejected": -1.291745662689209,
"logps/chosen": -5.865665435791016,
"logps/rejected": -139.880859375,
"loss": 0.2276858538389206,
"memory(GiB)": 45.96,
"nll_loss": 0.19169428944587708,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31476259231567383,
"rewards/margins": 12.022266387939453,
"rewards/rejected": -11.707503318786621,
"step": 632,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.1969114253594462,
"grad_norm": 3.695615291595459,
"learning_rate": 0.0001403808599222289,
"logits/chosen": -1.2897461652755737,
"logits/rejected": -1.3059349060058594,
"logps/chosen": -5.9791765213012695,
"logps/rejected": -137.66943359375,
"loss": 0.22073869407176971,
"memory(GiB)": 45.96,
"nll_loss": 0.21946173906326294,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.7112911343574524,
"rewards/margins": 12.674735069274902,
"rewards/rejected": -11.9634428024292,
"step": 633,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.1988048044494408,
"grad_norm": 1.971228837966919,
"learning_rate": 0.00014018967717970254,
"logits/chosen": -1.300931692123413,
"logits/rejected": -1.3245811462402344,
"logps/chosen": -4.173644542694092,
"logps/rejected": -140.01991271972656,
"loss": 0.24654018878936768,
"memory(GiB)": 45.96,
"nll_loss": 0.24364623427391052,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3556899130344391,
"rewards/margins": 12.488964080810547,
"rewards/rejected": -12.13327407836914,
"step": 634,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.2006981835394355,
"grad_norm": 1.9012233018875122,
"learning_rate": 0.0001399983190820635,
"logits/chosen": -1.302451729774475,
"logits/rejected": -1.33121919631958,
"logps/chosen": -2.868640422821045,
"logps/rejected": -171.15383911132812,
"loss": 0.18641558289527893,
"memory(GiB)": 45.96,
"nll_loss": 0.12313997745513916,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.48267343640327454,
"rewards/margins": 15.43280029296875,
"rewards/rejected": -14.950126647949219,
"step": 635,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2025915626294301,
"grad_norm": 2.096956729888916,
"learning_rate": 0.0001398067864642431,
"logits/chosen": -1.2636353969573975,
"logits/rejected": -1.2825238704681396,
"logps/chosen": -5.219088554382324,
"logps/rejected": -133.4476318359375,
"loss": 0.2759723663330078,
"memory(GiB)": 45.96,
"nll_loss": 0.2651902437210083,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6040548086166382,
"rewards/margins": 12.336801528930664,
"rewards/rejected": -11.732746124267578,
"step": 636,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.204484941719425,
"grad_norm": 0.7150812149047852,
"learning_rate": 0.00013961508016193416,
"logits/chosen": -1.230392336845398,
"logits/rejected": -1.2499421834945679,
"logps/chosen": -3.6723968982696533,
"logps/rejected": -131.15306091308594,
"loss": 0.20008526742458344,
"memory(GiB)": 45.96,
"nll_loss": 0.1471841037273407,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5768845677375793,
"rewards/margins": 11.497173309326172,
"rewards/rejected": -10.920289039611816,
"step": 637,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2063783208094196,
"grad_norm": 2.1268279552459717,
"learning_rate": 0.00013942320101158732,
"logits/chosen": -1.215066909790039,
"logits/rejected": -1.2379679679870605,
"logps/chosen": -3.8959691524505615,
"logps/rejected": -145.33799743652344,
"loss": 0.17703424394130707,
"memory(GiB)": 45.96,
"nll_loss": 0.17233292758464813,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2276427000761032,
"rewards/margins": 12.982682228088379,
"rewards/rejected": -12.75503921508789,
"step": 638,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2082716998994143,
"grad_norm": 1.3078527450561523,
"learning_rate": 0.00013923114985040733,
"logits/chosen": -1.2039527893066406,
"logits/rejected": -1.2280265092849731,
"logps/chosen": -3.3238728046417236,
"logps/rejected": -127.83318328857422,
"loss": 0.18549729883670807,
"memory(GiB)": 45.96,
"nll_loss": 0.13051187992095947,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5606825947761536,
"rewards/margins": 11.299223899841309,
"rewards/rejected": -10.738540649414062,
"step": 639,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.210165078989409,
"grad_norm": 1.6217330694198608,
"learning_rate": 0.00013903892751634947,
"logits/chosen": -1.2137424945831299,
"logits/rejected": -1.21882164478302,
"logps/chosen": -4.9762983322143555,
"logps/rejected": -101.02047729492188,
"loss": 0.27594050765037537,
"memory(GiB)": 45.96,
"nll_loss": 0.17926731705665588,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28640735149383545,
"rewards/margins": 9.02888298034668,
"rewards/rejected": -8.742474555969238,
"step": 640,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2120584580794036,
"grad_norm": 7.413793087005615,
"learning_rate": 0.000138846534848116,
"logits/chosen": -1.141318917274475,
"logits/rejected": -1.1606910228729248,
"logps/chosen": -5.451035499572754,
"logps/rejected": -101.37506103515625,
"loss": 0.31164583563804626,
"memory(GiB)": 45.96,
"nll_loss": 0.27093198895454407,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6124750971794128,
"rewards/margins": 8.550021171569824,
"rewards/rejected": -7.937546730041504,
"step": 641,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2139518371693983,
"grad_norm": 0.9872555732727051,
"learning_rate": 0.00013865397268515215,
"logits/chosen": -1.103111743927002,
"logits/rejected": -1.1166858673095703,
"logps/chosen": -5.7832255363464355,
"logps/rejected": -87.32723236083984,
"loss": 0.31326529383659363,
"memory(GiB)": 45.96,
"nll_loss": 0.23107054829597473,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4298703670501709,
"rewards/margins": 7.514644622802734,
"rewards/rejected": -7.084774494171143,
"step": 642,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.215845216259393,
"grad_norm": 4.625118732452393,
"learning_rate": 0.0001384612418676429,
"logits/chosen": -1.0852738618850708,
"logits/rejected": -1.1021206378936768,
"logps/chosen": -4.508449554443359,
"logps/rejected": -104.58615112304688,
"loss": 0.363935649394989,
"memory(GiB)": 45.96,
"nll_loss": 0.3228420615196228,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3612232804298401,
"rewards/margins": 8.754815101623535,
"rewards/rejected": -8.393592834472656,
"step": 643,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2177385953493876,
"grad_norm": 3.9486324787139893,
"learning_rate": 0.000138268343236509,
"logits/chosen": -1.0697134733200073,
"logits/rejected": -1.0845346450805664,
"logps/chosen": -5.405340194702148,
"logps/rejected": -81.9689712524414,
"loss": 0.24942205846309662,
"memory(GiB)": 45.96,
"nll_loss": 0.18678025901317596,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.7587069869041443,
"rewards/margins": 6.866741180419922,
"rewards/rejected": -6.108034133911133,
"step": 644,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2196319744393822,
"grad_norm": 1.8781797885894775,
"learning_rate": 0.0001380752776334034,
"logits/chosen": -1.063079833984375,
"logits/rejected": -1.0907819271087646,
"logps/chosen": -4.9822845458984375,
"logps/rejected": -98.52869415283203,
"loss": 0.48380017280578613,
"memory(GiB)": 45.96,
"nll_loss": 0.3868637979030609,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45160090923309326,
"rewards/margins": 7.476816177368164,
"rewards/rejected": -7.025215148925781,
"step": 645,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.221525353529377,
"grad_norm": 1.285443663597107,
"learning_rate": 0.00013788204590070764,
"logits/chosen": -1.0937983989715576,
"logits/rejected": -1.097926139831543,
"logps/chosen": -4.647152423858643,
"logps/rejected": -70.02279663085938,
"loss": 0.3429650664329529,
"memory(GiB)": 45.96,
"nll_loss": 0.2989942133426666,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5649895668029785,
"rewards/margins": 6.161919116973877,
"rewards/rejected": -5.596929550170898,
"step": 646,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2234187326193717,
"grad_norm": 10.317179679870605,
"learning_rate": 0.000137688648881528,
"logits/chosen": -1.1082532405853271,
"logits/rejected": -1.1164014339447021,
"logps/chosen": -5.854452610015869,
"logps/rejected": -72.38533782958984,
"loss": 0.5907310247421265,
"memory(GiB)": 45.96,
"nll_loss": 0.4151501953601837,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.6598876118659973,
"rewards/margins": 6.241320610046387,
"rewards/rejected": -5.581433296203613,
"step": 647,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2253121117093664,
"grad_norm": 1.430675745010376,
"learning_rate": 0.00013749508741969213,
"logits/chosen": -1.1150786876678467,
"logits/rejected": -1.1341830492019653,
"logps/chosen": -2.883854627609253,
"logps/rejected": -87.04833221435547,
"loss": 0.2859303057193756,
"memory(GiB)": 45.96,
"nll_loss": 0.2183929681777954,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.44854816794395447,
"rewards/margins": 7.2965617179870605,
"rewards/rejected": -6.848013877868652,
"step": 648,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.227205490799361,
"grad_norm": 0.6251242756843567,
"learning_rate": 0.00013730136235974493,
"logits/chosen": -1.0749518871307373,
"logits/rejected": -1.1022703647613525,
"logps/chosen": -3.4674556255340576,
"logps/rejected": -94.43933868408203,
"loss": 0.19341430068016052,
"memory(GiB)": 45.96,
"nll_loss": 0.16188928484916687,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5625832676887512,
"rewards/margins": 7.256820201873779,
"rewards/rejected": -6.69423770904541,
"step": 649,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2290988698893557,
"grad_norm": 0.854637086391449,
"learning_rate": 0.00013710747454694536,
"logits/chosen": -1.1327743530273438,
"logits/rejected": -1.1492671966552734,
"logps/chosen": -3.158024787902832,
"logps/rejected": -92.56230926513672,
"loss": 0.16373629868030548,
"memory(GiB)": 45.96,
"nll_loss": 0.13652028143405914,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6151731610298157,
"rewards/margins": 7.690463066101074,
"rewards/rejected": -7.075289249420166,
"step": 650,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2309922489793503,
"grad_norm": 1.0111662149429321,
"learning_rate": 0.00013691342482726227,
"logits/chosen": -1.164562463760376,
"logits/rejected": -1.1749894618988037,
"logps/chosen": -3.864534854888916,
"logps/rejected": -85.07794189453125,
"loss": 0.19850535690784454,
"memory(GiB)": 45.96,
"nll_loss": 0.14427503943443298,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.435876727104187,
"rewards/margins": 7.181488037109375,
"rewards/rejected": -6.745611667633057,
"step": 651,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.232885628069345,
"grad_norm": 0.6544408798217773,
"learning_rate": 0.0001367192140473711,
"logits/chosen": -1.1733068227767944,
"logits/rejected": -1.1924707889556885,
"logps/chosen": -2.2992167472839355,
"logps/rejected": -92.77910614013672,
"loss": 0.13127104938030243,
"memory(GiB)": 45.96,
"nll_loss": 0.11011791974306107,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5089115500450134,
"rewards/margins": 8.034041404724121,
"rewards/rejected": -7.525129795074463,
"step": 652,
"train_speed(iter/s)": 0.005581
},
{
"epoch": 1.2347790071593396,
"grad_norm": 0.8594977259635925,
"learning_rate": 0.00013652484305464994,
"logits/chosen": -1.2025909423828125,
"logits/rejected": -1.2214899063110352,
"logps/chosen": -5.194190979003906,
"logps/rejected": -102.56082153320312,
"loss": 0.2433939427137375,
"memory(GiB)": 45.96,
"nll_loss": 0.196023091673851,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37284529209136963,
"rewards/margins": 8.817720413208008,
"rewards/rejected": -8.444875717163086,
"step": 653,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2366723862493343,
"grad_norm": 4.11221170425415,
"learning_rate": 0.000136330312697176,
"logits/chosen": -1.2391037940979004,
"logits/rejected": -1.257367730140686,
"logps/chosen": -3.074094533920288,
"logps/rejected": -107.96156311035156,
"loss": 0.17748232185840607,
"memory(GiB)": 45.96,
"nll_loss": 0.12704119086265564,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45895522832870483,
"rewards/margins": 9.096002578735352,
"rewards/rejected": -8.637046813964844,
"step": 654,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.238565765339329,
"grad_norm": 13.602038383483887,
"learning_rate": 0.00013613562382372175,
"logits/chosen": -1.2747328281402588,
"logits/rejected": -1.2887108325958252,
"logps/chosen": -4.994225978851318,
"logps/rejected": -111.89958190917969,
"loss": 0.22689774632453918,
"memory(GiB)": 45.96,
"nll_loss": 0.19176575541496277,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6112773418426514,
"rewards/margins": 9.564874649047852,
"rewards/rejected": -8.953597068786621,
"step": 655,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2404591444293236,
"grad_norm": 1.4164304733276367,
"learning_rate": 0.00013594077728375128,
"logits/chosen": -1.2002649307250977,
"logits/rejected": -1.2172743082046509,
"logps/chosen": -2.0340259075164795,
"logps/rejected": -100.03349304199219,
"loss": 0.15853197872638702,
"memory(GiB)": 45.96,
"nll_loss": 0.14140553772449493,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39426544308662415,
"rewards/margins": 8.667793273925781,
"rewards/rejected": -8.273527145385742,
"step": 656,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2423525235193185,
"grad_norm": 1.2055261135101318,
"learning_rate": 0.00013574577392741675,
"logits/chosen": -1.1947505474090576,
"logits/rejected": -1.2100290060043335,
"logps/chosen": -3.4151129722595215,
"logps/rejected": -87.28324890136719,
"loss": 0.25436219573020935,
"memory(GiB)": 45.96,
"nll_loss": 0.21079185605049133,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3687793016433716,
"rewards/margins": 7.392486572265625,
"rewards/rejected": -7.023707389831543,
"step": 657,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2442459026093131,
"grad_norm": 0.7824620008468628,
"learning_rate": 0.00013555061460555437,
"logits/chosen": -1.2751868963241577,
"logits/rejected": -1.2890942096710205,
"logps/chosen": -5.6683349609375,
"logps/rejected": -94.01497650146484,
"loss": 0.22607284784317017,
"memory(GiB)": 45.96,
"nll_loss": 0.18028336763381958,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5186669230461121,
"rewards/margins": 8.202751159667969,
"rewards/rejected": -7.684084892272949,
"step": 658,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2461392816993078,
"grad_norm": 10.540384292602539,
"learning_rate": 0.00013535530016968095,
"logits/chosen": -1.224336862564087,
"logits/rejected": -1.234197735786438,
"logps/chosen": -4.465878963470459,
"logps/rejected": -78.70198822021484,
"loss": 0.3276776671409607,
"memory(GiB)": 45.96,
"nll_loss": 0.2578147053718567,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.48812490701675415,
"rewards/margins": 6.712148666381836,
"rewards/rejected": -6.224023818969727,
"step": 659,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2480326607893024,
"grad_norm": 1.0541977882385254,
"learning_rate": 0.00013515983147199007,
"logits/chosen": -1.263400673866272,
"logits/rejected": -1.2767853736877441,
"logps/chosen": -4.78371000289917,
"logps/rejected": -91.89421081542969,
"loss": 0.2207237035036087,
"memory(GiB)": 45.96,
"nll_loss": 0.21213196218013763,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.40188920497894287,
"rewards/margins": 7.835195541381836,
"rewards/rejected": -7.433306694030762,
"step": 660,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.249926039879297,
"grad_norm": 1.1346842050552368,
"learning_rate": 0.00013496420936534839,
"logits/chosen": -1.2140860557556152,
"logits/rejected": -1.2262767553329468,
"logps/chosen": -4.072805881500244,
"logps/rejected": -83.90109252929688,
"loss": 0.29052406549453735,
"memory(GiB)": 45.96,
"nll_loss": 0.20386162400245667,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5836110711097717,
"rewards/margins": 7.275147914886475,
"rewards/rejected": -6.691536903381348,
"step": 661,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2518194189692917,
"grad_norm": 1.0119054317474365,
"learning_rate": 0.0001347684347032919,
"logits/chosen": -1.2601851224899292,
"logits/rejected": -1.2733888626098633,
"logps/chosen": -3.0143775939941406,
"logps/rejected": -83.3037109375,
"loss": 0.1853754073381424,
"memory(GiB)": 45.96,
"nll_loss": 0.16816890239715576,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4909835159778595,
"rewards/margins": 7.277222156524658,
"rewards/rejected": -6.786238670349121,
"step": 662,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2537127980592864,
"grad_norm": 1.772426724433899,
"learning_rate": 0.00013457250834002227,
"logits/chosen": -1.259223461151123,
"logits/rejected": -1.2752642631530762,
"logps/chosen": -6.449353218078613,
"logps/rejected": -77.19977569580078,
"loss": 0.3121209740638733,
"memory(GiB)": 45.96,
"nll_loss": 0.2732515037059784,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.48688846826553345,
"rewards/margins": 6.596216678619385,
"rewards/rejected": -6.109328746795654,
"step": 663,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2556061771492812,
"grad_norm": 0.834148645401001,
"learning_rate": 0.00013437643113040301,
"logits/chosen": -1.2490071058273315,
"logits/rejected": -1.2806060314178467,
"logps/chosen": -2.3923885822296143,
"logps/rejected": -112.9473876953125,
"loss": 0.12270709872245789,
"memory(GiB)": 45.96,
"nll_loss": 0.11919470131397247,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5832490921020508,
"rewards/margins": 9.47195816040039,
"rewards/rejected": -8.888710021972656,
"step": 664,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2574995562392757,
"grad_norm": 0.6280990242958069,
"learning_rate": 0.0001341802039299558,
"logits/chosen": -1.2498441934585571,
"logits/rejected": -1.2767866849899292,
"logps/chosen": -1.147368311882019,
"logps/rejected": -101.53812408447266,
"loss": 0.09030965715646744,
"memory(GiB)": 45.96,
"nll_loss": 0.08374150097370148,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41601359844207764,
"rewards/margins": 8.669894218444824,
"rewards/rejected": -8.25387954711914,
"step": 665,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2593929353292705,
"grad_norm": 7.9262776374816895,
"learning_rate": 0.00013398382759485683,
"logits/chosen": -1.2408939599990845,
"logits/rejected": -1.2566684484481812,
"logps/chosen": -2.6536943912506104,
"logps/rejected": -89.7925033569336,
"loss": 0.21182867884635925,
"memory(GiB)": 45.96,
"nll_loss": 0.18399737775325775,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.467414915561676,
"rewards/margins": 7.703207969665527,
"rewards/rejected": -7.23579216003418,
"step": 666,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2612863144192652,
"grad_norm": 2.1628665924072266,
"learning_rate": 0.00013378730298193293,
"logits/chosen": -1.2686347961425781,
"logits/rejected": -1.2850341796875,
"logps/chosen": -2.91650128364563,
"logps/rejected": -98.89842224121094,
"loss": 0.12062933295965195,
"memory(GiB)": 45.96,
"nll_loss": 0.09240053594112396,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.44848957657814026,
"rewards/margins": 8.455171585083008,
"rewards/rejected": -8.006681442260742,
"step": 667,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2631796935092598,
"grad_norm": 1.5882667303085327,
"learning_rate": 0.0001335906309486579,
"logits/chosen": -1.2118374109268188,
"logits/rejected": -1.228037714958191,
"logps/chosen": -4.291105270385742,
"logps/rejected": -93.77169799804688,
"loss": 0.23226000368595123,
"memory(GiB)": 45.96,
"nll_loss": 0.17540231347084045,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5786739587783813,
"rewards/margins": 8.085977554321289,
"rewards/rejected": -7.507303237915039,
"step": 668,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2650730725992545,
"grad_norm": 0.7664045691490173,
"learning_rate": 0.00013339381235314877,
"logits/chosen": -1.2171658277511597,
"logits/rejected": -1.2381665706634521,
"logps/chosen": -2.144977569580078,
"logps/rejected": -104.58934783935547,
"loss": 0.1646273136138916,
"memory(GiB)": 45.96,
"nll_loss": 0.15552210807800293,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5437726974487305,
"rewards/margins": 9.003692626953125,
"rewards/rejected": -8.459919929504395,
"step": 669,
"train_speed(iter/s)": 0.005582
},
{
"epoch": 1.2669664516892492,
"grad_norm": 0.997371256351471,
"learning_rate": 0.00013319684805416208,
"logits/chosen": -1.2663860321044922,
"logits/rejected": -1.2850096225738525,
"logps/chosen": -3.7030885219573975,
"logps/rejected": -94.42146301269531,
"loss": 0.19464686512947083,
"memory(GiB)": 45.96,
"nll_loss": 0.1695374846458435,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6468212008476257,
"rewards/margins": 8.09141731262207,
"rewards/rejected": -7.444596290588379,
"step": 670,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2688598307792438,
"grad_norm": 1.922092080116272,
"learning_rate": 0.00013299973891109002,
"logits/chosen": -1.2253403663635254,
"logits/rejected": -1.244078278541565,
"logps/chosen": -3.8278942108154297,
"logps/rejected": -102.39065551757812,
"loss": 0.20534221827983856,
"memory(GiB)": 45.96,
"nll_loss": 0.18800829350948334,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6005682945251465,
"rewards/margins": 8.945769309997559,
"rewards/rejected": -8.345200538635254,
"step": 671,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2707532098692385,
"grad_norm": 0.8352254033088684,
"learning_rate": 0.0001328024857839569,
"logits/chosen": -1.2455424070358276,
"logits/rejected": -1.2553379535675049,
"logps/chosen": -4.562953472137451,
"logps/rejected": -100.60092163085938,
"loss": 0.20486782491207123,
"memory(GiB)": 45.96,
"nll_loss": 0.18330179154872894,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.49509212374687195,
"rewards/margins": 8.774545669555664,
"rewards/rejected": -8.27945327758789,
"step": 672,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.272646588959233,
"grad_norm": 2.8604531288146973,
"learning_rate": 0.00013260508953341513,
"logits/chosen": -1.2760071754455566,
"logits/rejected": -1.2919646501541138,
"logps/chosen": -4.311322212219238,
"logps/rejected": -109.21879577636719,
"loss": 0.25504687428474426,
"memory(GiB)": 45.96,
"nll_loss": 0.18772965669631958,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.7696996927261353,
"rewards/margins": 9.808104515075684,
"rewards/rejected": -9.038405418395996,
"step": 673,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2745399680492278,
"grad_norm": 3.490610361099243,
"learning_rate": 0.00013240755102074162,
"logits/chosen": -1.2782739400863647,
"logits/rejected": -1.2971439361572266,
"logps/chosen": -6.547723293304443,
"logps/rejected": -123.92678833007812,
"loss": 0.27842605113983154,
"memory(GiB)": 45.96,
"nll_loss": 0.21907608211040497,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5699790120124817,
"rewards/margins": 10.686688423156738,
"rewards/rejected": -10.11670970916748,
"step": 674,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2764333471392226,
"grad_norm": 0.6559191346168518,
"learning_rate": 0.00013220987110783405,
"logits/chosen": -1.3302873373031616,
"logits/rejected": -1.3444199562072754,
"logps/chosen": -3.099641799926758,
"logps/rejected": -100.66400146484375,
"loss": 0.13532628118991852,
"memory(GiB)": 45.96,
"nll_loss": 0.11194542795419693,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4563906788825989,
"rewards/margins": 8.841947555541992,
"rewards/rejected": -8.3855562210083,
"step": 675,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2783267262292173,
"grad_norm": 0.6219284534454346,
"learning_rate": 0.00013201205065720698,
"logits/chosen": -1.2828350067138672,
"logits/rejected": -1.3093940019607544,
"logps/chosen": -2.723968029022217,
"logps/rejected": -119.10283660888672,
"loss": 0.13384726643562317,
"memory(GiB)": 45.96,
"nll_loss": 0.11944205313920975,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.644302487373352,
"rewards/margins": 10.407089233398438,
"rewards/rejected": -9.762786865234375,
"step": 676,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.280220105319212,
"grad_norm": 4.198030471801758,
"learning_rate": 0.00013181409053198822,
"logits/chosen": -1.2754874229431152,
"logits/rejected": -1.2981709241867065,
"logps/chosen": -3.2714099884033203,
"logps/rejected": -102.00110626220703,
"loss": 0.16418549418449402,
"memory(GiB)": 45.96,
"nll_loss": 0.15923593938350677,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3782915472984314,
"rewards/margins": 8.629867553710938,
"rewards/rejected": -8.251575469970703,
"step": 677,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2821134844092066,
"grad_norm": 0.7027133107185364,
"learning_rate": 0.00013161599159591502,
"logits/chosen": -1.3214412927627563,
"logits/rejected": -1.3430482149124146,
"logps/chosen": -2.828273296356201,
"logps/rejected": -122.728271484375,
"loss": 0.16940374672412872,
"memory(GiB)": 45.96,
"nll_loss": 0.16672328114509583,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6937204599380493,
"rewards/margins": 10.843151092529297,
"rewards/rejected": -10.149429321289062,
"step": 678,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2840068634992012,
"grad_norm": 0.4566222131252289,
"learning_rate": 0.00013141775471333023,
"logits/chosen": -1.2488141059875488,
"logits/rejected": -1.2712870836257935,
"logps/chosen": -1.4968810081481934,
"logps/rejected": -115.5900650024414,
"loss": 0.07236362993717194,
"memory(GiB)": 45.96,
"nll_loss": 0.06065154820680618,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5558494329452515,
"rewards/margins": 10.079120635986328,
"rewards/rejected": -9.523271560668945,
"step": 679,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2859002425891959,
"grad_norm": 7.306726455688477,
"learning_rate": 0.00013121938074917865,
"logits/chosen": -1.3081672191619873,
"logits/rejected": -1.3317952156066895,
"logps/chosen": -2.5203912258148193,
"logps/rejected": -124.57064819335938,
"loss": 0.14741453528404236,
"memory(GiB)": 45.96,
"nll_loss": 0.12144798040390015,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.49395012855529785,
"rewards/margins": 10.88518238067627,
"rewards/rejected": -10.391231536865234,
"step": 680,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2877936216791905,
"grad_norm": 0.7193635702133179,
"learning_rate": 0.00013102087056900312,
"logits/chosen": -1.361487627029419,
"logits/rejected": -1.3688561916351318,
"logps/chosen": -3.718552350997925,
"logps/rejected": -90.23562622070312,
"loss": 0.1710875928401947,
"memory(GiB)": 45.96,
"nll_loss": 0.1185617595911026,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.38218656182289124,
"rewards/margins": 7.945744037628174,
"rewards/rejected": -7.563557147979736,
"step": 681,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2896870007691852,
"grad_norm": 1.750275731086731,
"learning_rate": 0.00013082222503894085,
"logits/chosen": -1.328383207321167,
"logits/rejected": -1.3390076160430908,
"logps/chosen": -4.469247341156006,
"logps/rejected": -99.45858764648438,
"loss": 0.24831274151802063,
"memory(GiB)": 45.96,
"nll_loss": 0.2337150275707245,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5493384599685669,
"rewards/margins": 9.164920806884766,
"rewards/rejected": -8.615582466125488,
"step": 682,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2915803798591798,
"grad_norm": 1.4674733877182007,
"learning_rate": 0.0001306234450257196,
"logits/chosen": -1.3304932117462158,
"logits/rejected": -1.354658842086792,
"logps/chosen": -3.1954829692840576,
"logps/rejected": -115.50567626953125,
"loss": 0.16422712802886963,
"memory(GiB)": 45.96,
"nll_loss": 0.16022494435310364,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5024171471595764,
"rewards/margins": 9.925741195678711,
"rewards/rejected": -9.423324584960938,
"step": 683,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2934737589491747,
"grad_norm": 3.6834020614624023,
"learning_rate": 0.00013042453139665397,
"logits/chosen": -1.3059653043746948,
"logits/rejected": -1.3349957466125488,
"logps/chosen": -7.1290788650512695,
"logps/rejected": -118.19027709960938,
"loss": 0.5577002167701721,
"memory(GiB)": 45.96,
"nll_loss": 0.5272465348243713,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2190469354391098,
"rewards/margins": 9.950216293334961,
"rewards/rejected": -9.731169700622559,
"step": 684,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2953671380391691,
"grad_norm": 0.9725119471549988,
"learning_rate": 0.00013022548501964148,
"logits/chosen": -1.2843022346496582,
"logits/rejected": -1.3074129819869995,
"logps/chosen": -4.139756202697754,
"logps/rejected": -121.79645538330078,
"loss": 0.21320319175720215,
"memory(GiB)": 45.96,
"nll_loss": 0.1927129179239273,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6416595578193665,
"rewards/margins": 11.054458618164062,
"rewards/rejected": -10.412799835205078,
"step": 685,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.297260517129164,
"grad_norm": 0.9142606258392334,
"learning_rate": 0.00013002630676315884,
"logits/chosen": -1.297221064567566,
"logits/rejected": -1.313838243484497,
"logps/chosen": -3.9657680988311768,
"logps/rejected": -108.65413665771484,
"loss": 0.16495384275913239,
"memory(GiB)": 45.96,
"nll_loss": 0.13814619183540344,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5089263319969177,
"rewards/margins": 9.599608421325684,
"rewards/rejected": -9.090682029724121,
"step": 686,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.2991538962191587,
"grad_norm": 0.8316473364830017,
"learning_rate": 0.00012982699749625821,
"logits/chosen": -1.2407358884811401,
"logits/rejected": -1.2609210014343262,
"logps/chosen": -7.802042484283447,
"logps/rejected": -116.04839324951172,
"loss": 0.31111985445022583,
"memory(GiB)": 45.96,
"nll_loss": 0.2776601016521454,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5655537843704224,
"rewards/margins": 10.247386932373047,
"rewards/rejected": -9.681832313537598,
"step": 687,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3010472753091533,
"grad_norm": 0.7703730463981628,
"learning_rate": 0.00012962755808856342,
"logits/chosen": -1.2796357870101929,
"logits/rejected": -1.2995810508728027,
"logps/chosen": -4.099747657775879,
"logps/rejected": -121.5992431640625,
"loss": 0.17581507563591003,
"memory(GiB)": 45.96,
"nll_loss": 0.1654597371816635,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6910482048988342,
"rewards/margins": 10.691566467285156,
"rewards/rejected": -10.000518798828125,
"step": 688,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.302940654399148,
"grad_norm": 1.3358616828918457,
"learning_rate": 0.000129427989410266,
"logits/chosen": -1.302721381187439,
"logits/rejected": -1.3264588117599487,
"logps/chosen": -5.364765167236328,
"logps/rejected": -98.9963607788086,
"loss": 0.5656005144119263,
"memory(GiB)": 45.96,
"nll_loss": 0.42210423946380615,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4461752772331238,
"rewards/margins": 8.554890632629395,
"rewards/rejected": -8.108715057373047,
"step": 689,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3048340334891426,
"grad_norm": 19.095157623291016,
"learning_rate": 0.00012922829233212165,
"logits/chosen": -1.3093451261520386,
"logits/rejected": -1.3238065242767334,
"logps/chosen": -4.750430583953857,
"logps/rejected": -109.75341796875,
"loss": 0.2108265459537506,
"memory(GiB)": 45.96,
"nll_loss": 0.18970412015914917,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2624005675315857,
"rewards/margins": 9.519784927368164,
"rewards/rejected": -9.257384300231934,
"step": 690,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3067274125791373,
"grad_norm": 0.773473858833313,
"learning_rate": 0.00012902846772544624,
"logits/chosen": -1.2952555418014526,
"logits/rejected": -1.3154966831207275,
"logps/chosen": -5.129486083984375,
"logps/rejected": -127.95144653320312,
"loss": 0.19911812245845795,
"memory(GiB)": 45.96,
"nll_loss": 0.16275183856487274,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37549078464508057,
"rewards/margins": 10.62497329711914,
"rewards/rejected": -10.249483108520508,
"step": 691,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.308620791669132,
"grad_norm": 1.073358416557312,
"learning_rate": 0.00012882851646211206,
"logits/chosen": -1.2766900062561035,
"logits/rejected": -1.2928975820541382,
"logps/chosen": -7.992812156677246,
"logps/rejected": -116.97691345214844,
"loss": 0.2699803411960602,
"memory(GiB)": 45.96,
"nll_loss": 0.2624160349369049,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5498393774032593,
"rewards/margins": 10.348921775817871,
"rewards/rejected": -9.799081802368164,
"step": 692,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3105141707591268,
"grad_norm": 0.6758482456207275,
"learning_rate": 0.00012862843941454402,
"logits/chosen": -1.254409670829773,
"logits/rejected": -1.2667585611343384,
"logps/chosen": -5.230801105499268,
"logps/rejected": -113.11685943603516,
"loss": 0.20469366014003754,
"memory(GiB)": 45.96,
"nll_loss": 0.1763952076435089,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3384644091129303,
"rewards/margins": 9.77762508392334,
"rewards/rejected": -9.439160346984863,
"step": 693,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3124075498491212,
"grad_norm": 5.1062445640563965,
"learning_rate": 0.00012842823745571588,
"logits/chosen": -1.2632169723510742,
"logits/rejected": -1.285363793373108,
"logps/chosen": -3.2440667152404785,
"logps/rejected": -129.44454956054688,
"loss": 0.20233389735221863,
"memory(GiB)": 45.96,
"nll_loss": 0.12110748142004013,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5933730006217957,
"rewards/margins": 11.818197250366211,
"rewards/rejected": -11.224824905395508,
"step": 694,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.314300928939116,
"grad_norm": 4.967945098876953,
"learning_rate": 0.00012822791145914643,
"logits/chosen": -1.3190865516662598,
"logits/rejected": -1.322510838508606,
"logps/chosen": -6.946662425994873,
"logps/rejected": -99.20793151855469,
"loss": 0.22520855069160461,
"memory(GiB)": 45.96,
"nll_loss": 0.20360182225704193,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4464600384235382,
"rewards/margins": 8.819591522216797,
"rewards/rejected": -8.37313175201416,
"step": 695,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3161943080291107,
"grad_norm": 0.7528690695762634,
"learning_rate": 0.00012802746229889563,
"logits/chosen": -1.2697570323944092,
"logits/rejected": -1.2890403270721436,
"logps/chosen": -4.18599796295166,
"logps/rejected": -116.47010040283203,
"loss": 0.12717163562774658,
"memory(GiB)": 45.96,
"nll_loss": 0.12329236418008804,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39391693472862244,
"rewards/margins": 10.161079406738281,
"rewards/rejected": -9.767163276672363,
"step": 696,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3180876871191054,
"grad_norm": 4.968014240264893,
"learning_rate": 0.00012782689084956078,
"logits/chosen": -1.3118584156036377,
"logits/rejected": -1.320459008216858,
"logps/chosen": -5.031144142150879,
"logps/rejected": -111.54464721679688,
"loss": 0.27862486243247986,
"memory(GiB)": 45.96,
"nll_loss": 0.15949955582618713,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4624725878238678,
"rewards/margins": 9.712789535522461,
"rewards/rejected": -9.250316619873047,
"step": 697,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3199810662091,
"grad_norm": 2.0111641883850098,
"learning_rate": 0.00012762619798627282,
"logits/chosen": -1.2476155757904053,
"logits/rejected": -1.260296106338501,
"logps/chosen": -4.611104965209961,
"logps/rejected": -103.76033020019531,
"loss": 0.17496375739574432,
"memory(GiB)": 45.96,
"nll_loss": 0.16747039556503296,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5656296014785767,
"rewards/margins": 8.926993370056152,
"rewards/rejected": -8.361364364624023,
"step": 698,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3218744452990947,
"grad_norm": 0.7398191094398499,
"learning_rate": 0.00012742538458469246,
"logits/chosen": -1.2478125095367432,
"logits/rejected": -1.2548859119415283,
"logps/chosen": -3.8168303966522217,
"logps/rejected": -97.06517791748047,
"loss": 0.14771857857704163,
"memory(GiB)": 45.96,
"nll_loss": 0.1390731930732727,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5594909191131592,
"rewards/margins": 8.748406410217285,
"rewards/rejected": -8.188915252685547,
"step": 699,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3237678243890894,
"grad_norm": 0.8066232800483704,
"learning_rate": 0.00012722445152100624,
"logits/chosen": -1.2417348623275757,
"logits/rejected": -1.2570741176605225,
"logps/chosen": -2.389744997024536,
"logps/rejected": -86.6338882446289,
"loss": 0.16380390524864197,
"memory(GiB)": 45.96,
"nll_loss": 0.12720054388046265,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.570247232913971,
"rewards/margins": 7.321161270141602,
"rewards/rejected": -6.750914096832275,
"step": 700,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.325661203479084,
"grad_norm": 1.1527165174484253,
"learning_rate": 0.00012702339967192292,
"logits/chosen": -1.2916889190673828,
"logits/rejected": -1.3003627061843872,
"logps/chosen": -3.0451269149780273,
"logps/rejected": -91.65868377685547,
"loss": 0.1978881061077118,
"memory(GiB)": 45.96,
"nll_loss": 0.16753852367401123,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5230326056480408,
"rewards/margins": 8.209744453430176,
"rewards/rejected": -7.686711311340332,
"step": 701,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3275545825690789,
"grad_norm": 1.0912978649139404,
"learning_rate": 0.00012682222991466948,
"logits/chosen": -1.2573422193527222,
"logits/rejected": -1.2747260332107544,
"logps/chosen": -2.7481446266174316,
"logps/rejected": -103.978515625,
"loss": 0.14063449203968048,
"memory(GiB)": 45.96,
"nll_loss": 0.13063806295394897,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.47163817286491394,
"rewards/margins": 8.745121002197266,
"rewards/rejected": -8.273482322692871,
"step": 702,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3294479616590733,
"grad_norm": 22.729263305664062,
"learning_rate": 0.00012662094312698735,
"logits/chosen": -1.2921996116638184,
"logits/rejected": -1.2991044521331787,
"logps/chosen": -5.945530414581299,
"logps/rejected": -76.7307357788086,
"loss": 0.2982117533683777,
"memory(GiB)": 45.96,
"nll_loss": 0.27566850185394287,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3026009798049927,
"rewards/margins": 6.646614074707031,
"rewards/rejected": -6.344013214111328,
"step": 703,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3313413407490682,
"grad_norm": 0.9101666212081909,
"learning_rate": 0.00012641954018712863,
"logits/chosen": -1.2816362380981445,
"logits/rejected": -1.306016445159912,
"logps/chosen": -2.3992016315460205,
"logps/rejected": -104.89875030517578,
"loss": 0.21880419552326202,
"memory(GiB)": 45.96,
"nll_loss": 0.17376631498336792,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5566422939300537,
"rewards/margins": 8.900392532348633,
"rewards/rejected": -8.34375,
"step": 704,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3332347198390628,
"grad_norm": 0.7675183415412903,
"learning_rate": 0.00012621802197385212,
"logits/chosen": -1.2347376346588135,
"logits/rejected": -1.2482961416244507,
"logps/chosen": -3.8751392364501953,
"logps/rejected": -100.11812591552734,
"loss": 0.1806536465883255,
"memory(GiB)": 45.96,
"nll_loss": 0.1367262303829193,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.564403772354126,
"rewards/margins": 8.214317321777344,
"rewards/rejected": -7.649913787841797,
"step": 705,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3351280989290575,
"grad_norm": 0.995285153388977,
"learning_rate": 0.00012601638936641976,
"logits/chosen": -1.270362138748169,
"logits/rejected": -1.2847920656204224,
"logps/chosen": -3.295135021209717,
"logps/rejected": -82.77586364746094,
"loss": 0.19705501198768616,
"memory(GiB)": 45.96,
"nll_loss": 0.1198456883430481,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.49801748991012573,
"rewards/margins": 7.20506477355957,
"rewards/rejected": -6.707046985626221,
"step": 706,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3370214780190521,
"grad_norm": 1.0535005331039429,
"learning_rate": 0.0001258146432445924,
"logits/chosen": -1.3396191596984863,
"logits/rejected": -1.356287956237793,
"logps/chosen": -3.8445959091186523,
"logps/rejected": -90.25233459472656,
"loss": 0.2341512143611908,
"memory(GiB)": 45.96,
"nll_loss": 0.1896001696586609,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.495680570602417,
"rewards/margins": 7.917792320251465,
"rewards/rejected": -7.422112464904785,
"step": 707,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3389148571090468,
"grad_norm": 1.5458048582077026,
"learning_rate": 0.00012561278448862634,
"logits/chosen": -1.3336971998214722,
"logits/rejected": -1.3589318990707397,
"logps/chosen": -1.9345256090164185,
"logps/rejected": -104.30036163330078,
"loss": 0.1311199814081192,
"memory(GiB)": 45.96,
"nll_loss": 0.10932604968547821,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5588750243186951,
"rewards/margins": 9.301870346069336,
"rewards/rejected": -8.742996215820312,
"step": 708,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3408082361990414,
"grad_norm": 0.8339555263519287,
"learning_rate": 0.00012541081397926925,
"logits/chosen": -1.3096569776535034,
"logits/rejected": -1.3302487134933472,
"logps/chosen": -3.6992669105529785,
"logps/rejected": -118.5272216796875,
"loss": 0.14296677708625793,
"memory(GiB)": 45.96,
"nll_loss": 0.12727825343608856,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6764388680458069,
"rewards/margins": 10.035237312316895,
"rewards/rejected": -9.358798027038574,
"step": 709,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.342701615289036,
"grad_norm": 15.578758239746094,
"learning_rate": 0.00012520873259775636,
"logits/chosen": -1.37481689453125,
"logits/rejected": -1.3919589519500732,
"logps/chosen": -3.958169460296631,
"logps/rejected": -109.35943603515625,
"loss": 0.4203401207923889,
"memory(GiB)": 45.96,
"nll_loss": 0.34680628776550293,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18485558032989502,
"rewards/margins": 9.556227684020996,
"rewards/rejected": -9.37137222290039,
"step": 710,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.344594994379031,
"grad_norm": 0.9837526679039001,
"learning_rate": 0.00012500654122580675,
"logits/chosen": -1.4348475933074951,
"logits/rejected": -1.456255316734314,
"logps/chosen": -1.9943851232528687,
"logps/rejected": -137.81805419921875,
"loss": 0.09225192666053772,
"memory(GiB)": 45.96,
"nll_loss": 0.07782280445098877,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.44493988156318665,
"rewards/margins": 12.162233352661133,
"rewards/rejected": -11.717293739318848,
"step": 711,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3464883734690254,
"grad_norm": 2.581824779510498,
"learning_rate": 0.00012480424074561933,
"logits/chosen": -1.3822526931762695,
"logits/rejected": -1.4020648002624512,
"logps/chosen": -4.550716400146484,
"logps/rejected": -103.86782836914062,
"loss": 0.28442901372909546,
"memory(GiB)": 45.96,
"nll_loss": 0.24876733124256134,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4810265600681305,
"rewards/margins": 9.237351417541504,
"rewards/rejected": -8.756324768066406,
"step": 712,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3483817525590203,
"grad_norm": 2.6685738563537598,
"learning_rate": 0.00012460183203986917,
"logits/chosen": -1.4334018230438232,
"logits/rejected": -1.4540126323699951,
"logps/chosen": -5.17223596572876,
"logps/rejected": -127.40531158447266,
"loss": 0.24820397794246674,
"memory(GiB)": 45.96,
"nll_loss": 0.21534302830696106,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.533196747303009,
"rewards/margins": 11.388389587402344,
"rewards/rejected": -10.855192184448242,
"step": 713,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.350275131649015,
"grad_norm": 3.6330223083496094,
"learning_rate": 0.00012439931599170342,
"logits/chosen": -1.3965675830841064,
"logits/rejected": -1.4132789373397827,
"logps/chosen": -5.910233020782471,
"logps/rejected": -115.43537902832031,
"loss": 0.22887299954891205,
"memory(GiB)": 45.96,
"nll_loss": 0.2144639939069748,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4336181581020355,
"rewards/margins": 10.194890022277832,
"rewards/rejected": -9.761272430419922,
"step": 714,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3521685107390096,
"grad_norm": 1.252068042755127,
"learning_rate": 0.0001241966934847377,
"logits/chosen": -1.4876632690429688,
"logits/rejected": -1.5106892585754395,
"logps/chosen": -4.912591934204102,
"logps/rejected": -130.63931274414062,
"loss": 0.2556398808956146,
"memory(GiB)": 45.96,
"nll_loss": 0.19699408113956451,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.49190080165863037,
"rewards/margins": 11.174872398376465,
"rewards/rejected": -10.682971954345703,
"step": 715,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3540618898290042,
"grad_norm": 0.47095194458961487,
"learning_rate": 0.00012399396540305205,
"logits/chosen": -1.5109764337539673,
"logits/rejected": -1.5408351421356201,
"logps/chosen": -1.663557767868042,
"logps/rejected": -182.84844970703125,
"loss": 0.08118365705013275,
"memory(GiB)": 45.96,
"nll_loss": 0.07808937877416611,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.562421441078186,
"rewards/margins": 16.441465377807617,
"rewards/rejected": -15.879043579101562,
"step": 716,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3559552689189989,
"grad_norm": 2.3887813091278076,
"learning_rate": 0.00012379113263118717,
"logits/chosen": -1.5092129707336426,
"logits/rejected": -1.5265885591506958,
"logps/chosen": -4.671719551086426,
"logps/rejected": -130.737548828125,
"loss": 0.3565371334552765,
"memory(GiB)": 45.96,
"nll_loss": 0.3507789671421051,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.38416343927383423,
"rewards/margins": 11.713521003723145,
"rewards/rejected": -11.32935619354248,
"step": 717,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3578486480089935,
"grad_norm": 13.596844673156738,
"learning_rate": 0.0001235881960541405,
"logits/chosen": -1.4459404945373535,
"logits/rejected": -1.4728071689605713,
"logps/chosen": -3.910332679748535,
"logps/rejected": -169.46316528320312,
"loss": 0.21092525124549866,
"memory(GiB)": 45.96,
"nll_loss": 0.19290146231651306,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5652647018432617,
"rewards/margins": 15.016708374023438,
"rewards/rejected": -14.451443672180176,
"step": 718,
"train_speed(iter/s)": 0.005583
},
{
"epoch": 1.3597420270989882,
"grad_norm": 1.977660894393921,
"learning_rate": 0.0001233851565573626,
"logits/chosen": -1.4575848579406738,
"logits/rejected": -1.4886194467544556,
"logps/chosen": -3.429673671722412,
"logps/rejected": -176.4278106689453,
"loss": 0.21111251413822174,
"memory(GiB)": 45.96,
"nll_loss": 0.20513850450515747,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4268459379673004,
"rewards/margins": 16.01671600341797,
"rewards/rejected": -15.589868545532227,
"step": 719,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3616354061889828,
"grad_norm": 0.8643395304679871,
"learning_rate": 0.00012318201502675285,
"logits/chosen": -1.4632608890533447,
"logits/rejected": -1.496609091758728,
"logps/chosen": -2.374844551086426,
"logps/rejected": -159.74131774902344,
"loss": 0.14827243983745575,
"memory(GiB)": 45.96,
"nll_loss": 0.11705812066793442,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.46328988671302795,
"rewards/margins": 13.929129600524902,
"rewards/rejected": -13.465839385986328,
"step": 720,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3635287852789775,
"grad_norm": 0.8877068161964417,
"learning_rate": 0.00012297877234865588,
"logits/chosen": -1.4121975898742676,
"logits/rejected": -1.420471429824829,
"logps/chosen": -7.728551864624023,
"logps/rejected": -122.19908905029297,
"loss": 0.2621362805366516,
"memory(GiB)": 45.96,
"nll_loss": 0.2564736008644104,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.8202823400497437,
"rewards/margins": 10.843989372253418,
"rewards/rejected": -10.02370548248291,
"step": 721,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3654221643689723,
"grad_norm": 0.8817264437675476,
"learning_rate": 0.00012277542940985779,
"logits/chosen": -1.4238308668136597,
"logits/rejected": -1.4451203346252441,
"logps/chosen": -4.689065456390381,
"logps/rejected": -126.12505340576172,
"loss": 0.20782385766506195,
"memory(GiB)": 45.96,
"nll_loss": 0.19612634181976318,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6051958799362183,
"rewards/margins": 11.33012580871582,
"rewards/rejected": -10.724929809570312,
"step": 722,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.367315543458967,
"grad_norm": 1.012028455734253,
"learning_rate": 0.00012257198709758195,
"logits/chosen": -1.430659532546997,
"logits/rejected": -1.455889105796814,
"logps/chosen": -2.4323935508728027,
"logps/rejected": -160.52789306640625,
"loss": 0.15415363013744354,
"memory(GiB)": 45.96,
"nll_loss": 0.12620654702186584,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5517710447311401,
"rewards/margins": 14.274921417236328,
"rewards/rejected": -13.723150253295898,
"step": 723,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3692089225489616,
"grad_norm": 1.9171146154403687,
"learning_rate": 0.00012236844629948538,
"logits/chosen": -1.3615983724594116,
"logits/rejected": -1.3914395570755005,
"logps/chosen": -5.449278831481934,
"logps/rejected": -129.47451782226562,
"loss": 0.2664668560028076,
"memory(GiB)": 45.96,
"nll_loss": 0.2412000298500061,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.679523229598999,
"rewards/margins": 11.65814208984375,
"rewards/rejected": -10.978619575500488,
"step": 724,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3711023016389563,
"grad_norm": 0.5200458765029907,
"learning_rate": 0.00012216480790365488,
"logits/chosen": -1.3722385168075562,
"logits/rejected": -1.4049911499023438,
"logps/chosen": -3.476780891418457,
"logps/rejected": -159.24119567871094,
"loss": 0.19099539518356323,
"memory(GiB)": 45.96,
"nll_loss": 0.16211548447608948,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.41306477785110474,
"rewards/margins": 14.28917121887207,
"rewards/rejected": -13.876106262207031,
"step": 725,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.372995680728951,
"grad_norm": 3.351590156555176,
"learning_rate": 0.00012196107279860301,
"logits/chosen": -1.3456298112869263,
"logits/rejected": -1.3633019924163818,
"logps/chosen": -5.894962310791016,
"logps/rejected": -127.60720825195312,
"loss": 0.497927188873291,
"memory(GiB)": 45.96,
"nll_loss": 0.45556724071502686,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2950041890144348,
"rewards/margins": 10.873826026916504,
"rewards/rejected": -10.578822135925293,
"step": 726,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3748890598189456,
"grad_norm": 0.7161403894424438,
"learning_rate": 0.00012175724187326428,
"logits/chosen": -1.351697325706482,
"logits/rejected": -1.3736845254898071,
"logps/chosen": -3.959686517715454,
"logps/rejected": -154.29759216308594,
"loss": 0.19538988173007965,
"memory(GiB)": 45.96,
"nll_loss": 0.1853979378938675,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5529553294181824,
"rewards/margins": 13.636305809020996,
"rewards/rejected": -13.083351135253906,
"step": 727,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3767824389089403,
"grad_norm": 1.0838693380355835,
"learning_rate": 0.00012155331601699136,
"logits/chosen": -1.3614987134933472,
"logits/rejected": -1.3678171634674072,
"logps/chosen": -11.347692489624023,
"logps/rejected": -108.63534545898438,
"loss": 0.3933212459087372,
"memory(GiB)": 45.96,
"nll_loss": 0.35364362597465515,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.7163238525390625,
"rewards/margins": 9.661209106445312,
"rewards/rejected": -8.94488525390625,
"step": 728,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.378675817998935,
"grad_norm": 0.7250790596008301,
"learning_rate": 0.00012134929611955109,
"logits/chosen": -1.360811471939087,
"logits/rejected": -1.3907039165496826,
"logps/chosen": -2.4135990142822266,
"logps/rejected": -160.8827667236328,
"loss": 0.1475839763879776,
"memory(GiB)": 45.96,
"nll_loss": 0.11929626762866974,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.49388089776039124,
"rewards/margins": 13.924455642700195,
"rewards/rejected": -13.430574417114258,
"step": 729,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3805691970889296,
"grad_norm": 1.2542954683303833,
"learning_rate": 0.00012114518307112053,
"logits/chosen": -1.3999381065368652,
"logits/rejected": -1.4196140766143799,
"logps/chosen": -2.968822479248047,
"logps/rejected": -147.8498077392578,
"loss": 0.1501389890909195,
"memory(GiB)": 45.96,
"nll_loss": 0.13163243234157562,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.47122716903686523,
"rewards/margins": 13.5759859085083,
"rewards/rejected": -13.104759216308594,
"step": 730,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3824625761789244,
"grad_norm": 0.6328426003456116,
"learning_rate": 0.00012094097776228335,
"logits/chosen": -1.3374364376068115,
"logits/rejected": -1.3639745712280273,
"logps/chosen": -3.418973445892334,
"logps/rejected": -139.9619903564453,
"loss": 0.149828240275383,
"memory(GiB)": 45.96,
"nll_loss": 0.11651848256587982,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.544003963470459,
"rewards/margins": 12.12524700164795,
"rewards/rejected": -11.581243515014648,
"step": 731,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.384355955268919,
"grad_norm": 0.8515809178352356,
"learning_rate": 0.00012073668108402565,
"logits/chosen": -1.404557704925537,
"logits/rejected": -1.4227296113967896,
"logps/chosen": -5.3266801834106445,
"logps/rejected": -127.69633483886719,
"loss": 0.23115482926368713,
"memory(GiB)": 45.96,
"nll_loss": 0.16876675188541412,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5588371753692627,
"rewards/margins": 11.65122127532959,
"rewards/rejected": -11.092384338378906,
"step": 732,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3862493343589137,
"grad_norm": 1.035111904144287,
"learning_rate": 0.0001205322939277322,
"logits/chosen": -1.3675159215927124,
"logits/rejected": -1.377406358718872,
"logps/chosen": -7.57385778427124,
"logps/rejected": -113.66754150390625,
"loss": 0.5253475904464722,
"memory(GiB)": 45.96,
"nll_loss": 0.5173190832138062,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6031939387321472,
"rewards/margins": 10.4005708694458,
"rewards/rejected": -9.79737663269043,
"step": 733,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3881427134489084,
"grad_norm": 0.7137688398361206,
"learning_rate": 0.00012032781718518257,
"logits/chosen": -1.400411605834961,
"logits/rejected": -1.4152530431747437,
"logps/chosen": -7.439002990722656,
"logps/rejected": -134.11846923828125,
"loss": 0.17674262821674347,
"memory(GiB)": 45.96,
"nll_loss": 0.1659688949584961,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.8982738256454468,
"rewards/margins": 12.587785720825195,
"rewards/rejected": -11.689512252807617,
"step": 734,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.390036092538903,
"grad_norm": 1.0638463497161865,
"learning_rate": 0.00012012325174854724,
"logits/chosen": -1.381399393081665,
"logits/rejected": -1.417229413986206,
"logps/chosen": -4.133545398712158,
"logps/rejected": -165.7884979248047,
"loss": 0.1909055858850479,
"memory(GiB)": 45.96,
"nll_loss": 0.1588495373725891,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3287806212902069,
"rewards/margins": 13.795286178588867,
"rewards/rejected": -13.46650505065918,
"step": 735,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3919294716288977,
"grad_norm": 3.916788339614868,
"learning_rate": 0.0001199185985103836,
"logits/chosen": -1.3574695587158203,
"logits/rejected": -1.3903796672821045,
"logps/chosen": -4.943059921264648,
"logps/rejected": -145.6674041748047,
"loss": 0.3422682583332062,
"memory(GiB)": 45.96,
"nll_loss": 0.30081629753112793,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.46855008602142334,
"rewards/margins": 12.823249816894531,
"rewards/rejected": -12.35469913482666,
"step": 736,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3938228507188923,
"grad_norm": 0.7496212720870972,
"learning_rate": 0.00011971385836363223,
"logits/chosen": -1.3401854038238525,
"logits/rejected": -1.3637409210205078,
"logps/chosen": -3.160003662109375,
"logps/rejected": -148.8011016845703,
"loss": 0.13967886567115784,
"memory(GiB)": 45.96,
"nll_loss": 0.1187189519405365,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6559804677963257,
"rewards/margins": 13.016501426696777,
"rewards/rejected": -12.360520362854004,
"step": 737,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.395716229808887,
"grad_norm": 0.8836220502853394,
"learning_rate": 0.00011950903220161285,
"logits/chosen": -1.2783434391021729,
"logits/rejected": -1.291855812072754,
"logps/chosen": -5.08381462097168,
"logps/rejected": -125.47669982910156,
"loss": 0.23457510769367218,
"memory(GiB)": 45.96,
"nll_loss": 0.22920887172222137,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.725649356842041,
"rewards/margins": 11.28402328491211,
"rewards/rejected": -10.558374404907227,
"step": 738,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3976096088988816,
"grad_norm": 0.9596480131149292,
"learning_rate": 0.00011930412091802044,
"logits/chosen": -1.23847234249115,
"logits/rejected": -1.2562484741210938,
"logps/chosen": -6.178463935852051,
"logps/rejected": -124.13822174072266,
"loss": 0.2189672887325287,
"memory(GiB)": 45.96,
"nll_loss": 0.21428486704826355,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5073556303977966,
"rewards/margins": 11.04176139831543,
"rewards/rejected": -10.534406661987305,
"step": 739,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.3995029879888765,
"grad_norm": 1.186428189277649,
"learning_rate": 0.00011909912540692148,
"logits/chosen": -1.2327266931533813,
"logits/rejected": -1.2502973079681396,
"logps/chosen": -3.5932505130767822,
"logps/rejected": -124.90965270996094,
"loss": 0.2263035923242569,
"memory(GiB)": 45.96,
"nll_loss": 0.17550766468048096,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.47944796085357666,
"rewards/margins": 11.442840576171875,
"rewards/rejected": -10.963393211364746,
"step": 740,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.401396367078871,
"grad_norm": 0.9400050640106201,
"learning_rate": 0.00011889404656274985,
"logits/chosen": -1.2746970653533936,
"logits/rejected": -1.301072359085083,
"logps/chosen": -4.578012943267822,
"logps/rejected": -143.21412658691406,
"loss": 0.14633478224277496,
"memory(GiB)": 45.96,
"nll_loss": 0.14389167726039886,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4045856297016144,
"rewards/margins": 12.573046684265137,
"rewards/rejected": -12.168460845947266,
"step": 741,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.4032897461688658,
"grad_norm": 12.828886032104492,
"learning_rate": 0.00011868888528030312,
"logits/chosen": -1.290102481842041,
"logits/rejected": -1.3054649829864502,
"logps/chosen": -7.718609809875488,
"logps/rejected": -142.0688934326172,
"loss": 1.2448090314865112,
"memory(GiB)": 45.96,
"nll_loss": 0.6703987121582031,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.06796294450759888,
"rewards/margins": 12.493032455444336,
"rewards/rejected": -12.560995101928711,
"step": 742,
"train_speed(iter/s)": 0.005584
},
{
"epoch": 1.4051831252588605,
"grad_norm": 2.3734612464904785,
"learning_rate": 0.00011848364245473851,
"logits/chosen": -1.277733325958252,
"logits/rejected": -1.2968937158584595,
"logps/chosen": -5.408899784088135,
"logps/rejected": -135.39718627929688,
"loss": 0.4479808509349823,
"memory(GiB)": 45.96,
"nll_loss": 0.44413915276527405,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3601748049259186,
"rewards/margins": 11.691971778869629,
"rewards/rejected": -11.331796646118164,
"step": 743,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.4070765043488551,
"grad_norm": 0.9128540754318237,
"learning_rate": 0.00011827831898156905,
"logits/chosen": -1.227461814880371,
"logits/rejected": -1.2495135068893433,
"logps/chosen": -1.9151227474212646,
"logps/rejected": -136.8602752685547,
"loss": 0.14868707954883575,
"memory(GiB)": 45.96,
"nll_loss": 0.12404179573059082,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5372089147567749,
"rewards/margins": 12.386828422546387,
"rewards/rejected": -11.849618911743164,
"step": 744,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.4089698834388498,
"grad_norm": 1.1429063081741333,
"learning_rate": 0.0001180729157566596,
"logits/chosen": -1.2368712425231934,
"logits/rejected": -1.2416596412658691,
"logps/chosen": -4.958278179168701,
"logps/rejected": -103.30583190917969,
"loss": 0.21024346351623535,
"memory(GiB)": 45.96,
"nll_loss": 0.1912650763988495,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3631391227245331,
"rewards/margins": 9.275796890258789,
"rewards/rejected": -8.912657737731934,
"step": 745,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.4108632625288444,
"grad_norm": 1.0790748596191406,
"learning_rate": 0.00011786743367622301,
"logits/chosen": -1.1736490726470947,
"logits/rejected": -1.1861443519592285,
"logps/chosen": -2.616354465484619,
"logps/rejected": -102.14070129394531,
"loss": 0.19070766866207123,
"memory(GiB)": 45.96,
"nll_loss": 0.1813308298587799,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3258036971092224,
"rewards/margins": 8.927370071411133,
"rewards/rejected": -8.601566314697266,
"step": 746,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.412756641618839,
"grad_norm": 0.5030332803726196,
"learning_rate": 0.00011766187363681622,
"logits/chosen": -1.1803619861602783,
"logits/rejected": -1.1944257020950317,
"logps/chosen": -4.902136325836182,
"logps/rejected": -123.20097351074219,
"loss": 0.14166034758090973,
"memory(GiB)": 45.96,
"nll_loss": 0.13693617284297943,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4183957576751709,
"rewards/margins": 10.870806694030762,
"rewards/rejected": -10.452409744262695,
"step": 747,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.4146500207088337,
"grad_norm": 15.55799388885498,
"learning_rate": 0.00011745623653533633,
"logits/chosen": -1.242021083831787,
"logits/rejected": -1.266333818435669,
"logps/chosen": -4.228762149810791,
"logps/rejected": -99.54964447021484,
"loss": 0.4001218378543854,
"memory(GiB)": 45.96,
"nll_loss": 0.31423306465148926,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.49108681082725525,
"rewards/margins": 8.478590965270996,
"rewards/rejected": -7.987504959106445,
"step": 748,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.4165433997988286,
"grad_norm": 0.9360311627388,
"learning_rate": 0.00011725052326901662,
"logits/chosen": -1.2178735733032227,
"logits/rejected": -1.2292119264602661,
"logps/chosen": -5.197657585144043,
"logps/rejected": -93.74435424804688,
"loss": 0.22836686670780182,
"memory(GiB)": 45.96,
"nll_loss": 0.18862150609493256,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4481957256793976,
"rewards/margins": 8.137001037597656,
"rewards/rejected": -7.688804626464844,
"step": 749,
"train_speed(iter/s)": 0.005585
},
{
"epoch": 1.418436778888823,
"grad_norm": 0.9867538809776306,
"learning_rate": 0.0001170447347354227,
"logits/chosen": -1.2246237993240356,
"logits/rejected": -1.2385095357894897,
"logps/chosen": -2.0182390213012695,
"logps/rejected": -94.68486022949219,
"loss": 0.13907429575920105,
"memory(GiB)": 45.96,
"nll_loss": 0.12384593486785889,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5055228471755981,
"rewards/margins": 8.253795623779297,
"rewards/rejected": -7.7482733726501465,
"step": 750,
"train_speed(iter/s)": 0.005585
}
],
"logging_steps": 1,
"max_steps": 1584,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.260421268267598e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}