PEFT
Safetensors
2gt5-100 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
dfd0429 verified
Raw
History Blame Contribute Delete
63.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.18933790899946748,
"eval_steps": 300,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0018933790899946748,
"grad_norm": 12.48285961151123,
"learning_rate": 2.5e-06,
"logits/chosen": -0.600911557674408,
"logits/rejected": -0.6057144403457642,
"logps/chosen": -8.623997688293457,
"logps/rejected": -21.27922248840332,
"loss": 1.5083240270614624,
"memory(GiB)": 45.96,
"nll_loss": 0.8151768445968628,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005677
},
{
"epoch": 0.0037867581799893497,
"grad_norm": 12.232138633728027,
"learning_rate": 5e-06,
"logits/chosen": -0.6421620845794678,
"logits/rejected": -0.6454498767852783,
"logps/chosen": -10.60006046295166,
"logps/rejected": -13.605328559875488,
"loss": 1.547582983970642,
"memory(GiB)": 45.96,
"nll_loss": 0.8544361591339111,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005654
},
{
"epoch": 0.005680137269984025,
"grad_norm": 14.417566299438477,
"learning_rate": 7.5e-06,
"logits/chosen": -0.664191484451294,
"logits/rejected": -0.6654082536697388,
"logps/chosen": -11.958788871765137,
"logps/rejected": -13.785713195800781,
"loss": 1.6179333925247192,
"memory(GiB)": 45.96,
"nll_loss": 0.9271513819694519,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.003109893761575222,
"rewards/margins": 0.0048811971209943295,
"rewards/rejected": -0.0017713033594191074,
"step": 3,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.007573516359978699,
"grad_norm": 8.840044975280762,
"learning_rate": 1e-05,
"logits/chosen": -0.6362882256507874,
"logits/rejected": -0.6385632753372192,
"logps/chosen": -9.689570426940918,
"logps/rejected": -18.226909637451172,
"loss": 1.4001612663269043,
"memory(GiB)": 45.96,
"nll_loss": 0.7101836204528809,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.005959533154964447,
"rewards/margins": 0.00653040548786521,
"rewards/rejected": -0.0005708730313926935,
"step": 4,
"train_speed(iter/s)": 0.005654
},
{
"epoch": 0.009466895449973374,
"grad_norm": 12.643730163574219,
"learning_rate": 1.25e-05,
"logits/chosen": -0.6108935475349426,
"logits/rejected": -0.6125737428665161,
"logps/chosen": -10.900370597839355,
"logps/rejected": -16.267436981201172,
"loss": 1.5408352613449097,
"memory(GiB)": 45.96,
"nll_loss": 0.853638768196106,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.018230972811579704,
"rewards/margins": 0.01212537381798029,
"rewards/rejected": 0.006105600390583277,
"step": 5,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.01136027453996805,
"grad_norm": 13.595820426940918,
"learning_rate": 1.5e-05,
"logits/chosen": -0.6641858220100403,
"logits/rejected": -0.6705058217048645,
"logps/chosen": -7.528585910797119,
"logps/rejected": -18.073911666870117,
"loss": 1.4404857158660889,
"memory(GiB)": 45.96,
"nll_loss": 0.7598920464515686,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.034823305904865265,
"rewards/margins": 0.026311496272683144,
"rewards/rejected": 0.008511810563504696,
"step": 6,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.013253653629962723,
"grad_norm": 13.2615385055542,
"learning_rate": 1.75e-05,
"logits/chosen": -0.6327687501907349,
"logits/rejected": -0.637922465801239,
"logps/chosen": -8.100177764892578,
"logps/rejected": -22.4697322845459,
"loss": 1.310943603515625,
"memory(GiB)": 45.96,
"nll_loss": 0.6429428458213806,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07164613902568817,
"rewards/margins": 0.053715869784355164,
"rewards/rejected": 0.017930276691913605,
"step": 7,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.015147032719957399,
"grad_norm": 9.518823623657227,
"learning_rate": 2e-05,
"logits/chosen": -0.6458379626274109,
"logits/rejected": -0.6480465531349182,
"logps/chosen": -8.227258682250977,
"logps/rejected": -15.074575424194336,
"loss": 1.2895722389221191,
"memory(GiB)": 45.96,
"nll_loss": 0.6121883392333984,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.11458335816860199,
"rewards/margins": 0.04461951553821564,
"rewards/rejected": 0.06996384263038635,
"step": 8,
"train_speed(iter/s)": 0.005657
},
{
"epoch": 0.017040411809952073,
"grad_norm": 5.971006393432617,
"learning_rate": 2.25e-05,
"logits/chosen": -0.6322387456893921,
"logits/rejected": -0.6355814933776855,
"logps/chosen": -6.8561859130859375,
"logps/rejected": -16.394319534301758,
"loss": 1.1358637809753418,
"memory(GiB)": 45.96,
"nll_loss": 0.4396786093711853,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.126601442694664,
"rewards/margins": 0.027468431740999222,
"rewards/rejected": 0.09913301467895508,
"step": 9,
"train_speed(iter/s)": 0.005656
},
{
"epoch": 0.018933790899946748,
"grad_norm": 4.615151405334473,
"learning_rate": 2.5e-05,
"logits/chosen": -0.6353996992111206,
"logits/rejected": -0.6420772075653076,
"logps/chosen": -4.39181661605835,
"logps/rejected": -19.73300552368164,
"loss": 0.98687344789505,
"memory(GiB)": 45.96,
"nll_loss": 0.38576164841651917,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.196926087141037,
"rewards/margins": 0.274502158164978,
"rewards/rejected": -0.07757607102394104,
"step": 10,
"train_speed(iter/s)": 0.005651
},
{
"epoch": 0.020827169989941424,
"grad_norm": 3.6985604763031006,
"learning_rate": 2.7500000000000004e-05,
"logits/chosen": -0.6321280002593994,
"logits/rejected": -0.6365548968315125,
"logps/chosen": -7.2246904373168945,
"logps/rejected": -19.404216766357422,
"loss": 0.9879567623138428,
"memory(GiB)": 45.96,
"nll_loss": 0.36671119928359985,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.12358222156763077,
"rewards/margins": 0.28244268894195557,
"rewards/rejected": -0.1588604599237442,
"step": 11,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 0.0227205490799361,
"grad_norm": 7.83486270904541,
"learning_rate": 3e-05,
"logits/chosen": -0.6391905546188354,
"logits/rejected": -0.6451292634010315,
"logps/chosen": -8.3941011428833,
"logps/rejected": -24.687467575073242,
"loss": 1.1386761665344238,
"memory(GiB)": 45.96,
"nll_loss": 0.3862188458442688,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.004531089216470718,
"rewards/margins": 0.17587248980998993,
"rewards/rejected": -0.18040357530117035,
"step": 12,
"train_speed(iter/s)": 0.005646
},
{
"epoch": 0.024613928169930775,
"grad_norm": 5.917618274688721,
"learning_rate": 3.2500000000000004e-05,
"logits/chosen": -0.6517987251281738,
"logits/rejected": -0.658316969871521,
"logps/chosen": -6.573670387268066,
"logps/rejected": -19.874000549316406,
"loss": 1.050663948059082,
"memory(GiB)": 45.96,
"nll_loss": 0.40407559275627136,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.10255793482065201,
"rewards/margins": 0.36497071385383606,
"rewards/rejected": -0.26241275668144226,
"step": 13,
"train_speed(iter/s)": 0.00565
},
{
"epoch": 0.026507307259925447,
"grad_norm": 4.1237287521362305,
"learning_rate": 3.5e-05,
"logits/chosen": -0.61805260181427,
"logits/rejected": -0.6224305033683777,
"logps/chosen": -5.8840789794921875,
"logps/rejected": -29.290557861328125,
"loss": 0.9034114480018616,
"memory(GiB)": 45.96,
"nll_loss": 0.33107179403305054,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.13439905643463135,
"rewards/margins": 0.5032773017883301,
"rewards/rejected": -0.36887818574905396,
"step": 14,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.028400686349920122,
"grad_norm": 2.141984701156616,
"learning_rate": 3.7500000000000003e-05,
"logits/chosen": -0.6251233816146851,
"logits/rejected": -0.6291872262954712,
"logps/chosen": -5.3556623458862305,
"logps/rejected": -22.30205535888672,
"loss": 0.7756511569023132,
"memory(GiB)": 45.96,
"nll_loss": 0.22363990545272827,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21060410141944885,
"rewards/margins": 0.5203964710235596,
"rewards/rejected": -0.30979233980178833,
"step": 15,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.030294065439914798,
"grad_norm": 6.157620906829834,
"learning_rate": 4e-05,
"logits/chosen": -0.6184762716293335,
"logits/rejected": -0.6184364557266235,
"logps/chosen": -10.368714332580566,
"logps/rejected": -12.033210754394531,
"loss": 1.4029701948165894,
"memory(GiB)": 45.96,
"nll_loss": 0.6103286743164062,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.020060203969478607,
"rewards/margins": -0.03359239548444748,
"rewards/rejected": 0.013532169163227081,
"step": 16,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.03218744452990947,
"grad_norm": 2.690070152282715,
"learning_rate": 4.25e-05,
"logits/chosen": -0.6329092383384705,
"logits/rejected": -0.6367439031600952,
"logps/chosen": -6.010343551635742,
"logps/rejected": -17.85470199584961,
"loss": 0.8949607610702515,
"memory(GiB)": 45.96,
"nll_loss": 0.3054018020629883,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.25051170587539673,
"rewards/margins": 0.37515202164649963,
"rewards/rejected": -0.12464030832052231,
"step": 17,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.034080823619904145,
"grad_norm": 2.8276467323303223,
"learning_rate": 4.5e-05,
"logits/chosen": -0.6264123320579529,
"logits/rejected": -0.6279273629188538,
"logps/chosen": -9.41238021850586,
"logps/rejected": -18.639442443847656,
"loss": 1.0180559158325195,
"memory(GiB)": 45.96,
"nll_loss": 0.3220836818218231,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.1841900646686554,
"rewards/margins": 0.13813874125480652,
"rewards/rejected": 0.04605132341384888,
"step": 18,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.035974202709898824,
"grad_norm": 2.10530161857605,
"learning_rate": 4.75e-05,
"logits/chosen": -0.6376557946205139,
"logits/rejected": -0.6416239738464355,
"logps/chosen": -5.7143964767456055,
"logps/rejected": -16.784849166870117,
"loss": 0.9154303669929504,
"memory(GiB)": 45.96,
"nll_loss": 0.2545720934867859,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.24181872606277466,
"rewards/margins": 0.18784700334072113,
"rewards/rejected": 0.05397173762321472,
"step": 19,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.037867581799893496,
"grad_norm": 2.357306480407715,
"learning_rate": 5e-05,
"logits/chosen": -0.6326904296875,
"logits/rejected": -0.6354666352272034,
"logps/chosen": -5.867492198944092,
"logps/rejected": -13.818038940429688,
"loss": 0.9468417167663574,
"memory(GiB)": 45.96,
"nll_loss": 0.3124926686286926,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.3217320740222931,
"rewards/margins": 0.22124268114566803,
"rewards/rejected": 0.10048942267894745,
"step": 20,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.039760960889888175,
"grad_norm": 2.5859196186065674,
"learning_rate": 5.25e-05,
"logits/chosen": -0.6597320437431335,
"logits/rejected": -0.6610896587371826,
"logps/chosen": -7.943680286407471,
"logps/rejected": -11.634421348571777,
"loss": 1.0064345598220825,
"memory(GiB)": 45.96,
"nll_loss": 0.3732220232486725,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3646732270717621,
"rewards/margins": 0.21462492644786835,
"rewards/rejected": 0.15004827082157135,
"step": 21,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.04165433997988285,
"grad_norm": 2.20487642288208,
"learning_rate": 5.500000000000001e-05,
"logits/chosen": -0.6439244151115417,
"logits/rejected": -0.6464219093322754,
"logps/chosen": -4.180229187011719,
"logps/rejected": -19.56499481201172,
"loss": 0.9136227369308472,
"memory(GiB)": 45.96,
"nll_loss": 0.22558730840682983,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.25369688868522644,
"rewards/margins": 0.14792592823505402,
"rewards/rejected": 0.10577096790075302,
"step": 22,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.04354771906987752,
"grad_norm": 2.80965518951416,
"learning_rate": 5.7499999999999995e-05,
"logits/chosen": -0.5748096108436584,
"logits/rejected": -0.5799225568771362,
"logps/chosen": -5.921882629394531,
"logps/rejected": -22.432538986206055,
"loss": 0.9860997796058655,
"memory(GiB)": 45.96,
"nll_loss": 0.3462521731853485,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.24639810621738434,
"rewards/margins": 0.1898707151412964,
"rewards/rejected": 0.05652741342782974,
"step": 23,
"train_speed(iter/s)": 0.005621
},
{
"epoch": 0.0454410981598722,
"grad_norm": 2.9503355026245117,
"learning_rate": 6e-05,
"logits/chosen": -0.6007645726203918,
"logits/rejected": -0.6086101531982422,
"logps/chosen": -5.338952541351318,
"logps/rejected": -26.883895874023438,
"loss": 0.9453619122505188,
"memory(GiB)": 45.96,
"nll_loss": 0.3667706847190857,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.392182856798172,
"rewards/margins": 0.36902523040771484,
"rewards/rejected": 0.02315761335194111,
"step": 24,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.04733447724986687,
"grad_norm": 2.2843515872955322,
"learning_rate": 6.25e-05,
"logits/chosen": -0.6047165393829346,
"logits/rejected": -0.608917772769928,
"logps/chosen": -6.276377201080322,
"logps/rejected": -21.095470428466797,
"loss": 0.914051353931427,
"memory(GiB)": 45.96,
"nll_loss": 0.3292374610900879,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3036147356033325,
"rewards/margins": 0.32923099398612976,
"rewards/rejected": -0.025616232305765152,
"step": 25,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.04922785633986155,
"grad_norm": 2.7294957637786865,
"learning_rate": 6.500000000000001e-05,
"logits/chosen": -0.6337023377418518,
"logits/rejected": -0.6374361515045166,
"logps/chosen": -7.032902240753174,
"logps/rejected": -24.937816619873047,
"loss": 0.8451516032218933,
"memory(GiB)": 45.96,
"nll_loss": 0.25359871983528137,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.24989479780197144,
"rewards/margins": 0.3727536201477051,
"rewards/rejected": -0.12285882234573364,
"step": 26,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.05112123542985622,
"grad_norm": 1.9816867113113403,
"learning_rate": 6.750000000000001e-05,
"logits/chosen": -0.6674913167953491,
"logits/rejected": -0.6716790795326233,
"logps/chosen": -3.894029378890991,
"logps/rejected": -19.461292266845703,
"loss": 0.720669686794281,
"memory(GiB)": 45.96,
"nll_loss": 0.1943943053483963,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.40334552526474,
"rewards/margins": 0.5223954319953918,
"rewards/rejected": -0.11904986202716827,
"step": 27,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.05301461451985089,
"grad_norm": 1.9561638832092285,
"learning_rate": 7e-05,
"logits/chosen": -0.6560395359992981,
"logits/rejected": -0.6615370512008667,
"logps/chosen": -3.828300952911377,
"logps/rejected": -27.646583557128906,
"loss": 0.7324035167694092,
"memory(GiB)": 45.96,
"nll_loss": 0.18986308574676514,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2855417728424072,
"rewards/margins": 0.5658388733863831,
"rewards/rejected": -0.28029707074165344,
"step": 28,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.05490799360984557,
"grad_norm": 2.197960376739502,
"learning_rate": 7.25e-05,
"logits/chosen": -0.6013461351394653,
"logits/rejected": -0.6078683733940125,
"logps/chosen": -5.841001987457275,
"logps/rejected": -28.59882926940918,
"loss": 0.763361930847168,
"memory(GiB)": 45.96,
"nll_loss": 0.29682645201683044,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.33854252099990845,
"rewards/margins": 0.7552333474159241,
"rewards/rejected": -0.416690856218338,
"step": 29,
"train_speed(iter/s)": 0.005603
},
{
"epoch": 0.056801372699840244,
"grad_norm": 4.102924823760986,
"learning_rate": 7.500000000000001e-05,
"logits/chosen": -0.6362655758857727,
"logits/rejected": -0.6371059417724609,
"logps/chosen": -6.047646522521973,
"logps/rejected": -16.402286529541016,
"loss": 0.930861234664917,
"memory(GiB)": 45.96,
"nll_loss": 0.33219844102859497,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2280413955450058,
"rewards/margins": 0.48401153087615967,
"rewards/rejected": -0.25597015023231506,
"step": 30,
"train_speed(iter/s)": 0.005604
},
{
"epoch": 0.05869475178983492,
"grad_norm": 2.643806219100952,
"learning_rate": 7.75e-05,
"logits/chosen": -0.6917952299118042,
"logits/rejected": -0.6954830884933472,
"logps/chosen": -4.5008368492126465,
"logps/rejected": -25.313228607177734,
"loss": 0.7698233127593994,
"memory(GiB)": 45.96,
"nll_loss": 0.21702390909194946,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2267376184463501,
"rewards/margins": 0.6824056506156921,
"rewards/rejected": -0.4556680917739868,
"step": 31,
"train_speed(iter/s)": 0.005603
},
{
"epoch": 0.060588130879829595,
"grad_norm": 3.9089903831481934,
"learning_rate": 8e-05,
"logits/chosen": -0.6848002672195435,
"logits/rejected": -0.6877056360244751,
"logps/chosen": -9.047338485717773,
"logps/rejected": -25.891061782836914,
"loss": 0.9844011068344116,
"memory(GiB)": 45.96,
"nll_loss": 0.3213033378124237,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.13390681147575378,
"rewards/margins": 0.6111294031143188,
"rewards/rejected": -0.4772225618362427,
"step": 32,
"train_speed(iter/s)": 0.005603
},
{
"epoch": 0.062481509969824274,
"grad_norm": 3.631053924560547,
"learning_rate": 8.25e-05,
"logits/chosen": -0.6787916421890259,
"logits/rejected": -0.681725025177002,
"logps/chosen": -11.23558521270752,
"logps/rejected": -24.226280212402344,
"loss": 1.1201726198196411,
"memory(GiB)": 45.96,
"nll_loss": 0.5571246147155762,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2192046195268631,
"rewards/margins": 0.6016167402267456,
"rewards/rejected": -0.3824121356010437,
"step": 33,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.06437488905981895,
"grad_norm": 2.667919158935547,
"learning_rate": 8.5e-05,
"logits/chosen": -0.7005462646484375,
"logits/rejected": -0.7055037021636963,
"logps/chosen": -3.1784541606903076,
"logps/rejected": -23.535545349121094,
"loss": 0.638558566570282,
"memory(GiB)": 45.96,
"nll_loss": 0.23515944182872772,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.27606871724128723,
"rewards/margins": 1.0784178972244263,
"rewards/rejected": -0.8023491501808167,
"step": 34,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.06626826814981363,
"grad_norm": 4.037520408630371,
"learning_rate": 8.75e-05,
"logits/chosen": -0.7001099586486816,
"logits/rejected": -0.7051636576652527,
"logps/chosen": -6.665594577789307,
"logps/rejected": -30.973716735839844,
"loss": 0.848934531211853,
"memory(GiB)": 45.96,
"nll_loss": 0.38612014055252075,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15037909150123596,
"rewards/margins": 1.0571930408477783,
"rewards/rejected": -0.9068138599395752,
"step": 35,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.06816164723980829,
"grad_norm": 3.6542232036590576,
"learning_rate": 9e-05,
"logits/chosen": -0.7070563435554504,
"logits/rejected": -0.7053466439247131,
"logps/chosen": -5.064585208892822,
"logps/rejected": -19.19178581237793,
"loss": 0.7724434733390808,
"memory(GiB)": 45.96,
"nll_loss": 0.26881077885627747,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2176203727722168,
"rewards/margins": 0.7342812418937683,
"rewards/rejected": -0.5166608095169067,
"step": 36,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.07005502632980297,
"grad_norm": 3.4213714599609375,
"learning_rate": 9.250000000000001e-05,
"logits/chosen": -0.7090893387794495,
"logits/rejected": -0.7106159329414368,
"logps/chosen": -10.25515365600586,
"logps/rejected": -24.033281326293945,
"loss": 0.9920384883880615,
"memory(GiB)": 45.96,
"nll_loss": 0.46471139788627625,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0965394526720047,
"rewards/margins": 0.8922154307365417,
"rewards/rejected": -0.7956759929656982,
"step": 37,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.07194840541979765,
"grad_norm": 5.325904846191406,
"learning_rate": 9.5e-05,
"logits/chosen": -0.657074511051178,
"logits/rejected": -0.6611977815628052,
"logps/chosen": -11.612046241760254,
"logps/rejected": -27.249744415283203,
"loss": 0.8334037065505981,
"memory(GiB)": 45.96,
"nll_loss": 0.3489510715007782,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12560953199863434,
"rewards/margins": 0.9447187781333923,
"rewards/rejected": -0.819109320640564,
"step": 38,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.07384178450979231,
"grad_norm": 2.9407873153686523,
"learning_rate": 9.75e-05,
"logits/chosen": -0.7148993611335754,
"logits/rejected": -0.7166731357574463,
"logps/chosen": -7.349883079528809,
"logps/rejected": -25.866724014282227,
"loss": 0.7971550822257996,
"memory(GiB)": 45.96,
"nll_loss": 0.3317265808582306,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1786963939666748,
"rewards/margins": 0.9361187815666199,
"rewards/rejected": -0.7574224472045898,
"step": 39,
"train_speed(iter/s)": 0.005621
},
{
"epoch": 0.07573516359978699,
"grad_norm": 7.271725654602051,
"learning_rate": 0.0001,
"logits/chosen": -0.6494594216346741,
"logits/rejected": -0.6519922018051147,
"logps/chosen": -10.921842575073242,
"logps/rejected": -26.213640213012695,
"loss": 1.3029272556304932,
"memory(GiB)": 45.96,
"nll_loss": 0.7071102261543274,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04726380109786987,
"rewards/margins": 0.7260035276412964,
"rewards/rejected": -0.6787396669387817,
"step": 40,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.07762854268978167,
"grad_norm": 2.3149876594543457,
"learning_rate": 0.0001025,
"logits/chosen": -0.6998907327651978,
"logits/rejected": -0.7039870023727417,
"logps/chosen": -4.173505783081055,
"logps/rejected": -23.617250442504883,
"loss": 0.5567827224731445,
"memory(GiB)": 45.96,
"nll_loss": 0.22731299698352814,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3785739839076996,
"rewards/margins": 1.2282123565673828,
"rewards/rejected": -0.8496384620666504,
"step": 41,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.07952192177977635,
"grad_norm": 2.81628155708313,
"learning_rate": 0.000105,
"logits/chosen": -0.7065268754959106,
"logits/rejected": -0.7109476923942566,
"logps/chosen": -7.945868492126465,
"logps/rejected": -28.209381103515625,
"loss": 0.9143926501274109,
"memory(GiB)": 45.96,
"nll_loss": 0.45929795503616333,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.14874038100242615,
"rewards/margins": 0.9704731702804565,
"rewards/rejected": -0.8217328786849976,
"step": 42,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.08141530086977102,
"grad_norm": 5.763336658477783,
"learning_rate": 0.0001075,
"logits/chosen": -0.6870285868644714,
"logits/rejected": -0.6968757510185242,
"logps/chosen": -5.37760066986084,
"logps/rejected": -30.209644317626953,
"loss": 1.0033479928970337,
"memory(GiB)": 45.96,
"nll_loss": 0.5952383279800415,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.25675737857818604,
"rewards/margins": 1.0465596914291382,
"rewards/rejected": -0.7898023128509521,
"step": 43,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.0833086799597657,
"grad_norm": 5.945868015289307,
"learning_rate": 0.00011000000000000002,
"logits/chosen": -0.6680281758308411,
"logits/rejected": -0.6685014963150024,
"logps/chosen": -11.777937889099121,
"logps/rejected": -14.195478439331055,
"loss": 1.2500255107879639,
"memory(GiB)": 45.96,
"nll_loss": 0.6744679808616638,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2654823362827301,
"rewards/margins": 0.44828659296035767,
"rewards/rejected": -0.18280424177646637,
"step": 44,
"train_speed(iter/s)": 0.005626
},
{
"epoch": 0.08520205904976037,
"grad_norm": 3.6887738704681396,
"learning_rate": 0.00011250000000000001,
"logits/chosen": -0.6420993804931641,
"logits/rejected": -0.649295449256897,
"logps/chosen": -5.845967769622803,
"logps/rejected": -29.958538055419922,
"loss": 0.8367453217506409,
"memory(GiB)": 45.96,
"nll_loss": 0.40336742997169495,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.25286757946014404,
"rewards/margins": 0.9195659160614014,
"rewards/rejected": -0.6666983962059021,
"step": 45,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.08709543813975504,
"grad_norm": 2.1550676822662354,
"learning_rate": 0.00011499999999999999,
"logits/chosen": -0.6583084464073181,
"logits/rejected": -0.6640565395355225,
"logps/chosen": -2.7918519973754883,
"logps/rejected": -30.053329467773438,
"loss": 0.6384420394897461,
"memory(GiB)": 45.96,
"nll_loss": 0.16433243453502655,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.33078277111053467,
"rewards/margins": 0.8035537004470825,
"rewards/rejected": -0.4727708697319031,
"step": 46,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.08898881722974972,
"grad_norm": 1.9267369508743286,
"learning_rate": 0.00011750000000000001,
"logits/chosen": -0.6443086266517639,
"logits/rejected": -0.6484851837158203,
"logps/chosen": -6.4907331466674805,
"logps/rejected": -26.10548973083496,
"loss": 0.8166890740394592,
"memory(GiB)": 45.96,
"nll_loss": 0.2826446294784546,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.33410829305648804,
"rewards/margins": 0.7130259275436401,
"rewards/rejected": -0.3789176642894745,
"step": 47,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.0908821963197444,
"grad_norm": 2.238929510116577,
"learning_rate": 0.00012,
"logits/chosen": -0.6500992774963379,
"logits/rejected": -0.6550747156143188,
"logps/chosen": -6.974908351898193,
"logps/rejected": -25.759687423706055,
"loss": 0.8363897800445557,
"memory(GiB)": 45.96,
"nll_loss": 0.26740241050720215,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.2779407501220703,
"rewards/margins": 0.71395343542099,
"rewards/rejected": -0.43601274490356445,
"step": 48,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.09277557540973908,
"grad_norm": 2.5497782230377197,
"learning_rate": 0.00012250000000000002,
"logits/chosen": -0.676102876663208,
"logits/rejected": -0.676883339881897,
"logps/chosen": -6.410519599914551,
"logps/rejected": -17.417396545410156,
"loss": 0.9155470728874207,
"memory(GiB)": 45.96,
"nll_loss": 0.3170667886734009,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.24874374270439148,
"rewards/margins": 0.6556647419929504,
"rewards/rejected": -0.40692102909088135,
"step": 49,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.09466895449973374,
"grad_norm": 2.275879144668579,
"learning_rate": 0.000125,
"logits/chosen": -0.6682412028312683,
"logits/rejected": -0.6694232225418091,
"logps/chosen": -7.84281587600708,
"logps/rejected": -18.11672019958496,
"loss": 0.8602735996246338,
"memory(GiB)": 45.96,
"nll_loss": 0.342671662569046,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.16426895558834076,
"rewards/margins": 0.6373977065086365,
"rewards/rejected": -0.47312870621681213,
"step": 50,
"train_speed(iter/s)": 0.005623
},
{
"epoch": 0.09656233358972842,
"grad_norm": 2.448835611343384,
"learning_rate": 0.0001275,
"logits/chosen": -0.7030003070831299,
"logits/rejected": -0.702628493309021,
"logps/chosen": -7.209776401519775,
"logps/rejected": -24.76384162902832,
"loss": 0.7324039340019226,
"memory(GiB)": 45.96,
"nll_loss": 0.22679060697555542,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2451048642396927,
"rewards/margins": 0.9410224556922913,
"rewards/rejected": -0.695917546749115,
"step": 51,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.0984557126797231,
"grad_norm": 2.4740657806396484,
"learning_rate": 0.00013000000000000002,
"logits/chosen": -0.7383002042770386,
"logits/rejected": -0.7460674047470093,
"logps/chosen": -4.4354424476623535,
"logps/rejected": -26.271957397460938,
"loss": 0.738042414188385,
"memory(GiB)": 45.96,
"nll_loss": 0.30589190125465393,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.35504794120788574,
"rewards/margins": 1.1514215469360352,
"rewards/rejected": -0.7963736057281494,
"step": 52,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.10034909176971776,
"grad_norm": 3.1427273750305176,
"learning_rate": 0.0001325,
"logits/chosen": -0.7910199165344238,
"logits/rejected": -0.7956037521362305,
"logps/chosen": -5.2786359786987305,
"logps/rejected": -27.01905632019043,
"loss": 0.7005700469017029,
"memory(GiB)": 45.96,
"nll_loss": 0.2977657616138458,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.32858696579933167,
"rewards/margins": 1.1505931615829468,
"rewards/rejected": -0.8220062255859375,
"step": 53,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.10224247085971244,
"grad_norm": 2.710829973220825,
"learning_rate": 0.00013500000000000003,
"logits/chosen": -0.7300952672958374,
"logits/rejected": -0.7392382621765137,
"logps/chosen": -4.204522132873535,
"logps/rejected": -35.52387237548828,
"loss": 0.5068414211273193,
"memory(GiB)": 45.96,
"nll_loss": 0.18188302218914032,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3228433430194855,
"rewards/margins": 1.5467703342437744,
"rewards/rejected": -1.2239267826080322,
"step": 54,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.10413584994970712,
"grad_norm": 2.6672115325927734,
"learning_rate": 0.0001375,
"logits/chosen": -0.7622752785682678,
"logits/rejected": -0.7692346572875977,
"logps/chosen": -5.656646728515625,
"logps/rejected": -36.99287033081055,
"loss": 0.6165193319320679,
"memory(GiB)": 45.96,
"nll_loss": 0.2455344796180725,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21251262724399567,
"rewards/margins": 1.7865149974822998,
"rewards/rejected": -1.5740022659301758,
"step": 55,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.10602922903970179,
"grad_norm": 7.261322975158691,
"learning_rate": 0.00014,
"logits/chosen": -0.8227823376655579,
"logits/rejected": -0.8353255391120911,
"logps/chosen": -7.420350551605225,
"logps/rejected": -42.59074401855469,
"loss": 0.8744301199913025,
"memory(GiB)": 45.96,
"nll_loss": 0.49042099714279175,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.23873600363731384,
"rewards/margins": 2.152242422103882,
"rewards/rejected": -1.9135063886642456,
"step": 56,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.10792260812969647,
"grad_norm": 3.6271088123321533,
"learning_rate": 0.00014250000000000002,
"logits/chosen": -0.8145865201950073,
"logits/rejected": -0.8213882446289062,
"logps/chosen": -4.568179130554199,
"logps/rejected": -37.50999450683594,
"loss": 0.6209616661071777,
"memory(GiB)": 45.96,
"nll_loss": 0.29730865359306335,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26820147037506104,
"rewards/margins": 2.114492893218994,
"rewards/rejected": -1.8462913036346436,
"step": 57,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.10981598721969114,
"grad_norm": 3.6261045932769775,
"learning_rate": 0.000145,
"logits/chosen": -0.7670393586158752,
"logits/rejected": -0.7794223427772522,
"logps/chosen": -8.460503578186035,
"logps/rejected": -43.186954498291016,
"loss": 0.6528911590576172,
"memory(GiB)": 45.96,
"nll_loss": 0.30593881011009216,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.28572511672973633,
"rewards/margins": 2.0398354530334473,
"rewards/rejected": -1.75411057472229,
"step": 58,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.11170936630968582,
"grad_norm": 2.79728364944458,
"learning_rate": 0.0001475,
"logits/chosen": -0.8239770531654358,
"logits/rejected": -0.8207590579986572,
"logps/chosen": -12.058256149291992,
"logps/rejected": -25.070674896240234,
"loss": 0.8349239230155945,
"memory(GiB)": 45.96,
"nll_loss": 0.4342367947101593,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2961112856864929,
"rewards/margins": 1.2313449382781982,
"rewards/rejected": -0.9352336525917053,
"step": 59,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.11360274539968049,
"grad_norm": 3.0574796199798584,
"learning_rate": 0.00015000000000000001,
"logits/chosen": -0.810753345489502,
"logits/rejected": -0.8193599581718445,
"logps/chosen": -5.105385780334473,
"logps/rejected": -29.203344345092773,
"loss": 0.6070073843002319,
"memory(GiB)": 45.96,
"nll_loss": 0.24924401938915253,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.5035626292228699,
"rewards/margins": 1.4562283754348755,
"rewards/rejected": -0.9526655077934265,
"step": 60,
"train_speed(iter/s)": 0.005609
},
{
"epoch": 0.11549612448967517,
"grad_norm": 5.350250720977783,
"learning_rate": 0.0001525,
"logits/chosen": -0.815939724445343,
"logits/rejected": -0.826446533203125,
"logps/chosen": -2.3785085678100586,
"logps/rejected": -34.224422454833984,
"loss": 0.7174049019813538,
"memory(GiB)": 45.96,
"nll_loss": 0.38427019119262695,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.4009089469909668,
"rewards/margins": 1.891708254814148,
"rewards/rejected": -1.4907994270324707,
"step": 61,
"train_speed(iter/s)": 0.005608
},
{
"epoch": 0.11738950357966985,
"grad_norm": 2.239091157913208,
"learning_rate": 0.000155,
"logits/chosen": -0.8229139447212219,
"logits/rejected": -0.8320141434669495,
"logps/chosen": -4.586618900299072,
"logps/rejected": -32.01433181762695,
"loss": 0.6079644560813904,
"memory(GiB)": 45.96,
"nll_loss": 0.20739667117595673,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26031073927879333,
"rewards/margins": 1.4821346998214722,
"rewards/rejected": -1.2218239307403564,
"step": 62,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.11928288266966451,
"grad_norm": 4.1209940910339355,
"learning_rate": 0.0001575,
"logits/chosen": -0.8513484597206116,
"logits/rejected": -0.8552687168121338,
"logps/chosen": -9.33289909362793,
"logps/rejected": -29.56768226623535,
"loss": 1.0120337009429932,
"memory(GiB)": 45.96,
"nll_loss": 0.4378553628921509,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.14417365193367004,
"rewards/margins": 1.3170634508132935,
"rewards/rejected": -1.1728898286819458,
"step": 63,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.12117626175965919,
"grad_norm": 4.230152606964111,
"learning_rate": 0.00016,
"logits/chosen": -0.7943696975708008,
"logits/rejected": -0.8050058484077454,
"logps/chosen": -6.4711594581604,
"logps/rejected": -42.82871627807617,
"loss": 0.5924439430236816,
"memory(GiB)": 45.96,
"nll_loss": 0.23330256342887878,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16898760199546814,
"rewards/margins": 1.992952585220337,
"rewards/rejected": -1.823965072631836,
"step": 64,
"train_speed(iter/s)": 0.00561
},
{
"epoch": 0.12306964084965387,
"grad_norm": 2.351702928543091,
"learning_rate": 0.00016250000000000002,
"logits/chosen": -0.8158823251724243,
"logits/rejected": -0.8219522833824158,
"logps/chosen": -4.3665313720703125,
"logps/rejected": -28.09051513671875,
"loss": 0.7134827375411987,
"memory(GiB)": 45.96,
"nll_loss": 0.22144050896167755,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.3041003942489624,
"rewards/margins": 1.2433838844299316,
"rewards/rejected": -0.9392834305763245,
"step": 65,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.12496301993964855,
"grad_norm": 3.1737756729125977,
"learning_rate": 0.000165,
"logits/chosen": -0.8072597980499268,
"logits/rejected": -0.8171340823173523,
"logps/chosen": -5.0343122482299805,
"logps/rejected": -32.46968460083008,
"loss": 0.63325434923172,
"memory(GiB)": 45.96,
"nll_loss": 0.29483139514923096,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.29814648628234863,
"rewards/margins": 1.4677376747131348,
"rewards/rejected": -1.1695910692214966,
"step": 66,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.1268563990296432,
"grad_norm": 2.5199668407440186,
"learning_rate": 0.0001675,
"logits/chosen": -0.8106119632720947,
"logits/rejected": -0.8191246390342712,
"logps/chosen": -8.389342308044434,
"logps/rejected": -36.18731689453125,
"loss": 0.7148120403289795,
"memory(GiB)": 45.96,
"nll_loss": 0.31000831723213196,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2828730642795563,
"rewards/margins": 1.7046067714691162,
"rewards/rejected": -1.4217336177825928,
"step": 67,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.1287497781196379,
"grad_norm": 3.428029775619507,
"learning_rate": 0.00017,
"logits/chosen": -0.8391574621200562,
"logits/rejected": -0.8546858429908752,
"logps/chosen": -8.799811363220215,
"logps/rejected": -37.64997863769531,
"loss": 0.7224959135055542,
"memory(GiB)": 45.96,
"nll_loss": 0.4090877175331116,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3909546434879303,
"rewards/margins": 1.7023922204971313,
"rewards/rejected": -1.3114374876022339,
"step": 68,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.13064315720963257,
"grad_norm": 3.7791826725006104,
"learning_rate": 0.00017250000000000002,
"logits/chosen": -0.8618558049201965,
"logits/rejected": -0.86772221326828,
"logps/chosen": -8.02017879486084,
"logps/rejected": -28.318117141723633,
"loss": 0.8481130003929138,
"memory(GiB)": 45.96,
"nll_loss": 0.32193318009376526,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.07287055253982544,
"rewards/margins": 1.3111273050308228,
"rewards/rejected": -1.2382566928863525,
"step": 69,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.13253653629962725,
"grad_norm": 3.5219051837921143,
"learning_rate": 0.000175,
"logits/chosen": -0.8731855154037476,
"logits/rejected": -0.8781698346138,
"logps/chosen": -8.205753326416016,
"logps/rejected": -23.05510902404785,
"loss": 0.9284813404083252,
"memory(GiB)": 45.96,
"nll_loss": 0.4099024832248688,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.26493778824806213,
"rewards/margins": 1.1318817138671875,
"rewards/rejected": -0.866943895816803,
"step": 70,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.13442991538962193,
"grad_norm": 2.412374973297119,
"learning_rate": 0.0001775,
"logits/chosen": -0.8586634993553162,
"logits/rejected": -0.8701040744781494,
"logps/chosen": -3.7027158737182617,
"logps/rejected": -42.672996520996094,
"loss": 0.5218284130096436,
"memory(GiB)": 45.96,
"nll_loss": 0.2169719785451889,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.371543824672699,
"rewards/margins": 2.3614425659179688,
"rewards/rejected": -1.989898920059204,
"step": 71,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.13632329447961658,
"grad_norm": 1.723345160484314,
"learning_rate": 0.00018,
"logits/chosen": -0.8107991814613342,
"logits/rejected": -0.8227972388267517,
"logps/chosen": -4.743021488189697,
"logps/rejected": -38.795711517333984,
"loss": 0.4607815742492676,
"memory(GiB)": 45.96,
"nll_loss": 0.18950311839580536,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.36083462834358215,
"rewards/margins": 2.311211585998535,
"rewards/rejected": -1.9503768682479858,
"step": 72,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.13821667356961126,
"grad_norm": 4.164133548736572,
"learning_rate": 0.0001825,
"logits/chosen": -0.9086084365844727,
"logits/rejected": -0.9208739995956421,
"logps/chosen": -13.34437084197998,
"logps/rejected": -53.04572296142578,
"loss": 0.6920671463012695,
"memory(GiB)": 45.96,
"nll_loss": 0.43207526206970215,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.031513512134552,
"rewards/margins": 3.146587371826172,
"rewards/rejected": -3.1150739192962646,
"step": 73,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.14011005265960594,
"grad_norm": 6.1999382972717285,
"learning_rate": 0.00018500000000000002,
"logits/chosen": -0.8234269618988037,
"logits/rejected": -0.8303597569465637,
"logps/chosen": -8.394856452941895,
"logps/rejected": -41.975399017333984,
"loss": 1.1737077236175537,
"memory(GiB)": 45.96,
"nll_loss": 0.7135495543479919,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14376360177993774,
"rewards/margins": 2.6206157207489014,
"rewards/rejected": -2.4768521785736084,
"step": 74,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.14200343174960062,
"grad_norm": 6.218433856964111,
"learning_rate": 0.0001875,
"logits/chosen": -0.8009334802627563,
"logits/rejected": -0.8051450848579407,
"logps/chosen": -12.022541046142578,
"logps/rejected": -38.48487091064453,
"loss": 0.9869168400764465,
"memory(GiB)": 45.96,
"nll_loss": 0.45167890191078186,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.010723039507865906,
"rewards/margins": 1.8775376081466675,
"rewards/rejected": -1.8882607221603394,
"step": 75,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.1438968108395953,
"grad_norm": 1.9325371980667114,
"learning_rate": 0.00019,
"logits/chosen": -0.7815489768981934,
"logits/rejected": -0.7896750569343567,
"logps/chosen": -6.42656946182251,
"logps/rejected": -33.38284683227539,
"loss": 0.6605334281921387,
"memory(GiB)": 45.96,
"nll_loss": 0.30029603838920593,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31539270281791687,
"rewards/margins": 1.6843116283416748,
"rewards/rejected": -1.368919014930725,
"step": 76,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.14579018992958998,
"grad_norm": 5.768399238586426,
"learning_rate": 0.00019250000000000002,
"logits/chosen": -0.7157012820243835,
"logits/rejected": -0.7218092679977417,
"logps/chosen": -5.720545291900635,
"logps/rejected": -32.14387512207031,
"loss": 0.9388673901557922,
"memory(GiB)": 45.96,
"nll_loss": 0.49579885601997375,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2496451437473297,
"rewards/margins": 1.3803541660308838,
"rewards/rejected": -1.130708932876587,
"step": 77,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.14768356901958463,
"grad_norm": 2.978989601135254,
"learning_rate": 0.000195,
"logits/chosen": -0.7398240566253662,
"logits/rejected": -0.74552983045578,
"logps/chosen": -6.459310054779053,
"logps/rejected": -28.873746871948242,
"loss": 0.6721470952033997,
"memory(GiB)": 45.96,
"nll_loss": 0.2696229815483093,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.28077179193496704,
"rewards/margins": 1.547407865524292,
"rewards/rejected": -1.2666360139846802,
"step": 78,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.1495769481095793,
"grad_norm": 2.109548568725586,
"learning_rate": 0.00019750000000000003,
"logits/chosen": -0.7017478942871094,
"logits/rejected": -0.7096887826919556,
"logps/chosen": -4.097768783569336,
"logps/rejected": -31.799213409423828,
"loss": 0.5941745042800903,
"memory(GiB)": 45.96,
"nll_loss": 0.19475214183330536,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.4046904742717743,
"rewards/margins": 1.6549233198165894,
"rewards/rejected": -1.2502328157424927,
"step": 79,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.15147032719957398,
"grad_norm": 3.9734411239624023,
"learning_rate": 0.0002,
"logits/chosen": -0.6862869262695312,
"logits/rejected": -0.6942235827445984,
"logps/chosen": -8.900280952453613,
"logps/rejected": -41.978641510009766,
"loss": 0.7803151607513428,
"memory(GiB)": 45.96,
"nll_loss": 0.3115917146205902,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1415846347808838,
"rewards/margins": 2.006580352783203,
"rewards/rejected": -1.8649954795837402,
"step": 80,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.15336370628956866,
"grad_norm": 6.735928535461426,
"learning_rate": 0.00019999978184060562,
"logits/chosen": -0.7448083162307739,
"logits/rejected": -0.7499798536300659,
"logps/chosen": -5.58134126663208,
"logps/rejected": -42.04484939575195,
"loss": 0.9395004510879517,
"memory(GiB)": 45.96,
"nll_loss": 0.515042245388031,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.24552975594997406,
"rewards/margins": 2.421520233154297,
"rewards/rejected": -2.175990343093872,
"step": 81,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.15525708537956334,
"grad_norm": 4.143361568450928,
"learning_rate": 0.00019999912736337437,
"logits/chosen": -0.7276468873023987,
"logits/rejected": -0.741879940032959,
"logps/chosen": -3.295543670654297,
"logps/rejected": -54.32012939453125,
"loss": 0.660046398639679,
"memory(GiB)": 45.96,
"nll_loss": 0.42805707454681396,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2942177951335907,
"rewards/margins": 3.302980661392212,
"rewards/rejected": -3.008762836456299,
"step": 82,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.15715046446955802,
"grad_norm": 4.713730812072754,
"learning_rate": 0.00019999803657116188,
"logits/chosen": -0.7310099601745605,
"logits/rejected": -0.7400019764900208,
"logps/chosen": -6.529958248138428,
"logps/rejected": -39.906105041503906,
"loss": 0.7617413997650146,
"memory(GiB)": 45.96,
"nll_loss": 0.422638475894928,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2212720513343811,
"rewards/margins": 2.413503885269165,
"rewards/rejected": -2.1922316551208496,
"step": 83,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.1590438435595527,
"grad_norm": 4.658056735992432,
"learning_rate": 0.00019999650946872738,
"logits/chosen": -0.7134297490119934,
"logits/rejected": -0.7193505764007568,
"logps/chosen": -5.202678680419922,
"logps/rejected": -33.255706787109375,
"loss": 0.6914293766021729,
"memory(GiB)": 45.96,
"nll_loss": 0.2725370526313782,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.29689377546310425,
"rewards/margins": 1.9401971101760864,
"rewards/rejected": -1.6433032751083374,
"step": 84,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.16093722264954735,
"grad_norm": 2.288125991821289,
"learning_rate": 0.00019999454606273404,
"logits/chosen": -0.6521891951560974,
"logits/rejected": -0.6597902774810791,
"logps/chosen": -6.535229206085205,
"logps/rejected": -33.92669677734375,
"loss": 0.5946552157402039,
"memory(GiB)": 45.96,
"nll_loss": 0.29953494668006897,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3503923714160919,
"rewards/margins": 1.96759831905365,
"rewards/rejected": -1.61720609664917,
"step": 85,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.16283060173954203,
"grad_norm": 6.193369388580322,
"learning_rate": 0.00019999214636174845,
"logits/chosen": -0.7137624025344849,
"logits/rejected": -0.7180912494659424,
"logps/chosen": -6.647699356079102,
"logps/rejected": -31.25023078918457,
"loss": 0.9301581382751465,
"memory(GiB)": 45.96,
"nll_loss": 0.46883538365364075,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.29692143201828003,
"rewards/margins": 1.745566964149475,
"rewards/rejected": -1.4486457109451294,
"step": 86,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.1647239808295367,
"grad_norm": 3.9115772247314453,
"learning_rate": 0.00019998931037624104,
"logits/chosen": -0.6435313820838928,
"logits/rejected": -0.6480632424354553,
"logps/chosen": -6.559725284576416,
"logps/rejected": -34.3360481262207,
"loss": 0.7339984178543091,
"memory(GiB)": 45.96,
"nll_loss": 0.3988235890865326,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2545357048511505,
"rewards/margins": 1.8583070039749146,
"rewards/rejected": -1.603771448135376,
"step": 87,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.1666173599195314,
"grad_norm": 2.725975751876831,
"learning_rate": 0.00019998603811858571,
"logits/chosen": -0.6484612822532654,
"logits/rejected": -0.6513442993164062,
"logps/chosen": -5.939992427825928,
"logps/rejected": -30.691526412963867,
"loss": 0.6261233687400818,
"memory(GiB)": 45.96,
"nll_loss": 0.30717653036117554,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3799961507320404,
"rewards/margins": 1.8060214519500732,
"rewards/rejected": -1.426025390625,
"step": 88,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.16851073900952607,
"grad_norm": 3.1483325958251953,
"learning_rate": 0.00019998232960305993,
"logits/chosen": -0.640424907207489,
"logits/rejected": -0.6445133090019226,
"logps/chosen": -10.158927917480469,
"logps/rejected": -31.649131774902344,
"loss": 0.7713112235069275,
"memory(GiB)": 45.96,
"nll_loss": 0.4013857841491699,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2583284080028534,
"rewards/margins": 1.7178279161453247,
"rewards/rejected": -1.4594995975494385,
"step": 89,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.17040411809952075,
"grad_norm": 9.671393394470215,
"learning_rate": 0.0001999781848458447,
"logits/chosen": -0.6384307146072388,
"logits/rejected": -0.6467083692550659,
"logps/chosen": -5.6327433586120605,
"logps/rejected": -33.724124908447266,
"loss": 1.136250615119934,
"memory(GiB)": 45.96,
"nll_loss": 0.6182616353034973,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12717147171497345,
"rewards/margins": 1.5072848796844482,
"rewards/rejected": -1.3801133632659912,
"step": 90,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.17229749718951543,
"grad_norm": 3.9667158126831055,
"learning_rate": 0.0001999736038650243,
"logits/chosen": -0.6727519035339355,
"logits/rejected": -0.678146243095398,
"logps/chosen": -3.9062070846557617,
"logps/rejected": -40.605716705322266,
"loss": 0.5808683633804321,
"memory(GiB)": 45.96,
"nll_loss": 0.29070931673049927,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3750736713409424,
"rewards/margins": 2.2590668201446533,
"rewards/rejected": -1.883993148803711,
"step": 91,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.17419087627951008,
"grad_norm": 2.966646909713745,
"learning_rate": 0.00019996858668058646,
"logits/chosen": -0.6560570597648621,
"logits/rejected": -0.6633113622665405,
"logps/chosen": -6.821100234985352,
"logps/rejected": -35.842308044433594,
"loss": 0.5389344096183777,
"memory(GiB)": 45.96,
"nll_loss": 0.22853048145771027,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.33146628737449646,
"rewards/margins": 2.221740484237671,
"rewards/rejected": -1.8902742862701416,
"step": 92,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.17608425536950476,
"grad_norm": 4.352930068969727,
"learning_rate": 0.0001999631333144221,
"logits/chosen": -0.6744297742843628,
"logits/rejected": -0.6817238926887512,
"logps/chosen": -10.121214866638184,
"logps/rejected": -45.07015609741211,
"loss": 0.7165765166282654,
"memory(GiB)": 45.96,
"nll_loss": 0.36157098412513733,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3100533187389374,
"rewards/margins": 2.3896117210388184,
"rewards/rejected": -2.0795583724975586,
"step": 93,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.17797763445949943,
"grad_norm": 3.650033473968506,
"learning_rate": 0.00019995724379032526,
"logits/chosen": -0.6463199257850647,
"logits/rejected": -0.6561610102653503,
"logps/chosen": -5.5554704666137695,
"logps/rejected": -39.192264556884766,
"loss": 0.7099438309669495,
"memory(GiB)": 45.96,
"nll_loss": 0.3186087906360626,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28469714522361755,
"rewards/margins": 2.1725757122039795,
"rewards/rejected": -1.887878656387329,
"step": 94,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.1798710135494941,
"grad_norm": 3.6392762660980225,
"learning_rate": 0.00019995091813399305,
"logits/chosen": -0.6218971014022827,
"logits/rejected": -0.6236589550971985,
"logps/chosen": -9.031105041503906,
"logps/rejected": -29.54071044921875,
"loss": 0.7348965406417847,
"memory(GiB)": 45.96,
"nll_loss": 0.35691019892692566,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3281153440475464,
"rewards/margins": 1.6330987215042114,
"rewards/rejected": -1.3049836158752441,
"step": 95,
"train_speed(iter/s)": 0.005611
},
{
"epoch": 0.1817643926394888,
"grad_norm": 4.513101100921631,
"learning_rate": 0.00019994415637302547,
"logits/chosen": -0.6518260836601257,
"logits/rejected": -0.6591805815696716,
"logps/chosen": -3.454824447631836,
"logps/rejected": -40.539100646972656,
"loss": 0.4428410232067108,
"memory(GiB)": 45.96,
"nll_loss": 0.16427120566368103,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29650911688804626,
"rewards/margins": 1.9197403192520142,
"rewards/rejected": -1.623231053352356,
"step": 96,
"train_speed(iter/s)": 0.005612
},
{
"epoch": 0.18365777172948347,
"grad_norm": 3.081139087677002,
"learning_rate": 0.00019993695853692537,
"logits/chosen": -0.6301771402359009,
"logits/rejected": -0.6361221671104431,
"logps/chosen": -5.919186592102051,
"logps/rejected": -33.726078033447266,
"loss": 0.6770766377449036,
"memory(GiB)": 45.96,
"nll_loss": 0.3173068165779114,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.288848340511322,
"rewards/margins": 1.7297114133834839,
"rewards/rejected": -1.4408631324768066,
"step": 97,
"train_speed(iter/s)": 0.005613
},
{
"epoch": 0.18555115081947815,
"grad_norm": 5.967331409454346,
"learning_rate": 0.0001999293246570983,
"logits/chosen": -0.6614546179771423,
"logits/rejected": -0.6638529300689697,
"logps/chosen": -6.57697057723999,
"logps/rejected": -30.82279396057129,
"loss": 0.6938097476959229,
"memory(GiB)": 45.96,
"nll_loss": 0.23730693757534027,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.24900805950164795,
"rewards/margins": 1.5996767282485962,
"rewards/rejected": -1.3506686687469482,
"step": 98,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.1874445299094728,
"grad_norm": 2.659550428390503,
"learning_rate": 0.0001999212547668523,
"logits/chosen": -0.6610513925552368,
"logits/rejected": -0.6650281548500061,
"logps/chosen": -7.570089817047119,
"logps/rejected": -41.5615348815918,
"loss": 0.521258533000946,
"memory(GiB)": 45.96,
"nll_loss": 0.34517771005630493,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28127947449684143,
"rewards/margins": 2.645756244659424,
"rewards/rejected": -2.3644769191741943,
"step": 99,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.18933790899946748,
"grad_norm": 12.499390602111816,
"learning_rate": 0.00019991274890139774,
"logits/chosen": -0.5981582403182983,
"logits/rejected": -0.5984249114990234,
"logps/chosen": -5.772880554199219,
"logps/rejected": -36.335723876953125,
"loss": 0.5674217939376831,
"memory(GiB)": 45.96,
"nll_loss": 0.3134133517742157,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3456924557685852,
"rewards/margins": 2.240718364715576,
"rewards/rejected": -1.8950259685516357,
"step": 100,
"train_speed(iter/s)": 0.005613
}
],
"logging_steps": 1,
"max_steps": 1584,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7.025223996853453e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}