{ "best_global_step": 600, "best_metric": 0.30104092, "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task2_dpo_absgt0_taskgt5__pari0.3_no_cheat/v0-20250606-011515/checkpoint-600", "epoch": 1.418436778888823, "eval_steps": 300, "global_step": 750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0018933790899946748, "grad_norm": 12.48285961151123, "learning_rate": 2.5e-06, "logits/chosen": -0.600911557674408, "logits/rejected": -0.6057144403457642, "logps/chosen": -8.623997688293457, "logps/rejected": -21.27922248840332, "loss": 1.5083240270614624, "memory(GiB)": 45.96, "nll_loss": 0.8151768445968628, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005677 }, { "epoch": 0.0037867581799893497, "grad_norm": 12.232138633728027, "learning_rate": 5e-06, "logits/chosen": -0.6421620845794678, "logits/rejected": -0.6454498767852783, "logps/chosen": -10.60006046295166, "logps/rejected": -13.605328559875488, "loss": 1.547582983970642, "memory(GiB)": 45.96, "nll_loss": 0.8544361591339111, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005654 }, { "epoch": 0.005680137269984025, "grad_norm": 14.417566299438477, "learning_rate": 7.5e-06, "logits/chosen": -0.664191484451294, "logits/rejected": -0.6654082536697388, "logps/chosen": -11.958788871765137, "logps/rejected": -13.785713195800781, "loss": 1.6179333925247192, "memory(GiB)": 45.96, "nll_loss": 0.9271513819694519, "rewards/accuracies": 0.59375, "rewards/chosen": 0.003109893761575222, "rewards/margins": 0.0048811971209943295, "rewards/rejected": -0.0017713033594191074, "step": 3, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.007573516359978699, "grad_norm": 8.840044975280762, "learning_rate": 1e-05, "logits/chosen": -0.6362882256507874, "logits/rejected": -0.6385632753372192, "logps/chosen": -9.689570426940918, "logps/rejected": -18.226909637451172, "loss": 1.4001612663269043, "memory(GiB)": 45.96, "nll_loss": 0.7101836204528809, "rewards/accuracies": 0.59375, "rewards/chosen": 0.005959533154964447, "rewards/margins": 0.00653040548786521, "rewards/rejected": -0.0005708730313926935, "step": 4, "train_speed(iter/s)": 0.005654 }, { "epoch": 0.009466895449973374, "grad_norm": 12.643730163574219, "learning_rate": 1.25e-05, "logits/chosen": -0.6108935475349426, "logits/rejected": -0.6125737428665161, "logps/chosen": -10.900370597839355, "logps/rejected": -16.267436981201172, "loss": 1.5408352613449097, "memory(GiB)": 45.96, "nll_loss": 0.853638768196106, "rewards/accuracies": 0.6875, "rewards/chosen": 0.018230972811579704, "rewards/margins": 0.01212537381798029, "rewards/rejected": 0.006105600390583277, "step": 5, "train_speed(iter/s)": 0.005633 }, { "epoch": 0.01136027453996805, "grad_norm": 13.595820426940918, "learning_rate": 1.5e-05, "logits/chosen": -0.6641858220100403, "logits/rejected": -0.6705058217048645, "logps/chosen": -7.528585910797119, "logps/rejected": -18.073911666870117, "loss": 1.4404857158660889, "memory(GiB)": 45.96, "nll_loss": 0.7598920464515686, "rewards/accuracies": 0.71875, "rewards/chosen": 0.034823305904865265, "rewards/margins": 0.026311496272683144, "rewards/rejected": 0.008511810563504696, "step": 6, "train_speed(iter/s)": 0.005634 }, { "epoch": 0.013253653629962723, "grad_norm": 13.2615385055542, "learning_rate": 1.75e-05, "logits/chosen": -0.6327687501907349, "logits/rejected": -0.637922465801239, "logps/chosen": -8.100177764892578, "logps/rejected": -22.4697322845459, "loss": 1.310943603515625, "memory(GiB)": 45.96, "nll_loss": 0.6429428458213806, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07164613902568817, "rewards/margins": 0.053715869784355164, "rewards/rejected": 0.017930276691913605, "step": 7, "train_speed(iter/s)": 0.005641 }, { "epoch": 0.015147032719957399, "grad_norm": 9.518823623657227, "learning_rate": 2e-05, "logits/chosen": -0.6458379626274109, "logits/rejected": -0.6480465531349182, "logps/chosen": -8.227258682250977, "logps/rejected": -15.074575424194336, "loss": 1.2895722389221191, "memory(GiB)": 45.96, "nll_loss": 0.6121883392333984, "rewards/accuracies": 0.5625, "rewards/chosen": 0.11458335816860199, "rewards/margins": 0.04461951553821564, "rewards/rejected": 0.06996384263038635, "step": 8, "train_speed(iter/s)": 0.005657 }, { "epoch": 0.017040411809952073, "grad_norm": 5.971006393432617, "learning_rate": 2.25e-05, "logits/chosen": -0.6322387456893921, "logits/rejected": -0.6355814933776855, "logps/chosen": -6.8561859130859375, "logps/rejected": -16.394319534301758, "loss": 1.1358637809753418, "memory(GiB)": 45.96, "nll_loss": 0.4396786093711853, "rewards/accuracies": 0.5, "rewards/chosen": 0.126601442694664, "rewards/margins": 0.027468431740999222, "rewards/rejected": 0.09913301467895508, "step": 9, "train_speed(iter/s)": 0.005656 }, { "epoch": 0.018933790899946748, "grad_norm": 4.615151405334473, "learning_rate": 2.5e-05, "logits/chosen": -0.6353996992111206, "logits/rejected": -0.6420772075653076, "logps/chosen": -4.39181661605835, "logps/rejected": -19.73300552368164, "loss": 0.98687344789505, "memory(GiB)": 45.96, "nll_loss": 0.38576164841651917, "rewards/accuracies": 0.6875, "rewards/chosen": 0.196926087141037, "rewards/margins": 0.274502158164978, "rewards/rejected": -0.07757607102394104, "step": 10, "train_speed(iter/s)": 0.005651 }, { "epoch": 0.020827169989941424, "grad_norm": 3.6985604763031006, "learning_rate": 2.7500000000000004e-05, "logits/chosen": -0.6321280002593994, "logits/rejected": -0.6365548968315125, "logps/chosen": -7.2246904373168945, "logps/rejected": -19.404216766357422, "loss": 0.9879567623138428, "memory(GiB)": 45.96, "nll_loss": 0.36671119928359985, "rewards/accuracies": 0.625, "rewards/chosen": 0.12358222156763077, "rewards/margins": 0.28244268894195557, "rewards/rejected": -0.1588604599237442, "step": 11, "train_speed(iter/s)": 0.005662 }, { "epoch": 0.0227205490799361, "grad_norm": 7.83486270904541, "learning_rate": 3e-05, "logits/chosen": -0.6391905546188354, "logits/rejected": -0.6451292634010315, "logps/chosen": -8.3941011428833, "logps/rejected": -24.687467575073242, "loss": 1.1386761665344238, "memory(GiB)": 45.96, "nll_loss": 0.3862188458442688, "rewards/accuracies": 0.59375, "rewards/chosen": -0.004531089216470718, "rewards/margins": 0.17587248980998993, "rewards/rejected": -0.18040357530117035, "step": 12, "train_speed(iter/s)": 0.005646 }, { "epoch": 0.024613928169930775, "grad_norm": 5.917618274688721, "learning_rate": 3.2500000000000004e-05, "logits/chosen": -0.6517987251281738, "logits/rejected": -0.658316969871521, "logps/chosen": -6.573670387268066, "logps/rejected": -19.874000549316406, "loss": 1.050663948059082, "memory(GiB)": 45.96, "nll_loss": 0.40407559275627136, "rewards/accuracies": 0.59375, "rewards/chosen": 0.10255793482065201, "rewards/margins": 0.36497071385383606, "rewards/rejected": -0.26241275668144226, "step": 13, "train_speed(iter/s)": 0.00565 }, { "epoch": 0.026507307259925447, "grad_norm": 4.1237287521362305, "learning_rate": 3.5e-05, "logits/chosen": -0.61805260181427, "logits/rejected": -0.6224305033683777, "logps/chosen": -5.8840789794921875, "logps/rejected": -29.290557861328125, "loss": 0.9034114480018616, "memory(GiB)": 45.96, "nll_loss": 0.33107179403305054, "rewards/accuracies": 0.6875, "rewards/chosen": 0.13439905643463135, "rewards/margins": 0.5032773017883301, "rewards/rejected": -0.36887818574905396, "step": 14, "train_speed(iter/s)": 0.005633 }, { "epoch": 0.028400686349920122, "grad_norm": 2.141984701156616, "learning_rate": 3.7500000000000003e-05, "logits/chosen": -0.6251233816146851, "logits/rejected": -0.6291872262954712, "logps/chosen": -5.3556623458862305, "logps/rejected": -22.30205535888672, "loss": 0.7756511569023132, "memory(GiB)": 45.96, "nll_loss": 0.22363990545272827, "rewards/accuracies": 0.78125, "rewards/chosen": 0.21060410141944885, "rewards/margins": 0.5203964710235596, "rewards/rejected": -0.30979233980178833, "step": 15, "train_speed(iter/s)": 0.005622 }, { "epoch": 0.030294065439914798, "grad_norm": 6.157620906829834, "learning_rate": 4e-05, "logits/chosen": -0.6184762716293335, "logits/rejected": -0.6184364557266235, "logps/chosen": -10.368714332580566, "logps/rejected": -12.033210754394531, "loss": 1.4029701948165894, "memory(GiB)": 45.96, "nll_loss": 0.6103286743164062, "rewards/accuracies": 0.40625, "rewards/chosen": -0.020060203969478607, "rewards/margins": -0.03359239548444748, "rewards/rejected": 0.013532169163227081, "step": 16, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.03218744452990947, "grad_norm": 2.690070152282715, "learning_rate": 4.25e-05, "logits/chosen": -0.6329092383384705, "logits/rejected": -0.6367439031600952, "logps/chosen": -6.010343551635742, "logps/rejected": -17.85470199584961, "loss": 0.8949607610702515, "memory(GiB)": 45.96, "nll_loss": 0.3054018020629883, "rewards/accuracies": 0.65625, "rewards/chosen": 0.25051170587539673, "rewards/margins": 0.37515202164649963, "rewards/rejected": -0.12464030832052231, "step": 17, "train_speed(iter/s)": 0.00562 }, { "epoch": 0.034080823619904145, "grad_norm": 2.8276467323303223, "learning_rate": 4.5e-05, "logits/chosen": -0.6264123320579529, "logits/rejected": -0.6279273629188538, "logps/chosen": -9.41238021850586, "logps/rejected": -18.639442443847656, "loss": 1.0180559158325195, "memory(GiB)": 45.96, "nll_loss": 0.3220836818218231, "rewards/accuracies": 0.59375, "rewards/chosen": 0.1841900646686554, "rewards/margins": 0.13813874125480652, "rewards/rejected": 0.04605132341384888, "step": 18, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.035974202709898824, "grad_norm": 2.10530161857605, "learning_rate": 4.75e-05, "logits/chosen": -0.6376557946205139, "logits/rejected": -0.6416239738464355, "logps/chosen": -5.7143964767456055, "logps/rejected": -16.784849166870117, "loss": 0.9154303669929504, "memory(GiB)": 45.96, "nll_loss": 0.2545720934867859, "rewards/accuracies": 0.59375, "rewards/chosen": 0.24181872606277466, "rewards/margins": 0.18784700334072113, "rewards/rejected": 0.05397173762321472, "step": 19, "train_speed(iter/s)": 0.00562 }, { "epoch": 0.037867581799893496, "grad_norm": 2.357306480407715, "learning_rate": 5e-05, "logits/chosen": -0.6326904296875, "logits/rejected": -0.6354666352272034, "logps/chosen": -5.867492198944092, "logps/rejected": -13.818038940429688, "loss": 0.9468417167663574, "memory(GiB)": 45.96, "nll_loss": 0.3124926686286926, "rewards/accuracies": 0.59375, "rewards/chosen": 0.3217320740222931, "rewards/margins": 0.22124268114566803, "rewards/rejected": 0.10048942267894745, "step": 20, "train_speed(iter/s)": 0.005628 }, { "epoch": 0.039760960889888175, "grad_norm": 2.5859196186065674, "learning_rate": 5.25e-05, "logits/chosen": -0.6597320437431335, "logits/rejected": -0.6610896587371826, "logps/chosen": -7.943680286407471, "logps/rejected": -11.634421348571777, "loss": 1.0064345598220825, "memory(GiB)": 45.96, "nll_loss": 0.3732220232486725, "rewards/accuracies": 0.6875, "rewards/chosen": 0.3646732270717621, "rewards/margins": 0.21462492644786835, "rewards/rejected": 0.15004827082157135, "step": 21, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.04165433997988285, "grad_norm": 2.20487642288208, "learning_rate": 5.500000000000001e-05, "logits/chosen": -0.6439244151115417, "logits/rejected": -0.6464219093322754, "logps/chosen": -4.180229187011719, "logps/rejected": -19.56499481201172, "loss": 0.9136227369308472, "memory(GiB)": 45.96, "nll_loss": 0.22558730840682983, "rewards/accuracies": 0.5625, "rewards/chosen": 0.25369688868522644, "rewards/margins": 0.14792592823505402, "rewards/rejected": 0.10577096790075302, "step": 22, "train_speed(iter/s)": 0.00562 }, { "epoch": 0.04354771906987752, "grad_norm": 2.80965518951416, "learning_rate": 5.7499999999999995e-05, "logits/chosen": -0.5748096108436584, "logits/rejected": -0.5799225568771362, "logps/chosen": -5.921882629394531, "logps/rejected": -22.432538986206055, "loss": 0.9860997796058655, "memory(GiB)": 45.96, "nll_loss": 0.3462521731853485, "rewards/accuracies": 0.625, "rewards/chosen": 0.24639810621738434, "rewards/margins": 0.1898707151412964, "rewards/rejected": 0.05652741342782974, "step": 23, "train_speed(iter/s)": 0.005621 }, { "epoch": 0.0454410981598722, "grad_norm": 2.9503355026245117, "learning_rate": 6e-05, "logits/chosen": -0.6007645726203918, "logits/rejected": -0.6086101531982422, "logps/chosen": -5.338952541351318, "logps/rejected": -26.883895874023438, "loss": 0.9453619122505188, "memory(GiB)": 45.96, "nll_loss": 0.3667706847190857, "rewards/accuracies": 0.6875, "rewards/chosen": 0.392182856798172, "rewards/margins": 0.36902523040771484, "rewards/rejected": 0.02315761335194111, "step": 24, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.04733447724986687, "grad_norm": 2.2843515872955322, "learning_rate": 6.25e-05, "logits/chosen": -0.6047165393829346, "logits/rejected": -0.608917772769928, "logps/chosen": -6.276377201080322, "logps/rejected": -21.095470428466797, "loss": 0.914051353931427, "memory(GiB)": 45.96, "nll_loss": 0.3292374610900879, "rewards/accuracies": 0.6875, "rewards/chosen": 0.3036147356033325, "rewards/margins": 0.32923099398612976, "rewards/rejected": -0.025616232305765152, "step": 25, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.04922785633986155, "grad_norm": 2.7294957637786865, "learning_rate": 6.500000000000001e-05, "logits/chosen": -0.6337023377418518, "logits/rejected": -0.6374361515045166, "logps/chosen": -7.032902240753174, "logps/rejected": -24.937816619873047, "loss": 0.8451516032218933, "memory(GiB)": 45.96, "nll_loss": 0.25359871983528137, "rewards/accuracies": 0.65625, "rewards/chosen": 0.24989479780197144, "rewards/margins": 0.3727536201477051, "rewards/rejected": -0.12285882234573364, "step": 26, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.05112123542985622, "grad_norm": 1.9816867113113403, "learning_rate": 6.750000000000001e-05, "logits/chosen": -0.6674913167953491, "logits/rejected": -0.6716790795326233, "logps/chosen": -3.894029378890991, "logps/rejected": -19.461292266845703, "loss": 0.720669686794281, "memory(GiB)": 45.96, "nll_loss": 0.1943943053483963, "rewards/accuracies": 0.78125, "rewards/chosen": 0.40334552526474, "rewards/margins": 0.5223954319953918, "rewards/rejected": -0.11904986202716827, "step": 27, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.05301461451985089, "grad_norm": 1.9561638832092285, "learning_rate": 7e-05, "logits/chosen": -0.6560395359992981, "logits/rejected": -0.6615370512008667, "logps/chosen": -3.828300952911377, "logps/rejected": -27.646583557128906, "loss": 0.7324035167694092, "memory(GiB)": 45.96, "nll_loss": 0.18986308574676514, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2855417728424072, "rewards/margins": 0.5658388733863831, "rewards/rejected": -0.28029707074165344, "step": 28, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.05490799360984557, "grad_norm": 2.197960376739502, "learning_rate": 7.25e-05, "logits/chosen": -0.6013461351394653, "logits/rejected": -0.6078683733940125, "logps/chosen": -5.841001987457275, "logps/rejected": -28.59882926940918, "loss": 0.763361930847168, "memory(GiB)": 45.96, "nll_loss": 0.29682645201683044, "rewards/accuracies": 0.75, "rewards/chosen": 0.33854252099990845, "rewards/margins": 0.7552333474159241, "rewards/rejected": -0.416690856218338, "step": 29, "train_speed(iter/s)": 0.005603 }, { "epoch": 0.056801372699840244, "grad_norm": 4.102924823760986, "learning_rate": 7.500000000000001e-05, "logits/chosen": -0.6362655758857727, "logits/rejected": -0.6371059417724609, "logps/chosen": -6.047646522521973, "logps/rejected": -16.402286529541016, "loss": 0.930861234664917, "memory(GiB)": 45.96, "nll_loss": 0.33219844102859497, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2280413955450058, "rewards/margins": 0.48401153087615967, "rewards/rejected": -0.25597015023231506, "step": 30, "train_speed(iter/s)": 0.005604 }, { "epoch": 0.05869475178983492, "grad_norm": 2.643806219100952, "learning_rate": 7.75e-05, "logits/chosen": -0.6917952299118042, "logits/rejected": -0.6954830884933472, "logps/chosen": -4.5008368492126465, "logps/rejected": -25.313228607177734, "loss": 0.7698233127593994, "memory(GiB)": 45.96, "nll_loss": 0.21702390909194946, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2267376184463501, "rewards/margins": 0.6824056506156921, "rewards/rejected": -0.4556680917739868, "step": 31, "train_speed(iter/s)": 0.005603 }, { "epoch": 0.060588130879829595, "grad_norm": 3.9089903831481934, "learning_rate": 8e-05, "logits/chosen": -0.6848002672195435, "logits/rejected": -0.6877056360244751, "logps/chosen": -9.047338485717773, "logps/rejected": -25.891061782836914, "loss": 0.9844011068344116, "memory(GiB)": 45.96, "nll_loss": 0.3213033378124237, "rewards/accuracies": 0.59375, "rewards/chosen": 0.13390681147575378, "rewards/margins": 0.6111294031143188, "rewards/rejected": -0.4772225618362427, "step": 32, "train_speed(iter/s)": 0.005603 }, { "epoch": 0.062481509969824274, "grad_norm": 3.631053924560547, "learning_rate": 8.25e-05, "logits/chosen": -0.6787916421890259, "logits/rejected": -0.681725025177002, "logps/chosen": -11.23558521270752, "logps/rejected": -24.226280212402344, "loss": 1.1201726198196411, "memory(GiB)": 45.96, "nll_loss": 0.5571246147155762, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2192046195268631, "rewards/margins": 0.6016167402267456, "rewards/rejected": -0.3824121356010437, "step": 33, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.06437488905981895, "grad_norm": 2.667919158935547, "learning_rate": 8.5e-05, "logits/chosen": -0.7005462646484375, "logits/rejected": -0.7055037021636963, "logps/chosen": -3.1784541606903076, "logps/rejected": -23.535545349121094, "loss": 0.638558566570282, "memory(GiB)": 45.96, "nll_loss": 0.23515944182872772, "rewards/accuracies": 0.8125, "rewards/chosen": 0.27606871724128723, "rewards/margins": 1.0784178972244263, "rewards/rejected": -0.8023491501808167, "step": 34, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.06626826814981363, "grad_norm": 4.037520408630371, "learning_rate": 8.75e-05, "logits/chosen": -0.7001099586486816, "logits/rejected": -0.7051636576652527, "logps/chosen": -6.665594577789307, "logps/rejected": -30.973716735839844, "loss": 0.848934531211853, "memory(GiB)": 45.96, "nll_loss": 0.38612014055252075, "rewards/accuracies": 0.75, "rewards/chosen": 0.15037909150123596, "rewards/margins": 1.0571930408477783, "rewards/rejected": -0.9068138599395752, "step": 35, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.06816164723980829, "grad_norm": 3.6542232036590576, "learning_rate": 9e-05, "logits/chosen": -0.7070563435554504, "logits/rejected": -0.7053466439247131, "logps/chosen": -5.064585208892822, "logps/rejected": -19.19178581237793, "loss": 0.7724434733390808, "memory(GiB)": 45.96, "nll_loss": 0.26881077885627747, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2176203727722168, "rewards/margins": 0.7342812418937683, "rewards/rejected": -0.5166608095169067, "step": 36, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.07005502632980297, "grad_norm": 3.4213714599609375, "learning_rate": 9.250000000000001e-05, "logits/chosen": -0.7090893387794495, "logits/rejected": -0.7106159329414368, "logps/chosen": -10.25515365600586, "logps/rejected": -24.033281326293945, "loss": 0.9920384883880615, "memory(GiB)": 45.96, "nll_loss": 0.46471139788627625, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0965394526720047, "rewards/margins": 0.8922154307365417, "rewards/rejected": -0.7956759929656982, "step": 37, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.07194840541979765, "grad_norm": 5.325904846191406, "learning_rate": 9.5e-05, "logits/chosen": -0.657074511051178, "logits/rejected": -0.6611977815628052, "logps/chosen": -11.612046241760254, "logps/rejected": -27.249744415283203, "loss": 0.8334037065505981, "memory(GiB)": 45.96, "nll_loss": 0.3489510715007782, "rewards/accuracies": 0.75, "rewards/chosen": 0.12560953199863434, "rewards/margins": 0.9447187781333923, "rewards/rejected": -0.819109320640564, "step": 38, "train_speed(iter/s)": 0.005622 }, { "epoch": 0.07384178450979231, "grad_norm": 2.9407873153686523, "learning_rate": 9.75e-05, "logits/chosen": -0.7148993611335754, "logits/rejected": -0.7166731357574463, "logps/chosen": -7.349883079528809, "logps/rejected": -25.866724014282227, "loss": 0.7971550822257996, "memory(GiB)": 45.96, "nll_loss": 0.3317265808582306, "rewards/accuracies": 0.75, "rewards/chosen": 0.1786963939666748, "rewards/margins": 0.9361187815666199, "rewards/rejected": -0.7574224472045898, "step": 39, "train_speed(iter/s)": 0.005621 }, { "epoch": 0.07573516359978699, "grad_norm": 7.271725654602051, "learning_rate": 0.0001, "logits/chosen": -0.6494594216346741, "logits/rejected": -0.6519922018051147, "logps/chosen": -10.921842575073242, "logps/rejected": -26.213640213012695, "loss": 1.3029272556304932, "memory(GiB)": 45.96, "nll_loss": 0.7071102261543274, "rewards/accuracies": 0.6875, "rewards/chosen": 0.04726380109786987, "rewards/margins": 0.7260035276412964, "rewards/rejected": -0.6787396669387817, "step": 40, "train_speed(iter/s)": 0.005622 }, { "epoch": 0.07762854268978167, "grad_norm": 2.3149876594543457, "learning_rate": 0.0001025, "logits/chosen": -0.6998907327651978, "logits/rejected": -0.7039870023727417, "logps/chosen": -4.173505783081055, "logps/rejected": -23.617250442504883, "loss": 0.5567827224731445, "memory(GiB)": 45.96, "nll_loss": 0.22731299698352814, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3785739839076996, "rewards/margins": 1.2282123565673828, "rewards/rejected": -0.8496384620666504, "step": 41, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.07952192177977635, "grad_norm": 2.81628155708313, "learning_rate": 0.000105, "logits/chosen": -0.7065268754959106, "logits/rejected": -0.7109476923942566, "logps/chosen": -7.945868492126465, "logps/rejected": -28.209381103515625, "loss": 0.9143926501274109, "memory(GiB)": 45.96, "nll_loss": 0.45929795503616333, "rewards/accuracies": 0.78125, "rewards/chosen": 0.14874038100242615, "rewards/margins": 0.9704731702804565, "rewards/rejected": -0.8217328786849976, "step": 42, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.08141530086977102, "grad_norm": 5.763336658477783, "learning_rate": 0.0001075, "logits/chosen": -0.6870285868644714, "logits/rejected": -0.6968757510185242, "logps/chosen": -5.37760066986084, "logps/rejected": -30.209644317626953, "loss": 1.0033479928970337, "memory(GiB)": 45.96, "nll_loss": 0.5952383279800415, "rewards/accuracies": 0.8125, "rewards/chosen": 0.25675737857818604, "rewards/margins": 1.0465596914291382, "rewards/rejected": -0.7898023128509521, "step": 43, "train_speed(iter/s)": 0.005627 }, { "epoch": 0.0833086799597657, "grad_norm": 5.945868015289307, "learning_rate": 0.00011000000000000002, "logits/chosen": -0.6680281758308411, "logits/rejected": -0.6685014963150024, "logps/chosen": -11.777937889099121, "logps/rejected": -14.195478439331055, "loss": 1.2500255107879639, "memory(GiB)": 45.96, "nll_loss": 0.6744679808616638, "rewards/accuracies": 0.75, "rewards/chosen": 0.2654823362827301, "rewards/margins": 0.44828659296035767, "rewards/rejected": -0.18280424177646637, "step": 44, "train_speed(iter/s)": 0.005626 }, { "epoch": 0.08520205904976037, "grad_norm": 3.6887738704681396, "learning_rate": 0.00011250000000000001, "logits/chosen": -0.6420993804931641, "logits/rejected": -0.649295449256897, "logps/chosen": -5.845967769622803, "logps/rejected": -29.958538055419922, "loss": 0.8367453217506409, "memory(GiB)": 45.96, "nll_loss": 0.40336742997169495, "rewards/accuracies": 0.8125, "rewards/chosen": 0.25286757946014404, "rewards/margins": 0.9195659160614014, "rewards/rejected": -0.6666983962059021, "step": 45, "train_speed(iter/s)": 0.005627 }, { "epoch": 0.08709543813975504, "grad_norm": 2.1550676822662354, "learning_rate": 0.00011499999999999999, "logits/chosen": -0.6583084464073181, "logits/rejected": -0.6640565395355225, "logps/chosen": -2.7918519973754883, "logps/rejected": -30.053329467773438, "loss": 0.6384420394897461, "memory(GiB)": 45.96, "nll_loss": 0.16433243453502655, "rewards/accuracies": 0.75, "rewards/chosen": 0.33078277111053467, "rewards/margins": 0.8035537004470825, "rewards/rejected": -0.4727708697319031, "step": 46, "train_speed(iter/s)": 0.005628 }, { "epoch": 0.08898881722974972, "grad_norm": 1.9267369508743286, "learning_rate": 0.00011750000000000001, "logits/chosen": -0.6443086266517639, "logits/rejected": -0.6484851837158203, "logps/chosen": -6.4907331466674805, "logps/rejected": -26.10548973083496, "loss": 0.8166890740394592, "memory(GiB)": 45.96, "nll_loss": 0.2826446294784546, "rewards/accuracies": 0.75, "rewards/chosen": 0.33410829305648804, "rewards/margins": 0.7130259275436401, "rewards/rejected": -0.3789176642894745, "step": 47, "train_speed(iter/s)": 0.005627 }, { "epoch": 0.0908821963197444, "grad_norm": 2.238929510116577, "learning_rate": 0.00012, "logits/chosen": -0.6500992774963379, "logits/rejected": -0.6550747156143188, "logps/chosen": -6.974908351898193, "logps/rejected": -25.759687423706055, "loss": 0.8363897800445557, "memory(GiB)": 45.96, "nll_loss": 0.26740241050720215, "rewards/accuracies": 0.625, "rewards/chosen": 0.2779407501220703, "rewards/margins": 0.71395343542099, "rewards/rejected": -0.43601274490356445, "step": 48, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.09277557540973908, "grad_norm": 2.5497782230377197, "learning_rate": 0.00012250000000000002, "logits/chosen": -0.676102876663208, "logits/rejected": -0.676883339881897, "logps/chosen": -6.410519599914551, "logps/rejected": -17.417396545410156, "loss": 0.9155470728874207, "memory(GiB)": 45.96, "nll_loss": 0.3170667886734009, "rewards/accuracies": 0.5625, "rewards/chosen": 0.24874374270439148, "rewards/margins": 0.6556647419929504, "rewards/rejected": -0.40692102909088135, "step": 49, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.09466895449973374, "grad_norm": 2.275879144668579, "learning_rate": 0.000125, "logits/chosen": -0.6682412028312683, "logits/rejected": -0.6694232225418091, "logps/chosen": -7.84281587600708, "logps/rejected": -18.11672019958496, "loss": 0.8602735996246338, "memory(GiB)": 45.96, "nll_loss": 0.342671662569046, "rewards/accuracies": 0.6875, "rewards/chosen": 0.16426895558834076, "rewards/margins": 0.6373977065086365, "rewards/rejected": -0.47312870621681213, "step": 50, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.09656233358972842, "grad_norm": 2.448835611343384, "learning_rate": 0.0001275, "logits/chosen": -0.7030003070831299, "logits/rejected": -0.702628493309021, "logps/chosen": -7.209776401519775, "logps/rejected": -24.76384162902832, "loss": 0.7324039340019226, "memory(GiB)": 45.96, "nll_loss": 0.22679060697555542, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2451048642396927, "rewards/margins": 0.9410224556922913, "rewards/rejected": -0.695917546749115, "step": 51, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.0984557126797231, "grad_norm": 2.4740657806396484, "learning_rate": 0.00013000000000000002, "logits/chosen": -0.7383002042770386, "logits/rejected": -0.7460674047470093, "logps/chosen": -4.4354424476623535, "logps/rejected": -26.271957397460938, "loss": 0.738042414188385, "memory(GiB)": 45.96, "nll_loss": 0.30589190125465393, "rewards/accuracies": 0.71875, "rewards/chosen": 0.35504794120788574, "rewards/margins": 1.1514215469360352, "rewards/rejected": -0.7963736057281494, "step": 52, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.10034909176971776, "grad_norm": 3.1427273750305176, "learning_rate": 0.0001325, "logits/chosen": -0.7910199165344238, "logits/rejected": -0.7956037521362305, "logps/chosen": -5.2786359786987305, "logps/rejected": -27.01905632019043, "loss": 0.7005700469017029, "memory(GiB)": 45.96, "nll_loss": 0.2977657616138458, "rewards/accuracies": 0.8125, "rewards/chosen": 0.32858696579933167, "rewards/margins": 1.1505931615829468, "rewards/rejected": -0.8220062255859375, "step": 53, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.10224247085971244, "grad_norm": 2.710829973220825, "learning_rate": 0.00013500000000000003, "logits/chosen": -0.7300952672958374, "logits/rejected": -0.7392382621765137, "logps/chosen": -4.204522132873535, "logps/rejected": -35.52387237548828, "loss": 0.5068414211273193, "memory(GiB)": 45.96, "nll_loss": 0.18188302218914032, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3228433430194855, "rewards/margins": 1.5467703342437744, "rewards/rejected": -1.2239267826080322, "step": 54, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.10413584994970712, "grad_norm": 2.6672115325927734, "learning_rate": 0.0001375, "logits/chosen": -0.7622752785682678, "logits/rejected": -0.7692346572875977, "logps/chosen": -5.656646728515625, "logps/rejected": -36.99287033081055, "loss": 0.6165193319320679, "memory(GiB)": 45.96, "nll_loss": 0.2455344796180725, "rewards/accuracies": 0.78125, "rewards/chosen": 0.21251262724399567, "rewards/margins": 1.7865149974822998, "rewards/rejected": -1.5740022659301758, "step": 55, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.10602922903970179, "grad_norm": 7.261322975158691, "learning_rate": 0.00014, "logits/chosen": -0.8227823376655579, "logits/rejected": -0.8353255391120911, "logps/chosen": -7.420350551605225, "logps/rejected": -42.59074401855469, "loss": 0.8744301199913025, "memory(GiB)": 45.96, "nll_loss": 0.49042099714279175, "rewards/accuracies": 0.71875, "rewards/chosen": 0.23873600363731384, "rewards/margins": 2.152242422103882, "rewards/rejected": -1.9135063886642456, "step": 56, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.10792260812969647, "grad_norm": 3.6271088123321533, "learning_rate": 0.00014250000000000002, "logits/chosen": -0.8145865201950073, "logits/rejected": -0.8213882446289062, "logps/chosen": -4.568179130554199, "logps/rejected": -37.50999450683594, "loss": 0.6209616661071777, "memory(GiB)": 45.96, "nll_loss": 0.29730865359306335, "rewards/accuracies": 0.875, "rewards/chosen": 0.26820147037506104, "rewards/margins": 2.114492893218994, "rewards/rejected": -1.8462913036346436, "step": 57, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.10981598721969114, "grad_norm": 3.6261045932769775, "learning_rate": 0.000145, "logits/chosen": -0.7670393586158752, "logits/rejected": -0.7794223427772522, "logps/chosen": -8.460503578186035, "logps/rejected": -43.186954498291016, "loss": 0.6528911590576172, "memory(GiB)": 45.96, "nll_loss": 0.30593881011009216, "rewards/accuracies": 0.84375, "rewards/chosen": 0.28572511672973633, "rewards/margins": 2.0398354530334473, "rewards/rejected": -1.75411057472229, "step": 58, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.11170936630968582, "grad_norm": 2.79728364944458, "learning_rate": 0.0001475, "logits/chosen": -0.8239770531654358, "logits/rejected": -0.8207590579986572, "logps/chosen": -12.058256149291992, "logps/rejected": -25.070674896240234, "loss": 0.8349239230155945, "memory(GiB)": 45.96, "nll_loss": 0.4342367947101593, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2961112856864929, "rewards/margins": 1.2313449382781982, "rewards/rejected": -0.9352336525917053, "step": 59, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.11360274539968049, "grad_norm": 3.0574796199798584, "learning_rate": 0.00015000000000000001, "logits/chosen": -0.810753345489502, "logits/rejected": -0.8193599581718445, "logps/chosen": -5.105385780334473, "logps/rejected": -29.203344345092773, "loss": 0.6070073843002319, "memory(GiB)": 45.96, "nll_loss": 0.24924401938915253, "rewards/accuracies": 0.75, "rewards/chosen": 0.5035626292228699, "rewards/margins": 1.4562283754348755, "rewards/rejected": -0.9526655077934265, "step": 60, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.11549612448967517, "grad_norm": 5.350250720977783, "learning_rate": 0.0001525, "logits/chosen": -0.815939724445343, "logits/rejected": -0.826446533203125, "logps/chosen": -2.3785085678100586, "logps/rejected": -34.224422454833984, "loss": 0.7174049019813538, "memory(GiB)": 45.96, "nll_loss": 0.38427019119262695, "rewards/accuracies": 0.8125, "rewards/chosen": 0.4009089469909668, "rewards/margins": 1.891708254814148, "rewards/rejected": -1.4907994270324707, "step": 61, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.11738950357966985, "grad_norm": 2.239091157913208, "learning_rate": 0.000155, "logits/chosen": -0.8229139447212219, "logits/rejected": -0.8320141434669495, "logps/chosen": -4.586618900299072, "logps/rejected": -32.01433181762695, "loss": 0.6079644560813904, "memory(GiB)": 45.96, "nll_loss": 0.20739667117595673, "rewards/accuracies": 0.78125, "rewards/chosen": 0.26031073927879333, "rewards/margins": 1.4821346998214722, "rewards/rejected": -1.2218239307403564, "step": 62, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.11928288266966451, "grad_norm": 4.1209940910339355, "learning_rate": 0.0001575, "logits/chosen": -0.8513484597206116, "logits/rejected": -0.8552687168121338, "logps/chosen": -9.33289909362793, "logps/rejected": -29.56768226623535, "loss": 1.0120337009429932, "memory(GiB)": 45.96, "nll_loss": 0.4378553628921509, "rewards/accuracies": 0.625, "rewards/chosen": 0.14417365193367004, "rewards/margins": 1.3170634508132935, "rewards/rejected": -1.1728898286819458, "step": 63, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.12117626175965919, "grad_norm": 4.230152606964111, "learning_rate": 0.00016, "logits/chosen": -0.7943696975708008, "logits/rejected": -0.8050058484077454, "logps/chosen": -6.4711594581604, "logps/rejected": -42.82871627807617, "loss": 0.5924439430236816, "memory(GiB)": 45.96, "nll_loss": 0.23330256342887878, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16898760199546814, "rewards/margins": 1.992952585220337, "rewards/rejected": -1.823965072631836, "step": 64, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.12306964084965387, "grad_norm": 2.351702928543091, "learning_rate": 0.00016250000000000002, "logits/chosen": -0.8158823251724243, "logits/rejected": -0.8219522833824158, "logps/chosen": -4.3665313720703125, "logps/rejected": -28.09051513671875, "loss": 0.7134827375411987, "memory(GiB)": 45.96, "nll_loss": 0.22144050896167755, "rewards/accuracies": 0.65625, "rewards/chosen": 0.3041003942489624, "rewards/margins": 1.2433838844299316, "rewards/rejected": -0.9392834305763245, "step": 65, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.12496301993964855, "grad_norm": 3.1737756729125977, "learning_rate": 0.000165, "logits/chosen": -0.8072597980499268, "logits/rejected": -0.8171340823173523, "logps/chosen": -5.0343122482299805, "logps/rejected": -32.46968460083008, "loss": 0.63325434923172, "memory(GiB)": 45.96, "nll_loss": 0.29483139514923096, "rewards/accuracies": 0.84375, "rewards/chosen": 0.29814648628234863, "rewards/margins": 1.4677376747131348, "rewards/rejected": -1.1695910692214966, "step": 66, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.1268563990296432, "grad_norm": 2.5199668407440186, "learning_rate": 0.0001675, "logits/chosen": -0.8106119632720947, "logits/rejected": -0.8191246390342712, "logps/chosen": -8.389342308044434, "logps/rejected": -36.18731689453125, "loss": 0.7148120403289795, "memory(GiB)": 45.96, "nll_loss": 0.31000831723213196, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2828730642795563, "rewards/margins": 1.7046067714691162, "rewards/rejected": -1.4217336177825928, "step": 67, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.1287497781196379, "grad_norm": 3.428029775619507, "learning_rate": 0.00017, "logits/chosen": -0.8391574621200562, "logits/rejected": -0.8546858429908752, "logps/chosen": -8.799811363220215, "logps/rejected": -37.64997863769531, "loss": 0.7224959135055542, "memory(GiB)": 45.96, "nll_loss": 0.4090877175331116, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3909546434879303, "rewards/margins": 1.7023922204971313, "rewards/rejected": -1.3114374876022339, "step": 68, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.13064315720963257, "grad_norm": 3.7791826725006104, "learning_rate": 0.00017250000000000002, "logits/chosen": -0.8618558049201965, "logits/rejected": -0.86772221326828, "logps/chosen": -8.02017879486084, "logps/rejected": -28.318117141723633, "loss": 0.8481130003929138, "memory(GiB)": 45.96, "nll_loss": 0.32193318009376526, "rewards/accuracies": 0.625, "rewards/chosen": 0.07287055253982544, "rewards/margins": 1.3111273050308228, "rewards/rejected": -1.2382566928863525, "step": 69, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.13253653629962725, "grad_norm": 3.5219051837921143, "learning_rate": 0.000175, "logits/chosen": -0.8731855154037476, "logits/rejected": -0.8781698346138, "logps/chosen": -8.205753326416016, "logps/rejected": -23.05510902404785, "loss": 0.9284813404083252, "memory(GiB)": 45.96, "nll_loss": 0.4099024832248688, "rewards/accuracies": 0.59375, "rewards/chosen": 0.26493778824806213, "rewards/margins": 1.1318817138671875, "rewards/rejected": -0.866943895816803, "step": 70, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.13442991538962193, "grad_norm": 2.412374973297119, "learning_rate": 0.0001775, "logits/chosen": -0.8586634993553162, "logits/rejected": -0.8701040744781494, "logps/chosen": -3.7027158737182617, "logps/rejected": -42.672996520996094, "loss": 0.5218284130096436, "memory(GiB)": 45.96, "nll_loss": 0.2169719785451889, "rewards/accuracies": 0.8125, "rewards/chosen": 0.371543824672699, "rewards/margins": 2.3614425659179688, "rewards/rejected": -1.989898920059204, "step": 71, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.13632329447961658, "grad_norm": 1.723345160484314, "learning_rate": 0.00018, "logits/chosen": -0.8107991814613342, "logits/rejected": -0.8227972388267517, "logps/chosen": -4.743021488189697, "logps/rejected": -38.795711517333984, "loss": 0.4607815742492676, "memory(GiB)": 45.96, "nll_loss": 0.18950311839580536, "rewards/accuracies": 0.90625, "rewards/chosen": 0.36083462834358215, "rewards/margins": 2.311211585998535, "rewards/rejected": -1.9503768682479858, "step": 72, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.13821667356961126, "grad_norm": 4.164133548736572, "learning_rate": 0.0001825, "logits/chosen": -0.9086084365844727, "logits/rejected": -0.9208739995956421, "logps/chosen": -13.34437084197998, "logps/rejected": -53.04572296142578, "loss": 0.6920671463012695, "memory(GiB)": 45.96, "nll_loss": 0.43207526206970215, "rewards/accuracies": 0.84375, "rewards/chosen": 0.031513512134552, "rewards/margins": 3.146587371826172, "rewards/rejected": -3.1150739192962646, "step": 73, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.14011005265960594, "grad_norm": 6.1999382972717285, "learning_rate": 0.00018500000000000002, "logits/chosen": -0.8234269618988037, "logits/rejected": -0.8303597569465637, "logps/chosen": -8.394856452941895, "logps/rejected": -41.975399017333984, "loss": 1.1737077236175537, "memory(GiB)": 45.96, "nll_loss": 0.7135495543479919, "rewards/accuracies": 0.75, "rewards/chosen": 0.14376360177993774, "rewards/margins": 2.6206157207489014, "rewards/rejected": -2.4768521785736084, "step": 74, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.14200343174960062, "grad_norm": 6.218433856964111, "learning_rate": 0.0001875, "logits/chosen": -0.8009334802627563, "logits/rejected": -0.8051450848579407, "logps/chosen": -12.022541046142578, "logps/rejected": -38.48487091064453, "loss": 0.9869168400764465, "memory(GiB)": 45.96, "nll_loss": 0.45167890191078186, "rewards/accuracies": 0.6875, "rewards/chosen": -0.010723039507865906, "rewards/margins": 1.8775376081466675, "rewards/rejected": -1.8882607221603394, "step": 75, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.1438968108395953, "grad_norm": 1.9325371980667114, "learning_rate": 0.00019, "logits/chosen": -0.7815489768981934, "logits/rejected": -0.7896750569343567, "logps/chosen": -6.42656946182251, "logps/rejected": -33.38284683227539, "loss": 0.6605334281921387, "memory(GiB)": 45.96, "nll_loss": 0.30029603838920593, "rewards/accuracies": 0.875, "rewards/chosen": 0.31539270281791687, "rewards/margins": 1.6843116283416748, "rewards/rejected": -1.368919014930725, "step": 76, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.14579018992958998, "grad_norm": 5.768399238586426, "learning_rate": 0.00019250000000000002, "logits/chosen": -0.7157012820243835, "logits/rejected": -0.7218092679977417, "logps/chosen": -5.720545291900635, "logps/rejected": -32.14387512207031, "loss": 0.9388673901557922, "memory(GiB)": 45.96, "nll_loss": 0.49579885601997375, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2496451437473297, "rewards/margins": 1.3803541660308838, "rewards/rejected": -1.130708932876587, "step": 77, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.14768356901958463, "grad_norm": 2.978989601135254, "learning_rate": 0.000195, "logits/chosen": -0.7398240566253662, "logits/rejected": -0.74552983045578, "logps/chosen": -6.459310054779053, "logps/rejected": -28.873746871948242, "loss": 0.6721470952033997, "memory(GiB)": 45.96, "nll_loss": 0.2696229815483093, "rewards/accuracies": 0.8125, "rewards/chosen": 0.28077179193496704, "rewards/margins": 1.547407865524292, "rewards/rejected": -1.2666360139846802, "step": 78, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.1495769481095793, "grad_norm": 2.109548568725586, "learning_rate": 0.00019750000000000003, "logits/chosen": -0.7017478942871094, "logits/rejected": -0.7096887826919556, "logps/chosen": -4.097768783569336, "logps/rejected": -31.799213409423828, "loss": 0.5941745042800903, "memory(GiB)": 45.96, "nll_loss": 0.19475214183330536, "rewards/accuracies": 0.75, "rewards/chosen": 0.4046904742717743, "rewards/margins": 1.6549233198165894, "rewards/rejected": -1.2502328157424927, "step": 79, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.15147032719957398, "grad_norm": 3.9734411239624023, "learning_rate": 0.0002, "logits/chosen": -0.6862869262695312, "logits/rejected": -0.6942235827445984, "logps/chosen": -8.900280952453613, "logps/rejected": -41.978641510009766, "loss": 0.7803151607513428, "memory(GiB)": 45.96, "nll_loss": 0.3115917146205902, "rewards/accuracies": 0.75, "rewards/chosen": 0.1415846347808838, "rewards/margins": 2.006580352783203, "rewards/rejected": -1.8649954795837402, "step": 80, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.15336370628956866, "grad_norm": 6.735928535461426, "learning_rate": 0.00019999978184060562, "logits/chosen": -0.7448083162307739, "logits/rejected": -0.7499798536300659, "logps/chosen": -5.58134126663208, "logps/rejected": -42.04484939575195, "loss": 0.9395004510879517, "memory(GiB)": 45.96, "nll_loss": 0.515042245388031, "rewards/accuracies": 0.75, "rewards/chosen": 0.24552975594997406, "rewards/margins": 2.421520233154297, "rewards/rejected": -2.175990343093872, "step": 81, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.15525708537956334, "grad_norm": 4.143361568450928, "learning_rate": 0.00019999912736337437, "logits/chosen": -0.7276468873023987, "logits/rejected": -0.741879940032959, "logps/chosen": -3.295543670654297, "logps/rejected": -54.32012939453125, "loss": 0.660046398639679, "memory(GiB)": 45.96, "nll_loss": 0.42805707454681396, "rewards/accuracies": 0.875, "rewards/chosen": 0.2942177951335907, "rewards/margins": 3.302980661392212, "rewards/rejected": -3.008762836456299, "step": 82, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.15715046446955802, "grad_norm": 4.713730812072754, "learning_rate": 0.00019999803657116188, "logits/chosen": -0.7310099601745605, "logits/rejected": -0.7400019764900208, "logps/chosen": -6.529958248138428, "logps/rejected": -39.906105041503906, "loss": 0.7617413997650146, "memory(GiB)": 45.96, "nll_loss": 0.422638475894928, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2212720513343811, "rewards/margins": 2.413503885269165, "rewards/rejected": -2.1922316551208496, "step": 83, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.1590438435595527, "grad_norm": 4.658056735992432, "learning_rate": 0.00019999650946872738, "logits/chosen": -0.7134297490119934, "logits/rejected": -0.7193505764007568, "logps/chosen": -5.202678680419922, "logps/rejected": -33.255706787109375, "loss": 0.6914293766021729, "memory(GiB)": 45.96, "nll_loss": 0.2725370526313782, "rewards/accuracies": 0.75, "rewards/chosen": 0.29689377546310425, "rewards/margins": 1.9401971101760864, "rewards/rejected": -1.6433032751083374, "step": 84, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.16093722264954735, "grad_norm": 2.288125991821289, "learning_rate": 0.00019999454606273404, "logits/chosen": -0.6521891951560974, "logits/rejected": -0.6597902774810791, "logps/chosen": -6.535229206085205, "logps/rejected": -33.92669677734375, "loss": 0.5946552157402039, "memory(GiB)": 45.96, "nll_loss": 0.29953494668006897, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3503923714160919, "rewards/margins": 1.96759831905365, "rewards/rejected": -1.61720609664917, "step": 85, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.16283060173954203, "grad_norm": 6.193369388580322, "learning_rate": 0.00019999214636174845, "logits/chosen": -0.7137624025344849, "logits/rejected": -0.7180912494659424, "logps/chosen": -6.647699356079102, "logps/rejected": -31.25023078918457, "loss": 0.9301581382751465, "memory(GiB)": 45.96, "nll_loss": 0.46883538365364075, "rewards/accuracies": 0.78125, "rewards/chosen": 0.29692143201828003, "rewards/margins": 1.745566964149475, "rewards/rejected": -1.4486457109451294, "step": 86, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.1647239808295367, "grad_norm": 3.9115772247314453, "learning_rate": 0.00019998931037624104, "logits/chosen": -0.6435313820838928, "logits/rejected": -0.6480632424354553, "logps/chosen": -6.559725284576416, "logps/rejected": -34.3360481262207, "loss": 0.7339984178543091, "memory(GiB)": 45.96, "nll_loss": 0.3988235890865326, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2545357048511505, "rewards/margins": 1.8583070039749146, "rewards/rejected": -1.603771448135376, "step": 87, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.1666173599195314, "grad_norm": 2.725975751876831, "learning_rate": 0.00019998603811858571, "logits/chosen": -0.6484612822532654, "logits/rejected": -0.6513442993164062, "logps/chosen": -5.939992427825928, "logps/rejected": -30.691526412963867, "loss": 0.6261233687400818, "memory(GiB)": 45.96, "nll_loss": 0.30717653036117554, "rewards/accuracies": 0.875, "rewards/chosen": 0.3799961507320404, "rewards/margins": 1.8060214519500732, "rewards/rejected": -1.426025390625, "step": 88, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.16851073900952607, "grad_norm": 3.1483325958251953, "learning_rate": 0.00019998232960305993, "logits/chosen": -0.640424907207489, "logits/rejected": -0.6445133090019226, "logps/chosen": -10.158927917480469, "logps/rejected": -31.649131774902344, "loss": 0.7713112235069275, "memory(GiB)": 45.96, "nll_loss": 0.4013857841491699, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2583284080028534, "rewards/margins": 1.7178279161453247, "rewards/rejected": -1.4594995975494385, "step": 89, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.17040411809952075, "grad_norm": 9.671393394470215, "learning_rate": 0.0001999781848458447, "logits/chosen": -0.6384307146072388, "logits/rejected": -0.6467083692550659, "logps/chosen": -5.6327433586120605, "logps/rejected": -33.724124908447266, "loss": 1.136250615119934, "memory(GiB)": 45.96, "nll_loss": 0.6182616353034973, "rewards/accuracies": 0.8125, "rewards/chosen": 0.12717147171497345, "rewards/margins": 1.5072848796844482, "rewards/rejected": -1.3801133632659912, "step": 90, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.17229749718951543, "grad_norm": 3.9667158126831055, "learning_rate": 0.0001999736038650243, "logits/chosen": -0.6727519035339355, "logits/rejected": -0.678146243095398, "logps/chosen": -3.9062070846557617, "logps/rejected": -40.605716705322266, "loss": 0.5808683633804321, "memory(GiB)": 45.96, "nll_loss": 0.29070931673049927, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3750736713409424, "rewards/margins": 2.2590668201446533, "rewards/rejected": -1.883993148803711, "step": 91, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.17419087627951008, "grad_norm": 2.966646909713745, "learning_rate": 0.00019996858668058646, "logits/chosen": -0.6560570597648621, "logits/rejected": -0.6633113622665405, "logps/chosen": -6.821100234985352, "logps/rejected": -35.842308044433594, "loss": 0.5389344096183777, "memory(GiB)": 45.96, "nll_loss": 0.22853048145771027, "rewards/accuracies": 0.78125, "rewards/chosen": 0.33146628737449646, "rewards/margins": 2.221740484237671, "rewards/rejected": -1.8902742862701416, "step": 92, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.17608425536950476, "grad_norm": 4.352930068969727, "learning_rate": 0.0001999631333144221, "logits/chosen": -0.6744297742843628, "logits/rejected": -0.6817238926887512, "logps/chosen": -10.121214866638184, "logps/rejected": -45.07015609741211, "loss": 0.7165765166282654, "memory(GiB)": 45.96, "nll_loss": 0.36157098412513733, "rewards/accuracies": 0.71875, "rewards/chosen": 0.3100533187389374, "rewards/margins": 2.3896117210388184, "rewards/rejected": -2.0795583724975586, "step": 93, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.17797763445949943, "grad_norm": 3.650033473968506, "learning_rate": 0.00019995724379032526, "logits/chosen": -0.6463199257850647, "logits/rejected": -0.6561610102653503, "logps/chosen": -5.5554704666137695, "logps/rejected": -39.192264556884766, "loss": 0.7099438309669495, "memory(GiB)": 45.96, "nll_loss": 0.3186087906360626, "rewards/accuracies": 0.875, "rewards/chosen": 0.28469714522361755, "rewards/margins": 2.1725757122039795, "rewards/rejected": -1.887878656387329, "step": 94, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.1798710135494941, "grad_norm": 3.6392762660980225, "learning_rate": 0.00019995091813399305, "logits/chosen": -0.6218971014022827, "logits/rejected": -0.6236589550971985, "logps/chosen": -9.031105041503906, "logps/rejected": -29.54071044921875, "loss": 0.7348965406417847, "memory(GiB)": 45.96, "nll_loss": 0.35691019892692566, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3281153440475464, "rewards/margins": 1.6330987215042114, "rewards/rejected": -1.3049836158752441, "step": 95, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.1817643926394888, "grad_norm": 4.513101100921631, "learning_rate": 0.00019994415637302547, "logits/chosen": -0.6518260836601257, "logits/rejected": -0.6591805815696716, "logps/chosen": -3.454824447631836, "logps/rejected": -40.539100646972656, "loss": 0.4428410232067108, "memory(GiB)": 45.96, "nll_loss": 0.16427120566368103, "rewards/accuracies": 0.90625, "rewards/chosen": 0.29650911688804626, "rewards/margins": 1.9197403192520142, "rewards/rejected": -1.623231053352356, "step": 96, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.18365777172948347, "grad_norm": 3.081139087677002, "learning_rate": 0.00019993695853692537, "logits/chosen": -0.6301771402359009, "logits/rejected": -0.6361221671104431, "logps/chosen": -5.919186592102051, "logps/rejected": -33.726078033447266, "loss": 0.6770766377449036, "memory(GiB)": 45.96, "nll_loss": 0.3173068165779114, "rewards/accuracies": 0.8125, "rewards/chosen": 0.288848340511322, "rewards/margins": 1.7297114133834839, "rewards/rejected": -1.4408631324768066, "step": 97, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.18555115081947815, "grad_norm": 5.967331409454346, "learning_rate": 0.0001999293246570983, "logits/chosen": -0.6614546179771423, "logits/rejected": -0.6638529300689697, "logps/chosen": -6.57697057723999, "logps/rejected": -30.82279396057129, "loss": 0.6938097476959229, "memory(GiB)": 45.96, "nll_loss": 0.23730693757534027, "rewards/accuracies": 0.71875, "rewards/chosen": 0.24900805950164795, "rewards/margins": 1.5996767282485962, "rewards/rejected": -1.3506686687469482, "step": 98, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.1874445299094728, "grad_norm": 2.659550428390503, "learning_rate": 0.0001999212547668523, "logits/chosen": -0.6610513925552368, "logits/rejected": -0.6650281548500061, "logps/chosen": -7.570089817047119, "logps/rejected": -41.5615348815918, "loss": 0.521258533000946, "memory(GiB)": 45.96, "nll_loss": 0.34517771005630493, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28127947449684143, "rewards/margins": 2.645756244659424, "rewards/rejected": -2.3644769191741943, "step": 99, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.18933790899946748, "grad_norm": 12.499390602111816, "learning_rate": 0.00019991274890139774, "logits/chosen": -0.5981582403182983, "logits/rejected": -0.5984249114990234, "logps/chosen": -5.772880554199219, "logps/rejected": -36.335723876953125, "loss": 0.5674217939376831, "memory(GiB)": 45.96, "nll_loss": 0.3134133517742157, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3456924557685852, "rewards/margins": 2.240718364715576, "rewards/rejected": -1.8950259685516357, "step": 100, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.19123128808946216, "grad_norm": 8.361610412597656, "learning_rate": 0.00019990380709784743, "logits/chosen": -0.6467748880386353, "logits/rejected": -0.6568058133125305, "logps/chosen": -6.142106056213379, "logps/rejected": -42.85158920288086, "loss": 0.7210798859596252, "memory(GiB)": 45.96, "nll_loss": 0.48578304052352905, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24581415951251984, "rewards/margins": 2.62912917137146, "rewards/rejected": -2.383315086364746, "step": 101, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.19312466717945684, "grad_norm": 8.87897777557373, "learning_rate": 0.00019989442939521602, "logits/chosen": -0.6422844529151917, "logits/rejected": -0.6491110324859619, "logps/chosen": -4.283577919006348, "logps/rejected": -44.210323333740234, "loss": 0.4512465298175812, "memory(GiB)": 45.96, "nll_loss": 0.18845491111278534, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2913907766342163, "rewards/margins": 2.8169469833374023, "rewards/rejected": -2.5255563259124756, "step": 102, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.19501804626945152, "grad_norm": 5.385126113891602, "learning_rate": 0.0001998846158344203, "logits/chosen": -0.6668524742126465, "logits/rejected": -0.6711164712905884, "logps/chosen": -8.307709693908691, "logps/rejected": -46.651424407958984, "loss": 0.5795091986656189, "memory(GiB)": 45.96, "nll_loss": 0.2871760427951813, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2825217843055725, "rewards/margins": 3.175206422805786, "rewards/rejected": -2.8926849365234375, "step": 103, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.1969114253594462, "grad_norm": 5.178345680236816, "learning_rate": 0.0001998743664582786, "logits/chosen": -0.6665439009666443, "logits/rejected": -0.6732444763183594, "logps/chosen": -6.044788360595703, "logps/rejected": -49.20276641845703, "loss": 0.5723894834518433, "memory(GiB)": 45.96, "nll_loss": 0.30348485708236694, "rewards/accuracies": 0.8125, "rewards/chosen": 0.4383161664009094, "rewards/margins": 3.547417402267456, "rewards/rejected": -3.1091012954711914, "step": 104, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.19880480444944088, "grad_norm": 13.239428520202637, "learning_rate": 0.00019986368131151086, "logits/chosen": -0.6453922390937805, "logits/rejected": -0.6535012125968933, "logps/chosen": -6.758315086364746, "logps/rejected": -47.57633590698242, "loss": 0.8193904161453247, "memory(GiB)": 45.96, "nll_loss": 0.48707395792007446, "rewards/accuracies": 0.75, "rewards/chosen": 0.25950154662132263, "rewards/margins": 2.7850496768951416, "rewards/rejected": -2.5255484580993652, "step": 105, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.20069818353943553, "grad_norm": 8.258339881896973, "learning_rate": 0.00019985256044073848, "logits/chosen": -0.6464555263519287, "logits/rejected": -0.6525677442550659, "logps/chosen": -8.009160995483398, "logps/rejected": -44.356807708740234, "loss": 0.8658470511436462, "memory(GiB)": 45.96, "nll_loss": 0.40163958072662354, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08035992085933685, "rewards/margins": 2.636491537094116, "rewards/rejected": -2.556131601333618, "step": 106, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.2025915626294302, "grad_norm": 5.688174247741699, "learning_rate": 0.0001998410038944838, "logits/chosen": -0.6843658685684204, "logits/rejected": -0.6876212358474731, "logps/chosen": -2.5727243423461914, "logps/rejected": -29.177391052246094, "loss": 0.4456700086593628, "memory(GiB)": 45.96, "nll_loss": 0.15025635063648224, "rewards/accuracies": 0.90625, "rewards/chosen": 0.46042385697364807, "rewards/margins": 1.8946454524993896, "rewards/rejected": -1.434221863746643, "step": 107, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.20448494171942488, "grad_norm": 2.6327826976776123, "learning_rate": 0.00019982901172317031, "logits/chosen": -0.6323860287666321, "logits/rejected": -0.6346494555473328, "logps/chosen": -8.630059242248535, "logps/rejected": -31.78713035583496, "loss": 0.6648795008659363, "memory(GiB)": 45.96, "nll_loss": 0.2702806890010834, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19947871565818787, "rewards/margins": 1.5066046714782715, "rewards/rejected": -1.3071260452270508, "step": 108, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.20637832080941956, "grad_norm": 2.5843868255615234, "learning_rate": 0.000199816583979122, "logits/chosen": -0.5910162329673767, "logits/rejected": -0.5975123047828674, "logps/chosen": -3.9122486114501953, "logps/rejected": -28.35757064819336, "loss": 0.6974324584007263, "memory(GiB)": 45.96, "nll_loss": 0.3021320104598999, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3400159180164337, "rewards/margins": 1.3856966495513916, "rewards/rejected": -1.0456807613372803, "step": 109, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.20827169989941424, "grad_norm": 5.559172630310059, "learning_rate": 0.00019980372071656352, "logits/chosen": -0.6566262245178223, "logits/rejected": -0.6621754169464111, "logps/chosen": -6.803584575653076, "logps/rejected": -29.84942626953125, "loss": 0.84231036901474, "memory(GiB)": 45.96, "nll_loss": 0.47532981634140015, "rewards/accuracies": 0.8125, "rewards/chosen": 0.30856069922447205, "rewards/margins": 1.5043147802352905, "rewards/rejected": -1.195754051208496, "step": 110, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.21016507898940892, "grad_norm": 3.415010929107666, "learning_rate": 0.0001997904219916197, "logits/chosen": -0.6346056461334229, "logits/rejected": -0.6350025534629822, "logps/chosen": -11.599414825439453, "logps/rejected": -30.610013961791992, "loss": 0.7572425007820129, "memory(GiB)": 45.96, "nll_loss": 0.36608272790908813, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2624809741973877, "rewards/margins": 1.713860034942627, "rewards/rejected": -1.4513791799545288, "step": 111, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.21205845807940357, "grad_norm": 3.41812801361084, "learning_rate": 0.00019977668786231534, "logits/chosen": -0.6841356754302979, "logits/rejected": -0.6936293840408325, "logps/chosen": -5.25693416595459, "logps/rejected": -32.669185638427734, "loss": 0.741496741771698, "memory(GiB)": 45.96, "nll_loss": 0.313353031873703, "rewards/accuracies": 0.8125, "rewards/chosen": 0.24570311605930328, "rewards/margins": 1.6960662603378296, "rewards/rejected": -1.450363278388977, "step": 112, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.21395183716939825, "grad_norm": 2.2650668621063232, "learning_rate": 0.00019976251838857502, "logits/chosen": -0.7449254393577576, "logits/rejected": -0.75071120262146, "logps/chosen": -4.380943298339844, "logps/rejected": -35.95576858520508, "loss": 0.4989684820175171, "memory(GiB)": 45.96, "nll_loss": 0.22844262421131134, "rewards/accuracies": 0.90625, "rewards/chosen": 0.36053481698036194, "rewards/margins": 2.2524986267089844, "rewards/rejected": -1.8919636011123657, "step": 113, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.21584521625939293, "grad_norm": 4.310145378112793, "learning_rate": 0.0001997479136322229, "logits/chosen": -0.7409523129463196, "logits/rejected": -0.7497206330299377, "logps/chosen": -4.750667572021484, "logps/rejected": -48.04157638549805, "loss": 0.6291773915290833, "memory(GiB)": 45.96, "nll_loss": 0.25920921564102173, "rewards/accuracies": 0.84375, "rewards/chosen": 0.24817335605621338, "rewards/margins": 3.173919677734375, "rewards/rejected": -2.925746202468872, "step": 114, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.2177385953493876, "grad_norm": 49.79676818847656, "learning_rate": 0.00019973287365698217, "logits/chosen": -0.6885964274406433, "logits/rejected": -0.6920081973075867, "logps/chosen": -8.995617866516113, "logps/rejected": -50.670982360839844, "loss": 0.8429219722747803, "memory(GiB)": 45.96, "nll_loss": 0.6063740849494934, "rewards/accuracies": 0.875, "rewards/chosen": -0.02555127628147602, "rewards/margins": 3.5049619674682617, "rewards/rejected": -3.530513286590576, "step": 115, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.2196319744393823, "grad_norm": 24.369260787963867, "learning_rate": 0.00019971739852847514, "logits/chosen": -0.7350776791572571, "logits/rejected": -0.7412790656089783, "logps/chosen": -11.02401065826416, "logps/rejected": -58.75929260253906, "loss": 1.4918644428253174, "memory(GiB)": 45.96, "nll_loss": 1.1034432649612427, "rewards/accuracies": 0.8125, "rewards/chosen": -0.35152652859687805, "rewards/margins": 3.6628317832946777, "rewards/rejected": -4.0143585205078125, "step": 116, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.22152535352937697, "grad_norm": 5.370579719543457, "learning_rate": 0.00019970148831422265, "logits/chosen": -0.7471648454666138, "logits/rejected": -0.7545170187950134, "logps/chosen": -8.818143844604492, "logps/rejected": -56.34012985229492, "loss": 0.5391644239425659, "memory(GiB)": 45.96, "nll_loss": 0.3180984854698181, "rewards/accuracies": 0.84375, "rewards/chosen": 0.27325814962387085, "rewards/margins": 3.91802978515625, "rewards/rejected": -3.6447718143463135, "step": 117, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.22341873261937165, "grad_norm": 3.5595195293426514, "learning_rate": 0.00019968514308364398, "logits/chosen": -0.7581095099449158, "logits/rejected": -0.7644103765487671, "logps/chosen": -5.872043609619141, "logps/rejected": -59.083518981933594, "loss": 0.5253903865814209, "memory(GiB)": 45.96, "nll_loss": 0.2678287923336029, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3531153202056885, "rewards/margins": 4.330952167510986, "rewards/rejected": -3.977836847305298, "step": 118, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.2253121117093663, "grad_norm": 5.7043280601501465, "learning_rate": 0.00019966836290805648, "logits/chosen": -0.7545002102851868, "logits/rejected": -0.7589887380599976, "logps/chosen": -5.470965385437012, "logps/rejected": -45.09376525878906, "loss": 0.5245931148529053, "memory(GiB)": 45.96, "nll_loss": 0.3320286273956299, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1665220558643341, "rewards/margins": 2.904370069503784, "rewards/rejected": -2.7378478050231934, "step": 119, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.22720549079936098, "grad_norm": 9.95584774017334, "learning_rate": 0.00019965114786067516, "logits/chosen": -0.7246638536453247, "logits/rejected": -0.7372928261756897, "logps/chosen": -9.260250091552734, "logps/rejected": -49.462730407714844, "loss": 0.6747857928276062, "memory(GiB)": 45.96, "nll_loss": 0.39999300241470337, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3001291751861572, "rewards/margins": 3.218559980392456, "rewards/rejected": -2.918430805206299, "step": 120, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.22909886988935566, "grad_norm": 3.724515676498413, "learning_rate": 0.00019963349801661252, "logits/chosen": -0.772263765335083, "logits/rejected": -0.7768078446388245, "logps/chosen": -3.9073729515075684, "logps/rejected": -37.0045051574707, "loss": 0.4512227177619934, "memory(GiB)": 45.96, "nll_loss": 0.22428500652313232, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24837777018547058, "rewards/margins": 2.6941304206848145, "rewards/rejected": -2.4457523822784424, "step": 121, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.23099224897935033, "grad_norm": 3.838991403579712, "learning_rate": 0.00019961541345287815, "logits/chosen": -0.7484467029571533, "logits/rejected": -0.7612442374229431, "logps/chosen": -5.860817909240723, "logps/rejected": -57.7578125, "loss": 0.6650333404541016, "memory(GiB)": 45.96, "nll_loss": 0.44994574785232544, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3677416145801544, "rewards/margins": 3.3471570014953613, "rewards/rejected": -2.9794154167175293, "step": 122, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.232885628069345, "grad_norm": 8.47818374633789, "learning_rate": 0.0001995968942483784, "logits/chosen": -0.7861376404762268, "logits/rejected": -0.7918702960014343, "logps/chosen": -6.540744304656982, "logps/rejected": -44.694793701171875, "loss": 0.686521053314209, "memory(GiB)": 45.96, "nll_loss": 0.3082555830478668, "rewards/accuracies": 0.84375, "rewards/chosen": 0.23747095465660095, "rewards/margins": 3.017436981201172, "rewards/rejected": -2.779966115951538, "step": 123, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.2347790071593397, "grad_norm": 4.60905647277832, "learning_rate": 0.00019957794048391602, "logits/chosen": -0.7763262391090393, "logits/rejected": -0.7869465947151184, "logps/chosen": -3.775228261947632, "logps/rejected": -50.85580062866211, "loss": 0.4823143184185028, "memory(GiB)": 45.96, "nll_loss": 0.18497991561889648, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3380104899406433, "rewards/margins": 3.654966115951538, "rewards/rejected": -3.316955089569092, "step": 124, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.23667238624933437, "grad_norm": 8.420757293701172, "learning_rate": 0.00019955855224218985, "logits/chosen": -0.7525299787521362, "logits/rejected": -0.7635971903800964, "logps/chosen": -6.437612533569336, "logps/rejected": -38.99058532714844, "loss": 0.8981273174285889, "memory(GiB)": 45.96, "nll_loss": 0.4748547673225403, "rewards/accuracies": 0.8125, "rewards/chosen": 0.15252822637557983, "rewards/margins": 2.468339443206787, "rewards/rejected": -2.3158111572265625, "step": 125, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.23856576533932902, "grad_norm": 4.813470363616943, "learning_rate": 0.00019953872960779445, "logits/chosen": -0.7726767063140869, "logits/rejected": -0.7802519202232361, "logps/chosen": -8.317635536193848, "logps/rejected": -43.16456985473633, "loss": 0.8319203853607178, "memory(GiB)": 45.96, "nll_loss": 0.31651198863983154, "rewards/accuracies": 0.625, "rewards/chosen": 0.013967695645987988, "rewards/margins": 2.4464800357818604, "rewards/rejected": -2.4325122833251953, "step": 126, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.2404591444293237, "grad_norm": 3.016392469406128, "learning_rate": 0.0001995184726672197, "logits/chosen": -0.7210108637809753, "logits/rejected": -0.7305353283882141, "logps/chosen": -6.296525478363037, "logps/rejected": -46.77278137207031, "loss": 0.6447858214378357, "memory(GiB)": 45.96, "nll_loss": 0.3108886778354645, "rewards/accuracies": 0.78125, "rewards/chosen": 0.26448336243629456, "rewards/margins": 2.491849660873413, "rewards/rejected": -2.2273662090301514, "step": 127, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.24235252351931838, "grad_norm": 1.984066128730774, "learning_rate": 0.00019949778150885042, "logits/chosen": -0.7717783451080322, "logits/rejected": -0.7797784805297852, "logps/chosen": -3.87850022315979, "logps/rejected": -53.567745208740234, "loss": 0.31897497177124023, "memory(GiB)": 45.96, "nll_loss": 0.15310946106910706, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2823570668697357, "rewards/margins": 3.53421688079834, "rewards/rejected": -3.2518601417541504, "step": 128, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.24424590260931306, "grad_norm": 2.775517225265503, "learning_rate": 0.00019947665622296602, "logits/chosen": -0.721402645111084, "logits/rejected": -0.7311292886734009, "logps/chosen": -3.766075611114502, "logps/rejected": -40.414039611816406, "loss": 0.5010823011398315, "memory(GiB)": 45.96, "nll_loss": 0.24178192019462585, "rewards/accuracies": 0.875, "rewards/chosen": 0.3318912386894226, "rewards/margins": 2.27069091796875, "rewards/rejected": -1.9387996196746826, "step": 129, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.24613928169930774, "grad_norm": 3.1850295066833496, "learning_rate": 0.00019945509690174012, "logits/chosen": -0.7250795960426331, "logits/rejected": -0.7257798910140991, "logps/chosen": -6.547388553619385, "logps/rejected": -31.564491271972656, "loss": 0.6416950821876526, "memory(GiB)": 45.96, "nll_loss": 0.2817922532558441, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25322476029396057, "rewards/margins": 1.9835402965545654, "rewards/rejected": -1.7303153276443481, "step": 130, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.24803266078930242, "grad_norm": 3.2285263538360596, "learning_rate": 0.00019943310363924007, "logits/chosen": -0.7049883604049683, "logits/rejected": -0.7214145064353943, "logps/chosen": -7.687161445617676, "logps/rejected": -48.23120880126953, "loss": 0.5076671838760376, "memory(GiB)": 45.96, "nll_loss": 0.29537200927734375, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3577454090118408, "rewards/margins": 2.9845407009124756, "rewards/rejected": -2.6267952919006348, "step": 131, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.2499260398792971, "grad_norm": 3.9876368045806885, "learning_rate": 0.00019941067653142657, "logits/chosen": -0.7751510143280029, "logits/rejected": -0.779951274394989, "logps/chosen": -5.9425530433654785, "logps/rejected": -44.56589126586914, "loss": 0.7343396544456482, "memory(GiB)": 45.96, "nll_loss": 0.40883925557136536, "rewards/accuracies": 0.8125, "rewards/chosen": 0.26840847730636597, "rewards/margins": 2.8791656494140625, "rewards/rejected": -2.6107571125030518, "step": 132, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.2518194189692918, "grad_norm": 3.382171869277954, "learning_rate": 0.00019938781567615336, "logits/chosen": -0.7755506038665771, "logits/rejected": -0.7845891714096069, "logps/chosen": -7.24715518951416, "logps/rejected": -44.12371063232422, "loss": 0.6991584300994873, "memory(GiB)": 45.96, "nll_loss": 0.410519003868103, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21389470994472504, "rewards/margins": 2.8707995414733887, "rewards/rejected": -2.65690541267395, "step": 133, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.2537127980592864, "grad_norm": 5.093874931335449, "learning_rate": 0.00019936452117316663, "logits/chosen": -0.8056867718696594, "logits/rejected": -0.809194803237915, "logps/chosen": -9.516021728515625, "logps/rejected": -56.02266311645508, "loss": 0.6206343770027161, "memory(GiB)": 45.96, "nll_loss": 0.3526919484138489, "rewards/accuracies": 0.875, "rewards/chosen": 0.2024693489074707, "rewards/margins": 4.063340187072754, "rewards/rejected": -3.860870838165283, "step": 134, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.25560617714928113, "grad_norm": 4.6863226890563965, "learning_rate": 0.00019934079312410467, "logits/chosen": -0.8240848183631897, "logits/rejected": -0.8471858501434326, "logps/chosen": -3.86633563041687, "logps/rejected": -100.45770263671875, "loss": 0.33894628286361694, "memory(GiB)": 45.96, "nll_loss": 0.22375458478927612, "rewards/accuracies": 0.9375, "rewards/chosen": 0.31900501251220703, "rewards/margins": 7.854244232177734, "rewards/rejected": -7.535239219665527, "step": 135, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.2574995562392758, "grad_norm": 3.567854404449463, "learning_rate": 0.00019931663163249742, "logits/chosen": -0.8480275273323059, "logits/rejected": -0.8538500070571899, "logps/chosen": -9.888245582580566, "logps/rejected": -45.75389099121094, "loss": 0.6490932106971741, "memory(GiB)": 45.96, "nll_loss": 0.3520674705505371, "rewards/accuracies": 0.8125, "rewards/chosen": 0.28484463691711426, "rewards/margins": 3.3431763648986816, "rewards/rejected": -3.0583324432373047, "step": 136, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.25939293532927044, "grad_norm": 4.430754661560059, "learning_rate": 0.000199292036803766, "logits/chosen": -0.8859494924545288, "logits/rejected": -0.8960965275764465, "logps/chosen": -10.031050682067871, "logps/rejected": -64.34874725341797, "loss": 0.6498712301254272, "memory(GiB)": 45.96, "nll_loss": 0.4804614186286926, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3784683644771576, "rewards/margins": 5.330948352813721, "rewards/rejected": -4.952479839324951, "step": 137, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.26128631441926514, "grad_norm": 7.582626819610596, "learning_rate": 0.00019926700874522228, "logits/chosen": -0.8495133519172668, "logits/rejected": -0.8645675778388977, "logps/chosen": -8.528069496154785, "logps/rejected": -57.99681854248047, "loss": 1.0912293195724487, "memory(GiB)": 45.96, "nll_loss": 0.8290497064590454, "rewards/accuracies": 0.90625, "rewards/chosen": 0.18979007005691528, "rewards/margins": 4.3057451248168945, "rewards/rejected": -4.115954399108887, "step": 138, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.2631796935092598, "grad_norm": 23.314302444458008, "learning_rate": 0.00019924154756606837, "logits/chosen": -0.8541093468666077, "logits/rejected": -0.8688046932220459, "logps/chosen": -5.522783279418945, "logps/rejected": -79.18603515625, "loss": 0.5735315084457397, "memory(GiB)": 45.96, "nll_loss": 0.3679307699203491, "rewards/accuracies": 0.9375, "rewards/chosen": 0.20842784643173218, "rewards/margins": 6.1773834228515625, "rewards/rejected": -5.9689555168151855, "step": 139, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.2650730725992545, "grad_norm": 12.074163436889648, "learning_rate": 0.0001992156533773962, "logits/chosen": -0.8475787043571472, "logits/rejected": -0.8581144213676453, "logps/chosen": -4.404082298278809, "logps/rejected": -69.51590728759766, "loss": 0.6005671620368958, "memory(GiB)": 45.96, "nll_loss": 0.41126585006713867, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12076976895332336, "rewards/margins": 5.504639148712158, "rewards/rejected": -5.383869171142578, "step": 140, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.26696645168924915, "grad_norm": 14.37826156616211, "learning_rate": 0.00019918932629218693, "logits/chosen": -0.7814698219299316, "logits/rejected": -0.7934913039207458, "logps/chosen": -7.017152309417725, "logps/rejected": -53.27716827392578, "loss": 1.1257140636444092, "memory(GiB)": 45.96, "nll_loss": 0.8658289909362793, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10481896996498108, "rewards/margins": 3.3784234523773193, "rewards/rejected": -3.273604393005371, "step": 141, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.26885983077924386, "grad_norm": 5.494270324707031, "learning_rate": 0.00019916256642531064, "logits/chosen": -0.7829540371894836, "logits/rejected": -0.7963675856590271, "logps/chosen": -8.385337829589844, "logps/rejected": -51.070316314697266, "loss": 0.7671561241149902, "memory(GiB)": 45.96, "nll_loss": 0.5193882584571838, "rewards/accuracies": 0.9375, "rewards/chosen": 0.04612942785024643, "rewards/margins": 3.2342934608459473, "rewards/rejected": -3.188163995742798, "step": 142, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.2707532098692385, "grad_norm": 10.173422813415527, "learning_rate": 0.00019913537389352565, "logits/chosen": -0.7792036533355713, "logits/rejected": -0.7820754647254944, "logps/chosen": -11.546073913574219, "logps/rejected": -36.85886001586914, "loss": 1.2373579740524292, "memory(GiB)": 45.96, "nll_loss": 0.7483444809913635, "rewards/accuracies": 0.875, "rewards/chosen": 0.11113296449184418, "rewards/margins": 2.2868616580963135, "rewards/rejected": -2.1757285594940186, "step": 143, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.27264658895923316, "grad_norm": 10.165970802307129, "learning_rate": 0.000199107748815478, "logits/chosen": -0.7335910201072693, "logits/rejected": -0.7423563599586487, "logps/chosen": -5.789748668670654, "logps/rejected": -51.16117858886719, "loss": 0.5209447741508484, "memory(GiB)": 45.96, "nll_loss": 0.26225852966308594, "rewards/accuracies": 0.875, "rewards/chosen": 0.34096524119377136, "rewards/margins": 3.562436103820801, "rewards/rejected": -3.221470832824707, "step": 144, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.27453996804922787, "grad_norm": 3.7743449211120605, "learning_rate": 0.00019907969131170123, "logits/chosen": -0.6795719861984253, "logits/rejected": -0.687801718711853, "logps/chosen": -5.778347969055176, "logps/rejected": -36.02931213378906, "loss": 0.746212363243103, "memory(GiB)": 45.96, "nll_loss": 0.41548293828964233, "rewards/accuracies": 0.84375, "rewards/chosen": 0.17704080045223236, "rewards/margins": 2.0213520526885986, "rewards/rejected": -1.8443111181259155, "step": 145, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.2764333471392225, "grad_norm": 8.021881103515625, "learning_rate": 0.0001990512015046154, "logits/chosen": -0.7164587378501892, "logits/rejected": -0.724740207195282, "logps/chosen": -11.131789207458496, "logps/rejected": -47.94390869140625, "loss": 0.7136993408203125, "memory(GiB)": 45.96, "nll_loss": 0.46022000908851624, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19410860538482666, "rewards/margins": 3.1541659832000732, "rewards/rejected": -2.960057497024536, "step": 146, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.2783267262292172, "grad_norm": 2.5674595832824707, "learning_rate": 0.00019902227951852693, "logits/chosen": -0.6974028944969177, "logits/rejected": -0.7133046984672546, "logps/chosen": -5.312131881713867, "logps/rejected": -56.97577667236328, "loss": 0.546694815158844, "memory(GiB)": 45.96, "nll_loss": 0.2678171694278717, "rewards/accuracies": 0.875, "rewards/chosen": 0.3132306933403015, "rewards/margins": 3.396456003189087, "rewards/rejected": -3.0832252502441406, "step": 147, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.2802201053192119, "grad_norm": 2.6228554248809814, "learning_rate": 0.00019899292547962788, "logits/chosen": -0.6645054221153259, "logits/rejected": -0.6710233092308044, "logps/chosen": -5.465825080871582, "logps/rejected": -34.39421463012695, "loss": 0.5485950112342834, "memory(GiB)": 45.96, "nll_loss": 0.24020352959632874, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2989718019962311, "rewards/margins": 1.9927932024002075, "rewards/rejected": -1.6938214302062988, "step": 148, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.2821134844092066, "grad_norm": 3.143923759460449, "learning_rate": 0.0001989631395159954, "logits/chosen": -0.6561654806137085, "logits/rejected": -0.6622195243835449, "logps/chosen": -4.917874813079834, "logps/rejected": -40.90203094482422, "loss": 0.47251078486442566, "memory(GiB)": 45.96, "nll_loss": 0.18277724087238312, "rewards/accuracies": 0.78125, "rewards/chosen": 0.34272196888923645, "rewards/margins": 2.234957695007324, "rewards/rejected": -1.892235517501831, "step": 149, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.28400686349920123, "grad_norm": 2.255929946899414, "learning_rate": 0.00019893292175759131, "logits/chosen": -0.700336754322052, "logits/rejected": -0.7083441615104675, "logps/chosen": -6.8965606689453125, "logps/rejected": -33.876731872558594, "loss": 0.5560379028320312, "memory(GiB)": 45.96, "nll_loss": 0.23617547750473022, "rewards/accuracies": 0.875, "rewards/chosen": 0.3127138316631317, "rewards/margins": 1.6684951782226562, "rewards/rejected": -1.3557813167572021, "step": 150, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.2859002425891959, "grad_norm": 3.593722105026245, "learning_rate": 0.00019890227233626133, "logits/chosen": -0.6745707392692566, "logits/rejected": -0.6865944862365723, "logps/chosen": -6.157535076141357, "logps/rejected": -43.30187225341797, "loss": 0.5548833012580872, "memory(GiB)": 45.96, "nll_loss": 0.3123031556606293, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37635695934295654, "rewards/margins": 2.288217306137085, "rewards/rejected": -1.911860466003418, "step": 151, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.2877936216791906, "grad_norm": 3.031252861022949, "learning_rate": 0.0001988711913857346, "logits/chosen": -0.6861976385116577, "logits/rejected": -0.6901456713676453, "logps/chosen": -6.361867427825928, "logps/rejected": -32.86566162109375, "loss": 0.6771292090415955, "memory(GiB)": 45.96, "nll_loss": 0.35346654057502747, "rewards/accuracies": 0.84375, "rewards/chosen": 0.26746034622192383, "rewards/margins": 1.8923015594482422, "rewards/rejected": -1.6248412132263184, "step": 152, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.28968700076918524, "grad_norm": 3.878405809402466, "learning_rate": 0.00019883967904162325, "logits/chosen": -0.7064144611358643, "logits/rejected": -0.7097403407096863, "logps/chosen": -4.3548808097839355, "logps/rejected": -32.47248458862305, "loss": 0.5777835249900818, "memory(GiB)": 45.96, "nll_loss": 0.2289128601551056, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3213263750076294, "rewards/margins": 2.1042110919952393, "rewards/rejected": -1.7828848361968994, "step": 153, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.29158037985917995, "grad_norm": 3.498708724975586, "learning_rate": 0.00019880773544142148, "logits/chosen": -0.7486563324928284, "logits/rejected": -0.7543911933898926, "logps/chosen": -5.338995933532715, "logps/rejected": -37.15753173828125, "loss": 0.46198132634162903, "memory(GiB)": 45.96, "nll_loss": 0.21741318702697754, "rewards/accuracies": 0.9375, "rewards/chosen": 0.388688325881958, "rewards/margins": 2.447216033935547, "rewards/rejected": -2.058527708053589, "step": 154, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.2934737589491746, "grad_norm": 4.984945297241211, "learning_rate": 0.00019877536072450527, "logits/chosen": -0.7390610575675964, "logits/rejected": -0.7399532794952393, "logps/chosen": -10.968379020690918, "logps/rejected": -33.57049560546875, "loss": 0.718737006187439, "memory(GiB)": 45.96, "nll_loss": 0.3964201509952545, "rewards/accuracies": 0.78125, "rewards/chosen": 0.036715492606163025, "rewards/margins": 1.7534269094467163, "rewards/rejected": -1.7167115211486816, "step": 155, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.29536713803916925, "grad_norm": 7.5653076171875, "learning_rate": 0.00019874255503213152, "logits/chosen": -0.7588214874267578, "logits/rejected": -0.7610840797424316, "logps/chosen": -5.5218400955200195, "logps/rejected": -35.822601318359375, "loss": 0.6484081745147705, "memory(GiB)": 45.96, "nll_loss": 0.2997969686985016, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3626272678375244, "rewards/margins": 2.2176332473754883, "rewards/rejected": -1.8550057411193848, "step": 156, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.29726051712916396, "grad_norm": 5.305218696594238, "learning_rate": 0.0001987093185074377, "logits/chosen": -0.7636702656745911, "logits/rejected": -0.7821192145347595, "logps/chosen": -6.363223552703857, "logps/rejected": -50.883975982666016, "loss": 0.7150736451148987, "memory(GiB)": 45.96, "nll_loss": 0.47810113430023193, "rewards/accuracies": 0.875, "rewards/chosen": 0.28776872158050537, "rewards/margins": 2.793571710586548, "rewards/rejected": -2.505803108215332, "step": 157, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.2991538962191586, "grad_norm": 5.158674716949463, "learning_rate": 0.00019867565129544096, "logits/chosen": -0.7358605861663818, "logits/rejected": -0.7439287900924683, "logps/chosen": -7.443007469177246, "logps/rejected": -38.113685607910156, "loss": 0.6584007740020752, "memory(GiB)": 45.96, "nll_loss": 0.46212419867515564, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1576625108718872, "rewards/margins": 2.456287384033203, "rewards/rejected": -2.2986247539520264, "step": 158, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.3010472753091533, "grad_norm": 1.6912269592285156, "learning_rate": 0.00019864155354303774, "logits/chosen": -0.7355219125747681, "logits/rejected": -0.7489408850669861, "logps/chosen": -6.299466133117676, "logps/rejected": -53.93749237060547, "loss": 0.4212099313735962, "memory(GiB)": 45.96, "nll_loss": 0.3141719102859497, "rewards/accuracies": 0.96875, "rewards/chosen": 0.42553815245628357, "rewards/margins": 3.6282081604003906, "rewards/rejected": -3.202670097351074, "step": 159, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.30294065439914797, "grad_norm": 2.9518110752105713, "learning_rate": 0.00019860702539900287, "logits/chosen": -0.7960153818130493, "logits/rejected": -0.8071813583374023, "logps/chosen": -3.6753034591674805, "logps/rejected": -49.42953872680664, "loss": 0.40266910195350647, "memory(GiB)": 45.96, "nll_loss": 0.17762762308120728, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2651080787181854, "rewards/margins": 3.387268304824829, "rewards/rejected": -3.1221606731414795, "step": 160, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.3048340334891427, "grad_norm": 3.5469512939453125, "learning_rate": 0.00019857206701398916, "logits/chosen": -0.8305792808532715, "logits/rejected": -0.8400905728340149, "logps/chosen": -5.762335300445557, "logps/rejected": -47.677391052246094, "loss": 0.5519442558288574, "memory(GiB)": 45.96, "nll_loss": 0.2981826364994049, "rewards/accuracies": 0.875, "rewards/chosen": 0.3638038635253906, "rewards/margins": 3.451838493347168, "rewards/rejected": -3.0880346298217773, "step": 161, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.3067274125791373, "grad_norm": 2.6079318523406982, "learning_rate": 0.00019853667854052663, "logits/chosen": -0.8280395865440369, "logits/rejected": -0.8434029221534729, "logps/chosen": -4.625239849090576, "logps/rejected": -66.49324798583984, "loss": 0.4290291368961334, "memory(GiB)": 45.96, "nll_loss": 0.20821890234947205, "rewards/accuracies": 0.84375, "rewards/chosen": 0.35179567337036133, "rewards/margins": 4.545844078063965, "rewards/rejected": -4.1940484046936035, "step": 162, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.308620791669132, "grad_norm": 2.6247661113739014, "learning_rate": 0.00019850086013302177, "logits/chosen": -0.8385536074638367, "logits/rejected": -0.8439200520515442, "logps/chosen": -5.475846290588379, "logps/rejected": -41.36055374145508, "loss": 0.5085667371749878, "memory(GiB)": 45.96, "nll_loss": 0.22582083940505981, "rewards/accuracies": 0.8125, "rewards/chosen": 0.21153010427951813, "rewards/margins": 2.7622647285461426, "rewards/rejected": -2.550734519958496, "step": 163, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3105141707591267, "grad_norm": 4.81837797164917, "learning_rate": 0.00019846461194775712, "logits/chosen": -0.8339718580245972, "logits/rejected": -0.8418379426002502, "logps/chosen": -6.669006824493408, "logps/rejected": -50.45562744140625, "loss": 0.44998225569725037, "memory(GiB)": 45.96, "nll_loss": 0.24861308932304382, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22774268686771393, "rewards/margins": 3.316464900970459, "rewards/rejected": -3.0887222290039062, "step": 164, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.31240754984912134, "grad_norm": 18.49859619140625, "learning_rate": 0.00019842793414289025, "logits/chosen": -0.8581401109695435, "logits/rejected": -0.8685382008552551, "logps/chosen": -8.510130882263184, "logps/rejected": -42.820594787597656, "loss": 1.1465768814086914, "memory(GiB)": 45.96, "nll_loss": 0.8463043570518494, "rewards/accuracies": 0.875, "rewards/chosen": 0.06564593315124512, "rewards/margins": 2.910576343536377, "rewards/rejected": -2.844930410385132, "step": 165, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.31430092893911604, "grad_norm": 3.5281901359558105, "learning_rate": 0.00019839082687845335, "logits/chosen": -0.8467564582824707, "logits/rejected": -0.8614873886108398, "logps/chosen": -4.1369709968566895, "logps/rejected": -45.932647705078125, "loss": 0.5405523180961609, "memory(GiB)": 45.96, "nll_loss": 0.36477237939834595, "rewards/accuracies": 0.9375, "rewards/chosen": 0.43693381547927856, "rewards/margins": 2.8673934936523438, "rewards/rejected": -2.430459499359131, "step": 166, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.3161943080291107, "grad_norm": 6.309659481048584, "learning_rate": 0.00019835329031635236, "logits/chosen": -0.875261664390564, "logits/rejected": -0.8817040920257568, "logps/chosen": -6.334891319274902, "logps/rejected": -44.5136604309082, "loss": 0.6270987391471863, "memory(GiB)": 45.96, "nll_loss": 0.4417693614959717, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2866978049278259, "rewards/margins": 3.0005598068237305, "rewards/rejected": -2.7138617038726807, "step": 167, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.3180876871191054, "grad_norm": 2.7777206897735596, "learning_rate": 0.00019831532462036636, "logits/chosen": -0.8659749031066895, "logits/rejected": -0.8756385445594788, "logps/chosen": -4.664763450622559, "logps/rejected": -47.90147399902344, "loss": 0.40055564045906067, "memory(GiB)": 45.96, "nll_loss": 0.19673526287078857, "rewards/accuracies": 0.84375, "rewards/chosen": 0.26774388551712036, "rewards/margins": 3.2054920196533203, "rewards/rejected": -2.9377481937408447, "step": 168, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.31998106620910005, "grad_norm": 3.458099126815796, "learning_rate": 0.00019827692995614684, "logits/chosen": -0.8792099952697754, "logits/rejected": -0.9006062150001526, "logps/chosen": -3.765416383743286, "logps/rejected": -60.21432113647461, "loss": 0.2773051857948303, "memory(GiB)": 45.96, "nll_loss": 0.18920491635799408, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4749259054660797, "rewards/margins": 4.124298572540283, "rewards/rejected": -3.6493725776672363, "step": 169, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3218744452990947, "grad_norm": 8.359429359436035, "learning_rate": 0.00019823810649121688, "logits/chosen": -0.8826816082000732, "logits/rejected": -0.8891168832778931, "logps/chosen": -8.386528968811035, "logps/rejected": -48.619346618652344, "loss": 0.778719425201416, "memory(GiB)": 45.96, "nll_loss": 0.31902748346328735, "rewards/accuracies": 0.84375, "rewards/chosen": 0.09863989800214767, "rewards/margins": 3.2789182662963867, "rewards/rejected": -3.1802785396575928, "step": 170, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.3237678243890894, "grad_norm": 13.873231887817383, "learning_rate": 0.00019819885439497064, "logits/chosen": -0.9619755744934082, "logits/rejected": -0.9695166349411011, "logps/chosen": -5.436773300170898, "logps/rejected": -59.05510711669922, "loss": 0.5205389261245728, "memory(GiB)": 45.96, "nll_loss": 0.34230145812034607, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24220561981201172, "rewards/margins": 4.29957914352417, "rewards/rejected": -4.057373046875, "step": 171, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.32566120347908406, "grad_norm": 3.8463759422302246, "learning_rate": 0.0001981591738386723, "logits/chosen": -0.9225479960441589, "logits/rejected": -0.9369975924491882, "logps/chosen": -8.551187515258789, "logps/rejected": -47.00754165649414, "loss": 0.6620715260505676, "memory(GiB)": 45.96, "nll_loss": 0.4425104558467865, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32423532009124756, "rewards/margins": 3.5909903049468994, "rewards/rejected": -3.2667555809020996, "step": 172, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.32755458256907877, "grad_norm": 3.727912425994873, "learning_rate": 0.00019811906499545562, "logits/chosen": -0.9073245525360107, "logits/rejected": -0.9162495732307434, "logps/chosen": -5.982071876525879, "logps/rejected": -50.51770782470703, "loss": 0.5481733083724976, "memory(GiB)": 45.96, "nll_loss": 0.3087068498134613, "rewards/accuracies": 0.875, "rewards/chosen": 0.32423850893974304, "rewards/margins": 3.5125081539154053, "rewards/rejected": -3.188269853591919, "step": 173, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3294479616590734, "grad_norm": 2.11468505859375, "learning_rate": 0.00019807852804032305, "logits/chosen": -0.9244458079338074, "logits/rejected": -0.933106541633606, "logps/chosen": -4.452414035797119, "logps/rejected": -54.93663787841797, "loss": 0.40622979402542114, "memory(GiB)": 45.96, "nll_loss": 0.24508938193321228, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4698372185230255, "rewards/margins": 4.054183006286621, "rewards/rejected": -3.584345817565918, "step": 174, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3313413407490681, "grad_norm": 2.2816247940063477, "learning_rate": 0.0001980375631501449, "logits/chosen": -0.8938907980918884, "logits/rejected": -0.9044409990310669, "logps/chosen": -6.407214164733887, "logps/rejected": -41.67128372192383, "loss": 0.517264187335968, "memory(GiB)": 45.96, "nll_loss": 0.23160898685455322, "rewards/accuracies": 0.875, "rewards/chosen": 0.16628842055797577, "rewards/margins": 2.5896196365356445, "rewards/rejected": -2.4233314990997314, "step": 175, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.3332347198390628, "grad_norm": 8.774862289428711, "learning_rate": 0.0001979961705036587, "logits/chosen": -0.9432955384254456, "logits/rejected": -0.9490511417388916, "logps/chosen": -9.636987686157227, "logps/rejected": -32.12892150878906, "loss": 0.8658261299133301, "memory(GiB)": 45.96, "nll_loss": 0.4186471104621887, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2648793160915375, "rewards/margins": 1.9339655637741089, "rewards/rejected": -1.6690863370895386, "step": 176, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.3351280989290574, "grad_norm": 2.58535099029541, "learning_rate": 0.00019795435028146832, "logits/chosen": -0.9230942130088806, "logits/rejected": -0.9304215312004089, "logps/chosen": -5.531979084014893, "logps/rejected": -39.95973205566406, "loss": 0.517862856388092, "memory(GiB)": 45.96, "nll_loss": 0.21315467357635498, "rewards/accuracies": 0.84375, "rewards/chosen": 0.38708987832069397, "rewards/margins": 2.6242735385894775, "rewards/rejected": -2.2371835708618164, "step": 177, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.33702147801905213, "grad_norm": 2.765552520751953, "learning_rate": 0.00019791210266604327, "logits/chosen": -0.9633134007453918, "logits/rejected": -0.9681880474090576, "logps/chosen": -9.997314453125, "logps/rejected": -49.51629638671875, "loss": 0.5439927577972412, "memory(GiB)": 45.96, "nll_loss": 0.3282304108142853, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16391798853874207, "rewards/margins": 3.436600685119629, "rewards/rejected": -3.2726829051971436, "step": 178, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3389148571090468, "grad_norm": 6.450003623962402, "learning_rate": 0.00019786942784171782, "logits/chosen": -0.9957299828529358, "logits/rejected": -1.0053359270095825, "logps/chosen": -5.161239147186279, "logps/rejected": -50.02446365356445, "loss": 0.6050621271133423, "memory(GiB)": 45.96, "nll_loss": 0.35807108879089355, "rewards/accuracies": 0.875, "rewards/chosen": 0.34535130858421326, "rewards/margins": 3.329792022705078, "rewards/rejected": -2.984440565109253, "step": 179, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3408082361990415, "grad_norm": 13.34005355834961, "learning_rate": 0.0001978263259946903, "logits/chosen": -0.9830922484397888, "logits/rejected": -0.9981817603111267, "logps/chosen": -5.311959266662598, "logps/rejected": -53.79689025878906, "loss": 0.7078217267990112, "memory(GiB)": 45.96, "nll_loss": 0.4622059464454651, "rewards/accuracies": 0.875, "rewards/chosen": 0.2304527461528778, "rewards/margins": 3.5389761924743652, "rewards/rejected": -3.308523654937744, "step": 180, "train_speed(iter/s)": 0.005615 }, { "epoch": 0.34270161528903614, "grad_norm": 2.397674798965454, "learning_rate": 0.00019778279731302208, "logits/chosen": -1.0014008283615112, "logits/rejected": -1.0088224411010742, "logps/chosen": -3.664111852645874, "logps/rejected": -58.612579345703125, "loss": 0.4614037573337555, "memory(GiB)": 45.96, "nll_loss": 0.28485679626464844, "rewards/accuracies": 0.90625, "rewards/chosen": 0.29827213287353516, "rewards/margins": 4.444318771362305, "rewards/rejected": -4.1460466384887695, "step": 181, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.34459499437903085, "grad_norm": 3.9618663787841797, "learning_rate": 0.00019773884198663702, "logits/chosen": -1.0462435483932495, "logits/rejected": -1.0496163368225098, "logps/chosen": -5.64785623550415, "logps/rejected": -44.06422805786133, "loss": 0.4265408515930176, "memory(GiB)": 45.96, "nll_loss": 0.28328245878219604, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3340551257133484, "rewards/margins": 3.536937952041626, "rewards/rejected": -3.202882766723633, "step": 182, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.3464883734690255, "grad_norm": 17.443655014038086, "learning_rate": 0.0001976944602073205, "logits/chosen": -1.0237135887145996, "logits/rejected": -1.035752296447754, "logps/chosen": -6.11564302444458, "logps/rejected": -62.04539108276367, "loss": 0.6523773074150085, "memory(GiB)": 45.96, "nll_loss": 0.4753287136554718, "rewards/accuracies": 0.875, "rewards/chosen": 0.09037357568740845, "rewards/margins": 4.670170783996582, "rewards/rejected": -4.57979679107666, "step": 183, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.34838175255902015, "grad_norm": 5.512650966644287, "learning_rate": 0.00019764965216871846, "logits/chosen": -1.0302878618240356, "logits/rejected": -1.0458002090454102, "logps/chosen": -3.419121742248535, "logps/rejected": -63.38270950317383, "loss": 0.49930378794670105, "memory(GiB)": 45.96, "nll_loss": 0.3524174690246582, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2955472469329834, "rewards/margins": 4.947563648223877, "rewards/rejected": -4.6520161628723145, "step": 184, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.35027513164901486, "grad_norm": 6.747854232788086, "learning_rate": 0.0001976044180663369, "logits/chosen": -1.0561788082122803, "logits/rejected": -1.0584559440612793, "logps/chosen": -8.470739364624023, "logps/rejected": -50.98492431640625, "loss": 0.6530550718307495, "memory(GiB)": 45.96, "nll_loss": 0.5211396813392639, "rewards/accuracies": 0.9375, "rewards/chosen": 0.29809102416038513, "rewards/margins": 3.9881184101104736, "rewards/rejected": -3.6900272369384766, "step": 185, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.3521685107390095, "grad_norm": 6.5586652755737305, "learning_rate": 0.00019755875809754068, "logits/chosen": -1.0228182077407837, "logits/rejected": -1.0410220623016357, "logps/chosen": -7.406016826629639, "logps/rejected": -69.44340515136719, "loss": 0.6502223610877991, "memory(GiB)": 45.96, "nll_loss": 0.5331264734268188, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19563554227352142, "rewards/margins": 4.833287239074707, "rewards/rejected": -4.6376519203186035, "step": 186, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.3540618898290042, "grad_norm": 5.859078407287598, "learning_rate": 0.0001975126724615528, "logits/chosen": -1.0921781063079834, "logits/rejected": -1.1058279275894165, "logps/chosen": -5.384334564208984, "logps/rejected": -77.71084594726562, "loss": 0.4395386874675751, "memory(GiB)": 45.96, "nll_loss": 0.31949254870414734, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4337487518787384, "rewards/margins": 6.361716270446777, "rewards/rejected": -5.927967071533203, "step": 187, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.35595526891899887, "grad_norm": 15.831610679626465, "learning_rate": 0.00019746616135945356, "logits/chosen": -1.0272451639175415, "logits/rejected": -1.0303428173065186, "logps/chosen": -12.975401878356934, "logps/rejected": -74.52774810791016, "loss": 1.1604161262512207, "memory(GiB)": 45.96, "nll_loss": 0.6281093955039978, "rewards/accuracies": 0.8125, "rewards/chosen": -0.2834433913230896, "rewards/margins": 5.4041290283203125, "rewards/rejected": -5.687572002410889, "step": 188, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.3578486480089936, "grad_norm": 18.28084373474121, "learning_rate": 0.00019741922499417967, "logits/chosen": -1.0908275842666626, "logits/rejected": -1.1018905639648438, "logps/chosen": -11.791484832763672, "logps/rejected": -81.34092712402344, "loss": 0.8243842124938965, "memory(GiB)": 45.96, "nll_loss": 0.48044607043266296, "rewards/accuracies": 0.78125, "rewards/chosen": -0.19179318845272064, "rewards/margins": 6.231574058532715, "rewards/rejected": -6.423367500305176, "step": 189, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.3597420270989882, "grad_norm": 5.565955638885498, "learning_rate": 0.00019737186357052323, "logits/chosen": -1.049489140510559, "logits/rejected": -1.0638219118118286, "logps/chosen": -11.849400520324707, "logps/rejected": -77.38867950439453, "loss": 0.8963607549667358, "memory(GiB)": 45.96, "nll_loss": 0.4650379419326782, "rewards/accuracies": 0.71875, "rewards/chosen": -0.17283156514167786, "rewards/margins": 5.426693916320801, "rewards/rejected": -5.5995259284973145, "step": 190, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.3616354061889829, "grad_norm": 14.447429656982422, "learning_rate": 0.00019732407729513107, "logits/chosen": -0.9934099912643433, "logits/rejected": -1.0042476654052734, "logps/chosen": -7.797165393829346, "logps/rejected": -61.078086853027344, "loss": 0.9133828282356262, "memory(GiB)": 45.96, "nll_loss": 0.5914595127105713, "rewards/accuracies": 0.84375, "rewards/chosen": 0.22981007397174835, "rewards/margins": 4.205626964569092, "rewards/rejected": -3.975816488265991, "step": 191, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.3635287852789776, "grad_norm": 3.4415605068206787, "learning_rate": 0.00019727586637650373, "logits/chosen": -0.938055694103241, "logits/rejected": -0.9400723576545715, "logps/chosen": -8.713332176208496, "logps/rejected": -31.563758850097656, "loss": 0.8647351264953613, "memory(GiB)": 45.96, "nll_loss": 0.3555485010147095, "rewards/accuracies": 0.625, "rewards/chosen": 0.26367247104644775, "rewards/margins": 1.897101879119873, "rewards/rejected": -1.6334295272827148, "step": 192, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.36542216436897224, "grad_norm": 2.8079140186309814, "learning_rate": 0.00019722723102499445, "logits/chosen": -0.9127380847930908, "logits/rejected": -0.9193118810653687, "logps/chosen": -9.860222816467285, "logps/rejected": -32.82182312011719, "loss": 0.7513078451156616, "memory(GiB)": 45.96, "nll_loss": 0.45012104511260986, "rewards/accuracies": 0.90625, "rewards/chosen": 0.39801499247550964, "rewards/margins": 1.9368736743927002, "rewards/rejected": -1.5388586521148682, "step": 193, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.36731554345896694, "grad_norm": 2.0083696842193604, "learning_rate": 0.00019717817145280844, "logits/chosen": -0.8076668381690979, "logits/rejected": -0.8209682703018188, "logps/chosen": -4.274347305297852, "logps/rejected": -33.934600830078125, "loss": 0.4636756479740143, "memory(GiB)": 45.96, "nll_loss": 0.23125851154327393, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4366719722747803, "rewards/margins": 1.8356088399887085, "rewards/rejected": -1.3989369869232178, "step": 194, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.3692089225489616, "grad_norm": 2.961672782897949, "learning_rate": 0.0001971286878740018, "logits/chosen": -0.8038672804832458, "logits/rejected": -0.8188544511795044, "logps/chosen": -5.464829921722412, "logps/rejected": -35.65196990966797, "loss": 0.5770344138145447, "memory(GiB)": 45.96, "nll_loss": 0.28108230233192444, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41526705026626587, "rewards/margins": 1.6502375602722168, "rewards/rejected": -1.2349704504013062, "step": 195, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.3711023016389563, "grad_norm": 2.441650867462158, "learning_rate": 0.0001970787805044807, "logits/chosen": -0.7855252027511597, "logits/rejected": -0.7945607900619507, "logps/chosen": -5.450367450714111, "logps/rejected": -29.437000274658203, "loss": 0.729956328868866, "memory(GiB)": 45.96, "nll_loss": 0.3391174077987671, "rewards/accuracies": 0.8125, "rewards/chosen": 0.34154844284057617, "rewards/margins": 1.204176664352417, "rewards/rejected": -0.8626283407211304, "step": 196, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.37299568072895095, "grad_norm": 2.670504570007324, "learning_rate": 0.0001970284495620004, "logits/chosen": -0.7562150359153748, "logits/rejected": -0.7687780857086182, "logps/chosen": -5.965810775756836, "logps/rejected": -28.51659393310547, "loss": 0.649283230304718, "memory(GiB)": 45.96, "nll_loss": 0.24607613682746887, "rewards/accuracies": 0.8125, "rewards/chosen": 0.30883094668388367, "rewards/margins": 1.3016407489776611, "rewards/rejected": -0.9928098320960999, "step": 197, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.3748890598189456, "grad_norm": 2.004596710205078, "learning_rate": 0.0001969776952661642, "logits/chosen": -0.7988819479942322, "logits/rejected": -0.8083655834197998, "logps/chosen": -3.273776054382324, "logps/rejected": -36.80686569213867, "loss": 0.399419903755188, "memory(GiB)": 45.96, "nll_loss": 0.09559443593025208, "rewards/accuracies": 0.84375, "rewards/chosen": 0.32672712206840515, "rewards/margins": 2.123263120651245, "rewards/rejected": -1.7965359687805176, "step": 198, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.3767824389089403, "grad_norm": 3.9536526203155518, "learning_rate": 0.00019692651783842266, "logits/chosen": -0.847248911857605, "logits/rejected": -0.855591893196106, "logps/chosen": -5.48413610458374, "logps/rejected": -42.407466888427734, "loss": 0.744387149810791, "memory(GiB)": 45.96, "nll_loss": 0.44560301303863525, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3550267219543457, "rewards/margins": 2.79954195022583, "rewards/rejected": -2.4445152282714844, "step": 199, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.37867581799893496, "grad_norm": 3.1670258045196533, "learning_rate": 0.00019687491750207254, "logits/chosen": -0.8439433574676514, "logits/rejected": -0.8627237677574158, "logps/chosen": -7.741463661193848, "logps/rejected": -68.83930206298828, "loss": 0.5499181747436523, "memory(GiB)": 45.96, "nll_loss": 0.43246734142303467, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2407217025756836, "rewards/margins": 4.725229263305664, "rewards/rejected": -4.4845075607299805, "step": 200, "train_speed(iter/s)": 0.005616 }, { "epoch": 0.38056919708892967, "grad_norm": 2.094644069671631, "learning_rate": 0.00019682289448225574, "logits/chosen": -0.8863729238510132, "logits/rejected": -0.8907830715179443, "logps/chosen": -7.671055316925049, "logps/rejected": -44.41012954711914, "loss": 0.4959008991718292, "memory(GiB)": 45.96, "nll_loss": 0.26474902033805847, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3542103171348572, "rewards/margins": 3.474036693572998, "rewards/rejected": -3.119826555252075, "step": 201, "train_speed(iter/s)": 0.005614 }, { "epoch": 0.3824625761789243, "grad_norm": 11.448583602905273, "learning_rate": 0.00019677044900595853, "logits/chosen": -0.8807945251464844, "logits/rejected": -0.8872815370559692, "logps/chosen": -11.44729995727539, "logps/rejected": -62.735740661621094, "loss": 1.1596614122390747, "memory(GiB)": 45.96, "nll_loss": 0.688713014125824, "rewards/accuracies": 0.96875, "rewards/chosen": -0.03281363099813461, "rewards/margins": 4.351940155029297, "rewards/rejected": -4.384753704071045, "step": 202, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.384355955268919, "grad_norm": 6.370971202850342, "learning_rate": 0.00019671758130201033, "logits/chosen": -0.8891761898994446, "logits/rejected": -0.893890917301178, "logps/chosen": -12.073139190673828, "logps/rejected": -69.95759582519531, "loss": 0.7996310591697693, "memory(GiB)": 45.96, "nll_loss": 0.44943156838417053, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06105910986661911, "rewards/margins": 5.00841760635376, "rewards/rejected": -4.94735860824585, "step": 203, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.3862493343589137, "grad_norm": 15.760053634643555, "learning_rate": 0.0001966642916010829, "logits/chosen": -0.815875768661499, "logits/rejected": -0.8287965655326843, "logps/chosen": -7.0843329429626465, "logps/rejected": -74.68546295166016, "loss": 1.1046340465545654, "memory(GiB)": 45.96, "nll_loss": 0.742209792137146, "rewards/accuracies": 0.875, "rewards/chosen": 0.12297496199607849, "rewards/margins": 5.271447658538818, "rewards/rejected": -5.148472785949707, "step": 204, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.3881427134489083, "grad_norm": 6.462108135223389, "learning_rate": 0.0001966105801356892, "logits/chosen": -0.8428470492362976, "logits/rejected": -0.8488373160362244, "logps/chosen": -5.4728593826293945, "logps/rejected": -46.639549255371094, "loss": 0.5182836055755615, "memory(GiB)": 45.96, "nll_loss": 0.28622910380363464, "rewards/accuracies": 0.875, "rewards/chosen": 0.32224246859550476, "rewards/margins": 3.5525856018066406, "rewards/rejected": -3.2303428649902344, "step": 205, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.39003609253890303, "grad_norm": 10.162330627441406, "learning_rate": 0.00019655644714018243, "logits/chosen": -0.8311890959739685, "logits/rejected": -0.8424821496009827, "logps/chosen": -8.355030059814453, "logps/rejected": -51.8420295715332, "loss": 0.6847360730171204, "memory(GiB)": 45.96, "nll_loss": 0.3994583189487457, "rewards/accuracies": 0.84375, "rewards/chosen": 0.22317469120025635, "rewards/margins": 3.7131669521331787, "rewards/rejected": -3.489992141723633, "step": 206, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.3919294716288977, "grad_norm": 46.052215576171875, "learning_rate": 0.00019650189285075508, "logits/chosen": -0.8170652389526367, "logits/rejected": -0.8271661400794983, "logps/chosen": -4.059424877166748, "logps/rejected": -59.41645431518555, "loss": 0.48422518372535706, "memory(GiB)": 45.96, "nll_loss": 0.34698107838630676, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3219386041164398, "rewards/margins": 4.430522918701172, "rewards/rejected": -4.108584403991699, "step": 207, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.3938228507188924, "grad_norm": 6.666492938995361, "learning_rate": 0.00019644691750543767, "logits/chosen": -0.7725352048873901, "logits/rejected": -0.7822741270065308, "logps/chosen": -5.679694175720215, "logps/rejected": -48.45197296142578, "loss": 0.4621519148349762, "memory(GiB)": 45.96, "nll_loss": 0.2669067084789276, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2976520359516144, "rewards/margins": 3.225492238998413, "rewards/rejected": -2.9278407096862793, "step": 208, "train_speed(iter/s)": 0.005613 }, { "epoch": 0.39571622980888704, "grad_norm": 5.6893768310546875, "learning_rate": 0.00019639152134409804, "logits/chosen": -0.735471785068512, "logits/rejected": -0.7498069405555725, "logps/chosen": -6.4797258377075195, "logps/rejected": -64.09175872802734, "loss": 0.4735986888408661, "memory(GiB)": 45.96, "nll_loss": 0.3434915244579315, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32974106073379517, "rewards/margins": 3.6602020263671875, "rewards/rejected": -3.330461025238037, "step": 209, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.39760960889888175, "grad_norm": 16.44124984741211, "learning_rate": 0.00019633570460844002, "logits/chosen": -0.7513502836227417, "logits/rejected": -0.7627707719802856, "logps/chosen": -7.414983749389648, "logps/rejected": -51.88617706298828, "loss": 0.6197516918182373, "memory(GiB)": 45.96, "nll_loss": 0.45195478200912476, "rewards/accuracies": 0.90625, "rewards/chosen": 0.28587087988853455, "rewards/margins": 3.576326847076416, "rewards/rejected": -3.2904555797576904, "step": 210, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.3995029879888764, "grad_norm": 5.624166965484619, "learning_rate": 0.00019627946754200253, "logits/chosen": -0.7246634364128113, "logits/rejected": -0.7336344718933105, "logps/chosen": -8.098308563232422, "logps/rejected": -55.1407356262207, "loss": 0.48521894216537476, "memory(GiB)": 45.96, "nll_loss": 0.3496650457382202, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3241997957229614, "rewards/margins": 3.7958688735961914, "rewards/rejected": -3.4716691970825195, "step": 211, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.40139636707887105, "grad_norm": 1.7889741659164429, "learning_rate": 0.00019622281039015843, "logits/chosen": -0.7441357374191284, "logits/rejected": -0.7580739855766296, "logps/chosen": -3.684328556060791, "logps/rejected": -56.209293365478516, "loss": 0.33327439427375793, "memory(GiB)": 45.96, "nll_loss": 0.20535799860954285, "rewards/accuracies": 0.9375, "rewards/chosen": 0.30587002635002136, "rewards/margins": 3.881227970123291, "rewards/rejected": -3.5753583908081055, "step": 212, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.40328974616886576, "grad_norm": 2.787834882736206, "learning_rate": 0.00019616573340011355, "logits/chosen": -0.7508048415184021, "logits/rejected": -0.7553164958953857, "logps/chosen": -4.937004089355469, "logps/rejected": -43.78971862792969, "loss": 0.5410025119781494, "memory(GiB)": 45.96, "nll_loss": 0.29258573055267334, "rewards/accuracies": 0.8125, "rewards/chosen": 0.41944828629493713, "rewards/margins": 3.099458694458008, "rewards/rejected": -2.6800098419189453, "step": 213, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.4051831252588604, "grad_norm": 12.853190422058105, "learning_rate": 0.0001961082368209055, "logits/chosen": -0.7836991548538208, "logits/rejected": -0.7966538667678833, "logps/chosen": -4.6951093673706055, "logps/rejected": -51.65924835205078, "loss": 0.9481589794158936, "memory(GiB)": 45.96, "nll_loss": 0.49695920944213867, "rewards/accuracies": 0.78125, "rewards/chosen": 0.05445462837815285, "rewards/margins": 3.114589214324951, "rewards/rejected": -3.0601344108581543, "step": 214, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.4070765043488551, "grad_norm": 5.1839704513549805, "learning_rate": 0.00019605032090340267, "logits/chosen": -0.8062314987182617, "logits/rejected": -0.8129691481590271, "logps/chosen": -4.397279739379883, "logps/rejected": -42.56846237182617, "loss": 0.7058886289596558, "memory(GiB)": 45.96, "nll_loss": 0.34186726808547974, "rewards/accuracies": 0.8125, "rewards/chosen": 0.12627288699150085, "rewards/margins": 2.8559820652008057, "rewards/rejected": -2.7297093868255615, "step": 215, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.40896988343884977, "grad_norm": 2.8434062004089355, "learning_rate": 0.0001959919859003031, "logits/chosen": -0.7388439178466797, "logits/rejected": -0.7492343187332153, "logps/chosen": -3.2313055992126465, "logps/rejected": -54.10618591308594, "loss": 0.33251953125, "memory(GiB)": 45.96, "nll_loss": 0.20878179371356964, "rewards/accuracies": 0.9375, "rewards/chosen": 0.42627185583114624, "rewards/margins": 3.7635509967803955, "rewards/rejected": -3.3372793197631836, "step": 216, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4108632625288444, "grad_norm": 3.8040099143981934, "learning_rate": 0.00019593323206613331, "logits/chosen": -0.7919730544090271, "logits/rejected": -0.8036046028137207, "logps/chosen": -7.406411647796631, "logps/rejected": -57.45484924316406, "loss": 0.6115871667861938, "memory(GiB)": 45.96, "nll_loss": 0.32974275946617126, "rewards/accuracies": 0.84375, "rewards/chosen": 0.29590100049972534, "rewards/margins": 3.664919376373291, "rewards/rejected": -3.369018077850342, "step": 217, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4127566416188391, "grad_norm": 2.7392921447753906, "learning_rate": 0.0001958740596572474, "logits/chosen": -0.7719218730926514, "logits/rejected": -0.7802299857139587, "logps/chosen": -2.140526056289673, "logps/rejected": -53.021087646484375, "loss": 0.328443706035614, "memory(GiB)": 45.96, "nll_loss": 0.12891747057437897, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3535212278366089, "rewards/margins": 3.531355381011963, "rewards/rejected": -3.1778340339660645, "step": 218, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4146500207088338, "grad_norm": 2.372682809829712, "learning_rate": 0.00019581446893182565, "logits/chosen": -0.7669311165809631, "logits/rejected": -0.7759067416191101, "logps/chosen": -4.876304626464844, "logps/rejected": -45.05213928222656, "loss": 0.42399588227272034, "memory(GiB)": 45.96, "nll_loss": 0.17316851019859314, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3615014851093292, "rewards/margins": 2.848667621612549, "rewards/rejected": -2.487166166305542, "step": 219, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4165433997988285, "grad_norm": 2.5566980838775635, "learning_rate": 0.00019575446014987363, "logits/chosen": -0.7663781046867371, "logits/rejected": -0.7778026461601257, "logps/chosen": -9.037557601928711, "logps/rejected": -41.32817459106445, "loss": 0.670400857925415, "memory(GiB)": 45.96, "nll_loss": 0.3820984661579132, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2986691892147064, "rewards/margins": 2.576287031173706, "rewards/rejected": -2.2776176929473877, "step": 220, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.41843677888882314, "grad_norm": 2.0137414932250977, "learning_rate": 0.0001956940335732209, "logits/chosen": -0.7961980104446411, "logits/rejected": -0.8072370290756226, "logps/chosen": -5.287474632263184, "logps/rejected": -52.39486312866211, "loss": 0.4247521758079529, "memory(GiB)": 45.96, "nll_loss": 0.2258274108171463, "rewards/accuracies": 0.9375, "rewards/chosen": 0.46624377369880676, "rewards/margins": 3.2418112754821777, "rewards/rejected": -2.7755677700042725, "step": 221, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.42033015797881784, "grad_norm": 9.485119819641113, "learning_rate": 0.00019563318946551998, "logits/chosen": -0.7868661880493164, "logits/rejected": -0.7932162880897522, "logps/chosen": -4.125566482543945, "logps/rejected": -41.510528564453125, "loss": 0.45158693194389343, "memory(GiB)": 45.96, "nll_loss": 0.2398645132780075, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3339860439300537, "rewards/margins": 2.9751968383789062, "rewards/rejected": -2.6412105560302734, "step": 222, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.4222235370688125, "grad_norm": 1.728522777557373, "learning_rate": 0.00019557192809224513, "logits/chosen": -0.8158318996429443, "logits/rejected": -0.8269481062889099, "logps/chosen": -6.187929630279541, "logps/rejected": -65.49488830566406, "loss": 0.3769925534725189, "memory(GiB)": 45.96, "nll_loss": 0.20739418268203735, "rewards/accuracies": 0.90625, "rewards/chosen": 0.5454128980636597, "rewards/margins": 3.809990882873535, "rewards/rejected": -3.264577865600586, "step": 223, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.42411691615880714, "grad_norm": 3.2084922790527344, "learning_rate": 0.00019551024972069126, "logits/chosen": -0.765777051448822, "logits/rejected": -0.7758392095565796, "logps/chosen": -5.901573181152344, "logps/rejected": -52.30465316772461, "loss": 0.618301272392273, "memory(GiB)": 45.96, "nll_loss": 0.3325042426586151, "rewards/accuracies": 0.84375, "rewards/chosen": 0.33851462602615356, "rewards/margins": 2.8817224502563477, "rewards/rejected": -2.5432076454162598, "step": 224, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.42601029524880185, "grad_norm": 3.7956161499023438, "learning_rate": 0.00019544815461997264, "logits/chosen": -0.8206179141998291, "logits/rejected": -0.8290830850601196, "logps/chosen": -5.066240310668945, "logps/rejected": -51.627464294433594, "loss": 0.5323878526687622, "memory(GiB)": 45.96, "nll_loss": 0.34584906697273254, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36647719144821167, "rewards/margins": 3.2682008743286133, "rewards/rejected": -2.9017233848571777, "step": 225, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4279036743387965, "grad_norm": 6.160758972167969, "learning_rate": 0.00019538564306102195, "logits/chosen": -0.8133172988891602, "logits/rejected": -0.8209658861160278, "logps/chosen": -7.938709259033203, "logps/rejected": -49.04197311401367, "loss": 0.6256651878356934, "memory(GiB)": 45.96, "nll_loss": 0.45015066862106323, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21895331144332886, "rewards/margins": 3.475795269012451, "rewards/rejected": -3.2568421363830566, "step": 226, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4297970534287912, "grad_norm": 3.3720943927764893, "learning_rate": 0.00019532271531658878, "logits/chosen": -0.8342875242233276, "logits/rejected": -0.8426697254180908, "logps/chosen": -5.65493106842041, "logps/rejected": -56.189483642578125, "loss": 0.550865888595581, "memory(GiB)": 45.96, "nll_loss": 0.32167327404022217, "rewards/accuracies": 0.90625, "rewards/chosen": 0.18321865797042847, "rewards/margins": 4.062854766845703, "rewards/rejected": -3.879636287689209, "step": 227, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.43169043251878586, "grad_norm": 7.045608043670654, "learning_rate": 0.00019525937166123877, "logits/chosen": -0.8390461802482605, "logits/rejected": -0.848449170589447, "logps/chosen": -4.815664768218994, "logps/rejected": -59.5663948059082, "loss": 0.5792067050933838, "memory(GiB)": 45.96, "nll_loss": 0.35179653763771057, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08492806553840637, "rewards/margins": 3.999222993850708, "rewards/rejected": -3.914294719696045, "step": 228, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.43358381160878057, "grad_norm": 3.3884899616241455, "learning_rate": 0.00019519561237135214, "logits/chosen": -0.8333678841590881, "logits/rejected": -0.8382862210273743, "logps/chosen": -6.737687110900879, "logps/rejected": -47.592185974121094, "loss": 0.46553468704223633, "memory(GiB)": 45.96, "nll_loss": 0.2802257835865021, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3542218804359436, "rewards/margins": 3.4753262996673584, "rewards/rejected": -3.1211044788360596, "step": 229, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4354771906987752, "grad_norm": 1.4453233480453491, "learning_rate": 0.00019513143772512267, "logits/chosen": -0.8504279851913452, "logits/rejected": -0.8653618097305298, "logps/chosen": -6.069849491119385, "logps/rejected": -61.96661376953125, "loss": 0.35670334100723267, "memory(GiB)": 45.96, "nll_loss": 0.27682676911354065, "rewards/accuracies": 1.0, "rewards/chosen": 0.4068211615085602, "rewards/margins": 4.582265853881836, "rewards/rejected": -4.175444602966309, "step": 230, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.43737056978876987, "grad_norm": 2.451911687850952, "learning_rate": 0.0001950668480025564, "logits/chosen": -0.8143424391746521, "logits/rejected": -0.820701003074646, "logps/chosen": -5.882935047149658, "logps/rejected": -41.83823013305664, "loss": 0.413090318441391, "memory(GiB)": 45.96, "nll_loss": 0.25027984380722046, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4448525905609131, "rewards/margins": 3.033524990081787, "rewards/rejected": -2.588672637939453, "step": 231, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.4392639488787646, "grad_norm": 3.493765354156494, "learning_rate": 0.00019500184348547042, "logits/chosen": -0.8186232447624207, "logits/rejected": -0.8271446228027344, "logps/chosen": -5.602138042449951, "logps/rejected": -53.67842102050781, "loss": 0.523601233959198, "memory(GiB)": 45.96, "nll_loss": 0.30448588728904724, "rewards/accuracies": 0.96875, "rewards/chosen": 0.284013032913208, "rewards/margins": 3.9659247398376465, "rewards/rejected": -3.6819119453430176, "step": 232, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4411573279687592, "grad_norm": 2.912060260772705, "learning_rate": 0.00019493642445749166, "logits/chosen": -0.842425525188446, "logits/rejected": -0.8589853644371033, "logps/chosen": -3.74099063873291, "logps/rejected": -57.953006744384766, "loss": 0.36314085125923157, "memory(GiB)": 45.96, "nll_loss": 0.2760802209377289, "rewards/accuracies": 0.96875, "rewards/chosen": 0.443424254655838, "rewards/margins": 4.425593852996826, "rewards/rejected": -3.9821696281433105, "step": 233, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.44305070705875393, "grad_norm": 12.398122787475586, "learning_rate": 0.0001948705912040556, "logits/chosen": -0.7788976430892944, "logits/rejected": -0.7920855283737183, "logps/chosen": -9.004324913024902, "logps/rejected": -57.34058380126953, "loss": 0.47224855422973633, "memory(GiB)": 45.96, "nll_loss": 0.3402937054634094, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19586092233657837, "rewards/margins": 3.8706259727478027, "rewards/rejected": -3.67476487159729, "step": 234, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4449440861487486, "grad_norm": 4.74459981918335, "learning_rate": 0.00019480434401240512, "logits/chosen": -0.8051593899726868, "logits/rejected": -0.8183260560035706, "logps/chosen": -6.355615615844727, "logps/rejected": -56.04167938232422, "loss": 0.5707345008850098, "memory(GiB)": 45.96, "nll_loss": 0.34050434827804565, "rewards/accuracies": 0.90625, "rewards/chosen": 0.33054211735725403, "rewards/margins": 3.9471776485443115, "rewards/rejected": -3.616635799407959, "step": 235, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.4468374652387433, "grad_norm": 6.874378681182861, "learning_rate": 0.0001947376831715892, "logits/chosen": -0.7758195400238037, "logits/rejected": -0.788472592830658, "logps/chosen": -5.814244270324707, "logps/rejected": -54.79585266113281, "loss": 0.5337939262390137, "memory(GiB)": 45.96, "nll_loss": 0.3693539500236511, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13278648257255554, "rewards/margins": 3.429861545562744, "rewards/rejected": -3.297075033187866, "step": 236, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.44873084432873794, "grad_norm": 5.422703742980957, "learning_rate": 0.00019467060897246157, "logits/chosen": -0.7782034277915955, "logits/rejected": -0.7840334177017212, "logps/chosen": -8.718152046203613, "logps/rejected": -41.60744857788086, "loss": 0.7435796856880188, "memory(GiB)": 45.96, "nll_loss": 0.4146505296230316, "rewards/accuracies": 0.875, "rewards/chosen": 0.09374925494194031, "rewards/margins": 2.6359703540802, "rewards/rejected": -2.5422208309173584, "step": 237, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4506242234187326, "grad_norm": 2.3289687633514404, "learning_rate": 0.00019460312170767956, "logits/chosen": -0.7645810842514038, "logits/rejected": -0.7797269821166992, "logps/chosen": -5.059871673583984, "logps/rejected": -64.65418243408203, "loss": 0.3661719858646393, "memory(GiB)": 45.96, "nll_loss": 0.25765132904052734, "rewards/accuracies": 0.96875, "rewards/chosen": 0.39239248633384705, "rewards/margins": 4.386118412017822, "rewards/rejected": -3.9937262535095215, "step": 238, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4525176025087273, "grad_norm": 1.4744064807891846, "learning_rate": 0.0001945352216717028, "logits/chosen": -0.831943154335022, "logits/rejected": -0.8483419418334961, "logps/chosen": -5.389368534088135, "logps/rejected": -62.634124755859375, "loss": 0.29625532031059265, "memory(GiB)": 45.96, "nll_loss": 0.19564969837665558, "rewards/accuracies": 1.0, "rewards/chosen": 0.4885157346725464, "rewards/margins": 4.1885905265808105, "rewards/rejected": -3.700075149536133, "step": 239, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.45441098159872195, "grad_norm": 10.076432228088379, "learning_rate": 0.0001944669091607919, "logits/chosen": -0.7903633117675781, "logits/rejected": -0.796679675579071, "logps/chosen": -6.789815902709961, "logps/rejected": -46.970340728759766, "loss": 0.6889331340789795, "memory(GiB)": 45.96, "nll_loss": 0.4780619740486145, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2585870325565338, "rewards/margins": 3.206406593322754, "rewards/rejected": -2.947819709777832, "step": 240, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.45630436068871666, "grad_norm": 3.162611961364746, "learning_rate": 0.00019439818447300716, "logits/chosen": -0.7782495617866516, "logits/rejected": -0.793842077255249, "logps/chosen": -6.149593353271484, "logps/rejected": -57.481685638427734, "loss": 0.35159918665885925, "memory(GiB)": 45.96, "nll_loss": 0.26541072130203247, "rewards/accuracies": 1.0, "rewards/chosen": 0.4303516149520874, "rewards/margins": 3.7947804927825928, "rewards/rejected": -3.364428997039795, "step": 241, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.4581977397787113, "grad_norm": 2.6365225315093994, "learning_rate": 0.00019432904790820735, "logits/chosen": -0.779421329498291, "logits/rejected": -0.7866885662078857, "logps/chosen": -4.453818321228027, "logps/rejected": -48.04380798339844, "loss": 0.5028890371322632, "memory(GiB)": 45.96, "nll_loss": 0.3481641113758087, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17416518926620483, "rewards/margins": 3.206613063812256, "rewards/rejected": -3.0324478149414062, "step": 242, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.460091118868706, "grad_norm": 4.328489780426025, "learning_rate": 0.00019425949976804827, "logits/chosen": -0.7438924312591553, "logits/rejected": -0.7507935762405396, "logps/chosen": -10.080765724182129, "logps/rejected": -45.97163009643555, "loss": 0.5210501551628113, "memory(GiB)": 45.96, "nll_loss": 0.32953721284866333, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3890751004219055, "rewards/margins": 3.2612807750701904, "rewards/rejected": -2.8722057342529297, "step": 243, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.46198449795870067, "grad_norm": 2.42315673828125, "learning_rate": 0.00019418954035598152, "logits/chosen": -0.8272375464439392, "logits/rejected": -0.8359189033508301, "logps/chosen": -6.97105073928833, "logps/rejected": -54.705596923828125, "loss": 0.39850807189941406, "memory(GiB)": 45.96, "nll_loss": 0.23200449347496033, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2904537618160248, "rewards/margins": 3.9579145908355713, "rewards/rejected": -3.6674604415893555, "step": 244, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4638778770486953, "grad_norm": 11.622922897338867, "learning_rate": 0.00019411916997725314, "logits/chosen": -0.804512619972229, "logits/rejected": -0.8301945924758911, "logps/chosen": -5.534765243530273, "logps/rejected": -75.79460144042969, "loss": 0.3892122805118561, "memory(GiB)": 45.96, "nll_loss": 0.2879936993122101, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24686971306800842, "rewards/margins": 5.173652172088623, "rewards/rejected": -4.926782608032227, "step": 245, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.46577125613869, "grad_norm": 29.126651763916016, "learning_rate": 0.00019404838893890235, "logits/chosen": -0.8384321928024292, "logits/rejected": -0.8446701169013977, "logps/chosen": -6.7067742347717285, "logps/rejected": -56.584373474121094, "loss": 0.4600946009159088, "memory(GiB)": 45.96, "nll_loss": 0.27550381422042847, "rewards/accuracies": 0.9375, "rewards/chosen": 0.273784339427948, "rewards/margins": 3.861654281616211, "rewards/rejected": -3.587869882583618, "step": 246, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4676646352286847, "grad_norm": 1.977882981300354, "learning_rate": 0.0001939771975497601, "logits/chosen": -0.8426949977874756, "logits/rejected": -0.855405330657959, "logps/chosen": -8.002025604248047, "logps/rejected": -68.733154296875, "loss": 0.41115817427635193, "memory(GiB)": 45.96, "nll_loss": 0.31340885162353516, "rewards/accuracies": 0.96875, "rewards/chosen": 0.39579659700393677, "rewards/margins": 5.0697808265686035, "rewards/rejected": -4.673984527587891, "step": 247, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.4695580143186794, "grad_norm": 6.719147205352783, "learning_rate": 0.0001939055961204478, "logits/chosen": -0.8593066334724426, "logits/rejected": -0.871523916721344, "logps/chosen": -8.719642639160156, "logps/rejected": -73.46538543701172, "loss": 0.5661371946334839, "memory(GiB)": 45.96, "nll_loss": 0.28518250584602356, "rewards/accuracies": 0.875, "rewards/chosen": 0.1493295133113861, "rewards/margins": 5.667934417724609, "rewards/rejected": -5.5186052322387695, "step": 248, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.47145139340867404, "grad_norm": 3.4157960414886475, "learning_rate": 0.00019383358496337594, "logits/chosen": -0.8707897067070007, "logits/rejected": -0.8835899233818054, "logps/chosen": -8.206844329833984, "logps/rejected": -70.05189514160156, "loss": 0.5082112550735474, "memory(GiB)": 45.96, "nll_loss": 0.3844239413738251, "rewards/accuracies": 0.9375, "rewards/chosen": 0.40558338165283203, "rewards/margins": 5.734279155731201, "rewards/rejected": -5.328695297241211, "step": 249, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.47334477249866874, "grad_norm": 2.3171849250793457, "learning_rate": 0.00019376116439274275, "logits/chosen": -0.8690236210823059, "logits/rejected": -0.8809092044830322, "logps/chosen": -7.636664390563965, "logps/rejected": -67.01061248779297, "loss": 0.5090566873550415, "memory(GiB)": 45.96, "nll_loss": 0.34755271673202515, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2747221887111664, "rewards/margins": 4.926432132720947, "rewards/rejected": -4.651710033416748, "step": 250, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.4752381515886634, "grad_norm": 5.929121494293213, "learning_rate": 0.00019368833472453275, "logits/chosen": -0.8622236847877502, "logits/rejected": -0.8675254583358765, "logps/chosen": -6.978309631347656, "logps/rejected": -59.03238296508789, "loss": 0.6428236365318298, "memory(GiB)": 45.96, "nll_loss": 0.3348870873451233, "rewards/accuracies": 0.8125, "rewards/chosen": 0.00988294929265976, "rewards/margins": 4.309958457946777, "rewards/rejected": -4.300075531005859, "step": 251, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.47713153067865804, "grad_norm": 2.0272998809814453, "learning_rate": 0.00019361509627651547, "logits/chosen": -0.8882036805152893, "logits/rejected": -0.894838809967041, "logps/chosen": -5.545462608337402, "logps/rejected": -53.88817596435547, "loss": 0.3966207802295685, "memory(GiB)": 45.96, "nll_loss": 0.2131766378879547, "rewards/accuracies": 0.875, "rewards/chosen": 0.36596545577049255, "rewards/margins": 4.208477973937988, "rewards/rejected": -3.842512607574463, "step": 252, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.47902490976865275, "grad_norm": 5.7287468910217285, "learning_rate": 0.00019354144936824401, "logits/chosen": -0.8320537209510803, "logits/rejected": -0.8402711153030396, "logps/chosen": -6.792182445526123, "logps/rejected": -54.659339904785156, "loss": 0.4517640769481659, "memory(GiB)": 45.96, "nll_loss": 0.3251955211162567, "rewards/accuracies": 0.9375, "rewards/chosen": 0.33542922139167786, "rewards/margins": 3.7679901123046875, "rewards/rejected": -3.432560920715332, "step": 253, "train_speed(iter/s)": 0.005608 }, { "epoch": 0.4809182888586474, "grad_norm": 18.151660919189453, "learning_rate": 0.00019346739432105374, "logits/chosen": -0.8174375295639038, "logits/rejected": -0.8378430604934692, "logps/chosen": -8.57436466217041, "logps/rejected": -62.255455017089844, "loss": 0.7509753108024597, "memory(GiB)": 45.96, "nll_loss": 0.6498162746429443, "rewards/accuracies": 1.0, "rewards/chosen": 0.266471803188324, "rewards/margins": 3.990063428878784, "rewards/rejected": -3.7235915660858154, "step": 254, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.4828116679486421, "grad_norm": 12.132912635803223, "learning_rate": 0.00019339293145806066, "logits/chosen": -0.8464425802230835, "logits/rejected": -0.8538373708724976, "logps/chosen": -6.4575605392456055, "logps/rejected": -50.951087951660156, "loss": 0.4662426710128784, "memory(GiB)": 45.96, "nll_loss": 0.3501847982406616, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22113488614559174, "rewards/margins": 3.7245137691497803, "rewards/rejected": -3.5033788681030273, "step": 255, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.48470504703863676, "grad_norm": 14.220233917236328, "learning_rate": 0.00019331806110416027, "logits/chosen": -0.8058353066444397, "logits/rejected": -0.8215208053588867, "logps/chosen": -6.208203315734863, "logps/rejected": -65.32124328613281, "loss": 0.9521104097366333, "memory(GiB)": 45.96, "nll_loss": 0.7899406552314758, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07534287869930267, "rewards/margins": 3.819141387939453, "rewards/rejected": -3.7437989711761475, "step": 256, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.48659842612863147, "grad_norm": 5.3797173500061035, "learning_rate": 0.000193242783586026, "logits/chosen": -0.8115130066871643, "logits/rejected": -0.8261612057685852, "logps/chosen": -4.243943691253662, "logps/rejected": -64.59398651123047, "loss": 0.6993451714515686, "memory(GiB)": 45.96, "nll_loss": 0.5960971117019653, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2801298499107361, "rewards/margins": 4.3589348793029785, "rewards/rejected": -4.078805446624756, "step": 257, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.4884918052186261, "grad_norm": 2.5662522315979004, "learning_rate": 0.00019316709923210775, "logits/chosen": -0.7943601608276367, "logits/rejected": -0.8015127182006836, "logps/chosen": -7.6889801025390625, "logps/rejected": -54.64246368408203, "loss": 0.7327463626861572, "memory(GiB)": 45.96, "nll_loss": 0.45545923709869385, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21556581556797028, "rewards/margins": 3.397770643234253, "rewards/rejected": -3.1822047233581543, "step": 258, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.49038518430862077, "grad_norm": 25.52183723449707, "learning_rate": 0.00019309100837263068, "logits/chosen": -0.7869693040847778, "logits/rejected": -0.7915991544723511, "logps/chosen": -8.936237335205078, "logps/rejected": -42.483360290527344, "loss": 0.5518508553504944, "memory(GiB)": 45.96, "nll_loss": 0.35867419838905334, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36850929260253906, "rewards/margins": 3.0449368953704834, "rewards/rejected": -2.6764283180236816, "step": 259, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.4922785633986155, "grad_norm": 1.8457614183425903, "learning_rate": 0.0001930145113395934, "logits/chosen": -0.7611051797866821, "logits/rejected": -0.7706549167633057, "logps/chosen": -4.166028022766113, "logps/rejected": -42.88038635253906, "loss": 0.5326672196388245, "memory(GiB)": 45.96, "nll_loss": 0.26256081461906433, "rewards/accuracies": 0.84375, "rewards/chosen": 0.31425848603248596, "rewards/margins": 3.049826145172119, "rewards/rejected": -2.735567808151245, "step": 260, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.4941719424886101, "grad_norm": 4.680253028869629, "learning_rate": 0.0001929376084667669, "logits/chosen": -0.7653763890266418, "logits/rejected": -0.7684553265571594, "logps/chosen": -11.641561508178711, "logps/rejected": -33.487953186035156, "loss": 0.8013095259666443, "memory(GiB)": 45.96, "nll_loss": 0.5253302454948425, "rewards/accuracies": 0.84375, "rewards/chosen": 0.34696438908576965, "rewards/margins": 2.4490063190460205, "rewards/rejected": -2.102041721343994, "step": 261, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.49606532157860483, "grad_norm": 1.6427733898162842, "learning_rate": 0.00019286030008969283, "logits/chosen": -0.7503105401992798, "logits/rejected": -0.7532596588134766, "logps/chosen": -3.582320213317871, "logps/rejected": -44.282466888427734, "loss": 0.3885384798049927, "memory(GiB)": 45.96, "nll_loss": 0.12933489680290222, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19427397847175598, "rewards/margins": 3.2359180450439453, "rewards/rejected": -3.041644334793091, "step": 262, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.4979587006685995, "grad_norm": 2.3090734481811523, "learning_rate": 0.00019278258654568218, "logits/chosen": -0.763583779335022, "logits/rejected": -0.7730581760406494, "logps/chosen": -9.824563980102539, "logps/rejected": -51.514068603515625, "loss": 0.5489881038665771, "memory(GiB)": 45.96, "nll_loss": 0.3023039996623993, "rewards/accuracies": 0.84375, "rewards/chosen": 0.5053662061691284, "rewards/margins": 3.4952330589294434, "rewards/rejected": -2.9898667335510254, "step": 263, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.4998520797585942, "grad_norm": 1.4782931804656982, "learning_rate": 0.00019270446817381377, "logits/chosen": -0.7714170813560486, "logits/rejected": -0.7751628160476685, "logps/chosen": -7.587092399597168, "logps/rejected": -46.782779693603516, "loss": 0.5135377049446106, "memory(GiB)": 45.96, "nll_loss": 0.3512042164802551, "rewards/accuracies": 0.9375, "rewards/chosen": 0.40125563740730286, "rewards/margins": 3.7470357418060303, "rewards/rejected": -3.345780372619629, "step": 264, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5017454588485888, "grad_norm": 4.727572917938232, "learning_rate": 0.0001926259453149327, "logits/chosen": -0.7314101457595825, "logits/rejected": -0.7375609874725342, "logps/chosen": -5.705110549926758, "logps/rejected": -57.362266540527344, "loss": 0.5352091789245605, "memory(GiB)": 45.96, "nll_loss": 0.34295836091041565, "rewards/accuracies": 0.875, "rewards/chosen": 0.31562328338623047, "rewards/margins": 4.008930683135986, "rewards/rejected": -3.693307399749756, "step": 265, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5036388379385836, "grad_norm": 4.0496649742126465, "learning_rate": 0.00019254701831164893, "logits/chosen": -0.7853831648826599, "logits/rejected": -0.7986811995506287, "logps/chosen": -4.441198348999023, "logps/rejected": -53.076751708984375, "loss": 0.3684377670288086, "memory(GiB)": 45.96, "nll_loss": 0.2579481899738312, "rewards/accuracies": 1.0, "rewards/chosen": 0.46632638573646545, "rewards/margins": 3.7940874099731445, "rewards/rejected": -3.327761173248291, "step": 266, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5055322170285782, "grad_norm": 5.552995204925537, "learning_rate": 0.00019246768750833586, "logits/chosen": -0.7842399477958679, "logits/rejected": -0.7948920130729675, "logps/chosen": -6.420162677764893, "logps/rejected": -59.88761520385742, "loss": 0.6227431297302246, "memory(GiB)": 45.96, "nll_loss": 0.41716307401657104, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4504700005054474, "rewards/margins": 4.746631622314453, "rewards/rejected": -4.296161651611328, "step": 267, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.5074255961185729, "grad_norm": 5.908695697784424, "learning_rate": 0.0001923879532511287, "logits/chosen": -0.7927809953689575, "logits/rejected": -0.8063479065895081, "logps/chosen": -4.683359146118164, "logps/rejected": -72.5576400756836, "loss": 0.5436932444572449, "memory(GiB)": 45.96, "nll_loss": 0.4655058979988098, "rewards/accuracies": 1.0, "rewards/chosen": 0.26488012075424194, "rewards/margins": 5.25103759765625, "rewards/rejected": -4.986156940460205, "step": 268, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.5093189752085675, "grad_norm": 1.9154390096664429, "learning_rate": 0.00019230781588792294, "logits/chosen": -0.8069201111793518, "logits/rejected": -0.8189995884895325, "logps/chosen": -5.3705830574035645, "logps/rejected": -52.988075256347656, "loss": 0.3851671814918518, "memory(GiB)": 45.96, "nll_loss": 0.21666651964187622, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3238618075847626, "rewards/margins": 3.722102642059326, "rewards/rejected": -3.398240327835083, "step": 269, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.5112123542985623, "grad_norm": 3.472141742706299, "learning_rate": 0.00019222727576837295, "logits/chosen": -0.8795083165168762, "logits/rejected": -0.8880424499511719, "logps/chosen": -4.646546363830566, "logps/rejected": -52.22845458984375, "loss": 0.4236709177494049, "memory(GiB)": 45.96, "nll_loss": 0.2475687563419342, "rewards/accuracies": 0.9375, "rewards/chosen": 0.41008079051971436, "rewards/margins": 4.20516300201416, "rewards/rejected": -3.795081853866577, "step": 270, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.5131057333885569, "grad_norm": 5.411405563354492, "learning_rate": 0.00019214633324389046, "logits/chosen": -0.8955191969871521, "logits/rejected": -0.9028213620185852, "logps/chosen": -7.191625118255615, "logps/rejected": -64.41796112060547, "loss": 0.5999385118484497, "memory(GiB)": 45.96, "nll_loss": 0.4318827986717224, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3819724917411804, "rewards/margins": 5.266749382019043, "rewards/rejected": -4.884777069091797, "step": 271, "train_speed(iter/s)": 0.005605 }, { "epoch": 0.5149991124785516, "grad_norm": 2.4139254093170166, "learning_rate": 0.00019206498866764288, "logits/chosen": -0.892187774181366, "logits/rejected": -0.9053075909614563, "logps/chosen": -10.184382438659668, "logps/rejected": -61.766212463378906, "loss": 0.5961122512817383, "memory(GiB)": 45.96, "nll_loss": 0.41012638807296753, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3639661967754364, "rewards/margins": 4.510526180267334, "rewards/rejected": -4.146560192108154, "step": 272, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5168924915685462, "grad_norm": 8.651139259338379, "learning_rate": 0.00019198324239455187, "logits/chosen": -0.8872772455215454, "logits/rejected": -0.9006874561309814, "logps/chosen": -8.185474395751953, "logps/rejected": -65.75993347167969, "loss": 0.8648337721824646, "memory(GiB)": 45.96, "nll_loss": 0.3675552308559418, "rewards/accuracies": 0.78125, "rewards/chosen": 0.15013383328914642, "rewards/margins": 4.743319988250732, "rewards/rejected": -4.593186378479004, "step": 273, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5187858706585409, "grad_norm": 2.5142791271209717, "learning_rate": 0.0001919010947812918, "logits/chosen": -0.8946865200996399, "logits/rejected": -0.9012131690979004, "logps/chosen": -4.413853645324707, "logps/rejected": -56.88621520996094, "loss": 0.41415372490882874, "memory(GiB)": 45.96, "nll_loss": 0.19099995493888855, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3928433954715729, "rewards/margins": 4.33311128616333, "rewards/rejected": -3.94026780128479, "step": 274, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5206792497485356, "grad_norm": 2.757438898086548, "learning_rate": 0.00019181854618628816, "logits/chosen": -0.8939404487609863, "logits/rejected": -0.9018977880477905, "logps/chosen": -6.882540702819824, "logps/rejected": -53.659786224365234, "loss": 0.5660197734832764, "memory(GiB)": 45.96, "nll_loss": 0.31941333413124084, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27356964349746704, "rewards/margins": 3.988978147506714, "rewards/rejected": -3.7154083251953125, "step": 275, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5225726288385303, "grad_norm": 3.7840638160705566, "learning_rate": 0.00019173559696971594, "logits/chosen": -0.829815149307251, "logits/rejected": -0.8413034081459045, "logps/chosen": -5.10278844833374, "logps/rejected": -57.6441650390625, "loss": 0.4606822431087494, "memory(GiB)": 45.96, "nll_loss": 0.2637704610824585, "rewards/accuracies": 0.84375, "rewards/chosen": 0.23584577441215515, "rewards/margins": 4.247429370880127, "rewards/rejected": -4.01158332824707, "step": 276, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5244660079285249, "grad_norm": 2.141832113265991, "learning_rate": 0.00019165224749349816, "logits/chosen": -0.8428906202316284, "logits/rejected": -0.8528401851654053, "logps/chosen": -5.591213703155518, "logps/rejected": -64.73967742919922, "loss": 0.2879190742969513, "memory(GiB)": 45.96, "nll_loss": 0.20184285938739777, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3050042390823364, "rewards/margins": 4.54812479019165, "rewards/rejected": -4.2431206703186035, "step": 277, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5263593870185196, "grad_norm": 3.644115447998047, "learning_rate": 0.00019156849812130427, "logits/chosen": -0.8035122156143188, "logits/rejected": -0.8153725862503052, "logps/chosen": -12.309917449951172, "logps/rejected": -51.97355270385742, "loss": 0.5790233612060547, "memory(GiB)": 45.96, "nll_loss": 0.3488881289958954, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5022516846656799, "rewards/margins": 3.658660888671875, "rewards/rejected": -3.1564090251922607, "step": 278, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5282527661085142, "grad_norm": 5.298548221588135, "learning_rate": 0.00019148434921854849, "logits/chosen": -0.8239580988883972, "logits/rejected": -0.8249148726463318, "logps/chosen": -6.91997766494751, "logps/rejected": -54.75133514404297, "loss": 0.4746522009372711, "memory(GiB)": 45.96, "nll_loss": 0.2784557044506073, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1923876702785492, "rewards/margins": 3.716320276260376, "rewards/rejected": -3.523932695388794, "step": 279, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.530146145198509, "grad_norm": 4.2977800369262695, "learning_rate": 0.00019139980115238827, "logits/chosen": -0.7907276749610901, "logits/rejected": -0.7962623834609985, "logps/chosen": -6.527490615844727, "logps/rejected": -44.79871368408203, "loss": 0.47257882356643677, "memory(GiB)": 45.96, "nll_loss": 0.35276007652282715, "rewards/accuracies": 1.0, "rewards/chosen": 0.2639794945716858, "rewards/margins": 2.987936019897461, "rewards/rejected": -2.723956346511841, "step": 280, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5320395242885037, "grad_norm": 3.901082754135132, "learning_rate": 0.00019131485429172278, "logits/chosen": -0.7934513092041016, "logits/rejected": -0.8078168630599976, "logps/chosen": -6.55319881439209, "logps/rejected": -61.66103744506836, "loss": 0.37024247646331787, "memory(GiB)": 45.96, "nll_loss": 0.28827083110809326, "rewards/accuracies": 1.0, "rewards/chosen": 0.24689851701259613, "rewards/margins": 3.8940815925598145, "rewards/rejected": -3.647183418273926, "step": 281, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5339329033784983, "grad_norm": 2.530467987060547, "learning_rate": 0.0001912295090071911, "logits/chosen": -0.7923294901847839, "logits/rejected": -0.7994742393493652, "logps/chosen": -6.937150001525879, "logps/rejected": -56.21875, "loss": 0.5143358111381531, "memory(GiB)": 45.96, "nll_loss": 0.3873366713523865, "rewards/accuracies": 0.9375, "rewards/chosen": 0.174740269780159, "rewards/margins": 4.219673156738281, "rewards/rejected": -4.044933319091797, "step": 282, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.535826282468493, "grad_norm": 2.29225754737854, "learning_rate": 0.00019114376567117074, "logits/chosen": -0.8077491521835327, "logits/rejected": -0.8139883279800415, "logps/chosen": -4.497866630554199, "logps/rejected": -47.65617370605469, "loss": 0.3458153009414673, "memory(GiB)": 45.96, "nll_loss": 0.23723626136779785, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32140105962753296, "rewards/margins": 3.6276650428771973, "rewards/rejected": -3.3062644004821777, "step": 283, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5377196615584877, "grad_norm": 2.587045431137085, "learning_rate": 0.00019105762465777598, "logits/chosen": -0.76796555519104, "logits/rejected": -0.7804409265518188, "logps/chosen": -6.710290908813477, "logps/rejected": -55.04357147216797, "loss": 0.6548448204994202, "memory(GiB)": 45.96, "nll_loss": 0.41518449783325195, "rewards/accuracies": 0.84375, "rewards/chosen": 0.23511014878749847, "rewards/margins": 3.4961049556732178, "rewards/rejected": -3.2609944343566895, "step": 284, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5396130406484824, "grad_norm": 2.1301791667938232, "learning_rate": 0.00019097108634285624, "logits/chosen": -0.7952322363853455, "logits/rejected": -0.8057968616485596, "logps/chosen": -5.858229637145996, "logps/rejected": -66.42866516113281, "loss": 0.37013787031173706, "memory(GiB)": 45.96, "nll_loss": 0.2697468400001526, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23830053210258484, "rewards/margins": 4.619449615478516, "rewards/rejected": -4.381148815155029, "step": 285, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.541506419738477, "grad_norm": 14.95060920715332, "learning_rate": 0.00019088415110399444, "logits/chosen": -0.8046155571937561, "logits/rejected": -0.8122010827064514, "logps/chosen": -6.331181526184082, "logps/rejected": -64.72640228271484, "loss": 0.3927690088748932, "memory(GiB)": 45.96, "nll_loss": 0.26214665174484253, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19679710268974304, "rewards/margins": 5.021756649017334, "rewards/rejected": -4.824959754943848, "step": 286, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5433997988284717, "grad_norm": 4.531976699829102, "learning_rate": 0.00019079681932050542, "logits/chosen": -0.7703898549079895, "logits/rejected": -0.7752258777618408, "logps/chosen": -5.728086471557617, "logps/rejected": -57.623958587646484, "loss": 0.4262126386165619, "memory(GiB)": 45.96, "nll_loss": 0.27883288264274597, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2624058723449707, "rewards/margins": 4.643805503845215, "rewards/rejected": -4.3814005851745605, "step": 287, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5452931779184663, "grad_norm": 2.6767520904541016, "learning_rate": 0.00019070909137343408, "logits/chosen": -0.8187030553817749, "logits/rejected": -0.8257608413696289, "logps/chosen": -6.29841423034668, "logps/rejected": -66.14295959472656, "loss": 0.3371083736419678, "memory(GiB)": 45.96, "nll_loss": 0.210712268948555, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22904178500175476, "rewards/margins": 4.86109733581543, "rewards/rejected": -4.632055282592773, "step": 288, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5471865570084611, "grad_norm": 9.247986793518066, "learning_rate": 0.000190620967645554, "logits/chosen": -0.7456453442573547, "logits/rejected": -0.758894681930542, "logps/chosen": -5.9966888427734375, "logps/rejected": -89.31047821044922, "loss": 0.376960426568985, "memory(GiB)": 45.96, "nll_loss": 0.32863202691078186, "rewards/accuracies": 1.0, "rewards/chosen": 0.40128135681152344, "rewards/margins": 6.478516578674316, "rewards/rejected": -6.077235221862793, "step": 289, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5490799360984557, "grad_norm": 4.125120162963867, "learning_rate": 0.00019053244852136554, "logits/chosen": -0.720355749130249, "logits/rejected": -0.7238030433654785, "logps/chosen": -7.328817367553711, "logps/rejected": -54.47208023071289, "loss": 0.5468963384628296, "memory(GiB)": 45.96, "nll_loss": 0.313761830329895, "rewards/accuracies": 0.84375, "rewards/chosen": 0.20256341993808746, "rewards/margins": 4.272522926330566, "rewards/rejected": -4.06995964050293, "step": 290, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5509733151884504, "grad_norm": 16.452295303344727, "learning_rate": 0.00019044353438709425, "logits/chosen": -0.7850386500358582, "logits/rejected": -0.7899038195610046, "logps/chosen": -8.804156303405762, "logps/rejected": -50.80997848510742, "loss": 0.41979584097862244, "memory(GiB)": 45.96, "nll_loss": 0.2754655182361603, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2856299877166748, "rewards/margins": 3.883333206176758, "rewards/rejected": -3.597702980041504, "step": 291, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.552866694278445, "grad_norm": 1.7969173192977905, "learning_rate": 0.0001903542256306892, "logits/chosen": -0.7434848546981812, "logits/rejected": -0.7542124390602112, "logps/chosen": -5.325131416320801, "logps/rejected": -52.36528015136719, "loss": 0.3374747335910797, "memory(GiB)": 45.96, "nll_loss": 0.18438780307769775, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2966896891593933, "rewards/margins": 3.624333381652832, "rewards/rejected": -3.327644109725952, "step": 292, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5547600733684397, "grad_norm": 1.3389047384262085, "learning_rate": 0.00019026452264182133, "logits/chosen": -0.7741931080818176, "logits/rejected": -0.7864500284194946, "logps/chosen": -3.9642157554626465, "logps/rejected": -56.372291564941406, "loss": 0.25577616691589355, "memory(GiB)": 45.96, "nll_loss": 0.19787441194057465, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3570703864097595, "rewards/margins": 4.0897650718688965, "rewards/rejected": -3.732694149017334, "step": 293, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5566534524584345, "grad_norm": 19.48859977722168, "learning_rate": 0.0001901744258118816, "logits/chosen": -0.7488910555839539, "logits/rejected": -0.7564380764961243, "logps/chosen": -5.505663871765137, "logps/rejected": -47.65184020996094, "loss": 0.5035507082939148, "memory(GiB)": 45.96, "nll_loss": 0.32677191495895386, "rewards/accuracies": 0.90625, "rewards/chosen": 0.395191490650177, "rewards/margins": 3.423536777496338, "rewards/rejected": -3.0283451080322266, "step": 294, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5585468315484291, "grad_norm": 2.008774518966675, "learning_rate": 0.00019008393553397938, "logits/chosen": -0.7502264976501465, "logits/rejected": -0.7578118443489075, "logps/chosen": -5.755902290344238, "logps/rejected": -68.1287841796875, "loss": 0.35803064703941345, "memory(GiB)": 45.96, "nll_loss": 0.2247561663389206, "rewards/accuracies": 0.90625, "rewards/chosen": 0.33679965138435364, "rewards/margins": 5.233041763305664, "rewards/rejected": -4.896242618560791, "step": 295, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5604402106384238, "grad_norm": 1.3325504064559937, "learning_rate": 0.0001899930522029408, "logits/chosen": -0.8117009401321411, "logits/rejected": -0.8213991522789001, "logps/chosen": -6.647754669189453, "logps/rejected": -63.37158203125, "loss": 0.31900104880332947, "memory(GiB)": 45.96, "nll_loss": 0.2485048770904541, "rewards/accuracies": 1.0, "rewards/chosen": 0.528366208076477, "rewards/margins": 4.6781086921691895, "rewards/rejected": -4.149742603302002, "step": 296, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5623335897284184, "grad_norm": 2.195697784423828, "learning_rate": 0.00018990177621530687, "logits/chosen": -0.8317320346832275, "logits/rejected": -0.8371787071228027, "logps/chosen": -2.5732357501983643, "logps/rejected": -64.65092468261719, "loss": 0.21604421734809875, "memory(GiB)": 45.96, "nll_loss": 0.14539764821529388, "rewards/accuracies": 0.96875, "rewards/chosen": 0.33231592178344727, "rewards/margins": 5.368936061859131, "rewards/rejected": -5.036620140075684, "step": 297, "train_speed(iter/s)": 0.005607 }, { "epoch": 0.5642269688184132, "grad_norm": 3.2850587368011475, "learning_rate": 0.0001898101079693319, "logits/chosen": -0.8763929009437561, "logits/rejected": -0.8853050470352173, "logps/chosen": -7.0348052978515625, "logps/rejected": -73.10599517822266, "loss": 0.3883512616157532, "memory(GiB)": 45.96, "nll_loss": 0.3356992304325104, "rewards/accuracies": 0.96875, "rewards/chosen": 0.44934678077697754, "rewards/margins": 5.959858417510986, "rewards/rejected": -5.510511875152588, "step": 298, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5661203479084078, "grad_norm": 73.654052734375, "learning_rate": 0.0001897180478649817, "logits/chosen": -0.8361641764640808, "logits/rejected": -0.8429641723632812, "logps/chosen": -3.9281766414642334, "logps/rejected": -61.438812255859375, "loss": 0.36019739508628845, "memory(GiB)": 45.96, "nll_loss": 0.25969114899635315, "rewards/accuracies": 1.0, "rewards/chosen": 0.31078457832336426, "rewards/margins": 4.794025421142578, "rewards/rejected": -4.483240604400635, "step": 299, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5680137269984025, "grad_norm": 4.500136852264404, "learning_rate": 0.00018962559630393173, "logits/chosen": -0.8823038339614868, "logits/rejected": -0.8893939256668091, "logps/chosen": -10.261281967163086, "logps/rejected": -72.63387298583984, "loss": 0.5553180575370789, "memory(GiB)": 45.96, "nll_loss": 0.48980623483657837, "rewards/accuracies": 1.0, "rewards/chosen": 0.2931188941001892, "rewards/margins": 5.616513252258301, "rewards/rejected": -5.323395252227783, "step": 300, "train_speed(iter/s)": 0.005606 }, { "epoch": 0.5680137269984025, "eval_logits/chosen": -0.9059550762176514, "eval_logits/rejected": -0.9165492057800293, "eval_logps/chosen": -6.452853679656982, "eval_logps/rejected": -87.56333923339844, "eval_loss": 0.4157661497592926, "eval_nll_loss": 0.34246140718460083, "eval_rewards/accuracies": 0.9647058844566345, "eval_rewards/chosen": 0.3199980556964874, "eval_rewards/margins": 7.240695476531982, "eval_rewards/rejected": -6.920697212219238, "eval_runtime": 383.4477, "eval_samples_per_second": 0.443, "eval_steps_per_second": 0.443, "step": 300 }, { "epoch": 0.5699071060883971, "grad_norm": 1.6478270292282104, "learning_rate": 0.00018953275368956555, "logits/chosen": -0.8683250546455383, "logits/rejected": -0.8765738010406494, "logps/chosen": -4.596683502197266, "logps/rejected": -71.82097625732422, "loss": 0.23614919185638428, "memory(GiB)": 45.96, "nll_loss": 0.1724119931459427, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28458163142204285, "rewards/margins": 5.737771987915039, "rewards/rejected": -5.453190326690674, "step": 301, "train_speed(iter/s)": 0.005565 }, { "epoch": 0.5718004851783918, "grad_norm": 2.4366822242736816, "learning_rate": 0.00018943952042697296, "logits/chosen": -0.903656005859375, "logits/rejected": -0.9147554636001587, "logps/chosen": -6.1691365242004395, "logps/rejected": -98.06748962402344, "loss": 0.43336808681488037, "memory(GiB)": 45.96, "nll_loss": 0.37197959423065186, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45999443531036377, "rewards/margins": 8.3666353225708, "rewards/rejected": -7.906641006469727, "step": 302, "train_speed(iter/s)": 0.005565 }, { "epoch": 0.5736938642683865, "grad_norm": 6.613124847412109, "learning_rate": 0.00018934589692294818, "logits/chosen": -0.9739726781845093, "logits/rejected": -0.9870423674583435, "logps/chosen": -5.006122589111328, "logps/rejected": -110.79590606689453, "loss": 0.3391586244106293, "memory(GiB)": 45.96, "nll_loss": 0.24201489984989166, "rewards/accuracies": 0.9375, "rewards/chosen": 0.352843701839447, "rewards/margins": 9.359478950500488, "rewards/rejected": -9.006634712219238, "step": 303, "train_speed(iter/s)": 0.005565 }, { "epoch": 0.5755872433583812, "grad_norm": 6.816748142242432, "learning_rate": 0.00018925188358598813, "logits/chosen": -0.962784469127655, "logits/rejected": -0.9713460206985474, "logps/chosen": -8.601051330566406, "logps/rejected": -93.97550964355469, "loss": 0.4550440311431885, "memory(GiB)": 45.96, "nll_loss": 0.331770122051239, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2643924951553345, "rewards/margins": 8.098273277282715, "rewards/rejected": -7.833880424499512, "step": 304, "train_speed(iter/s)": 0.005565 }, { "epoch": 0.5774806224483758, "grad_norm": 3.7295877933502197, "learning_rate": 0.0001891574808262907, "logits/chosen": -0.9686220288276672, "logits/rejected": -0.9826257228851318, "logps/chosen": -8.40042781829834, "logps/rejected": -118.83855438232422, "loss": 0.3994218707084656, "memory(GiB)": 45.96, "nll_loss": 0.32849177718162537, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37062764167785645, "rewards/margins": 10.088976860046387, "rewards/rejected": -9.71834945678711, "step": 305, "train_speed(iter/s)": 0.005565 }, { "epoch": 0.5793740015383705, "grad_norm": 1.8573001623153687, "learning_rate": 0.00018906268905575285, "logits/chosen": -0.9196559190750122, "logits/rejected": -0.9327231645584106, "logps/chosen": -9.870383262634277, "logps/rejected": -115.3849868774414, "loss": 0.4931097626686096, "memory(GiB)": 45.96, "nll_loss": 0.3947875499725342, "rewards/accuracies": 0.96875, "rewards/chosen": 0.35478293895721436, "rewards/margins": 10.043420791625977, "rewards/rejected": -9.688638687133789, "step": 306, "train_speed(iter/s)": 0.005566 }, { "epoch": 0.5812673806283651, "grad_norm": 5.879184722900391, "learning_rate": 0.00018896750868796887, "logits/chosen": -0.8445271849632263, "logits/rejected": -0.8584895133972168, "logps/chosen": -7.785769939422607, "logps/rejected": -109.72542572021484, "loss": 0.3518598675727844, "memory(GiB)": 45.96, "nll_loss": 0.29149600863456726, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4223713278770447, "rewards/margins": 9.426725387573242, "rewards/rejected": -9.004354476928711, "step": 307, "train_speed(iter/s)": 0.005566 }, { "epoch": 0.5831607597183599, "grad_norm": 10.44513988494873, "learning_rate": 0.00018887194013822862, "logits/chosen": -0.8841306567192078, "logits/rejected": -0.8950796127319336, "logps/chosen": -4.3363447189331055, "logps/rejected": -103.37335205078125, "loss": 0.4750944674015045, "memory(GiB)": 45.96, "nll_loss": 0.343455046415329, "rewards/accuracies": 0.875, "rewards/chosen": 0.2507314085960388, "rewards/margins": 8.82553482055664, "rewards/rejected": -8.574803352355957, "step": 308, "train_speed(iter/s)": 0.005566 }, { "epoch": 0.5850541388083546, "grad_norm": 34.57544708251953, "learning_rate": 0.0001887759838235156, "logits/chosen": -0.8739007115364075, "logits/rejected": -0.8843562602996826, "logps/chosen": -6.813051700592041, "logps/rejected": -107.06051635742188, "loss": 0.7519917488098145, "memory(GiB)": 45.96, "nll_loss": 0.5681273341178894, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10883338749408722, "rewards/margins": 8.822795867919922, "rewards/rejected": -8.71396255493164, "step": 309, "train_speed(iter/s)": 0.005567 }, { "epoch": 0.5869475178983492, "grad_norm": 8.953110694885254, "learning_rate": 0.00018867964016250528, "logits/chosen": -0.8052958846092224, "logits/rejected": -0.8159947991371155, "logps/chosen": -6.318592548370361, "logps/rejected": -106.75569152832031, "loss": 0.3217519521713257, "memory(GiB)": 45.96, "nll_loss": 0.24863341450691223, "rewards/accuracies": 0.96875, "rewards/chosen": 0.03278753161430359, "rewards/margins": 8.891491889953613, "rewards/rejected": -8.858704566955566, "step": 310, "train_speed(iter/s)": 0.005567 }, { "epoch": 0.5888408969883439, "grad_norm": 9.680059432983398, "learning_rate": 0.00018858290957556313, "logits/chosen": -0.8246707916259766, "logits/rejected": -0.8383605480194092, "logps/chosen": -5.819177150726318, "logps/rejected": -84.25653076171875, "loss": 0.4908764958381653, "memory(GiB)": 45.96, "nll_loss": 0.3518160581588745, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2999556064605713, "rewards/margins": 6.772392272949219, "rewards/rejected": -6.472436904907227, "step": 311, "train_speed(iter/s)": 0.005567 }, { "epoch": 0.5907342760783385, "grad_norm": 1.4490282535552979, "learning_rate": 0.00018848579248474288, "logits/chosen": -0.7970471978187561, "logits/rejected": -0.8090251684188843, "logps/chosen": -2.809403896331787, "logps/rejected": -65.53295135498047, "loss": 0.23040540516376495, "memory(GiB)": 45.96, "nll_loss": 0.14142940938472748, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31414929032325745, "rewards/margins": 5.153748989105225, "rewards/rejected": -4.839599609375, "step": 312, "train_speed(iter/s)": 0.005568 }, { "epoch": 0.5926276551683333, "grad_norm": 11.067521095275879, "learning_rate": 0.00018838828931378463, "logits/chosen": -0.8277375102043152, "logits/rejected": -0.8391073942184448, "logps/chosen": -7.107628345489502, "logps/rejected": -77.02799987792969, "loss": 0.6485866904258728, "memory(GiB)": 45.96, "nll_loss": 0.35685575008392334, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19486919045448303, "rewards/margins": 5.629068374633789, "rewards/rejected": -5.43419885635376, "step": 313, "train_speed(iter/s)": 0.005568 }, { "epoch": 0.5945210342583279, "grad_norm": 17.583600997924805, "learning_rate": 0.00018829040048811305, "logits/chosen": -0.8249818086624146, "logits/rejected": -0.8355417251586914, "logps/chosen": -10.383692741394043, "logps/rejected": -88.57411193847656, "loss": 1.1173313856124878, "memory(GiB)": 45.96, "nll_loss": 0.8328571915626526, "rewards/accuracies": 0.84375, "rewards/chosen": -0.12180662155151367, "rewards/margins": 6.225827217102051, "rewards/rejected": -6.3476338386535645, "step": 314, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.5964144133483226, "grad_norm": 1.3052239418029785, "learning_rate": 0.0001881921264348355, "logits/chosen": -0.8118442893028259, "logits/rejected": -0.8303354978561401, "logps/chosen": -5.193848609924316, "logps/rejected": -78.52323913574219, "loss": 0.3948984444141388, "memory(GiB)": 45.96, "nll_loss": 0.22238636016845703, "rewards/accuracies": 0.875, "rewards/chosen": 0.4186479151248932, "rewards/margins": 5.8724188804626465, "rewards/rejected": -5.453771114349365, "step": 315, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.5983077924383172, "grad_norm": 4.303112983703613, "learning_rate": 0.00018809346758274012, "logits/chosen": -0.8591910004615784, "logits/rejected": -0.8673767447471619, "logps/chosen": -6.369632244110107, "logps/rejected": -72.42138671875, "loss": 0.3798455595970154, "memory(GiB)": 45.96, "nll_loss": 0.2527866065502167, "rewards/accuracies": 0.9375, "rewards/chosen": 0.39195647835731506, "rewards/margins": 5.535797119140625, "rewards/rejected": -5.143840789794922, "step": 316, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.600201171528312, "grad_norm": 1.2503244876861572, "learning_rate": 0.00018799442436229403, "logits/chosen": -0.8667201399803162, "logits/rejected": -0.8784090876579285, "logps/chosen": -4.633861541748047, "logps/rejected": -93.7111587524414, "loss": 0.30663278698921204, "memory(GiB)": 45.96, "nll_loss": 0.2311694324016571, "rewards/accuracies": 0.96875, "rewards/chosen": 0.48267802596092224, "rewards/margins": 8.00043773651123, "rewards/rejected": -7.517759323120117, "step": 317, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6020945506183066, "grad_norm": 6.858788967132568, "learning_rate": 0.00018789499720564136, "logits/chosen": -0.9277811646461487, "logits/rejected": -0.934998631477356, "logps/chosen": -6.271909236907959, "logps/rejected": -58.293670654296875, "loss": 0.5750719308853149, "memory(GiB)": 45.96, "nll_loss": 0.3498351275920868, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1989549994468689, "rewards/margins": 4.847379207611084, "rewards/rejected": -4.64842414855957, "step": 318, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6039879297083013, "grad_norm": 4.458963394165039, "learning_rate": 0.00018779518654660153, "logits/chosen": -0.8746768236160278, "logits/rejected": -0.887937605381012, "logps/chosen": -5.970765113830566, "logps/rejected": -73.90641784667969, "loss": 0.5496221780776978, "memory(GiB)": 45.96, "nll_loss": 0.4115613102912903, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2141362726688385, "rewards/margins": 5.52421236038208, "rewards/rejected": -5.310075759887695, "step": 319, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6058813087982959, "grad_norm": 4.74213981628418, "learning_rate": 0.00018769499282066717, "logits/chosen": -0.9022679328918457, "logits/rejected": -0.9067811965942383, "logps/chosen": -4.3401031494140625, "logps/rejected": -64.71338653564453, "loss": 0.46817266941070557, "memory(GiB)": 45.96, "nll_loss": 0.2838274836540222, "rewards/accuracies": 0.875, "rewards/chosen": 0.387113094329834, "rewards/margins": 5.29489278793335, "rewards/rejected": -4.907780170440674, "step": 320, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6077746878882906, "grad_norm": 1.5771666765213013, "learning_rate": 0.00018759441646500234, "logits/chosen": -0.9481390714645386, "logits/rejected": -0.960427463054657, "logps/chosen": -3.579497814178467, "logps/rejected": -90.05030822753906, "loss": 0.27988624572753906, "memory(GiB)": 45.96, "nll_loss": 0.1971428096294403, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3307838439941406, "rewards/margins": 7.247364521026611, "rewards/rejected": -6.916580677032471, "step": 321, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6096680669782854, "grad_norm": 3.5266613960266113, "learning_rate": 0.0001874934579184406, "logits/chosen": -0.9149664640426636, "logits/rejected": -0.9217000007629395, "logps/chosen": -7.331539630889893, "logps/rejected": -62.536720275878906, "loss": 0.2879345715045929, "memory(GiB)": 45.96, "nll_loss": 0.2096707969903946, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19104890525341034, "rewards/margins": 4.760408401489258, "rewards/rejected": -4.56935977935791, "step": 322, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.61156144606828, "grad_norm": 17.796716690063477, "learning_rate": 0.000187392117621483, "logits/chosen": -0.9241886734962463, "logits/rejected": -0.9360665082931519, "logps/chosen": -3.9619576930999756, "logps/rejected": -81.54830169677734, "loss": 0.29742905497550964, "memory(GiB)": 45.96, "nll_loss": 0.21862103044986725, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4049226641654968, "rewards/margins": 6.298480033874512, "rewards/rejected": -5.893557548522949, "step": 323, "train_speed(iter/s)": 0.005568 }, { "epoch": 0.6134548251582747, "grad_norm": 3.629298210144043, "learning_rate": 0.00018729039601629634, "logits/chosen": -0.888552725315094, "logits/rejected": -0.8931864500045776, "logps/chosen": -8.97883129119873, "logps/rejected": -53.001277923583984, "loss": 0.4431394934654236, "memory(GiB)": 45.96, "nll_loss": 0.27529340982437134, "rewards/accuracies": 0.90625, "rewards/chosen": 0.27515706419944763, "rewards/margins": 3.8233470916748047, "rewards/rejected": -3.548189878463745, "step": 324, "train_speed(iter/s)": 0.005568 }, { "epoch": 0.6153482042482693, "grad_norm": 22.506664276123047, "learning_rate": 0.00018718829354671113, "logits/chosen": -0.935386061668396, "logits/rejected": -0.946205735206604, "logps/chosen": -4.333962917327881, "logps/rejected": -69.80958557128906, "loss": 0.38010165095329285, "memory(GiB)": 45.96, "nll_loss": 0.27887049317359924, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41510555148124695, "rewards/margins": 5.503192901611328, "rewards/rejected": -5.088087558746338, "step": 325, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.617241583338264, "grad_norm": 3.3655357360839844, "learning_rate": 0.00018708581065821954, "logits/chosen": -0.9429974555969238, "logits/rejected": -0.9552821516990662, "logps/chosen": -5.25839900970459, "logps/rejected": -56.73838424682617, "loss": 0.5094978213310242, "memory(GiB)": 45.96, "nll_loss": 0.446816086769104, "rewards/accuracies": 1.0, "rewards/chosen": 0.38630491495132446, "rewards/margins": 4.239760398864746, "rewards/rejected": -3.8534557819366455, "step": 326, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6191349624282587, "grad_norm": 2.8727710247039795, "learning_rate": 0.0001869829477979737, "logits/chosen": -0.8893756866455078, "logits/rejected": -0.8951653242111206, "logps/chosen": -4.583832263946533, "logps/rejected": -55.753257751464844, "loss": 0.2895621359348297, "memory(GiB)": 45.96, "nll_loss": 0.19121912121772766, "rewards/accuracies": 0.96875, "rewards/chosen": 0.40792274475097656, "rewards/margins": 4.444224834442139, "rewards/rejected": -4.03630256652832, "step": 327, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.6210283415182534, "grad_norm": 2.481173515319824, "learning_rate": 0.00018687970541478364, "logits/chosen": -0.9552744030952454, "logits/rejected": -0.9592955112457275, "logps/chosen": -6.099732875823975, "logps/rejected": -55.62705993652344, "loss": 0.3935054838657379, "memory(GiB)": 45.96, "nll_loss": 0.2654397785663605, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3739722669124603, "rewards/margins": 4.395190238952637, "rewards/rejected": -4.021218299865723, "step": 328, "train_speed(iter/s)": 0.005569 }, { "epoch": 0.622921720608248, "grad_norm": 0.932902991771698, "learning_rate": 0.00018677608395911526, "logits/chosen": -0.9515609741210938, "logits/rejected": -0.9636331796646118, "logps/chosen": -5.270691871643066, "logps/rejected": -69.07537841796875, "loss": 0.1866064816713333, "memory(GiB)": 45.96, "nll_loss": 0.1546114981174469, "rewards/accuracies": 1.0, "rewards/chosen": 0.43455418944358826, "rewards/margins": 5.497076034545898, "rewards/rejected": -5.062521934509277, "step": 329, "train_speed(iter/s)": 0.00557 }, { "epoch": 0.6248150996982427, "grad_norm": 56.31227493286133, "learning_rate": 0.00018667208388308841, "logits/chosen": -0.9246232509613037, "logits/rejected": -0.9359687566757202, "logps/chosen": -5.232905864715576, "logps/rejected": -61.79796600341797, "loss": 0.4251781404018402, "memory(GiB)": 45.96, "nll_loss": 0.3015526831150055, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32587265968322754, "rewards/margins": 4.692801475524902, "rewards/rejected": -4.366928577423096, "step": 330, "train_speed(iter/s)": 0.00557 }, { "epoch": 0.6267084787882374, "grad_norm": 4.163169860839844, "learning_rate": 0.00018656770564047496, "logits/chosen": -0.9365993142127991, "logits/rejected": -0.9441806674003601, "logps/chosen": -5.937311172485352, "logps/rejected": -64.2382583618164, "loss": 0.4102782905101776, "memory(GiB)": 45.96, "nll_loss": 0.21538400650024414, "rewards/accuracies": 0.875, "rewards/chosen": 0.27078527212142944, "rewards/margins": 5.3102803230285645, "rewards/rejected": -5.03949499130249, "step": 331, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6286018578782321, "grad_norm": 23.430564880371094, "learning_rate": 0.00018646294968669685, "logits/chosen": -0.9300607442855835, "logits/rejected": -0.9476884603500366, "logps/chosen": -5.615139007568359, "logps/rejected": -77.03141784667969, "loss": 0.6246126890182495, "memory(GiB)": 45.96, "nll_loss": 0.4357287287712097, "rewards/accuracies": 0.875, "rewards/chosen": 0.3221561312675476, "rewards/margins": 5.601375579833984, "rewards/rejected": -5.2792205810546875, "step": 332, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6304952369682267, "grad_norm": 3.6118054389953613, "learning_rate": 0.0001863578164788239, "logits/chosen": -0.9302395582199097, "logits/rejected": -0.9413833022117615, "logps/chosen": -7.32153844833374, "logps/rejected": -66.94845581054688, "loss": 0.7131233811378479, "memory(GiB)": 45.96, "nll_loss": 0.4995349049568176, "rewards/accuracies": 0.84375, "rewards/chosen": 0.04812576249241829, "rewards/margins": 5.103006362915039, "rewards/rejected": -5.0548810958862305, "step": 333, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6323886160582214, "grad_norm": 2.5514726638793945, "learning_rate": 0.00018625230647557217, "logits/chosen": -0.9299983978271484, "logits/rejected": -0.940325915813446, "logps/chosen": -6.139636039733887, "logps/rejected": -66.79703521728516, "loss": 0.38100895285606384, "memory(GiB)": 45.96, "nll_loss": 0.2833740711212158, "rewards/accuracies": 0.96875, "rewards/chosen": 0.39727550745010376, "rewards/margins": 5.418885231018066, "rewards/rejected": -5.021610260009766, "step": 334, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.634281995148216, "grad_norm": 7.410953998565674, "learning_rate": 0.0001861464201373015, "logits/chosen": -0.9981006979942322, "logits/rejected": -1.0123075246810913, "logps/chosen": -3.0750880241394043, "logps/rejected": -89.65264892578125, "loss": 0.23634791374206543, "memory(GiB)": 45.96, "nll_loss": 0.14243003726005554, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37372106313705444, "rewards/margins": 7.329642295837402, "rewards/rejected": -6.955921173095703, "step": 335, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6361753742382108, "grad_norm": 2.460972547531128, "learning_rate": 0.00018604015792601396, "logits/chosen": -0.926382303237915, "logits/rejected": -0.9328540563583374, "logps/chosen": -6.227597713470459, "logps/rejected": -58.30305480957031, "loss": 0.2906293272972107, "memory(GiB)": 45.96, "nll_loss": 0.1831737905740738, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3218955993652344, "rewards/margins": 4.378249645233154, "rewards/rejected": -4.05635404586792, "step": 336, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6380687533282055, "grad_norm": 2.0313737392425537, "learning_rate": 0.0001859335203053515, "logits/chosen": -0.9640895128250122, "logits/rejected": -0.9761223196983337, "logps/chosen": -5.581124305725098, "logps/rejected": -63.39913558959961, "loss": 0.5718323588371277, "memory(GiB)": 45.96, "nll_loss": 0.3999195396900177, "rewards/accuracies": 0.96875, "rewards/chosen": 0.213788241147995, "rewards/margins": 5.133645534515381, "rewards/rejected": -4.919857025146484, "step": 337, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6399621324182001, "grad_norm": 4.065624713897705, "learning_rate": 0.0001858265077405941, "logits/chosen": -0.8603492379188538, "logits/rejected": -0.870326578617096, "logps/chosen": -5.7338457107543945, "logps/rejected": -69.25128936767578, "loss": 0.34140416979789734, "memory(GiB)": 45.96, "nll_loss": 0.2584512233734131, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32439491152763367, "rewards/margins": 5.536102294921875, "rewards/rejected": -5.21170711517334, "step": 338, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6418555115081948, "grad_norm": 2.9222512245178223, "learning_rate": 0.00018571912069865776, "logits/chosen": -0.8618049621582031, "logits/rejected": -0.870703935623169, "logps/chosen": -7.246155261993408, "logps/rejected": -51.38260269165039, "loss": 0.4438958466053009, "memory(GiB)": 45.96, "nll_loss": 0.27844953536987305, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2594514489173889, "rewards/margins": 3.721580982208252, "rewards/rejected": -3.462129592895508, "step": 339, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6437488905981894, "grad_norm": 11.053990364074707, "learning_rate": 0.00018561135964809223, "logits/chosen": -0.8574349880218506, "logits/rejected": -0.8660771250724792, "logps/chosen": -2.8028204441070557, "logps/rejected": -60.271385192871094, "loss": 0.2936401665210724, "memory(GiB)": 45.96, "nll_loss": 0.2107047736644745, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37268757820129395, "rewards/margins": 4.701450824737549, "rewards/rejected": -4.328763484954834, "step": 340, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6456422696881842, "grad_norm": 33.189571380615234, "learning_rate": 0.00018550322505907923, "logits/chosen": -0.7724344730377197, "logits/rejected": -0.7846801280975342, "logps/chosen": -6.443312644958496, "logps/rejected": -63.350616455078125, "loss": 0.8022756576538086, "memory(GiB)": 45.96, "nll_loss": 0.5788527131080627, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21350334584712982, "rewards/margins": 4.397084712982178, "rewards/rejected": -4.183581352233887, "step": 341, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6475356487781788, "grad_norm": 12.396661758422852, "learning_rate": 0.00018539471740343033, "logits/chosen": -0.8222888708114624, "logits/rejected": -0.8293163180351257, "logps/chosen": -4.639364242553711, "logps/rejected": -57.1859016418457, "loss": 0.6142297387123108, "memory(GiB)": 45.96, "nll_loss": 0.4827613830566406, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2849894165992737, "rewards/margins": 4.214752197265625, "rewards/rejected": -3.929762601852417, "step": 342, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6494290278681735, "grad_norm": 2.387334108352661, "learning_rate": 0.0001852858371545848, "logits/chosen": -0.7581778764724731, "logits/rejected": -0.7650014758110046, "logps/chosen": -7.369527816772461, "logps/rejected": -59.144012451171875, "loss": 0.3893844187259674, "memory(GiB)": 45.96, "nll_loss": 0.33146339654922485, "rewards/accuracies": 1.0, "rewards/chosen": 0.4411081373691559, "rewards/margins": 4.799034118652344, "rewards/rejected": -4.357925891876221, "step": 343, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6513224069581681, "grad_norm": 2.518702745437622, "learning_rate": 0.0001851765847876076, "logits/chosen": -0.8135807514190674, "logits/rejected": -0.8240830898284912, "logps/chosen": -3.35158109664917, "logps/rejected": -54.54274368286133, "loss": 0.25894394516944885, "memory(GiB)": 45.96, "nll_loss": 0.15596656501293182, "rewards/accuracies": 1.0, "rewards/chosen": 0.3464549779891968, "rewards/margins": 4.198663234710693, "rewards/rejected": -3.852208137512207, "step": 344, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6532157860481629, "grad_norm": 6.995054244995117, "learning_rate": 0.00018506696077918742, "logits/chosen": -0.8065057992935181, "logits/rejected": -0.814572811126709, "logps/chosen": -4.734983921051025, "logps/rejected": -58.506385803222656, "loss": 0.45452654361724854, "memory(GiB)": 45.96, "nll_loss": 0.29960596561431885, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23975589871406555, "rewards/margins": 4.3970513343811035, "rewards/rejected": -4.157295227050781, "step": 345, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6551091651381575, "grad_norm": 1.396971344947815, "learning_rate": 0.00018495696560763428, "logits/chosen": -0.8346060514450073, "logits/rejected": -0.8455590009689331, "logps/chosen": -6.954171657562256, "logps/rejected": -58.36876678466797, "loss": 0.41100573539733887, "memory(GiB)": 45.96, "nll_loss": 0.3312125504016876, "rewards/accuracies": 1.0, "rewards/chosen": 0.3940037786960602, "rewards/margins": 4.3294878005981445, "rewards/rejected": -3.935483932495117, "step": 346, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6570025442281522, "grad_norm": 4.642291069030762, "learning_rate": 0.00018484659975287788, "logits/chosen": -0.8456770777702332, "logits/rejected": -0.8482322692871094, "logps/chosen": -10.749929428100586, "logps/rejected": -61.98844909667969, "loss": 0.3847033679485321, "memory(GiB)": 45.96, "nll_loss": 0.25482821464538574, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3538522720336914, "rewards/margins": 4.825608253479004, "rewards/rejected": -4.4717559814453125, "step": 347, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6588959233181468, "grad_norm": 2.9362223148345947, "learning_rate": 0.00018473586369646512, "logits/chosen": -0.8183330297470093, "logits/rejected": -0.8273117542266846, "logps/chosen": -3.4568326473236084, "logps/rejected": -69.13544464111328, "loss": 0.35661450028419495, "memory(GiB)": 45.96, "nll_loss": 0.1939859688282013, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36636775732040405, "rewards/margins": 5.597408771514893, "rewards/rejected": -5.231040954589844, "step": 348, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6607893024081415, "grad_norm": 8.023280143737793, "learning_rate": 0.00018462475792155824, "logits/chosen": -0.775278627872467, "logits/rejected": -0.7894055247306824, "logps/chosen": -4.536966323852539, "logps/rejected": -65.62297821044922, "loss": 0.2713961899280548, "memory(GiB)": 45.96, "nll_loss": 0.19426655769348145, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4155954420566559, "rewards/margins": 5.086872577667236, "rewards/rejected": -4.671277046203613, "step": 349, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6626826814981363, "grad_norm": 2.4450321197509766, "learning_rate": 0.00018451328291293264, "logits/chosen": -0.7985575795173645, "logits/rejected": -0.808333694934845, "logps/chosen": -6.013537883758545, "logps/rejected": -75.55121612548828, "loss": 0.3190026879310608, "memory(GiB)": 45.96, "nll_loss": 0.274376779794693, "rewards/accuracies": 1.0, "rewards/chosen": 0.37852659821510315, "rewards/margins": 5.885116100311279, "rewards/rejected": -5.506588935852051, "step": 350, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6645760605881309, "grad_norm": 11.652441024780273, "learning_rate": 0.0001844014391569747, "logits/chosen": -0.8393977284431458, "logits/rejected": -0.8486717939376831, "logps/chosen": -8.01746940612793, "logps/rejected": -66.04694366455078, "loss": 0.5918421745300293, "memory(GiB)": 45.96, "nll_loss": 0.4767189025878906, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20049431920051575, "rewards/margins": 5.253631591796875, "rewards/rejected": -5.053136825561523, "step": 351, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6664694396781256, "grad_norm": 3.3374173641204834, "learning_rate": 0.0001842892271416797, "logits/chosen": -0.828509509563446, "logits/rejected": -0.8383011221885681, "logps/chosen": -7.521579742431641, "logps/rejected": -65.2198486328125, "loss": 0.4373883008956909, "memory(GiB)": 45.96, "nll_loss": 0.38811227679252625, "rewards/accuracies": 1.0, "rewards/chosen": 0.3511880338191986, "rewards/margins": 5.433207035064697, "rewards/rejected": -5.082019329071045, "step": 352, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6683628187681202, "grad_norm": 1.81625235080719, "learning_rate": 0.00018417664735664985, "logits/chosen": -0.7870513200759888, "logits/rejected": -0.7983162999153137, "logps/chosen": -6.6251020431518555, "logps/rejected": -69.36129760742188, "loss": 0.30411848425865173, "memory(GiB)": 45.96, "nll_loss": 0.23931153118610382, "rewards/accuracies": 0.96875, "rewards/chosen": 0.46187031269073486, "rewards/margins": 5.455815315246582, "rewards/rejected": -4.9939446449279785, "step": 353, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6702561978581149, "grad_norm": 5.95273494720459, "learning_rate": 0.0001840637002930918, "logits/chosen": -0.7893354892730713, "logits/rejected": -0.7926087975502014, "logps/chosen": -3.356367588043213, "logps/rejected": -54.068214416503906, "loss": 0.23361176252365112, "memory(GiB)": 45.96, "nll_loss": 0.16138066351413727, "rewards/accuracies": 1.0, "rewards/chosen": 0.3823690414428711, "rewards/margins": 4.487397193908691, "rewards/rejected": -4.1050286293029785, "step": 354, "train_speed(iter/s)": 0.005571 }, { "epoch": 0.6721495769481096, "grad_norm": 2.7681703567504883, "learning_rate": 0.00018395038644381488, "logits/chosen": -0.8022831678390503, "logits/rejected": -0.8161917924880981, "logps/chosen": -7.168720245361328, "logps/rejected": -60.850887298583984, "loss": 0.6297565698623657, "memory(GiB)": 45.96, "nll_loss": 0.5241124629974365, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3222300112247467, "rewards/margins": 4.561849117279053, "rewards/rejected": -4.239619255065918, "step": 355, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6740429560381043, "grad_norm": 1.745928406715393, "learning_rate": 0.00018383670630322865, "logits/chosen": -0.8162990212440491, "logits/rejected": -0.8287326097488403, "logps/chosen": -5.697843551635742, "logps/rejected": -72.2893295288086, "loss": 0.3242051899433136, "memory(GiB)": 45.96, "nll_loss": 0.19369246065616608, "rewards/accuracies": 0.90625, "rewards/chosen": 0.39551740884780884, "rewards/margins": 5.45540189743042, "rewards/rejected": -5.059884071350098, "step": 356, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6759363351280989, "grad_norm": 1.5724689960479736, "learning_rate": 0.00018372266036734098, "logits/chosen": -0.7709946036338806, "logits/rejected": -0.7820452451705933, "logps/chosen": -7.69317102432251, "logps/rejected": -63.20610809326172, "loss": 0.4046747088432312, "memory(GiB)": 45.96, "nll_loss": 0.26361504197120667, "rewards/accuracies": 0.90625, "rewards/chosen": 0.44556182622909546, "rewards/margins": 4.433609962463379, "rewards/rejected": -3.9880480766296387, "step": 357, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6778297142180936, "grad_norm": 0.8649733662605286, "learning_rate": 0.00018360824913375568, "logits/chosen": -0.8018120527267456, "logits/rejected": -0.8122223019599915, "logps/chosen": -5.195913314819336, "logps/rejected": -69.43289947509766, "loss": 0.1661713868379593, "memory(GiB)": 45.96, "nll_loss": 0.12944738566875458, "rewards/accuracies": 1.0, "rewards/chosen": 0.3514459729194641, "rewards/margins": 5.306279182434082, "rewards/rejected": -4.954833030700684, "step": 358, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6797230933080883, "grad_norm": 1.0646100044250488, "learning_rate": 0.00018349347310167046, "logits/chosen": -0.7723908424377441, "logits/rejected": -0.7902077436447144, "logps/chosen": -4.268543243408203, "logps/rejected": -75.9552001953125, "loss": 0.23154988884925842, "memory(GiB)": 45.96, "nll_loss": 0.17301858961582184, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5057197213172913, "rewards/margins": 5.4032464027404785, "rewards/rejected": -4.897526741027832, "step": 359, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.681616472398083, "grad_norm": 1.2381056547164917, "learning_rate": 0.00018337833277187472, "logits/chosen": -0.8530025482177734, "logits/rejected": -0.8602923154830933, "logps/chosen": -3.5304064750671387, "logps/rejected": -69.44783782958984, "loss": 0.27017509937286377, "memory(GiB)": 45.96, "nll_loss": 0.24506865441799164, "rewards/accuracies": 1.0, "rewards/chosen": 0.34460416436195374, "rewards/margins": 5.07497501373291, "rewards/rejected": -4.73037052154541, "step": 360, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6835098514880776, "grad_norm": 51.11272048950195, "learning_rate": 0.00018326282864674734, "logits/chosen": -0.8346350193023682, "logits/rejected": -0.847761332988739, "logps/chosen": -4.418249607086182, "logps/rejected": -72.58184051513672, "loss": 0.548991858959198, "memory(GiB)": 45.96, "nll_loss": 0.39672714471817017, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2148188203573227, "rewards/margins": 5.45236873626709, "rewards/rejected": -5.237550258636475, "step": 361, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6854032305780723, "grad_norm": 3.5835256576538086, "learning_rate": 0.00018314696123025454, "logits/chosen": -0.8421773314476013, "logits/rejected": -0.8487293124198914, "logps/chosen": -9.384542465209961, "logps/rejected": -66.58482360839844, "loss": 0.5891345739364624, "memory(GiB)": 45.96, "nll_loss": 0.5249395370483398, "rewards/accuracies": 1.0, "rewards/chosen": 0.3435335159301758, "rewards/margins": 5.227488994598389, "rewards/rejected": -4.883955001831055, "step": 362, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6872966096680669, "grad_norm": 2.492431163787842, "learning_rate": 0.0001830307310279476, "logits/chosen": -0.877526581287384, "logits/rejected": -0.8845463991165161, "logps/chosen": -5.337737083435059, "logps/rejected": -63.96607971191406, "loss": 0.4151839017868042, "memory(GiB)": 45.96, "nll_loss": 0.2992326319217682, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3732222020626068, "rewards/margins": 5.134644508361816, "rewards/rejected": -4.761421203613281, "step": 363, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6891899887580617, "grad_norm": 1.5654759407043457, "learning_rate": 0.00018291413854696077, "logits/chosen": -0.8303389549255371, "logits/rejected": -0.8396271467208862, "logps/chosen": -9.332134246826172, "logps/rejected": -57.97529602050781, "loss": 0.48519501090049744, "memory(GiB)": 45.96, "nll_loss": 0.37487462162971497, "rewards/accuracies": 0.9375, "rewards/chosen": 0.45280930399894714, "rewards/margins": 4.4484758377075195, "rewards/rejected": -3.995666742324829, "step": 364, "train_speed(iter/s)": 0.005573 }, { "epoch": 0.6910833678480564, "grad_norm": 21.09276580810547, "learning_rate": 0.0001827971842960089, "logits/chosen": -0.864224910736084, "logits/rejected": -0.8757129311561584, "logps/chosen": -6.988122940063477, "logps/rejected": -66.54647064208984, "loss": 0.662355899810791, "memory(GiB)": 45.96, "nll_loss": 0.4306182265281677, "rewards/accuracies": 0.90625, "rewards/chosen": -0.004866257309913635, "rewards/margins": 4.913517475128174, "rewards/rejected": -4.918384075164795, "step": 365, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.692976746938051, "grad_norm": 1.0892640352249146, "learning_rate": 0.00018267986878538545, "logits/chosen": -0.917788028717041, "logits/rejected": -0.9294503927230835, "logps/chosen": -3.470579147338867, "logps/rejected": -78.84397888183594, "loss": 0.20548279583454132, "memory(GiB)": 45.96, "nll_loss": 0.14263419806957245, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4148893356323242, "rewards/margins": 6.348430156707764, "rewards/rejected": -5.9335408210754395, "step": 366, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6948701260280457, "grad_norm": 5.015666484832764, "learning_rate": 0.00018256219252695994, "logits/chosen": -0.9198713302612305, "logits/rejected": -0.9371796250343323, "logps/chosen": -9.38389778137207, "logps/rejected": -91.02330780029297, "loss": 0.3265993297100067, "memory(GiB)": 45.96, "nll_loss": 0.2348761260509491, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09129352122545242, "rewards/margins": 6.925175666809082, "rewards/rejected": -6.8338823318481445, "step": 367, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6967635051180403, "grad_norm": 6.3433518409729, "learning_rate": 0.00018244415603417603, "logits/chosen": -0.8368143439292908, "logits/rejected": -0.8486584424972534, "logps/chosen": -6.600013732910156, "logps/rejected": -63.1298942565918, "loss": 0.6284315586090088, "memory(GiB)": 45.96, "nll_loss": 0.4247177243232727, "rewards/accuracies": 0.84375, "rewards/chosen": 0.37347325682640076, "rewards/margins": 4.725260257720947, "rewards/rejected": -4.3517866134643555, "step": 368, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.6986568842080351, "grad_norm": 7.823058128356934, "learning_rate": 0.00018232575982204914, "logits/chosen": -0.9267025589942932, "logits/rejected": -0.9404476284980774, "logps/chosen": -5.923476219177246, "logps/rejected": -87.72044372558594, "loss": 0.4384441375732422, "memory(GiB)": 45.96, "nll_loss": 0.3303898870944977, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2169867604970932, "rewards/margins": 6.883980751037598, "rewards/rejected": -6.666994571685791, "step": 369, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.7005502632980297, "grad_norm": 9.935714721679688, "learning_rate": 0.00018220700440716413, "logits/chosen": -0.9617865681648254, "logits/rejected": -0.9780336022377014, "logps/chosen": -5.394845962524414, "logps/rejected": -81.97534942626953, "loss": 0.3096768260002136, "memory(GiB)": 45.96, "nll_loss": 0.22962169349193573, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36911681294441223, "rewards/margins": 6.486654758453369, "rewards/rejected": -6.1175384521484375, "step": 370, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.7024436423880244, "grad_norm": 2.1283838748931885, "learning_rate": 0.00018208789030767325, "logits/chosen": -0.931568443775177, "logits/rejected": -0.9491530656814575, "logps/chosen": -5.131685256958008, "logps/rejected": -83.98279571533203, "loss": 0.32068467140197754, "memory(GiB)": 45.96, "nll_loss": 0.25166767835617065, "rewards/accuracies": 0.96875, "rewards/chosen": 0.40735071897506714, "rewards/margins": 6.204363822937012, "rewards/rejected": -5.797012805938721, "step": 371, "train_speed(iter/s)": 0.005572 }, { "epoch": 0.704337021478019, "grad_norm": 2.4540481567382812, "learning_rate": 0.00018196841804329368, "logits/chosen": -0.9263602495193481, "logits/rejected": -0.9327493906021118, "logps/chosen": -8.066591262817383, "logps/rejected": -75.68155670166016, "loss": 0.3130130469799042, "memory(GiB)": 45.96, "nll_loss": 0.2522437274456024, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31773021817207336, "rewards/margins": 6.315546035766602, "rewards/rejected": -5.99781608581543, "step": 372, "train_speed(iter/s)": 0.005573 }, { "epoch": 0.7062304005680137, "grad_norm": 1.692391276359558, "learning_rate": 0.00018184858813530532, "logits/chosen": -0.9145341515541077, "logits/rejected": -0.9194747805595398, "logps/chosen": -7.334906578063965, "logps/rejected": -73.05682373046875, "loss": 0.3234623968601227, "memory(GiB)": 45.96, "nll_loss": 0.2537417709827423, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24510082602500916, "rewards/margins": 5.801229476928711, "rewards/rejected": -5.55612850189209, "step": 373, "train_speed(iter/s)": 0.005573 }, { "epoch": 0.7081237796580084, "grad_norm": 36.44214630126953, "learning_rate": 0.00018172840110654862, "logits/chosen": -0.9754062294960022, "logits/rejected": -0.991508960723877, "logps/chosen": -6.064601421356201, "logps/rejected": -89.70690155029297, "loss": 0.5042046904563904, "memory(GiB)": 45.96, "nll_loss": 0.4545992314815521, "rewards/accuracies": 1.0, "rewards/chosen": 0.1555050164461136, "rewards/margins": 7.101882457733154, "rewards/rejected": -6.946377754211426, "step": 374, "train_speed(iter/s)": 0.005573 }, { "epoch": 0.7100171587480031, "grad_norm": 2.978787899017334, "learning_rate": 0.00018160785748142213, "logits/chosen": -0.9359906315803528, "logits/rejected": -0.9400643110275269, "logps/chosen": -8.096701622009277, "logps/rejected": -72.11371612548828, "loss": 0.32742807269096375, "memory(GiB)": 45.96, "nll_loss": 0.25164440274238586, "rewards/accuracies": 0.96875, "rewards/chosen": 0.05610913783311844, "rewards/margins": 5.611598491668701, "rewards/rejected": -5.555489540100098, "step": 375, "train_speed(iter/s)": 0.005573 }, { "epoch": 0.7119105378379977, "grad_norm": 14.366015434265137, "learning_rate": 0.00018148695778588033, "logits/chosen": -0.956476628780365, "logits/rejected": -0.9655558466911316, "logps/chosen": -4.012333393096924, "logps/rejected": -62.51438903808594, "loss": 0.3993355333805084, "memory(GiB)": 45.96, "nll_loss": 0.29191824793815613, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3031947910785675, "rewards/margins": 5.061457633972168, "rewards/rejected": -4.758262634277344, "step": 376, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7138039169279924, "grad_norm": 3.066188335418701, "learning_rate": 0.0001813657025474314, "logits/chosen": -0.9844723343849182, "logits/rejected": -0.9966791868209839, "logps/chosen": -4.741098880767822, "logps/rejected": -71.6838150024414, "loss": 0.3621368706226349, "memory(GiB)": 45.96, "nll_loss": 0.2202376276254654, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3772399425506592, "rewards/margins": 5.600998878479004, "rewards/rejected": -5.223758220672607, "step": 377, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7156972960179872, "grad_norm": 11.998395919799805, "learning_rate": 0.00018124409229513462, "logits/chosen": -0.9505751729011536, "logits/rejected": -0.9621790647506714, "logps/chosen": -7.32084846496582, "logps/rejected": -74.40185546875, "loss": 0.6046153903007507, "memory(GiB)": 45.96, "nll_loss": 0.4943448007106781, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3040057122707367, "rewards/margins": 5.977365970611572, "rewards/rejected": -5.6733598709106445, "step": 378, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7175906751079818, "grad_norm": 1.9508522748947144, "learning_rate": 0.0001811221275595984, "logits/chosen": -0.9317912459373474, "logits/rejected": -0.9388425350189209, "logps/chosen": -5.765390872955322, "logps/rejected": -62.51669692993164, "loss": 0.4143444895744324, "memory(GiB)": 45.96, "nll_loss": 0.31946519017219543, "rewards/accuracies": 1.0, "rewards/chosen": 0.39909541606903076, "rewards/margins": 5.322498321533203, "rewards/rejected": -4.923402309417725, "step": 379, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7194840541979765, "grad_norm": 6.575671195983887, "learning_rate": 0.00018099980887297781, "logits/chosen": -0.9164581298828125, "logits/rejected": -0.9194830656051636, "logps/chosen": -6.478179931640625, "logps/rejected": -49.975425720214844, "loss": 0.44688597321510315, "memory(GiB)": 45.96, "nll_loss": 0.2767287492752075, "rewards/accuracies": 0.90625, "rewards/chosen": 0.5000704526901245, "rewards/margins": 4.214252948760986, "rewards/rejected": -3.7141826152801514, "step": 380, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7213774332879711, "grad_norm": 10.62743854522705, "learning_rate": 0.00018087713676897226, "logits/chosen": -0.9223384261131287, "logits/rejected": -0.938324511051178, "logps/chosen": -2.1367008686065674, "logps/rejected": -82.99889373779297, "loss": 0.20312689244747162, "memory(GiB)": 45.96, "nll_loss": 0.15922902524471283, "rewards/accuracies": 1.0, "rewards/chosen": 0.43284815549850464, "rewards/margins": 6.020846843719482, "rewards/rejected": -5.58799934387207, "step": 381, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7232708123779658, "grad_norm": 5.026012420654297, "learning_rate": 0.0001807541117828232, "logits/chosen": -0.8925135731697083, "logits/rejected": -0.9032195210456848, "logps/chosen": -4.171497821807861, "logps/rejected": -69.82553100585938, "loss": 0.4734829068183899, "memory(GiB)": 45.96, "nll_loss": 0.3503991365432739, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2768786549568176, "rewards/margins": 5.154216766357422, "rewards/rejected": -4.877338409423828, "step": 382, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7251641914679605, "grad_norm": 2.993335485458374, "learning_rate": 0.00018063073445131168, "logits/chosen": -0.8994606137275696, "logits/rejected": -0.9080754518508911, "logps/chosen": -5.122469902038574, "logps/rejected": -61.14916229248047, "loss": 0.2968669831752777, "memory(GiB)": 45.96, "nll_loss": 0.21081849932670593, "rewards/accuracies": 0.9375, "rewards/chosen": 0.38207852840423584, "rewards/margins": 4.733161926269531, "rewards/rejected": -4.351083755493164, "step": 383, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7270575705579552, "grad_norm": 1.0400865077972412, "learning_rate": 0.0001805070053127563, "logits/chosen": -0.901731550693512, "logits/rejected": -0.9139244556427002, "logps/chosen": -2.863340377807617, "logps/rejected": -68.22149658203125, "loss": 0.18375320732593536, "memory(GiB)": 45.96, "nll_loss": 0.11174498498439789, "rewards/accuracies": 0.96875, "rewards/chosen": 0.430495947599411, "rewards/margins": 5.3512468338012695, "rewards/rejected": -4.920751094818115, "step": 384, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7289509496479498, "grad_norm": 1.6904346942901611, "learning_rate": 0.00018038292490701047, "logits/chosen": -0.9130061268806458, "logits/rejected": -0.9136845469474792, "logps/chosen": -9.056621551513672, "logps/rejected": -46.760475158691406, "loss": 0.48324084281921387, "memory(GiB)": 45.96, "nll_loss": 0.34024232625961304, "rewards/accuracies": 0.9375, "rewards/chosen": 0.42201292514801025, "rewards/margins": 3.9340808391571045, "rewards/rejected": -3.512068271636963, "step": 385, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7308443287379445, "grad_norm": 1.1459290981292725, "learning_rate": 0.00018025849377546033, "logits/chosen": -0.9257358908653259, "logits/rejected": -0.9371558427810669, "logps/chosen": -2.7692415714263916, "logps/rejected": -71.15418243408203, "loss": 0.2346101850271225, "memory(GiB)": 45.96, "nll_loss": 0.1666901409626007, "rewards/accuracies": 0.9375, "rewards/chosen": 0.46027594804763794, "rewards/margins": 5.177318572998047, "rewards/rejected": -4.717042922973633, "step": 386, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7327377078279391, "grad_norm": 10.089129447937012, "learning_rate": 0.00018013371246102227, "logits/chosen": -0.8970749378204346, "logits/rejected": -0.9004898071289062, "logps/chosen": -5.8673787117004395, "logps/rejected": -60.121673583984375, "loss": 0.3606058955192566, "memory(GiB)": 45.96, "nll_loss": 0.2795240879058838, "rewards/accuracies": 0.96875, "rewards/chosen": 0.447785347700119, "rewards/margins": 5.038176536560059, "rewards/rejected": -4.590391159057617, "step": 387, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7346310869179339, "grad_norm": 1.2866895198822021, "learning_rate": 0.0001800085815081406, "logits/chosen": -0.9037926197052002, "logits/rejected": -0.9107275009155273, "logps/chosen": -4.869014739990234, "logps/rejected": -57.07670974731445, "loss": 0.2692682445049286, "memory(GiB)": 45.96, "nll_loss": 0.1857883632183075, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4257521331310272, "rewards/margins": 4.402857780456543, "rewards/rejected": -3.9771053791046143, "step": 388, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7365244660079285, "grad_norm": 3.418945550918579, "learning_rate": 0.00017988310146278523, "logits/chosen": -0.9708212614059448, "logits/rejected": -0.9790508151054382, "logps/chosen": -2.9867353439331055, "logps/rejected": -64.79772186279297, "loss": 0.25667768716812134, "memory(GiB)": 45.96, "nll_loss": 0.1426447629928589, "rewards/accuracies": 0.96875, "rewards/chosen": 0.34653186798095703, "rewards/margins": 5.321665287017822, "rewards/rejected": -4.975133895874023, "step": 389, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7384178450979232, "grad_norm": 4.090985298156738, "learning_rate": 0.00017975727287244914, "logits/chosen": -1.037940263748169, "logits/rejected": -1.0541801452636719, "logps/chosen": -4.899912357330322, "logps/rejected": -75.53579711914062, "loss": 0.35355865955352783, "memory(GiB)": 45.96, "nll_loss": 0.2508485019207001, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3642263412475586, "rewards/margins": 5.843046188354492, "rewards/rejected": -5.478819847106934, "step": 390, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7403112241879178, "grad_norm": 1.0435255765914917, "learning_rate": 0.00017963109628614613, "logits/chosen": -1.0441638231277466, "logits/rejected": -1.0574573278427124, "logps/chosen": -3.3426506519317627, "logps/rejected": -63.72442626953125, "loss": 0.23277787864208221, "memory(GiB)": 45.96, "nll_loss": 0.20041929185390472, "rewards/accuracies": 1.0, "rewards/chosen": 0.4242357015609741, "rewards/margins": 5.191644191741943, "rewards/rejected": -4.767408847808838, "step": 391, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7422046032779126, "grad_norm": 0.7653146386146545, "learning_rate": 0.0001795045722544083, "logits/chosen": -0.999144434928894, "logits/rejected": -1.0147640705108643, "logps/chosen": -2.727332592010498, "logps/rejected": -78.85921478271484, "loss": 0.13891945779323578, "memory(GiB)": 45.96, "nll_loss": 0.1272052526473999, "rewards/accuracies": 1.0, "rewards/chosen": 0.646836519241333, "rewards/margins": 6.576606750488281, "rewards/rejected": -5.929770469665527, "step": 392, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7440979823679073, "grad_norm": 9.776786804199219, "learning_rate": 0.00017937770132928383, "logits/chosen": -1.0467562675476074, "logits/rejected": -1.0627236366271973, "logps/chosen": -6.933349609375, "logps/rejected": -73.26114654541016, "loss": 0.7141088247299194, "memory(GiB)": 45.96, "nll_loss": 0.5707842111587524, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17063282430171967, "rewards/margins": 5.584632396697998, "rewards/rejected": -5.413999557495117, "step": 393, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7459913614579019, "grad_norm": 1.990278720855713, "learning_rate": 0.00017925048406433437, "logits/chosen": -1.0911043882369995, "logits/rejected": -1.1038135290145874, "logps/chosen": -6.190121650695801, "logps/rejected": -80.86822509765625, "loss": 0.2924405038356781, "memory(GiB)": 45.96, "nll_loss": 0.2574291527271271, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2957814037799835, "rewards/margins": 6.825494289398193, "rewards/rejected": -6.5297136306762695, "step": 394, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7478847405478966, "grad_norm": 17.2550106048584, "learning_rate": 0.0001791229210146328, "logits/chosen": -1.0845831632614136, "logits/rejected": -1.0984985828399658, "logps/chosen": -7.322081565856934, "logps/rejected": -84.80224609375, "loss": 0.37159523367881775, "memory(GiB)": 45.96, "nll_loss": 0.2948389947414398, "rewards/accuracies": 0.96875, "rewards/chosen": 0.30554482340812683, "rewards/margins": 6.833071708679199, "rewards/rejected": -6.527526378631592, "step": 395, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7497781196378912, "grad_norm": 0.8952667117118835, "learning_rate": 0.0001789950127367606, "logits/chosen": -1.050929307937622, "logits/rejected": -1.0651614665985107, "logps/chosen": -3.8682401180267334, "logps/rejected": -84.12080383300781, "loss": 0.18135719001293182, "memory(GiB)": 45.96, "nll_loss": 0.142669215798378, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3838658928871155, "rewards/margins": 6.844507217407227, "rewards/rejected": -6.460641384124756, "step": 396, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.751671498727886, "grad_norm": 2.4551334381103516, "learning_rate": 0.00017886675978880565, "logits/chosen": -1.037245273590088, "logits/rejected": -1.0525448322296143, "logps/chosen": -11.067987442016602, "logps/rejected": -78.05215454101562, "loss": 0.5026216506958008, "memory(GiB)": 45.96, "nll_loss": 0.41904473304748535, "rewards/accuracies": 0.96875, "rewards/chosen": 0.319905161857605, "rewards/margins": 6.043320655822754, "rewards/rejected": -5.723415374755859, "step": 397, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7535648778178806, "grad_norm": 8.531716346740723, "learning_rate": 0.0001787381627303597, "logits/chosen": -1.0312135219573975, "logits/rejected": -1.0378743410110474, "logps/chosen": -4.678598880767822, "logps/rejected": -78.02084350585938, "loss": 0.42119985818862915, "memory(GiB)": 45.96, "nll_loss": 0.34666430950164795, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24222567677497864, "rewards/margins": 6.521797180175781, "rewards/rejected": -6.279571533203125, "step": 398, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7554582569078753, "grad_norm": 3.705852508544922, "learning_rate": 0.00017860922212251579, "logits/chosen": -1.0187020301818848, "logits/rejected": -1.0253901481628418, "logps/chosen": -8.070443153381348, "logps/rejected": -69.82466125488281, "loss": 0.2855599522590637, "memory(GiB)": 45.96, "nll_loss": 0.21128731966018677, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09387722611427307, "rewards/margins": 5.497537612915039, "rewards/rejected": -5.403660297393799, "step": 399, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.7573516359978699, "grad_norm": 28.791128158569336, "learning_rate": 0.0001784799385278661, "logits/chosen": -0.9633829593658447, "logits/rejected": -0.9697256088256836, "logps/chosen": -7.547330379486084, "logps/rejected": -61.4130744934082, "loss": 0.7181084156036377, "memory(GiB)": 45.96, "nll_loss": 0.538273274898529, "rewards/accuracies": 0.90625, "rewards/chosen": 0.18001368641853333, "rewards/margins": 5.022581577301025, "rewards/rejected": -4.842568397521973, "step": 400, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.7592450150878646, "grad_norm": 23.678117752075195, "learning_rate": 0.00017835031251049922, "logits/chosen": -0.9481673240661621, "logits/rejected": -0.9688194394111633, "logps/chosen": -3.7135748863220215, "logps/rejected": -74.0098648071289, "loss": 0.2994523346424103, "memory(GiB)": 45.96, "nll_loss": 0.25903573632240295, "rewards/accuracies": 1.0, "rewards/chosen": 0.44725221395492554, "rewards/margins": 5.681788921356201, "rewards/rejected": -5.234536170959473, "step": 401, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7611383941778593, "grad_norm": 5.658694744110107, "learning_rate": 0.00017822034463599778, "logits/chosen": -0.9763189554214478, "logits/rejected": -0.9897902011871338, "logps/chosen": -4.176187515258789, "logps/rejected": -79.24385070800781, "loss": 0.3210103213787079, "memory(GiB)": 45.96, "nll_loss": 0.22857408225536346, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3976101875305176, "rewards/margins": 6.241819858551025, "rewards/rejected": -5.84420919418335, "step": 402, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.763031773267854, "grad_norm": 1.2923495769500732, "learning_rate": 0.00017809003547143612, "logits/chosen": -0.907258927822113, "logits/rejected": -0.917163074016571, "logps/chosen": -6.157055377960205, "logps/rejected": -68.08614349365234, "loss": 0.24948692321777344, "memory(GiB)": 45.96, "nll_loss": 0.21286801993846893, "rewards/accuracies": 1.0, "rewards/chosen": 0.4159366488456726, "rewards/margins": 5.365114212036133, "rewards/rejected": -4.9491777420043945, "step": 403, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7649251523578486, "grad_norm": 1.8167670965194702, "learning_rate": 0.00017795938558537753, "logits/chosen": -0.9293066263198853, "logits/rejected": -0.9362936019897461, "logps/chosen": -6.498391628265381, "logps/rejected": -60.98576736450195, "loss": 0.4341224730014801, "memory(GiB)": 45.96, "nll_loss": 0.36389267444610596, "rewards/accuracies": 1.0, "rewards/chosen": 0.40591150522232056, "rewards/margins": 4.675572395324707, "rewards/rejected": -4.269660472869873, "step": 404, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7668185314478433, "grad_norm": 1.2195301055908203, "learning_rate": 0.00017782839554787204, "logits/chosen": -0.8840275406837463, "logits/rejected": -0.8963786363601685, "logps/chosen": -4.563403129577637, "logps/rejected": -70.3100814819336, "loss": 0.29657843708992004, "memory(GiB)": 45.96, "nll_loss": 0.22001734375953674, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41886448860168457, "rewards/margins": 5.402155876159668, "rewards/rejected": -4.983292102813721, "step": 405, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.768711910537838, "grad_norm": 0.9042125344276428, "learning_rate": 0.0001776970659304538, "logits/chosen": -0.9276862144470215, "logits/rejected": -0.9463416934013367, "logps/chosen": -2.721170425415039, "logps/rejected": -77.12850952148438, "loss": 0.16812542080879211, "memory(GiB)": 45.96, "nll_loss": 0.12775033712387085, "rewards/accuracies": 1.0, "rewards/chosen": 0.5595777630805969, "rewards/margins": 5.493441104888916, "rewards/rejected": -4.933863639831543, "step": 406, "train_speed(iter/s)": 0.005574 }, { "epoch": 0.7706052896278327, "grad_norm": 6.283580303192139, "learning_rate": 0.0001775653973061386, "logits/chosen": -0.8509265780448914, "logits/rejected": -0.8639415502548218, "logps/chosen": -4.486887454986572, "logps/rejected": -56.64537048339844, "loss": 0.6943869590759277, "memory(GiB)": 45.96, "nll_loss": 0.4812234044075012, "rewards/accuracies": 0.875, "rewards/chosen": 0.1978735774755478, "rewards/margins": 4.130608558654785, "rewards/rejected": -3.9327352046966553, "step": 407, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7724986687178274, "grad_norm": 2.473437786102295, "learning_rate": 0.00017743339024942135, "logits/chosen": -0.8597152233123779, "logits/rejected": -0.8724321126937866, "logps/chosen": -3.882218837738037, "logps/rejected": -59.771484375, "loss": 0.3383080065250397, "memory(GiB)": 45.96, "nll_loss": 0.24344521760940552, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43006354570388794, "rewards/margins": 4.42924690246582, "rewards/rejected": -3.99918270111084, "step": 408, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.774392047807822, "grad_norm": 1.8906275033950806, "learning_rate": 0.0001773010453362737, "logits/chosen": -0.8703848123550415, "logits/rejected": -0.8756015300750732, "logps/chosen": -5.282890319824219, "logps/rejected": -49.80982208251953, "loss": 0.3379298746585846, "memory(GiB)": 45.96, "nll_loss": 0.23951074481010437, "rewards/accuracies": 0.96875, "rewards/chosen": 0.365540087223053, "rewards/margins": 4.006491661071777, "rewards/rejected": -3.6409518718719482, "step": 409, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7762854268978167, "grad_norm": 7.051182270050049, "learning_rate": 0.00017716836314414137, "logits/chosen": -0.8841079473495483, "logits/rejected": -0.8995672464370728, "logps/chosen": -4.768126964569092, "logps/rejected": -57.94666290283203, "loss": 0.7324269413948059, "memory(GiB)": 45.96, "nll_loss": 0.41325533390045166, "rewards/accuracies": 0.875, "rewards/chosen": 0.18045026063919067, "rewards/margins": 4.116349220275879, "rewards/rejected": -3.935899496078491, "step": 410, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7781788059878114, "grad_norm": 9.723516464233398, "learning_rate": 0.00017703534425194162, "logits/chosen": -0.9590765237808228, "logits/rejected": -0.978516697883606, "logps/chosen": -3.969177484512329, "logps/rejected": -77.96525573730469, "loss": 0.19977864623069763, "memory(GiB)": 45.96, "nll_loss": 0.11787045001983643, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41094639897346497, "rewards/margins": 5.471322059631348, "rewards/rejected": -5.060375690460205, "step": 411, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7800721850778061, "grad_norm": 3.833841323852539, "learning_rate": 0.00017690198924006097, "logits/chosen": -0.8818249702453613, "logits/rejected": -0.8868318200111389, "logps/chosen": -9.053668022155762, "logps/rejected": -51.70756149291992, "loss": 0.8266224265098572, "memory(GiB)": 45.96, "nll_loss": 0.5343714356422424, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2412976324558258, "rewards/margins": 4.036813735961914, "rewards/rejected": -3.7955162525177, "step": 412, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7819655641678007, "grad_norm": 1.554246187210083, "learning_rate": 0.00017676829869035232, "logits/chosen": -0.9043519496917725, "logits/rejected": -0.9118601083755493, "logps/chosen": -10.494165420532227, "logps/rejected": -70.82110595703125, "loss": 0.42945966124534607, "memory(GiB)": 45.96, "nll_loss": 0.3161766827106476, "rewards/accuracies": 0.96875, "rewards/chosen": 0.29031792283058167, "rewards/margins": 5.651849746704102, "rewards/rejected": -5.361531734466553, "step": 413, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7838589432577954, "grad_norm": 7.9514079093933105, "learning_rate": 0.0001766342731861327, "logits/chosen": -0.9233826994895935, "logits/rejected": -0.9361361265182495, "logps/chosen": -3.67756986618042, "logps/rejected": -73.57920837402344, "loss": 0.21047185361385345, "memory(GiB)": 45.96, "nll_loss": 0.13145719468593597, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2930607497692108, "rewards/margins": 5.711090564727783, "rewards/rejected": -5.41802978515625, "step": 414, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.78575232234779, "grad_norm": 8.199553489685059, "learning_rate": 0.00017649991331218051, "logits/chosen": -0.9082167148590088, "logits/rejected": -0.9135277271270752, "logps/chosen": -6.026224613189697, "logps/rejected": -63.22338104248047, "loss": 0.25728654861450195, "memory(GiB)": 45.96, "nll_loss": 0.219262033700943, "rewards/accuracies": 1.0, "rewards/chosen": 0.2262103408575058, "rewards/margins": 5.247284889221191, "rewards/rejected": -5.0210747718811035, "step": 415, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7876457014377848, "grad_norm": 1.4603794813156128, "learning_rate": 0.00017636521965473323, "logits/chosen": -0.9447462558746338, "logits/rejected": -0.9523710012435913, "logps/chosen": -5.464984893798828, "logps/rejected": -70.84123229980469, "loss": 0.3190080225467682, "memory(GiB)": 45.96, "nll_loss": 0.23086979985237122, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4398874342441559, "rewards/margins": 5.966001987457275, "rewards/rejected": -5.526113986968994, "step": 416, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7895390805277794, "grad_norm": 2.0953357219696045, "learning_rate": 0.00017623019280148445, "logits/chosen": -0.9457417130470276, "logits/rejected": -0.9614331722259521, "logps/chosen": -6.09683895111084, "logps/rejected": -71.07952880859375, "loss": 0.30602532625198364, "memory(GiB)": 45.96, "nll_loss": 0.23463232815265656, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4258151054382324, "rewards/margins": 5.393369674682617, "rewards/rejected": -4.967555046081543, "step": 417, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7914324596177741, "grad_norm": 3.631746530532837, "learning_rate": 0.00017609483334158181, "logits/chosen": -0.8911413550376892, "logits/rejected": -0.9076879620552063, "logps/chosen": -3.185537576675415, "logps/rejected": -73.76860809326172, "loss": 0.27826330065727234, "memory(GiB)": 45.96, "nll_loss": 0.17217418551445007, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3891518712043762, "rewards/margins": 5.921802520751953, "rewards/rejected": -5.532650947570801, "step": 418, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7933258387077687, "grad_norm": 2.356017827987671, "learning_rate": 0.00017595914186562407, "logits/chosen": -0.9325594902038574, "logits/rejected": -0.9440548419952393, "logps/chosen": -4.001617908477783, "logps/rejected": -73.55976867675781, "loss": 0.42719385027885437, "memory(GiB)": 45.96, "nll_loss": 0.26717454195022583, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3177154064178467, "rewards/margins": 5.908562183380127, "rewards/rejected": -5.590847015380859, "step": 419, "train_speed(iter/s)": 0.005575 }, { "epoch": 0.7952192177977635, "grad_norm": 2.385035514831543, "learning_rate": 0.00017582311896565856, "logits/chosen": -0.9272701740264893, "logits/rejected": -0.9425795674324036, "logps/chosen": -5.3703532218933105, "logps/rejected": -79.19388580322266, "loss": 0.366239070892334, "memory(GiB)": 45.96, "nll_loss": 0.28597089648246765, "rewards/accuracies": 1.0, "rewards/chosen": 0.23774051666259766, "rewards/margins": 6.523024082183838, "rewards/rejected": -6.285284042358398, "step": 420, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.7971125968877582, "grad_norm": 1.515577793121338, "learning_rate": 0.00017568676523517878, "logits/chosen": -0.9449001550674438, "logits/rejected": -0.9685764908790588, "logps/chosen": -3.0468153953552246, "logps/rejected": -99.55249786376953, "loss": 0.2705683708190918, "memory(GiB)": 45.96, "nll_loss": 0.23674362897872925, "rewards/accuracies": 1.0, "rewards/chosen": 0.36185410618782043, "rewards/margins": 8.01712417602539, "rewards/rejected": -7.655271053314209, "step": 421, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.7990059759777528, "grad_norm": 4.03458833694458, "learning_rate": 0.00017555008126912168, "logits/chosen": -0.9106298685073853, "logits/rejected": -0.9396368861198425, "logps/chosen": -3.947406768798828, "logps/rejected": -102.24916076660156, "loss": 0.4227983355522156, "memory(GiB)": 45.96, "nll_loss": 0.2840198278427124, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3644457161426544, "rewards/margins": 7.7836761474609375, "rewards/rejected": -7.419230937957764, "step": 422, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8008993550677475, "grad_norm": 1.4805070161819458, "learning_rate": 0.00017541306766386512, "logits/chosen": -0.8955278396606445, "logits/rejected": -0.9099395871162415, "logps/chosen": -3.7780051231384277, "logps/rejected": -91.8361587524414, "loss": 0.2600992023944855, "memory(GiB)": 45.96, "nll_loss": 0.15484608709812164, "rewards/accuracies": 0.90625, "rewards/chosen": 0.31357866525650024, "rewards/margins": 7.206130504608154, "rewards/rejected": -6.892551422119141, "step": 423, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8027927341577421, "grad_norm": 7.871303081512451, "learning_rate": 0.00017527572501722512, "logits/chosen": -0.9275432229042053, "logits/rejected": -0.9326556324958801, "logps/chosen": -5.747369766235352, "logps/rejected": -84.74732208251953, "loss": 0.3905383348464966, "memory(GiB)": 45.96, "nll_loss": 0.30991342663764954, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14356550574302673, "rewards/margins": 6.889118671417236, "rewards/rejected": -6.745552062988281, "step": 424, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8046861132477369, "grad_norm": 4.8259477615356445, "learning_rate": 0.00017513805392845356, "logits/chosen": -0.93051677942276, "logits/rejected": -0.9383388757705688, "logps/chosen": -6.837670803070068, "logps/rejected": -88.047119140625, "loss": 0.4115247428417206, "memory(GiB)": 45.96, "nll_loss": 0.24050895869731903, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09084747731685638, "rewards/margins": 7.040899753570557, "rewards/rejected": -6.950051784515381, "step": 425, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8065794923377315, "grad_norm": 1.4630215167999268, "learning_rate": 0.00017500005499823519, "logits/chosen": -0.8715620636940002, "logits/rejected": -0.8803263306617737, "logps/chosen": -7.669510841369629, "logps/rejected": -83.8923568725586, "loss": 0.37616875767707825, "memory(GiB)": 45.96, "nll_loss": 0.2779691219329834, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3295210897922516, "rewards/margins": 7.212647438049316, "rewards/rejected": -6.883126258850098, "step": 426, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8084728714277262, "grad_norm": 7.37748908996582, "learning_rate": 0.0001748617288286853, "logits/chosen": -0.9009289741516113, "logits/rejected": -0.9088554978370667, "logps/chosen": -7.394189357757568, "logps/rejected": -108.95574951171875, "loss": 0.33651089668273926, "memory(GiB)": 45.96, "nll_loss": 0.2095419317483902, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22998183965682983, "rewards/margins": 9.595008850097656, "rewards/rejected": -9.365028381347656, "step": 427, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8103662505177208, "grad_norm": 6.123429298400879, "learning_rate": 0.00017472307602334693, "logits/chosen": -0.89423668384552, "logits/rejected": -0.9038995504379272, "logps/chosen": -8.802855491638184, "logps/rejected": -88.23287200927734, "loss": 0.4874518811702728, "memory(GiB)": 45.96, "nll_loss": 0.3115327060222626, "rewards/accuracies": 0.96875, "rewards/chosen": 0.11184003949165344, "rewards/margins": 7.504295825958252, "rewards/rejected": -7.392455577850342, "step": 428, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8122596296077155, "grad_norm": 6.689691543579102, "learning_rate": 0.00017458409718718834, "logits/chosen": -0.8707554340362549, "logits/rejected": -0.886796772480011, "logps/chosen": -4.8936262130737305, "logps/rejected": -88.58076477050781, "loss": 0.5303760170936584, "memory(GiB)": 45.96, "nll_loss": 0.4417770802974701, "rewards/accuracies": 0.9375, "rewards/chosen": 0.15029491484165192, "rewards/margins": 7.341009140014648, "rewards/rejected": -7.190713405609131, "step": 429, "train_speed(iter/s)": 0.005576 }, { "epoch": 0.8141530086977102, "grad_norm": 8.597928047180176, "learning_rate": 0.0001744447929266003, "logits/chosen": -0.8662844896316528, "logits/rejected": -0.8829063773155212, "logps/chosen": -5.029667377471924, "logps/rejected": -87.51130676269531, "loss": 0.39819207787513733, "memory(GiB)": 45.96, "nll_loss": 0.28675615787506104, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22954146564006805, "rewards/margins": 6.7957072257995605, "rewards/rejected": -6.566165924072266, "step": 430, "train_speed(iter/s)": 0.005577 }, { "epoch": 0.8160463877877049, "grad_norm": 2.8258883953094482, "learning_rate": 0.00017430516384939345, "logits/chosen": -0.826620876789093, "logits/rejected": -0.833583414554596, "logps/chosen": -6.807863235473633, "logps/rejected": -74.75788879394531, "loss": 0.524578869342804, "memory(GiB)": 45.96, "nll_loss": 0.4435310363769531, "rewards/accuracies": 1.0, "rewards/chosen": 0.2683424651622772, "rewards/margins": 6.224869728088379, "rewards/rejected": -5.956527233123779, "step": 431, "train_speed(iter/s)": 0.005577 }, { "epoch": 0.8179397668776995, "grad_norm": 24.219331741333008, "learning_rate": 0.00017416521056479577, "logits/chosen": -0.815615177154541, "logits/rejected": -0.8294793367385864, "logps/chosen": -5.088006496429443, "logps/rejected": -85.76319122314453, "loss": 0.4257265627384186, "memory(GiB)": 45.96, "nll_loss": 0.39785972237586975, "rewards/accuracies": 1.0, "rewards/chosen": 0.33022740483283997, "rewards/margins": 6.924592018127441, "rewards/rejected": -6.594364166259766, "step": 432, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.8198331459676942, "grad_norm": 9.516819953918457, "learning_rate": 0.00017402493368344965, "logits/chosen": -0.7762714624404907, "logits/rejected": -0.7849063277244568, "logps/chosen": -6.736428260803223, "logps/rejected": -70.95455169677734, "loss": 0.4678858518600464, "memory(GiB)": 45.96, "nll_loss": 0.3948495388031006, "rewards/accuracies": 0.96875, "rewards/chosen": 0.13923215866088867, "rewards/margins": 5.282342433929443, "rewards/rejected": -5.143110275268555, "step": 433, "train_speed(iter/s)": 0.005577 }, { "epoch": 0.8217265250576888, "grad_norm": 7.945901393890381, "learning_rate": 0.00017388433381740952, "logits/chosen": -0.7900452613830566, "logits/rejected": -0.7998518347740173, "logps/chosen": -6.878015041351318, "logps/rejected": -73.27943420410156, "loss": 0.40994495153427124, "memory(GiB)": 45.96, "nll_loss": 0.3519839644432068, "rewards/accuracies": 1.0, "rewards/chosen": 0.4654313027858734, "rewards/margins": 6.1711835861206055, "rewards/rejected": -5.705752849578857, "step": 434, "train_speed(iter/s)": 0.005577 }, { "epoch": 0.8236199041476836, "grad_norm": 1.621781349182129, "learning_rate": 0.00017374341158013897, "logits/chosen": -0.7397841215133667, "logits/rejected": -0.7477171421051025, "logps/chosen": -8.785954475402832, "logps/rejected": -74.62800598144531, "loss": 0.3700712323188782, "memory(GiB)": 45.96, "nll_loss": 0.29524165391921997, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4034354090690613, "rewards/margins": 5.8851189613342285, "rewards/rejected": -5.481683731079102, "step": 435, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.8255132832376783, "grad_norm": 11.901042938232422, "learning_rate": 0.00017360216758650828, "logits/chosen": -0.7307888269424438, "logits/rejected": -0.73638516664505, "logps/chosen": -8.413528442382812, "logps/rejected": -62.19019317626953, "loss": 0.4531805217266083, "memory(GiB)": 45.96, "nll_loss": 0.3570531904697418, "rewards/accuracies": 0.96875, "rewards/chosen": 0.39727261662483215, "rewards/margins": 4.906312465667725, "rewards/rejected": -4.509039878845215, "step": 436, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.8274066623276729, "grad_norm": 12.022588729858398, "learning_rate": 0.00017346060245279147, "logits/chosen": -0.7360296249389648, "logits/rejected": -0.7512168288230896, "logps/chosen": -5.395040035247803, "logps/rejected": -66.02803802490234, "loss": 0.2887762784957886, "memory(GiB)": 45.96, "nll_loss": 0.22481848299503326, "rewards/accuracies": 1.0, "rewards/chosen": 0.2582862079143524, "rewards/margins": 4.8272881507873535, "rewards/rejected": -4.5690016746521, "step": 437, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.8293000414176676, "grad_norm": 5.518744945526123, "learning_rate": 0.0001733187167966638, "logits/chosen": -0.7701220512390137, "logits/rejected": -0.7844356298446655, "logps/chosen": -2.579286575317383, "logps/rejected": -66.53873443603516, "loss": 0.3727279603481293, "memory(GiB)": 45.96, "nll_loss": 0.2864982485771179, "rewards/accuracies": 1.0, "rewards/chosen": 0.4387655556201935, "rewards/margins": 5.002132415771484, "rewards/rejected": -4.563366413116455, "step": 438, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.8311934205076623, "grad_norm": 3.2701282501220703, "learning_rate": 0.00017317651123719912, "logits/chosen": -0.7506716251373291, "logits/rejected": -0.7568422555923462, "logps/chosen": -11.24153995513916, "logps/rejected": -60.69418716430664, "loss": 0.5295559763908386, "memory(GiB)": 45.96, "nll_loss": 0.45408472418785095, "rewards/accuracies": 1.0, "rewards/chosen": 0.36308178305625916, "rewards/margins": 4.746029853820801, "rewards/rejected": -4.38294792175293, "step": 439, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.833086799597657, "grad_norm": 1.1384278535842896, "learning_rate": 0.00017303398639486695, "logits/chosen": -0.731947660446167, "logits/rejected": -0.7437530755996704, "logps/chosen": -9.611553192138672, "logps/rejected": -76.5805892944336, "loss": 0.2904091775417328, "memory(GiB)": 45.96, "nll_loss": 0.2315519154071808, "rewards/accuracies": 1.0, "rewards/chosen": 0.531777024269104, "rewards/margins": 5.823252201080322, "rewards/rejected": -5.291475772857666, "step": 440, "train_speed(iter/s)": 0.005578 }, { "epoch": 0.8349801786876516, "grad_norm": 0.8361400365829468, "learning_rate": 0.00017289114289152996, "logits/chosen": -0.7166184186935425, "logits/rejected": -0.734869122505188, "logps/chosen": -5.195431232452393, "logps/rejected": -79.26923370361328, "loss": 0.25895360112190247, "memory(GiB)": 45.96, "nll_loss": 0.21112824976444244, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6189270615577698, "rewards/margins": 6.133816242218018, "rewards/rejected": -5.514889240264893, "step": 441, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8368735577776463, "grad_norm": 2.4993669986724854, "learning_rate": 0.00017274798135044118, "logits/chosen": -0.790854811668396, "logits/rejected": -0.8087242841720581, "logps/chosen": -3.1484498977661133, "logps/rejected": -92.63924407958984, "loss": 0.17340044677257538, "memory(GiB)": 45.96, "nll_loss": 0.11792504787445068, "rewards/accuracies": 1.0, "rewards/chosen": 0.323365181684494, "rewards/margins": 7.355247497558594, "rewards/rejected": -7.0318827629089355, "step": 442, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8387669368676409, "grad_norm": 1.7912027835845947, "learning_rate": 0.00017260450239624136, "logits/chosen": -0.7304463982582092, "logits/rejected": -0.7448377013206482, "logps/chosen": -5.269331932067871, "logps/rejected": -84.68616485595703, "loss": 0.2722683548927307, "memory(GiB)": 45.96, "nll_loss": 0.19279897212982178, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2668758034706116, "rewards/margins": 6.523564338684082, "rewards/rejected": -6.256688117980957, "step": 443, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8406603159576357, "grad_norm": 2.5274224281311035, "learning_rate": 0.00017246070665495608, "logits/chosen": -0.754114031791687, "logits/rejected": -0.7749913930892944, "logps/chosen": -4.680078506469727, "logps/rejected": -90.58206939697266, "loss": 0.2556043863296509, "memory(GiB)": 45.96, "nll_loss": 0.2013716846704483, "rewards/accuracies": 1.0, "rewards/chosen": 0.5823894739151001, "rewards/margins": 7.6140594482421875, "rewards/rejected": -7.031670570373535, "step": 444, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8425536950476303, "grad_norm": 1.2107690572738647, "learning_rate": 0.00017231659475399323, "logits/chosen": -0.7979104518890381, "logits/rejected": -0.8069046139717102, "logps/chosen": -4.9781174659729, "logps/rejected": -66.70126342773438, "loss": 0.30611103773117065, "memory(GiB)": 45.96, "nll_loss": 0.23165598511695862, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4561145305633545, "rewards/margins": 5.505497455596924, "rewards/rejected": -5.04938268661499, "step": 445, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.844447074137625, "grad_norm": 4.050295829772949, "learning_rate": 0.0001721721673221401, "logits/chosen": -0.7885401248931885, "logits/rejected": -0.8013665676116943, "logps/chosen": -6.65448522567749, "logps/rejected": -85.34944152832031, "loss": 0.3965107798576355, "memory(GiB)": 45.96, "nll_loss": 0.25117045640945435, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4342056214809418, "rewards/margins": 7.116891860961914, "rewards/rejected": -6.682686805725098, "step": 446, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8463404532276196, "grad_norm": 1.9369865655899048, "learning_rate": 0.00017202742498956066, "logits/chosen": -0.8296957612037659, "logits/rejected": -0.8483850359916687, "logps/chosen": -5.465951442718506, "logps/rejected": -83.44580078125, "loss": 0.29229405522346497, "memory(GiB)": 45.96, "nll_loss": 0.2555358409881592, "rewards/accuracies": 1.0, "rewards/chosen": 0.34571531414985657, "rewards/margins": 6.757546901702881, "rewards/rejected": -6.411831855773926, "step": 447, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8482338323176143, "grad_norm": 1.0717179775238037, "learning_rate": 0.00017188236838779295, "logits/chosen": -0.8507705926895142, "logits/rejected": -0.8675693273544312, "logps/chosen": -3.8401472568511963, "logps/rejected": -105.99805450439453, "loss": 0.2020038366317749, "memory(GiB)": 45.96, "nll_loss": 0.15445975959300995, "rewards/accuracies": 1.0, "rewards/chosen": 0.43529555201530457, "rewards/margins": 8.494356155395508, "rewards/rejected": -8.059060096740723, "step": 448, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.850127211407609, "grad_norm": 1.2371408939361572, "learning_rate": 0.00017173699814974615, "logits/chosen": -0.8888499140739441, "logits/rejected": -0.8976138234138489, "logps/chosen": -6.716226100921631, "logps/rejected": -81.250732421875, "loss": 0.3499948978424072, "memory(GiB)": 45.96, "nll_loss": 0.29640763998031616, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4713817238807678, "rewards/margins": 7.038424491882324, "rewards/rejected": -6.567043304443359, "step": 449, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8520205904976037, "grad_norm": 1.0314913988113403, "learning_rate": 0.00017159131490969797, "logits/chosen": -0.8845159411430359, "logits/rejected": -0.897428035736084, "logps/chosen": -7.58637809753418, "logps/rejected": -90.65620422363281, "loss": 0.22296631336212158, "memory(GiB)": 45.96, "nll_loss": 0.1991596817970276, "rewards/accuracies": 1.0, "rewards/chosen": 0.3203076124191284, "rewards/margins": 7.438530921936035, "rewards/rejected": -7.118223667144775, "step": 450, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8539139695875984, "grad_norm": 14.719244003295898, "learning_rate": 0.0001714453193032917, "logits/chosen": -0.8827124834060669, "logits/rejected": -0.893791675567627, "logps/chosen": -4.368500232696533, "logps/rejected": -82.19820404052734, "loss": 0.31974878907203674, "memory(GiB)": 45.96, "nll_loss": 0.24097216129302979, "rewards/accuracies": 0.96875, "rewards/chosen": 0.44965288043022156, "rewards/margins": 6.721735000610352, "rewards/rejected": -6.2720818519592285, "step": 451, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.855807348677593, "grad_norm": 36.062278747558594, "learning_rate": 0.00017129901196753363, "logits/chosen": -0.9345687627792358, "logits/rejected": -0.9502599835395813, "logps/chosen": -5.315582275390625, "logps/rejected": -83.8296127319336, "loss": 0.34316593408584595, "memory(GiB)": 45.96, "nll_loss": 0.2703927457332611, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2453213632106781, "rewards/margins": 6.990170955657959, "rewards/rejected": -6.744849681854248, "step": 452, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8577007277675878, "grad_norm": 1.541624903678894, "learning_rate": 0.00017115239354079017, "logits/chosen": -0.9115346074104309, "logits/rejected": -0.9224709868431091, "logps/chosen": -9.181022644042969, "logps/rejected": -101.25410461425781, "loss": 0.34988313913345337, "memory(GiB)": 45.96, "nll_loss": 0.3383327126502991, "rewards/accuracies": 1.0, "rewards/chosen": 0.34222501516342163, "rewards/margins": 8.531024932861328, "rewards/rejected": -8.188799858093262, "step": 453, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8595941068575824, "grad_norm": 3.925374746322632, "learning_rate": 0.00017100546466278504, "logits/chosen": -0.9633154273033142, "logits/rejected": -0.9739294648170471, "logps/chosen": -4.56303071975708, "logps/rejected": -88.93602752685547, "loss": 0.25692471861839294, "memory(GiB)": 45.96, "nll_loss": 0.2111371010541916, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45011770725250244, "rewards/margins": 7.744128227233887, "rewards/rejected": -7.294011116027832, "step": 454, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8614874859475771, "grad_norm": 1.6003632545471191, "learning_rate": 0.00017085822597459656, "logits/chosen": -0.9982748627662659, "logits/rejected": -1.014983892440796, "logps/chosen": -4.145792484283447, "logps/rejected": -106.2919921875, "loss": 0.3255295157432556, "memory(GiB)": 45.96, "nll_loss": 0.18978404998779297, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3449160158634186, "rewards/margins": 8.899467468261719, "rewards/rejected": -8.554551124572754, "step": 455, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8633808650375717, "grad_norm": 1.9852300882339478, "learning_rate": 0.00017071067811865476, "logits/chosen": -0.9765909910202026, "logits/rejected": -0.9930113554000854, "logps/chosen": -7.842015266418457, "logps/rejected": -123.04806518554688, "loss": 0.32382023334503174, "memory(GiB)": 45.96, "nll_loss": 0.31453680992126465, "rewards/accuracies": 1.0, "rewards/chosen": 0.43028274178504944, "rewards/margins": 10.73808765411377, "rewards/rejected": -10.307806015014648, "step": 456, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8652742441275664, "grad_norm": 1.2360267639160156, "learning_rate": 0.00017056282173873868, "logits/chosen": -0.9575759768486023, "logits/rejected": -0.9700069427490234, "logps/chosen": -10.015963554382324, "logps/rejected": -102.37469482421875, "loss": 0.3883022665977478, "memory(GiB)": 45.96, "nll_loss": 0.3106726109981537, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5499778389930725, "rewards/margins": 8.473649024963379, "rewards/rejected": -7.923670291900635, "step": 457, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8671676232175611, "grad_norm": 1.6001282930374146, "learning_rate": 0.00017041465747997349, "logits/chosen": -0.9415493011474609, "logits/rejected": -0.9562855958938599, "logps/chosen": -9.043622016906738, "logps/rejected": -96.49923706054688, "loss": 0.4010081887245178, "memory(GiB)": 45.96, "nll_loss": 0.3429657518863678, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36076611280441284, "rewards/margins": 7.912264823913574, "rewards/rejected": -7.551499366760254, "step": 458, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8690610023075558, "grad_norm": 4.4591827392578125, "learning_rate": 0.00017026618598882766, "logits/chosen": -0.8824436068534851, "logits/rejected": -0.9026194214820862, "logps/chosen": -5.729236602783203, "logps/rejected": -98.84695434570312, "loss": 0.6645115613937378, "memory(GiB)": 45.96, "nll_loss": 0.5048111081123352, "rewards/accuracies": 0.96875, "rewards/chosen": 0.15461787581443787, "rewards/margins": 8.146541595458984, "rewards/rejected": -7.991923809051514, "step": 459, "train_speed(iter/s)": 0.005579 }, { "epoch": 0.8709543813975504, "grad_norm": 4.195268630981445, "learning_rate": 0.00017011740791311026, "logits/chosen": -0.9580066800117493, "logits/rejected": -0.9738634824752808, "logps/chosen": -8.056970596313477, "logps/rejected": -81.84449005126953, "loss": 0.43963536620140076, "memory(GiB)": 45.96, "nll_loss": 0.26443713903427124, "rewards/accuracies": 0.9375, "rewards/chosen": 0.40618056058883667, "rewards/margins": 6.734289646148682, "rewards/rejected": -6.328108787536621, "step": 460, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8728477604875451, "grad_norm": 1.0153616666793823, "learning_rate": 0.00016996832390196793, "logits/chosen": -0.8880928158760071, "logits/rejected": -0.8997581601142883, "logps/chosen": -6.155505657196045, "logps/rejected": -90.45980834960938, "loss": 0.25239306688308716, "memory(GiB)": 45.96, "nll_loss": 0.20010052621364594, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5011169910430908, "rewards/margins": 7.597998142242432, "rewards/rejected": -7.09688138961792, "step": 461, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8747411395775397, "grad_norm": 1.5598828792572021, "learning_rate": 0.00016981893460588223, "logits/chosen": -0.9450682401657104, "logits/rejected": -0.9603253602981567, "logps/chosen": -5.602974891662598, "logps/rejected": -77.44328308105469, "loss": 0.2963503897190094, "memory(GiB)": 45.96, "nll_loss": 0.19901219010353088, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3095168471336365, "rewards/margins": 6.423759937286377, "rewards/rejected": -6.114243507385254, "step": 462, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8766345186675345, "grad_norm": 1.6015018224716187, "learning_rate": 0.00016966924067666675, "logits/chosen": -0.9075458645820618, "logits/rejected": -0.9180577397346497, "logps/chosen": -5.821288108825684, "logps/rejected": -82.2751235961914, "loss": 0.4034554958343506, "memory(GiB)": 45.96, "nll_loss": 0.32892781496047974, "rewards/accuracies": 0.96875, "rewards/chosen": 0.50316321849823, "rewards/margins": 7.111847400665283, "rewards/rejected": -6.608684539794922, "step": 463, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8785278977575292, "grad_norm": 1.3844958543777466, "learning_rate": 0.00016951924276746425, "logits/chosen": -0.9798877239227295, "logits/rejected": -0.9947710633277893, "logps/chosen": -4.286856651306152, "logps/rejected": -95.45182037353516, "loss": 0.24686779081821442, "memory(GiB)": 45.96, "nll_loss": 0.19889356195926666, "rewards/accuracies": 1.0, "rewards/chosen": 0.41103440523147583, "rewards/margins": 8.060623168945312, "rewards/rejected": -7.649588584899902, "step": 464, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8804212768475238, "grad_norm": 0.8604599833488464, "learning_rate": 0.0001693689415327437, "logits/chosen": -0.9294370412826538, "logits/rejected": -0.944360077381134, "logps/chosen": -3.5297131538391113, "logps/rejected": -95.1581039428711, "loss": 0.15934985876083374, "memory(GiB)": 45.96, "nll_loss": 0.09140884131193161, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4215770959854126, "rewards/margins": 8.435728073120117, "rewards/rejected": -8.014151573181152, "step": 465, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8823146559375185, "grad_norm": 1.621468186378479, "learning_rate": 0.00016921833762829772, "logits/chosen": -0.9183394312858582, "logits/rejected": -0.9399121403694153, "logps/chosen": -3.055697441101074, "logps/rejected": -108.91096496582031, "loss": 0.22333787381649017, "memory(GiB)": 45.96, "nll_loss": 0.14798688888549805, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5031476616859436, "rewards/margins": 9.055591583251953, "rewards/rejected": -8.552444458007812, "step": 466, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8842080350275132, "grad_norm": 0.7695557475090027, "learning_rate": 0.00016906743171123942, "logits/chosen": -0.9076614379882812, "logits/rejected": -0.937860906124115, "logps/chosen": -3.8487682342529297, "logps/rejected": -115.37907409667969, "loss": 0.2175092250108719, "memory(GiB)": 45.96, "nll_loss": 0.20558762550354004, "rewards/accuracies": 1.0, "rewards/chosen": 0.4292341470718384, "rewards/margins": 9.0150146484375, "rewards/rejected": -8.585780143737793, "step": 467, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8861014141175079, "grad_norm": 22.37851333618164, "learning_rate": 0.00016891622443999965, "logits/chosen": -0.938933789730072, "logits/rejected": -0.9588154554367065, "logps/chosen": -4.282645225524902, "logps/rejected": -119.61936950683594, "loss": 0.28716757893562317, "memory(GiB)": 45.96, "nll_loss": 0.1910058856010437, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4263598322868347, "rewards/margins": 10.150740623474121, "rewards/rejected": -9.724381446838379, "step": 468, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8879947932075025, "grad_norm": 2.1868958473205566, "learning_rate": 0.00016876471647432414, "logits/chosen": -0.9410998225212097, "logits/rejected": -0.9753378629684448, "logps/chosen": -2.8839712142944336, "logps/rejected": -123.82636260986328, "loss": 0.30020710825920105, "memory(GiB)": 45.96, "nll_loss": 0.16036656498908997, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36097994446754456, "rewards/margins": 9.432804107666016, "rewards/rejected": -9.071824073791504, "step": 469, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8898881722974972, "grad_norm": 1.1966303586959839, "learning_rate": 0.00016861290847527066, "logits/chosen": -0.9341630935668945, "logits/rejected": -0.9561231732368469, "logps/chosen": -4.715222358703613, "logps/rejected": -99.74626922607422, "loss": 0.2830410897731781, "memory(GiB)": 45.96, "nll_loss": 0.26199036836624146, "rewards/accuracies": 1.0, "rewards/chosen": 0.5495744943618774, "rewards/margins": 8.375075340270996, "rewards/rejected": -7.825501441955566, "step": 470, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8917815513874918, "grad_norm": 5.522665977478027, "learning_rate": 0.00016846080110520593, "logits/chosen": -0.8682283759117126, "logits/rejected": -0.8838706016540527, "logps/chosen": -7.110651969909668, "logps/rejected": -98.35552215576172, "loss": 0.5406176447868347, "memory(GiB)": 45.96, "nll_loss": 0.3845999240875244, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2689996361732483, "rewards/margins": 8.083311080932617, "rewards/rejected": -7.814311504364014, "step": 471, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8936749304774866, "grad_norm": 0.9458474516868591, "learning_rate": 0.0001683083950278031, "logits/chosen": -0.9151694178581238, "logits/rejected": -0.9346402883529663, "logps/chosen": -4.737029075622559, "logps/rejected": -121.00469970703125, "loss": 0.2966020405292511, "memory(GiB)": 45.96, "nll_loss": 0.2277030497789383, "rewards/accuracies": 1.0, "rewards/chosen": 0.4393775463104248, "rewards/margins": 10.670300483703613, "rewards/rejected": -10.23092269897461, "step": 472, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8955683095674812, "grad_norm": 7.999751091003418, "learning_rate": 0.00016815569090803845, "logits/chosen": -0.8978246450424194, "logits/rejected": -0.9048880934715271, "logps/chosen": -7.204007148742676, "logps/rejected": -87.66303253173828, "loss": 0.42673900723457336, "memory(GiB)": 45.96, "nll_loss": 0.35650965571403503, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3317716717720032, "rewards/margins": 7.524182319641113, "rewards/rejected": -7.192410469055176, "step": 473, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8974616886574759, "grad_norm": 0.7010167837142944, "learning_rate": 0.00016800268941218876, "logits/chosen": -0.8622817397117615, "logits/rejected": -0.8864709138870239, "logps/chosen": -4.245789051055908, "logps/rejected": -120.96448516845703, "loss": 0.1819450557231903, "memory(GiB)": 45.96, "nll_loss": 0.14287763833999634, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41072070598602295, "rewards/margins": 10.304065704345703, "rewards/rejected": -9.89334487915039, "step": 474, "train_speed(iter/s)": 0.00558 }, { "epoch": 0.8993550677474705, "grad_norm": 7.6167731285095215, "learning_rate": 0.0001678493912078283, "logits/chosen": -0.8571869730949402, "logits/rejected": -0.8682100772857666, "logps/chosen": -6.5908732414245605, "logps/rejected": -90.01347351074219, "loss": 0.3374626636505127, "memory(GiB)": 45.96, "nll_loss": 0.2244843989610672, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3946775496006012, "rewards/margins": 7.9344305992126465, "rewards/rejected": -7.539752006530762, "step": 475, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.9012484468374652, "grad_norm": 3.698955774307251, "learning_rate": 0.00016769579696382597, "logits/chosen": -0.8630130887031555, "logits/rejected": -0.8758262991905212, "logps/chosen": -4.464090347290039, "logps/rejected": -84.8655014038086, "loss": 0.24113307893276215, "memory(GiB)": 45.96, "nll_loss": 0.19968506693840027, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5144667625427246, "rewards/margins": 7.58385705947876, "rewards/rejected": -7.069390296936035, "step": 476, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.90314182592746, "grad_norm": 1.0875921249389648, "learning_rate": 0.00016754190735034232, "logits/chosen": -0.8026514649391174, "logits/rejected": -0.8109226226806641, "logps/chosen": -7.072743892669678, "logps/rejected": -81.69027709960938, "loss": 0.3926900029182434, "memory(GiB)": 45.96, "nll_loss": 0.32436299324035645, "rewards/accuracies": 0.96875, "rewards/chosen": 0.42420172691345215, "rewards/margins": 7.307297706604004, "rewards/rejected": -6.883096694946289, "step": 477, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.9050352050174546, "grad_norm": 12.628859519958496, "learning_rate": 0.00016738772303882658, "logits/chosen": -0.8218420743942261, "logits/rejected": -0.8415544033050537, "logps/chosen": -3.9710536003112793, "logps/rejected": -114.25907897949219, "loss": 0.285603404045105, "memory(GiB)": 45.96, "nll_loss": 0.2653937041759491, "rewards/accuracies": 1.0, "rewards/chosen": 0.3051114082336426, "rewards/margins": 9.78807544708252, "rewards/rejected": -9.482963562011719, "step": 478, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.9069285841074493, "grad_norm": 3.7553205490112305, "learning_rate": 0.00016723324470201394, "logits/chosen": -0.8214201927185059, "logits/rejected": -0.8359025716781616, "logps/chosen": -7.0973076820373535, "logps/rejected": -96.85978698730469, "loss": 0.2682635188102722, "memory(GiB)": 45.96, "nll_loss": 0.21152906119823456, "rewards/accuracies": 0.96875, "rewards/chosen": 0.429471880197525, "rewards/margins": 8.366806983947754, "rewards/rejected": -7.937335968017578, "step": 479, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.9088219631974439, "grad_norm": 5.100663661956787, "learning_rate": 0.00016707847301392236, "logits/chosen": -0.8678508996963501, "logits/rejected": -0.886093258857727, "logps/chosen": -4.311007976531982, "logps/rejected": -87.9342269897461, "loss": 0.3412279784679413, "memory(GiB)": 45.96, "nll_loss": 0.16602440178394318, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21858087182044983, "rewards/margins": 6.955101490020752, "rewards/rejected": -6.736520767211914, "step": 480, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.9107153422874387, "grad_norm": 2.6578102111816406, "learning_rate": 0.0001669234086498498, "logits/chosen": -0.8269668817520142, "logits/rejected": -0.8376889824867249, "logps/chosen": -6.732077598571777, "logps/rejected": -84.00537109375, "loss": 0.5132743716239929, "memory(GiB)": 45.96, "nll_loss": 0.4207915961742401, "rewards/accuracies": 1.0, "rewards/chosen": 0.21707794070243835, "rewards/margins": 6.86088752746582, "rewards/rejected": -6.643810272216797, "step": 481, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.9126087213774333, "grad_norm": 7.355591773986816, "learning_rate": 0.00016676805228637128, "logits/chosen": -0.7974196672439575, "logits/rejected": -0.8050395250320435, "logps/chosen": -9.839652061462402, "logps/rejected": -77.39722442626953, "loss": 0.3702613115310669, "memory(GiB)": 45.96, "nll_loss": 0.3158036768436432, "rewards/accuracies": 0.96875, "rewards/chosen": 0.38017088174819946, "rewards/margins": 6.458867073059082, "rewards/rejected": -6.078695774078369, "step": 482, "train_speed(iter/s)": 0.005581 }, { "epoch": 0.914502100467428, "grad_norm": 1.2167003154754639, "learning_rate": 0.0001666124046013357, "logits/chosen": -0.8047705292701721, "logits/rejected": -0.821438193321228, "logps/chosen": -4.215728759765625, "logps/rejected": -84.90574645996094, "loss": 0.2564030885696411, "memory(GiB)": 45.96, "nll_loss": 0.17464032769203186, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36784717440605164, "rewards/margins": 6.691460132598877, "rewards/rejected": -6.323612689971924, "step": 483, "train_speed(iter/s)": 0.005582 }, { "epoch": 0.9163954795574226, "grad_norm": 1.4329453706741333, "learning_rate": 0.0001664564662738632, "logits/chosen": -0.8270524144172668, "logits/rejected": -0.843065619468689, "logps/chosen": -3.869436502456665, "logps/rejected": -82.40938568115234, "loss": 0.32981476187705994, "memory(GiB)": 45.96, "nll_loss": 0.24593578279018402, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4524030089378357, "rewards/margins": 6.6524176597595215, "rewards/rejected": -6.200014591217041, "step": 484, "train_speed(iter/s)": 0.005582 }, { "epoch": 0.9182888586474173, "grad_norm": 1.2793928384780884, "learning_rate": 0.00016630023798434206, "logits/chosen": -0.8093842267990112, "logits/rejected": -0.8249430656433105, "logps/chosen": -3.626284122467041, "logps/rejected": -91.00061798095703, "loss": 0.26968449354171753, "memory(GiB)": 45.96, "nll_loss": 0.18248513340950012, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5210257768630981, "rewards/margins": 7.8323211669921875, "rewards/rejected": -7.311295509338379, "step": 485, "train_speed(iter/s)": 0.005582 }, { "epoch": 0.920182237737412, "grad_norm": 1.2872005701065063, "learning_rate": 0.0001661437204144256, "logits/chosen": -0.8859755396842957, "logits/rejected": -0.9020763635635376, "logps/chosen": -3.142106771469116, "logps/rejected": -110.82911682128906, "loss": 0.23602813482284546, "memory(GiB)": 45.96, "nll_loss": 0.17257589101791382, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2963697910308838, "rewards/margins": 9.594768524169922, "rewards/rejected": -9.2983980178833, "step": 486, "train_speed(iter/s)": 0.005582 }, { "epoch": 0.9220756168274067, "grad_norm": 1.0377421379089355, "learning_rate": 0.00016598691424702937, "logits/chosen": -0.8930898904800415, "logits/rejected": -0.9027186036109924, "logps/chosen": -8.572845458984375, "logps/rejected": -103.29754638671875, "loss": 0.34422510862350464, "memory(GiB)": 45.96, "nll_loss": 0.31612199544906616, "rewards/accuracies": 1.0, "rewards/chosen": 0.42877423763275146, "rewards/margins": 9.359115600585938, "rewards/rejected": -8.930340766906738, "step": 487, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9239689959174013, "grad_norm": 5.561287879943848, "learning_rate": 0.00016582982016632818, "logits/chosen": -0.9102674126625061, "logits/rejected": -0.9301952123641968, "logps/chosen": -5.624942302703857, "logps/rejected": -136.92950439453125, "loss": 0.411335289478302, "memory(GiB)": 45.96, "nll_loss": 0.3478354811668396, "rewards/accuracies": 0.96875, "rewards/chosen": 0.40333279967308044, "rewards/margins": 12.023845672607422, "rewards/rejected": -11.620512962341309, "step": 488, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.925862375007396, "grad_norm": 1.0229040384292603, "learning_rate": 0.000165672438857753, "logits/chosen": -0.9191131591796875, "logits/rejected": -0.924005389213562, "logps/chosen": -7.766480922698975, "logps/rejected": -100.96819305419922, "loss": 0.3040256202220917, "memory(GiB)": 45.96, "nll_loss": 0.26725876331329346, "rewards/accuracies": 1.0, "rewards/chosen": 0.4234240651130676, "rewards/margins": 9.132671356201172, "rewards/rejected": -8.709247589111328, "step": 489, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9277557540973906, "grad_norm": 19.993261337280273, "learning_rate": 0.00016551477100798805, "logits/chosen": -0.9173243045806885, "logits/rejected": -0.931130051612854, "logps/chosen": -9.224342346191406, "logps/rejected": -119.46231079101562, "loss": 0.6596160531044006, "memory(GiB)": 45.96, "nll_loss": 0.5873731374740601, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28087401390075684, "rewards/margins": 9.973217010498047, "rewards/rejected": -9.692342758178711, "step": 490, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9296491331873854, "grad_norm": 1.2866884469985962, "learning_rate": 0.00016535681730496778, "logits/chosen": -0.9484301805496216, "logits/rejected": -0.9697479605674744, "logps/chosen": -7.1799516677856445, "logps/rejected": -141.3379364013672, "loss": 0.28797227144241333, "memory(GiB)": 45.96, "nll_loss": 0.25906774401664734, "rewards/accuracies": 1.0, "rewards/chosen": 0.5529451370239258, "rewards/margins": 12.745800971984863, "rewards/rejected": -12.192853927612305, "step": 491, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.93154251227738, "grad_norm": 1.1486427783966064, "learning_rate": 0.00016519857843787388, "logits/chosen": -0.8829447627067566, "logits/rejected": -0.8954159021377563, "logps/chosen": -3.612278938293457, "logps/rejected": -104.1048583984375, "loss": 0.24075637757778168, "memory(GiB)": 45.96, "nll_loss": 0.17766651511192322, "rewards/accuracies": 0.9375, "rewards/chosen": 0.39927470684051514, "rewards/margins": 9.08088493347168, "rewards/rejected": -8.681610107421875, "step": 492, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9334358913673747, "grad_norm": 6.187593460083008, "learning_rate": 0.00016504005509713227, "logits/chosen": -0.9053263068199158, "logits/rejected": -0.9288167357444763, "logps/chosen": -7.226568222045898, "logps/rejected": -149.4182586669922, "loss": 1.2350273132324219, "memory(GiB)": 45.96, "nll_loss": 1.0333458185195923, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1103183850646019, "rewards/margins": 12.931726455688477, "rewards/rejected": -12.821407318115234, "step": 493, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9353292704573694, "grad_norm": 4.0292534828186035, "learning_rate": 0.00016488124797441004, "logits/chosen": -0.896517813205719, "logits/rejected": -0.9123057126998901, "logps/chosen": -3.1331238746643066, "logps/rejected": -122.09529113769531, "loss": 0.26523512601852417, "memory(GiB)": 45.96, "nll_loss": 0.22852984070777893, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41106387972831726, "rewards/margins": 11.093954086303711, "rewards/rejected": -10.682888984680176, "step": 494, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.937222649547364, "grad_norm": 3.866851329803467, "learning_rate": 0.00016472215776261256, "logits/chosen": -0.8998519778251648, "logits/rejected": -0.9100637435913086, "logps/chosen": -6.161553382873535, "logps/rejected": -91.67127990722656, "loss": 0.32430458068847656, "memory(GiB)": 45.96, "nll_loss": 0.29789990186691284, "rewards/accuracies": 1.0, "rewards/chosen": 0.37541043758392334, "rewards/margins": 7.9647979736328125, "rewards/rejected": -7.589386940002441, "step": 495, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9391160286373588, "grad_norm": 1.5745933055877686, "learning_rate": 0.00016456278515588024, "logits/chosen": -0.9250640869140625, "logits/rejected": -0.9345837831497192, "logps/chosen": -3.4266815185546875, "logps/rejected": -95.2527084350586, "loss": 0.22486472129821777, "memory(GiB)": 45.96, "nll_loss": 0.14442774653434753, "rewards/accuracies": 0.96875, "rewards/chosen": 0.35136106610298157, "rewards/margins": 8.68508243560791, "rewards/rejected": -8.333721160888672, "step": 496, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9410094077273534, "grad_norm": 2.027763843536377, "learning_rate": 0.00016440313084958578, "logits/chosen": -0.8975878953933716, "logits/rejected": -0.9132086038589478, "logps/chosen": -4.722578525543213, "logps/rejected": -108.40174865722656, "loss": 0.2619985342025757, "memory(GiB)": 45.96, "nll_loss": 0.22499336302280426, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31465330719947815, "rewards/margins": 9.058952331542969, "rewards/rejected": -8.744298934936523, "step": 497, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9429027868173481, "grad_norm": 31.387229919433594, "learning_rate": 0.00016424319554033084, "logits/chosen": -0.8927862048149109, "logits/rejected": -0.9180783629417419, "logps/chosen": -3.2301762104034424, "logps/rejected": -132.96664428710938, "loss": 0.3428140878677368, "memory(GiB)": 45.96, "nll_loss": 0.303774356842041, "rewards/accuracies": 1.0, "rewards/chosen": 0.41509026288986206, "rewards/margins": 11.307497024536133, "rewards/rejected": -10.89240550994873, "step": 498, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9447961659073427, "grad_norm": 0.9289922714233398, "learning_rate": 0.0001640829799259433, "logits/chosen": -0.9254931807518005, "logits/rejected": -0.9433070421218872, "logps/chosen": -1.6293895244598389, "logps/rejected": -97.64047241210938, "loss": 0.15687072277069092, "memory(GiB)": 45.96, "nll_loss": 0.13367648422718048, "rewards/accuracies": 1.0, "rewards/chosen": 0.4715469181537628, "rewards/margins": 8.527523040771484, "rewards/rejected": -8.055976867675781, "step": 499, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9466895449973375, "grad_norm": 2.5266456604003906, "learning_rate": 0.00016392248470547394, "logits/chosen": -0.8945059776306152, "logits/rejected": -0.9079508781433105, "logps/chosen": -4.099118709564209, "logps/rejected": -92.66238403320312, "loss": 0.30788105726242065, "memory(GiB)": 45.96, "nll_loss": 0.255858838558197, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23659808933734894, "rewards/margins": 7.956408500671387, "rewards/rejected": -7.719810485839844, "step": 500, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9485829240873321, "grad_norm": 6.29925012588501, "learning_rate": 0.00016376171057919358, "logits/chosen": -0.9756448268890381, "logits/rejected": -0.9866229891777039, "logps/chosen": -4.4007415771484375, "logps/rejected": -88.4787368774414, "loss": 0.5212814211845398, "memory(GiB)": 45.96, "nll_loss": 0.49678102135658264, "rewards/accuracies": 1.0, "rewards/chosen": 0.5291932225227356, "rewards/margins": 8.009785652160645, "rewards/rejected": -7.480591773986816, "step": 501, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9504763031773268, "grad_norm": 14.686606407165527, "learning_rate": 0.00016360065824858993, "logits/chosen": -0.8657544851303101, "logits/rejected": -0.8791153430938721, "logps/chosen": -5.418216705322266, "logps/rejected": -87.16682434082031, "loss": 0.5172737240791321, "memory(GiB)": 45.96, "nll_loss": 0.4656076729297638, "rewards/accuracies": 1.0, "rewards/chosen": 0.30911099910736084, "rewards/margins": 7.13665771484375, "rewards/rejected": -6.827547073364258, "step": 502, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9523696822673214, "grad_norm": 0.8342228531837463, "learning_rate": 0.00016343932841636456, "logits/chosen": -0.9093836545944214, "logits/rejected": -0.9287516474723816, "logps/chosen": -4.357170104980469, "logps/rejected": -101.34312438964844, "loss": 0.23222270607948303, "memory(GiB)": 45.96, "nll_loss": 0.16751480102539062, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3810700476169586, "rewards/margins": 8.414416313171387, "rewards/rejected": -8.033347129821777, "step": 503, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9542630613573161, "grad_norm": 2.5457377433776855, "learning_rate": 0.00016327772178642986, "logits/chosen": -0.9070831537246704, "logits/rejected": -0.9166555404663086, "logps/chosen": -7.324579238891602, "logps/rejected": -86.09144592285156, "loss": 0.4546603858470917, "memory(GiB)": 45.96, "nll_loss": 0.3363542854785919, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4323062300682068, "rewards/margins": 7.224738597869873, "rewards/rejected": -6.79243278503418, "step": 504, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9561564404473109, "grad_norm": 1.2815897464752197, "learning_rate": 0.00016311583906390592, "logits/chosen": -0.9519956707954407, "logits/rejected": -0.9706866145133972, "logps/chosen": -4.026782989501953, "logps/rejected": -92.71136474609375, "loss": 0.2715020179748535, "memory(GiB)": 45.96, "nll_loss": 0.20830240845680237, "rewards/accuracies": 1.0, "rewards/chosen": 0.504820704460144, "rewards/margins": 7.9874420166015625, "rewards/rejected": -7.482622146606445, "step": 505, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9580498195373055, "grad_norm": 1.0361456871032715, "learning_rate": 0.00016295368095511746, "logits/chosen": -0.9036988615989685, "logits/rejected": -0.9219734072685242, "logps/chosen": -8.218575477600098, "logps/rejected": -93.13555908203125, "loss": 0.29020407795906067, "memory(GiB)": 45.96, "nll_loss": 0.26319992542266846, "rewards/accuracies": 1.0, "rewards/chosen": 0.4894104301929474, "rewards/margins": 7.870117664337158, "rewards/rejected": -7.380707263946533, "step": 506, "train_speed(iter/s)": 0.005583 }, { "epoch": 0.9599431986273002, "grad_norm": 1.8414019346237183, "learning_rate": 0.0001627912481675908, "logits/chosen": -0.8823158144950867, "logits/rejected": -0.898427426815033, "logps/chosen": -7.699591636657715, "logps/rejected": -80.27245330810547, "loss": 0.7505689263343811, "memory(GiB)": 45.96, "nll_loss": 0.5265831351280212, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19867704808712006, "rewards/margins": 6.069255828857422, "rewards/rejected": -5.870578765869141, "step": 507, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9618365777172948, "grad_norm": 4.019859790802002, "learning_rate": 0.0001626285414100507, "logits/chosen": -0.8857368230819702, "logits/rejected": -0.8978668451309204, "logps/chosen": -4.504330635070801, "logps/rejected": -81.92082214355469, "loss": 0.3514907658100128, "memory(GiB)": 45.96, "nll_loss": 0.21580490469932556, "rewards/accuracies": 0.875, "rewards/chosen": 0.3438741862773895, "rewards/margins": 6.67080020904541, "rewards/rejected": -6.326925754547119, "step": 508, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9637299568072895, "grad_norm": 1.0069034099578857, "learning_rate": 0.00016246556139241726, "logits/chosen": -0.8332890272140503, "logits/rejected": -0.8481358885765076, "logps/chosen": -5.350769519805908, "logps/rejected": -90.37372589111328, "loss": 0.30022063851356506, "memory(GiB)": 45.96, "nll_loss": 0.19650080800056458, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4888809323310852, "rewards/margins": 7.104846954345703, "rewards/rejected": -6.615966796875, "step": 509, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9656233358972842, "grad_norm": 1.631832242012024, "learning_rate": 0.00016230230882580303, "logits/chosen": -0.9425424337387085, "logits/rejected": -0.952564537525177, "logps/chosen": -3.654702663421631, "logps/rejected": -69.78423309326172, "loss": 0.3088323771953583, "memory(GiB)": 45.96, "nll_loss": 0.19460514187812805, "rewards/accuracies": 0.90625, "rewards/chosen": 0.4093857407569885, "rewards/margins": 5.899824142456055, "rewards/rejected": -5.490438461303711, "step": 510, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9675167149872789, "grad_norm": 13.144497871398926, "learning_rate": 0.00016213878442250954, "logits/chosen": -0.9134064316749573, "logits/rejected": -0.9225355386734009, "logps/chosen": -10.128987312316895, "logps/rejected": -73.52391052246094, "loss": 0.49284934997558594, "memory(GiB)": 45.96, "nll_loss": 0.2897854149341583, "rewards/accuracies": 0.875, "rewards/chosen": 0.02852116897702217, "rewards/margins": 5.512090682983398, "rewards/rejected": -5.483569622039795, "step": 511, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9694100940772735, "grad_norm": 5.9472761154174805, "learning_rate": 0.00016197498889602448, "logits/chosen": -0.9309385418891907, "logits/rejected": -0.9506005048751831, "logps/chosen": -5.9269938468933105, "logps/rejected": -94.47163391113281, "loss": 0.34433653950691223, "memory(GiB)": 45.96, "nll_loss": 0.25453051924705505, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4299897253513336, "rewards/margins": 8.080008506774902, "rewards/rejected": -7.650019645690918, "step": 512, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9713034731672682, "grad_norm": 1.6089311838150024, "learning_rate": 0.0001618109229610186, "logits/chosen": -0.9268408417701721, "logits/rejected": -0.937603235244751, "logps/chosen": -7.795493125915527, "logps/rejected": -76.06086730957031, "loss": 0.3525398075580597, "memory(GiB)": 45.96, "nll_loss": 0.2876393496990204, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4603784680366516, "rewards/margins": 6.2412896156311035, "rewards/rejected": -5.780911445617676, "step": 513, "train_speed(iter/s)": 0.005584 }, { "epoch": 0.9731968522572629, "grad_norm": 1.1773451566696167, "learning_rate": 0.0001616465873333423, "logits/chosen": -0.9452431201934814, "logits/rejected": -0.9670403599739075, "logps/chosen": -4.365338325500488, "logps/rejected": -87.41246032714844, "loss": 0.22716665267944336, "memory(GiB)": 45.96, "nll_loss": 0.19295459985733032, "rewards/accuracies": 1.0, "rewards/chosen": 0.46086013317108154, "rewards/margins": 7.090925693511963, "rewards/rejected": -6.630065441131592, "step": 514, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.9750902313472576, "grad_norm": 1.8114774227142334, "learning_rate": 0.00016148198273002287, "logits/chosen": -0.906434953212738, "logits/rejected": -0.9241432547569275, "logps/chosen": -4.319371700286865, "logps/rejected": -76.49603271484375, "loss": 0.2575733959674835, "memory(GiB)": 45.96, "nll_loss": 0.23216064274311066, "rewards/accuracies": 1.0, "rewards/chosen": 0.6431917548179626, "rewards/margins": 6.2898454666137695, "rewards/rejected": -5.646653652191162, "step": 515, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.9769836104372522, "grad_norm": 1.0340324640274048, "learning_rate": 0.00016131710986926108, "logits/chosen": -0.936368465423584, "logits/rejected": -0.9526094794273376, "logps/chosen": -3.4732229709625244, "logps/rejected": -81.12310791015625, "loss": 0.20995403826236725, "memory(GiB)": 45.96, "nll_loss": 0.18944348394870758, "rewards/accuracies": 1.0, "rewards/chosen": 0.5206528902053833, "rewards/margins": 6.727083206176758, "rewards/rejected": -6.206429481506348, "step": 516, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.9788769895272469, "grad_norm": 3.1034345626831055, "learning_rate": 0.0001611519694704282, "logits/chosen": -0.9805644154548645, "logits/rejected": -0.9963036775588989, "logps/chosen": -4.623378753662109, "logps/rejected": -77.49845123291016, "loss": 0.3559991419315338, "memory(GiB)": 45.96, "nll_loss": 0.2764490246772766, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3371025025844574, "rewards/margins": 6.5251383781433105, "rewards/rejected": -6.18803596496582, "step": 517, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.9807703686172415, "grad_norm": 4.58514928817749, "learning_rate": 0.00016098656225406287, "logits/chosen": -0.9553229212760925, "logits/rejected": -0.9597129225730896, "logps/chosen": -7.885223388671875, "logps/rejected": -72.13860321044922, "loss": 0.4449266791343689, "memory(GiB)": 45.96, "nll_loss": 0.3402749300003052, "rewards/accuracies": 0.90625, "rewards/chosen": 0.264324426651001, "rewards/margins": 5.985879898071289, "rewards/rejected": -5.721555709838867, "step": 518, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.9826637477072363, "grad_norm": 0.9089112281799316, "learning_rate": 0.00016082088894186778, "logits/chosen": -0.9573476314544678, "logits/rejected": -0.9719171524047852, "logps/chosen": -3.7913498878479004, "logps/rejected": -79.99372863769531, "loss": 0.27717337012290955, "memory(GiB)": 45.96, "nll_loss": 0.23127052187919617, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4175718426704407, "rewards/margins": 6.348897933959961, "rewards/rejected": -5.931325912475586, "step": 519, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.984557126797231, "grad_norm": 17.343408584594727, "learning_rate": 0.00016065495025670675, "logits/chosen": -0.9993346929550171, "logits/rejected": -1.015330195426941, "logps/chosen": -3.9948267936706543, "logps/rejected": -84.67949676513672, "loss": 0.44340285658836365, "memory(GiB)": 45.96, "nll_loss": 0.2410781979560852, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18794837594032288, "rewards/margins": 6.663022518157959, "rewards/rejected": -6.475074291229248, "step": 520, "train_speed(iter/s)": 0.005585 }, { "epoch": 0.9864505058872256, "grad_norm": 1.0182690620422363, "learning_rate": 0.00016048874692260149, "logits/chosen": -1.0138598680496216, "logits/rejected": -1.0335602760314941, "logps/chosen": -5.567783355712891, "logps/rejected": -90.43717956542969, "loss": 0.2480800896883011, "memory(GiB)": 45.96, "nll_loss": 0.20226755738258362, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3979242146015167, "rewards/margins": 7.263826370239258, "rewards/rejected": -6.865901470184326, "step": 521, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.9883438849772203, "grad_norm": 0.6683632731437683, "learning_rate": 0.00016032227966472827, "logits/chosen": -0.9863166809082031, "logits/rejected": -1.0132988691329956, "logps/chosen": -3.0443716049194336, "logps/rejected": -98.99560546875, "loss": 0.15996497869491577, "memory(GiB)": 45.96, "nll_loss": 0.1395530253648758, "rewards/accuracies": 1.0, "rewards/chosen": 0.53858482837677, "rewards/margins": 8.103957176208496, "rewards/rejected": -7.565372943878174, "step": 522, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.9902372640672149, "grad_norm": 1.112196445465088, "learning_rate": 0.0001601555492094151, "logits/chosen": -1.0361038446426392, "logits/rejected": -1.0564793348312378, "logps/chosen": -3.820387363433838, "logps/rejected": -85.76795196533203, "loss": 0.2085203379392624, "memory(GiB)": 45.96, "nll_loss": 0.1832592487335205, "rewards/accuracies": 1.0, "rewards/chosen": 0.5125322937965393, "rewards/margins": 7.044062614440918, "rewards/rejected": -6.531529903411865, "step": 523, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.9921306431572097, "grad_norm": 2.029463529586792, "learning_rate": 0.00015998855628413823, "logits/chosen": -1.0319892168045044, "logits/rejected": -1.0529518127441406, "logps/chosen": -4.808176517486572, "logps/rejected": -84.97135162353516, "loss": 0.21726690232753754, "memory(GiB)": 45.96, "nll_loss": 0.1616971641778946, "rewards/accuracies": 1.0, "rewards/chosen": 0.28862282633781433, "rewards/margins": 6.925485610961914, "rewards/rejected": -6.636862277984619, "step": 524, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.9940240222472043, "grad_norm": 3.0579190254211426, "learning_rate": 0.00015982130161751922, "logits/chosen": -0.9786304235458374, "logits/rejected": -0.9961691498756409, "logps/chosen": -10.302689552307129, "logps/rejected": -89.45677185058594, "loss": 0.5347995162010193, "memory(GiB)": 45.96, "nll_loss": 0.4095235764980316, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21495375037193298, "rewards/margins": 6.500909328460693, "rewards/rejected": -6.285955429077148, "step": 525, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.995917401337199, "grad_norm": 1.0815080404281616, "learning_rate": 0.00015965378593932157, "logits/chosen": -1.0681151151657104, "logits/rejected": -1.0940450429916382, "logps/chosen": -2.94252872467041, "logps/rejected": -87.89140319824219, "loss": 0.22619354724884033, "memory(GiB)": 45.96, "nll_loss": 0.16631841659545898, "rewards/accuracies": 1.0, "rewards/chosen": 0.5529903769493103, "rewards/margins": 7.263401031494141, "rewards/rejected": -6.710411071777344, "step": 526, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.9978107804271936, "grad_norm": 38.966758728027344, "learning_rate": 0.00015948600998044765, "logits/chosen": -1.0475246906280518, "logits/rejected": -1.080329179763794, "logps/chosen": -8.313323974609375, "logps/rejected": -90.39398956298828, "loss": 0.7874181270599365, "memory(GiB)": 45.96, "nll_loss": 0.6002381443977356, "rewards/accuracies": 0.90625, "rewards/chosen": 0.44292813539505005, "rewards/margins": 6.95076322555542, "rewards/rejected": -6.507835388183594, "step": 527, "train_speed(iter/s)": 0.005586 }, { "epoch": 0.9997041595171884, "grad_norm": 4.178254127502441, "learning_rate": 0.00015931797447293552, "logits/chosen": -1.0808571577072144, "logits/rejected": -1.1031514406204224, "logps/chosen": -3.7605037689208984, "logps/rejected": -98.75016021728516, "loss": 0.2028055489063263, "memory(GiB)": 45.96, "nll_loss": 0.13626113533973694, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3011845648288727, "rewards/margins": 8.235344886779785, "rewards/rejected": -7.934159755706787, "step": 528, "train_speed(iter/s)": 0.005586 }, { "epoch": 1.0, "grad_norm": 4.178254127502441, "learning_rate": 0.00015914968014995567, "logits/chosen": -1.1427804231643677, "logits/rejected": -1.1405260562896729, "logps/chosen": -2.7054977416992188, "logps/rejected": -56.67396926879883, "loss": 0.038843873888254166, "memory(GiB)": 45.96, "nll_loss": 0.12972064316272736, "rewards/accuracies": 1.0, "rewards/chosen": 0.3542119860649109, "rewards/margins": 4.969267845153809, "rewards/rejected": -4.615056037902832, "step": 529, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0018933790899947, "grad_norm": 50.89724349975586, "learning_rate": 0.00015898112774580784, "logits/chosen": -1.1593101024627686, "logits/rejected": -1.168821096420288, "logps/chosen": -6.839245796203613, "logps/rejected": -88.95535278320312, "loss": 0.6083638072013855, "memory(GiB)": 45.96, "nll_loss": 0.4864938259124756, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19008603692054749, "rewards/margins": 7.390456676483154, "rewards/rejected": -7.200370788574219, "step": 530, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0037867581799893, "grad_norm": 1.4983274936676025, "learning_rate": 0.00015881231799591783, "logits/chosen": -1.1478654146194458, "logits/rejected": -1.160862922668457, "logps/chosen": -5.944678783416748, "logps/rejected": -110.5527114868164, "loss": 0.2588149607181549, "memory(GiB)": 45.96, "nll_loss": 0.1914646476507187, "rewards/accuracies": 0.96875, "rewards/chosen": 0.39623722434043884, "rewards/margins": 9.497812271118164, "rewards/rejected": -9.101574897766113, "step": 531, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.005680137269984, "grad_norm": 1.2377827167510986, "learning_rate": 0.00015864325163683431, "logits/chosen": -1.1823019981384277, "logits/rejected": -1.1935970783233643, "logps/chosen": -5.829947471618652, "logps/rejected": -96.11874389648438, "loss": 0.2351379096508026, "memory(GiB)": 45.96, "nll_loss": 0.21910277009010315, "rewards/accuracies": 1.0, "rewards/chosen": 0.6932865381240845, "rewards/margins": 8.259093284606934, "rewards/rejected": -7.5658063888549805, "step": 532, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0075735163599786, "grad_norm": 6.626506328582764, "learning_rate": 0.00015847392940622555, "logits/chosen": -1.2572100162506104, "logits/rejected": -1.2743322849273682, "logps/chosen": -5.158469200134277, "logps/rejected": -102.89447021484375, "loss": 0.43753018975257874, "memory(GiB)": 45.96, "nll_loss": 0.3763510584831238, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37863367795944214, "rewards/margins": 9.09069538116455, "rewards/rejected": -8.712060928344727, "step": 533, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0094668954499735, "grad_norm": 9.237115859985352, "learning_rate": 0.00015830435204287628, "logits/chosen": -1.2432606220245361, "logits/rejected": -1.2568538188934326, "logps/chosen": -5.230342388153076, "logps/rejected": -125.57969665527344, "loss": 0.320054829120636, "memory(GiB)": 45.96, "nll_loss": 0.1863236427307129, "rewards/accuracies": 0.90625, "rewards/chosen": 0.5029672384262085, "rewards/margins": 11.315177917480469, "rewards/rejected": -10.812210083007812, "step": 534, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0113602745399681, "grad_norm": 2.3910863399505615, "learning_rate": 0.0001581345202866844, "logits/chosen": -1.2545768022537231, "logits/rejected": -1.2814122438430786, "logps/chosen": -4.037993431091309, "logps/rejected": -119.29512023925781, "loss": 0.2895146310329437, "memory(GiB)": 45.96, "nll_loss": 0.19089049100875854, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3177344799041748, "rewards/margins": 10.372758865356445, "rewards/rejected": -10.055024147033691, "step": 535, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0132536536299628, "grad_norm": 11.799864768981934, "learning_rate": 0.00015796443487865776, "logits/chosen": -1.2704317569732666, "logits/rejected": -1.2862308025360107, "logps/chosen": -3.8405699729919434, "logps/rejected": -101.06300354003906, "loss": 0.3045562505722046, "memory(GiB)": 45.96, "nll_loss": 0.2211739867925644, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4603561460971832, "rewards/margins": 9.070082664489746, "rewards/rejected": -8.609726905822754, "step": 536, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0151470327199574, "grad_norm": 1.1523226499557495, "learning_rate": 0.00015779409656091096, "logits/chosen": -1.2223632335662842, "logits/rejected": -1.2454135417938232, "logps/chosen": -3.3703105449676514, "logps/rejected": -114.88744354248047, "loss": 0.23221755027770996, "memory(GiB)": 45.96, "nll_loss": 0.2025429606437683, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6476104855537415, "rewards/margins": 10.323287963867188, "rewards/rejected": -9.675678253173828, "step": 537, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.017040411809952, "grad_norm": 1.1821354627609253, "learning_rate": 0.00015762350607666204, "logits/chosen": -1.2749884128570557, "logits/rejected": -1.2943077087402344, "logps/chosen": -8.302059173583984, "logps/rejected": -98.96806335449219, "loss": 0.2986391484737396, "memory(GiB)": 45.96, "nll_loss": 0.2838631868362427, "rewards/accuracies": 1.0, "rewards/chosen": 0.5527027249336243, "rewards/margins": 8.528514862060547, "rewards/rejected": -7.975813388824463, "step": 538, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0189337908999467, "grad_norm": 19.518661499023438, "learning_rate": 0.0001574526641702294, "logits/chosen": -1.2305980920791626, "logits/rejected": -1.2421363592147827, "logps/chosen": -4.4403533935546875, "logps/rejected": -96.62861633300781, "loss": 0.3891787827014923, "memory(GiB)": 45.96, "nll_loss": 0.2562548518180847, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3143804967403412, "rewards/margins": 8.539346694946289, "rewards/rejected": -8.224966049194336, "step": 539, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0208271699899414, "grad_norm": 9.813395500183105, "learning_rate": 0.00015728157158702833, "logits/chosen": -1.2191518545150757, "logits/rejected": -1.2443480491638184, "logps/chosen": -5.321511268615723, "logps/rejected": -100.6253890991211, "loss": 0.38886359333992004, "memory(GiB)": 45.96, "nll_loss": 0.3503781855106354, "rewards/accuracies": 1.0, "rewards/chosen": 0.4170704782009125, "rewards/margins": 7.897201061248779, "rewards/rejected": -7.480130672454834, "step": 540, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.022720549079936, "grad_norm": 5.502192974090576, "learning_rate": 0.00015711022907356794, "logits/chosen": -1.2725385427474976, "logits/rejected": -1.281760573387146, "logps/chosen": -5.788969039916992, "logps/rejected": -83.48539733886719, "loss": 0.2782316207885742, "memory(GiB)": 45.96, "nll_loss": 0.2644944489002228, "rewards/accuracies": 1.0, "rewards/chosen": 0.6322579979896545, "rewards/margins": 7.397380352020264, "rewards/rejected": -6.765121936798096, "step": 541, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0246139281699307, "grad_norm": 1.0033241510391235, "learning_rate": 0.0001569386373774478, "logits/chosen": -1.2947453260421753, "logits/rejected": -1.3235821723937988, "logps/chosen": -2.1399617195129395, "logps/rejected": -99.05345153808594, "loss": 0.18756692111492157, "memory(GiB)": 45.96, "nll_loss": 0.10680165886878967, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4721769094467163, "rewards/margins": 8.319814682006836, "rewards/rejected": -7.84763765335083, "step": 542, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0265073072599253, "grad_norm": 2.2815518379211426, "learning_rate": 0.00015676679724735475, "logits/chosen": -1.2527762651443481, "logits/rejected": -1.2706432342529297, "logps/chosen": -3.529473304748535, "logps/rejected": -102.44934844970703, "loss": 0.19709157943725586, "memory(GiB)": 45.96, "nll_loss": 0.16788038611412048, "rewards/accuracies": 1.0, "rewards/chosen": 0.39325255155563354, "rewards/margins": 8.873687744140625, "rewards/rejected": -8.48043441772461, "step": 543, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0284006863499202, "grad_norm": 0.9781432747840881, "learning_rate": 0.00015659470943305955, "logits/chosen": -1.3074346780776978, "logits/rejected": -1.3225350379943848, "logps/chosen": -3.6736319065093994, "logps/rejected": -99.07704162597656, "loss": 0.24773047864437103, "memory(GiB)": 45.96, "nll_loss": 0.20028436183929443, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5773366689682007, "rewards/margins": 8.81675910949707, "rewards/rejected": -8.239421844482422, "step": 544, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0302940654399149, "grad_norm": 3.2625584602355957, "learning_rate": 0.0001564223746854136, "logits/chosen": -1.2451472282409668, "logits/rejected": -1.2746459245681763, "logps/chosen": -2.6118361949920654, "logps/rejected": -106.3071517944336, "loss": 0.18340322375297546, "memory(GiB)": 45.96, "nll_loss": 0.16001468896865845, "rewards/accuracies": 1.0, "rewards/chosen": 0.5671020150184631, "rewards/margins": 9.123932838439941, "rewards/rejected": -8.556831359863281, "step": 545, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0321874445299095, "grad_norm": 11.41080379486084, "learning_rate": 0.00015624979375634588, "logits/chosen": -1.2669609785079956, "logits/rejected": -1.285220742225647, "logps/chosen": -6.25026798248291, "logps/rejected": -104.86439514160156, "loss": 0.36971619725227356, "memory(GiB)": 45.96, "nll_loss": 0.26008346676826477, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31941547989845276, "rewards/margins": 8.899809837341309, "rewards/rejected": -8.580394744873047, "step": 546, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0340808236199042, "grad_norm": 23.427906036376953, "learning_rate": 0.00015607696739885934, "logits/chosen": -1.2728469371795654, "logits/rejected": -1.292362093925476, "logps/chosen": -6.034543037414551, "logps/rejected": -88.89381408691406, "loss": 0.7123737335205078, "memory(GiB)": 45.96, "nll_loss": 0.6033825278282166, "rewards/accuracies": 0.96875, "rewards/chosen": 0.26061975955963135, "rewards/margins": 7.074716567993164, "rewards/rejected": -6.8140974044799805, "step": 547, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0359742027098988, "grad_norm": 1.0424782037734985, "learning_rate": 0.0001559038963670279, "logits/chosen": -1.263490080833435, "logits/rejected": -1.2818467617034912, "logps/chosen": -4.806588172912598, "logps/rejected": -109.88215637207031, "loss": 0.2099330872297287, "memory(GiB)": 45.96, "nll_loss": 0.19888734817504883, "rewards/accuracies": 1.0, "rewards/chosen": 0.7063236832618713, "rewards/margins": 9.634958267211914, "rewards/rejected": -8.928633689880371, "step": 548, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0378675817998935, "grad_norm": 1.565426230430603, "learning_rate": 0.00015573058141599296, "logits/chosen": -1.3012843132019043, "logits/rejected": -1.3339687585830688, "logps/chosen": -3.8335983753204346, "logps/rejected": -109.77323913574219, "loss": 0.22731725871562958, "memory(GiB)": 45.96, "nll_loss": 0.18710672855377197, "rewards/accuracies": 1.0, "rewards/chosen": 0.6432173252105713, "rewards/margins": 9.041927337646484, "rewards/rejected": -8.398711204528809, "step": 549, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0397609608898881, "grad_norm": 1.0922037363052368, "learning_rate": 0.00015555702330196023, "logits/chosen": -1.2561464309692383, "logits/rejected": -1.2797656059265137, "logps/chosen": -4.883576393127441, "logps/rejected": -94.83533477783203, "loss": 0.18200495839118958, "memory(GiB)": 45.96, "nll_loss": 0.13938182592391968, "rewards/accuracies": 1.0, "rewards/chosen": 0.5235949158668518, "rewards/margins": 8.185545921325684, "rewards/rejected": -7.661951065063477, "step": 550, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0416543399798828, "grad_norm": 1.1942391395568848, "learning_rate": 0.00015538322278219638, "logits/chosen": -1.327378749847412, "logits/rejected": -1.3506507873535156, "logps/chosen": -2.917591094970703, "logps/rejected": -94.31072235107422, "loss": 0.2088836431503296, "memory(GiB)": 45.96, "nll_loss": 0.13950389623641968, "rewards/accuracies": 0.96875, "rewards/chosen": 0.48478469252586365, "rewards/margins": 8.057584762573242, "rewards/rejected": -7.572801113128662, "step": 551, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0435477190698774, "grad_norm": 1.8847681283950806, "learning_rate": 0.00015520918061502569, "logits/chosen": -1.3219040632247925, "logits/rejected": -1.3375160694122314, "logps/chosen": -3.741983413696289, "logps/rejected": -94.9761962890625, "loss": 0.21428059041500092, "memory(GiB)": 45.96, "nll_loss": 0.17732422053813934, "rewards/accuracies": 1.0, "rewards/chosen": 0.6145517230033875, "rewards/margins": 8.826709747314453, "rewards/rejected": -8.212158203125, "step": 552, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0454410981598723, "grad_norm": 3.402707099914551, "learning_rate": 0.00015503489755982686, "logits/chosen": -1.3000562191009521, "logits/rejected": -1.303682565689087, "logps/chosen": -5.613664150238037, "logps/rejected": -80.0399169921875, "loss": 0.40057235956192017, "memory(GiB)": 45.96, "nll_loss": 0.35176751017570496, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3800576329231262, "rewards/margins": 7.2210588455200195, "rewards/rejected": -6.841001033782959, "step": 553, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.047334477249867, "grad_norm": 1.0752265453338623, "learning_rate": 0.0001548603743770296, "logits/chosen": -1.355738878250122, "logits/rejected": -1.37424898147583, "logps/chosen": -3.0492472648620605, "logps/rejected": -108.67159271240234, "loss": 0.13657376170158386, "memory(GiB)": 45.96, "nll_loss": 0.10331787168979645, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4870010018348694, "rewards/margins": 9.527022361755371, "rewards/rejected": -9.040020942687988, "step": 554, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0492278563398616, "grad_norm": 5.314583778381348, "learning_rate": 0.0001546856118281114, "logits/chosen": -1.3520063161849976, "logits/rejected": -1.3624749183654785, "logps/chosen": -6.195893287658691, "logps/rejected": -94.56097412109375, "loss": 0.30682989954948425, "memory(GiB)": 45.96, "nll_loss": 0.27029889822006226, "rewards/accuracies": 1.0, "rewards/chosen": 0.3668309152126312, "rewards/margins": 8.312253952026367, "rewards/rejected": -7.945422172546387, "step": 555, "train_speed(iter/s)": 0.005596 }, { "epoch": 1.0511212354298562, "grad_norm": 20.930891036987305, "learning_rate": 0.000154510610675594, "logits/chosen": -1.327778697013855, "logits/rejected": -1.3483771085739136, "logps/chosen": -3.625875473022461, "logps/rejected": -97.228271484375, "loss": 0.3087195158004761, "memory(GiB)": 45.96, "nll_loss": 0.2725326120853424, "rewards/accuracies": 1.0, "rewards/chosen": 0.294748455286026, "rewards/margins": 7.920544147491455, "rewards/rejected": -7.625795841217041, "step": 556, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.053014614519851, "grad_norm": 2.161787748336792, "learning_rate": 0.00015433537168304038, "logits/chosen": -1.3243646621704102, "logits/rejected": -1.3322596549987793, "logps/chosen": -5.126698017120361, "logps/rejected": -71.53412628173828, "loss": 0.250238835811615, "memory(GiB)": 45.96, "nll_loss": 0.20904159545898438, "rewards/accuracies": 1.0, "rewards/chosen": 0.5107704997062683, "rewards/margins": 6.104798793792725, "rewards/rejected": -5.594027996063232, "step": 557, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0549079936098456, "grad_norm": 1.0270330905914307, "learning_rate": 0.00015415989561505118, "logits/chosen": -1.334947109222412, "logits/rejected": -1.3445045948028564, "logps/chosen": -8.810266494750977, "logps/rejected": -87.59201049804688, "loss": 0.26200586557388306, "memory(GiB)": 45.96, "nll_loss": 0.2543470859527588, "rewards/accuracies": 1.0, "rewards/chosen": 0.8190967440605164, "rewards/margins": 7.7875471115112305, "rewards/rejected": -6.968450546264648, "step": 558, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0568013726998402, "grad_norm": 0.8429592251777649, "learning_rate": 0.00015398418323726146, "logits/chosen": -1.3177508115768433, "logits/rejected": -1.3297425508499146, "logps/chosen": -4.267469882965088, "logps/rejected": -99.88289642333984, "loss": 0.2590307593345642, "memory(GiB)": 45.96, "nll_loss": 0.21612831950187683, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4924696385860443, "rewards/margins": 8.744771957397461, "rewards/rejected": -8.252302169799805, "step": 559, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0586947517898349, "grad_norm": 1.2864187955856323, "learning_rate": 0.00015380823531633729, "logits/chosen": -1.3363707065582275, "logits/rejected": -1.3560690879821777, "logps/chosen": -6.6727423667907715, "logps/rejected": -105.22146606445312, "loss": 0.25500863790512085, "memory(GiB)": 45.96, "nll_loss": 0.2455504983663559, "rewards/accuracies": 1.0, "rewards/chosen": 0.4451357424259186, "rewards/margins": 8.943872451782227, "rewards/rejected": -8.498737335205078, "step": 560, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0605881308798295, "grad_norm": 1.5146949291229248, "learning_rate": 0.00015363205261997254, "logits/chosen": -1.3046088218688965, "logits/rejected": -1.3203272819519043, "logps/chosen": -4.633506774902344, "logps/rejected": -88.37890625, "loss": 0.259783536195755, "memory(GiB)": 45.96, "nll_loss": 0.2198258489370346, "rewards/accuracies": 1.0, "rewards/chosen": 0.4317323565483093, "rewards/margins": 7.1905717849731445, "rewards/rejected": -6.758839130401611, "step": 561, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.0624815099698244, "grad_norm": 1.078278660774231, "learning_rate": 0.0001534556359168854, "logits/chosen": -1.3316317796707153, "logits/rejected": -1.3745862245559692, "logps/chosen": -2.4428582191467285, "logps/rejected": -138.22593688964844, "loss": 0.08312231302261353, "memory(GiB)": 45.96, "nll_loss": 0.06975560635328293, "rewards/accuracies": 1.0, "rewards/chosen": 0.3613326847553253, "rewards/margins": 11.056950569152832, "rewards/rejected": -10.695618629455566, "step": 562, "train_speed(iter/s)": 0.005597 }, { "epoch": 1.064374889059819, "grad_norm": 2.635319948196411, "learning_rate": 0.00015327898597681516, "logits/chosen": -1.3323938846588135, "logits/rejected": -1.3507311344146729, "logps/chosen": -3.511697769165039, "logps/rejected": -95.56913757324219, "loss": 0.19266293942928314, "memory(GiB)": 45.96, "nll_loss": 0.17116276919841766, "rewards/accuracies": 1.0, "rewards/chosen": 0.4276401996612549, "rewards/margins": 8.056602478027344, "rewards/rejected": -7.628961563110352, "step": 563, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0662682681498137, "grad_norm": 1.3077629804611206, "learning_rate": 0.00015310210357051863, "logits/chosen": -1.2944490909576416, "logits/rejected": -1.3115651607513428, "logps/chosen": -3.241935968399048, "logps/rejected": -98.64260864257812, "loss": 0.251848042011261, "memory(GiB)": 45.96, "nll_loss": 0.20104049146175385, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5110239386558533, "rewards/margins": 8.376340866088867, "rewards/rejected": -7.865316390991211, "step": 564, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0681616472398083, "grad_norm": 0.9010938405990601, "learning_rate": 0.000152924989469767, "logits/chosen": -1.2769780158996582, "logits/rejected": -1.2927641868591309, "logps/chosen": -6.640301704406738, "logps/rejected": -88.61182403564453, "loss": 0.25189408659935, "memory(GiB)": 45.96, "nll_loss": 0.24645669758319855, "rewards/accuracies": 1.0, "rewards/chosen": 1.0925995111465454, "rewards/margins": 8.120665550231934, "rewards/rejected": -7.0280656814575195, "step": 565, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.070055026329803, "grad_norm": 19.70159149169922, "learning_rate": 0.00015274764444734234, "logits/chosen": -1.244207501411438, "logits/rejected": -1.259688138961792, "logps/chosen": -6.578207969665527, "logps/rejected": -106.03319549560547, "loss": 0.3873708248138428, "memory(GiB)": 45.96, "nll_loss": 0.35074567794799805, "rewards/accuracies": 1.0, "rewards/chosen": 0.40361860394477844, "rewards/margins": 9.156301498413086, "rewards/rejected": -8.752683639526367, "step": 566, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0719484054197976, "grad_norm": 3.134403944015503, "learning_rate": 0.0001525700692770344, "logits/chosen": -1.2441952228546143, "logits/rejected": -1.2602890729904175, "logps/chosen": -3.320517063140869, "logps/rejected": -106.19863891601562, "loss": 0.15019084513187408, "memory(GiB)": 45.96, "nll_loss": 0.12886883318424225, "rewards/accuracies": 1.0, "rewards/chosen": 0.32790637016296387, "rewards/margins": 9.072044372558594, "rewards/rejected": -8.744136810302734, "step": 567, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0738417845097923, "grad_norm": 0.787064790725708, "learning_rate": 0.00015239226473363687, "logits/chosen": -1.2932322025299072, "logits/rejected": -1.3016360998153687, "logps/chosen": -4.699370861053467, "logps/rejected": -105.18386840820312, "loss": 0.2008758783340454, "memory(GiB)": 45.96, "nll_loss": 0.16714823246002197, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4735586643218994, "rewards/margins": 9.312126159667969, "rewards/rejected": -8.838567733764648, "step": 568, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.075735163599787, "grad_norm": 1.0752480030059814, "learning_rate": 0.0001522142315929445, "logits/chosen": -1.336026668548584, "logits/rejected": -1.350561499595642, "logps/chosen": -6.8737311363220215, "logps/rejected": -91.298583984375, "loss": 0.33137187361717224, "memory(GiB)": 45.96, "nll_loss": 0.25478339195251465, "rewards/accuracies": 1.0, "rewards/chosen": 0.5015548467636108, "rewards/margins": 7.741572856903076, "rewards/rejected": -7.240017890930176, "step": 569, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0776285426897816, "grad_norm": 1.0518560409545898, "learning_rate": 0.0001520359706317493, "logits/chosen": -1.3285919427871704, "logits/rejected": -1.3354926109313965, "logps/chosen": -5.613513469696045, "logps/rejected": -103.08087158203125, "loss": 0.25189992785453796, "memory(GiB)": 45.96, "nll_loss": 0.2361432909965515, "rewards/accuracies": 1.0, "rewards/chosen": 0.38287657499313354, "rewards/margins": 9.170334815979004, "rewards/rejected": -8.787456512451172, "step": 570, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0795219217797762, "grad_norm": 2.020385980606079, "learning_rate": 0.0001518574826278373, "logits/chosen": -1.347183346748352, "logits/rejected": -1.3727235794067383, "logps/chosen": -3.2963013648986816, "logps/rejected": -125.87289428710938, "loss": 0.19588108360767365, "memory(GiB)": 45.96, "nll_loss": 0.16800087690353394, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6195613741874695, "rewards/margins": 10.826133728027344, "rewards/rejected": -10.206572532653809, "step": 571, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0814153008697711, "grad_norm": 0.9883559942245483, "learning_rate": 0.00015167876835998524, "logits/chosen": -1.3224377632141113, "logits/rejected": -1.353177785873413, "logps/chosen": -3.696470022201538, "logps/rejected": -137.7168426513672, "loss": 0.16710160672664642, "memory(GiB)": 45.96, "nll_loss": 0.14809738099575043, "rewards/accuracies": 1.0, "rewards/chosen": 0.6114938855171204, "rewards/margins": 11.972872734069824, "rewards/rejected": -11.361379623413086, "step": 572, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0833086799597658, "grad_norm": 0.9463618993759155, "learning_rate": 0.00015149982860795702, "logits/chosen": -1.3223044872283936, "logits/rejected": -1.3528592586517334, "logps/chosen": -2.193894386291504, "logps/rejected": -142.0426483154297, "loss": 0.09805414825677872, "memory(GiB)": 45.96, "nll_loss": 0.08482219278812408, "rewards/accuracies": 1.0, "rewards/chosen": 0.4664475917816162, "rewards/margins": 12.09679889678955, "rewards/rejected": -11.630352020263672, "step": 573, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0852020590497604, "grad_norm": 1.1137388944625854, "learning_rate": 0.00015132066415250042, "logits/chosen": -1.318729043006897, "logits/rejected": -1.3286855220794678, "logps/chosen": -6.172143459320068, "logps/rejected": -121.0008544921875, "loss": 0.2336159348487854, "memory(GiB)": 45.96, "nll_loss": 0.19225838780403137, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5859619379043579, "rewards/margins": 10.895280838012695, "rewards/rejected": -10.309318542480469, "step": 574, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.087095438139755, "grad_norm": 2.3039913177490234, "learning_rate": 0.00015114127577534357, "logits/chosen": -1.2611424922943115, "logits/rejected": -1.2765283584594727, "logps/chosen": -6.725334644317627, "logps/rejected": -115.01373291015625, "loss": 0.2680964767932892, "memory(GiB)": 45.96, "nll_loss": 0.21015194058418274, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36756518483161926, "rewards/margins": 10.524402618408203, "rewards/rejected": -10.156837463378906, "step": 575, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0889888172297497, "grad_norm": 0.801198422908783, "learning_rate": 0.00015096166425919175, "logits/chosen": -1.2074100971221924, "logits/rejected": -1.2279514074325562, "logps/chosen": -5.492415904998779, "logps/rejected": -110.50377655029297, "loss": 0.2561566233634949, "memory(GiB)": 45.96, "nll_loss": 0.23524636030197144, "rewards/accuracies": 1.0, "rewards/chosen": 0.545266330242157, "rewards/margins": 9.796957015991211, "rewards/rejected": -9.251690864562988, "step": 576, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.0908821963197444, "grad_norm": 0.8023693561553955, "learning_rate": 0.00015078183038772368, "logits/chosen": -1.2201210260391235, "logits/rejected": -1.239213466644287, "logps/chosen": -3.4091765880584717, "logps/rejected": -110.39087677001953, "loss": 0.15457846224308014, "memory(GiB)": 45.96, "nll_loss": 0.13152047991752625, "rewards/accuracies": 1.0, "rewards/chosen": 0.5018508434295654, "rewards/margins": 9.737335205078125, "rewards/rejected": -9.23548412322998, "step": 577, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.092775575409739, "grad_norm": 10.036036491394043, "learning_rate": 0.0001506017749455884, "logits/chosen": -1.2568118572235107, "logits/rejected": -1.274863839149475, "logps/chosen": -4.811936378479004, "logps/rejected": -107.5451889038086, "loss": 0.3094099164009094, "memory(GiB)": 45.96, "nll_loss": 0.2990308701992035, "rewards/accuracies": 1.0, "rewards/chosen": 0.6428719162940979, "rewards/margins": 9.620796203613281, "rewards/rejected": -8.977926254272461, "step": 578, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0946689544997337, "grad_norm": 2.8122897148132324, "learning_rate": 0.00015042149871840157, "logits/chosen": -1.2904918193817139, "logits/rejected": -1.3019131422042847, "logps/chosen": -4.516243934631348, "logps/rejected": -104.33990478515625, "loss": 0.2950717508792877, "memory(GiB)": 45.96, "nll_loss": 0.21373407542705536, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6212645769119263, "rewards/margins": 9.591170310974121, "rewards/rejected": -8.969905853271484, "step": 579, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.0965623335897283, "grad_norm": 1.7572249174118042, "learning_rate": 0.00015024100249274227, "logits/chosen": -1.2378251552581787, "logits/rejected": -1.2591315507888794, "logps/chosen": -6.137165069580078, "logps/rejected": -146.08526611328125, "loss": 0.2149486243724823, "memory(GiB)": 45.96, "nll_loss": 0.17733576893806458, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6879799365997314, "rewards/margins": 13.418159484863281, "rewards/rejected": -12.730178833007812, "step": 580, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.0984557126797232, "grad_norm": 1.0533857345581055, "learning_rate": 0.00015006028705614942, "logits/chosen": -1.251503348350525, "logits/rejected": -1.2591009140014648, "logps/chosen": -4.528883457183838, "logps/rejected": -114.74151611328125, "loss": 0.21506644785404205, "memory(GiB)": 45.96, "nll_loss": 0.19855085015296936, "rewards/accuracies": 1.0, "rewards/chosen": 0.4429333209991455, "rewards/margins": 10.232474327087402, "rewards/rejected": -9.789541244506836, "step": 581, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.1003490917697178, "grad_norm": 1.5791045427322388, "learning_rate": 0.00014987935319711842, "logits/chosen": -1.226974606513977, "logits/rejected": -1.257514238357544, "logps/chosen": -3.320363759994507, "logps/rejected": -167.9702606201172, "loss": 0.15922771394252777, "memory(GiB)": 45.96, "nll_loss": 0.15475928783416748, "rewards/accuracies": 1.0, "rewards/chosen": 0.4842221140861511, "rewards/margins": 14.752422332763672, "rewards/rejected": -14.268199920654297, "step": 582, "train_speed(iter/s)": 0.005598 }, { "epoch": 1.1022424708597125, "grad_norm": 1.8434008359909058, "learning_rate": 0.00014969820170509775, "logits/chosen": -1.2599531412124634, "logits/rejected": -1.2809091806411743, "logps/chosen": -5.004319667816162, "logps/rejected": -122.86878967285156, "loss": 0.2221767008304596, "memory(GiB)": 45.96, "nll_loss": 0.14954842627048492, "rewards/accuracies": 0.9375, "rewards/chosen": 0.8574638962745667, "rewards/margins": 11.233372688293457, "rewards/rejected": -10.375908851623535, "step": 583, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1041358499497071, "grad_norm": 0.8550779819488525, "learning_rate": 0.00014951683337048537, "logits/chosen": -1.2449126243591309, "logits/rejected": -1.2596272230148315, "logps/chosen": -1.8333827257156372, "logps/rejected": -109.7436294555664, "loss": 0.14426660537719727, "memory(GiB)": 45.96, "nll_loss": 0.12021489441394806, "rewards/accuracies": 1.0, "rewards/chosen": 0.5166503190994263, "rewards/margins": 9.900659561157227, "rewards/rejected": -9.384010314941406, "step": 584, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1060292290397018, "grad_norm": 0.7879387140274048, "learning_rate": 0.0001493352489846254, "logits/chosen": -1.24300217628479, "logits/rejected": -1.260710597038269, "logps/chosen": -4.432990074157715, "logps/rejected": -107.72745513916016, "loss": 0.18139131367206573, "memory(GiB)": 45.96, "nll_loss": 0.1617611199617386, "rewards/accuracies": 1.0, "rewards/chosen": 0.4947144389152527, "rewards/margins": 9.030978202819824, "rewards/rejected": -8.536263465881348, "step": 585, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1079226081296965, "grad_norm": 0.7365395426750183, "learning_rate": 0.0001491534493398046, "logits/chosen": -1.2553640604019165, "logits/rejected": -1.2758809328079224, "logps/chosen": -3.403491497039795, "logps/rejected": -105.79845428466797, "loss": 0.16256746649742126, "memory(GiB)": 45.96, "nll_loss": 0.15543223917484283, "rewards/accuracies": 1.0, "rewards/chosen": 0.6307507753372192, "rewards/margins": 9.163625717163086, "rewards/rejected": -8.53287410736084, "step": 586, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.109815987219691, "grad_norm": 12.859845161437988, "learning_rate": 0.0001489714352292491, "logits/chosen": -1.254917860031128, "logits/rejected": -1.2662553787231445, "logps/chosen": -5.313860893249512, "logps/rejected": -96.21810913085938, "loss": 0.4549526572227478, "memory(GiB)": 45.96, "nll_loss": 0.3455367684364319, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3554072082042694, "rewards/margins": 8.50544548034668, "rewards/rejected": -8.150038719177246, "step": 587, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1117093663096858, "grad_norm": 1.2317994832992554, "learning_rate": 0.0001487892074471205, "logits/chosen": -1.2423638105392456, "logits/rejected": -1.2684507369995117, "logps/chosen": -3.429466485977173, "logps/rejected": -92.40089416503906, "loss": 0.22674602270126343, "memory(GiB)": 45.96, "nll_loss": 0.1670750081539154, "rewards/accuracies": 1.0, "rewards/chosen": 0.5393322706222534, "rewards/margins": 7.976922512054443, "rewards/rejected": -7.4375901222229, "step": 588, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1136027453996804, "grad_norm": 10.093466758728027, "learning_rate": 0.00014860676678851294, "logits/chosen": -1.2574409246444702, "logits/rejected": -1.273606300354004, "logps/chosen": -5.608072757720947, "logps/rejected": -99.13803100585938, "loss": 0.39078086614608765, "memory(GiB)": 45.96, "nll_loss": 0.3612406253814697, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6365304589271545, "rewards/margins": 8.688333511352539, "rewards/rejected": -8.051802635192871, "step": 589, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1154961244896753, "grad_norm": 9.636011123657227, "learning_rate": 0.00014842411404944927, "logits/chosen": -1.286845088005066, "logits/rejected": -1.3059313297271729, "logps/chosen": -7.7975311279296875, "logps/rejected": -106.14432525634766, "loss": 0.9191125631332397, "memory(GiB)": 45.96, "nll_loss": 0.8574790358543396, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21184280514717102, "rewards/margins": 8.63295841217041, "rewards/rejected": -8.421114921569824, "step": 590, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.11738950357967, "grad_norm": 2.9925789833068848, "learning_rate": 0.00014824125002687772, "logits/chosen": -1.3378455638885498, "logits/rejected": -1.37661874294281, "logps/chosen": -4.0678205490112305, "logps/rejected": -126.1729965209961, "loss": 0.5300029516220093, "memory(GiB)": 45.96, "nll_loss": 0.3785613775253296, "rewards/accuracies": 0.96875, "rewards/chosen": 0.33407914638519287, "rewards/margins": 10.628999710083008, "rewards/rejected": -10.294920921325684, "step": 591, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1192828826696646, "grad_norm": 2.0460188388824463, "learning_rate": 0.00014805817551866838, "logits/chosen": -1.315762996673584, "logits/rejected": -1.3334267139434814, "logps/chosen": -6.571153163909912, "logps/rejected": -87.01092529296875, "loss": 0.2811226546764374, "memory(GiB)": 45.96, "nll_loss": 0.23497222363948822, "rewards/accuracies": 1.0, "rewards/chosen": 0.3480154275894165, "rewards/margins": 7.635659217834473, "rewards/rejected": -7.287643909454346, "step": 592, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1211762617596592, "grad_norm": 0.971920907497406, "learning_rate": 0.00014787489132360974, "logits/chosen": -1.3045918941497803, "logits/rejected": -1.3217551708221436, "logps/chosen": -6.293361186981201, "logps/rejected": -105.55299377441406, "loss": 0.23011934757232666, "memory(GiB)": 45.96, "nll_loss": 0.1706216186285019, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3878113925457001, "rewards/margins": 8.775679588317871, "rewards/rejected": -8.38786792755127, "step": 593, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1230696408496539, "grad_norm": 5.00411319732666, "learning_rate": 0.00014769139824140516, "logits/chosen": -1.3342088460922241, "logits/rejected": -1.3560993671417236, "logps/chosen": -3.8638527393341064, "logps/rejected": -90.72246551513672, "loss": 0.309597909450531, "memory(GiB)": 45.96, "nll_loss": 0.248661071062088, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3779904246330261, "rewards/margins": 7.73700475692749, "rewards/rejected": -7.35901403427124, "step": 594, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1249630199396485, "grad_norm": 1.8497488498687744, "learning_rate": 0.0001475076970726694, "logits/chosen": -1.3347439765930176, "logits/rejected": -1.3567668199539185, "logps/chosen": -4.323431015014648, "logps/rejected": -99.05289459228516, "loss": 0.31018275022506714, "memory(GiB)": 45.96, "nll_loss": 0.2699596583843231, "rewards/accuracies": 1.0, "rewards/chosen": 0.4811839461326599, "rewards/margins": 8.345390319824219, "rewards/rejected": -7.864206314086914, "step": 595, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1268563990296432, "grad_norm": 2.490046501159668, "learning_rate": 0.00014732378861892525, "logits/chosen": -1.3427214622497559, "logits/rejected": -1.3540985584259033, "logps/chosen": -4.136582851409912, "logps/rejected": -108.85411071777344, "loss": 0.2530824840068817, "memory(GiB)": 45.96, "nll_loss": 0.2168596386909485, "rewards/accuracies": 0.96875, "rewards/chosen": 0.47699812054634094, "rewards/margins": 9.652837753295898, "rewards/rejected": -9.175840377807617, "step": 596, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1287497781196378, "grad_norm": 0.9580318927764893, "learning_rate": 0.0001471396736825998, "logits/chosen": -1.351408839225769, "logits/rejected": -1.365317940711975, "logps/chosen": -4.171363353729248, "logps/rejected": -128.09634399414062, "loss": 0.1587587147951126, "memory(GiB)": 45.96, "nll_loss": 0.14957861602306366, "rewards/accuracies": 1.0, "rewards/chosen": 0.38554343581199646, "rewards/margins": 10.911967277526855, "rewards/rejected": -10.526424407958984, "step": 597, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.1306431572096325, "grad_norm": 0.7954278588294983, "learning_rate": 0.00014695535306702109, "logits/chosen": -1.353016972541809, "logits/rejected": -1.3709743022918701, "logps/chosen": -4.011623859405518, "logps/rejected": -109.84175109863281, "loss": 0.1796695441007614, "memory(GiB)": 45.96, "nll_loss": 0.16843344271183014, "rewards/accuracies": 1.0, "rewards/chosen": 0.5847711563110352, "rewards/margins": 9.300955772399902, "rewards/rejected": -8.716184616088867, "step": 598, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.1325365362996274, "grad_norm": 1.2315398454666138, "learning_rate": 0.00014677082757641463, "logits/chosen": -1.3229308128356934, "logits/rejected": -1.3372865915298462, "logps/chosen": -4.83215856552124, "logps/rejected": -100.4617691040039, "loss": 0.25171154737472534, "memory(GiB)": 45.96, "nll_loss": 0.17117245495319366, "rewards/accuracies": 0.96875, "rewards/chosen": 0.46751469373703003, "rewards/margins": 8.871299743652344, "rewards/rejected": -8.403785705566406, "step": 599, "train_speed(iter/s)": 0.0056 }, { "epoch": 1.134429915389622, "grad_norm": 2.3959968090057373, "learning_rate": 0.00014658609801589982, "logits/chosen": -1.3001402616500854, "logits/rejected": -1.3274784088134766, "logps/chosen": -3.039743185043335, "logps/rejected": -124.06808471679688, "loss": 0.19401244819164276, "memory(GiB)": 45.96, "nll_loss": 0.13560381531715393, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4775664508342743, "rewards/margins": 10.630762100219727, "rewards/rejected": -10.153194427490234, "step": 600, "train_speed(iter/s)": 0.005599 }, { "epoch": 1.134429915389622, "eval_logits/chosen": -1.2894256114959717, "eval_logits/rejected": -1.3079851865768433, "eval_logps/chosen": -5.3323974609375, "eval_logps/rejected": -111.4054946899414, "eval_loss": 0.301040917634964, "eval_nll_loss": 0.2509084641933441, "eval_rewards/accuracies": 0.970588207244873, "eval_rewards/chosen": 0.43204373121261597, "eval_rewards/margins": 9.736958503723145, "eval_rewards/rejected": -9.304915428161621, "eval_runtime": 382.4328, "eval_samples_per_second": 0.445, "eval_steps_per_second": 0.445, "step": 600 }, { "epoch": 1.1363232944796167, "grad_norm": 2.15849232673645, "learning_rate": 0.0001464011651914864, "logits/chosen": -1.3066818714141846, "logits/rejected": -1.3111045360565186, "logps/chosen": -5.026226043701172, "logps/rejected": -83.13053894042969, "loss": 0.32173430919647217, "memory(GiB)": 45.96, "nll_loss": 0.27388620376586914, "rewards/accuracies": 1.0, "rewards/chosen": 0.6003259420394897, "rewards/margins": 7.298637390136719, "rewards/rejected": -6.698311805725098, "step": 601, "train_speed(iter/s)": 0.005579 }, { "epoch": 1.1382166735696113, "grad_norm": 1.3094327449798584, "learning_rate": 0.0001462160299100711, "logits/chosen": -1.253884196281433, "logits/rejected": -1.275226354598999, "logps/chosen": -3.2981009483337402, "logps/rejected": -118.21580505371094, "loss": 0.2262260913848877, "memory(GiB)": 45.96, "nll_loss": 0.17337152361869812, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5595407485961914, "rewards/margins": 10.254971504211426, "rewards/rejected": -9.695430755615234, "step": 602, "train_speed(iter/s)": 0.005579 }, { "epoch": 1.140110052659606, "grad_norm": 1.0693010091781616, "learning_rate": 0.00014603069297943383, "logits/chosen": -1.1947200298309326, "logits/rejected": -1.2207998037338257, "logps/chosen": -5.210245609283447, "logps/rejected": -121.29008483886719, "loss": 0.26592108607292175, "memory(GiB)": 45.96, "nll_loss": 0.2492990344762802, "rewards/accuracies": 1.0, "rewards/chosen": 0.5870697498321533, "rewards/margins": 10.30087661743164, "rewards/rejected": -9.713807106018066, "step": 603, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1420034317496006, "grad_norm": 0.8486844301223755, "learning_rate": 0.00014584515520823453, "logits/chosen": -1.2308590412139893, "logits/rejected": -1.2505226135253906, "logps/chosen": -2.348849058151245, "logps/rejected": -127.62843322753906, "loss": 0.21631911396980286, "memory(GiB)": 45.96, "nll_loss": 0.11859283596277237, "rewards/accuracies": 0.90625, "rewards/chosen": 0.5035842061042786, "rewards/margins": 11.000757217407227, "rewards/rejected": -10.497172355651855, "step": 604, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1438968108395953, "grad_norm": 4.024954319000244, "learning_rate": 0.00014565941740600933, "logits/chosen": -1.2393971681594849, "logits/rejected": -1.2759772539138794, "logps/chosen": -4.519779205322266, "logps/rejected": -139.6679229736328, "loss": 0.34041982889175415, "memory(GiB)": 45.96, "nll_loss": 0.2741459906101227, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2945583462715149, "rewards/margins": 11.51474380493164, "rewards/rejected": -11.220185279846191, "step": 605, "train_speed(iter/s)": 0.005579 }, { "epoch": 1.14579018992959, "grad_norm": 0.4649512469768524, "learning_rate": 0.00014547348038316713, "logits/chosen": -1.2851876020431519, "logits/rejected": -1.311815619468689, "logps/chosen": -3.730963945388794, "logps/rejected": -136.5504913330078, "loss": 0.11688469350337982, "memory(GiB)": 45.96, "nll_loss": 0.11342987418174744, "rewards/accuracies": 1.0, "rewards/chosen": 0.5621517896652222, "rewards/margins": 12.048606872558594, "rewards/rejected": -11.486455917358398, "step": 606, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1476835690195846, "grad_norm": 0.6240984201431274, "learning_rate": 0.00014528734495098612, "logits/chosen": -1.2574249505996704, "logits/rejected": -1.289762020111084, "logps/chosen": -2.7826473712921143, "logps/rejected": -154.68235778808594, "loss": 0.13110938668251038, "memory(GiB)": 45.96, "nll_loss": 0.12355895340442657, "rewards/accuracies": 1.0, "rewards/chosen": 0.5258219838142395, "rewards/margins": 13.26880931854248, "rewards/rejected": -12.742988586425781, "step": 607, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1495769481095792, "grad_norm": 9.865966796875, "learning_rate": 0.00014510101192161018, "logits/chosen": -1.3318796157836914, "logits/rejected": -1.3524816036224365, "logps/chosen": -1.951794147491455, "logps/rejected": -139.08607482910156, "loss": 0.15863743424415588, "memory(GiB)": 45.96, "nll_loss": 0.10350289195775986, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4276507496833801, "rewards/margins": 12.455421447753906, "rewards/rejected": -12.02777099609375, "step": 608, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1514703271995739, "grad_norm": 0.9074051976203918, "learning_rate": 0.00014491448210804533, "logits/chosen": -1.2468656301498413, "logits/rejected": -1.274411916732788, "logps/chosen": -2.7470922470092773, "logps/rejected": -136.74620056152344, "loss": 0.20206348598003387, "memory(GiB)": 45.96, "nll_loss": 0.1475079357624054, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5379533171653748, "rewards/margins": 12.279942512512207, "rewards/rejected": -11.741988182067871, "step": 609, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1533637062895687, "grad_norm": 28.569091796875, "learning_rate": 0.00014472775632415615, "logits/chosen": -1.286940097808838, "logits/rejected": -1.3069936037063599, "logps/chosen": -3.2979979515075684, "logps/rejected": -138.9271240234375, "loss": 0.2696467936038971, "memory(GiB)": 45.96, "nll_loss": 0.25612494349479675, "rewards/accuracies": 1.0, "rewards/chosen": 0.4200615882873535, "rewards/margins": 12.597105026245117, "rewards/rejected": -12.177042007446289, "step": 610, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1552570853795634, "grad_norm": 0.8472843766212463, "learning_rate": 0.00014454083538466232, "logits/chosen": -1.250975251197815, "logits/rejected": -1.2794559001922607, "logps/chosen": -3.220829486846924, "logps/rejected": -124.9334945678711, "loss": 0.15973174571990967, "memory(GiB)": 45.96, "nll_loss": 0.12067501991987228, "rewards/accuracies": 1.0, "rewards/chosen": 0.4378184378147125, "rewards/margins": 10.894189834594727, "rewards/rejected": -10.456371307373047, "step": 611, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.157150464469558, "grad_norm": 1.6857807636260986, "learning_rate": 0.00014435372010513509, "logits/chosen": -1.2885514497756958, "logits/rejected": -1.3083856105804443, "logps/chosen": -4.843531608581543, "logps/rejected": -142.25416564941406, "loss": 0.2124728113412857, "memory(GiB)": 45.96, "nll_loss": 0.18952128291130066, "rewards/accuracies": 1.0, "rewards/chosen": 0.8398178815841675, "rewards/margins": 13.268404960632324, "rewards/rejected": -12.428586959838867, "step": 612, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1590438435595527, "grad_norm": 2.1635098457336426, "learning_rate": 0.00014416641130199348, "logits/chosen": -1.2934908866882324, "logits/rejected": -1.3176602125167847, "logps/chosen": -2.5755224227905273, "logps/rejected": -130.80252075195312, "loss": 0.14858324825763702, "memory(GiB)": 45.96, "nll_loss": 0.0918111577630043, "rewards/accuracies": 0.9375, "rewards/chosen": 0.46725374460220337, "rewards/margins": 11.65639591217041, "rewards/rejected": -11.189140319824219, "step": 613, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1609372226495474, "grad_norm": 0.7229548096656799, "learning_rate": 0.00014397890979250108, "logits/chosen": -1.3669577836990356, "logits/rejected": -1.3880679607391357, "logps/chosen": -2.74421763420105, "logps/rejected": -147.63467407226562, "loss": 0.14499099552631378, "memory(GiB)": 45.96, "nll_loss": 0.13768450915813446, "rewards/accuracies": 1.0, "rewards/chosen": 0.5143299698829651, "rewards/margins": 13.366703033447266, "rewards/rejected": -12.852371215820312, "step": 614, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.162830601739542, "grad_norm": 2.729567766189575, "learning_rate": 0.00014379121639476215, "logits/chosen": -1.4184008836746216, "logits/rejected": -1.4347777366638184, "logps/chosen": -4.132072448730469, "logps/rejected": -138.54647827148438, "loss": 0.2683996260166168, "memory(GiB)": 45.96, "nll_loss": 0.17208775877952576, "rewards/accuracies": 0.96875, "rewards/chosen": 0.29247456789016724, "rewards/margins": 12.408050537109375, "rewards/rejected": -12.11557674407959, "step": 615, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1647239808295367, "grad_norm": 2.1155970096588135, "learning_rate": 0.0001436033319277183, "logits/chosen": -1.3942526578903198, "logits/rejected": -1.4128817319869995, "logps/chosen": -4.156976699829102, "logps/rejected": -128.30084228515625, "loss": 0.2736564576625824, "memory(GiB)": 45.96, "nll_loss": 0.19724150002002716, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45423924922943115, "rewards/margins": 11.601901054382324, "rewards/rejected": -11.147662162780762, "step": 616, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1666173599195313, "grad_norm": 0.8983713984489441, "learning_rate": 0.0001434152572111447, "logits/chosen": -1.3567776679992676, "logits/rejected": -1.3857258558273315, "logps/chosen": -4.764517784118652, "logps/rejected": -148.31007385253906, "loss": 0.23424586653709412, "memory(GiB)": 45.96, "nll_loss": 0.17179971933364868, "rewards/accuracies": 0.9375, "rewards/chosen": 0.58805912733078, "rewards/margins": 13.08167839050293, "rewards/rejected": -12.493619918823242, "step": 617, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.168510739009526, "grad_norm": 29.474414825439453, "learning_rate": 0.00014322699306564668, "logits/chosen": -1.4533697366714478, "logits/rejected": -1.4785865545272827, "logps/chosen": -4.931976795196533, "logps/rejected": -175.3928985595703, "loss": 0.3418967127799988, "memory(GiB)": 45.96, "nll_loss": 0.19013942778110504, "rewards/accuracies": 0.9375, "rewards/chosen": 0.34835898876190186, "rewards/margins": 15.95287036895752, "rewards/rejected": -15.604512214660645, "step": 618, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1704041180995208, "grad_norm": 1.0662310123443604, "learning_rate": 0.00014303854031265614, "logits/chosen": -1.3845001459121704, "logits/rejected": -1.4054373502731323, "logps/chosen": -7.603452205657959, "logps/rejected": -147.59339904785156, "loss": 0.279501348733902, "memory(GiB)": 45.96, "nll_loss": 0.2728596031665802, "rewards/accuracies": 1.0, "rewards/chosen": 0.6738547086715698, "rewards/margins": 13.407675743103027, "rewards/rejected": -12.733820915222168, "step": 619, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1722974971895155, "grad_norm": 0.6584770083427429, "learning_rate": 0.0001428498997744278, "logits/chosen": -1.3540077209472656, "logits/rejected": -1.3758193254470825, "logps/chosen": -5.209235668182373, "logps/rejected": -154.4058074951172, "loss": 0.19960321485996246, "memory(GiB)": 45.96, "nll_loss": 0.1905829906463623, "rewards/accuracies": 1.0, "rewards/chosen": 0.5462955832481384, "rewards/margins": 13.737914085388184, "rewards/rejected": -13.191617965698242, "step": 620, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1741908762795101, "grad_norm": 3.4600303173065186, "learning_rate": 0.0001426610722740358, "logits/chosen": -1.3978145122528076, "logits/rejected": -1.417238712310791, "logps/chosen": -4.0614776611328125, "logps/rejected": -153.81399536132812, "loss": 0.22619248926639557, "memory(GiB)": 45.96, "nll_loss": 0.18299546837806702, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3758312165737152, "rewards/margins": 14.089869499206543, "rewards/rejected": -13.714038848876953, "step": 621, "train_speed(iter/s)": 0.00558 }, { "epoch": 1.1760842553695048, "grad_norm": 1.2220512628555298, "learning_rate": 0.00014247205863536996, "logits/chosen": -1.387900948524475, "logits/rejected": -1.399329662322998, "logps/chosen": -3.232072114944458, "logps/rejected": -139.4011688232422, "loss": 0.2432737946510315, "memory(GiB)": 45.96, "nll_loss": 0.19621756672859192, "rewards/accuracies": 0.96875, "rewards/chosen": 0.48939788341522217, "rewards/margins": 13.003323554992676, "rewards/rejected": -12.51392650604248, "step": 622, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1779776344594994, "grad_norm": 14.152691841125488, "learning_rate": 0.00014228285968313236, "logits/chosen": -1.3739328384399414, "logits/rejected": -1.409564733505249, "logps/chosen": -1.8794363737106323, "logps/rejected": -161.13742065429688, "loss": 0.3040890693664551, "memory(GiB)": 45.96, "nll_loss": 0.2211679369211197, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3907140791416168, "rewards/margins": 14.480472564697266, "rewards/rejected": -14.089759826660156, "step": 623, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.179871013549494, "grad_norm": 1.134121060371399, "learning_rate": 0.0001420934762428335, "logits/chosen": -1.3690139055252075, "logits/rejected": -1.3873157501220703, "logps/chosen": -4.1531476974487305, "logps/rejected": -147.33445739746094, "loss": 0.18056610226631165, "memory(GiB)": 45.96, "nll_loss": 0.1357978731393814, "rewards/accuracies": 1.0, "rewards/chosen": 0.49936407804489136, "rewards/margins": 13.393208503723145, "rewards/rejected": -12.893844604492188, "step": 624, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1817643926394887, "grad_norm": 0.7700979113578796, "learning_rate": 0.000141903909140789, "logits/chosen": -1.3152154684066772, "logits/rejected": -1.3336371183395386, "logps/chosen": -2.753535032272339, "logps/rejected": -146.24029541015625, "loss": 0.14292775094509125, "memory(GiB)": 45.96, "nll_loss": 0.12083562463521957, "rewards/accuracies": 1.0, "rewards/chosen": 0.4257271885871887, "rewards/margins": 13.148740768432617, "rewards/rejected": -12.723015785217285, "step": 625, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1836577717294834, "grad_norm": 0.9010930061340332, "learning_rate": 0.00014171415920411566, "logits/chosen": -1.2387850284576416, "logits/rejected": -1.2547930479049683, "logps/chosen": -4.986386775970459, "logps/rejected": -110.98575592041016, "loss": 0.24002321064472198, "memory(GiB)": 45.96, "nll_loss": 0.20919182896614075, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5843397378921509, "rewards/margins": 9.915672302246094, "rewards/rejected": -9.331332206726074, "step": 626, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.185551150819478, "grad_norm": 1.0032802820205688, "learning_rate": 0.00014152422726072816, "logits/chosen": -1.2714622020721436, "logits/rejected": -1.2804292440414429, "logps/chosen": -6.319892406463623, "logps/rejected": -106.84049987792969, "loss": 0.27855637669563293, "memory(GiB)": 45.96, "nll_loss": 0.23598721623420715, "rewards/accuracies": 0.96875, "rewards/chosen": 0.696945071220398, "rewards/margins": 9.756473541259766, "rewards/rejected": -9.059529304504395, "step": 627, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.187444529909473, "grad_norm": 0.8959448933601379, "learning_rate": 0.00014133411413933523, "logits/chosen": -1.3523356914520264, "logits/rejected": -1.382279634475708, "logps/chosen": -2.0693681240081787, "logps/rejected": -150.83078002929688, "loss": 0.12720414996147156, "memory(GiB)": 45.96, "nll_loss": 0.11241940408945084, "rewards/accuracies": 1.0, "rewards/chosen": 0.5900616645812988, "rewards/margins": 13.786452293395996, "rewards/rejected": -13.196392059326172, "step": 628, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1893379089994676, "grad_norm": 19.023563385009766, "learning_rate": 0.00014114382066943618, "logits/chosen": -1.2807756662368774, "logits/rejected": -1.3037108182907104, "logps/chosen": -6.60006046295166, "logps/rejected": -135.55589294433594, "loss": 0.3288038969039917, "memory(GiB)": 45.96, "nll_loss": 0.3017730116844177, "rewards/accuracies": 1.0, "rewards/chosen": 0.18927210569381714, "rewards/margins": 11.776759147644043, "rewards/rejected": -11.58748722076416, "step": 629, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1912312880894622, "grad_norm": 1.1239473819732666, "learning_rate": 0.0001409533476813171, "logits/chosen": -1.3297996520996094, "logits/rejected": -1.3480398654937744, "logps/chosen": -5.556182861328125, "logps/rejected": -143.35040283203125, "loss": 0.23849260807037354, "memory(GiB)": 45.96, "nll_loss": 0.19322925806045532, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5474792718887329, "rewards/margins": 13.075397491455078, "rewards/rejected": -12.527918815612793, "step": 630, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.1931246671794569, "grad_norm": 0.8637579679489136, "learning_rate": 0.00014076269600604748, "logits/chosen": -1.2814322710037231, "logits/rejected": -1.3097827434539795, "logps/chosen": -2.7755789756774902, "logps/rejected": -165.87844848632812, "loss": 0.18964631855487823, "memory(GiB)": 45.96, "nll_loss": 0.16508126258850098, "rewards/accuracies": 1.0, "rewards/chosen": 0.6472874879837036, "rewards/margins": 14.968192100524902, "rewards/rejected": -14.320903778076172, "step": 631, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.1950180462694515, "grad_norm": 35.91895294189453, "learning_rate": 0.0001405718664754764, "logits/chosen": -1.2617077827453613, "logits/rejected": -1.291745662689209, "logps/chosen": -5.865665435791016, "logps/rejected": -139.880859375, "loss": 0.2276858538389206, "memory(GiB)": 45.96, "nll_loss": 0.19169428944587708, "rewards/accuracies": 1.0, "rewards/chosen": 0.31476259231567383, "rewards/margins": 12.022266387939453, "rewards/rejected": -11.707503318786621, "step": 632, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.1969114253594462, "grad_norm": 3.695615291595459, "learning_rate": 0.0001403808599222289, "logits/chosen": -1.2897461652755737, "logits/rejected": -1.3059349060058594, "logps/chosen": -5.9791765213012695, "logps/rejected": -137.66943359375, "loss": 0.22073869407176971, "memory(GiB)": 45.96, "nll_loss": 0.21946173906326294, "rewards/accuracies": 1.0, "rewards/chosen": 0.7112911343574524, "rewards/margins": 12.674735069274902, "rewards/rejected": -11.9634428024292, "step": 633, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.1988048044494408, "grad_norm": 1.971228837966919, "learning_rate": 0.00014018967717970254, "logits/chosen": -1.300931692123413, "logits/rejected": -1.3245811462402344, "logps/chosen": -4.173644542694092, "logps/rejected": -140.01991271972656, "loss": 0.24654018878936768, "memory(GiB)": 45.96, "nll_loss": 0.24364623427391052, "rewards/accuracies": 1.0, "rewards/chosen": 0.3556899130344391, "rewards/margins": 12.488964080810547, "rewards/rejected": -12.13327407836914, "step": 634, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.2006981835394355, "grad_norm": 1.9012233018875122, "learning_rate": 0.0001399983190820635, "logits/chosen": -1.302451729774475, "logits/rejected": -1.33121919631958, "logps/chosen": -2.868640422821045, "logps/rejected": -171.15383911132812, "loss": 0.18641558289527893, "memory(GiB)": 45.96, "nll_loss": 0.12313997745513916, "rewards/accuracies": 0.96875, "rewards/chosen": 0.48267343640327454, "rewards/margins": 15.43280029296875, "rewards/rejected": -14.950126647949219, "step": 635, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2025915626294301, "grad_norm": 2.096956729888916, "learning_rate": 0.0001398067864642431, "logits/chosen": -1.2636353969573975, "logits/rejected": -1.2825238704681396, "logps/chosen": -5.219088554382324, "logps/rejected": -133.4476318359375, "loss": 0.2759723663330078, "memory(GiB)": 45.96, "nll_loss": 0.2651902437210083, "rewards/accuracies": 1.0, "rewards/chosen": 0.6040548086166382, "rewards/margins": 12.336801528930664, "rewards/rejected": -11.732746124267578, "step": 636, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.204484941719425, "grad_norm": 0.7150812149047852, "learning_rate": 0.00013961508016193416, "logits/chosen": -1.230392336845398, "logits/rejected": -1.2499421834945679, "logps/chosen": -3.6723968982696533, "logps/rejected": -131.15306091308594, "loss": 0.20008526742458344, "memory(GiB)": 45.96, "nll_loss": 0.1471841037273407, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5768845677375793, "rewards/margins": 11.497173309326172, "rewards/rejected": -10.920289039611816, "step": 637, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2063783208094196, "grad_norm": 2.1268279552459717, "learning_rate": 0.00013942320101158732, "logits/chosen": -1.215066909790039, "logits/rejected": -1.2379679679870605, "logps/chosen": -3.8959691524505615, "logps/rejected": -145.33799743652344, "loss": 0.17703424394130707, "memory(GiB)": 45.96, "nll_loss": 0.17233292758464813, "rewards/accuracies": 1.0, "rewards/chosen": 0.2276427000761032, "rewards/margins": 12.982682228088379, "rewards/rejected": -12.75503921508789, "step": 638, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2082716998994143, "grad_norm": 1.3078527450561523, "learning_rate": 0.00013923114985040733, "logits/chosen": -1.2039527893066406, "logits/rejected": -1.2280265092849731, "logps/chosen": -3.3238728046417236, "logps/rejected": -127.83318328857422, "loss": 0.18549729883670807, "memory(GiB)": 45.96, "nll_loss": 0.13051187992095947, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5606825947761536, "rewards/margins": 11.299223899841309, "rewards/rejected": -10.738540649414062, "step": 639, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.210165078989409, "grad_norm": 1.6217330694198608, "learning_rate": 0.00013903892751634947, "logits/chosen": -1.2137424945831299, "logits/rejected": -1.21882164478302, "logps/chosen": -4.9762983322143555, "logps/rejected": -101.02047729492188, "loss": 0.27594050765037537, "memory(GiB)": 45.96, "nll_loss": 0.17926731705665588, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28640735149383545, "rewards/margins": 9.02888298034668, "rewards/rejected": -8.742474555969238, "step": 640, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2120584580794036, "grad_norm": 7.413793087005615, "learning_rate": 0.000138846534848116, "logits/chosen": -1.141318917274475, "logits/rejected": -1.1606910228729248, "logps/chosen": -5.451035499572754, "logps/rejected": -101.37506103515625, "loss": 0.31164583563804626, "memory(GiB)": 45.96, "nll_loss": 0.27093198895454407, "rewards/accuracies": 1.0, "rewards/chosen": 0.6124750971794128, "rewards/margins": 8.550021171569824, "rewards/rejected": -7.937546730041504, "step": 641, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2139518371693983, "grad_norm": 0.9872555732727051, "learning_rate": 0.00013865397268515215, "logits/chosen": -1.103111743927002, "logits/rejected": -1.1166858673095703, "logps/chosen": -5.7832255363464355, "logps/rejected": -87.32723236083984, "loss": 0.31326529383659363, "memory(GiB)": 45.96, "nll_loss": 0.23107054829597473, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4298703670501709, "rewards/margins": 7.514644622802734, "rewards/rejected": -7.084774494171143, "step": 642, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.215845216259393, "grad_norm": 4.625118732452393, "learning_rate": 0.0001384612418676429, "logits/chosen": -1.0852738618850708, "logits/rejected": -1.1021206378936768, "logps/chosen": -4.508449554443359, "logps/rejected": -104.58615112304688, "loss": 0.363935649394989, "memory(GiB)": 45.96, "nll_loss": 0.3228420615196228, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3612232804298401, "rewards/margins": 8.754815101623535, "rewards/rejected": -8.393592834472656, "step": 643, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2177385953493876, "grad_norm": 3.9486324787139893, "learning_rate": 0.000138268343236509, "logits/chosen": -1.0697134733200073, "logits/rejected": -1.0845346450805664, "logps/chosen": -5.405340194702148, "logps/rejected": -81.9689712524414, "loss": 0.24942205846309662, "memory(GiB)": 45.96, "nll_loss": 0.18678025901317596, "rewards/accuracies": 0.96875, "rewards/chosen": 0.7587069869041443, "rewards/margins": 6.866741180419922, "rewards/rejected": -6.108034133911133, "step": 644, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2196319744393822, "grad_norm": 1.8781797885894775, "learning_rate": 0.0001380752776334034, "logits/chosen": -1.063079833984375, "logits/rejected": -1.0907819271087646, "logps/chosen": -4.9822845458984375, "logps/rejected": -98.52869415283203, "loss": 0.48380017280578613, "memory(GiB)": 45.96, "nll_loss": 0.3868637979030609, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45160090923309326, "rewards/margins": 7.476816177368164, "rewards/rejected": -7.025215148925781, "step": 645, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.221525353529377, "grad_norm": 1.285443663597107, "learning_rate": 0.00013788204590070764, "logits/chosen": -1.0937983989715576, "logits/rejected": -1.097926139831543, "logps/chosen": -4.647152423858643, "logps/rejected": -70.02279663085938, "loss": 0.3429650664329529, "memory(GiB)": 45.96, "nll_loss": 0.2989942133426666, "rewards/accuracies": 1.0, "rewards/chosen": 0.5649895668029785, "rewards/margins": 6.161919116973877, "rewards/rejected": -5.596929550170898, "step": 646, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2234187326193717, "grad_norm": 10.317179679870605, "learning_rate": 0.000137688648881528, "logits/chosen": -1.1082532405853271, "logits/rejected": -1.1164014339447021, "logps/chosen": -5.854452610015869, "logps/rejected": -72.38533782958984, "loss": 0.5907310247421265, "memory(GiB)": 45.96, "nll_loss": 0.4151501953601837, "rewards/accuracies": 0.9375, "rewards/chosen": 0.6598876118659973, "rewards/margins": 6.241320610046387, "rewards/rejected": -5.581433296203613, "step": 647, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2253121117093664, "grad_norm": 1.430675745010376, "learning_rate": 0.00013749508741969213, "logits/chosen": -1.1150786876678467, "logits/rejected": -1.1341830492019653, "logps/chosen": -2.883854627609253, "logps/rejected": -87.04833221435547, "loss": 0.2859303057193756, "memory(GiB)": 45.96, "nll_loss": 0.2183929681777954, "rewards/accuracies": 0.96875, "rewards/chosen": 0.44854816794395447, "rewards/margins": 7.2965617179870605, "rewards/rejected": -6.848013877868652, "step": 648, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.227205490799361, "grad_norm": 0.6251242756843567, "learning_rate": 0.00013730136235974493, "logits/chosen": -1.0749518871307373, "logits/rejected": -1.1022703647613525, "logps/chosen": -3.4674556255340576, "logps/rejected": -94.43933868408203, "loss": 0.19341430068016052, "memory(GiB)": 45.96, "nll_loss": 0.16188928484916687, "rewards/accuracies": 1.0, "rewards/chosen": 0.5625832676887512, "rewards/margins": 7.256820201873779, "rewards/rejected": -6.69423770904541, "step": 649, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2290988698893557, "grad_norm": 0.854637086391449, "learning_rate": 0.00013710747454694536, "logits/chosen": -1.1327743530273438, "logits/rejected": -1.1492671966552734, "logps/chosen": -3.158024787902832, "logps/rejected": -92.56230926513672, "loss": 0.16373629868030548, "memory(GiB)": 45.96, "nll_loss": 0.13652028143405914, "rewards/accuracies": 1.0, "rewards/chosen": 0.6151731610298157, "rewards/margins": 7.690463066101074, "rewards/rejected": -7.075289249420166, "step": 650, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2309922489793503, "grad_norm": 1.0111662149429321, "learning_rate": 0.00013691342482726227, "logits/chosen": -1.164562463760376, "logits/rejected": -1.1749894618988037, "logps/chosen": -3.864534854888916, "logps/rejected": -85.07794189453125, "loss": 0.19850535690784454, "memory(GiB)": 45.96, "nll_loss": 0.14427503943443298, "rewards/accuracies": 0.96875, "rewards/chosen": 0.435876727104187, "rewards/margins": 7.181488037109375, "rewards/rejected": -6.745611667633057, "step": 651, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.232885628069345, "grad_norm": 0.6544408798217773, "learning_rate": 0.0001367192140473711, "logits/chosen": -1.1733068227767944, "logits/rejected": -1.1924707889556885, "logps/chosen": -2.2992167472839355, "logps/rejected": -92.77910614013672, "loss": 0.13127104938030243, "memory(GiB)": 45.96, "nll_loss": 0.11011791974306107, "rewards/accuracies": 1.0, "rewards/chosen": 0.5089115500450134, "rewards/margins": 8.034041404724121, "rewards/rejected": -7.525129795074463, "step": 652, "train_speed(iter/s)": 0.005581 }, { "epoch": 1.2347790071593396, "grad_norm": 0.8594977259635925, "learning_rate": 0.00013652484305464994, "logits/chosen": -1.2025909423828125, "logits/rejected": -1.2214899063110352, "logps/chosen": -5.194190979003906, "logps/rejected": -102.56082153320312, "loss": 0.2433939427137375, "memory(GiB)": 45.96, "nll_loss": 0.196023091673851, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37284529209136963, "rewards/margins": 8.817720413208008, "rewards/rejected": -8.444875717163086, "step": 653, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2366723862493343, "grad_norm": 4.11221170425415, "learning_rate": 0.000136330312697176, "logits/chosen": -1.2391037940979004, "logits/rejected": -1.257367730140686, "logps/chosen": -3.074094533920288, "logps/rejected": -107.96156311035156, "loss": 0.17748232185840607, "memory(GiB)": 45.96, "nll_loss": 0.12704119086265564, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45895522832870483, "rewards/margins": 9.096002578735352, "rewards/rejected": -8.637046813964844, "step": 654, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.238565765339329, "grad_norm": 13.602038383483887, "learning_rate": 0.00013613562382372175, "logits/chosen": -1.2747328281402588, "logits/rejected": -1.2887108325958252, "logps/chosen": -4.994225978851318, "logps/rejected": -111.89958190917969, "loss": 0.22689774632453918, "memory(GiB)": 45.96, "nll_loss": 0.19176575541496277, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6112773418426514, "rewards/margins": 9.564874649047852, "rewards/rejected": -8.953597068786621, "step": 655, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2404591444293236, "grad_norm": 1.4164304733276367, "learning_rate": 0.00013594077728375128, "logits/chosen": -1.2002649307250977, "logits/rejected": -1.2172743082046509, "logps/chosen": -2.0340259075164795, "logps/rejected": -100.03349304199219, "loss": 0.15853197872638702, "memory(GiB)": 45.96, "nll_loss": 0.14140553772449493, "rewards/accuracies": 1.0, "rewards/chosen": 0.39426544308662415, "rewards/margins": 8.667793273925781, "rewards/rejected": -8.273527145385742, "step": 656, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2423525235193185, "grad_norm": 1.2055261135101318, "learning_rate": 0.00013574577392741675, "logits/chosen": -1.1947505474090576, "logits/rejected": -1.2100290060043335, "logps/chosen": -3.4151129722595215, "logps/rejected": -87.28324890136719, "loss": 0.25436219573020935, "memory(GiB)": 45.96, "nll_loss": 0.21079185605049133, "rewards/accuracies": 1.0, "rewards/chosen": 0.3687793016433716, "rewards/margins": 7.392486572265625, "rewards/rejected": -7.023707389831543, "step": 657, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2442459026093131, "grad_norm": 0.7824620008468628, "learning_rate": 0.00013555061460555437, "logits/chosen": -1.2751868963241577, "logits/rejected": -1.2890942096710205, "logps/chosen": -5.6683349609375, "logps/rejected": -94.01497650146484, "loss": 0.22607284784317017, "memory(GiB)": 45.96, "nll_loss": 0.18028336763381958, "rewards/accuracies": 1.0, "rewards/chosen": 0.5186669230461121, "rewards/margins": 8.202751159667969, "rewards/rejected": -7.684084892272949, "step": 658, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2461392816993078, "grad_norm": 10.540384292602539, "learning_rate": 0.00013535530016968095, "logits/chosen": -1.224336862564087, "logits/rejected": -1.234197735786438, "logps/chosen": -4.465878963470459, "logps/rejected": -78.70198822021484, "loss": 0.3276776671409607, "memory(GiB)": 45.96, "nll_loss": 0.2578147053718567, "rewards/accuracies": 0.9375, "rewards/chosen": 0.48812490701675415, "rewards/margins": 6.712148666381836, "rewards/rejected": -6.224023818969727, "step": 659, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2480326607893024, "grad_norm": 1.0541977882385254, "learning_rate": 0.00013515983147199007, "logits/chosen": -1.263400673866272, "logits/rejected": -1.2767853736877441, "logps/chosen": -4.78371000289917, "logps/rejected": -91.89421081542969, "loss": 0.2207237035036087, "memory(GiB)": 45.96, "nll_loss": 0.21213196218013763, "rewards/accuracies": 1.0, "rewards/chosen": 0.40188920497894287, "rewards/margins": 7.835195541381836, "rewards/rejected": -7.433306694030762, "step": 660, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.249926039879297, "grad_norm": 1.1346842050552368, "learning_rate": 0.00013496420936534839, "logits/chosen": -1.2140860557556152, "logits/rejected": -1.2262767553329468, "logps/chosen": -4.072805881500244, "logps/rejected": -83.90109252929688, "loss": 0.29052406549453735, "memory(GiB)": 45.96, "nll_loss": 0.20386162400245667, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5836110711097717, "rewards/margins": 7.275147914886475, "rewards/rejected": -6.691536903381348, "step": 661, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2518194189692917, "grad_norm": 1.0119054317474365, "learning_rate": 0.0001347684347032919, "logits/chosen": -1.2601851224899292, "logits/rejected": -1.2733888626098633, "logps/chosen": -3.0143775939941406, "logps/rejected": -83.3037109375, "loss": 0.1853754073381424, "memory(GiB)": 45.96, "nll_loss": 0.16816890239715576, "rewards/accuracies": 1.0, "rewards/chosen": 0.4909835159778595, "rewards/margins": 7.277222156524658, "rewards/rejected": -6.786238670349121, "step": 662, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2537127980592864, "grad_norm": 1.772426724433899, "learning_rate": 0.00013457250834002227, "logits/chosen": -1.259223461151123, "logits/rejected": -1.2752642631530762, "logps/chosen": -6.449353218078613, "logps/rejected": -77.19977569580078, "loss": 0.3121209740638733, "memory(GiB)": 45.96, "nll_loss": 0.2732515037059784, "rewards/accuracies": 1.0, "rewards/chosen": 0.48688846826553345, "rewards/margins": 6.596216678619385, "rewards/rejected": -6.109328746795654, "step": 663, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2556061771492812, "grad_norm": 0.834148645401001, "learning_rate": 0.00013437643113040301, "logits/chosen": -1.2490071058273315, "logits/rejected": -1.2806060314178467, "logps/chosen": -2.3923885822296143, "logps/rejected": -112.9473876953125, "loss": 0.12270709872245789, "memory(GiB)": 45.96, "nll_loss": 0.11919470131397247, "rewards/accuracies": 1.0, "rewards/chosen": 0.5832490921020508, "rewards/margins": 9.47195816040039, "rewards/rejected": -8.888710021972656, "step": 664, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2574995562392757, "grad_norm": 0.6280990242958069, "learning_rate": 0.0001341802039299558, "logits/chosen": -1.2498441934585571, "logits/rejected": -1.2767866849899292, "logps/chosen": -1.147368311882019, "logps/rejected": -101.53812408447266, "loss": 0.09030965715646744, "memory(GiB)": 45.96, "nll_loss": 0.08374150097370148, "rewards/accuracies": 1.0, "rewards/chosen": 0.41601359844207764, "rewards/margins": 8.669894218444824, "rewards/rejected": -8.25387954711914, "step": 665, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2593929353292705, "grad_norm": 7.9262776374816895, "learning_rate": 0.00013398382759485683, "logits/chosen": -1.2408939599990845, "logits/rejected": -1.2566684484481812, "logps/chosen": -2.6536943912506104, "logps/rejected": -89.7925033569336, "loss": 0.21182867884635925, "memory(GiB)": 45.96, "nll_loss": 0.18399737775325775, "rewards/accuracies": 1.0, "rewards/chosen": 0.467414915561676, "rewards/margins": 7.703207969665527, "rewards/rejected": -7.23579216003418, "step": 666, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2612863144192652, "grad_norm": 2.1628665924072266, "learning_rate": 0.00013378730298193293, "logits/chosen": -1.2686347961425781, "logits/rejected": -1.2850341796875, "logps/chosen": -2.91650128364563, "logps/rejected": -98.89842224121094, "loss": 0.12062933295965195, "memory(GiB)": 45.96, "nll_loss": 0.09240053594112396, "rewards/accuracies": 1.0, "rewards/chosen": 0.44848957657814026, "rewards/margins": 8.455171585083008, "rewards/rejected": -8.006681442260742, "step": 667, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2631796935092598, "grad_norm": 1.5882667303085327, "learning_rate": 0.0001335906309486579, "logits/chosen": -1.2118374109268188, "logits/rejected": -1.228037714958191, "logps/chosen": -4.291105270385742, "logps/rejected": -93.77169799804688, "loss": 0.23226000368595123, "memory(GiB)": 45.96, "nll_loss": 0.17540231347084045, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5786739587783813, "rewards/margins": 8.085977554321289, "rewards/rejected": -7.507303237915039, "step": 668, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2650730725992545, "grad_norm": 0.7664045691490173, "learning_rate": 0.00013339381235314877, "logits/chosen": -1.2171658277511597, "logits/rejected": -1.2381665706634521, "logps/chosen": -2.144977569580078, "logps/rejected": -104.58934783935547, "loss": 0.1646273136138916, "memory(GiB)": 45.96, "nll_loss": 0.15552210807800293, "rewards/accuracies": 1.0, "rewards/chosen": 0.5437726974487305, "rewards/margins": 9.003692626953125, "rewards/rejected": -8.459919929504395, "step": 669, "train_speed(iter/s)": 0.005582 }, { "epoch": 1.2669664516892492, "grad_norm": 0.997371256351471, "learning_rate": 0.00013319684805416208, "logits/chosen": -1.2663860321044922, "logits/rejected": -1.2850096225738525, "logps/chosen": -3.7030885219573975, "logps/rejected": -94.42146301269531, "loss": 0.19464686512947083, "memory(GiB)": 45.96, "nll_loss": 0.1695374846458435, "rewards/accuracies": 1.0, "rewards/chosen": 0.6468212008476257, "rewards/margins": 8.09141731262207, "rewards/rejected": -7.444596290588379, "step": 670, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2688598307792438, "grad_norm": 1.922092080116272, "learning_rate": 0.00013299973891109002, "logits/chosen": -1.2253403663635254, "logits/rejected": -1.244078278541565, "logps/chosen": -3.8278942108154297, "logps/rejected": -102.39065551757812, "loss": 0.20534221827983856, "memory(GiB)": 45.96, "nll_loss": 0.18800829350948334, "rewards/accuracies": 1.0, "rewards/chosen": 0.6005682945251465, "rewards/margins": 8.945769309997559, "rewards/rejected": -8.345200538635254, "step": 671, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2707532098692385, "grad_norm": 0.8352254033088684, "learning_rate": 0.0001328024857839569, "logits/chosen": -1.2455424070358276, "logits/rejected": -1.2553379535675049, "logps/chosen": -4.562953472137451, "logps/rejected": -100.60092163085938, "loss": 0.20486782491207123, "memory(GiB)": 45.96, "nll_loss": 0.18330179154872894, "rewards/accuracies": 1.0, "rewards/chosen": 0.49509212374687195, "rewards/margins": 8.774545669555664, "rewards/rejected": -8.27945327758789, "step": 672, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.272646588959233, "grad_norm": 2.8604531288146973, "learning_rate": 0.00013260508953341513, "logits/chosen": -1.2760071754455566, "logits/rejected": -1.2919646501541138, "logps/chosen": -4.311322212219238, "logps/rejected": -109.21879577636719, "loss": 0.25504687428474426, "memory(GiB)": 45.96, "nll_loss": 0.18772965669631958, "rewards/accuracies": 1.0, "rewards/chosen": 0.7696996927261353, "rewards/margins": 9.808104515075684, "rewards/rejected": -9.038405418395996, "step": 673, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2745399680492278, "grad_norm": 3.490610361099243, "learning_rate": 0.00013240755102074162, "logits/chosen": -1.2782739400863647, "logits/rejected": -1.2971439361572266, "logps/chosen": -6.547723293304443, "logps/rejected": -123.92678833007812, "loss": 0.27842605113983154, "memory(GiB)": 45.96, "nll_loss": 0.21907608211040497, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5699790120124817, "rewards/margins": 10.686688423156738, "rewards/rejected": -10.11670970916748, "step": 674, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2764333471392226, "grad_norm": 0.6559191346168518, "learning_rate": 0.00013220987110783405, "logits/chosen": -1.3302873373031616, "logits/rejected": -1.3444199562072754, "logps/chosen": -3.099641799926758, "logps/rejected": -100.66400146484375, "loss": 0.13532628118991852, "memory(GiB)": 45.96, "nll_loss": 0.11194542795419693, "rewards/accuracies": 1.0, "rewards/chosen": 0.4563906788825989, "rewards/margins": 8.841947555541992, "rewards/rejected": -8.3855562210083, "step": 675, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2783267262292173, "grad_norm": 0.6219284534454346, "learning_rate": 0.00013201205065720698, "logits/chosen": -1.2828350067138672, "logits/rejected": -1.3093940019607544, "logps/chosen": -2.723968029022217, "logps/rejected": -119.10283660888672, "loss": 0.13384726643562317, "memory(GiB)": 45.96, "nll_loss": 0.11944205313920975, "rewards/accuracies": 1.0, "rewards/chosen": 0.644302487373352, "rewards/margins": 10.407089233398438, "rewards/rejected": -9.762786865234375, "step": 676, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.280220105319212, "grad_norm": 4.198030471801758, "learning_rate": 0.00013181409053198822, "logits/chosen": -1.2754874229431152, "logits/rejected": -1.2981709241867065, "logps/chosen": -3.2714099884033203, "logps/rejected": -102.00110626220703, "loss": 0.16418549418449402, "memory(GiB)": 45.96, "nll_loss": 0.15923593938350677, "rewards/accuracies": 1.0, "rewards/chosen": 0.3782915472984314, "rewards/margins": 8.629867553710938, "rewards/rejected": -8.251575469970703, "step": 677, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2821134844092066, "grad_norm": 0.7027133107185364, "learning_rate": 0.00013161599159591502, "logits/chosen": -1.3214412927627563, "logits/rejected": -1.3430482149124146, "logps/chosen": -2.828273296356201, "logps/rejected": -122.728271484375, "loss": 0.16940374672412872, "memory(GiB)": 45.96, "nll_loss": 0.16672328114509583, "rewards/accuracies": 1.0, "rewards/chosen": 0.6937204599380493, "rewards/margins": 10.843151092529297, "rewards/rejected": -10.149429321289062, "step": 678, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2840068634992012, "grad_norm": 0.4566222131252289, "learning_rate": 0.00013141775471333023, "logits/chosen": -1.2488141059875488, "logits/rejected": -1.2712870836257935, "logps/chosen": -1.4968810081481934, "logps/rejected": -115.5900650024414, "loss": 0.07236362993717194, "memory(GiB)": 45.96, "nll_loss": 0.06065154820680618, "rewards/accuracies": 1.0, "rewards/chosen": 0.5558494329452515, "rewards/margins": 10.079120635986328, "rewards/rejected": -9.523271560668945, "step": 679, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2859002425891959, "grad_norm": 7.306726455688477, "learning_rate": 0.00013121938074917865, "logits/chosen": -1.3081672191619873, "logits/rejected": -1.3317952156066895, "logps/chosen": -2.5203912258148193, "logps/rejected": -124.57064819335938, "loss": 0.14741453528404236, "memory(GiB)": 45.96, "nll_loss": 0.12144798040390015, "rewards/accuracies": 0.96875, "rewards/chosen": 0.49395012855529785, "rewards/margins": 10.88518238067627, "rewards/rejected": -10.391231536865234, "step": 680, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2877936216791905, "grad_norm": 0.7193635702133179, "learning_rate": 0.00013102087056900312, "logits/chosen": -1.361487627029419, "logits/rejected": -1.3688561916351318, "logps/chosen": -3.718552350997925, "logps/rejected": -90.23562622070312, "loss": 0.1710875928401947, "memory(GiB)": 45.96, "nll_loss": 0.1185617595911026, "rewards/accuracies": 0.9375, "rewards/chosen": 0.38218656182289124, "rewards/margins": 7.945744037628174, "rewards/rejected": -7.563557147979736, "step": 681, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2896870007691852, "grad_norm": 1.750275731086731, "learning_rate": 0.00013082222503894085, "logits/chosen": -1.328383207321167, "logits/rejected": -1.3390076160430908, "logps/chosen": -4.469247341156006, "logps/rejected": -99.45858764648438, "loss": 0.24831274151802063, "memory(GiB)": 45.96, "nll_loss": 0.2337150275707245, "rewards/accuracies": 1.0, "rewards/chosen": 0.5493384599685669, "rewards/margins": 9.164920806884766, "rewards/rejected": -8.615582466125488, "step": 682, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2915803798591798, "grad_norm": 1.4674733877182007, "learning_rate": 0.0001306234450257196, "logits/chosen": -1.3304932117462158, "logits/rejected": -1.354658842086792, "logps/chosen": -3.1954829692840576, "logps/rejected": -115.50567626953125, "loss": 0.16422712802886963, "memory(GiB)": 45.96, "nll_loss": 0.16022494435310364, "rewards/accuracies": 1.0, "rewards/chosen": 0.5024171471595764, "rewards/margins": 9.925741195678711, "rewards/rejected": -9.423324584960938, "step": 683, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2934737589491747, "grad_norm": 3.6834020614624023, "learning_rate": 0.00013042453139665397, "logits/chosen": -1.3059653043746948, "logits/rejected": -1.3349957466125488, "logps/chosen": -7.1290788650512695, "logps/rejected": -118.19027709960938, "loss": 0.5577002167701721, "memory(GiB)": 45.96, "nll_loss": 0.5272465348243713, "rewards/accuracies": 1.0, "rewards/chosen": 0.2190469354391098, "rewards/margins": 9.950216293334961, "rewards/rejected": -9.731169700622559, "step": 684, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2953671380391691, "grad_norm": 0.9725119471549988, "learning_rate": 0.00013022548501964148, "logits/chosen": -1.2843022346496582, "logits/rejected": -1.3074129819869995, "logps/chosen": -4.139756202697754, "logps/rejected": -121.79645538330078, "loss": 0.21320319175720215, "memory(GiB)": 45.96, "nll_loss": 0.1927129179239273, "rewards/accuracies": 1.0, "rewards/chosen": 0.6416595578193665, "rewards/margins": 11.054458618164062, "rewards/rejected": -10.412799835205078, "step": 685, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.297260517129164, "grad_norm": 0.9142606258392334, "learning_rate": 0.00013002630676315884, "logits/chosen": -1.297221064567566, "logits/rejected": -1.313838243484497, "logps/chosen": -3.9657680988311768, "logps/rejected": -108.65413665771484, "loss": 0.16495384275913239, "memory(GiB)": 45.96, "nll_loss": 0.13814619183540344, "rewards/accuracies": 1.0, "rewards/chosen": 0.5089263319969177, "rewards/margins": 9.599608421325684, "rewards/rejected": -9.090682029724121, "step": 686, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.2991538962191587, "grad_norm": 0.8316473364830017, "learning_rate": 0.00012982699749625821, "logits/chosen": -1.2407358884811401, "logits/rejected": -1.2609210014343262, "logps/chosen": -7.802042484283447, "logps/rejected": -116.04839324951172, "loss": 0.31111985445022583, "memory(GiB)": 45.96, "nll_loss": 0.2776601016521454, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5655537843704224, "rewards/margins": 10.247386932373047, "rewards/rejected": -9.681832313537598, "step": 687, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3010472753091533, "grad_norm": 0.7703730463981628, "learning_rate": 0.00012962755808856342, "logits/chosen": -1.2796357870101929, "logits/rejected": -1.2995810508728027, "logps/chosen": -4.099747657775879, "logps/rejected": -121.5992431640625, "loss": 0.17581507563591003, "memory(GiB)": 45.96, "nll_loss": 0.1654597371816635, "rewards/accuracies": 1.0, "rewards/chosen": 0.6910482048988342, "rewards/margins": 10.691566467285156, "rewards/rejected": -10.000518798828125, "step": 688, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.302940654399148, "grad_norm": 1.3358616828918457, "learning_rate": 0.000129427989410266, "logits/chosen": -1.302721381187439, "logits/rejected": -1.3264588117599487, "logps/chosen": -5.364765167236328, "logps/rejected": -98.9963607788086, "loss": 0.5656005144119263, "memory(GiB)": 45.96, "nll_loss": 0.42210423946380615, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4461752772331238, "rewards/margins": 8.554890632629395, "rewards/rejected": -8.108715057373047, "step": 689, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3048340334891426, "grad_norm": 19.095157623291016, "learning_rate": 0.00012922829233212165, "logits/chosen": -1.3093451261520386, "logits/rejected": -1.3238065242767334, "logps/chosen": -4.750430583953857, "logps/rejected": -109.75341796875, "loss": 0.2108265459537506, "memory(GiB)": 45.96, "nll_loss": 0.18970412015914917, "rewards/accuracies": 1.0, "rewards/chosen": 0.2624005675315857, "rewards/margins": 9.519784927368164, "rewards/rejected": -9.257384300231934, "step": 690, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3067274125791373, "grad_norm": 0.773473858833313, "learning_rate": 0.00012902846772544624, "logits/chosen": -1.2952555418014526, "logits/rejected": -1.3154966831207275, "logps/chosen": -5.129486083984375, "logps/rejected": -127.95144653320312, "loss": 0.19911812245845795, "memory(GiB)": 45.96, "nll_loss": 0.16275183856487274, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37549078464508057, "rewards/margins": 10.62497329711914, "rewards/rejected": -10.249483108520508, "step": 691, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.308620791669132, "grad_norm": 1.073358416557312, "learning_rate": 0.00012882851646211206, "logits/chosen": -1.2766900062561035, "logits/rejected": -1.2928975820541382, "logps/chosen": -7.992812156677246, "logps/rejected": -116.97691345214844, "loss": 0.2699803411960602, "memory(GiB)": 45.96, "nll_loss": 0.2624160349369049, "rewards/accuracies": 1.0, "rewards/chosen": 0.5498393774032593, "rewards/margins": 10.348921775817871, "rewards/rejected": -9.799081802368164, "step": 692, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3105141707591268, "grad_norm": 0.6758482456207275, "learning_rate": 0.00012862843941454402, "logits/chosen": -1.254409670829773, "logits/rejected": -1.2667585611343384, "logps/chosen": -5.230801105499268, "logps/rejected": -113.11685943603516, "loss": 0.20469366014003754, "memory(GiB)": 45.96, "nll_loss": 0.1763952076435089, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3384644091129303, "rewards/margins": 9.77762508392334, "rewards/rejected": -9.439160346984863, "step": 693, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3124075498491212, "grad_norm": 5.1062445640563965, "learning_rate": 0.00012842823745571588, "logits/chosen": -1.2632169723510742, "logits/rejected": -1.285363793373108, "logps/chosen": -3.2440667152404785, "logps/rejected": -129.44454956054688, "loss": 0.20233389735221863, "memory(GiB)": 45.96, "nll_loss": 0.12110748142004013, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5933730006217957, "rewards/margins": 11.818197250366211, "rewards/rejected": -11.224824905395508, "step": 694, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.314300928939116, "grad_norm": 4.967945098876953, "learning_rate": 0.00012822791145914643, "logits/chosen": -1.3190865516662598, "logits/rejected": -1.322510838508606, "logps/chosen": -6.946662425994873, "logps/rejected": -99.20793151855469, "loss": 0.22520855069160461, "memory(GiB)": 45.96, "nll_loss": 0.20360182225704193, "rewards/accuracies": 1.0, "rewards/chosen": 0.4464600384235382, "rewards/margins": 8.819591522216797, "rewards/rejected": -8.37313175201416, "step": 695, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3161943080291107, "grad_norm": 0.7528690695762634, "learning_rate": 0.00012802746229889563, "logits/chosen": -1.2697570323944092, "logits/rejected": -1.2890403270721436, "logps/chosen": -4.18599796295166, "logps/rejected": -116.47010040283203, "loss": 0.12717163562774658, "memory(GiB)": 45.96, "nll_loss": 0.12329236418008804, "rewards/accuracies": 1.0, "rewards/chosen": 0.39391693472862244, "rewards/margins": 10.161079406738281, "rewards/rejected": -9.767163276672363, "step": 696, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3180876871191054, "grad_norm": 4.968014240264893, "learning_rate": 0.00012782689084956078, "logits/chosen": -1.3118584156036377, "logits/rejected": -1.320459008216858, "logps/chosen": -5.031144142150879, "logps/rejected": -111.54464721679688, "loss": 0.27862486243247986, "memory(GiB)": 45.96, "nll_loss": 0.15949955582618713, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4624725878238678, "rewards/margins": 9.712789535522461, "rewards/rejected": -9.250316619873047, "step": 697, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3199810662091, "grad_norm": 2.0111641883850098, "learning_rate": 0.00012762619798627282, "logits/chosen": -1.2476155757904053, "logits/rejected": -1.260296106338501, "logps/chosen": -4.611104965209961, "logps/rejected": -103.76033020019531, "loss": 0.17496375739574432, "memory(GiB)": 45.96, "nll_loss": 0.16747039556503296, "rewards/accuracies": 1.0, "rewards/chosen": 0.5656296014785767, "rewards/margins": 8.926993370056152, "rewards/rejected": -8.361364364624023, "step": 698, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3218744452990947, "grad_norm": 0.7398191094398499, "learning_rate": 0.00012742538458469246, "logits/chosen": -1.2478125095367432, "logits/rejected": -1.2548859119415283, "logps/chosen": -3.8168303966522217, "logps/rejected": -97.06517791748047, "loss": 0.14771857857704163, "memory(GiB)": 45.96, "nll_loss": 0.1390731930732727, "rewards/accuracies": 1.0, "rewards/chosen": 0.5594909191131592, "rewards/margins": 8.748406410217285, "rewards/rejected": -8.188915252685547, "step": 699, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3237678243890894, "grad_norm": 0.8066232800483704, "learning_rate": 0.00012722445152100624, "logits/chosen": -1.2417348623275757, "logits/rejected": -1.2570741176605225, "logps/chosen": -2.389744997024536, "logps/rejected": -86.6338882446289, "loss": 0.16380390524864197, "memory(GiB)": 45.96, "nll_loss": 0.12720054388046265, "rewards/accuracies": 1.0, "rewards/chosen": 0.570247232913971, "rewards/margins": 7.321161270141602, "rewards/rejected": -6.750914096832275, "step": 700, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.325661203479084, "grad_norm": 1.1527165174484253, "learning_rate": 0.00012702339967192292, "logits/chosen": -1.2916889190673828, "logits/rejected": -1.3003627061843872, "logps/chosen": -3.0451269149780273, "logps/rejected": -91.65868377685547, "loss": 0.1978881061077118, "memory(GiB)": 45.96, "nll_loss": 0.16753852367401123, "rewards/accuracies": 1.0, "rewards/chosen": 0.5230326056480408, "rewards/margins": 8.209744453430176, "rewards/rejected": -7.686711311340332, "step": 701, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3275545825690789, "grad_norm": 1.0912978649139404, "learning_rate": 0.00012682222991466948, "logits/chosen": -1.2573422193527222, "logits/rejected": -1.2747260332107544, "logps/chosen": -2.7481446266174316, "logps/rejected": -103.978515625, "loss": 0.14063449203968048, "memory(GiB)": 45.96, "nll_loss": 0.13063806295394897, "rewards/accuracies": 1.0, "rewards/chosen": 0.47163817286491394, "rewards/margins": 8.745121002197266, "rewards/rejected": -8.273482322692871, "step": 702, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3294479616590733, "grad_norm": 22.729263305664062, "learning_rate": 0.00012662094312698735, "logits/chosen": -1.2921996116638184, "logits/rejected": -1.2991044521331787, "logps/chosen": -5.945530414581299, "logps/rejected": -76.7307357788086, "loss": 0.2982117533683777, "memory(GiB)": 45.96, "nll_loss": 0.27566850185394287, "rewards/accuracies": 1.0, "rewards/chosen": 0.3026009798049927, "rewards/margins": 6.646614074707031, "rewards/rejected": -6.344013214111328, "step": 703, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3313413407490682, "grad_norm": 0.9101666212081909, "learning_rate": 0.00012641954018712863, "logits/chosen": -1.2816362380981445, "logits/rejected": -1.306016445159912, "logps/chosen": -2.3992016315460205, "logps/rejected": -104.89875030517578, "loss": 0.21880419552326202, "memory(GiB)": 45.96, "nll_loss": 0.17376631498336792, "rewards/accuracies": 1.0, "rewards/chosen": 0.5566422939300537, "rewards/margins": 8.900392532348633, "rewards/rejected": -8.34375, "step": 704, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3332347198390628, "grad_norm": 0.7675183415412903, "learning_rate": 0.00012621802197385212, "logits/chosen": -1.2347376346588135, "logits/rejected": -1.2482961416244507, "logps/chosen": -3.8751392364501953, "logps/rejected": -100.11812591552734, "loss": 0.1806536465883255, "memory(GiB)": 45.96, "nll_loss": 0.1367262303829193, "rewards/accuracies": 0.96875, "rewards/chosen": 0.564403772354126, "rewards/margins": 8.214317321777344, "rewards/rejected": -7.649913787841797, "step": 705, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3351280989290575, "grad_norm": 0.995285153388977, "learning_rate": 0.00012601638936641976, "logits/chosen": -1.270362138748169, "logits/rejected": -1.2847920656204224, "logps/chosen": -3.295135021209717, "logps/rejected": -82.77586364746094, "loss": 0.19705501198768616, "memory(GiB)": 45.96, "nll_loss": 0.1198456883430481, "rewards/accuracies": 0.9375, "rewards/chosen": 0.49801748991012573, "rewards/margins": 7.20506477355957, "rewards/rejected": -6.707046985626221, "step": 706, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3370214780190521, "grad_norm": 1.0535005331039429, "learning_rate": 0.0001258146432445924, "logits/chosen": -1.3396191596984863, "logits/rejected": -1.356287956237793, "logps/chosen": -3.8445959091186523, "logps/rejected": -90.25233459472656, "loss": 0.2341512143611908, "memory(GiB)": 45.96, "nll_loss": 0.1896001696586609, "rewards/accuracies": 0.96875, "rewards/chosen": 0.495680570602417, "rewards/margins": 7.917792320251465, "rewards/rejected": -7.422112464904785, "step": 707, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3389148571090468, "grad_norm": 1.5458048582077026, "learning_rate": 0.00012561278448862634, "logits/chosen": -1.3336971998214722, "logits/rejected": -1.3589318990707397, "logps/chosen": -1.9345256090164185, "logps/rejected": -104.30036163330078, "loss": 0.1311199814081192, "memory(GiB)": 45.96, "nll_loss": 0.10932604968547821, "rewards/accuracies": 1.0, "rewards/chosen": 0.5588750243186951, "rewards/margins": 9.301870346069336, "rewards/rejected": -8.742996215820312, "step": 708, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3408082361990414, "grad_norm": 0.8339555263519287, "learning_rate": 0.00012541081397926925, "logits/chosen": -1.3096569776535034, "logits/rejected": -1.3302487134933472, "logps/chosen": -3.6992669105529785, "logps/rejected": -118.5272216796875, "loss": 0.14296677708625793, "memory(GiB)": 45.96, "nll_loss": 0.12727825343608856, "rewards/accuracies": 1.0, "rewards/chosen": 0.6764388680458069, "rewards/margins": 10.035237312316895, "rewards/rejected": -9.358798027038574, "step": 709, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.342701615289036, "grad_norm": 15.578758239746094, "learning_rate": 0.00012520873259775636, "logits/chosen": -1.37481689453125, "logits/rejected": -1.3919589519500732, "logps/chosen": -3.958169460296631, "logps/rejected": -109.35943603515625, "loss": 0.4203401207923889, "memory(GiB)": 45.96, "nll_loss": 0.34680628776550293, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18485558032989502, "rewards/margins": 9.556227684020996, "rewards/rejected": -9.37137222290039, "step": 710, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.344594994379031, "grad_norm": 0.9837526679039001, "learning_rate": 0.00012500654122580675, "logits/chosen": -1.4348475933074951, "logits/rejected": -1.456255316734314, "logps/chosen": -1.9943851232528687, "logps/rejected": -137.81805419921875, "loss": 0.09225192666053772, "memory(GiB)": 45.96, "nll_loss": 0.07782280445098877, "rewards/accuracies": 1.0, "rewards/chosen": 0.44493988156318665, "rewards/margins": 12.162233352661133, "rewards/rejected": -11.717293739318848, "step": 711, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3464883734690254, "grad_norm": 2.581824779510498, "learning_rate": 0.00012480424074561933, "logits/chosen": -1.3822526931762695, "logits/rejected": -1.4020648002624512, "logps/chosen": -4.550716400146484, "logps/rejected": -103.86782836914062, "loss": 0.28442901372909546, "memory(GiB)": 45.96, "nll_loss": 0.24876733124256134, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4810265600681305, "rewards/margins": 9.237351417541504, "rewards/rejected": -8.756324768066406, "step": 712, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3483817525590203, "grad_norm": 2.6685738563537598, "learning_rate": 0.00012460183203986917, "logits/chosen": -1.4334018230438232, "logits/rejected": -1.4540126323699951, "logps/chosen": -5.17223596572876, "logps/rejected": -127.40531158447266, "loss": 0.24820397794246674, "memory(GiB)": 45.96, "nll_loss": 0.21534302830696106, "rewards/accuracies": 1.0, "rewards/chosen": 0.533196747303009, "rewards/margins": 11.388389587402344, "rewards/rejected": -10.855192184448242, "step": 713, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.350275131649015, "grad_norm": 3.6330223083496094, "learning_rate": 0.00012439931599170342, "logits/chosen": -1.3965675830841064, "logits/rejected": -1.4132789373397827, "logps/chosen": -5.910233020782471, "logps/rejected": -115.43537902832031, "loss": 0.22887299954891205, "memory(GiB)": 45.96, "nll_loss": 0.2144639939069748, "rewards/accuracies": 1.0, "rewards/chosen": 0.4336181581020355, "rewards/margins": 10.194890022277832, "rewards/rejected": -9.761272430419922, "step": 714, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3521685107390096, "grad_norm": 1.252068042755127, "learning_rate": 0.0001241966934847377, "logits/chosen": -1.4876632690429688, "logits/rejected": -1.5106892585754395, "logps/chosen": -4.912591934204102, "logps/rejected": -130.63931274414062, "loss": 0.2556398808956146, "memory(GiB)": 45.96, "nll_loss": 0.19699408113956451, "rewards/accuracies": 0.9375, "rewards/chosen": 0.49190080165863037, "rewards/margins": 11.174872398376465, "rewards/rejected": -10.682971954345703, "step": 715, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3540618898290042, "grad_norm": 0.47095194458961487, "learning_rate": 0.00012399396540305205, "logits/chosen": -1.5109764337539673, "logits/rejected": -1.5408351421356201, "logps/chosen": -1.663557767868042, "logps/rejected": -182.84844970703125, "loss": 0.08118365705013275, "memory(GiB)": 45.96, "nll_loss": 0.07808937877416611, "rewards/accuracies": 1.0, "rewards/chosen": 0.562421441078186, "rewards/margins": 16.441465377807617, "rewards/rejected": -15.879043579101562, "step": 716, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3559552689189989, "grad_norm": 2.3887813091278076, "learning_rate": 0.00012379113263118717, "logits/chosen": -1.5092129707336426, "logits/rejected": -1.5265885591506958, "logps/chosen": -4.671719551086426, "logps/rejected": -130.737548828125, "loss": 0.3565371334552765, "memory(GiB)": 45.96, "nll_loss": 0.3507789671421051, "rewards/accuracies": 1.0, "rewards/chosen": 0.38416343927383423, "rewards/margins": 11.713521003723145, "rewards/rejected": -11.32935619354248, "step": 717, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3578486480089935, "grad_norm": 13.596844673156738, "learning_rate": 0.0001235881960541405, "logits/chosen": -1.4459404945373535, "logits/rejected": -1.4728071689605713, "logps/chosen": -3.910332679748535, "logps/rejected": -169.46316528320312, "loss": 0.21092525124549866, "memory(GiB)": 45.96, "nll_loss": 0.19290146231651306, "rewards/accuracies": 1.0, "rewards/chosen": 0.5652647018432617, "rewards/margins": 15.016708374023438, "rewards/rejected": -14.451443672180176, "step": 718, "train_speed(iter/s)": 0.005583 }, { "epoch": 1.3597420270989882, "grad_norm": 1.977660894393921, "learning_rate": 0.0001233851565573626, "logits/chosen": -1.4575848579406738, "logits/rejected": -1.4886194467544556, "logps/chosen": -3.429673671722412, "logps/rejected": -176.4278106689453, "loss": 0.21111251413822174, "memory(GiB)": 45.96, "nll_loss": 0.20513850450515747, "rewards/accuracies": 1.0, "rewards/chosen": 0.4268459379673004, "rewards/margins": 16.01671600341797, "rewards/rejected": -15.589868545532227, "step": 719, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3616354061889828, "grad_norm": 0.8643395304679871, "learning_rate": 0.00012318201502675285, "logits/chosen": -1.4632608890533447, "logits/rejected": -1.496609091758728, "logps/chosen": -2.374844551086426, "logps/rejected": -159.74131774902344, "loss": 0.14827243983745575, "memory(GiB)": 45.96, "nll_loss": 0.11705812066793442, "rewards/accuracies": 0.96875, "rewards/chosen": 0.46328988671302795, "rewards/margins": 13.929129600524902, "rewards/rejected": -13.465839385986328, "step": 720, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3635287852789775, "grad_norm": 0.8877068161964417, "learning_rate": 0.00012297877234865588, "logits/chosen": -1.4121975898742676, "logits/rejected": -1.420471429824829, "logps/chosen": -7.728551864624023, "logps/rejected": -122.19908905029297, "loss": 0.2621362805366516, "memory(GiB)": 45.96, "nll_loss": 0.2564736008644104, "rewards/accuracies": 1.0, "rewards/chosen": 0.8202823400497437, "rewards/margins": 10.843989372253418, "rewards/rejected": -10.02370548248291, "step": 721, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3654221643689723, "grad_norm": 0.8817264437675476, "learning_rate": 0.00012277542940985779, "logits/chosen": -1.4238308668136597, "logits/rejected": -1.4451203346252441, "logps/chosen": -4.689065456390381, "logps/rejected": -126.12505340576172, "loss": 0.20782385766506195, "memory(GiB)": 45.96, "nll_loss": 0.19612634181976318, "rewards/accuracies": 1.0, "rewards/chosen": 0.6051958799362183, "rewards/margins": 11.33012580871582, "rewards/rejected": -10.724929809570312, "step": 722, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.367315543458967, "grad_norm": 1.012028455734253, "learning_rate": 0.00012257198709758195, "logits/chosen": -1.430659532546997, "logits/rejected": -1.455889105796814, "logps/chosen": -2.4323935508728027, "logps/rejected": -160.52789306640625, "loss": 0.15415363013744354, "memory(GiB)": 45.96, "nll_loss": 0.12620654702186584, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5517710447311401, "rewards/margins": 14.274921417236328, "rewards/rejected": -13.723150253295898, "step": 723, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3692089225489616, "grad_norm": 1.9171146154403687, "learning_rate": 0.00012236844629948538, "logits/chosen": -1.3615983724594116, "logits/rejected": -1.3914395570755005, "logps/chosen": -5.449278831481934, "logps/rejected": -129.47451782226562, "loss": 0.2664668560028076, "memory(GiB)": 45.96, "nll_loss": 0.2412000298500061, "rewards/accuracies": 1.0, "rewards/chosen": 0.679523229598999, "rewards/margins": 11.65814208984375, "rewards/rejected": -10.978619575500488, "step": 724, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3711023016389563, "grad_norm": 0.5200458765029907, "learning_rate": 0.00012216480790365488, "logits/chosen": -1.3722385168075562, "logits/rejected": -1.4049911499023438, "logps/chosen": -3.476780891418457, "logps/rejected": -159.24119567871094, "loss": 0.19099539518356323, "memory(GiB)": 45.96, "nll_loss": 0.16211548447608948, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41306477785110474, "rewards/margins": 14.28917121887207, "rewards/rejected": -13.876106262207031, "step": 725, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.372995680728951, "grad_norm": 3.351590156555176, "learning_rate": 0.00012196107279860301, "logits/chosen": -1.3456298112869263, "logits/rejected": -1.3633019924163818, "logps/chosen": -5.894962310791016, "logps/rejected": -127.60720825195312, "loss": 0.497927188873291, "memory(GiB)": 45.96, "nll_loss": 0.45556724071502686, "rewards/accuracies": 1.0, "rewards/chosen": 0.2950041890144348, "rewards/margins": 10.873826026916504, "rewards/rejected": -10.578822135925293, "step": 726, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3748890598189456, "grad_norm": 0.7161403894424438, "learning_rate": 0.00012175724187326428, "logits/chosen": -1.351697325706482, "logits/rejected": -1.3736845254898071, "logps/chosen": -3.959686517715454, "logps/rejected": -154.29759216308594, "loss": 0.19538988173007965, "memory(GiB)": 45.96, "nll_loss": 0.1853979378938675, "rewards/accuracies": 1.0, "rewards/chosen": 0.5529553294181824, "rewards/margins": 13.636305809020996, "rewards/rejected": -13.083351135253906, "step": 727, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3767824389089403, "grad_norm": 1.0838693380355835, "learning_rate": 0.00012155331601699136, "logits/chosen": -1.3614987134933472, "logits/rejected": -1.3678171634674072, "logps/chosen": -11.347692489624023, "logps/rejected": -108.63534545898438, "loss": 0.3933212459087372, "memory(GiB)": 45.96, "nll_loss": 0.35364362597465515, "rewards/accuracies": 1.0, "rewards/chosen": 0.7163238525390625, "rewards/margins": 9.661209106445312, "rewards/rejected": -8.94488525390625, "step": 728, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.378675817998935, "grad_norm": 0.7250790596008301, "learning_rate": 0.00012134929611955109, "logits/chosen": -1.360811471939087, "logits/rejected": -1.3907039165496826, "logps/chosen": -2.4135990142822266, "logps/rejected": -160.8827667236328, "loss": 0.1475839763879776, "memory(GiB)": 45.96, "nll_loss": 0.11929626762866974, "rewards/accuracies": 1.0, "rewards/chosen": 0.49388089776039124, "rewards/margins": 13.924455642700195, "rewards/rejected": -13.430574417114258, "step": 729, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3805691970889296, "grad_norm": 1.2542954683303833, "learning_rate": 0.00012114518307112053, "logits/chosen": -1.3999381065368652, "logits/rejected": -1.4196140766143799, "logps/chosen": -2.968822479248047, "logps/rejected": -147.8498077392578, "loss": 0.1501389890909195, "memory(GiB)": 45.96, "nll_loss": 0.13163243234157562, "rewards/accuracies": 1.0, "rewards/chosen": 0.47122716903686523, "rewards/margins": 13.5759859085083, "rewards/rejected": -13.104759216308594, "step": 730, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3824625761789244, "grad_norm": 0.6328426003456116, "learning_rate": 0.00012094097776228335, "logits/chosen": -1.3374364376068115, "logits/rejected": -1.3639745712280273, "logps/chosen": -3.418973445892334, "logps/rejected": -139.9619903564453, "loss": 0.149828240275383, "memory(GiB)": 45.96, "nll_loss": 0.11651848256587982, "rewards/accuracies": 0.96875, "rewards/chosen": 0.544003963470459, "rewards/margins": 12.12524700164795, "rewards/rejected": -11.581243515014648, "step": 731, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.384355955268919, "grad_norm": 0.8515809178352356, "learning_rate": 0.00012073668108402565, "logits/chosen": -1.404557704925537, "logits/rejected": -1.4227296113967896, "logps/chosen": -5.3266801834106445, "logps/rejected": -127.69633483886719, "loss": 0.23115482926368713, "memory(GiB)": 45.96, "nll_loss": 0.16876675188541412, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5588371753692627, "rewards/margins": 11.65122127532959, "rewards/rejected": -11.092384338378906, "step": 732, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3862493343589137, "grad_norm": 1.035111904144287, "learning_rate": 0.0001205322939277322, "logits/chosen": -1.3675159215927124, "logits/rejected": -1.377406358718872, "logps/chosen": -7.57385778427124, "logps/rejected": -113.66754150390625, "loss": 0.5253475904464722, "memory(GiB)": 45.96, "nll_loss": 0.5173190832138062, "rewards/accuracies": 1.0, "rewards/chosen": 0.6031939387321472, "rewards/margins": 10.4005708694458, "rewards/rejected": -9.79737663269043, "step": 733, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3881427134489084, "grad_norm": 0.7137688398361206, "learning_rate": 0.00012032781718518257, "logits/chosen": -1.400411605834961, "logits/rejected": -1.4152530431747437, "logps/chosen": -7.439002990722656, "logps/rejected": -134.11846923828125, "loss": 0.17674262821674347, "memory(GiB)": 45.96, "nll_loss": 0.1659688949584961, "rewards/accuracies": 1.0, "rewards/chosen": 0.8982738256454468, "rewards/margins": 12.587785720825195, "rewards/rejected": -11.689512252807617, "step": 734, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.390036092538903, "grad_norm": 1.0638463497161865, "learning_rate": 0.00012012325174854724, "logits/chosen": -1.381399393081665, "logits/rejected": -1.417229413986206, "logps/chosen": -4.133545398712158, "logps/rejected": -165.7884979248047, "loss": 0.1909055858850479, "memory(GiB)": 45.96, "nll_loss": 0.1588495373725891, "rewards/accuracies": 1.0, "rewards/chosen": 0.3287806212902069, "rewards/margins": 13.795286178588867, "rewards/rejected": -13.46650505065918, "step": 735, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3919294716288977, "grad_norm": 3.916788339614868, "learning_rate": 0.0001199185985103836, "logits/chosen": -1.3574695587158203, "logits/rejected": -1.3903796672821045, "logps/chosen": -4.943059921264648, "logps/rejected": -145.6674041748047, "loss": 0.3422682583332062, "memory(GiB)": 45.96, "nll_loss": 0.30081629753112793, "rewards/accuracies": 0.96875, "rewards/chosen": 0.46855008602142334, "rewards/margins": 12.823249816894531, "rewards/rejected": -12.35469913482666, "step": 736, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3938228507188923, "grad_norm": 0.7496212720870972, "learning_rate": 0.00011971385836363223, "logits/chosen": -1.3401854038238525, "logits/rejected": -1.3637409210205078, "logps/chosen": -3.160003662109375, "logps/rejected": -148.8011016845703, "loss": 0.13967886567115784, "memory(GiB)": 45.96, "nll_loss": 0.1187189519405365, "rewards/accuracies": 1.0, "rewards/chosen": 0.6559804677963257, "rewards/margins": 13.016501426696777, "rewards/rejected": -12.360520362854004, "step": 737, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.395716229808887, "grad_norm": 0.8836220502853394, "learning_rate": 0.00011950903220161285, "logits/chosen": -1.2783434391021729, "logits/rejected": -1.291855812072754, "logps/chosen": -5.08381462097168, "logps/rejected": -125.47669982910156, "loss": 0.23457510769367218, "memory(GiB)": 45.96, "nll_loss": 0.22920887172222137, "rewards/accuracies": 1.0, "rewards/chosen": 0.725649356842041, "rewards/margins": 11.28402328491211, "rewards/rejected": -10.558374404907227, "step": 738, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3976096088988816, "grad_norm": 0.9596480131149292, "learning_rate": 0.00011930412091802044, "logits/chosen": -1.23847234249115, "logits/rejected": -1.2562484741210938, "logps/chosen": -6.178463935852051, "logps/rejected": -124.13822174072266, "loss": 0.2189672887325287, "memory(GiB)": 45.96, "nll_loss": 0.21428486704826355, "rewards/accuracies": 1.0, "rewards/chosen": 0.5073556303977966, "rewards/margins": 11.04176139831543, "rewards/rejected": -10.534406661987305, "step": 739, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.3995029879888765, "grad_norm": 1.186428189277649, "learning_rate": 0.00011909912540692148, "logits/chosen": -1.2327266931533813, "logits/rejected": -1.2502973079681396, "logps/chosen": -3.5932505130767822, "logps/rejected": -124.90965270996094, "loss": 0.2263035923242569, "memory(GiB)": 45.96, "nll_loss": 0.17550766468048096, "rewards/accuracies": 1.0, "rewards/chosen": 0.47944796085357666, "rewards/margins": 11.442840576171875, "rewards/rejected": -10.963393211364746, "step": 740, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.401396367078871, "grad_norm": 0.9400050640106201, "learning_rate": 0.00011889404656274985, "logits/chosen": -1.2746970653533936, "logits/rejected": -1.301072359085083, "logps/chosen": -4.578012943267822, "logps/rejected": -143.21412658691406, "loss": 0.14633478224277496, "memory(GiB)": 45.96, "nll_loss": 0.14389167726039886, "rewards/accuracies": 1.0, "rewards/chosen": 0.4045856297016144, "rewards/margins": 12.573046684265137, "rewards/rejected": -12.168460845947266, "step": 741, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.4032897461688658, "grad_norm": 12.828886032104492, "learning_rate": 0.00011868888528030312, "logits/chosen": -1.290102481842041, "logits/rejected": -1.3054649829864502, "logps/chosen": -7.718609809875488, "logps/rejected": -142.0688934326172, "loss": 1.2448090314865112, "memory(GiB)": 45.96, "nll_loss": 0.6703987121582031, "rewards/accuracies": 0.9375, "rewards/chosen": -0.06796294450759888, "rewards/margins": 12.493032455444336, "rewards/rejected": -12.560995101928711, "step": 742, "train_speed(iter/s)": 0.005584 }, { "epoch": 1.4051831252588605, "grad_norm": 2.3734612464904785, "learning_rate": 0.00011848364245473851, "logits/chosen": -1.277733325958252, "logits/rejected": -1.2968937158584595, "logps/chosen": -5.408899784088135, "logps/rejected": -135.39718627929688, "loss": 0.4479808509349823, "memory(GiB)": 45.96, "nll_loss": 0.44413915276527405, "rewards/accuracies": 1.0, "rewards/chosen": 0.3601748049259186, "rewards/margins": 11.691971778869629, "rewards/rejected": -11.331796646118164, "step": 743, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.4070765043488551, "grad_norm": 0.9128540754318237, "learning_rate": 0.00011827831898156905, "logits/chosen": -1.227461814880371, "logits/rejected": -1.2495135068893433, "logps/chosen": -1.9151227474212646, "logps/rejected": -136.8602752685547, "loss": 0.14868707954883575, "memory(GiB)": 45.96, "nll_loss": 0.12404179573059082, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5372089147567749, "rewards/margins": 12.386828422546387, "rewards/rejected": -11.849618911743164, "step": 744, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.4089698834388498, "grad_norm": 1.1429063081741333, "learning_rate": 0.0001180729157566596, "logits/chosen": -1.2368712425231934, "logits/rejected": -1.2416596412658691, "logps/chosen": -4.958278179168701, "logps/rejected": -103.30583190917969, "loss": 0.21024346351623535, "memory(GiB)": 45.96, "nll_loss": 0.1912650763988495, "rewards/accuracies": 1.0, "rewards/chosen": 0.3631391227245331, "rewards/margins": 9.275796890258789, "rewards/rejected": -8.912657737731934, "step": 745, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.4108632625288444, "grad_norm": 1.0790748596191406, "learning_rate": 0.00011786743367622301, "logits/chosen": -1.1736490726470947, "logits/rejected": -1.1861443519592285, "logps/chosen": -2.616354465484619, "logps/rejected": -102.14070129394531, "loss": 0.19070766866207123, "memory(GiB)": 45.96, "nll_loss": 0.1813308298587799, "rewards/accuracies": 1.0, "rewards/chosen": 0.3258036971092224, "rewards/margins": 8.927370071411133, "rewards/rejected": -8.601566314697266, "step": 746, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.412756641618839, "grad_norm": 0.5030332803726196, "learning_rate": 0.00011766187363681622, "logits/chosen": -1.1803619861602783, "logits/rejected": -1.1944257020950317, "logps/chosen": -4.902136325836182, "logps/rejected": -123.20097351074219, "loss": 0.14166034758090973, "memory(GiB)": 45.96, "nll_loss": 0.13693617284297943, "rewards/accuracies": 1.0, "rewards/chosen": 0.4183957576751709, "rewards/margins": 10.870806694030762, "rewards/rejected": -10.452409744262695, "step": 747, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.4146500207088337, "grad_norm": 15.55799388885498, "learning_rate": 0.00011745623653533633, "logits/chosen": -1.242021083831787, "logits/rejected": -1.266333818435669, "logps/chosen": -4.228762149810791, "logps/rejected": -99.54964447021484, "loss": 0.4001218378543854, "memory(GiB)": 45.96, "nll_loss": 0.31423306465148926, "rewards/accuracies": 0.96875, "rewards/chosen": 0.49108681082725525, "rewards/margins": 8.478590965270996, "rewards/rejected": -7.987504959106445, "step": 748, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.4165433997988286, "grad_norm": 0.9360311627388, "learning_rate": 0.00011725052326901662, "logits/chosen": -1.2178735733032227, "logits/rejected": -1.2292119264602661, "logps/chosen": -5.197657585144043, "logps/rejected": -93.74435424804688, "loss": 0.22836686670780182, "memory(GiB)": 45.96, "nll_loss": 0.18862150609493256, "rewards/accuracies": 1.0, "rewards/chosen": 0.4481957256793976, "rewards/margins": 8.137001037597656, "rewards/rejected": -7.688804626464844, "step": 749, "train_speed(iter/s)": 0.005585 }, { "epoch": 1.418436778888823, "grad_norm": 0.9867538809776306, "learning_rate": 0.0001170447347354227, "logits/chosen": -1.2246237993240356, "logits/rejected": -1.2385095357894897, "logps/chosen": -2.0182390213012695, "logps/rejected": -94.68486022949219, "loss": 0.13907429575920105, "memory(GiB)": 45.96, "nll_loss": 0.12384593486785889, "rewards/accuracies": 1.0, "rewards/chosen": 0.5055228471755981, "rewards/margins": 8.253795623779297, "rewards/rejected": -7.7482733726501465, "step": 750, "train_speed(iter/s)": 0.005585 } ], "logging_steps": 1, "max_steps": 1584, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.260421268267598e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }