{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.09466895449973374, "eval_steps": 300, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0018933790899946748, "grad_norm": 12.48285961151123, "learning_rate": 2.5e-06, "logits/chosen": -0.600911557674408, "logits/rejected": -0.6057144403457642, "logps/chosen": -8.623997688293457, "logps/rejected": -21.27922248840332, "loss": 1.5083240270614624, "memory(GiB)": 45.96, "nll_loss": 0.8151768445968628, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005677 }, { "epoch": 0.0037867581799893497, "grad_norm": 12.232138633728027, "learning_rate": 5e-06, "logits/chosen": -0.6421620845794678, "logits/rejected": -0.6454498767852783, "logps/chosen": -10.60006046295166, "logps/rejected": -13.605328559875488, "loss": 1.547582983970642, "memory(GiB)": 45.96, "nll_loss": 0.8544361591339111, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005654 }, { "epoch": 0.005680137269984025, "grad_norm": 14.417566299438477, "learning_rate": 7.5e-06, "logits/chosen": -0.664191484451294, "logits/rejected": -0.6654082536697388, "logps/chosen": -11.958788871765137, "logps/rejected": -13.785713195800781, "loss": 1.6179333925247192, "memory(GiB)": 45.96, "nll_loss": 0.9271513819694519, "rewards/accuracies": 0.59375, "rewards/chosen": 0.003109893761575222, "rewards/margins": 0.0048811971209943295, "rewards/rejected": -0.0017713033594191074, "step": 3, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.007573516359978699, "grad_norm": 8.840044975280762, "learning_rate": 1e-05, "logits/chosen": -0.6362882256507874, "logits/rejected": -0.6385632753372192, "logps/chosen": -9.689570426940918, "logps/rejected": -18.226909637451172, "loss": 1.4001612663269043, "memory(GiB)": 45.96, "nll_loss": 0.7101836204528809, "rewards/accuracies": 0.59375, "rewards/chosen": 0.005959533154964447, "rewards/margins": 0.00653040548786521, "rewards/rejected": -0.0005708730313926935, "step": 4, "train_speed(iter/s)": 0.005654 }, { "epoch": 0.009466895449973374, "grad_norm": 12.643730163574219, "learning_rate": 1.25e-05, "logits/chosen": -0.6108935475349426, "logits/rejected": -0.6125737428665161, "logps/chosen": -10.900370597839355, "logps/rejected": -16.267436981201172, "loss": 1.5408352613449097, "memory(GiB)": 45.96, "nll_loss": 0.853638768196106, "rewards/accuracies": 0.6875, "rewards/chosen": 0.018230972811579704, "rewards/margins": 0.01212537381798029, "rewards/rejected": 0.006105600390583277, "step": 5, "train_speed(iter/s)": 0.005633 }, { "epoch": 0.01136027453996805, "grad_norm": 13.595820426940918, "learning_rate": 1.5e-05, "logits/chosen": -0.6641858220100403, "logits/rejected": -0.6705058217048645, "logps/chosen": -7.528585910797119, "logps/rejected": -18.073911666870117, "loss": 1.4404857158660889, "memory(GiB)": 45.96, "nll_loss": 0.7598920464515686, "rewards/accuracies": 0.71875, "rewards/chosen": 0.034823305904865265, "rewards/margins": 0.026311496272683144, "rewards/rejected": 0.008511810563504696, "step": 6, "train_speed(iter/s)": 0.005634 }, { "epoch": 0.013253653629962723, "grad_norm": 13.2615385055542, "learning_rate": 1.75e-05, "logits/chosen": -0.6327687501907349, "logits/rejected": -0.637922465801239, "logps/chosen": -8.100177764892578, "logps/rejected": -22.4697322845459, "loss": 1.310943603515625, "memory(GiB)": 45.96, "nll_loss": 0.6429428458213806, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07164613902568817, "rewards/margins": 0.053715869784355164, "rewards/rejected": 0.017930276691913605, "step": 7, "train_speed(iter/s)": 0.005641 }, { "epoch": 0.015147032719957399, "grad_norm": 9.518823623657227, "learning_rate": 2e-05, "logits/chosen": -0.6458379626274109, "logits/rejected": -0.6480465531349182, "logps/chosen": -8.227258682250977, "logps/rejected": -15.074575424194336, "loss": 1.2895722389221191, "memory(GiB)": 45.96, "nll_loss": 0.6121883392333984, "rewards/accuracies": 0.5625, "rewards/chosen": 0.11458335816860199, "rewards/margins": 0.04461951553821564, "rewards/rejected": 0.06996384263038635, "step": 8, "train_speed(iter/s)": 0.005657 }, { "epoch": 0.017040411809952073, "grad_norm": 5.971006393432617, "learning_rate": 2.25e-05, "logits/chosen": -0.6322387456893921, "logits/rejected": -0.6355814933776855, "logps/chosen": -6.8561859130859375, "logps/rejected": -16.394319534301758, "loss": 1.1358637809753418, "memory(GiB)": 45.96, "nll_loss": 0.4396786093711853, "rewards/accuracies": 0.5, "rewards/chosen": 0.126601442694664, "rewards/margins": 0.027468431740999222, "rewards/rejected": 0.09913301467895508, "step": 9, "train_speed(iter/s)": 0.005656 }, { "epoch": 0.018933790899946748, "grad_norm": 4.615151405334473, "learning_rate": 2.5e-05, "logits/chosen": -0.6353996992111206, "logits/rejected": -0.6420772075653076, "logps/chosen": -4.39181661605835, "logps/rejected": -19.73300552368164, "loss": 0.98687344789505, "memory(GiB)": 45.96, "nll_loss": 0.38576164841651917, "rewards/accuracies": 0.6875, "rewards/chosen": 0.196926087141037, "rewards/margins": 0.274502158164978, "rewards/rejected": -0.07757607102394104, "step": 10, "train_speed(iter/s)": 0.005651 }, { "epoch": 0.020827169989941424, "grad_norm": 3.6985604763031006, "learning_rate": 2.7500000000000004e-05, "logits/chosen": -0.6321280002593994, "logits/rejected": -0.6365548968315125, "logps/chosen": -7.2246904373168945, "logps/rejected": -19.404216766357422, "loss": 0.9879567623138428, "memory(GiB)": 45.96, "nll_loss": 0.36671119928359985, "rewards/accuracies": 0.625, "rewards/chosen": 0.12358222156763077, "rewards/margins": 0.28244268894195557, "rewards/rejected": -0.1588604599237442, "step": 11, "train_speed(iter/s)": 0.005662 }, { "epoch": 0.0227205490799361, "grad_norm": 7.83486270904541, "learning_rate": 3e-05, "logits/chosen": -0.6391905546188354, "logits/rejected": -0.6451292634010315, "logps/chosen": -8.3941011428833, "logps/rejected": -24.687467575073242, "loss": 1.1386761665344238, "memory(GiB)": 45.96, "nll_loss": 0.3862188458442688, "rewards/accuracies": 0.59375, "rewards/chosen": -0.004531089216470718, "rewards/margins": 0.17587248980998993, "rewards/rejected": -0.18040357530117035, "step": 12, "train_speed(iter/s)": 0.005646 }, { "epoch": 0.024613928169930775, "grad_norm": 5.917618274688721, "learning_rate": 3.2500000000000004e-05, "logits/chosen": -0.6517987251281738, "logits/rejected": -0.658316969871521, "logps/chosen": -6.573670387268066, "logps/rejected": -19.874000549316406, "loss": 1.050663948059082, "memory(GiB)": 45.96, "nll_loss": 0.40407559275627136, "rewards/accuracies": 0.59375, "rewards/chosen": 0.10255793482065201, "rewards/margins": 0.36497071385383606, "rewards/rejected": -0.26241275668144226, "step": 13, "train_speed(iter/s)": 0.00565 }, { "epoch": 0.026507307259925447, "grad_norm": 4.1237287521362305, "learning_rate": 3.5e-05, "logits/chosen": -0.61805260181427, "logits/rejected": -0.6224305033683777, "logps/chosen": -5.8840789794921875, "logps/rejected": -29.290557861328125, "loss": 0.9034114480018616, "memory(GiB)": 45.96, "nll_loss": 0.33107179403305054, "rewards/accuracies": 0.6875, "rewards/chosen": 0.13439905643463135, "rewards/margins": 0.5032773017883301, "rewards/rejected": -0.36887818574905396, "step": 14, "train_speed(iter/s)": 0.005633 }, { "epoch": 0.028400686349920122, "grad_norm": 2.141984701156616, "learning_rate": 3.7500000000000003e-05, "logits/chosen": -0.6251233816146851, "logits/rejected": -0.6291872262954712, "logps/chosen": -5.3556623458862305, "logps/rejected": -22.30205535888672, "loss": 0.7756511569023132, "memory(GiB)": 45.96, "nll_loss": 0.22363990545272827, "rewards/accuracies": 0.78125, "rewards/chosen": 0.21060410141944885, "rewards/margins": 0.5203964710235596, "rewards/rejected": -0.30979233980178833, "step": 15, "train_speed(iter/s)": 0.005622 }, { "epoch": 0.030294065439914798, "grad_norm": 6.157620906829834, "learning_rate": 4e-05, "logits/chosen": -0.6184762716293335, "logits/rejected": -0.6184364557266235, "logps/chosen": -10.368714332580566, "logps/rejected": -12.033210754394531, "loss": 1.4029701948165894, "memory(GiB)": 45.96, "nll_loss": 0.6103286743164062, "rewards/accuracies": 0.40625, "rewards/chosen": -0.020060203969478607, "rewards/margins": -0.03359239548444748, "rewards/rejected": 0.013532169163227081, "step": 16, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.03218744452990947, "grad_norm": 2.690070152282715, "learning_rate": 4.25e-05, "logits/chosen": -0.6329092383384705, "logits/rejected": -0.6367439031600952, "logps/chosen": -6.010343551635742, "logps/rejected": -17.85470199584961, "loss": 0.8949607610702515, "memory(GiB)": 45.96, "nll_loss": 0.3054018020629883, "rewards/accuracies": 0.65625, "rewards/chosen": 0.25051170587539673, "rewards/margins": 0.37515202164649963, "rewards/rejected": -0.12464030832052231, "step": 17, "train_speed(iter/s)": 0.00562 }, { "epoch": 0.034080823619904145, "grad_norm": 2.8276467323303223, "learning_rate": 4.5e-05, "logits/chosen": -0.6264123320579529, "logits/rejected": -0.6279273629188538, "logps/chosen": -9.41238021850586, "logps/rejected": -18.639442443847656, "loss": 1.0180559158325195, "memory(GiB)": 45.96, "nll_loss": 0.3220836818218231, "rewards/accuracies": 0.59375, "rewards/chosen": 0.1841900646686554, "rewards/margins": 0.13813874125480652, "rewards/rejected": 0.04605132341384888, "step": 18, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.035974202709898824, "grad_norm": 2.10530161857605, "learning_rate": 4.75e-05, "logits/chosen": -0.6376557946205139, "logits/rejected": -0.6416239738464355, "logps/chosen": -5.7143964767456055, "logps/rejected": -16.784849166870117, "loss": 0.9154303669929504, "memory(GiB)": 45.96, "nll_loss": 0.2545720934867859, "rewards/accuracies": 0.59375, "rewards/chosen": 0.24181872606277466, "rewards/margins": 0.18784700334072113, "rewards/rejected": 0.05397173762321472, "step": 19, "train_speed(iter/s)": 0.00562 }, { "epoch": 0.037867581799893496, "grad_norm": 2.357306480407715, "learning_rate": 5e-05, "logits/chosen": -0.6326904296875, "logits/rejected": -0.6354666352272034, "logps/chosen": -5.867492198944092, "logps/rejected": -13.818038940429688, "loss": 0.9468417167663574, "memory(GiB)": 45.96, "nll_loss": 0.3124926686286926, "rewards/accuracies": 0.59375, "rewards/chosen": 0.3217320740222931, "rewards/margins": 0.22124268114566803, "rewards/rejected": 0.10048942267894745, "step": 20, "train_speed(iter/s)": 0.005628 }, { "epoch": 0.039760960889888175, "grad_norm": 2.5859196186065674, "learning_rate": 5.25e-05, "logits/chosen": -0.6597320437431335, "logits/rejected": -0.6610896587371826, "logps/chosen": -7.943680286407471, "logps/rejected": -11.634421348571777, "loss": 1.0064345598220825, "memory(GiB)": 45.96, "nll_loss": 0.3732220232486725, "rewards/accuracies": 0.6875, "rewards/chosen": 0.3646732270717621, "rewards/margins": 0.21462492644786835, "rewards/rejected": 0.15004827082157135, "step": 21, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.04165433997988285, "grad_norm": 2.20487642288208, "learning_rate": 5.500000000000001e-05, "logits/chosen": -0.6439244151115417, "logits/rejected": -0.6464219093322754, "logps/chosen": -4.180229187011719, "logps/rejected": -19.56499481201172, "loss": 0.9136227369308472, "memory(GiB)": 45.96, "nll_loss": 0.22558730840682983, "rewards/accuracies": 0.5625, "rewards/chosen": 0.25369688868522644, "rewards/margins": 0.14792592823505402, "rewards/rejected": 0.10577096790075302, "step": 22, "train_speed(iter/s)": 0.00562 }, { "epoch": 0.04354771906987752, "grad_norm": 2.80965518951416, "learning_rate": 5.7499999999999995e-05, "logits/chosen": -0.5748096108436584, "logits/rejected": -0.5799225568771362, "logps/chosen": -5.921882629394531, "logps/rejected": -22.432538986206055, "loss": 0.9860997796058655, "memory(GiB)": 45.96, "nll_loss": 0.3462521731853485, "rewards/accuracies": 0.625, "rewards/chosen": 0.24639810621738434, "rewards/margins": 0.1898707151412964, "rewards/rejected": 0.05652741342782974, "step": 23, "train_speed(iter/s)": 0.005621 }, { "epoch": 0.0454410981598722, "grad_norm": 2.9503355026245117, "learning_rate": 6e-05, "logits/chosen": -0.6007645726203918, "logits/rejected": -0.6086101531982422, "logps/chosen": -5.338952541351318, "logps/rejected": -26.883895874023438, "loss": 0.9453619122505188, "memory(GiB)": 45.96, "nll_loss": 0.3667706847190857, "rewards/accuracies": 0.6875, "rewards/chosen": 0.392182856798172, "rewards/margins": 0.36902523040771484, "rewards/rejected": 0.02315761335194111, "step": 24, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.04733447724986687, "grad_norm": 2.2843515872955322, "learning_rate": 6.25e-05, "logits/chosen": -0.6047165393829346, "logits/rejected": -0.608917772769928, "logps/chosen": -6.276377201080322, "logps/rejected": -21.095470428466797, "loss": 0.914051353931427, "memory(GiB)": 45.96, "nll_loss": 0.3292374610900879, "rewards/accuracies": 0.6875, "rewards/chosen": 0.3036147356033325, "rewards/margins": 0.32923099398612976, "rewards/rejected": -0.025616232305765152, "step": 25, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.04922785633986155, "grad_norm": 2.7294957637786865, "learning_rate": 6.500000000000001e-05, "logits/chosen": -0.6337023377418518, "logits/rejected": -0.6374361515045166, "logps/chosen": -7.032902240753174, "logps/rejected": -24.937816619873047, "loss": 0.8451516032218933, "memory(GiB)": 45.96, "nll_loss": 0.25359871983528137, "rewards/accuracies": 0.65625, "rewards/chosen": 0.24989479780197144, "rewards/margins": 0.3727536201477051, "rewards/rejected": -0.12285882234573364, "step": 26, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.05112123542985622, "grad_norm": 1.9816867113113403, "learning_rate": 6.750000000000001e-05, "logits/chosen": -0.6674913167953491, "logits/rejected": -0.6716790795326233, "logps/chosen": -3.894029378890991, "logps/rejected": -19.461292266845703, "loss": 0.720669686794281, "memory(GiB)": 45.96, "nll_loss": 0.1943943053483963, "rewards/accuracies": 0.78125, "rewards/chosen": 0.40334552526474, "rewards/margins": 0.5223954319953918, "rewards/rejected": -0.11904986202716827, "step": 27, "train_speed(iter/s)": 0.005612 }, { "epoch": 0.05301461451985089, "grad_norm": 1.9561638832092285, "learning_rate": 7e-05, "logits/chosen": -0.6560395359992981, "logits/rejected": -0.6615370512008667, "logps/chosen": -3.828300952911377, "logps/rejected": -27.646583557128906, "loss": 0.7324035167694092, "memory(GiB)": 45.96, "nll_loss": 0.18986308574676514, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2855417728424072, "rewards/margins": 0.5658388733863831, "rewards/rejected": -0.28029707074165344, "step": 28, "train_speed(iter/s)": 0.005609 }, { "epoch": 0.05490799360984557, "grad_norm": 2.197960376739502, "learning_rate": 7.25e-05, "logits/chosen": -0.6013461351394653, "logits/rejected": -0.6078683733940125, "logps/chosen": -5.841001987457275, "logps/rejected": -28.59882926940918, "loss": 0.763361930847168, "memory(GiB)": 45.96, "nll_loss": 0.29682645201683044, "rewards/accuracies": 0.75, "rewards/chosen": 0.33854252099990845, "rewards/margins": 0.7552333474159241, "rewards/rejected": -0.416690856218338, "step": 29, "train_speed(iter/s)": 0.005603 }, { "epoch": 0.056801372699840244, "grad_norm": 4.102924823760986, "learning_rate": 7.500000000000001e-05, "logits/chosen": -0.6362655758857727, "logits/rejected": -0.6371059417724609, "logps/chosen": -6.047646522521973, "logps/rejected": -16.402286529541016, "loss": 0.930861234664917, "memory(GiB)": 45.96, "nll_loss": 0.33219844102859497, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2280413955450058, "rewards/margins": 0.48401153087615967, "rewards/rejected": -0.25597015023231506, "step": 30, "train_speed(iter/s)": 0.005604 }, { "epoch": 0.05869475178983492, "grad_norm": 2.643806219100952, "learning_rate": 7.75e-05, "logits/chosen": -0.6917952299118042, "logits/rejected": -0.6954830884933472, "logps/chosen": -4.5008368492126465, "logps/rejected": -25.313228607177734, "loss": 0.7698233127593994, "memory(GiB)": 45.96, "nll_loss": 0.21702390909194946, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2267376184463501, "rewards/margins": 0.6824056506156921, "rewards/rejected": -0.4556680917739868, "step": 31, "train_speed(iter/s)": 0.005603 }, { "epoch": 0.060588130879829595, "grad_norm": 3.9089903831481934, "learning_rate": 8e-05, "logits/chosen": -0.6848002672195435, "logits/rejected": -0.6877056360244751, "logps/chosen": -9.047338485717773, "logps/rejected": -25.891061782836914, "loss": 0.9844011068344116, "memory(GiB)": 45.96, "nll_loss": 0.3213033378124237, "rewards/accuracies": 0.59375, "rewards/chosen": 0.13390681147575378, "rewards/margins": 0.6111294031143188, "rewards/rejected": -0.4772225618362427, "step": 32, "train_speed(iter/s)": 0.005603 }, { "epoch": 0.062481509969824274, "grad_norm": 3.631053924560547, "learning_rate": 8.25e-05, "logits/chosen": -0.6787916421890259, "logits/rejected": -0.681725025177002, "logps/chosen": -11.23558521270752, "logps/rejected": -24.226280212402344, "loss": 1.1201726198196411, "memory(GiB)": 45.96, "nll_loss": 0.5571246147155762, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2192046195268631, "rewards/margins": 0.6016167402267456, "rewards/rejected": -0.3824121356010437, "step": 33, "train_speed(iter/s)": 0.00561 }, { "epoch": 0.06437488905981895, "grad_norm": 2.667919158935547, "learning_rate": 8.5e-05, "logits/chosen": -0.7005462646484375, "logits/rejected": -0.7055037021636963, "logps/chosen": -3.1784541606903076, "logps/rejected": -23.535545349121094, "loss": 0.638558566570282, "memory(GiB)": 45.96, "nll_loss": 0.23515944182872772, "rewards/accuracies": 0.8125, "rewards/chosen": 0.27606871724128723, "rewards/margins": 1.0784178972244263, "rewards/rejected": -0.8023491501808167, "step": 34, "train_speed(iter/s)": 0.005611 }, { "epoch": 0.06626826814981363, "grad_norm": 4.037520408630371, "learning_rate": 8.75e-05, "logits/chosen": -0.7001099586486816, "logits/rejected": -0.7051636576652527, "logps/chosen": -6.665594577789307, "logps/rejected": -30.973716735839844, "loss": 0.848934531211853, "memory(GiB)": 45.96, "nll_loss": 0.38612014055252075, "rewards/accuracies": 0.75, "rewards/chosen": 0.15037909150123596, "rewards/margins": 1.0571930408477783, "rewards/rejected": -0.9068138599395752, "step": 35, "train_speed(iter/s)": 0.005618 }, { "epoch": 0.06816164723980829, "grad_norm": 3.6542232036590576, "learning_rate": 9e-05, "logits/chosen": -0.7070563435554504, "logits/rejected": -0.7053466439247131, "logps/chosen": -5.064585208892822, "logps/rejected": -19.19178581237793, "loss": 0.7724434733390808, "memory(GiB)": 45.96, "nll_loss": 0.26881077885627747, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2176203727722168, "rewards/margins": 0.7342812418937683, "rewards/rejected": -0.5166608095169067, "step": 36, "train_speed(iter/s)": 0.005617 }, { "epoch": 0.07005502632980297, "grad_norm": 3.4213714599609375, "learning_rate": 9.250000000000001e-05, "logits/chosen": -0.7090893387794495, "logits/rejected": -0.7106159329414368, "logps/chosen": -10.25515365600586, "logps/rejected": -24.033281326293945, "loss": 0.9920384883880615, "memory(GiB)": 45.96, "nll_loss": 0.46471139788627625, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0965394526720047, "rewards/margins": 0.8922154307365417, "rewards/rejected": -0.7956759929656982, "step": 37, "train_speed(iter/s)": 0.005619 }, { "epoch": 0.07194840541979765, "grad_norm": 5.325904846191406, "learning_rate": 9.5e-05, "logits/chosen": -0.657074511051178, "logits/rejected": -0.6611977815628052, "logps/chosen": -11.612046241760254, "logps/rejected": -27.249744415283203, "loss": 0.8334037065505981, "memory(GiB)": 45.96, "nll_loss": 0.3489510715007782, "rewards/accuracies": 0.75, "rewards/chosen": 0.12560953199863434, "rewards/margins": 0.9447187781333923, "rewards/rejected": -0.819109320640564, "step": 38, "train_speed(iter/s)": 0.005622 }, { "epoch": 0.07384178450979231, "grad_norm": 2.9407873153686523, "learning_rate": 9.75e-05, "logits/chosen": -0.7148993611335754, "logits/rejected": -0.7166731357574463, "logps/chosen": -7.349883079528809, "logps/rejected": -25.866724014282227, "loss": 0.7971550822257996, "memory(GiB)": 45.96, "nll_loss": 0.3317265808582306, "rewards/accuracies": 0.75, "rewards/chosen": 0.1786963939666748, "rewards/margins": 0.9361187815666199, "rewards/rejected": -0.7574224472045898, "step": 39, "train_speed(iter/s)": 0.005621 }, { "epoch": 0.07573516359978699, "grad_norm": 7.271725654602051, "learning_rate": 0.0001, "logits/chosen": -0.6494594216346741, "logits/rejected": -0.6519922018051147, "logps/chosen": -10.921842575073242, "logps/rejected": -26.213640213012695, "loss": 1.3029272556304932, "memory(GiB)": 45.96, "nll_loss": 0.7071102261543274, "rewards/accuracies": 0.6875, "rewards/chosen": 0.04726380109786987, "rewards/margins": 0.7260035276412964, "rewards/rejected": -0.6787396669387817, "step": 40, "train_speed(iter/s)": 0.005622 }, { "epoch": 0.07762854268978167, "grad_norm": 2.3149876594543457, "learning_rate": 0.0001025, "logits/chosen": -0.6998907327651978, "logits/rejected": -0.7039870023727417, "logps/chosen": -4.173505783081055, "logps/rejected": -23.617250442504883, "loss": 0.5567827224731445, "memory(GiB)": 45.96, "nll_loss": 0.22731299698352814, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3785739839076996, "rewards/margins": 1.2282123565673828, "rewards/rejected": -0.8496384620666504, "step": 41, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.07952192177977635, "grad_norm": 2.81628155708313, "learning_rate": 0.000105, "logits/chosen": -0.7065268754959106, "logits/rejected": -0.7109476923942566, "logps/chosen": -7.945868492126465, "logps/rejected": -28.209381103515625, "loss": 0.9143926501274109, "memory(GiB)": 45.96, "nll_loss": 0.45929795503616333, "rewards/accuracies": 0.78125, "rewards/chosen": 0.14874038100242615, "rewards/margins": 0.9704731702804565, "rewards/rejected": -0.8217328786849976, "step": 42, "train_speed(iter/s)": 0.005624 }, { "epoch": 0.08141530086977102, "grad_norm": 5.763336658477783, "learning_rate": 0.0001075, "logits/chosen": -0.6870285868644714, "logits/rejected": -0.6968757510185242, "logps/chosen": -5.37760066986084, "logps/rejected": -30.209644317626953, "loss": 1.0033479928970337, "memory(GiB)": 45.96, "nll_loss": 0.5952383279800415, "rewards/accuracies": 0.8125, "rewards/chosen": 0.25675737857818604, "rewards/margins": 1.0465596914291382, "rewards/rejected": -0.7898023128509521, "step": 43, "train_speed(iter/s)": 0.005627 }, { "epoch": 0.0833086799597657, "grad_norm": 5.945868015289307, "learning_rate": 0.00011000000000000002, "logits/chosen": -0.6680281758308411, "logits/rejected": -0.6685014963150024, "logps/chosen": -11.777937889099121, "logps/rejected": -14.195478439331055, "loss": 1.2500255107879639, "memory(GiB)": 45.96, "nll_loss": 0.6744679808616638, "rewards/accuracies": 0.75, "rewards/chosen": 0.2654823362827301, "rewards/margins": 0.44828659296035767, "rewards/rejected": -0.18280424177646637, "step": 44, "train_speed(iter/s)": 0.005626 }, { "epoch": 0.08520205904976037, "grad_norm": 3.6887738704681396, "learning_rate": 0.00011250000000000001, "logits/chosen": -0.6420993804931641, "logits/rejected": -0.649295449256897, "logps/chosen": -5.845967769622803, "logps/rejected": -29.958538055419922, "loss": 0.8367453217506409, "memory(GiB)": 45.96, "nll_loss": 0.40336742997169495, "rewards/accuracies": 0.8125, "rewards/chosen": 0.25286757946014404, "rewards/margins": 0.9195659160614014, "rewards/rejected": -0.6666983962059021, "step": 45, "train_speed(iter/s)": 0.005627 }, { "epoch": 0.08709543813975504, "grad_norm": 2.1550676822662354, "learning_rate": 0.00011499999999999999, "logits/chosen": -0.6583084464073181, "logits/rejected": -0.6640565395355225, "logps/chosen": -2.7918519973754883, "logps/rejected": -30.053329467773438, "loss": 0.6384420394897461, "memory(GiB)": 45.96, "nll_loss": 0.16433243453502655, "rewards/accuracies": 0.75, "rewards/chosen": 0.33078277111053467, "rewards/margins": 0.8035537004470825, "rewards/rejected": -0.4727708697319031, "step": 46, "train_speed(iter/s)": 0.005628 }, { "epoch": 0.08898881722974972, "grad_norm": 1.9267369508743286, "learning_rate": 0.00011750000000000001, "logits/chosen": -0.6443086266517639, "logits/rejected": -0.6484851837158203, "logps/chosen": -6.4907331466674805, "logps/rejected": -26.10548973083496, "loss": 0.8166890740394592, "memory(GiB)": 45.96, "nll_loss": 0.2826446294784546, "rewards/accuracies": 0.75, "rewards/chosen": 0.33410829305648804, "rewards/margins": 0.7130259275436401, "rewards/rejected": -0.3789176642894745, "step": 47, "train_speed(iter/s)": 0.005627 }, { "epoch": 0.0908821963197444, "grad_norm": 2.238929510116577, "learning_rate": 0.00012, "logits/chosen": -0.6500992774963379, "logits/rejected": -0.6550747156143188, "logps/chosen": -6.974908351898193, "logps/rejected": -25.759687423706055, "loss": 0.8363897800445557, "memory(GiB)": 45.96, "nll_loss": 0.26740241050720215, "rewards/accuracies": 0.625, "rewards/chosen": 0.2779407501220703, "rewards/margins": 0.71395343542099, "rewards/rejected": -0.43601274490356445, "step": 48, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.09277557540973908, "grad_norm": 2.5497782230377197, "learning_rate": 0.00012250000000000002, "logits/chosen": -0.676102876663208, "logits/rejected": -0.676883339881897, "logps/chosen": -6.410519599914551, "logps/rejected": -17.417396545410156, "loss": 0.9155470728874207, "memory(GiB)": 45.96, "nll_loss": 0.3170667886734009, "rewards/accuracies": 0.5625, "rewards/chosen": 0.24874374270439148, "rewards/margins": 0.6556647419929504, "rewards/rejected": -0.40692102909088135, "step": 49, "train_speed(iter/s)": 0.005623 }, { "epoch": 0.09466895449973374, "grad_norm": 2.275879144668579, "learning_rate": 0.000125, "logits/chosen": -0.6682412028312683, "logits/rejected": -0.6694232225418091, "logps/chosen": -7.84281587600708, "logps/rejected": -18.11672019958496, "loss": 0.8602735996246338, "memory(GiB)": 45.96, "nll_loss": 0.342671662569046, "rewards/accuracies": 0.6875, "rewards/chosen": 0.16426895558834076, "rewards/margins": 0.6373977065086365, "rewards/rejected": -0.47312870621681213, "step": 50, "train_speed(iter/s)": 0.005623 } ], "logging_steps": 1, "max_steps": 1584, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.5033118748862054e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }