diff --git "a/trainer_state.json" "b/trainer_state.json" new file mode 100644--- /dev/null +++ "b/trainer_state.json" @@ -0,0 +1,14468 @@ +{ + "best_global_step": 600, + "best_metric": 0.26907793, + "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task2_dpo_absgt0_taskgt6__pari0.5_no_cheat/v0-20250606-013952/checkpoint-600", + "epoch": 2.2858418937025458, + "eval_steps": 300, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.002858418937025458, + "grad_norm": 10.349462509155273, + "learning_rate": 3.7735849056603773e-06, + "logits/chosen": -0.6422490477561951, + "logits/rejected": -0.6447486877441406, + "logps/chosen": -6.999429225921631, + "logps/rejected": -13.433603286743164, + "loss": 1.3778549432754517, + "memory(GiB)": 46.73, + "nll_loss": 0.6847077012062073, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 1, + "train_speed(iter/s)": 0.005273 + }, + { + "epoch": 0.005716837874050916, + "grad_norm": 11.263213157653809, + "learning_rate": 7.547169811320755e-06, + "logits/chosen": -0.6429960131645203, + "logits/rejected": -0.6454926133155823, + "logps/chosen": -9.604641914367676, + "logps/rejected": -13.53369140625, + "loss": 1.4975696802139282, + "memory(GiB)": 46.73, + "nll_loss": 0.8044224381446838, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 2, + "train_speed(iter/s)": 0.005366 + }, + { + "epoch": 0.008575256811076373, + "grad_norm": 9.09404182434082, + "learning_rate": 1.1320754716981132e-05, + "logits/chosen": -0.6486532092094421, + "logits/rejected": -0.6493248343467712, + "logps/chosen": -7.69912576675415, + "logps/rejected": -17.816326141357422, + "loss": 1.2593896389007568, + "memory(GiB)": 46.73, + "nll_loss": 0.5679630637168884, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.0031128099653869867, + "rewards/margins": 0.0035441224463284016, + "rewards/rejected": -0.00043131227721460164, + "step": 3, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.011433675748101831, + "grad_norm": 13.314420700073242, + "learning_rate": 1.509433962264151e-05, + "logits/chosen": -0.6668453812599182, + "logits/rejected": -0.6718658804893494, + "logps/chosen": -6.061755180358887, + "logps/rejected": -13.643918991088867, + "loss": 1.4406771659851074, + "memory(GiB)": 46.73, + "nll_loss": 0.7477570176124573, + "rewards/accuracies": 0.53125, + "rewards/chosen": 0.008774133399128914, + "rewards/margins": 0.0006008772179484367, + "rewards/rejected": 0.008173256181180477, + "step": 4, + "train_speed(iter/s)": 0.005446 + }, + { + "epoch": 0.014292094685127288, + "grad_norm": 12.340804100036621, + "learning_rate": 1.8867924528301888e-05, + "logits/chosen": -0.6321276426315308, + "logits/rejected": -0.6321861743927002, + "logps/chosen": -11.234216690063477, + "logps/rejected": -11.82645034790039, + "loss": 1.3690662384033203, + "memory(GiB)": 46.73, + "nll_loss": 0.6870464086532593, + "rewards/accuracies": 0.6875, + "rewards/chosen": 0.032103873789310455, + "rewards/margins": 0.022960105910897255, + "rewards/rejected": 0.0091437678784132, + "step": 5, + "train_speed(iter/s)": 0.005444 + }, + { + "epoch": 0.017150513622152745, + "grad_norm": 13.995262145996094, + "learning_rate": 2.2641509433962265e-05, + "logits/chosen": -0.6530164480209351, + "logits/rejected": -0.6550691723823547, + "logps/chosen": -8.742744445800781, + "logps/rejected": -12.622247695922852, + "loss": 1.3672001361846924, + "memory(GiB)": 46.73, + "nll_loss": 0.702350378036499, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.0800265222787857, + "rewards/margins": 0.06047351285815239, + "rewards/rejected": 0.019553007557988167, + "step": 6, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.020008932559178204, + "grad_norm": 10.019857406616211, + "learning_rate": 2.641509433962264e-05, + "logits/chosen": -0.6211694478988647, + "logits/rejected": -0.6214967370033264, + "logps/chosen": -6.935382843017578, + "logps/rejected": -13.613279342651367, + "loss": 1.2412631511688232, + "memory(GiB)": 46.73, + "nll_loss": 0.5651571154594421, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.13799861073493958, + "rewards/margins": 0.053141627460718155, + "rewards/rejected": 0.08485697209835052, + "step": 7, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.022867351496203663, + "grad_norm": 6.375326633453369, + "learning_rate": 3.018867924528302e-05, + "logits/chosen": -0.6666778326034546, + "logits/rejected": -0.6678147315979004, + "logps/chosen": -8.114872932434082, + "logps/rejected": -13.392560958862305, + "loss": 1.1162137985229492, + "memory(GiB)": 46.73, + "nll_loss": 0.4446101784706116, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.20063960552215576, + "rewards/margins": 0.09723334014415741, + "rewards/rejected": 0.10340625792741776, + "step": 8, + "train_speed(iter/s)": 0.005426 + }, + { + "epoch": 0.02572577043322912, + "grad_norm": 4.046472549438477, + "learning_rate": 3.39622641509434e-05, + "logits/chosen": -0.5842044949531555, + "logits/rejected": -0.5892153382301331, + "logps/chosen": -13.877073287963867, + "logps/rejected": -14.116576194763184, + "loss": 1.259205937385559, + "memory(GiB)": 46.73, + "nll_loss": 0.5605449676513672, + "rewards/accuracies": 0.53125, + "rewards/chosen": 0.1392103135585785, + "rewards/margins": 0.09627523273229599, + "rewards/rejected": 0.0429350808262825, + "step": 9, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.028584189370254576, + "grad_norm": 7.625533103942871, + "learning_rate": 3.7735849056603776e-05, + "logits/chosen": -0.6210353374481201, + "logits/rejected": -0.6224341988563538, + "logps/chosen": -8.32575798034668, + "logps/rejected": -11.715011596679688, + "loss": 1.2772942781448364, + "memory(GiB)": 46.73, + "nll_loss": 0.48597079515457153, + "rewards/accuracies": 0.4375, + "rewards/chosen": -0.043191827833652496, + "rewards/margins": 0.029505327343940735, + "rewards/rejected": -0.07269717007875443, + "step": 10, + "train_speed(iter/s)": 0.005438 + }, + { + "epoch": 0.03144260830728004, + "grad_norm": 11.961934089660645, + "learning_rate": 4.150943396226415e-05, + "logits/chosen": -0.6265634298324585, + "logits/rejected": -0.6289808750152588, + "logps/chosen": -7.129470348358154, + "logps/rejected": -11.932583808898926, + "loss": 1.447466254234314, + "memory(GiB)": 46.73, + "nll_loss": 0.6552329659461975, + "rewards/accuracies": 0.46875, + "rewards/chosen": -0.00290237320587039, + "rewards/margins": 0.06162097677588463, + "rewards/rejected": -0.0645233541727066, + "step": 11, + "train_speed(iter/s)": 0.005473 + }, + { + "epoch": 0.03430102724430549, + "grad_norm": 10.154479026794434, + "learning_rate": 4.528301886792453e-05, + "logits/chosen": -0.6388624906539917, + "logits/rejected": -0.639370858669281, + "logps/chosen": -9.490407943725586, + "logps/rejected": -12.88676643371582, + "loss": 1.4875458478927612, + "memory(GiB)": 46.73, + "nll_loss": 0.6468713283538818, + "rewards/accuracies": 0.4375, + "rewards/chosen": -0.10463112592697144, + "rewards/margins": -0.059477299451828, + "rewards/rejected": -0.04515381157398224, + "step": 12, + "train_speed(iter/s)": 0.005465 + }, + { + "epoch": 0.03715944618133095, + "grad_norm": 4.091860771179199, + "learning_rate": 4.9056603773584906e-05, + "logits/chosen": -0.6680133938789368, + "logits/rejected": -0.6711105108261108, + "logps/chosen": -5.56148099899292, + "logps/rejected": -13.865943908691406, + "loss": 1.0154482126235962, + "memory(GiB)": 46.73, + "nll_loss": 0.35444653034210205, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.12190410494804382, + "rewards/margins": 0.3293726444244385, + "rewards/rejected": -0.20746850967407227, + "step": 13, + "train_speed(iter/s)": 0.00546 + }, + { + "epoch": 0.04001786511835641, + "grad_norm": 3.039910316467285, + "learning_rate": 5.283018867924528e-05, + "logits/chosen": -0.6245446801185608, + "logits/rejected": -0.6280595660209656, + "logps/chosen": -7.042474269866943, + "logps/rejected": -14.88280963897705, + "loss": 0.9986085295677185, + "memory(GiB)": 46.73, + "nll_loss": 0.32772910594940186, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.08946945518255234, + "rewards/margins": 0.2548743188381195, + "rewards/rejected": -0.16540484130382538, + "step": 14, + "train_speed(iter/s)": 0.005463 + }, + { + "epoch": 0.042876284055381866, + "grad_norm": 2.8388617038726807, + "learning_rate": 5.660377358490566e-05, + "logits/chosen": -0.613956868648529, + "logits/rejected": -0.6150951385498047, + "logps/chosen": -5.398593902587891, + "logps/rejected": -10.984697341918945, + "loss": 0.9217166900634766, + "memory(GiB)": 46.73, + "nll_loss": 0.21436992287635803, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.2490297257900238, + "rewards/margins": 0.12685683369636536, + "rewards/rejected": 0.12217291444540024, + "step": 15, + "train_speed(iter/s)": 0.005464 + }, + { + "epoch": 0.045734702992407325, + "grad_norm": 3.623399257659912, + "learning_rate": 6.037735849056604e-05, + "logits/chosen": -0.5890456438064575, + "logits/rejected": -0.5907201766967773, + "logps/chosen": -7.65773868560791, + "logps/rejected": -15.24480152130127, + "loss": 1.130638837814331, + "memory(GiB)": 46.73, + "nll_loss": 0.33376482129096985, + "rewards/accuracies": 0.46875, + "rewards/chosen": 0.14319562911987305, + "rewards/margins": 0.01443251222372055, + "rewards/rejected": 0.1287631392478943, + "step": 16, + "train_speed(iter/s)": 0.00546 + }, + { + "epoch": 0.048593121929432784, + "grad_norm": 2.9850075244903564, + "learning_rate": 6.415094339622641e-05, + "logits/chosen": -0.5228931903839111, + "logits/rejected": -0.524716854095459, + "logps/chosen": -10.135262489318848, + "logps/rejected": -14.072588920593262, + "loss": 1.2770482301712036, + "memory(GiB)": 46.73, + "nll_loss": 0.48515522480010986, + "rewards/accuracies": 0.40625, + "rewards/chosen": 0.13618236780166626, + "rewards/margins": -0.09462341666221619, + "rewards/rejected": 0.23080575466156006, + "step": 17, + "train_speed(iter/s)": 0.005473 + }, + { + "epoch": 0.05145154086645824, + "grad_norm": 2.2746193408966064, + "learning_rate": 6.79245283018868e-05, + "logits/chosen": -0.5764032006263733, + "logits/rejected": -0.5762047171592712, + "logps/chosen": -11.675098419189453, + "logps/rejected": -10.994297981262207, + "loss": 1.2022521495819092, + "memory(GiB)": 46.73, + "nll_loss": 0.4671342372894287, + "rewards/accuracies": 0.46875, + "rewards/chosen": 0.1593710482120514, + "rewards/margins": -0.00844080001115799, + "rewards/rejected": 0.1678118258714676, + "step": 18, + "train_speed(iter/s)": 0.005468 + }, + { + "epoch": 0.0543099598034837, + "grad_norm": 2.324984312057495, + "learning_rate": 7.169811320754717e-05, + "logits/chosen": -0.567690908908844, + "logits/rejected": -0.569066047668457, + "logps/chosen": -9.0728120803833, + "logps/rejected": -12.268661499023438, + "loss": 1.1060843467712402, + "memory(GiB)": 46.73, + "nll_loss": 0.41300466656684875, + "rewards/accuracies": 0.53125, + "rewards/chosen": 0.23081830143928528, + "rewards/margins": 0.0710553377866745, + "rewards/rejected": 0.15976294875144958, + "step": 19, + "train_speed(iter/s)": 0.005463 + }, + { + "epoch": 0.05716837874050915, + "grad_norm": 2.0991458892822266, + "learning_rate": 7.547169811320755e-05, + "logits/chosen": -0.6091416478157043, + "logits/rejected": -0.6100034117698669, + "logps/chosen": -4.26762056350708, + "logps/rejected": -11.32187557220459, + "loss": 1.0021699666976929, + "memory(GiB)": 46.73, + "nll_loss": 0.2933175265789032, + "rewards/accuracies": 0.4375, + "rewards/chosen": 0.15655732154846191, + "rewards/margins": 0.008277412503957748, + "rewards/rejected": 0.14827993512153625, + "step": 20, + "train_speed(iter/s)": 0.005467 + }, + { + "epoch": 0.06002679767753461, + "grad_norm": 3.4958455562591553, + "learning_rate": 7.924528301886794e-05, + "logits/chosen": -0.571921706199646, + "logits/rejected": -0.572878360748291, + "logps/chosen": -9.612298965454102, + "logps/rejected": -12.484085083007812, + "loss": 1.1795949935913086, + "memory(GiB)": 46.73, + "nll_loss": 0.46760252118110657, + "rewards/accuracies": 0.53125, + "rewards/chosen": 0.14643912017345428, + "rewards/margins": 0.0200117826461792, + "rewards/rejected": 0.12642733752727509, + "step": 21, + "train_speed(iter/s)": 0.005467 + }, + { + "epoch": 0.06288521661456008, + "grad_norm": 3.175546169281006, + "learning_rate": 8.30188679245283e-05, + "logits/chosen": -0.6108006834983826, + "logits/rejected": -0.6111243367195129, + "logps/chosen": -6.207424163818359, + "logps/rejected": -7.818144798278809, + "loss": 1.1549935340881348, + "memory(GiB)": 46.73, + "nll_loss": 0.4683927893638611, + "rewards/accuracies": 0.5625, + "rewards/chosen": 0.23285990953445435, + "rewards/margins": 0.06634702533483505, + "rewards/rejected": 0.16651292145252228, + "step": 22, + "train_speed(iter/s)": 0.00547 + }, + { + "epoch": 0.06574363555158554, + "grad_norm": 2.4531869888305664, + "learning_rate": 8.679245283018869e-05, + "logits/chosen": -0.6012008190155029, + "logits/rejected": -0.6021928191184998, + "logps/chosen": -5.598664283752441, + "logps/rejected": -13.262667655944824, + "loss": 0.9260164499282837, + "memory(GiB)": 46.73, + "nll_loss": 0.33532270789146423, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.3285560607910156, + "rewards/margins": 0.3157665431499481, + "rewards/rejected": 0.012789532542228699, + "step": 23, + "train_speed(iter/s)": 0.005467 + }, + { + "epoch": 0.06860205448861098, + "grad_norm": 2.328031301498413, + "learning_rate": 9.056603773584906e-05, + "logits/chosen": -0.567432165145874, + "logits/rejected": -0.5704118609428406, + "logps/chosen": -4.026985168457031, + "logps/rejected": -14.904813766479492, + "loss": 0.8984246253967285, + "memory(GiB)": 46.73, + "nll_loss": 0.26223480701446533, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.26638248562812805, + "rewards/margins": 0.22430934011936188, + "rewards/rejected": 0.042073119431734085, + "step": 24, + "train_speed(iter/s)": 0.005466 + }, + { + "epoch": 0.07146047342563644, + "grad_norm": 3.5119378566741943, + "learning_rate": 9.433962264150944e-05, + "logits/chosen": -0.5709348320960999, + "logits/rejected": -0.5688645243644714, + "logps/chosen": -7.716845989227295, + "logps/rejected": -7.868927955627441, + "loss": 1.113297462463379, + "memory(GiB)": 46.73, + "nll_loss": 0.3660878837108612, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.2273256480693817, + "rewards/margins": -0.0022776294499635696, + "rewards/rejected": 0.22960326075553894, + "step": 25, + "train_speed(iter/s)": 0.005475 + }, + { + "epoch": 0.0743188923626619, + "grad_norm": 3.2336673736572266, + "learning_rate": 9.811320754716981e-05, + "logits/chosen": -0.589956521987915, + "logits/rejected": -0.587726354598999, + "logps/chosen": -10.072855949401855, + "logps/rejected": -12.857810974121094, + "loss": 1.0991942882537842, + "memory(GiB)": 46.73, + "nll_loss": 0.40110355615615845, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.17576897144317627, + "rewards/margins": 0.11343260109424591, + "rewards/rejected": 0.062336355447769165, + "step": 26, + "train_speed(iter/s)": 0.005466 + }, + { + "epoch": 0.07717731129968736, + "grad_norm": 2.6813321113586426, + "learning_rate": 0.0001018867924528302, + "logits/chosen": -0.5832359194755554, + "logits/rejected": -0.5860565304756165, + "logps/chosen": -8.197118759155273, + "logps/rejected": -17.45244598388672, + "loss": 0.8366767764091492, + "memory(GiB)": 46.73, + "nll_loss": 0.2886262536048889, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.3297504186630249, + "rewards/margins": 0.48295390605926514, + "rewards/rejected": -0.15320347249507904, + "step": 27, + "train_speed(iter/s)": 0.00547 + }, + { + "epoch": 0.08003573023671282, + "grad_norm": 3.3800203800201416, + "learning_rate": 0.00010566037735849057, + "logits/chosen": -0.6005962491035461, + "logits/rejected": -0.6035608053207397, + "logps/chosen": -9.117904663085938, + "logps/rejected": -18.400161743164062, + "loss": 1.0143071413040161, + "memory(GiB)": 46.73, + "nll_loss": 0.4276316463947296, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.271901398897171, + "rewards/margins": 0.4319708049297333, + "rewards/rejected": -0.16006940603256226, + "step": 28, + "train_speed(iter/s)": 0.005468 + }, + { + "epoch": 0.08289414917373827, + "grad_norm": 5.461134433746338, + "learning_rate": 0.00010943396226415095, + "logits/chosen": -0.5596082210540771, + "logits/rejected": -0.5635167360305786, + "logps/chosen": -7.607837200164795, + "logps/rejected": -23.174358367919922, + "loss": 0.803045928478241, + "memory(GiB)": 46.73, + "nll_loss": 0.32165294885635376, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.3834715783596039, + "rewards/margins": 0.7214637994766235, + "rewards/rejected": -0.33799219131469727, + "step": 29, + "train_speed(iter/s)": 0.005464 + }, + { + "epoch": 0.08575256811076373, + "grad_norm": 3.3377506732940674, + "learning_rate": 0.00011320754716981132, + "logits/chosen": -0.6003558039665222, + "logits/rejected": -0.6016712188720703, + "logps/chosen": -7.941157817840576, + "logps/rejected": -10.564404487609863, + "loss": 1.0737202167510986, + "memory(GiB)": 46.73, + "nll_loss": 0.3314566910266876, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.1379927098751068, + "rewards/margins": 0.08670535683631897, + "rewards/rejected": 0.05128733813762665, + "step": 30, + "train_speed(iter/s)": 0.005461 + }, + { + "epoch": 0.08861098704778919, + "grad_norm": 3.4214563369750977, + "learning_rate": 0.0001169811320754717, + "logits/chosen": -0.5186684727668762, + "logits/rejected": -0.5189406275749207, + "logps/chosen": -6.143683910369873, + "logps/rejected": -25.88001251220703, + "loss": 0.7792238593101501, + "memory(GiB)": 46.73, + "nll_loss": 0.2514691948890686, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.2757991552352905, + "rewards/margins": 0.5156725645065308, + "rewards/rejected": -0.23987337946891785, + "step": 31, + "train_speed(iter/s)": 0.005459 + }, + { + "epoch": 0.09146940598481465, + "grad_norm": 4.645272731781006, + "learning_rate": 0.00012075471698113207, + "logits/chosen": -0.5988867282867432, + "logits/rejected": -0.6016397476196289, + "logps/chosen": -5.776233673095703, + "logps/rejected": -22.404544830322266, + "loss": 0.8892383575439453, + "memory(GiB)": 46.73, + "nll_loss": 0.4011368155479431, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.22715790569782257, + "rewards/margins": 0.7724226713180542, + "rewards/rejected": -0.545264720916748, + "step": 32, + "train_speed(iter/s)": 0.005454 + }, + { + "epoch": 0.09432782492184011, + "grad_norm": 4.586422443389893, + "learning_rate": 0.00012452830188679244, + "logits/chosen": -0.5782912969589233, + "logits/rejected": -0.5768243670463562, + "logps/chosen": -10.939208984375, + "logps/rejected": -13.486640930175781, + "loss": 1.1607584953308105, + "memory(GiB)": 46.73, + "nll_loss": 0.5877886414527893, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.21317529678344727, + "rewards/margins": 0.4141784906387329, + "rewards/rejected": -0.20100319385528564, + "step": 33, + "train_speed(iter/s)": 0.005457 + }, + { + "epoch": 0.09718624385886557, + "grad_norm": 4.306042671203613, + "learning_rate": 0.00012830188679245283, + "logits/chosen": -0.6019578576087952, + "logits/rejected": -0.6082974076271057, + "logps/chosen": -7.5170578956604, + "logps/rejected": -24.889406204223633, + "loss": 0.9509016275405884, + "memory(GiB)": 46.73, + "nll_loss": 0.4247076213359833, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.10510760545730591, + "rewards/margins": 0.8037927150726318, + "rewards/rejected": -0.6986850500106812, + "step": 34, + "train_speed(iter/s)": 0.005456 + }, + { + "epoch": 0.10004466279589103, + "grad_norm": 3.002274751663208, + "learning_rate": 0.0001320754716981132, + "logits/chosen": -0.6133092641830444, + "logits/rejected": -0.6127456426620483, + "logps/chosen": -8.859593391418457, + "logps/rejected": -17.02096939086914, + "loss": 0.8848217129707336, + "memory(GiB)": 46.73, + "nll_loss": 0.3480006456375122, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.25863486528396606, + "rewards/margins": 0.5611037015914917, + "rewards/rejected": -0.302468866109848, + "step": 35, + "train_speed(iter/s)": 0.005457 + }, + { + "epoch": 0.10290308173291648, + "grad_norm": 4.299287796020508, + "learning_rate": 0.0001358490566037736, + "logits/chosen": -0.5725032091140747, + "logits/rejected": -0.5725142359733582, + "logps/chosen": -8.371686935424805, + "logps/rejected": -17.657852172851562, + "loss": 0.8825864791870117, + "memory(GiB)": 46.73, + "nll_loss": 0.3603641390800476, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.23154468834400177, + "rewards/margins": 0.6240193843841553, + "rewards/rejected": -0.3924746811389923, + "step": 36, + "train_speed(iter/s)": 0.005457 + }, + { + "epoch": 0.10576150066994194, + "grad_norm": 4.354315757751465, + "learning_rate": 0.00013962264150943395, + "logits/chosen": -0.5943324565887451, + "logits/rejected": -0.5940991044044495, + "logps/chosen": -7.657552719116211, + "logps/rejected": -16.183917999267578, + "loss": 0.8160735964775085, + "memory(GiB)": 46.73, + "nll_loss": 0.3588046133518219, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.27544379234313965, + "rewards/margins": 0.7471473217010498, + "rewards/rejected": -0.4717034101486206, + "step": 37, + "train_speed(iter/s)": 0.005452 + }, + { + "epoch": 0.1086199196069674, + "grad_norm": 7.916697978973389, + "learning_rate": 0.00014339622641509434, + "logits/chosen": -0.5676888227462769, + "logits/rejected": -0.5714080929756165, + "logps/chosen": -6.698662757873535, + "logps/rejected": -17.954235076904297, + "loss": 1.052018642425537, + "memory(GiB)": 46.73, + "nll_loss": 0.49374452233314514, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.16338011622428894, + "rewards/margins": 0.42942774295806885, + "rewards/rejected": -0.2660475969314575, + "step": 38, + "train_speed(iter/s)": 0.005452 + }, + { + "epoch": 0.11147833854399285, + "grad_norm": 3.7271363735198975, + "learning_rate": 0.00014716981132075472, + "logits/chosen": -0.6097766160964966, + "logits/rejected": -0.6135396957397461, + "logps/chosen": -7.30006217956543, + "logps/rejected": -22.168495178222656, + "loss": 0.7729511857032776, + "memory(GiB)": 46.73, + "nll_loss": 0.3125499188899994, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.28066012263298035, + "rewards/margins": 0.8108583092689514, + "rewards/rejected": -0.5301981568336487, + "step": 39, + "train_speed(iter/s)": 0.00545 + }, + { + "epoch": 0.1143367574810183, + "grad_norm": 2.960145950317383, + "learning_rate": 0.0001509433962264151, + "logits/chosen": -0.6132208108901978, + "logits/rejected": -0.6163071990013123, + "logps/chosen": -7.024638652801514, + "logps/rejected": -21.298852920532227, + "loss": 0.8106734752655029, + "memory(GiB)": 46.73, + "nll_loss": 0.37238579988479614, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.39458420872688293, + "rewards/margins": 0.8476477265357971, + "rewards/rejected": -0.45306357741355896, + "step": 40, + "train_speed(iter/s)": 0.005445 + }, + { + "epoch": 0.11719517641804376, + "grad_norm": 4.3203630447387695, + "learning_rate": 0.0001547169811320755, + "logits/chosen": -0.5976248979568481, + "logits/rejected": -0.6002449989318848, + "logps/chosen": -5.656615257263184, + "logps/rejected": -16.032827377319336, + "loss": 0.9440045952796936, + "memory(GiB)": 46.73, + "nll_loss": 0.33253738284111023, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.14414586126804352, + "rewards/margins": 0.5006409287452698, + "rewards/rejected": -0.35649505257606506, + "step": 41, + "train_speed(iter/s)": 0.005445 + }, + { + "epoch": 0.12005359535506922, + "grad_norm": 4.646491527557373, + "learning_rate": 0.00015849056603773587, + "logits/chosen": -0.5956608653068542, + "logits/rejected": -0.5956603288650513, + "logps/chosen": -11.719463348388672, + "logps/rejected": -27.070579528808594, + "loss": 1.0076483488082886, + "memory(GiB)": 46.73, + "nll_loss": 0.5070124268531799, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.15291725099086761, + "rewards/margins": 0.7710469961166382, + "rewards/rejected": -0.6181297898292542, + "step": 42, + "train_speed(iter/s)": 0.005446 + }, + { + "epoch": 0.12291201429209468, + "grad_norm": 4.248917102813721, + "learning_rate": 0.00016226415094339625, + "logits/chosen": -0.6100150942802429, + "logits/rejected": -0.6142972111701965, + "logps/chosen": -6.201865196228027, + "logps/rejected": -19.82131004333496, + "loss": 0.7969534993171692, + "memory(GiB)": 46.73, + "nll_loss": 0.31225427985191345, + "rewards/accuracies": 0.6875, + "rewards/chosen": 0.20218679308891296, + "rewards/margins": 0.705444872379303, + "rewards/rejected": -0.5032580494880676, + "step": 43, + "train_speed(iter/s)": 0.005448 + }, + { + "epoch": 0.12577043322912015, + "grad_norm": 3.1864066123962402, + "learning_rate": 0.0001660377358490566, + "logits/chosen": -0.6078452467918396, + "logits/rejected": -0.6100336909294128, + "logps/chosen": -8.217609405517578, + "logps/rejected": -18.432086944580078, + "loss": 0.945781409740448, + "memory(GiB)": 46.73, + "nll_loss": 0.4447736442089081, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.16747131943702698, + "rewards/margins": 0.6352076530456543, + "rewards/rejected": -0.46773630380630493, + "step": 44, + "train_speed(iter/s)": 0.005451 + }, + { + "epoch": 0.1286288521661456, + "grad_norm": 2.8247904777526855, + "learning_rate": 0.000169811320754717, + "logits/chosen": -0.6424505710601807, + "logits/rejected": -0.6455634236335754, + "logps/chosen": -4.626930236816406, + "logps/rejected": -18.966289520263672, + "loss": 0.6525614261627197, + "memory(GiB)": 46.73, + "nll_loss": 0.20949943363666534, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.1935967355966568, + "rewards/margins": 0.7181073427200317, + "rewards/rejected": -0.5245105624198914, + "step": 45, + "train_speed(iter/s)": 0.005449 + }, + { + "epoch": 0.13148727110317107, + "grad_norm": 5.167090892791748, + "learning_rate": 0.00017358490566037738, + "logits/chosen": -0.6390554308891296, + "logits/rejected": -0.6455981731414795, + "logps/chosen": -7.457905292510986, + "logps/rejected": -22.238759994506836, + "loss": 0.7052859663963318, + "memory(GiB)": 46.73, + "nll_loss": 0.3145278990268707, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3406547009944916, + "rewards/margins": 0.9184964895248413, + "rewards/rejected": -0.5778417587280273, + "step": 46, + "train_speed(iter/s)": 0.005446 + }, + { + "epoch": 0.1343456900401965, + "grad_norm": 3.110797166824341, + "learning_rate": 0.00017735849056603776, + "logits/chosen": -0.6957284212112427, + "logits/rejected": -0.6984925866127014, + "logps/chosen": -6.335500717163086, + "logps/rejected": -26.946069717407227, + "loss": 0.6684616804122925, + "memory(GiB)": 46.73, + "nll_loss": 0.27696001529693604, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.36519789695739746, + "rewards/margins": 1.261197805404663, + "rewards/rejected": -0.8960000276565552, + "step": 47, + "train_speed(iter/s)": 0.005445 + }, + { + "epoch": 0.13720410897722196, + "grad_norm": 5.592209815979004, + "learning_rate": 0.00018113207547169812, + "logits/chosen": -0.6557337641716003, + "logits/rejected": -0.6595371961593628, + "logps/chosen": -6.262232780456543, + "logps/rejected": -22.550495147705078, + "loss": 0.844598650932312, + "memory(GiB)": 46.73, + "nll_loss": 0.32042089104652405, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.098446786403656, + "rewards/margins": 1.1042643785476685, + "rewards/rejected": -1.0058175325393677, + "step": 48, + "train_speed(iter/s)": 0.005444 + }, + { + "epoch": 0.14006252791424742, + "grad_norm": 5.518631458282471, + "learning_rate": 0.0001849056603773585, + "logits/chosen": -0.7261903285980225, + "logits/rejected": -0.7333111763000488, + "logps/chosen": -6.155282020568848, + "logps/rejected": -28.635177612304688, + "loss": 0.7839219570159912, + "memory(GiB)": 46.73, + "nll_loss": 0.3167538046836853, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.18123595416545868, + "rewards/margins": 1.343546986579895, + "rewards/rejected": -1.1623109579086304, + "step": 49, + "train_speed(iter/s)": 0.00544 + }, + { + "epoch": 0.14292094685127288, + "grad_norm": 5.368433475494385, + "learning_rate": 0.00018867924528301889, + "logits/chosen": -0.7460846304893494, + "logits/rejected": -0.7433331608772278, + "logps/chosen": -8.476225852966309, + "logps/rejected": -20.479339599609375, + "loss": 1.041689395904541, + "memory(GiB)": 46.73, + "nll_loss": 0.5162184834480286, + "rewards/accuracies": 0.6875, + "rewards/chosen": 0.07575411349534988, + "rewards/margins": 0.8544278144836426, + "rewards/rejected": -0.7786736488342285, + "step": 50, + "train_speed(iter/s)": 0.005439 + }, + { + "epoch": 0.14577936578829834, + "grad_norm": 12.666760444641113, + "learning_rate": 0.00019245283018867927, + "logits/chosen": -0.7423916459083557, + "logits/rejected": -0.7536158561706543, + "logps/chosen": -4.518327713012695, + "logps/rejected": -25.71565818786621, + "loss": 0.8285016417503357, + "memory(GiB)": 46.73, + "nll_loss": 0.38353338837623596, + "rewards/accuracies": 0.6875, + "rewards/chosen": 0.25002920627593994, + "rewards/margins": 1.0534642934799194, + "rewards/rejected": -0.8034350872039795, + "step": 51, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.1486377847253238, + "grad_norm": 5.63993501663208, + "learning_rate": 0.00019622641509433963, + "logits/chosen": -0.7661195993423462, + "logits/rejected": -0.7684649229049683, + "logps/chosen": -5.303972244262695, + "logps/rejected": -20.424297332763672, + "loss": 0.7760183811187744, + "memory(GiB)": 46.73, + "nll_loss": 0.30550119280815125, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.17865437269210815, + "rewards/margins": 0.9522275328636169, + "rewards/rejected": -0.7735730409622192, + "step": 52, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.15149620366234925, + "grad_norm": 3.208770275115967, + "learning_rate": 0.0002, + "logits/chosen": -0.7615375518798828, + "logits/rejected": -0.7639837861061096, + "logps/chosen": -7.793338775634766, + "logps/rejected": -22.267044067382812, + "loss": 0.6889612078666687, + "memory(GiB)": 46.73, + "nll_loss": 0.2784683108329773, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.21318240463733673, + "rewards/margins": 1.1274638175964355, + "rewards/rejected": -0.9142814874649048, + "step": 53, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.1543546225993747, + "grad_norm": 4.603616714477539, + "learning_rate": 0.00019999950054470762, + "logits/chosen": -0.7416525483131409, + "logits/rejected": -0.7468435168266296, + "logps/chosen": -11.753125190734863, + "logps/rejected": -23.24603271484375, + "loss": 0.9534075856208801, + "memory(GiB)": 46.73, + "nll_loss": 0.42802760004997253, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.2138495296239853, + "rewards/margins": 0.8852367997169495, + "rewards/rejected": -0.6713871955871582, + "step": 54, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.15721304153640017, + "grad_norm": 3.226914405822754, + "learning_rate": 0.00019999800218381956, + "logits/chosen": -0.782919704914093, + "logits/rejected": -0.7837254405021667, + "logps/chosen": -10.437933921813965, + "logps/rejected": -21.950359344482422, + "loss": 0.7319959998130798, + "memory(GiB)": 46.73, + "nll_loss": 0.28649967908859253, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.17146320641040802, + "rewards/margins": 0.9873074889183044, + "rewards/rejected": -0.8158442974090576, + "step": 55, + "train_speed(iter/s)": 0.005435 + }, + { + "epoch": 0.16007146047342563, + "grad_norm": 5.957598686218262, + "learning_rate": 0.00019999550493230315, + "logits/chosen": -0.7622566819190979, + "logits/rejected": -0.7720569968223572, + "logps/chosen": -9.299139022827148, + "logps/rejected": -25.902114868164062, + "loss": 1.0733510255813599, + "memory(GiB)": 46.73, + "nll_loss": 0.5738880634307861, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.1327313929796219, + "rewards/margins": 1.0297049283981323, + "rewards/rejected": -0.8969735503196716, + "step": 56, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.1629298794104511, + "grad_norm": 4.4198760986328125, + "learning_rate": 0.00019999200881510367, + "logits/chosen": -0.7777268886566162, + "logits/rejected": -0.7817560434341431, + "logps/chosen": -8.051362037658691, + "logps/rejected": -16.21352767944336, + "loss": 0.9994087815284729, + "memory(GiB)": 46.73, + "nll_loss": 0.5157659649848938, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.3178602159023285, + "rewards/margins": 0.7738386392593384, + "rewards/rejected": -0.4559784233570099, + "step": 57, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.16578829834747655, + "grad_norm": 10.918800354003906, + "learning_rate": 0.00019998751386714417, + "logits/chosen": -0.7735524773597717, + "logits/rejected": -0.7762777209281921, + "logps/chosen": -6.026726245880127, + "logps/rejected": -20.445030212402344, + "loss": 0.8424608707427979, + "memory(GiB)": 46.73, + "nll_loss": 0.4571954309940338, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.3362487852573395, + "rewards/margins": 1.0223908424377441, + "rewards/rejected": -0.6861420273780823, + "step": 58, + "train_speed(iter/s)": 0.005438 + }, + { + "epoch": 0.168646717284502, + "grad_norm": 6.003457546234131, + "learning_rate": 0.00019998202013332526, + "logits/chosen": -0.7671990394592285, + "logits/rejected": -0.7679510712623596, + "logps/chosen": -7.208020210266113, + "logps/rejected": -16.45644187927246, + "loss": 0.8400717377662659, + "memory(GiB)": 46.73, + "nll_loss": 0.3789638876914978, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.19236475229263306, + "rewards/margins": 0.8348343372344971, + "rewards/rejected": -0.6424695253372192, + "step": 59, + "train_speed(iter/s)": 0.005439 + }, + { + "epoch": 0.17150513622152747, + "grad_norm": 2.5898213386535645, + "learning_rate": 0.00019997552766852432, + "logits/chosen": -0.800130307674408, + "logits/rejected": -0.8043981790542603, + "logps/chosen": -6.655481815338135, + "logps/rejected": -24.4234619140625, + "loss": 0.6945982575416565, + "memory(GiB)": 46.73, + "nll_loss": 0.3340861201286316, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.3088517487049103, + "rewards/margins": 1.2354176044464111, + "rewards/rejected": -0.9265658855438232, + "step": 60, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.17436355515855292, + "grad_norm": 3.626788377761841, + "learning_rate": 0.00019996803653759532, + "logits/chosen": -0.7841392159461975, + "logits/rejected": -0.7904000282287598, + "logps/chosen": -4.378767013549805, + "logps/rejected": -26.130855560302734, + "loss": 0.5890128016471863, + "memory(GiB)": 46.73, + "nll_loss": 0.2802823781967163, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2776252329349518, + "rewards/margins": 1.491828203201294, + "rewards/rejected": -1.2142030000686646, + "step": 61, + "train_speed(iter/s)": 0.005438 + }, + { + "epoch": 0.17722197409557838, + "grad_norm": 6.747097492218018, + "learning_rate": 0.00019995954681536798, + "logits/chosen": -0.7469812035560608, + "logits/rejected": -0.7426640391349792, + "logps/chosen": -11.407801628112793, + "logps/rejected": -19.764530181884766, + "loss": 1.1509681940078735, + "memory(GiB)": 46.73, + "nll_loss": 0.4816472828388214, + "rewards/accuracies": 0.71875, + "rewards/chosen": -0.023781299591064453, + "rewards/margins": 0.7125381231307983, + "rewards/rejected": -0.7363194227218628, + "step": 62, + "train_speed(iter/s)": 0.005439 + }, + { + "epoch": 0.18008039303260384, + "grad_norm": 6.9256978034973145, + "learning_rate": 0.00019995005858664696, + "logits/chosen": -0.819698691368103, + "logits/rejected": -0.8221041560173035, + "logps/chosen": -7.0722761154174805, + "logps/rejected": -30.66091537475586, + "loss": 0.9850404262542725, + "memory(GiB)": 46.73, + "nll_loss": 0.42992380261421204, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.07954245805740356, + "rewards/margins": 1.697967767715454, + "rewards/rejected": -1.6184254884719849, + "step": 63, + "train_speed(iter/s)": 0.005439 + }, + { + "epoch": 0.1829388119696293, + "grad_norm": 5.373042106628418, + "learning_rate": 0.00019993957194621128, + "logits/chosen": -0.8020437955856323, + "logits/rejected": -0.8022991418838501, + "logps/chosen": -12.086634635925293, + "logps/rejected": -21.337501525878906, + "loss": 0.9992907643318176, + "memory(GiB)": 46.73, + "nll_loss": 0.46714556217193604, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.11581222712993622, + "rewards/margins": 1.0597875118255615, + "rewards/rejected": -0.9439753293991089, + "step": 64, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.18579723090665476, + "grad_norm": 3.77294921875, + "learning_rate": 0.00019992808699881303, + "logits/chosen": -0.7432379722595215, + "logits/rejected": -0.7440240979194641, + "logps/chosen": -6.54131555557251, + "logps/rejected": -25.4437255859375, + "loss": 0.8025262951850891, + "memory(GiB)": 46.73, + "nll_loss": 0.4345034658908844, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.1653081476688385, + "rewards/margins": 1.261300802230835, + "rewards/rejected": -1.0959926843643188, + "step": 65, + "train_speed(iter/s)": 0.005442 + }, + { + "epoch": 0.18865564984368022, + "grad_norm": 3.9820404052734375, + "learning_rate": 0.0001999156038591766, + "logits/chosen": -0.754156231880188, + "logits/rejected": -0.7619881629943848, + "logps/chosen": -6.165823459625244, + "logps/rejected": -23.689210891723633, + "loss": 0.7558284997940063, + "memory(GiB)": 46.73, + "nll_loss": 0.35462892055511475, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.18967051804065704, + "rewards/margins": 0.9685844779014587, + "rewards/rejected": -0.7789139151573181, + "step": 66, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.19151406878070568, + "grad_norm": 4.361135482788086, + "learning_rate": 0.00019990212265199738, + "logits/chosen": -0.7575560212135315, + "logits/rejected": -0.7635327577590942, + "logps/chosen": -4.563057899475098, + "logps/rejected": -24.856014251708984, + "loss": 0.7012404203414917, + "memory(GiB)": 46.73, + "nll_loss": 0.3292723000049591, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.360738068819046, + "rewards/margins": 1.0550967454910278, + "rewards/rejected": -0.6943586468696594, + "step": 67, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.19437248771773113, + "grad_norm": 8.01318359375, + "learning_rate": 0.00019988764351194056, + "logits/chosen": -0.7201259136199951, + "logits/rejected": -0.7213173508644104, + "logps/chosen": -14.019023895263672, + "logps/rejected": -23.463457107543945, + "loss": 1.155617594718933, + "memory(GiB)": 46.73, + "nll_loss": 0.6643218994140625, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.16900399327278137, + "rewards/margins": 0.8244603276252747, + "rewards/rejected": -0.6554563641548157, + "step": 68, + "train_speed(iter/s)": 0.005442 + }, + { + "epoch": 0.1972309066547566, + "grad_norm": 4.880486488342285, + "learning_rate": 0.00019987216658363984, + "logits/chosen": -0.7603176832199097, + "logits/rejected": -0.7611086368560791, + "logps/chosen": -7.871481418609619, + "logps/rejected": -18.355331420898438, + "loss": 0.9050899744033813, + "memory(GiB)": 46.73, + "nll_loss": 0.4671905040740967, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.14834776520729065, + "rewards/margins": 0.9282243251800537, + "rewards/rejected": -0.7798765897750854, + "step": 69, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.20008932559178205, + "grad_norm": 36.09653854370117, + "learning_rate": 0.00019985569202169584, + "logits/chosen": -0.826109766960144, + "logits/rejected": -0.8319188952445984, + "logps/chosen": -7.292363166809082, + "logps/rejected": -19.279315948486328, + "loss": 0.906982421875, + "memory(GiB)": 46.73, + "nll_loss": 0.4692971408367157, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.17047010362148285, + "rewards/margins": 0.9899492859840393, + "rewards/rejected": -0.8194791674613953, + "step": 70, + "train_speed(iter/s)": 0.005443 + }, + { + "epoch": 0.2029477445288075, + "grad_norm": 5.051456451416016, + "learning_rate": 0.00019983821999067475, + "logits/chosen": -0.7659405469894409, + "logits/rejected": -0.773281991481781, + "logps/chosen": -7.996345520019531, + "logps/rejected": -16.987951278686523, + "loss": 0.9166132211685181, + "memory(GiB)": 46.73, + "nll_loss": 0.43807780742645264, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.2428373396396637, + "rewards/margins": 0.7172515988349915, + "rewards/rejected": -0.47441428899765015, + "step": 71, + "train_speed(iter/s)": 0.005444 + }, + { + "epoch": 0.20580616346583297, + "grad_norm": 3.3546969890594482, + "learning_rate": 0.00019981975066510655, + "logits/chosen": -0.7702159285545349, + "logits/rejected": -0.7756153345108032, + "logps/chosen": -3.096975088119507, + "logps/rejected": -24.7138671875, + "loss": 0.6350318193435669, + "memory(GiB)": 46.73, + "nll_loss": 0.20447328686714172, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.23610374331474304, + "rewards/margins": 1.1568939685821533, + "rewards/rejected": -0.9207903146743774, + "step": 72, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.20866458240285843, + "grad_norm": 3.3056812286376953, + "learning_rate": 0.00019980028422948322, + "logits/chosen": -0.7785294651985168, + "logits/rejected": -0.7796329259872437, + "logps/chosen": -6.459807395935059, + "logps/rejected": -18.2646541595459, + "loss": 0.7826670408248901, + "memory(GiB)": 46.73, + "nll_loss": 0.299204021692276, + "rewards/accuracies": 0.71875, + "rewards/chosen": 0.17048794031143188, + "rewards/margins": 0.8538780212402344, + "rewards/rejected": -0.6833901405334473, + "step": 73, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.2115230013398839, + "grad_norm": 2.804248094558716, + "learning_rate": 0.00019977982087825713, + "logits/chosen": -0.7178574204444885, + "logits/rejected": -0.7222320437431335, + "logps/chosen": -5.382746696472168, + "logps/rejected": -21.648345947265625, + "loss": 0.6176108717918396, + "memory(GiB)": 46.73, + "nll_loss": 0.2642488479614258, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3241485357284546, + "rewards/margins": 1.1783626079559326, + "rewards/rejected": -0.854214072227478, + "step": 74, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.21438142027690935, + "grad_norm": 2.3271028995513916, + "learning_rate": 0.0001997583608158388, + "logits/chosen": -0.7665284872055054, + "logits/rejected": -0.7763013243675232, + "logps/chosen": -3.597620725631714, + "logps/rejected": -28.286640167236328, + "loss": 0.4727986454963684, + "memory(GiB)": 46.73, + "nll_loss": 0.1368505358695984, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.36978626251220703, + "rewards/margins": 1.460551142692566, + "rewards/rejected": -1.0907649993896484, + "step": 75, + "train_speed(iter/s)": 0.005442 + }, + { + "epoch": 0.2172398392139348, + "grad_norm": 5.8310160636901855, + "learning_rate": 0.00019973590425659507, + "logits/chosen": -0.7936246991157532, + "logits/rejected": -0.7950795888900757, + "logps/chosen": -8.558622360229492, + "logps/rejected": -22.39399528503418, + "loss": 0.7566131949424744, + "memory(GiB)": 46.73, + "nll_loss": 0.4084041714668274, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.26708710193634033, + "rewards/margins": 1.3221920728683472, + "rewards/rejected": -1.0551048517227173, + "step": 76, + "train_speed(iter/s)": 0.00544 + }, + { + "epoch": 0.22009825815096026, + "grad_norm": 4.89293909072876, + "learning_rate": 0.0001997124514248469, + "logits/chosen": -0.8093288540840149, + "logits/rejected": -0.8106516003608704, + "logps/chosen": -12.884543418884277, + "logps/rejected": -22.5157413482666, + "loss": 1.130676507949829, + "memory(GiB)": 46.73, + "nll_loss": 0.7112829685211182, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.10567857325077057, + "rewards/margins": 1.2312006950378418, + "rewards/rejected": -1.1255221366882324, + "step": 77, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.2229566770879857, + "grad_norm": 7.881620407104492, + "learning_rate": 0.00019968800255486713, + "logits/chosen": -0.8169571161270142, + "logits/rejected": -0.8179275393486023, + "logps/chosen": -6.7093825340271, + "logps/rejected": -29.32290267944336, + "loss": 0.8154858350753784, + "memory(GiB)": 46.73, + "nll_loss": 0.3944161534309387, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.16114036738872528, + "rewards/margins": 1.4641916751861572, + "rewards/rejected": -1.3030513525009155, + "step": 78, + "train_speed(iter/s)": 0.005441 + }, + { + "epoch": 0.22581509602501115, + "grad_norm": 2.513998031616211, + "learning_rate": 0.00019966255789087808, + "logits/chosen": -0.8547464609146118, + "logits/rejected": -0.8608615398406982, + "logps/chosen": -7.297125339508057, + "logps/rejected": -27.81803321838379, + "loss": 0.6003709435462952, + "memory(GiB)": 46.73, + "nll_loss": 0.29905110597610474, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.13682395219802856, + "rewards/margins": 1.487520456314087, + "rewards/rejected": -1.3506965637207031, + "step": 79, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.2286735149620366, + "grad_norm": 22.424015045166016, + "learning_rate": 0.0001996361176870492, + "logits/chosen": -0.8499366044998169, + "logits/rejected": -0.863770604133606, + "logps/chosen": -8.103764533996582, + "logps/rejected": -35.18703842163086, + "loss": 0.7495014071464539, + "memory(GiB)": 46.73, + "nll_loss": 0.5106410980224609, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2272297590970993, + "rewards/margins": 1.9457027912139893, + "rewards/rejected": -1.7184730768203735, + "step": 80, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.23153193389906207, + "grad_norm": 4.0974273681640625, + "learning_rate": 0.00019960868220749448, + "logits/chosen": -0.8633654117584229, + "logits/rejected": -0.8727495670318604, + "logps/chosen": -5.683876991271973, + "logps/rejected": -34.967037200927734, + "loss": 0.6187952756881714, + "memory(GiB)": 46.73, + "nll_loss": 0.32927608489990234, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.2094997614622116, + "rewards/margins": 2.0794010162353516, + "rewards/rejected": -1.8699012994766235, + "step": 81, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.23439035283608753, + "grad_norm": 3.275705575942993, + "learning_rate": 0.00019958025172626986, + "logits/chosen": -0.8937872648239136, + "logits/rejected": -0.9034286737442017, + "logps/chosen": -11.346511840820312, + "logps/rejected": -35.471927642822266, + "loss": 0.7466462850570679, + "memory(GiB)": 46.73, + "nll_loss": 0.4821043014526367, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2012697458267212, + "rewards/margins": 1.9956668615341187, + "rewards/rejected": -1.7943971157073975, + "step": 82, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.237248771773113, + "grad_norm": 8.550602912902832, + "learning_rate": 0.0001995508265273704, + "logits/chosen": -0.9247998595237732, + "logits/rejected": -0.934203028678894, + "logps/chosen": -7.0234270095825195, + "logps/rejected": -40.43362808227539, + "loss": 0.6714224219322205, + "memory(GiB)": 46.73, + "nll_loss": 0.36930039525032043, + "rewards/accuracies": 0.84375, + "rewards/chosen": -0.015845157206058502, + "rewards/margins": 2.3306310176849365, + "rewards/rejected": -2.3464760780334473, + "step": 83, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.24010719071013845, + "grad_norm": 10.380730628967285, + "learning_rate": 0.00019952040690472748, + "logits/chosen": -0.89071124792099, + "logits/rejected": -0.896521806716919, + "logps/chosen": -9.274986267089844, + "logps/rejected": -31.167112350463867, + "loss": 0.9556330442428589, + "memory(GiB)": 46.73, + "nll_loss": 0.4726044833660126, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.055123914033174515, + "rewards/margins": 1.99386465549469, + "rewards/rejected": -1.9387409687042236, + "step": 84, + "train_speed(iter/s)": 0.005435 + }, + { + "epoch": 0.2429656096471639, + "grad_norm": 59.343536376953125, + "learning_rate": 0.00019948899316220604, + "logits/chosen": -0.86629319190979, + "logits/rejected": -0.8767050504684448, + "logps/chosen": -6.04016637802124, + "logps/rejected": -28.20957374572754, + "loss": 0.725101888179779, + "memory(GiB)": 46.73, + "nll_loss": 0.40447694063186646, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.29112857580184937, + "rewards/margins": 1.845672369003296, + "rewards/rejected": -1.5545437335968018, + "step": 85, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.24582402858418936, + "grad_norm": 6.300822734832764, + "learning_rate": 0.0001994565856136012, + "logits/chosen": -0.8398523330688477, + "logits/rejected": -0.8439276814460754, + "logps/chosen": -7.2902045249938965, + "logps/rejected": -32.82334899902344, + "loss": 0.5805257558822632, + "memory(GiB)": 46.73, + "nll_loss": 0.4190253019332886, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3955605626106262, + "rewards/margins": 2.423994302749634, + "rewards/rejected": -2.0284337997436523, + "step": 86, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.24868244752121482, + "grad_norm": 43.768619537353516, + "learning_rate": 0.0001994231845826354, + "logits/chosen": -0.8710224628448486, + "logits/rejected": -0.8721168637275696, + "logps/chosen": -7.397428035736084, + "logps/rejected": -29.24224853515625, + "loss": 1.1686397790908813, + "memory(GiB)": 46.73, + "nll_loss": 0.7285480499267578, + "rewards/accuracies": 0.8125, + "rewards/chosen": -0.11831004917621613, + "rewards/margins": 1.2224053144454956, + "rewards/rejected": -1.3407154083251953, + "step": 87, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.2515408664582403, + "grad_norm": 39.749202728271484, + "learning_rate": 0.00019938879040295508, + "logits/chosen": -0.8551483750343323, + "logits/rejected": -0.8542779684066772, + "logps/chosen": -10.534215927124023, + "logps/rejected": -26.982810974121094, + "loss": 1.2515333890914917, + "memory(GiB)": 46.73, + "nll_loss": 0.7181237936019897, + "rewards/accuracies": 0.71875, + "rewards/chosen": -0.03403427451848984, + "rewards/margins": 1.2902536392211914, + "rewards/rejected": -1.32428777217865, + "step": 88, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.25439928539526574, + "grad_norm": 10.098331451416016, + "learning_rate": 0.00019935340341812737, + "logits/chosen": -0.8135808706283569, + "logits/rejected": -0.8137494325637817, + "logps/chosen": -9.00113582611084, + "logps/rejected": -22.338396072387695, + "loss": 0.9040060639381409, + "memory(GiB)": 46.73, + "nll_loss": 0.5397258400917053, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.04357346147298813, + "rewards/margins": 1.2031430006027222, + "rewards/rejected": -1.159569501876831, + "step": 89, + "train_speed(iter/s)": 0.005435 + }, + { + "epoch": 0.2572577043322912, + "grad_norm": 8.489130973815918, + "learning_rate": 0.00019931702398163657, + "logits/chosen": -0.8590521216392517, + "logits/rejected": -0.8651595711708069, + "logps/chosen": -8.849437713623047, + "logps/rejected": -27.54432487487793, + "loss": 0.8707167506217957, + "memory(GiB)": 46.73, + "nll_loss": 0.48353832960128784, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.06561100482940674, + "rewards/margins": 1.1353689432144165, + "rewards/rejected": -1.0697578191757202, + "step": 90, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.26011612326931666, + "grad_norm": 5.018461227416992, + "learning_rate": 0.00019927965245688072, + "logits/chosen": -0.8591816425323486, + "logits/rejected": -0.8660668730735779, + "logps/chosen": -11.013117790222168, + "logps/rejected": -27.660642623901367, + "loss": 0.9352516531944275, + "memory(GiB)": 46.73, + "nll_loss": 0.541546106338501, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.2031691074371338, + "rewards/margins": 1.437905192375183, + "rewards/rejected": -1.2347362041473389, + "step": 91, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.26297454220634214, + "grad_norm": 6.94728946685791, + "learning_rate": 0.00019924128921716797, + "logits/chosen": -0.8400283455848694, + "logits/rejected": -0.8450547456741333, + "logps/chosen": -9.49151611328125, + "logps/rejected": -28.902881622314453, + "loss": 0.806583821773529, + "memory(GiB)": 46.73, + "nll_loss": 0.3471754193305969, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.21784308552742004, + "rewards/margins": 1.679865837097168, + "rewards/rejected": -1.4620226621627808, + "step": 92, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.2658329611433676, + "grad_norm": 2.8959178924560547, + "learning_rate": 0.00019920193464571275, + "logits/chosen": -0.839047372341156, + "logits/rejected": -0.8450105786323547, + "logps/chosen": -10.59231948852539, + "logps/rejected": -29.6372013092041, + "loss": 0.7759805917739868, + "memory(GiB)": 46.73, + "nll_loss": 0.5248351097106934, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3599660098552704, + "rewards/margins": 1.950143575668335, + "rewards/rejected": -1.5901774168014526, + "step": 93, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.268691380080393, + "grad_norm": 5.318148612976074, + "learning_rate": 0.00019916158913563207, + "logits/chosen": -0.8162392377853394, + "logits/rejected": -0.8246886730194092, + "logps/chosen": -5.6260833740234375, + "logps/rejected": -29.538055419921875, + "loss": 0.6956499218940735, + "memory(GiB)": 46.73, + "nll_loss": 0.38102442026138306, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.2292197048664093, + "rewards/margins": 1.7469617128372192, + "rewards/rejected": -1.5177420377731323, + "step": 94, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.2715497990174185, + "grad_norm": 4.5264787673950195, + "learning_rate": 0.00019912025308994148, + "logits/chosen": -0.8437933325767517, + "logits/rejected": -0.8463299870491028, + "logps/chosen": -8.831324577331543, + "logps/rejected": -26.610977172851562, + "loss": 0.7661141157150269, + "memory(GiB)": 46.73, + "nll_loss": 0.4225902557373047, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.12178793549537659, + "rewards/margins": 1.467708945274353, + "rewards/rejected": -1.3459210395812988, + "step": 95, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.2744082179544439, + "grad_norm": 5.978212356567383, + "learning_rate": 0.00019907792692155113, + "logits/chosen": -0.7815445065498352, + "logits/rejected": -0.78977370262146, + "logps/chosen": -6.673672199249268, + "logps/rejected": -33.78847122192383, + "loss": 0.7695144414901733, + "memory(GiB)": 46.73, + "nll_loss": 0.5254613757133484, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2026345133781433, + "rewards/margins": 1.8294543027877808, + "rewards/rejected": -1.6268197298049927, + "step": 96, + "train_speed(iter/s)": 0.005435 + }, + { + "epoch": 0.2772666368914694, + "grad_norm": 9.170755386352539, + "learning_rate": 0.00019903461105326154, + "logits/chosen": -0.8260455131530762, + "logits/rejected": -0.830398678779602, + "logps/chosen": -6.689513206481934, + "logps/rejected": -22.671979904174805, + "loss": 0.7065067291259766, + "memory(GiB)": 46.73, + "nll_loss": 0.32698267698287964, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.2753945589065552, + "rewards/margins": 1.3633196353912354, + "rewards/rejected": -1.0879249572753906, + "step": 97, + "train_speed(iter/s)": 0.005435 + }, + { + "epoch": 0.28012505582849484, + "grad_norm": 3.521716594696045, + "learning_rate": 0.00019899030591775957, + "logits/chosen": -0.7963160872459412, + "logits/rejected": -0.8014420866966248, + "logps/chosen": -7.337916851043701, + "logps/rejected": -28.08383560180664, + "loss": 0.61917644739151, + "memory(GiB)": 46.73, + "nll_loss": 0.3110499680042267, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.23168900609016418, + "rewards/margins": 1.7576744556427002, + "rewards/rejected": -1.525985598564148, + "step": 98, + "train_speed(iter/s)": 0.005436 + }, + { + "epoch": 0.2829834747655203, + "grad_norm": 5.793614864349365, + "learning_rate": 0.00019894501195761392, + "logits/chosen": -0.8137191534042358, + "logits/rejected": -0.8227260708808899, + "logps/chosen": -6.954023838043213, + "logps/rejected": -35.75700378417969, + "loss": 0.6259573698043823, + "memory(GiB)": 46.73, + "nll_loss": 0.33839166164398193, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.26017990708351135, + "rewards/margins": 2.326916217803955, + "rewards/rejected": -2.0667362213134766, + "step": 99, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.28584189370254576, + "grad_norm": 5.138144493103027, + "learning_rate": 0.00019889872962527072, + "logits/chosen": -0.8491114377975464, + "logits/rejected": -0.8503983020782471, + "logps/chosen": -5.965326309204102, + "logps/rejected": -24.436853408813477, + "loss": 0.9054074287414551, + "memory(GiB)": 46.73, + "nll_loss": 0.3898293972015381, + "rewards/accuracies": 0.65625, + "rewards/chosen": 0.10434619337320328, + "rewards/margins": 1.369442105293274, + "rewards/rejected": -1.265095829963684, + "step": 100, + "train_speed(iter/s)": 0.005437 + }, + { + "epoch": 0.28870031263957124, + "grad_norm": 3.6206700801849365, + "learning_rate": 0.00019885145938304907, + "logits/chosen": -0.8245471119880676, + "logits/rejected": -0.8329594135284424, + "logps/chosen": -12.563156127929688, + "logps/rejected": -31.796875, + "loss": 0.6779420971870422, + "memory(GiB)": 46.73, + "nll_loss": 0.36515456438064575, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.2728801667690277, + "rewards/margins": 2.0701961517333984, + "rewards/rejected": -1.797316074371338, + "step": 101, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.2915587315765967, + "grad_norm": 4.129011154174805, + "learning_rate": 0.0001988032017031364, + "logits/chosen": -0.7823147773742676, + "logits/rejected": -0.7900741696357727, + "logps/chosen": -5.765602111816406, + "logps/rejected": -31.836132049560547, + "loss": 0.533344030380249, + "memory(GiB)": 46.73, + "nll_loss": 0.3198188543319702, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3069157004356384, + "rewards/margins": 2.2244224548339844, + "rewards/rejected": -1.9175068140029907, + "step": 102, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.29441715051362216, + "grad_norm": 7.285937786102295, + "learning_rate": 0.00019875395706758388, + "logits/chosen": -0.8199520707130432, + "logits/rejected": -0.8266770839691162, + "logps/chosen": -6.686117172241211, + "logps/rejected": -35.52680969238281, + "loss": 0.6140994429588318, + "memory(GiB)": 46.73, + "nll_loss": 0.33540287613868713, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3744865357875824, + "rewards/margins": 2.1863038539886475, + "rewards/rejected": -1.8118171691894531, + "step": 103, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.2972755694506476, + "grad_norm": 4.08017110824585, + "learning_rate": 0.0001987037259683013, + "logits/chosen": -0.7858948707580566, + "logits/rejected": -0.7929791808128357, + "logps/chosen": -6.60341215133667, + "logps/rejected": -32.91640853881836, + "loss": 0.49151238799095154, + "memory(GiB)": 46.73, + "nll_loss": 0.26134875416755676, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3017127513885498, + "rewards/margins": 2.313183546066284, + "rewards/rejected": -2.0114707946777344, + "step": 104, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.3001339883876731, + "grad_norm": 6.110865116119385, + "learning_rate": 0.00019865250890705247, + "logits/chosen": -0.8439383506774902, + "logits/rejected": -0.8605507612228394, + "logps/chosen": -5.249790668487549, + "logps/rejected": -45.18266677856445, + "loss": 0.665439248085022, + "memory(GiB)": 46.73, + "nll_loss": 0.4175432622432709, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.19819766283035278, + "rewards/margins": 2.974789619445801, + "rewards/rejected": -2.776592254638672, + "step": 105, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.3029924073246985, + "grad_norm": 8.704270362854004, + "learning_rate": 0.00019860030639545003, + "logits/chosen": -0.8581717610359192, + "logits/rejected": -0.8701122403144836, + "logps/chosen": -8.200727462768555, + "logps/rejected": -39.06196975708008, + "loss": 0.9722508788108826, + "memory(GiB)": 46.73, + "nll_loss": 0.6783410310745239, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.09280453622341156, + "rewards/margins": 2.520831823348999, + "rewards/rejected": -2.4280271530151367, + "step": 106, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.305850826261724, + "grad_norm": 6.919908046722412, + "learning_rate": 0.00019854711895495036, + "logits/chosen": -0.8861989974975586, + "logits/rejected": -0.8968295454978943, + "logps/chosen": -4.962037563323975, + "logps/rejected": -40.77632522583008, + "loss": 0.5569091439247131, + "memory(GiB)": 46.73, + "nll_loss": 0.37660181522369385, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.30795052647590637, + "rewards/margins": 3.064462184906006, + "rewards/rejected": -2.756511688232422, + "step": 107, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3087092451987494, + "grad_norm": 4.996776580810547, + "learning_rate": 0.00019849294711684845, + "logits/chosen": -0.9625644683837891, + "logits/rejected": -0.972130298614502, + "logps/chosen": -8.820281028747559, + "logps/rejected": -50.21597671508789, + "loss": 0.7489598989486694, + "memory(GiB)": 46.73, + "nll_loss": 0.5024483799934387, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.26294729113578796, + "rewards/margins": 3.5292611122131348, + "rewards/rejected": -3.2663135528564453, + "step": 108, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3115676641357749, + "grad_norm": 6.157798767089844, + "learning_rate": 0.00019843779142227256, + "logits/chosen": -0.8762018084526062, + "logits/rejected": -0.882946789264679, + "logps/chosen": -7.924221992492676, + "logps/rejected": -43.705806732177734, + "loss": 0.6497112512588501, + "memory(GiB)": 46.73, + "nll_loss": 0.3160628080368042, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.10452399402856827, + "rewards/margins": 3.319636106491089, + "rewards/rejected": -3.2151122093200684, + "step": 109, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.31442608307280034, + "grad_norm": 15.488557815551758, + "learning_rate": 0.00019838165242217875, + "logits/chosen": -0.863703727722168, + "logits/rejected": -0.8713690042495728, + "logps/chosen": -6.335309028625488, + "logps/rejected": -46.15715026855469, + "loss": 0.871519923210144, + "memory(GiB)": 46.73, + "nll_loss": 0.5997005701065063, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.15678179264068604, + "rewards/margins": 3.3330183029174805, + "rewards/rejected": -3.176236629486084, + "step": 110, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.31728450200982583, + "grad_norm": 4.969946384429932, + "learning_rate": 0.0001983245306773454, + "logits/chosen": -0.8029311895370483, + "logits/rejected": -0.8069216012954712, + "logps/chosen": -5.91574764251709, + "logps/rejected": -26.575307846069336, + "loss": 0.6512956619262695, + "memory(GiB)": 46.73, + "nll_loss": 0.2922568917274475, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.20303387939929962, + "rewards/margins": 1.892715573310852, + "rewards/rejected": -1.6896816492080688, + "step": 111, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.32014292094685126, + "grad_norm": 6.895030498504639, + "learning_rate": 0.0001982664267583677, + "logits/chosen": -0.8168566226959229, + "logits/rejected": -0.8292732238769531, + "logps/chosen": -5.602714538574219, + "logps/rejected": -31.50632667541504, + "loss": 0.8574928641319275, + "memory(GiB)": 46.73, + "nll_loss": 0.5075439810752869, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.010208956897258759, + "rewards/margins": 1.8891350030899048, + "rewards/rejected": -1.8789262771606445, + "step": 112, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.32300133988387675, + "grad_norm": 4.541954040527344, + "learning_rate": 0.00019820734124565182, + "logits/chosen": -0.7733545899391174, + "logits/rejected": -0.7771452069282532, + "logps/chosen": -6.299251079559326, + "logps/rejected": -27.075977325439453, + "loss": 0.7081068754196167, + "memory(GiB)": 46.73, + "nll_loss": 0.3878493905067444, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.13715356588363647, + "rewards/margins": 1.6064281463623047, + "rewards/rejected": -1.4692747592926025, + "step": 113, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3258597588209022, + "grad_norm": 3.1780240535736084, + "learning_rate": 0.00019814727472940917, + "logits/chosen": -0.7537604570388794, + "logits/rejected": -0.7559649348258972, + "logps/chosen": -11.733123779296875, + "logps/rejected": -27.673603057861328, + "loss": 0.71772301197052, + "memory(GiB)": 46.73, + "nll_loss": 0.42100292444229126, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.21125301718711853, + "rewards/margins": 1.6915286779403687, + "rewards/rejected": -1.4802757501602173, + "step": 114, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.32871817775792767, + "grad_norm": 3.8751778602600098, + "learning_rate": 0.00019808622780965066, + "logits/chosen": -0.7520322799682617, + "logits/rejected": -0.7543449401855469, + "logps/chosen": -7.260441303253174, + "logps/rejected": -29.127504348754883, + "loss": 0.6945881843566895, + "memory(GiB)": 46.73, + "nll_loss": 0.3524607717990875, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.26789340376853943, + "rewards/margins": 1.691644549369812, + "rewards/rejected": -1.4237512350082397, + "step": 115, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.3315765966949531, + "grad_norm": 3.0139174461364746, + "learning_rate": 0.0001980242010961803, + "logits/chosen": -0.7901269793510437, + "logits/rejected": -0.7972939014434814, + "logps/chosen": -7.289261341094971, + "logps/rejected": -47.759063720703125, + "loss": 0.5331582427024841, + "memory(GiB)": 46.73, + "nll_loss": 0.38446128368377686, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3029555678367615, + "rewards/margins": 2.9576172828674316, + "rewards/rejected": -2.6546616554260254, + "step": 116, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.3344350156319786, + "grad_norm": 3.233109712600708, + "learning_rate": 0.00019796119520858955, + "logits/chosen": -0.7568274140357971, + "logits/rejected": -0.7630717158317566, + "logps/chosen": -10.064506530761719, + "logps/rejected": -32.50635528564453, + "loss": 0.789489209651947, + "memory(GiB)": 46.73, + "nll_loss": 0.4839721918106079, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.3997339606285095, + "rewards/margins": 2.3508408069610596, + "rewards/rejected": -1.9511069059371948, + "step": 117, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.337293434569004, + "grad_norm": 6.901320934295654, + "learning_rate": 0.0001978972107762509, + "logits/chosen": -0.7462923526763916, + "logits/rejected": -0.7441357970237732, + "logps/chosen": -10.976001739501953, + "logps/rejected": -31.10492706298828, + "loss": 0.7512857913970947, + "memory(GiB)": 46.73, + "nll_loss": 0.43077993392944336, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.1536616086959839, + "rewards/margins": 2.106844186782837, + "rewards/rejected": -1.953182578086853, + "step": 118, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.3401518535060295, + "grad_norm": 2.286742925643921, + "learning_rate": 0.00019783224843831162, + "logits/chosen": -0.7183930277824402, + "logits/rejected": -0.7182736396789551, + "logps/chosen": -8.731864929199219, + "logps/rejected": -33.98211669921875, + "loss": 0.6520930528640747, + "memory(GiB)": 46.73, + "nll_loss": 0.3684110939502716, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.2964346706867218, + "rewards/margins": 2.4515674114227295, + "rewards/rejected": -2.15513277053833, + "step": 119, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.34301027244305493, + "grad_norm": 4.936792850494385, + "learning_rate": 0.00019776630884368738, + "logits/chosen": -0.7660694122314453, + "logits/rejected": -0.776424765586853, + "logps/chosen": -4.871070861816406, + "logps/rejected": -47.67111587524414, + "loss": 0.4515693187713623, + "memory(GiB)": 46.73, + "nll_loss": 0.30822524428367615, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.38517045974731445, + "rewards/margins": 3.7489230632781982, + "rewards/rejected": -3.363752841949463, + "step": 120, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3458686913800804, + "grad_norm": 9.613821983337402, + "learning_rate": 0.00019769939265105573, + "logits/chosen": -0.7732415795326233, + "logits/rejected": -0.7863773703575134, + "logps/chosen": -4.910383701324463, + "logps/rejected": -44.046382904052734, + "loss": 0.6085942983627319, + "memory(GiB)": 46.73, + "nll_loss": 0.3416149616241455, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.3152579069137573, + "rewards/margins": 3.380157470703125, + "rewards/rejected": -3.0648996829986572, + "step": 121, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.34872711031710585, + "grad_norm": 5.3062744140625, + "learning_rate": 0.00019763150052884966, + "logits/chosen": -0.7940014004707336, + "logits/rejected": -0.8029736280441284, + "logps/chosen": -3.551081895828247, + "logps/rejected": -38.06512451171875, + "loss": 0.42784249782562256, + "memory(GiB)": 46.73, + "nll_loss": 0.25387704372406006, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37009117007255554, + "rewards/margins": 2.841196298599243, + "rewards/rejected": -2.471104860305786, + "step": 122, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.35158552925413133, + "grad_norm": 1.533804178237915, + "learning_rate": 0.0001975626331552507, + "logits/chosen": -0.8097442984580994, + "logits/rejected": -0.8176737427711487, + "logps/chosen": -3.7899668216705322, + "logps/rejected": -51.7594108581543, + "loss": 0.3041819632053375, + "memory(GiB)": 46.73, + "nll_loss": 0.2387474924325943, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.35475367307662964, + "rewards/margins": 4.306023597717285, + "rewards/rejected": -3.9512698650360107, + "step": 123, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.35444394819115677, + "grad_norm": 4.373802661895752, + "learning_rate": 0.00019749279121818235, + "logits/chosen": -0.7605909705162048, + "logits/rejected": -0.770943284034729, + "logps/chosen": -8.83084774017334, + "logps/rejected": -59.24419021606445, + "loss": 0.5374789834022522, + "memory(GiB)": 46.73, + "nll_loss": 0.39307644963264465, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.14716514945030212, + "rewards/margins": 4.3210930824279785, + "rewards/rejected": -4.173928260803223, + "step": 124, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.3573023671281822, + "grad_norm": 6.3563103675842285, + "learning_rate": 0.0001974219754153032, + "logits/chosen": -0.8258897066116333, + "logits/rejected": -0.8272631168365479, + "logps/chosen": -7.77381706237793, + "logps/rejected": -41.343414306640625, + "loss": 0.6204044818878174, + "memory(GiB)": 46.73, + "nll_loss": 0.33825787901878357, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.12217142432928085, + "rewards/margins": 3.0349438190460205, + "rewards/rejected": -2.9127724170684814, + "step": 125, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3601607860652077, + "grad_norm": 9.85932731628418, + "learning_rate": 0.00019735018645399967, + "logits/chosen": -0.8187968730926514, + "logits/rejected": -0.8283690214157104, + "logps/chosen": -4.5190534591674805, + "logps/rejected": -45.119789123535156, + "loss": 0.5073397755622864, + "memory(GiB)": 46.73, + "nll_loss": 0.33468902111053467, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.34614282846450806, + "rewards/margins": 3.5951905250549316, + "rewards/rejected": -3.2490477561950684, + "step": 126, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.3630192050022331, + "grad_norm": 3.943042039871216, + "learning_rate": 0.00019727742505137936, + "logits/chosen": -0.7813420295715332, + "logits/rejected": -0.7975005507469177, + "logps/chosen": -7.530571937561035, + "logps/rejected": -53.51607894897461, + "loss": 0.46567243337631226, + "memory(GiB)": 46.73, + "nll_loss": 0.2742045819759369, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.23301076889038086, + "rewards/margins": 3.9482827186584473, + "rewards/rejected": -3.7152719497680664, + "step": 127, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.3658776239392586, + "grad_norm": 1.9621978998184204, + "learning_rate": 0.00019720369193426365, + "logits/chosen": -0.7805514335632324, + "logits/rejected": -0.7947923541069031, + "logps/chosen": -4.593271255493164, + "logps/rejected": -51.02714157104492, + "loss": 0.3543168008327484, + "memory(GiB)": 46.73, + "nll_loss": 0.2695479393005371, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3205646574497223, + "rewards/margins": 3.938343048095703, + "rewards/rejected": -3.6177780628204346, + "step": 128, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.36873604287628403, + "grad_norm": 6.375858783721924, + "learning_rate": 0.00019712898783918038, + "logits/chosen": -0.7720431089401245, + "logits/rejected": -0.7774226069450378, + "logps/chosen": -3.9679479598999023, + "logps/rejected": -39.059242248535156, + "loss": 0.42859622836112976, + "memory(GiB)": 46.73, + "nll_loss": 0.2718777060508728, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.335873007774353, + "rewards/margins": 3.0524649620056152, + "rewards/rejected": -2.7165920734405518, + "step": 129, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.3715944618133095, + "grad_norm": 20.90467643737793, + "learning_rate": 0.00019705331351235674, + "logits/chosen": -0.7668591737747192, + "logits/rejected": -0.7685776948928833, + "logps/chosen": -9.782769203186035, + "logps/rejected": -33.2745361328125, + "loss": 1.310682773590088, + "memory(GiB)": 46.73, + "nll_loss": 0.8834658861160278, + "rewards/accuracies": 0.78125, + "rewards/chosen": -0.039194077253341675, + "rewards/margins": 2.1344308853149414, + "rewards/rejected": -2.1736247539520264, + "step": 130, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.37445288075033495, + "grad_norm": 2.3716464042663574, + "learning_rate": 0.00019697666970971153, + "logits/chosen": -0.7852880954742432, + "logits/rejected": -0.7899134755134583, + "logps/chosen": -6.234109878540039, + "logps/rejected": -42.3105354309082, + "loss": 0.4260920286178589, + "memory(GiB)": 46.73, + "nll_loss": 0.25257518887519836, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3239039182662964, + "rewards/margins": 3.0808892250061035, + "rewards/rejected": -2.7569851875305176, + "step": 131, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.37731129968736044, + "grad_norm": 17.186786651611328, + "learning_rate": 0.00019689905719684782, + "logits/chosen": -0.7246553301811218, + "logits/rejected": -0.739700198173523, + "logps/chosen": -4.994725227355957, + "logps/rejected": -37.61749267578125, + "loss": 0.7901899814605713, + "memory(GiB)": 46.73, + "nll_loss": 0.529437243938446, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3914901614189148, + "rewards/margins": 2.7029402256011963, + "rewards/rejected": -2.311450242996216, + "step": 132, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.38016971862438587, + "grad_norm": 19.44753646850586, + "learning_rate": 0.00019682047674904525, + "logits/chosen": -0.7204717993736267, + "logits/rejected": -0.7237159013748169, + "logps/chosen": -10.331472396850586, + "logps/rejected": -44.90771484375, + "loss": 0.9498412609100342, + "memory(GiB)": 46.73, + "nll_loss": 0.6981635093688965, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.13750669360160828, + "rewards/margins": 3.0414295196533203, + "rewards/rejected": -2.9039225578308105, + "step": 133, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.38302813756141135, + "grad_norm": 2.630051612854004, + "learning_rate": 0.00019674092915125218, + "logits/chosen": -0.7359256148338318, + "logits/rejected": -0.7523387670516968, + "logps/chosen": -5.2792582511901855, + "logps/rejected": -53.244354248046875, + "loss": 0.37174469232559204, + "memory(GiB)": 46.73, + "nll_loss": 0.19531044363975525, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.35951948165893555, + "rewards/margins": 3.9146037101745605, + "rewards/rejected": -3.555084228515625, + "step": 134, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.3858865564984368, + "grad_norm": 8.38878059387207, + "learning_rate": 0.00019666041519807802, + "logits/chosen": -0.7512345910072327, + "logits/rejected": -0.7590532302856445, + "logps/chosen": -7.108774662017822, + "logps/rejected": -49.24845886230469, + "loss": 0.515214741230011, + "memory(GiB)": 46.73, + "nll_loss": 0.35548365116119385, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.11580058932304382, + "rewards/margins": 3.6866679191589355, + "rewards/rejected": -3.5708670616149902, + "step": 135, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.38874497543546227, + "grad_norm": 7.971051216125488, + "learning_rate": 0.0001965789356937852, + "logits/chosen": -0.7898239493370056, + "logits/rejected": -0.7973160743713379, + "logps/chosen": -9.885854721069336, + "logps/rejected": -55.670047760009766, + "loss": 0.7229015827178955, + "memory(GiB)": 46.73, + "nll_loss": 0.43035101890563965, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.13693107664585114, + "rewards/margins": 3.9661924839019775, + "rewards/rejected": -3.829261541366577, + "step": 136, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.3916033943724877, + "grad_norm": 6.154712677001953, + "learning_rate": 0.00019649649145228102, + "logits/chosen": -0.7895013689994812, + "logits/rejected": -0.7943228483200073, + "logps/chosen": -5.192661285400391, + "logps/rejected": -39.91571044921875, + "loss": 0.5592948794364929, + "memory(GiB)": 46.73, + "nll_loss": 0.22298313677310944, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.19678261876106262, + "rewards/margins": 2.95813250541687, + "rewards/rejected": -2.761349678039551, + "step": 137, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3944618133095132, + "grad_norm": 2.1893486976623535, + "learning_rate": 0.0001964130832971098, + "logits/chosen": -0.7978731393814087, + "logits/rejected": -0.808353066444397, + "logps/chosen": -7.741363048553467, + "logps/rejected": -49.584014892578125, + "loss": 0.4424561560153961, + "memory(GiB)": 46.73, + "nll_loss": 0.3187883198261261, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3768758773803711, + "rewards/margins": 3.4152517318725586, + "rewards/rejected": -3.0383756160736084, + "step": 138, + "train_speed(iter/s)": 0.005431 + }, + { + "epoch": 0.3973202322465386, + "grad_norm": 3.585315465927124, + "learning_rate": 0.0001963287120614444, + "logits/chosen": -0.8294897079467773, + "logits/rejected": -0.8371224403381348, + "logps/chosen": -4.645942211151123, + "logps/rejected": -41.52901840209961, + "loss": 0.5509465336799622, + "memory(GiB)": 46.73, + "nll_loss": 0.3694899380207062, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.15256014466285706, + "rewards/margins": 3.042027473449707, + "rewards/rejected": -2.8894670009613037, + "step": 139, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.4001786511835641, + "grad_norm": 3.1583364009857178, + "learning_rate": 0.00019624337858807807, + "logits/chosen": -0.8058665990829468, + "logits/rejected": -0.802970290184021, + "logps/chosen": -12.615983009338379, + "logps/rejected": -42.576560974121094, + "loss": 0.47237128019332886, + "memory(GiB)": 46.73, + "nll_loss": 0.28210973739624023, + "rewards/accuracies": 0.875, + "rewards/chosen": -0.08335088193416595, + "rewards/margins": 2.9341583251953125, + "rewards/rejected": -3.0175094604492188, + "step": 140, + "train_speed(iter/s)": 0.005432 + }, + { + "epoch": 0.40303707012058954, + "grad_norm": 1.9583823680877686, + "learning_rate": 0.00019615708372941587, + "logits/chosen": -0.7773740887641907, + "logits/rejected": -0.7813900113105774, + "logps/chosen": -7.43025016784668, + "logps/rejected": -48.81037521362305, + "loss": 0.45620426535606384, + "memory(GiB)": 46.73, + "nll_loss": 0.2858808636665344, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.14979784190654755, + "rewards/margins": 3.327134847640991, + "rewards/rejected": -3.177337169647217, + "step": 141, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.405895489057615, + "grad_norm": 17.376474380493164, + "learning_rate": 0.00019606982834746627, + "logits/chosen": -0.8055461645126343, + "logits/rejected": -0.8150217533111572, + "logps/chosen": -9.388490676879883, + "logps/rejected": -43.86671447753906, + "loss": 1.0983664989471436, + "memory(GiB)": 46.73, + "nll_loss": 0.7692541480064392, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.1326138973236084, + "rewards/margins": 2.8655741214752197, + "rewards/rejected": -2.7329602241516113, + "step": 142, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.40875390799464045, + "grad_norm": 35.17894744873047, + "learning_rate": 0.00019598161331383257, + "logits/chosen": -0.8625121116638184, + "logits/rejected": -0.871791422367096, + "logps/chosen": -9.16450023651123, + "logps/rejected": -47.45623016357422, + "loss": 0.7930290102958679, + "memory(GiB)": 46.73, + "nll_loss": 0.543784499168396, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.08059316873550415, + "rewards/margins": 3.273069381713867, + "rewards/rejected": -3.192476272583008, + "step": 143, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.41161232693166594, + "grad_norm": 4.112196445465088, + "learning_rate": 0.00019589243950970402, + "logits/chosen": -0.8877297043800354, + "logits/rejected": -0.8911035060882568, + "logps/chosen": -6.215106964111328, + "logps/rejected": -41.89563751220703, + "loss": 0.3530213236808777, + "memory(GiB)": 46.73, + "nll_loss": 0.20008514821529388, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3117275834083557, + "rewards/margins": 3.073056221008301, + "rewards/rejected": -2.76132869720459, + "step": 144, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.41447074586869137, + "grad_norm": 12.758796691894531, + "learning_rate": 0.00019580230782584722, + "logits/chosen": -0.8928901553153992, + "logits/rejected": -0.8998609781265259, + "logps/chosen": -5.406792640686035, + "logps/rejected": -40.006412506103516, + "loss": 0.5003563165664673, + "memory(GiB)": 46.73, + "nll_loss": 0.30671095848083496, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.23732616007328033, + "rewards/margins": 2.932386636734009, + "rewards/rejected": -2.6950607299804688, + "step": 145, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.41732916480571686, + "grad_norm": 4.014595985412598, + "learning_rate": 0.00019571121916259706, + "logits/chosen": -0.887598991394043, + "logits/rejected": -0.8942646384239197, + "logps/chosen": -4.3415961265563965, + "logps/rejected": -46.59621810913086, + "loss": 0.36891594529151917, + "memory(GiB)": 46.73, + "nll_loss": 0.2651711106300354, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.36169373989105225, + "rewards/margins": 3.6561460494995117, + "rewards/rejected": -3.294452428817749, + "step": 146, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.4201875837427423, + "grad_norm": 10.37033462524414, + "learning_rate": 0.00019561917442984788, + "logits/chosen": -0.8872988224029541, + "logits/rejected": -0.8909754753112793, + "logps/chosen": -7.036233901977539, + "logps/rejected": -44.856361389160156, + "loss": 0.5071041584014893, + "memory(GiB)": 46.73, + "nll_loss": 0.4129847586154938, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.29683101177215576, + "rewards/margins": 3.6587531566619873, + "rewards/rejected": -3.361922025680542, + "step": 147, + "train_speed(iter/s)": 0.005434 + }, + { + "epoch": 0.4230460026797678, + "grad_norm": 12.54053783416748, + "learning_rate": 0.00019552617454704428, + "logits/chosen": -0.909309983253479, + "logits/rejected": -0.9173017144203186, + "logps/chosen": -5.930859088897705, + "logps/rejected": -46.784332275390625, + "loss": 0.6537680625915527, + "memory(GiB)": 46.73, + "nll_loss": 0.521246075630188, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.25368478894233704, + "rewards/margins": 3.396470308303833, + "rewards/rejected": -3.1427857875823975, + "step": 148, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.4259044216167932, + "grad_norm": 2.5870954990386963, + "learning_rate": 0.00019543222044317188, + "logits/chosen": -0.8764325976371765, + "logits/rejected": -0.881737232208252, + "logps/chosen": -5.638083457946777, + "logps/rejected": -47.27805709838867, + "loss": 0.3462856113910675, + "memory(GiB)": 46.73, + "nll_loss": 0.22526228427886963, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3174706697463989, + "rewards/margins": 3.5086669921875, + "rewards/rejected": -3.1911962032318115, + "step": 149, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.4287628405538187, + "grad_norm": 9.161517143249512, + "learning_rate": 0.00019533731305674818, + "logits/chosen": -0.8732975721359253, + "logits/rejected": -0.8769663572311401, + "logps/chosen": -9.518259048461914, + "logps/rejected": -42.666114807128906, + "loss": 0.9442892670631409, + "memory(GiB)": 46.73, + "nll_loss": 0.6460040211677551, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.07534892857074738, + "rewards/margins": 3.1069083213806152, + "rewards/rejected": -3.0315592288970947, + "step": 150, + "train_speed(iter/s)": 0.005433 + }, + { + "epoch": 0.4316212594908441, + "grad_norm": 17.615604400634766, + "learning_rate": 0.00019524145333581317, + "logits/chosen": -0.8912621736526489, + "logits/rejected": -0.8975273966789246, + "logps/chosen": -10.543143272399902, + "logps/rejected": -44.90479278564453, + "loss": 1.2651307582855225, + "memory(GiB)": 46.73, + "nll_loss": 0.7548849582672119, + "rewards/accuracies": 0.84375, + "rewards/chosen": -0.13807448744773865, + "rewards/margins": 3.1065428256988525, + "rewards/rejected": -3.244617223739624, + "step": 151, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.4344796784278696, + "grad_norm": 2.197153091430664, + "learning_rate": 0.00019514464223791965, + "logits/chosen": -0.8220558762550354, + "logits/rejected": -0.8305569291114807, + "logps/chosen": -7.629626274108887, + "logps/rejected": -46.86054229736328, + "loss": 0.5103957653045654, + "memory(GiB)": 46.73, + "nll_loss": 0.4139241874217987, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3421666920185089, + "rewards/margins": 3.841639995574951, + "rewards/rejected": -3.4994730949401855, + "step": 152, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.43733809736489504, + "grad_norm": 2.0711119174957275, + "learning_rate": 0.00019504688073012397, + "logits/chosen": -0.8169566988945007, + "logits/rejected": -0.8239966034889221, + "logps/chosen": -6.1432342529296875, + "logps/rejected": -42.3114013671875, + "loss": 0.4369783401489258, + "memory(GiB)": 46.73, + "nll_loss": 0.22974222898483276, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.2705279588699341, + "rewards/margins": 2.976038932800293, + "rewards/rejected": -2.7055106163024902, + "step": 153, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.4401965163019205, + "grad_norm": 11.810593605041504, + "learning_rate": 0.00019494816978897616, + "logits/chosen": -0.8318780064582825, + "logits/rejected": -0.8391178846359253, + "logps/chosen": -7.192132472991943, + "logps/rejected": -39.354427337646484, + "loss": 0.6350818872451782, + "memory(GiB)": 46.73, + "nll_loss": 0.475485622882843, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3430967926979065, + "rewards/margins": 2.803071975708008, + "rewards/rejected": -2.459975004196167, + "step": 154, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.44305493523894596, + "grad_norm": 2.665921688079834, + "learning_rate": 0.0001948485104005103, + "logits/chosen": -0.8109292984008789, + "logits/rejected": -0.8165513277053833, + "logps/chosen": -4.813442230224609, + "logps/rejected": -38.313106536865234, + "loss": 0.6565403938293457, + "memory(GiB)": 46.73, + "nll_loss": 0.4435839056968689, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.25875312089920044, + "rewards/margins": 3.050962209701538, + "rewards/rejected": -2.7922089099884033, + "step": 155, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.4459133541759714, + "grad_norm": 2.126662015914917, + "learning_rate": 0.00019474790356023455, + "logits/chosen": -0.8104051351547241, + "logits/rejected": -0.8165953755378723, + "logps/chosen": -4.292057514190674, + "logps/rejected": -44.862060546875, + "loss": 0.309725821018219, + "memory(GiB)": 46.73, + "nll_loss": 0.18593546748161316, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3211231231689453, + "rewards/margins": 3.5143370628356934, + "rewards/rejected": -3.193213939666748, + "step": 156, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.4487717731129969, + "grad_norm": 3.4068145751953125, + "learning_rate": 0.00019464635027312128, + "logits/chosen": -0.8355593681335449, + "logits/rejected": -0.8380401730537415, + "logps/chosen": -6.426550388336182, + "logps/rejected": -44.43500518798828, + "loss": 0.6942108273506165, + "memory(GiB)": 46.73, + "nll_loss": 0.4586290121078491, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.1291281133890152, + "rewards/margins": 3.1570847034454346, + "rewards/rejected": -3.02795672416687, + "step": 157, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.4516301920500223, + "grad_norm": 4.667487621307373, + "learning_rate": 0.00019454385155359702, + "logits/chosen": -0.849906325340271, + "logits/rejected": -0.8568750619888306, + "logps/chosen": -9.276833534240723, + "logps/rejected": -49.35503387451172, + "loss": 0.4330065846443176, + "memory(GiB)": 46.73, + "nll_loss": 0.2498662769794464, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3473469913005829, + "rewards/margins": 4.031757354736328, + "rewards/rejected": -3.684410572052002, + "step": 158, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.4544886109870478, + "grad_norm": 1.687165379524231, + "learning_rate": 0.00019444040842553237, + "logits/chosen": -0.890581488609314, + "logits/rejected": -0.9015938639640808, + "logps/chosen": -3.249390125274658, + "logps/rejected": -57.22711181640625, + "loss": 0.362801194190979, + "memory(GiB)": 46.73, + "nll_loss": 0.22434672713279724, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2739589512348175, + "rewards/margins": 4.31603479385376, + "rewards/rejected": -4.0420756340026855, + "step": 159, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.4573470299240732, + "grad_norm": 12.536514282226562, + "learning_rate": 0.00019433602192223164, + "logits/chosen": -0.8646700382232666, + "logits/rejected": -0.872589111328125, + "logps/chosen": -6.172619342803955, + "logps/rejected": -48.3273811340332, + "loss": 0.6447067856788635, + "memory(GiB)": 46.73, + "nll_loss": 0.32002851366996765, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.09112294018268585, + "rewards/margins": 3.2884745597839355, + "rewards/rejected": -3.1973516941070557, + "step": 160, + "train_speed(iter/s)": 0.005426 + }, + { + "epoch": 0.4602054488610987, + "grad_norm": 3.207699775695801, + "learning_rate": 0.00019423069308642266, + "logits/chosen": -0.8848387002944946, + "logits/rejected": -0.8890655636787415, + "logps/chosen": -6.779003620147705, + "logps/rejected": -52.09819030761719, + "loss": 0.35991424322128296, + "memory(GiB)": 46.73, + "nll_loss": 0.26353347301483154, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40888625383377075, + "rewards/margins": 4.320865631103516, + "rewards/rejected": -3.9119794368743896, + "step": 161, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.46306386779812414, + "grad_norm": 13.387569427490234, + "learning_rate": 0.00019412442297024637, + "logits/chosen": -0.8957618474960327, + "logits/rejected": -0.8995543718338013, + "logps/chosen": -8.413171768188477, + "logps/rejected": -39.29925537109375, + "loss": 0.7494506239891052, + "memory(GiB)": 46.73, + "nll_loss": 0.4951186180114746, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.03331068903207779, + "rewards/margins": 2.7600255012512207, + "rewards/rejected": -2.726714849472046, + "step": 162, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.4659222867351496, + "grad_norm": 14.89892578125, + "learning_rate": 0.00019401721263524616, + "logits/chosen": -0.8836920261383057, + "logits/rejected": -0.8899936079978943, + "logps/chosen": -8.512656211853027, + "logps/rejected": -46.419029235839844, + "loss": 0.5585404634475708, + "memory(GiB)": 46.73, + "nll_loss": 0.3683706820011139, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.24114097654819489, + "rewards/margins": 3.47017240524292, + "rewards/rejected": -3.229031562805176, + "step": 163, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.46878070567217506, + "grad_norm": 14.938558578491211, + "learning_rate": 0.0001939090631523574, + "logits/chosen": -0.935294508934021, + "logits/rejected": -0.9457290768623352, + "logps/chosen": -7.823429107666016, + "logps/rejected": -56.9812126159668, + "loss": 1.0811909437179565, + "memory(GiB)": 46.73, + "nll_loss": 0.7688519954681396, + "rewards/accuracies": 0.875, + "rewards/chosen": -0.035027798265218735, + "rewards/margins": 3.6944613456726074, + "rewards/rejected": -3.729489326477051, + "step": 164, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.47163912460920054, + "grad_norm": 8.26276683807373, + "learning_rate": 0.00019379997560189675, + "logits/chosen": -0.9381538033485413, + "logits/rejected": -0.9450898170471191, + "logps/chosen": -6.668002605438232, + "logps/rejected": -51.126930236816406, + "loss": 0.5152188539505005, + "memory(GiB)": 46.73, + "nll_loss": 0.4229362905025482, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.14181563258171082, + "rewards/margins": 4.032417297363281, + "rewards/rejected": -3.890601873397827, + "step": 165, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.474497543546226, + "grad_norm": 5.228875160217285, + "learning_rate": 0.00019368995107355133, + "logits/chosen": -0.9465993642807007, + "logits/rejected": -0.9516839981079102, + "logps/chosen": -6.645859718322754, + "logps/rejected": -49.824649810791016, + "loss": 0.6003601551055908, + "memory(GiB)": 46.73, + "nll_loss": 0.4243951737880707, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.1566632241010666, + "rewards/margins": 3.7477457523345947, + "rewards/rejected": -3.5910823345184326, + "step": 166, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.47735596248325146, + "grad_norm": 11.680534362792969, + "learning_rate": 0.00019357899066636773, + "logits/chosen": -0.9604209661483765, + "logits/rejected": -0.9663453102111816, + "logps/chosen": -11.16219711303711, + "logps/rejected": -54.03529357910156, + "loss": 0.6696478128433228, + "memory(GiB)": 46.73, + "nll_loss": 0.5087156295776367, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.24885831773281097, + "rewards/margins": 4.16080379486084, + "rewards/rejected": -3.9119460582733154, + "step": 167, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.4802143814202769, + "grad_norm": 6.519625663757324, + "learning_rate": 0.00019346709548874127, + "logits/chosen": -0.9105353355407715, + "logits/rejected": -0.9168953895568848, + "logps/chosen": -7.151789665222168, + "logps/rejected": -51.146156311035156, + "loss": 0.538978099822998, + "memory(GiB)": 46.73, + "nll_loss": 0.38577884435653687, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.34396299719810486, + "rewards/margins": 4.075203895568848, + "rewards/rejected": -3.731240749359131, + "step": 168, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.4830728003573024, + "grad_norm": 11.481460571289062, + "learning_rate": 0.0001933542666584047, + "logits/chosen": -0.9098703265190125, + "logits/rejected": -0.9205840826034546, + "logps/chosen": -9.062050819396973, + "logps/rejected": -64.49413299560547, + "loss": 0.526665985584259, + "memory(GiB)": 46.73, + "nll_loss": 0.40413621068000793, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2691805362701416, + "rewards/margins": 5.563024044036865, + "rewards/rejected": -5.293843746185303, + "step": 169, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.4859312192943278, + "grad_norm": 13.25565242767334, + "learning_rate": 0.0001932405053024171, + "logits/chosen": -0.9104465246200562, + "logits/rejected": -0.917874276638031, + "logps/chosen": -11.206613540649414, + "logps/rejected": -57.438724517822266, + "loss": 1.0738518238067627, + "memory(GiB)": 46.73, + "nll_loss": 0.6307643055915833, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.05714952200651169, + "rewards/margins": 4.167277812957764, + "rewards/rejected": -4.110127925872803, + "step": 170, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.4887896382313533, + "grad_norm": 17.771833419799805, + "learning_rate": 0.00019312581255715277, + "logits/chosen": -0.8956343531608582, + "logits/rejected": -0.9024403691291809, + "logps/chosen": -13.308263778686523, + "logps/rejected": -65.24011993408203, + "loss": 0.9896730184555054, + "memory(GiB)": 46.73, + "nll_loss": 0.5083594918251038, + "rewards/accuracies": 0.71875, + "rewards/chosen": -0.0635133907198906, + "rewards/margins": 4.961539268493652, + "rewards/rejected": -5.025052547454834, + "step": 171, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.4916480571683787, + "grad_norm": 6.4772748947143555, + "learning_rate": 0.00019301018956828964, + "logits/chosen": -0.898830771446228, + "logits/rejected": -0.9118731021881104, + "logps/chosen": -8.135079383850098, + "logps/rejected": -57.8392333984375, + "loss": 0.5032879710197449, + "memory(GiB)": 46.73, + "nll_loss": 0.3064589500427246, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.2829325497150421, + "rewards/margins": 4.001053333282471, + "rewards/rejected": -3.718120574951172, + "step": 172, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.4945064761054042, + "grad_norm": 6.827486515045166, + "learning_rate": 0.000192893637490798, + "logits/chosen": -0.8352851867675781, + "logits/rejected": -0.8436259627342224, + "logps/chosen": -6.111320972442627, + "logps/rejected": -51.995445251464844, + "loss": 0.5788933038711548, + "memory(GiB)": 46.73, + "nll_loss": 0.27805906534194946, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.23611441254615784, + "rewards/margins": 3.686123847961426, + "rewards/rejected": -3.450009346008301, + "step": 173, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.49736489504242964, + "grad_norm": 3.4567549228668213, + "learning_rate": 0.00019277615748892885, + "logits/chosen": -0.785612165927887, + "logits/rejected": -0.7931377291679382, + "logps/chosen": -7.273856163024902, + "logps/rejected": -36.88285446166992, + "loss": 0.5589325428009033, + "memory(GiB)": 46.73, + "nll_loss": 0.37298017740249634, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4650301933288574, + "rewards/margins": 2.7481539249420166, + "rewards/rejected": -2.283123731613159, + "step": 174, + "train_speed(iter/s)": 0.00543 + }, + { + "epoch": 0.5002233139794551, + "grad_norm": 4.234227180480957, + "learning_rate": 0.00019265775073620245, + "logits/chosen": -0.7631555795669556, + "logits/rejected": -0.7687059044837952, + "logps/chosen": -6.337590217590332, + "logps/rejected": -35.29618453979492, + "loss": 0.6258898377418518, + "memory(GiB)": 46.73, + "nll_loss": 0.3696868121623993, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.21472924947738647, + "rewards/margins": 2.4024829864501953, + "rewards/rejected": -2.187753915786743, + "step": 175, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5030817329164806, + "grad_norm": 2.355490207672119, + "learning_rate": 0.00019253841841539632, + "logits/chosen": -0.7690540552139282, + "logits/rejected": -0.7676496505737305, + "logps/chosen": -12.918010711669922, + "logps/rejected": -30.43984603881836, + "loss": 0.6801320910453796, + "memory(GiB)": 46.73, + "nll_loss": 0.42714056372642517, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2977921664714813, + "rewards/margins": 2.146160125732422, + "rewards/rejected": -1.8483679294586182, + "step": 176, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.505940151853506, + "grad_norm": 1.5704671144485474, + "learning_rate": 0.0001924181617185336, + "logits/chosen": -0.7616850137710571, + "logits/rejected": -0.767928957939148, + "logps/chosen": -6.664812088012695, + "logps/rejected": -37.411277770996094, + "loss": 0.42176908254623413, + "memory(GiB)": 46.73, + "nll_loss": 0.2451857030391693, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.489712655544281, + "rewards/margins": 2.708432674407959, + "rewards/rejected": -2.218719959259033, + "step": 177, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5087985707905315, + "grad_norm": 2.1187188625335693, + "learning_rate": 0.00019229698184687128, + "logits/chosen": -0.7447081804275513, + "logits/rejected": -0.7508732080459595, + "logps/chosen": -5.233465671539307, + "logps/rejected": -35.176971435546875, + "loss": 0.5185775756835938, + "memory(GiB)": 46.73, + "nll_loss": 0.336780309677124, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.44237199425697327, + "rewards/margins": 2.7804007530212402, + "rewards/rejected": -2.3380286693573, + "step": 178, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5116569897275569, + "grad_norm": 3.629459857940674, + "learning_rate": 0.00019217488001088784, + "logits/chosen": -0.7853379249572754, + "logits/rejected": -0.8011223673820496, + "logps/chosen": -5.379916667938232, + "logps/rejected": -53.26487731933594, + "loss": 0.368004709482193, + "memory(GiB)": 46.73, + "nll_loss": 0.2341601699590683, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.32777413725852966, + "rewards/margins": 3.8236327171325684, + "rewards/rejected": -3.4958581924438477, + "step": 179, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5145154086645825, + "grad_norm": 6.440499782562256, + "learning_rate": 0.00019205185743027147, + "logits/chosen": -0.8589999079704285, + "logits/rejected": -0.8642404079437256, + "logps/chosen": -7.5277910232543945, + "logps/rejected": -48.523780822753906, + "loss": 0.4521387219429016, + "memory(GiB)": 46.73, + "nll_loss": 0.30114930868148804, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.30447474122047424, + "rewards/margins": 3.6830883026123047, + "rewards/rejected": -3.3786139488220215, + "step": 180, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5173738276016079, + "grad_norm": 1.3223450183868408, + "learning_rate": 0.00019192791533390776, + "logits/chosen": -0.8698243498802185, + "logits/rejected": -0.8859831094741821, + "logps/chosen": -5.199261665344238, + "logps/rejected": -53.24699783325195, + "loss": 0.32750457525253296, + "memory(GiB)": 46.73, + "nll_loss": 0.2843254506587982, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5321836471557617, + "rewards/margins": 4.558604717254639, + "rewards/rejected": -4.026421070098877, + "step": 181, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.5202322465386333, + "grad_norm": 6.235518932342529, + "learning_rate": 0.0001918030549598674, + "logits/chosen": -0.8939491510391235, + "logits/rejected": -0.9015032052993774, + "logps/chosen": -6.817130088806152, + "logps/rejected": -48.4378662109375, + "loss": 0.8820070028305054, + "memory(GiB)": 46.73, + "nll_loss": 0.5765649676322937, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.1285572648048401, + "rewards/margins": 3.808832883834839, + "rewards/rejected": -3.6802756786346436, + "step": 182, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.5230906654756587, + "grad_norm": 2.177001476287842, + "learning_rate": 0.00019167727755539394, + "logits/chosen": -0.9257232546806335, + "logits/rejected": -0.934444785118103, + "logps/chosen": -5.833935737609863, + "logps/rejected": -59.789955139160156, + "loss": 0.6103315949440002, + "memory(GiB)": 46.73, + "nll_loss": 0.42996734380722046, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.15345799922943115, + "rewards/margins": 5.012732982635498, + "rewards/rejected": -4.859274387359619, + "step": 183, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5259490844126843, + "grad_norm": 5.315007209777832, + "learning_rate": 0.00019155058437689114, + "logits/chosen": -0.9314823150634766, + "logits/rejected": -0.9416366815567017, + "logps/chosen": -6.756455421447754, + "logps/rejected": -56.72506332397461, + "loss": 0.7174702286720276, + "memory(GiB)": 46.73, + "nll_loss": 0.523749589920044, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.12303046137094498, + "rewards/margins": 4.29641580581665, + "rewards/rejected": -4.173385143280029, + "step": 184, + "train_speed(iter/s)": 0.005427 + }, + { + "epoch": 0.5288075033497097, + "grad_norm": 3.7265548706054688, + "learning_rate": 0.00019142297668991055, + "logits/chosen": -0.9351843595504761, + "logits/rejected": -0.9576059579849243, + "logps/chosen": -5.578176021575928, + "logps/rejected": -59.8486328125, + "loss": 0.6304588317871094, + "memory(GiB)": 46.73, + "nll_loss": 0.46496981382369995, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3721676766872406, + "rewards/margins": 4.994194507598877, + "rewards/rejected": -4.622026443481445, + "step": 185, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5316659222867351, + "grad_norm": 4.928941249847412, + "learning_rate": 0.00019129445576913888, + "logits/chosen": -0.8918996453285217, + "logits/rejected": -0.9014327526092529, + "logps/chosen": -5.464908123016357, + "logps/rejected": -53.11490249633789, + "loss": 0.8896833658218384, + "memory(GiB)": 46.73, + "nll_loss": 0.6313154697418213, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.12775132060050964, + "rewards/margins": 4.158487796783447, + "rewards/rejected": -4.030736923217773, + "step": 186, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5345243412237606, + "grad_norm": 7.509690284729004, + "learning_rate": 0.00019116502289838523, + "logits/chosen": -0.8859353065490723, + "logits/rejected": -0.9015785455703735, + "logps/chosen": -4.673905372619629, + "logps/rejected": -70.63243865966797, + "loss": 0.3962274491786957, + "memory(GiB)": 46.73, + "nll_loss": 0.3365238308906555, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3394577205181122, + "rewards/margins": 5.691706657409668, + "rewards/rejected": -5.352249622344971, + "step": 187, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.537382760160786, + "grad_norm": 1.5954922437667847, + "learning_rate": 0.00019103467937056824, + "logits/chosen": -0.9184845685958862, + "logits/rejected": -0.9304262399673462, + "logps/chosen": -4.041568756103516, + "logps/rejected": -76.92243957519531, + "loss": 0.3016416132450104, + "memory(GiB)": 46.73, + "nll_loss": 0.18911761045455933, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4253259301185608, + "rewards/margins": 6.5727128982543945, + "rewards/rejected": -6.1473870277404785, + "step": 188, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5402411790978116, + "grad_norm": 2.318643808364868, + "learning_rate": 0.0001909034264877032, + "logits/chosen": -0.8512060642242432, + "logits/rejected": -0.856816291809082, + "logps/chosen": -7.1723408699035645, + "logps/rejected": -48.11109161376953, + "loss": 0.4600585699081421, + "memory(GiB)": 46.73, + "nll_loss": 0.3386399745941162, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.33302804827690125, + "rewards/margins": 4.015811443328857, + "rewards/rejected": -3.682783365249634, + "step": 189, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.543099598034837, + "grad_norm": 1.4476327896118164, + "learning_rate": 0.0001907712655608891, + "logits/chosen": -0.8637464642524719, + "logits/rejected": -0.8820706009864807, + "logps/chosen": -3.2855453491210938, + "logps/rejected": -71.99874114990234, + "loss": 0.293333500623703, + "memory(GiB)": 46.73, + "nll_loss": 0.18421968817710876, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.28944161534309387, + "rewards/margins": 5.838719844818115, + "rewards/rejected": -5.549278259277344, + "step": 190, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5459580169718624, + "grad_norm": 4.899955749511719, + "learning_rate": 0.0001906381979102953, + "logits/chosen": -0.9037999510765076, + "logits/rejected": -0.9121489524841309, + "logps/chosen": -9.670417785644531, + "logps/rejected": -52.208683013916016, + "loss": 0.5949208736419678, + "memory(GiB)": 46.73, + "nll_loss": 0.38334017992019653, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.15043097734451294, + "rewards/margins": 4.171907901763916, + "rewards/rejected": -4.021476745605469, + "step": 191, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5488164359088878, + "grad_norm": 12.610368728637695, + "learning_rate": 0.00019050422486514878, + "logits/chosen": -0.840286374092102, + "logits/rejected": -0.8606438636779785, + "logps/chosen": -8.77206039428711, + "logps/rejected": -61.208587646484375, + "loss": 0.6860842108726501, + "memory(GiB)": 46.73, + "nll_loss": 0.49322137236595154, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2522002160549164, + "rewards/margins": 4.72483491897583, + "rewards/rejected": -4.472634792327881, + "step": 192, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5516748548459134, + "grad_norm": 7.451924800872803, + "learning_rate": 0.0001903693477637204, + "logits/chosen": -0.8095037937164307, + "logits/rejected": -0.8195419311523438, + "logps/chosen": -4.377245903015137, + "logps/rejected": -58.97959518432617, + "loss": 0.2787761986255646, + "memory(GiB)": 46.73, + "nll_loss": 0.24894402921199799, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3338276147842407, + "rewards/margins": 4.592215061187744, + "rewards/rejected": -4.258387088775635, + "step": 193, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5545332737829388, + "grad_norm": 1.0700743198394775, + "learning_rate": 0.00019023356795331182, + "logits/chosen": -0.8574849963188171, + "logits/rejected": -0.871565043926239, + "logps/chosen": -9.894993782043457, + "logps/rejected": -60.1685676574707, + "loss": 0.446493536233902, + "memory(GiB)": 46.73, + "nll_loss": 0.3630823493003845, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3332892954349518, + "rewards/margins": 4.909541606903076, + "rewards/rejected": -4.576252460479736, + "step": 194, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5573916927199642, + "grad_norm": 1.5138012170791626, + "learning_rate": 0.0001900968867902419, + "logits/chosen": -0.8919128775596619, + "logits/rejected": -0.8939546942710876, + "logps/chosen": -4.437774181365967, + "logps/rejected": -52.1574592590332, + "loss": 0.2619098424911499, + "memory(GiB)": 46.73, + "nll_loss": 0.20320795476436615, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3197801113128662, + "rewards/margins": 4.577724456787109, + "rewards/rejected": -4.257944583892822, + "step": 195, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5602501116569897, + "grad_norm": 3.5410804748535156, + "learning_rate": 0.00018995930563983334, + "logits/chosen": -0.8741534352302551, + "logits/rejected": -0.8824887871742249, + "logps/chosen": -5.8234734535217285, + "logps/rejected": -49.77042770385742, + "loss": 0.421186625957489, + "memory(GiB)": 46.73, + "nll_loss": 0.3348409831523895, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.49023908376693726, + "rewards/margins": 4.286158084869385, + "rewards/rejected": -3.7959189414978027, + "step": 196, + "train_speed(iter/s)": 0.005429 + }, + { + "epoch": 0.5631085305940152, + "grad_norm": 1.9928661584854126, + "learning_rate": 0.0001898208258763987, + "logits/chosen": -0.8889397382736206, + "logits/rejected": -0.9006186127662659, + "logps/chosen": -4.572671890258789, + "logps/rejected": -61.800926208496094, + "loss": 0.355736643075943, + "memory(GiB)": 46.73, + "nll_loss": 0.29381096363067627, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.31399890780448914, + "rewards/margins": 4.928988456726074, + "rewards/rejected": -4.614989757537842, + "step": 197, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5659669495310407, + "grad_norm": 14.296086311340332, + "learning_rate": 0.00018968144888322709, + "logits/chosen": -0.8595174551010132, + "logits/rejected": -0.861739993095398, + "logps/chosen": -7.95827054977417, + "logps/rejected": -51.00768280029297, + "loss": 0.9002599120140076, + "memory(GiB)": 46.73, + "nll_loss": 0.5538756251335144, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.06036340817809105, + "rewards/margins": 3.8160269260406494, + "rewards/rejected": -3.7556633949279785, + "step": 198, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5688253684680661, + "grad_norm": 6.8623809814453125, + "learning_rate": 0.00018954117605257, + "logits/chosen": -0.9402197003364563, + "logits/rejected": -0.953208863735199, + "logps/chosen": -4.058620929718018, + "logps/rejected": -63.09252166748047, + "loss": 0.5629696249961853, + "memory(GiB)": 46.73, + "nll_loss": 0.3906901776790619, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.26179081201553345, + "rewards/margins": 5.211573123931885, + "rewards/rejected": -4.949782371520996, + "step": 199, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5716837874050915, + "grad_norm": 7.293510913848877, + "learning_rate": 0.00018940000878562758, + "logits/chosen": -0.9181431531906128, + "logits/rejected": -0.9206308722496033, + "logps/chosen": -7.505152702331543, + "logps/rejected": -51.558433532714844, + "loss": 0.4831893742084503, + "memory(GiB)": 46.73, + "nll_loss": 0.3287861943244934, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.1301122009754181, + "rewards/margins": 4.108443737030029, + "rewards/rejected": -3.9783310890197754, + "step": 200, + "train_speed(iter/s)": 0.005428 + }, + { + "epoch": 0.5745422063421171, + "grad_norm": 1.9978575706481934, + "learning_rate": 0.00018925794849253462, + "logits/chosen": -0.9101322889328003, + "logits/rejected": -0.9203266501426697, + "logps/chosen": -10.848203659057617, + "logps/rejected": -65.54148864746094, + "loss": 0.7732073068618774, + "memory(GiB)": 46.73, + "nll_loss": 0.5795015692710876, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.06352178752422333, + "rewards/margins": 5.290210723876953, + "rewards/rejected": -5.226688861846924, + "step": 201, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.5774006252791425, + "grad_norm": 10.420772552490234, + "learning_rate": 0.0001891149965923464, + "logits/chosen": -0.9702765941619873, + "logits/rejected": -0.9766021370887756, + "logps/chosen": -5.592143535614014, + "logps/rejected": -61.43619918823242, + "loss": 0.586257815361023, + "memory(GiB)": 46.73, + "nll_loss": 0.47159674763679504, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.17951291799545288, + "rewards/margins": 4.912915229797363, + "rewards/rejected": -4.733402252197266, + "step": 202, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.5802590442161679, + "grad_norm": 13.509779930114746, + "learning_rate": 0.0001889711545130246, + "logits/chosen": -0.9708431959152222, + "logits/rejected": -0.9785487651824951, + "logps/chosen": -7.3830952644348145, + "logps/rejected": -51.72172164916992, + "loss": 0.526218831539154, + "memory(GiB)": 46.73, + "nll_loss": 0.334763765335083, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3495505452156067, + "rewards/margins": 4.381858825683594, + "rewards/rejected": -4.032308578491211, + "step": 203, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.5831174631531933, + "grad_norm": 3.5766985416412354, + "learning_rate": 0.000188826423691423, + "logits/chosen": -0.9285480380058289, + "logits/rejected": -0.9337785243988037, + "logps/chosen": -4.987155437469482, + "logps/rejected": -48.84478759765625, + "loss": 0.4154307246208191, + "memory(GiB)": 46.73, + "nll_loss": 0.2975158989429474, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3166441321372986, + "rewards/margins": 3.8094162940979004, + "rewards/rejected": -3.4927725791931152, + "step": 204, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.5859758820902189, + "grad_norm": 17.63137435913086, + "learning_rate": 0.00018868080557327306, + "logits/chosen": -0.8891575336456299, + "logits/rejected": -0.8922260403633118, + "logps/chosen": -6.72401762008667, + "logps/rejected": -51.23278045654297, + "loss": 0.4788863956928253, + "memory(GiB)": 46.73, + "nll_loss": 0.3527264893054962, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.29821208119392395, + "rewards/margins": 4.194456577301025, + "rewards/rejected": -3.896244525909424, + "step": 205, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.5888343010272443, + "grad_norm": 9.541404724121094, + "learning_rate": 0.00018853430161316957, + "logits/chosen": -0.8920901417732239, + "logits/rejected": -0.903443455696106, + "logps/chosen": -5.840543270111084, + "logps/rejected": -56.81292724609375, + "loss": 0.5086037516593933, + "memory(GiB)": 46.73, + "nll_loss": 0.34491029381752014, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.27246490120887756, + "rewards/margins": 4.210405349731445, + "rewards/rejected": -3.937941074371338, + "step": 206, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.5916927199642698, + "grad_norm": 36.082942962646484, + "learning_rate": 0.0001883869132745561, + "logits/chosen": -0.8546773195266724, + "logits/rejected": -0.8607960343360901, + "logps/chosen": -10.014286041259766, + "logps/rejected": -46.71479797363281, + "loss": 0.6521262526512146, + "memory(GiB)": 46.73, + "nll_loss": 0.4141015410423279, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.14084556698799133, + "rewards/margins": 3.5019726753234863, + "rewards/rejected": -3.3611273765563965, + "step": 207, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.5945511389012952, + "grad_norm": 3.8964920043945312, + "learning_rate": 0.00018823864202971042, + "logits/chosen": -0.8819292783737183, + "logits/rejected": -0.8937058448791504, + "logps/chosen": -9.53115177154541, + "logps/rejected": -55.31066131591797, + "loss": 0.4809289872646332, + "memory(GiB)": 46.73, + "nll_loss": 0.2986198961734772, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.24837446212768555, + "rewards/margins": 4.183048248291016, + "rewards/rejected": -3.9346742630004883, + "step": 208, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.5974095578383207, + "grad_norm": 2.320671796798706, + "learning_rate": 0.00018808948935972964, + "logits/chosen": -0.8995912671089172, + "logits/rejected": -0.9069520235061646, + "logps/chosen": -9.92770767211914, + "logps/rejected": -52.2730598449707, + "loss": 0.36179569363594055, + "memory(GiB)": 46.73, + "nll_loss": 0.29885053634643555, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2783893644809723, + "rewards/margins": 3.9017248153686523, + "rewards/rejected": -3.623335838317871, + "step": 209, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.6002679767753462, + "grad_norm": 4.009780406951904, + "learning_rate": 0.00018793945675451553, + "logits/chosen": -0.8754842877388, + "logits/rejected": -0.8889762163162231, + "logps/chosen": -4.163789749145508, + "logps/rejected": -54.52180099487305, + "loss": 0.30726245045661926, + "memory(GiB)": 46.73, + "nll_loss": 0.22840096056461334, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.38789692521095276, + "rewards/margins": 4.064230442047119, + "rewards/rejected": -3.676333427429199, + "step": 210, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.6031263957123716, + "grad_norm": 2.2772812843322754, + "learning_rate": 0.00018778854571275972, + "logits/chosen": -0.9018064141273499, + "logits/rejected": -0.9058933854103088, + "logps/chosen": -5.221268177032471, + "logps/rejected": -42.75416564941406, + "loss": 0.31052833795547485, + "memory(GiB)": 46.73, + "nll_loss": 0.2247018814086914, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3918154239654541, + "rewards/margins": 3.388484477996826, + "rewards/rejected": -2.996669292449951, + "step": 211, + "train_speed(iter/s)": 0.005425 + }, + { + "epoch": 0.605984814649397, + "grad_norm": 10.163191795349121, + "learning_rate": 0.0001876367577419286, + "logits/chosen": -0.850382924079895, + "logits/rejected": -0.864805281162262, + "logps/chosen": -5.846621990203857, + "logps/rejected": -58.741886138916016, + "loss": 0.4064854383468628, + "memory(GiB)": 46.73, + "nll_loss": 0.3250509202480316, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.30676084756851196, + "rewards/margins": 4.2306623458862305, + "rewards/rejected": -3.9239015579223633, + "step": 212, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.6088432335864226, + "grad_norm": 2.4588639736175537, + "learning_rate": 0.00018748409435824818, + "logits/chosen": -0.8809334635734558, + "logits/rejected": -0.8915649652481079, + "logps/chosen": -5.256155967712402, + "logps/rejected": -49.58497619628906, + "loss": 0.3395237326622009, + "memory(GiB)": 46.73, + "nll_loss": 0.2899019122123718, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3255791962146759, + "rewards/margins": 4.010343551635742, + "rewards/rejected": -3.6847646236419678, + "step": 213, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.611701652523448, + "grad_norm": 21.554292678833008, + "learning_rate": 0.00018733055708668926, + "logits/chosen": -0.9079571962356567, + "logits/rejected": -0.9125982522964478, + "logps/chosen": -8.034017562866211, + "logps/rejected": -38.557186126708984, + "loss": 0.922869086265564, + "memory(GiB)": 46.73, + "nll_loss": 0.7172112464904785, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.08057776838541031, + "rewards/margins": 2.6949210166931152, + "rewards/rejected": -2.6143431663513184, + "step": 214, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.6145600714604734, + "grad_norm": 30.98603630065918, + "learning_rate": 0.00018717614746095187, + "logits/chosen": -0.9082990288734436, + "logits/rejected": -0.9197255373001099, + "logps/chosen": -4.883214473724365, + "logps/rejected": -49.50416564941406, + "loss": 0.4404700696468353, + "memory(GiB)": 46.73, + "nll_loss": 0.34376513957977295, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.28728392720222473, + "rewards/margins": 3.837834119796753, + "rewards/rejected": -3.5505499839782715, + "step": 215, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.6174184903974989, + "grad_norm": 1.3132481575012207, + "learning_rate": 0.0001870208670234501, + "logits/chosen": -0.9290035963058472, + "logits/rejected": -0.934213399887085, + "logps/chosen": -10.832901000976562, + "logps/rejected": -55.205081939697266, + "loss": 0.4211485683917999, + "memory(GiB)": 46.73, + "nll_loss": 0.37757277488708496, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.22118425369262695, + "rewards/margins": 4.514135360717773, + "rewards/rejected": -4.2929511070251465, + "step": 216, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.6202769093345244, + "grad_norm": 5.870302200317383, + "learning_rate": 0.00018686471732529665, + "logits/chosen": -0.9589085578918457, + "logits/rejected": -0.9713011980056763, + "logps/chosen": -5.64130973815918, + "logps/rejected": -46.44078063964844, + "loss": 0.2975273132324219, + "memory(GiB)": 46.73, + "nll_loss": 0.191940039396286, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.35680240392684937, + "rewards/margins": 3.714186668395996, + "rewards/rejected": -3.357384443283081, + "step": 217, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.6231353282715498, + "grad_norm": 8.464821815490723, + "learning_rate": 0.00018670769992628743, + "logits/chosen": -0.9288697838783264, + "logits/rejected": -0.9361052513122559, + "logps/chosen": -7.309250354766846, + "logps/rejected": -55.75934982299805, + "loss": 0.5372158288955688, + "memory(GiB)": 46.73, + "nll_loss": 0.3037770390510559, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2024904191493988, + "rewards/margins": 4.475667476654053, + "rewards/rejected": -4.273177146911621, + "step": 218, + "train_speed(iter/s)": 0.005424 + }, + { + "epoch": 0.6259937472085753, + "grad_norm": 7.969956398010254, + "learning_rate": 0.00018654981639488577, + "logits/chosen": -0.8915677070617676, + "logits/rejected": -0.8954809904098511, + "logps/chosen": -10.680267333984375, + "logps/rejected": -46.57345199584961, + "loss": 0.4946494400501251, + "memory(GiB)": 46.73, + "nll_loss": 0.25526732206344604, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.10154397785663605, + "rewards/margins": 3.4904913902282715, + "rewards/rejected": -3.3889474868774414, + "step": 219, + "train_speed(iter/s)": 0.005423 + }, + { + "epoch": 0.6288521661456007, + "grad_norm": 4.48678731918335, + "learning_rate": 0.00018639106830820712, + "logits/chosen": -0.8933414816856384, + "logits/rejected": -0.9061769247055054, + "logps/chosen": -5.251230239868164, + "logps/rejected": -57.87230682373047, + "loss": 0.4995880722999573, + "memory(GiB)": 46.73, + "nll_loss": 0.3236704170703888, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.28504300117492676, + "rewards/margins": 4.6635212898254395, + "rewards/rejected": -4.378478527069092, + "step": 220, + "train_speed(iter/s)": 0.005423 + }, + { + "epoch": 0.6317105850826261, + "grad_norm": 9.096211433410645, + "learning_rate": 0.00018623145725200278, + "logits/chosen": -0.8734514713287354, + "logits/rejected": -0.8916375637054443, + "logps/chosen": -1.4930850267410278, + "logps/rejected": -66.85340118408203, + "loss": 0.18740399181842804, + "memory(GiB)": 46.73, + "nll_loss": 0.13703888654708862, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37862882018089294, + "rewards/margins": 5.180389881134033, + "rewards/rejected": -4.801761150360107, + "step": 221, + "train_speed(iter/s)": 0.005423 + }, + { + "epoch": 0.6345690040196517, + "grad_norm": 26.261280059814453, + "learning_rate": 0.0001860709848206446, + "logits/chosen": -0.8820620775222778, + "logits/rejected": -0.8966219425201416, + "logps/chosen": -2.2250847816467285, + "logps/rejected": -45.76300048828125, + "loss": 0.3367112874984741, + "memory(GiB)": 46.73, + "nll_loss": 0.19873520731925964, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4386615753173828, + "rewards/margins": 3.72398042678833, + "rewards/rejected": -3.2853188514709473, + "step": 222, + "train_speed(iter/s)": 0.005423 + }, + { + "epoch": 0.6374274229566771, + "grad_norm": 22.972919464111328, + "learning_rate": 0.00018590965261710855, + "logits/chosen": -0.8403002619743347, + "logits/rejected": -0.8476570248603821, + "logps/chosen": -8.319016456604004, + "logps/rejected": -53.541221618652344, + "loss": 0.6817492842674255, + "memory(GiB)": 46.73, + "nll_loss": 0.4776597023010254, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.1935867965221405, + "rewards/margins": 4.028127670288086, + "rewards/rejected": -3.834541082382202, + "step": 223, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6402858418937025, + "grad_norm": 2.3034980297088623, + "learning_rate": 0.0001857474622529592, + "logits/chosen": -0.8160367608070374, + "logits/rejected": -0.8165281414985657, + "logps/chosen": -12.484249114990234, + "logps/rejected": -37.48336410522461, + "loss": 0.971846878528595, + "memory(GiB)": 46.73, + "nll_loss": 0.7017231583595276, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3721400499343872, + "rewards/margins": 3.103872060775757, + "rewards/rejected": -2.73173189163208, + "step": 224, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.643144260830728, + "grad_norm": 5.584660530090332, + "learning_rate": 0.00018558441534833326, + "logits/chosen": -0.8463850021362305, + "logits/rejected": -0.8546481728553772, + "logps/chosen": -6.676924228668213, + "logps/rejected": -42.02546310424805, + "loss": 0.3610745072364807, + "memory(GiB)": 46.73, + "nll_loss": 0.22932007908821106, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.23803219199180603, + "rewards/margins": 3.133592367172241, + "rewards/rejected": -2.8955600261688232, + "step": 225, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6460026797677535, + "grad_norm": 19.920928955078125, + "learning_rate": 0.0001854205135319235, + "logits/chosen": -0.804871678352356, + "logits/rejected": -0.8120392560958862, + "logps/chosen": -4.961920738220215, + "logps/rejected": -35.829368591308594, + "loss": 0.5139291286468506, + "memory(GiB)": 46.73, + "nll_loss": 0.36350739002227783, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3230186402797699, + "rewards/margins": 2.9854631423950195, + "rewards/rejected": -2.662444591522217, + "step": 226, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6488610987047789, + "grad_norm": 4.711721420288086, + "learning_rate": 0.00018525575844096243, + "logits/chosen": -0.8603407740592957, + "logits/rejected": -0.8653955459594727, + "logps/chosen": -5.004653453826904, + "logps/rejected": -39.273414611816406, + "loss": 0.6492059230804443, + "memory(GiB)": 46.73, + "nll_loss": 0.4128054976463318, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.22731980681419373, + "rewards/margins": 2.9322750568389893, + "rewards/rejected": -2.7049553394317627, + "step": 227, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6517195176418044, + "grad_norm": 1.7484800815582275, + "learning_rate": 0.00018509015172120621, + "logits/chosen": -0.8575621843338013, + "logits/rejected": -0.8665353655815125, + "logps/chosen": -7.195815086364746, + "logps/rejected": -50.771728515625, + "loss": 0.31389814615249634, + "memory(GiB)": 46.73, + "nll_loss": 0.2718980014324188, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.342627614736557, + "rewards/margins": 4.143442153930664, + "rewards/rejected": -3.8008151054382324, + "step": 228, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6545779365788298, + "grad_norm": 2.002185344696045, + "learning_rate": 0.00018492369502691783, + "logits/chosen": -0.800703763961792, + "logits/rejected": -0.8078045845031738, + "logps/chosen": -2.682701349258423, + "logps/rejected": -49.849239349365234, + "loss": 0.30676865577697754, + "memory(GiB)": 46.73, + "nll_loss": 0.22686806321144104, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.23367229104042053, + "rewards/margins": 4.046586036682129, + "rewards/rejected": -3.8129141330718994, + "step": 229, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6574363555158553, + "grad_norm": 1.5651706457138062, + "learning_rate": 0.00018475639002085088, + "logits/chosen": -0.8538340926170349, + "logits/rejected": -0.8597412109375, + "logps/chosen": -4.410967826843262, + "logps/rejected": -49.90096664428711, + "loss": 0.574176013469696, + "memory(GiB)": 46.73, + "nll_loss": 0.3684491515159607, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.25362682342529297, + "rewards/margins": 4.066993713378906, + "rewards/rejected": -3.8133671283721924, + "step": 230, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6602947744528808, + "grad_norm": 6.113332748413086, + "learning_rate": 0.00018458823837423272, + "logits/chosen": -0.7913177013397217, + "logits/rejected": -0.7997550368309021, + "logps/chosen": -4.025767803192139, + "logps/rejected": -53.99266052246094, + "loss": 0.2960505187511444, + "memory(GiB)": 46.73, + "nll_loss": 0.18574629724025726, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2514365017414093, + "rewards/margins": 4.251288414001465, + "rewards/rejected": -3.999851703643799, + "step": 231, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6631531933899062, + "grad_norm": 19.446311950683594, + "learning_rate": 0.00018441924176674794, + "logits/chosen": -0.8168718218803406, + "logits/rejected": -0.8197526335716248, + "logps/chosen": -9.956727027893066, + "logps/rejected": -44.05134963989258, + "loss": 0.464748740196228, + "memory(GiB)": 46.73, + "nll_loss": 0.27714642882347107, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3305510878562927, + "rewards/margins": 3.2444560527801514, + "rewards/rejected": -2.913904905319214, + "step": 232, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6660116123269316, + "grad_norm": 4.284008979797363, + "learning_rate": 0.0001842494018865216, + "logits/chosen": -0.8440728187561035, + "logits/rejected": -0.8471089601516724, + "logps/chosen": -6.64088249206543, + "logps/rejected": -49.05445098876953, + "loss": 0.42048758268356323, + "memory(GiB)": 46.73, + "nll_loss": 0.28354334831237793, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.44579362869262695, + "rewards/margins": 4.0876898765563965, + "rewards/rejected": -3.6418962478637695, + "step": 233, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6688700312639572, + "grad_norm": 2.603118896484375, + "learning_rate": 0.00018407872043010222, + "logits/chosen": -0.8436523079872131, + "logits/rejected": -0.8567028045654297, + "logps/chosen": -4.48859977722168, + "logps/rejected": -50.14689636230469, + "loss": 0.40216153860092163, + "memory(GiB)": 46.73, + "nll_loss": 0.27896279096603394, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.34187889099121094, + "rewards/margins": 4.033811569213867, + "rewards/rejected": -3.6919329166412354, + "step": 234, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6717284502009826, + "grad_norm": 2.3652243614196777, + "learning_rate": 0.00018390719910244487, + "logits/chosen": -0.8383113145828247, + "logits/rejected": -0.8405783772468567, + "logps/chosen": -7.634208679199219, + "logps/rejected": -47.9358024597168, + "loss": 0.44057831168174744, + "memory(GiB)": 46.73, + "nll_loss": 0.3545606732368469, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4073534607887268, + "rewards/margins": 4.02724027633667, + "rewards/rejected": -3.619886875152588, + "step": 235, + "train_speed(iter/s)": 0.005423 + }, + { + "epoch": 0.674586869138008, + "grad_norm": 6.028226375579834, + "learning_rate": 0.00018373483961689433, + "logits/chosen": -0.791793942451477, + "logits/rejected": -0.7986205220222473, + "logps/chosen": -4.954317569732666, + "logps/rejected": -55.234737396240234, + "loss": 0.43700873851776123, + "memory(GiB)": 46.73, + "nll_loss": 0.30535393953323364, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.37826675176620483, + "rewards/margins": 4.826811790466309, + "rewards/rejected": -4.448545455932617, + "step": 236, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6774452880750335, + "grad_norm": 19.603124618530273, + "learning_rate": 0.0001835616436951677, + "logits/chosen": -0.8135831356048584, + "logits/rejected": -0.814205527305603, + "logps/chosen": -9.9032621383667, + "logps/rejected": -43.75004577636719, + "loss": 1.0214945077896118, + "memory(GiB)": 46.73, + "nll_loss": 0.7171285152435303, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.0824882835149765, + "rewards/margins": 3.4575212001800537, + "rewards/rejected": -3.375033378601074, + "step": 237, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.680303707012059, + "grad_norm": 3.10172176361084, + "learning_rate": 0.0001833876130673374, + "logits/chosen": -0.8079448342323303, + "logits/rejected": -0.8127983808517456, + "logps/chosen": -5.635651588439941, + "logps/rejected": -47.28111267089844, + "loss": 0.7593626976013184, + "memory(GiB)": 46.73, + "nll_loss": 0.5331795811653137, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.1643129289150238, + "rewards/margins": 3.6442363262176514, + "rewards/rejected": -3.4799234867095947, + "step": 238, + "train_speed(iter/s)": 0.005422 + }, + { + "epoch": 0.6831621259490844, + "grad_norm": 27.822246551513672, + "learning_rate": 0.0001832127494718138, + "logits/chosen": -0.7551109194755554, + "logits/rejected": -0.7638161778450012, + "logps/chosen": -10.555828094482422, + "logps/rejected": -53.38033676147461, + "loss": 1.1436967849731445, + "memory(GiB)": 46.73, + "nll_loss": 0.7946538329124451, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.15928542613983154, + "rewards/margins": 3.742271900177002, + "rewards/rejected": -3.582986354827881, + "step": 239, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6860205448861099, + "grad_norm": 16.83273696899414, + "learning_rate": 0.0001830370546553278, + "logits/chosen": -0.7728374600410461, + "logits/rejected": -0.7811495661735535, + "logps/chosen": -5.365185260772705, + "logps/rejected": -54.261924743652344, + "loss": 0.41165488958358765, + "memory(GiB)": 46.73, + "nll_loss": 0.31692206859588623, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3263813257217407, + "rewards/margins": 4.228232383728027, + "rewards/rejected": -3.901850938796997, + "step": 240, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6888789638231353, + "grad_norm": 1.7355122566223145, + "learning_rate": 0.00018286053037291358, + "logits/chosen": -0.81122225522995, + "logits/rejected": -0.8211573362350464, + "logps/chosen": -7.20838737487793, + "logps/rejected": -61.72975158691406, + "loss": 0.6045428514480591, + "memory(GiB)": 46.73, + "nll_loss": 0.40412986278533936, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.11305103451013565, + "rewards/margins": 4.976436614990234, + "rewards/rejected": -4.863386154174805, + "step": 241, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6917373827601608, + "grad_norm": 7.826045036315918, + "learning_rate": 0.00018268317838789088, + "logits/chosen": -0.7882257699966431, + "logits/rejected": -0.7961454391479492, + "logps/chosen": -9.31049919128418, + "logps/rejected": -60.73347473144531, + "loss": 0.47482648491859436, + "memory(GiB)": 46.73, + "nll_loss": 0.3099362254142761, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.33366695046424866, + "rewards/margins": 5.084123134613037, + "rewards/rejected": -4.750456809997559, + "step": 242, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6945958016971863, + "grad_norm": 4.641445636749268, + "learning_rate": 0.00018250500047184743, + "logits/chosen": -0.7924759387969971, + "logits/rejected": -0.8044589161872864, + "logps/chosen": -3.8715922832489014, + "logps/rejected": -84.22549438476562, + "loss": 0.2994554042816162, + "memory(GiB)": 46.73, + "nll_loss": 0.1720796376466751, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3689011037349701, + "rewards/margins": 7.356629848480225, + "rewards/rejected": -6.987728595733643, + "step": 243, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.6974542206342117, + "grad_norm": 2.049391746520996, + "learning_rate": 0.00018232599840462127, + "logits/chosen": -0.7979660034179688, + "logits/rejected": -0.814594030380249, + "logps/chosen": -5.095368385314941, + "logps/rejected": -78.81214141845703, + "loss": 0.5495756268501282, + "memory(GiB)": 46.73, + "nll_loss": 0.3513493835926056, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3352471590042114, + "rewards/margins": 6.755255222320557, + "rewards/rejected": -6.420008182525635, + "step": 244, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.7003126395712371, + "grad_norm": 6.190991401672363, + "learning_rate": 0.0001821461739742831, + "logits/chosen": -0.8227720856666565, + "logits/rejected": -0.8302331566810608, + "logps/chosen": -4.222079277038574, + "logps/rejected": -50.675010681152344, + "loss": 0.564222514629364, + "memory(GiB)": 46.73, + "nll_loss": 0.33342495560646057, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3969876766204834, + "rewards/margins": 4.388568878173828, + "rewards/rejected": -3.9915812015533447, + "step": 245, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.7031710585082627, + "grad_norm": 10.364058494567871, + "learning_rate": 0.00018196552897711805, + "logits/chosen": -0.8048458099365234, + "logits/rejected": -0.8072474002838135, + "logps/chosen": -10.411101341247559, + "logps/rejected": -56.306983947753906, + "loss": 1.0959556102752686, + "memory(GiB)": 46.73, + "nll_loss": 0.575545072555542, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.013596116565167904, + "rewards/margins": 4.414645671844482, + "rewards/rejected": -4.40104866027832, + "step": 246, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.7060294774452881, + "grad_norm": 1.150504469871521, + "learning_rate": 0.0001817840652176082, + "logits/chosen": -0.7576855421066284, + "logits/rejected": -0.7742222547531128, + "logps/chosen": -2.4694085121154785, + "logps/rejected": -71.76143646240234, + "loss": 0.3189219832420349, + "memory(GiB)": 46.73, + "nll_loss": 0.16295407712459564, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4176994264125824, + "rewards/margins": 6.149940490722656, + "rewards/rejected": -5.732240676879883, + "step": 247, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.7088878963823135, + "grad_norm": 5.994204044342041, + "learning_rate": 0.00018160178450841424, + "logits/chosen": -0.866169273853302, + "logits/rejected": -0.8704244494438171, + "logps/chosen": -6.661141872406006, + "logps/rejected": -49.67292022705078, + "loss": 0.6027306914329529, + "memory(GiB)": 46.73, + "nll_loss": 0.34626996517181396, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.22591182589530945, + "rewards/margins": 4.158686637878418, + "rewards/rejected": -3.9327750205993652, + "step": 248, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.711746315319339, + "grad_norm": 5.770801067352295, + "learning_rate": 0.00018141868867035745, + "logits/chosen": -0.8344917893409729, + "logits/rejected": -0.8478953838348389, + "logps/chosen": -3.321021318435669, + "logps/rejected": -65.89788818359375, + "loss": 0.37574970722198486, + "memory(GiB)": 46.73, + "nll_loss": 0.22786659002304077, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.46830183267593384, + "rewards/margins": 5.406087398529053, + "rewards/rejected": -4.9377851486206055, + "step": 249, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.7146047342563644, + "grad_norm": 10.37423038482666, + "learning_rate": 0.00018123477953240153, + "logits/chosen": -0.8937637805938721, + "logits/rejected": -0.8977770805358887, + "logps/chosen": -8.490730285644531, + "logps/rejected": -55.414119720458984, + "loss": 1.2775684595108032, + "memory(GiB)": 46.73, + "nll_loss": 0.8742450475692749, + "rewards/accuracies": 0.8125, + "rewards/chosen": -0.01779785007238388, + "rewards/margins": 4.217215061187744, + "rewards/rejected": -4.235013008117676, + "step": 250, + "train_speed(iter/s)": 0.005421 + }, + { + "epoch": 0.7174631531933899, + "grad_norm": 1.7192703485488892, + "learning_rate": 0.00018105005893163435, + "logits/chosen": -0.8390921354293823, + "logits/rejected": -0.8509503602981567, + "logps/chosen": -6.030505657196045, + "logps/rejected": -67.4354248046875, + "loss": 0.47158071398735046, + "memory(GiB)": 46.73, + "nll_loss": 0.3380236029624939, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.40208595991134644, + "rewards/margins": 5.5573272705078125, + "rewards/rejected": -5.155241012573242, + "step": 251, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7203215721304154, + "grad_norm": 2.977877140045166, + "learning_rate": 0.00018086452871324954, + "logits/chosen": -0.7667251825332642, + "logits/rejected": -0.7768008708953857, + "logps/chosen": -4.949960231781006, + "logps/rejected": -50.58625030517578, + "loss": 0.45571526885032654, + "memory(GiB)": 46.73, + "nll_loss": 0.2604752779006958, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3296346664428711, + "rewards/margins": 3.986636161804199, + "rewards/rejected": -3.657001495361328, + "step": 252, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7231799910674408, + "grad_norm": 5.2092461585998535, + "learning_rate": 0.0001806781907305281, + "logits/chosen": -0.7798765897750854, + "logits/rejected": -0.7910524606704712, + "logps/chosen": -5.809662818908691, + "logps/rejected": -53.34002685546875, + "loss": 0.8320525288581848, + "memory(GiB)": 46.73, + "nll_loss": 0.5776523947715759, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.23829270899295807, + "rewards/margins": 4.524988174438477, + "rewards/rejected": -4.28669548034668, + "step": 253, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7260384100044662, + "grad_norm": 1.3411738872528076, + "learning_rate": 0.00018049104684481984, + "logits/chosen": -0.7575161457061768, + "logits/rejected": -0.7671946287155151, + "logps/chosen": -2.434175729751587, + "logps/rejected": -57.82784652709961, + "loss": 0.20352256298065186, + "memory(GiB)": 46.73, + "nll_loss": 0.12845022976398468, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4981456398963928, + "rewards/margins": 5.003716945648193, + "rewards/rejected": -4.505571365356445, + "step": 254, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7288968289414918, + "grad_norm": 2.5868351459503174, + "learning_rate": 0.00018030309892552485, + "logits/chosen": -0.7499576210975647, + "logits/rejected": -0.7592740058898926, + "logps/chosen": -6.130841255187988, + "logps/rejected": -57.28644561767578, + "loss": 0.48349788784980774, + "memory(GiB)": 46.73, + "nll_loss": 0.2539648711681366, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.3308817446231842, + "rewards/margins": 4.663580894470215, + "rewards/rejected": -4.332699775695801, + "step": 255, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7317552478785172, + "grad_norm": 4.378026962280273, + "learning_rate": 0.00018011434885007482, + "logits/chosen": -0.7099967002868652, + "logits/rejected": -0.7259005308151245, + "logps/chosen": -5.300999641418457, + "logps/rejected": -75.72197723388672, + "loss": 0.6189821362495422, + "memory(GiB)": 46.73, + "nll_loss": 0.4664699137210846, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.32499435544013977, + "rewards/margins": 6.257512092590332, + "rewards/rejected": -5.932518482208252, + "step": 256, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7346136668155426, + "grad_norm": 5.1314287185668945, + "learning_rate": 0.00017992479850391417, + "logits/chosen": -0.7900992035865784, + "logits/rejected": -0.7963463068008423, + "logps/chosen": -7.288159370422363, + "logps/rejected": -65.37578582763672, + "loss": 0.7073066234588623, + "memory(GiB)": 46.73, + "nll_loss": 0.522219181060791, + "rewards/accuracies": 0.875, + "rewards/chosen": -0.01863168179988861, + "rewards/margins": 5.2057108879089355, + "rewards/rejected": -5.224342346191406, + "step": 257, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7374720857525681, + "grad_norm": 14.985835075378418, + "learning_rate": 0.0001797344497804814, + "logits/chosen": -0.8092799186706543, + "logits/rejected": -0.8284256458282471, + "logps/chosen": -3.5805835723876953, + "logps/rejected": -70.46089935302734, + "loss": 0.5027480125427246, + "memory(GiB)": 46.73, + "nll_loss": 0.3328987956047058, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.34573665261268616, + "rewards/margins": 5.720893859863281, + "rewards/rejected": -5.375156879425049, + "step": 258, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7403305046895936, + "grad_norm": 1.8163223266601562, + "learning_rate": 0.0001795433045811901, + "logits/chosen": -0.7964171171188354, + "logits/rejected": -0.8145956993103027, + "logps/chosen": -6.411382675170898, + "logps/rejected": -82.747314453125, + "loss": 0.3530154526233673, + "memory(GiB)": 46.73, + "nll_loss": 0.27328839898109436, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3884195387363434, + "rewards/margins": 7.130291938781738, + "rewards/rejected": -6.741872787475586, + "step": 259, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.743188923626619, + "grad_norm": 6.400819301605225, + "learning_rate": 0.00017935136481540983, + "logits/chosen": -0.7889119386672974, + "logits/rejected": -0.7964754700660706, + "logps/chosen": -5.224812984466553, + "logps/rejected": -72.13189697265625, + "loss": 0.41807201504707336, + "memory(GiB)": 46.73, + "nll_loss": 0.2358081340789795, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3295401632785797, + "rewards/margins": 6.076530933380127, + "rewards/rejected": -5.746991157531738, + "step": 260, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7460473425636445, + "grad_norm": 12.328303337097168, + "learning_rate": 0.00017915863240044728, + "logits/chosen": -0.7348450422286987, + "logits/rejected": -0.7534111738204956, + "logps/chosen": -5.4054975509643555, + "logps/rejected": -68.88573455810547, + "loss": 0.7026913166046143, + "memory(GiB)": 46.73, + "nll_loss": 0.44665706157684326, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.20527832210063934, + "rewards/margins": 5.571951866149902, + "rewards/rejected": -5.366673469543457, + "step": 261, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7489057615006699, + "grad_norm": 3.061285972595215, + "learning_rate": 0.0001789651092615269, + "logits/chosen": -0.7372769117355347, + "logits/rejected": -0.7543134689331055, + "logps/chosen": -6.071784973144531, + "logps/rejected": -75.79733276367188, + "loss": 0.5492207407951355, + "memory(GiB)": 46.73, + "nll_loss": 0.390069842338562, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.43368661403656006, + "rewards/margins": 6.3423871994018555, + "rewards/rejected": -5.908700466156006, + "step": 262, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7517641804376954, + "grad_norm": 2.7509682178497314, + "learning_rate": 0.00017877079733177184, + "logits/chosen": -0.7882805466651917, + "logits/rejected": -0.7959960699081421, + "logps/chosen": -4.451222896575928, + "logps/rejected": -65.09577178955078, + "loss": 0.46701446175575256, + "memory(GiB)": 46.73, + "nll_loss": 0.29663312435150146, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.2672671675682068, + "rewards/margins": 5.1345319747924805, + "rewards/rejected": -4.867265224456787, + "step": 263, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7546225993747209, + "grad_norm": 7.0340471267700195, + "learning_rate": 0.0001785756985521845, + "logits/chosen": -0.7474167346954346, + "logits/rejected": -0.7586854696273804, + "logps/chosen": -2.838711738586426, + "logps/rejected": -66.19261169433594, + "loss": 0.2907945513725281, + "memory(GiB)": 46.73, + "nll_loss": 0.1855563074350357, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3911718726158142, + "rewards/margins": 5.468771457672119, + "rewards/rejected": -5.077599048614502, + "step": 264, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7574810183117463, + "grad_norm": 6.862280368804932, + "learning_rate": 0.00017837981487162728, + "logits/chosen": -0.784568190574646, + "logits/rejected": -0.7910401821136475, + "logps/chosen": -5.12929630279541, + "logps/rejected": -56.361732482910156, + "loss": 0.40424007177352905, + "memory(GiB)": 46.73, + "nll_loss": 0.25972405076026917, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37295520305633545, + "rewards/margins": 4.483123779296875, + "rewards/rejected": -4.110168933868408, + "step": 265, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7603394372487717, + "grad_norm": 4.63895845413208, + "learning_rate": 0.000178183148246803, + "logits/chosen": -0.7499387860298157, + "logits/rejected": -0.7595155239105225, + "logps/chosen": -5.115823268890381, + "logps/rejected": -58.23040771484375, + "loss": 0.36365264654159546, + "memory(GiB)": 46.73, + "nll_loss": 0.2652009129524231, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5545862913131714, + "rewards/margins": 5.043620586395264, + "rewards/rejected": -4.489034652709961, + "step": 266, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7631978561857973, + "grad_norm": 3.7681679725646973, + "learning_rate": 0.00017798570064223533, + "logits/chosen": -0.7498815059661865, + "logits/rejected": -0.7551140189170837, + "logps/chosen": -8.723041534423828, + "logps/rejected": -57.88478088378906, + "loss": 0.5662537813186646, + "memory(GiB)": 46.73, + "nll_loss": 0.4090389013290405, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.42151832580566406, + "rewards/margins": 4.748777866363525, + "rewards/rejected": -4.327259540557861, + "step": 267, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7660562751228227, + "grad_norm": 3.2269599437713623, + "learning_rate": 0.00017778747403024938, + "logits/chosen": -0.7659600973129272, + "logits/rejected": -0.771249532699585, + "logps/chosen": -4.629357814788818, + "logps/rejected": -65.65526580810547, + "loss": 0.35117611289024353, + "memory(GiB)": 46.73, + "nll_loss": 0.2736473083496094, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4568191468715668, + "rewards/margins": 5.550890922546387, + "rewards/rejected": -5.094072341918945, + "step": 268, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7689146940598481, + "grad_norm": 2.8312392234802246, + "learning_rate": 0.00017758847039095168, + "logits/chosen": -0.798125684261322, + "logits/rejected": -0.8037543892860413, + "logps/chosen": -6.867776393890381, + "logps/rejected": -60.64920425415039, + "loss": 0.32864660024642944, + "memory(GiB)": 46.73, + "nll_loss": 0.2230987399816513, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3507767915725708, + "rewards/margins": 5.041985988616943, + "rewards/rejected": -4.691208839416504, + "step": 269, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7717731129968736, + "grad_norm": 13.008737564086914, + "learning_rate": 0.00017738869171221068, + "logits/chosen": -0.8288258910179138, + "logits/rejected": -0.8406282067298889, + "logps/chosen": -5.507926940917969, + "logps/rejected": -61.57422637939453, + "loss": 0.5156294703483582, + "memory(GiB)": 46.73, + "nll_loss": 0.35812243819236755, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3736186921596527, + "rewards/margins": 4.971932411193848, + "rewards/rejected": -4.59831428527832, + "step": 270, + "train_speed(iter/s)": 0.00542 + }, + { + "epoch": 0.7746315319338991, + "grad_norm": 3.5630056858062744, + "learning_rate": 0.00017718813998963677, + "logits/chosen": -0.8012739419937134, + "logits/rejected": -0.8092758059501648, + "logps/chosen": -3.510615587234497, + "logps/rejected": -64.04873657226562, + "loss": 0.32887405157089233, + "memory(GiB)": 46.73, + "nll_loss": 0.22269977629184723, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4387923777103424, + "rewards/margins": 5.713708877563477, + "rewards/rejected": -5.274916648864746, + "step": 271, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7774899508709245, + "grad_norm": 4.515592575073242, + "learning_rate": 0.0001769868172265623, + "logits/chosen": -0.7991639971733093, + "logits/rejected": -0.8151663541793823, + "logps/chosen": -6.522274017333984, + "logps/rejected": -66.93218231201172, + "loss": 0.36452019214630127, + "memory(GiB)": 46.73, + "nll_loss": 0.22390373051166534, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.42787954211235046, + "rewards/margins": 5.180395603179932, + "rewards/rejected": -4.75251579284668, + "step": 272, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.78034836980795, + "grad_norm": 5.741221904754639, + "learning_rate": 0.00017678472543402167, + "logits/chosen": -0.8168489336967468, + "logits/rejected": -0.8267149329185486, + "logps/chosen": -7.215493679046631, + "logps/rejected": -74.48379516601562, + "loss": 0.43839821219444275, + "memory(GiB)": 46.73, + "nll_loss": 0.27808046340942383, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.10016904771327972, + "rewards/margins": 6.203993797302246, + "rewards/rejected": -6.103825092315674, + "step": 273, + "train_speed(iter/s)": 0.005419 + }, + { + "epoch": 0.7832067887449754, + "grad_norm": 32.49665451049805, + "learning_rate": 0.0001765818666307312, + "logits/chosen": -0.829395592212677, + "logits/rejected": -0.8386520147323608, + "logps/chosen": -11.311494827270508, + "logps/rejected": -73.18070983886719, + "loss": 0.5425660014152527, + "memory(GiB)": 46.73, + "nll_loss": 0.36316078901290894, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.15256868302822113, + "rewards/margins": 6.144671440124512, + "rewards/rejected": -5.992103099822998, + "step": 274, + "train_speed(iter/s)": 0.005418 + }, + { + "epoch": 0.7860652076820009, + "grad_norm": 3.230365753173828, + "learning_rate": 0.00017637824284306896, + "logits/chosen": -0.8549230098724365, + "logits/rejected": -0.8643885850906372, + "logps/chosen": -6.326109409332275, + "logps/rejected": -79.64250183105469, + "loss": 0.40403613448143005, + "memory(GiB)": 46.73, + "nll_loss": 0.24930235743522644, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.4288281202316284, + "rewards/margins": 7.1657514572143555, + "rewards/rejected": -6.7369232177734375, + "step": 275, + "train_speed(iter/s)": 0.005418 + }, + { + "epoch": 0.7889236266190264, + "grad_norm": 13.746660232543945, + "learning_rate": 0.00017617385610505445, + "logits/chosen": -0.8277623653411865, + "logits/rejected": -0.8511622548103333, + "logps/chosen": -5.98537015914917, + "logps/rejected": -88.5182876586914, + "loss": 0.43429312109947205, + "memory(GiB)": 46.73, + "nll_loss": 0.3185354769229889, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.29758548736572266, + "rewards/margins": 7.396449089050293, + "rewards/rejected": -7.09886360168457, + "step": 276, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.7917820455560518, + "grad_norm": 6.405646800994873, + "learning_rate": 0.0001759687084583285, + "logits/chosen": -0.7691607475280762, + "logits/rejected": -0.7741835713386536, + "logps/chosen": -9.308018684387207, + "logps/rejected": -51.25666046142578, + "loss": 0.8975799679756165, + "memory(GiB)": 46.73, + "nll_loss": 0.5866126418113708, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.1858431100845337, + "rewards/margins": 4.487247467041016, + "rewards/rejected": -4.30140495300293, + "step": 277, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.7946404644930772, + "grad_norm": 2.4748454093933105, + "learning_rate": 0.00017576280195213265, + "logits/chosen": -0.7853768467903137, + "logits/rejected": -0.7936210036277771, + "logps/chosen": -5.454078674316406, + "logps/rejected": -75.30870056152344, + "loss": 0.2936534583568573, + "memory(GiB)": 46.73, + "nll_loss": 0.18900159001350403, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4082258343696594, + "rewards/margins": 6.508139610290527, + "rewards/rejected": -6.099913597106934, + "step": 278, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.7974988834301028, + "grad_norm": 34.00475311279297, + "learning_rate": 0.00017555613864328877, + "logits/chosen": -0.7811096906661987, + "logits/rejected": -0.7873689532279968, + "logps/chosen": -6.8495683670043945, + "logps/rejected": -55.13431930541992, + "loss": 0.637625515460968, + "memory(GiB)": 46.73, + "nll_loss": 0.3317420780658722, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.15362443029880524, + "rewards/margins": 4.4968953132629395, + "rewards/rejected": -4.343270778656006, + "step": 279, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.8003573023671282, + "grad_norm": 9.747983932495117, + "learning_rate": 0.00017534872059617854, + "logits/chosen": -0.7341008186340332, + "logits/rejected": -0.7383145093917847, + "logps/chosen": -9.441812515258789, + "logps/rejected": -52.60177993774414, + "loss": 0.7760030031204224, + "memory(GiB)": 46.73, + "nll_loss": 0.5588037371635437, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.16166743636131287, + "rewards/margins": 4.042746067047119, + "rewards/rejected": -3.8810782432556152, + "step": 280, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.8032157213041536, + "grad_norm": 3.125258684158325, + "learning_rate": 0.00017514054988272278, + "logits/chosen": -0.76849764585495, + "logits/rejected": -0.7703225016593933, + "logps/chosen": -7.879859924316406, + "logps/rejected": -46.87977600097656, + "loss": 0.40426021814346313, + "memory(GiB)": 46.73, + "nll_loss": 0.22946256399154663, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.1921083629131317, + "rewards/margins": 3.796980142593384, + "rewards/rejected": -3.6048717498779297, + "step": 281, + "train_speed(iter/s)": 0.005418 + }, + { + "epoch": 0.8060741402411791, + "grad_norm": 12.288455963134766, + "learning_rate": 0.00017493162858236077, + "logits/chosen": -0.7909262776374817, + "logits/rejected": -0.7904006242752075, + "logps/chosen": -6.4545183181762695, + "logps/rejected": -44.307891845703125, + "loss": 0.7655720114707947, + "memory(GiB)": 46.73, + "nll_loss": 0.49028268456459045, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.30812394618988037, + "rewards/margins": 3.476095199584961, + "rewards/rejected": -3.167971134185791, + "step": 282, + "train_speed(iter/s)": 0.005418 + }, + { + "epoch": 0.8089325591782045, + "grad_norm": 4.012885093688965, + "learning_rate": 0.00017472195878202954, + "logits/chosen": -0.7621877193450928, + "logits/rejected": -0.7748852968215942, + "logps/chosen": -5.457606315612793, + "logps/rejected": -58.349586486816406, + "loss": 0.5497166514396667, + "memory(GiB)": 46.73, + "nll_loss": 0.3570767641067505, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3271387219429016, + "rewards/margins": 4.170994281768799, + "rewards/rejected": -3.843855857849121, + "step": 283, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.81179097811523, + "grad_norm": 5.237916469573975, + "learning_rate": 0.00017451154257614287, + "logits/chosen": -0.7418099641799927, + "logits/rejected": -0.7571959495544434, + "logps/chosen": -3.4067182540893555, + "logps/rejected": -56.671165466308594, + "loss": 0.4136762320995331, + "memory(GiB)": 46.73, + "nll_loss": 0.28384339809417725, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3589616119861603, + "rewards/margins": 4.685504913330078, + "rewards/rejected": -4.32654333114624, + "step": 284, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.8146493970522555, + "grad_norm": 1.4427282810211182, + "learning_rate": 0.0001743003820665705, + "logits/chosen": -0.7895207405090332, + "logits/rejected": -0.7963113188743591, + "logps/chosen": -5.939748764038086, + "logps/rejected": -61.93427276611328, + "loss": 0.37020552158355713, + "memory(GiB)": 46.73, + "nll_loss": 0.25463271141052246, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4543488621711731, + "rewards/margins": 5.030240058898926, + "rewards/rejected": -4.575891494750977, + "step": 285, + "train_speed(iter/s)": 0.005417 + }, + { + "epoch": 0.8175078159892809, + "grad_norm": 1.0243815183639526, + "learning_rate": 0.00017408847936261718, + "logits/chosen": -0.7718304395675659, + "logits/rejected": -0.7830629348754883, + "logps/chosen": -6.110411643981934, + "logps/rejected": -74.25471496582031, + "loss": 0.2691524624824524, + "memory(GiB)": 46.73, + "nll_loss": 0.1934249997138977, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37820330262184143, + "rewards/margins": 5.837207794189453, + "rewards/rejected": -5.4590044021606445, + "step": 286, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8203662349263063, + "grad_norm": 3.313394784927368, + "learning_rate": 0.00017387583658100142, + "logits/chosen": -0.8310220837593079, + "logits/rejected": -0.8387812376022339, + "logps/chosen": -4.55296516418457, + "logps/rejected": -61.40394592285156, + "loss": 0.4389451742172241, + "memory(GiB)": 46.73, + "nll_loss": 0.27197274565696716, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.37971678376197815, + "rewards/margins": 5.221004009246826, + "rewards/rejected": -4.841287136077881, + "step": 287, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8232246538633319, + "grad_norm": 2.1154696941375732, + "learning_rate": 0.0001736624558458344, + "logits/chosen": -0.8145501017570496, + "logits/rejected": -0.8243207931518555, + "logps/chosen": -5.528270721435547, + "logps/rejected": -68.98825073242188, + "loss": 0.3845535218715668, + "memory(GiB)": 46.73, + "nll_loss": 0.3077916204929352, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2718258500099182, + "rewards/margins": 5.621387004852295, + "rewards/rejected": -5.34956169128418, + "step": 288, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8260830728003573, + "grad_norm": 24.870929718017578, + "learning_rate": 0.00017344833928859902, + "logits/chosen": -0.8270291090011597, + "logits/rejected": -0.835890531539917, + "logps/chosen": -9.923492431640625, + "logps/rejected": -67.6069107055664, + "loss": 0.7075707316398621, + "memory(GiB)": 46.73, + "nll_loss": 0.5235861539840698, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.13183848559856415, + "rewards/margins": 5.321423530578613, + "rewards/rejected": -5.189585208892822, + "step": 289, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8289414917373827, + "grad_norm": 44.18141555786133, + "learning_rate": 0.00017323348904812807, + "logits/chosen": -0.849445641040802, + "logits/rejected": -0.8580566644668579, + "logps/chosen": -6.3443121910095215, + "logps/rejected": -70.16064453125, + "loss": 0.8740846514701843, + "memory(GiB)": 46.73, + "nll_loss": 0.6279979944229126, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.03094465658068657, + "rewards/margins": 5.86611795425415, + "rewards/rejected": -5.835173606872559, + "step": 290, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8317999106744082, + "grad_norm": 2.5713086128234863, + "learning_rate": 0.00017301790727058345, + "logits/chosen": -0.8377387523651123, + "logits/rejected": -0.8420360088348389, + "logps/chosen": -8.347972869873047, + "logps/rejected": -60.33742141723633, + "loss": 0.5106192827224731, + "memory(GiB)": 46.73, + "nll_loss": 0.41129249334335327, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3251681327819824, + "rewards/margins": 5.310262680053711, + "rewards/rejected": -4.985095024108887, + "step": 291, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8346583296114337, + "grad_norm": 7.104504108428955, + "learning_rate": 0.0001728015961094343, + "logits/chosen": -0.8455878496170044, + "logits/rejected": -0.8570619821548462, + "logps/chosen": -6.6951751708984375, + "logps/rejected": -81.03128814697266, + "loss": 0.44324812293052673, + "memory(GiB)": 46.73, + "nll_loss": 0.32767486572265625, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.036870718002319336, + "rewards/margins": 6.7979583740234375, + "rewards/rejected": -6.761086940765381, + "step": 292, + "train_speed(iter/s)": 0.005416 + }, + { + "epoch": 0.8375167485484591, + "grad_norm": 4.131809234619141, + "learning_rate": 0.00017258455772543573, + "logits/chosen": -0.8040283918380737, + "logits/rejected": -0.811447024345398, + "logps/chosen": -8.506138801574707, + "logps/rejected": -61.88532638549805, + "loss": 0.36702975630760193, + "memory(GiB)": 46.73, + "nll_loss": 0.2761310636997223, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.37248650193214417, + "rewards/margins": 5.04264497756958, + "rewards/rejected": -4.670158386230469, + "step": 293, + "train_speed(iter/s)": 0.005415 + }, + { + "epoch": 0.8403751674854846, + "grad_norm": 15.525777816772461, + "learning_rate": 0.00017236679428660719, + "logits/chosen": -0.8311742544174194, + "logits/rejected": -0.8395902514457703, + "logps/chosen": -5.339737892150879, + "logps/rejected": -54.9642333984375, + "loss": 0.6541984677314758, + "memory(GiB)": 46.73, + "nll_loss": 0.4498509168624878, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.268288254737854, + "rewards/margins": 4.510727882385254, + "rewards/rejected": -4.242439270019531, + "step": 294, + "train_speed(iter/s)": 0.005415 + }, + { + "epoch": 0.84323358642251, + "grad_norm": 2.6126153469085693, + "learning_rate": 0.0001721483079682106, + "logits/chosen": -0.8357363939285278, + "logits/rejected": -0.8407280445098877, + "logps/chosen": -6.462512969970703, + "logps/rejected": -66.7704086303711, + "loss": 0.35049688816070557, + "memory(GiB)": 46.73, + "nll_loss": 0.23473332822322845, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3646930754184723, + "rewards/margins": 5.821950912475586, + "rewards/rejected": -5.4572577476501465, + "step": 295, + "train_speed(iter/s)": 0.005415 + }, + { + "epoch": 0.8460920053595355, + "grad_norm": 1.6905546188354492, + "learning_rate": 0.00017192910095272898, + "logits/chosen": -0.8126969337463379, + "logits/rejected": -0.8227717876434326, + "logps/chosen": -4.0240278244018555, + "logps/rejected": -69.86576080322266, + "loss": 0.36738839745521545, + "memory(GiB)": 46.73, + "nll_loss": 0.2895388901233673, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3507424294948578, + "rewards/margins": 5.908805847167969, + "rewards/rejected": -5.558063507080078, + "step": 296, + "train_speed(iter/s)": 0.005415 + }, + { + "epoch": 0.848950424296561, + "grad_norm": 0.7303423881530762, + "learning_rate": 0.00017170917542984443, + "logits/chosen": -0.8312556743621826, + "logits/rejected": -0.8409414291381836, + "logps/chosen": -3.1676483154296875, + "logps/rejected": -75.8035888671875, + "loss": 0.19972439110279083, + "memory(GiB)": 46.73, + "nll_loss": 0.17977482080459595, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2756307125091553, + "rewards/margins": 6.446622848510742, + "rewards/rejected": -6.170992851257324, + "step": 297, + "train_speed(iter/s)": 0.005415 + }, + { + "epoch": 0.8518088432335864, + "grad_norm": 2.5636391639709473, + "learning_rate": 0.00017148853359641626, + "logits/chosen": -0.839911699295044, + "logits/rejected": -0.8532472848892212, + "logps/chosen": -4.941699028015137, + "logps/rejected": -74.04802703857422, + "loss": 0.6130093932151794, + "memory(GiB)": 46.73, + "nll_loss": 0.4153917729854584, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.273116797208786, + "rewards/margins": 6.132874965667725, + "rewards/rejected": -5.859758377075195, + "step": 298, + "train_speed(iter/s)": 0.005415 + }, + { + "epoch": 0.8546672621706118, + "grad_norm": 5.344427108764648, + "learning_rate": 0.00017126717765645908, + "logits/chosen": -0.8634560704231262, + "logits/rejected": -0.8785987496376038, + "logps/chosen": -5.115147590637207, + "logps/rejected": -77.06375885009766, + "loss": 0.3565768003463745, + "memory(GiB)": 46.73, + "nll_loss": 0.2940167486667633, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4229351878166199, + "rewards/margins": 6.207124710083008, + "rewards/rejected": -5.7841901779174805, + "step": 299, + "train_speed(iter/s)": 0.005414 + }, + { + "epoch": 0.8575256811076374, + "grad_norm": 4.262563228607178, + "learning_rate": 0.00017104510982112085, + "logits/chosen": -0.8862661719322205, + "logits/rejected": -0.8961150646209717, + "logps/chosen": -6.4602837562561035, + "logps/rejected": -62.53819274902344, + "loss": 0.3667752146720886, + "memory(GiB)": 46.73, + "nll_loss": 0.2564036250114441, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.39489609003067017, + "rewards/margins": 5.051397800445557, + "rewards/rejected": -4.656500816345215, + "step": 300, + "train_speed(iter/s)": 0.005414 + }, + { + "epoch": 0.8575256811076374, + "eval_logits/chosen": -0.8734048008918762, + "eval_logits/rejected": -0.8801189661026001, + "eval_logps/chosen": -5.852853298187256, + "eval_logps/rejected": -64.62750244140625, + "eval_loss": 0.3423595726490021, + "eval_nll_loss": 0.26759958267211914, + "eval_rewards/accuracies": 0.9734513163566589, + "eval_rewards/chosen": 0.39209461212158203, + "eval_rewards/margins": 5.445755481719971, + "eval_rewards/rejected": -5.0536603927612305, + "eval_runtime": 267.2493, + "eval_samples_per_second": 0.423, + "eval_steps_per_second": 0.423, + "step": 300 + }, + { + "epoch": 0.8603841000446628, + "grad_norm": 20.735666275024414, + "learning_rate": 0.00017082233230866062, + "logits/chosen": -0.8673299551010132, + "logits/rejected": -0.876368522644043, + "logps/chosen": -9.548802375793457, + "logps/rejected": -63.38462829589844, + "loss": 0.6720445156097412, + "memory(GiB)": 46.73, + "nll_loss": 0.4585096538066864, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.06072264164686203, + "rewards/margins": 5.162600517272949, + "rewards/rejected": -5.1018781661987305, + "step": 301, + "train_speed(iter/s)": 0.005387 + }, + { + "epoch": 0.8632425189816882, + "grad_norm": 1.758367657661438, + "learning_rate": 0.00017059884734442658, + "logits/chosen": -0.8942989706993103, + "logits/rejected": -0.9041098356246948, + "logps/chosen": -4.6497111320495605, + "logps/rejected": -70.84129333496094, + "loss": 0.4637173116207123, + "memory(GiB)": 46.73, + "nll_loss": 0.33638495206832886, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3641985356807709, + "rewards/margins": 5.980964183807373, + "rewards/rejected": -5.61676549911499, + "step": 302, + "train_speed(iter/s)": 0.005387 + }, + { + "epoch": 0.8661009379187137, + "grad_norm": 1.3300881385803223, + "learning_rate": 0.0001703746571608337, + "logits/chosen": -0.9206355214118958, + "logits/rejected": -0.927955687046051, + "logps/chosen": -4.747969627380371, + "logps/rejected": -60.195621490478516, + "loss": 0.2779415249824524, + "memory(GiB)": 46.73, + "nll_loss": 0.2364496886730194, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.32591214776039124, + "rewards/margins": 5.419829845428467, + "rewards/rejected": -5.093916893005371, + "step": 303, + "train_speed(iter/s)": 0.005387 + }, + { + "epoch": 0.8689593568557392, + "grad_norm": 8.9483003616333, + "learning_rate": 0.00017014976399734144, + "logits/chosen": -0.9002286195755005, + "logits/rejected": -0.9120714068412781, + "logps/chosen": -3.8572702407836914, + "logps/rejected": -74.53612518310547, + "loss": 0.3219146728515625, + "memory(GiB)": 46.73, + "nll_loss": 0.24406777322292328, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3388945460319519, + "rewards/margins": 6.05419397354126, + "rewards/rejected": -5.715299129486084, + "step": 304, + "train_speed(iter/s)": 0.005387 + }, + { + "epoch": 0.8718177757927646, + "grad_norm": 24.502073287963867, + "learning_rate": 0.00016992417010043142, + "logits/chosen": -0.9110714197158813, + "logits/rejected": -0.9145501255989075, + "logps/chosen": -5.770493984222412, + "logps/rejected": -52.358863830566406, + "loss": 0.3569178283214569, + "memory(GiB)": 46.73, + "nll_loss": 0.2734857201576233, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3025267720222473, + "rewards/margins": 4.277225971221924, + "rewards/rejected": -3.974699020385742, + "step": 305, + "train_speed(iter/s)": 0.005387 + }, + { + "epoch": 0.8746761947297901, + "grad_norm": 1.132225513458252, + "learning_rate": 0.00016969787772358493, + "logits/chosen": -0.883800208568573, + "logits/rejected": -0.8920851945877075, + "logps/chosen": -5.719818592071533, + "logps/rejected": -62.382938385009766, + "loss": 0.33317288756370544, + "memory(GiB)": 46.73, + "nll_loss": 0.236215278506279, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.10508742928504944, + "rewards/margins": 5.275176048278809, + "rewards/rejected": -5.170088768005371, + "step": 306, + "train_speed(iter/s)": 0.005387 + }, + { + "epoch": 0.8775346136668155, + "grad_norm": 2.1382904052734375, + "learning_rate": 0.00016947088912726052, + "logits/chosen": -0.8931231498718262, + "logits/rejected": -0.9039135575294495, + "logps/chosen": -6.410434246063232, + "logps/rejected": -71.76957702636719, + "loss": 0.36886727809906006, + "memory(GiB)": 46.73, + "nll_loss": 0.2760961651802063, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.46529263257980347, + "rewards/margins": 6.17685079574585, + "rewards/rejected": -5.7115583419799805, + "step": 307, + "train_speed(iter/s)": 0.005388 + }, + { + "epoch": 0.880393032603841, + "grad_norm": 8.12493896484375, + "learning_rate": 0.00016924320657887127, + "logits/chosen": -0.8791784644126892, + "logits/rejected": -0.8861318230628967, + "logps/chosen": -5.161705017089844, + "logps/rejected": -60.26618576049805, + "loss": 0.4572223126888275, + "memory(GiB)": 46.73, + "nll_loss": 0.33235517144203186, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3299446403980255, + "rewards/margins": 5.036650657653809, + "rewards/rejected": -4.7067060470581055, + "step": 308, + "train_speed(iter/s)": 0.005388 + }, + { + "epoch": 0.8832514515408665, + "grad_norm": 1.3289014101028442, + "learning_rate": 0.00016901483235276228, + "logits/chosen": -0.8941358327865601, + "logits/rejected": -0.9037779569625854, + "logps/chosen": -6.27401876449585, + "logps/rejected": -71.07161712646484, + "loss": 0.3748854994773865, + "memory(GiB)": 46.73, + "nll_loss": 0.2852364182472229, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4290279448032379, + "rewards/margins": 5.811855792999268, + "rewards/rejected": -5.382828235626221, + "step": 309, + "train_speed(iter/s)": 0.005388 + }, + { + "epoch": 0.8861098704778919, + "grad_norm": 4.328617095947266, + "learning_rate": 0.00016878576873018787, + "logits/chosen": -0.8742256760597229, + "logits/rejected": -0.8770206570625305, + "logps/chosen": -5.228196144104004, + "logps/rejected": -53.101741790771484, + "loss": 0.4242691397666931, + "memory(GiB)": 46.73, + "nll_loss": 0.3180267810821533, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.34552180767059326, + "rewards/margins": 4.556669235229492, + "rewards/rejected": -4.211147308349609, + "step": 310, + "train_speed(iter/s)": 0.005388 + }, + { + "epoch": 0.8889682894149173, + "grad_norm": 1.7425999641418457, + "learning_rate": 0.00016855601799928876, + "logits/chosen": -0.9284868240356445, + "logits/rejected": -0.9364843368530273, + "logps/chosen": -3.691480875015259, + "logps/rejected": -63.92913818359375, + "loss": 0.22003982961177826, + "memory(GiB)": 46.73, + "nll_loss": 0.15120568871498108, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5339685082435608, + "rewards/margins": 5.319494247436523, + "rewards/rejected": -4.785525321960449, + "step": 311, + "train_speed(iter/s)": 0.005388 + }, + { + "epoch": 0.8918267083519428, + "grad_norm": 0.9392454624176025, + "learning_rate": 0.00016832558245506935, + "logits/chosen": -0.8813795447349548, + "logits/rejected": -0.889714777469635, + "logps/chosen": -6.073534965515137, + "logps/rejected": -59.29630661010742, + "loss": 0.35096725821495056, + "memory(GiB)": 46.73, + "nll_loss": 0.2775135636329651, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.43473172187805176, + "rewards/margins": 4.894845008850098, + "rewards/rejected": -4.460113048553467, + "step": 312, + "train_speed(iter/s)": 0.005388 + }, + { + "epoch": 0.8946851272889683, + "grad_norm": 1.2475719451904297, + "learning_rate": 0.0001680944643993747, + "logits/chosen": -0.9736749529838562, + "logits/rejected": -0.9871997237205505, + "logps/chosen": -4.467031478881836, + "logps/rejected": -61.235137939453125, + "loss": 0.2823341488838196, + "memory(GiB)": 46.73, + "nll_loss": 0.24649259448051453, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.43429625034332275, + "rewards/margins": 5.264223575592041, + "rewards/rejected": -4.829927921295166, + "step": 313, + "train_speed(iter/s)": 0.005389 + }, + { + "epoch": 0.8975435462259937, + "grad_norm": 3.567657709121704, + "learning_rate": 0.00016786266614086755, + "logits/chosen": -0.9802843332290649, + "logits/rejected": -0.9897909164428711, + "logps/chosen": -6.650794982910156, + "logps/rejected": -61.503173828125, + "loss": 0.5666725635528564, + "memory(GiB)": 46.73, + "nll_loss": 0.44352883100509644, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4951842427253723, + "rewards/margins": 5.488836765289307, + "rewards/rejected": -4.99365234375, + "step": 314, + "train_speed(iter/s)": 0.005389 + }, + { + "epoch": 0.9004019651630192, + "grad_norm": 1.4415922164916992, + "learning_rate": 0.00016763018999500518, + "logits/chosen": -0.9978210926055908, + "logits/rejected": -1.0054134130477905, + "logps/chosen": -4.759300231933594, + "logps/rejected": -55.411705017089844, + "loss": 0.3095281720161438, + "memory(GiB)": 46.73, + "nll_loss": 0.23518188297748566, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.41955995559692383, + "rewards/margins": 4.839236259460449, + "rewards/rejected": -4.419675827026367, + "step": 315, + "train_speed(iter/s)": 0.00539 + }, + { + "epoch": 0.9032603841000446, + "grad_norm": 1.454599142074585, + "learning_rate": 0.00016739703828401643, + "logits/chosen": -1.015478253364563, + "logits/rejected": -1.0180584192276, + "logps/chosen": -6.854709625244141, + "logps/rejected": -54.203224182128906, + "loss": 0.448214590549469, + "memory(GiB)": 46.73, + "nll_loss": 0.34830421209335327, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2672179639339447, + "rewards/margins": 4.653902530670166, + "rewards/rejected": -4.386684894561768, + "step": 316, + "train_speed(iter/s)": 0.00539 + }, + { + "epoch": 0.9061188030370702, + "grad_norm": 5.461782932281494, + "learning_rate": 0.00016716321333687848, + "logits/chosen": -0.986311674118042, + "logits/rejected": -1.0029571056365967, + "logps/chosen": -9.523213386535645, + "logps/rejected": -70.22506713867188, + "loss": 0.7210484147071838, + "memory(GiB)": 46.73, + "nll_loss": 0.5311657190322876, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.31339961290359497, + "rewards/margins": 5.7375407218933105, + "rewards/rejected": -5.4241414070129395, + "step": 317, + "train_speed(iter/s)": 0.005391 + }, + { + "epoch": 0.9089772219740956, + "grad_norm": 5.448202610015869, + "learning_rate": 0.0001669287174892934, + "logits/chosen": -1.0209075212478638, + "logits/rejected": -1.0312987565994263, + "logps/chosen": -6.145677089691162, + "logps/rejected": -76.97433471679688, + "loss": 0.49676480889320374, + "memory(GiB)": 46.73, + "nll_loss": 0.3716152012348175, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.1940852701663971, + "rewards/margins": 6.112122535705566, + "rewards/rejected": -5.9180378913879395, + "step": 318, + "train_speed(iter/s)": 0.005391 + }, + { + "epoch": 0.911835640911121, + "grad_norm": 4.858055591583252, + "learning_rate": 0.0001666935530836651, + "logits/chosen": -1.0205280780792236, + "logits/rejected": -1.027929663658142, + "logps/chosen": -8.096317291259766, + "logps/rejected": -72.40553283691406, + "loss": 0.4033167362213135, + "memory(GiB)": 46.73, + "nll_loss": 0.3082987666130066, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.33014655113220215, + "rewards/margins": 6.211818218231201, + "rewards/rejected": -5.881671905517578, + "step": 319, + "train_speed(iter/s)": 0.005391 + }, + { + "epoch": 0.9146940598481464, + "grad_norm": 25.689199447631836, + "learning_rate": 0.00016645772246907568, + "logits/chosen": -1.0175788402557373, + "logits/rejected": -1.0250442028045654, + "logps/chosen": -5.779062271118164, + "logps/rejected": -67.13630676269531, + "loss": 0.4840015172958374, + "memory(GiB)": 46.73, + "nll_loss": 0.3824375867843628, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3088567554950714, + "rewards/margins": 5.571361064910889, + "rewards/rejected": -5.2625041007995605, + "step": 320, + "train_speed(iter/s)": 0.005391 + }, + { + "epoch": 0.917552478785172, + "grad_norm": 2.411203145980835, + "learning_rate": 0.00016622122800126208, + "logits/chosen": -1.0164726972579956, + "logits/rejected": -1.0213780403137207, + "logps/chosen": -8.589577674865723, + "logps/rejected": -71.54415130615234, + "loss": 0.32722774147987366, + "memory(GiB)": 46.73, + "nll_loss": 0.26191988587379456, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.30120402574539185, + "rewards/margins": 5.828619956970215, + "rewards/rejected": -5.527415752410889, + "step": 321, + "train_speed(iter/s)": 0.005391 + }, + { + "epoch": 0.9204108977221974, + "grad_norm": 10.201706886291504, + "learning_rate": 0.0001659840720425926, + "logits/chosen": -1.0485953092575073, + "logits/rejected": -1.0498896837234497, + "logps/chosen": -11.473772048950195, + "logps/rejected": -59.5853271484375, + "loss": 0.7703381776809692, + "memory(GiB)": 46.73, + "nll_loss": 0.6231206059455872, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.014922700822353363, + "rewards/margins": 4.745216369628906, + "rewards/rejected": -4.730293273925781, + "step": 322, + "train_speed(iter/s)": 0.005391 + }, + { + "epoch": 0.9232693166592228, + "grad_norm": 8.294495582580566, + "learning_rate": 0.00016574625696204326, + "logits/chosen": -1.0103312730789185, + "logits/rejected": -1.0260792970657349, + "logps/chosen": -6.177521228790283, + "logps/rejected": -68.23878479003906, + "loss": 0.4851343035697937, + "memory(GiB)": 46.73, + "nll_loss": 0.31362757086753845, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.342265784740448, + "rewards/margins": 5.5506744384765625, + "rewards/rejected": -5.208408355712891, + "step": 323, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9261277355962483, + "grad_norm": 1.835939884185791, + "learning_rate": 0.000165507785135174, + "logits/chosen": -0.9879414439201355, + "logits/rejected": -0.9929082989692688, + "logps/chosen": -6.7657294273376465, + "logps/rejected": -73.79751586914062, + "loss": 0.42144203186035156, + "memory(GiB)": 46.73, + "nll_loss": 0.33192363381385803, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4221758246421814, + "rewards/margins": 6.4959306716918945, + "rewards/rejected": -6.07375431060791, + "step": 324, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9289861545332738, + "grad_norm": 1.5187759399414062, + "learning_rate": 0.00016526865894410524, + "logits/chosen": -0.9831660389900208, + "logits/rejected": -0.9866008758544922, + "logps/chosen": -1.8688807487487793, + "logps/rejected": -69.01907348632812, + "loss": 0.14090491831302643, + "memory(GiB)": 46.73, + "nll_loss": 0.10596515983343124, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5663707852363586, + "rewards/margins": 6.12815523147583, + "rewards/rejected": -5.561784267425537, + "step": 325, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9318445734702993, + "grad_norm": 9.269432067871094, + "learning_rate": 0.0001650288807774937, + "logits/chosen": -0.9924958348274231, + "logits/rejected": -0.9997655749320984, + "logps/chosen": -4.4954833984375, + "logps/rejected": -59.65481948852539, + "loss": 0.3288981020450592, + "memory(GiB)": 46.73, + "nll_loss": 0.27178075909614563, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.41092053055763245, + "rewards/margins": 5.2412567138671875, + "rewards/rejected": -4.830336093902588, + "step": 326, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9347029924073247, + "grad_norm": 3.1839118003845215, + "learning_rate": 0.0001647884530305089, + "logits/chosen": -1.017769455909729, + "logits/rejected": -1.0204215049743652, + "logps/chosen": -9.779426574707031, + "logps/rejected": -52.900611877441406, + "loss": 0.5431086421012878, + "memory(GiB)": 46.73, + "nll_loss": 0.4328044354915619, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.40310975909233093, + "rewards/margins": 4.863814830780029, + "rewards/rejected": -4.460704803466797, + "step": 327, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9375614113443501, + "grad_norm": 14.360014915466309, + "learning_rate": 0.00016454737810480912, + "logits/chosen": -1.045483112335205, + "logits/rejected": -1.0522551536560059, + "logps/chosen": -6.289290428161621, + "logps/rejected": -57.062992095947266, + "loss": 0.8400169610977173, + "memory(GiB)": 46.73, + "nll_loss": 0.6423981785774231, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.01210833340883255, + "rewards/margins": 4.530099391937256, + "rewards/rejected": -4.517991065979004, + "step": 328, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9404198302813757, + "grad_norm": 0.8805162906646729, + "learning_rate": 0.00016430565840851722, + "logits/chosen": -1.0371475219726562, + "logits/rejected": -1.0404698848724365, + "logps/chosen": -6.789125442504883, + "logps/rejected": -70.53579711914062, + "loss": 0.2656117379665375, + "memory(GiB)": 46.73, + "nll_loss": 0.24182505905628204, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2723756730556488, + "rewards/margins": 5.958362102508545, + "rewards/rejected": -5.685986518859863, + "step": 329, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9432782492184011, + "grad_norm": 33.674015045166016, + "learning_rate": 0.00016406329635619687, + "logits/chosen": -1.0247559547424316, + "logits/rejected": -1.0370457172393799, + "logps/chosen": -4.966681003570557, + "logps/rejected": -79.33086395263672, + "loss": 0.40524396300315857, + "memory(GiB)": 46.73, + "nll_loss": 0.2835578918457031, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.25815021991729736, + "rewards/margins": 6.6955718994140625, + "rewards/rejected": -6.437422275543213, + "step": 330, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9461366681554265, + "grad_norm": 8.032293319702148, + "learning_rate": 0.00016382029436882826, + "logits/chosen": -0.9656038284301758, + "logits/rejected": -0.9722874760627747, + "logps/chosen": -9.293785095214844, + "logps/rejected": -55.016483306884766, + "loss": 0.7841230630874634, + "memory(GiB)": 46.73, + "nll_loss": 0.49341529607772827, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.19789664447307587, + "rewards/margins": 4.488459587097168, + "rewards/rejected": -4.290563106536865, + "step": 331, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.948995087092452, + "grad_norm": 4.4950785636901855, + "learning_rate": 0.00016357665487378397, + "logits/chosen": -0.9956451654434204, + "logits/rejected": -1.0024536848068237, + "logps/chosen": -7.6442084312438965, + "logps/rejected": -71.45169830322266, + "loss": 0.5794447660446167, + "memory(GiB)": 46.73, + "nll_loss": 0.4559825658798218, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3677746653556824, + "rewards/margins": 5.780731201171875, + "rewards/rejected": -5.412956714630127, + "step": 332, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9518535060294775, + "grad_norm": 10.342886924743652, + "learning_rate": 0.0001633323803048047, + "logits/chosen": -1.0820869207382202, + "logits/rejected": -1.0929756164550781, + "logps/chosen": -4.995148181915283, + "logps/rejected": -73.86285400390625, + "loss": 0.8048845529556274, + "memory(GiB)": 46.73, + "nll_loss": 0.6948299407958984, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.15656176209449768, + "rewards/margins": 6.374897480010986, + "rewards/rejected": -6.2183356285095215, + "step": 333, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9547119249665029, + "grad_norm": 3.3627877235412598, + "learning_rate": 0.000163087473101975, + "logits/chosen": -0.9950565695762634, + "logits/rejected": -1.0016112327575684, + "logps/chosen": -5.096999645233154, + "logps/rejected": -79.18199920654297, + "loss": 0.2442929893732071, + "memory(GiB)": 46.73, + "nll_loss": 0.20111380517482758, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4255572557449341, + "rewards/margins": 7.013650417327881, + "rewards/rejected": -6.588093280792236, + "step": 334, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9575703439035284, + "grad_norm": 2.3392751216888428, + "learning_rate": 0.00016284193571169877, + "logits/chosen": -0.942111611366272, + "logits/rejected": -0.9454970359802246, + "logps/chosen": -5.703181743621826, + "logps/rejected": -78.9365463256836, + "loss": 0.23718298971652985, + "memory(GiB)": 46.73, + "nll_loss": 0.21918217837810516, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3546026349067688, + "rewards/margins": 7.023008346557617, + "rewards/rejected": -6.668405055999756, + "step": 335, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9604287628405538, + "grad_norm": 1.6322503089904785, + "learning_rate": 0.0001625957705866751, + "logits/chosen": -0.9369142055511475, + "logits/rejected": -0.9375166893005371, + "logps/chosen": -8.422727584838867, + "logps/rejected": -71.02118682861328, + "loss": 0.29250597953796387, + "memory(GiB)": 46.73, + "nll_loss": 0.21621529757976532, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.24125435948371887, + "rewards/margins": 6.201101303100586, + "rewards/rejected": -5.9598469734191895, + "step": 336, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9632871817775793, + "grad_norm": 1.4241256713867188, + "learning_rate": 0.00016234898018587337, + "logits/chosen": -0.919441282749176, + "logits/rejected": -0.9279767274856567, + "logps/chosen": -3.0357580184936523, + "logps/rejected": -74.14045715332031, + "loss": 0.2309810072183609, + "memory(GiB)": 46.73, + "nll_loss": 0.20462879538536072, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.45710915327072144, + "rewards/margins": 6.547056198120117, + "rewards/rejected": -6.08994722366333, + "step": 337, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9661456007146048, + "grad_norm": 1.0136852264404297, + "learning_rate": 0.0001621015669745091, + "logits/chosen": -0.9102113842964172, + "logits/rejected": -0.9235545992851257, + "logps/chosen": -5.8284711837768555, + "logps/rejected": -70.81057739257812, + "loss": 0.2786170244216919, + "memory(GiB)": 46.73, + "nll_loss": 0.19428883492946625, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.2921997904777527, + "rewards/margins": 5.950136661529541, + "rewards/rejected": -5.6579365730285645, + "step": 338, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9690040196516302, + "grad_norm": 15.279269218444824, + "learning_rate": 0.00016185353342401896, + "logits/chosen": -0.8982729315757751, + "logits/rejected": -0.9046964049339294, + "logps/chosen": -7.766308307647705, + "logps/rejected": -62.051937103271484, + "loss": 0.6271102428436279, + "memory(GiB)": 46.73, + "nll_loss": 0.48667430877685547, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.0021721050143241882, + "rewards/margins": 5.078856945037842, + "rewards/rejected": -5.076685428619385, + "step": 339, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9718624385886556, + "grad_norm": 1.1338287591934204, + "learning_rate": 0.00016160488201203644, + "logits/chosen": -0.8646394610404968, + "logits/rejected": -0.8734477758407593, + "logps/chosen": -5.671806335449219, + "logps/rejected": -69.74577331542969, + "loss": 0.29183241724967957, + "memory(GiB)": 46.73, + "nll_loss": 0.20666053891181946, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3366142809391022, + "rewards/margins": 5.2625555992126465, + "rewards/rejected": -4.925941467285156, + "step": 340, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9747208575256812, + "grad_norm": 1.3026493787765503, + "learning_rate": 0.00016135561522236672, + "logits/chosen": -0.8204034566879272, + "logits/rejected": -0.8284322023391724, + "logps/chosen": -4.833341598510742, + "logps/rejected": -69.78504180908203, + "loss": 0.3127586245536804, + "memory(GiB)": 46.73, + "nll_loss": 0.2100476622581482, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.242780864238739, + "rewards/margins": 5.5957465171813965, + "rewards/rejected": -5.35296630859375, + "step": 341, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.9775792764627066, + "grad_norm": 2.748405694961548, + "learning_rate": 0.00016110573554496224, + "logits/chosen": -0.8463813066482544, + "logits/rejected": -0.8463882803916931, + "logps/chosen": -5.698624134063721, + "logps/rejected": -55.9860954284668, + "loss": 0.4039191007614136, + "memory(GiB)": 46.73, + "nll_loss": 0.24814251065254211, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.21434757113456726, + "rewards/margins": 4.836075782775879, + "rewards/rejected": -4.62172794342041, + "step": 342, + "train_speed(iter/s)": 0.005392 + }, + { + "epoch": 0.980437695399732, + "grad_norm": 10.635896682739258, + "learning_rate": 0.00016085524547589745, + "logits/chosen": -0.834613561630249, + "logits/rejected": -0.8402217030525208, + "logps/chosen": -8.695450782775879, + "logps/rejected": -54.68165969848633, + "loss": 0.581217885017395, + "memory(GiB)": 46.73, + "nll_loss": 0.4611096978187561, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.46262139081954956, + "rewards/margins": 4.636106491088867, + "rewards/rejected": -4.173485279083252, + "step": 343, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9832961143367575, + "grad_norm": 1.466161847114563, + "learning_rate": 0.00016060414751734427, + "logits/chosen": -0.8554599285125732, + "logits/rejected": -0.8568660020828247, + "logps/chosen": -8.234001159667969, + "logps/rejected": -64.19937133789062, + "loss": 0.43428340554237366, + "memory(GiB)": 46.73, + "nll_loss": 0.38572317361831665, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.16825053095817566, + "rewards/margins": 5.233675956726074, + "rewards/rejected": -5.065425395965576, + "step": 344, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9861545332737829, + "grad_norm": 5.699708938598633, + "learning_rate": 0.00016035244417754666, + "logits/chosen": -0.8450981974601746, + "logits/rejected": -0.8527222275733948, + "logps/chosen": -3.89296555519104, + "logps/rejected": -66.04846954345703, + "loss": 0.3113130033016205, + "memory(GiB)": 46.73, + "nll_loss": 0.2075911909341812, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.31323832273483276, + "rewards/margins": 5.465184688568115, + "rewards/rejected": -5.151946067810059, + "step": 345, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9890129522108084, + "grad_norm": 3.284147262573242, + "learning_rate": 0.00016010013797079604, + "logits/chosen": -0.875758707523346, + "logits/rejected": -0.8854641318321228, + "logps/chosen": -8.347525596618652, + "logps/rejected": -64.02723693847656, + "loss": 0.3474237620830536, + "memory(GiB)": 46.73, + "nll_loss": 0.30704212188720703, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6182546615600586, + "rewards/margins": 5.860507965087891, + "rewards/rejected": -5.24225378036499, + "step": 346, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9918713711478339, + "grad_norm": 2.5723087787628174, + "learning_rate": 0.00015984723141740576, + "logits/chosen": -0.8617424964904785, + "logits/rejected": -0.8713058233261108, + "logps/chosen": -4.935853958129883, + "logps/rejected": -62.30400466918945, + "loss": 0.2456638514995575, + "memory(GiB)": 46.73, + "nll_loss": 0.21370640397071838, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5748140811920166, + "rewards/margins": 5.38767671585083, + "rewards/rejected": -4.812862873077393, + "step": 347, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9947297900848593, + "grad_norm": 3.616013765335083, + "learning_rate": 0.00015959372704368613, + "logits/chosen": -0.882293701171875, + "logits/rejected": -0.8994702696800232, + "logps/chosen": -4.042830944061279, + "logps/rejected": -71.71359252929688, + "loss": 0.3966720402240753, + "memory(GiB)": 46.73, + "nll_loss": 0.30810311436653137, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.33603835105895996, + "rewards/margins": 5.718041896820068, + "rewards/rejected": -5.382004261016846, + "step": 348, + "train_speed(iter/s)": 0.005393 + }, + { + "epoch": 0.9975882090218847, + "grad_norm": 6.144766330718994, + "learning_rate": 0.00015933962738191922, + "logits/chosen": -0.9038645625114441, + "logits/rejected": -0.9091448187828064, + "logps/chosen": -5.831871032714844, + "logps/rejected": -66.433349609375, + "loss": 0.47910255193710327, + "memory(GiB)": 46.73, + "nll_loss": 0.41736844182014465, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3490181863307953, + "rewards/margins": 5.82589054107666, + "rewards/rejected": -5.476872444152832, + "step": 349, + "train_speed(iter/s)": 0.005394 + }, + { + "epoch": 1.0, + "grad_norm": 6.144766330718994, + "learning_rate": 0.00015908493497033342, + "logits/chosen": -0.9684196710586548, + "logits/rejected": -0.9691399931907654, + "logps/chosen": -8.71323299407959, + "logps/rejected": -60.70466613769531, + "loss": 0.5765681862831116, + "memory(GiB)": 46.73, + "nll_loss": 0.48567596077919006, + "rewards/accuracies": 0.9629629850387573, + "rewards/chosen": 0.1075638011097908, + "rewards/margins": 4.990283966064453, + "rewards/rejected": -4.882720947265625, + "step": 350, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.0028584189370255, + "grad_norm": 12.870558738708496, + "learning_rate": 0.0001588296523530782, + "logits/chosen": -0.9231064915657043, + "logits/rejected": -0.9311851263046265, + "logps/chosen": -2.7042253017425537, + "logps/rejected": -82.00444793701172, + "loss": 0.1967441439628601, + "memory(GiB)": 46.73, + "nll_loss": 0.13856354355812073, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3296782970428467, + "rewards/margins": 7.18233585357666, + "rewards/rejected": -6.852657318115234, + "step": 351, + "train_speed(iter/s)": 0.005395 + }, + { + "epoch": 1.0057168378740509, + "grad_norm": 1.8271692991256714, + "learning_rate": 0.00015857378208019863, + "logits/chosen": -0.97520911693573, + "logits/rejected": -0.9849916696548462, + "logps/chosen": -4.477419853210449, + "logps/rejected": -86.62374877929688, + "loss": 0.3155742287635803, + "memory(GiB)": 46.73, + "nll_loss": 0.2099926471710205, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.43573394417762756, + "rewards/margins": 7.636806488037109, + "rewards/rejected": -7.2010722160339355, + "step": 352, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.0085752568110764, + "grad_norm": 7.060220718383789, + "learning_rate": 0.00015831732670761, + "logits/chosen": -0.9630932807922363, + "logits/rejected": -0.9717562198638916, + "logps/chosen": -5.999786376953125, + "logps/rejected": -72.86624145507812, + "loss": 0.37415221333503723, + "memory(GiB)": 46.73, + "nll_loss": 0.30320242047309875, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5031129121780396, + "rewards/margins": 6.387660503387451, + "rewards/rejected": -5.884547233581543, + "step": 353, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.0114336757481017, + "grad_norm": 3.706690788269043, + "learning_rate": 0.0001580602887970721, + "logits/chosen": -0.9575849771499634, + "logits/rejected": -0.9724946022033691, + "logps/chosen": -5.294210433959961, + "logps/rejected": -91.92877960205078, + "loss": 0.2967577278614044, + "memory(GiB)": 46.73, + "nll_loss": 0.2625669240951538, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6673180460929871, + "rewards/margins": 8.382440567016602, + "rewards/rejected": -7.715121746063232, + "step": 354, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.0142920946851273, + "grad_norm": 1.285293698310852, + "learning_rate": 0.00015780267091616384, + "logits/chosen": -0.9639118313789368, + "logits/rejected": -0.9653413891792297, + "logps/chosen": -5.7249932289123535, + "logps/rejected": -69.57672119140625, + "loss": 0.32318511605262756, + "memory(GiB)": 46.73, + "nll_loss": 0.22393131256103516, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4273739159107208, + "rewards/margins": 6.277651309967041, + "rewards/rejected": -5.850277423858643, + "step": 355, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0171505136221528, + "grad_norm": 2.779635429382324, + "learning_rate": 0.00015754447563825753, + "logits/chosen": -1.0046184062957764, + "logits/rejected": -1.0239185094833374, + "logps/chosen": -3.307408571243286, + "logps/rejected": -97.91881561279297, + "loss": 0.3016938269138336, + "memory(GiB)": 46.73, + "nll_loss": 0.24211131036281586, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.39448609948158264, + "rewards/margins": 8.36285400390625, + "rewards/rejected": -7.968369007110596, + "step": 356, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0200089325591781, + "grad_norm": 0.8398857116699219, + "learning_rate": 0.00015728570554249312, + "logits/chosen": -0.9939976334571838, + "logits/rejected": -1.0019322633743286, + "logps/chosen": -4.930360317230225, + "logps/rejected": -91.99279022216797, + "loss": 0.27104535698890686, + "memory(GiB)": 46.73, + "nll_loss": 0.23959386348724365, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6068980693817139, + "rewards/margins": 8.438031196594238, + "rewards/rejected": -7.831132888793945, + "step": 357, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0228673514962037, + "grad_norm": 13.871009826660156, + "learning_rate": 0.00015702636321375247, + "logits/chosen": -1.0234308242797852, + "logits/rejected": -1.0354745388031006, + "logps/chosen": -2.2346346378326416, + "logps/rejected": -83.26295471191406, + "loss": 0.2160538136959076, + "memory(GiB)": 46.73, + "nll_loss": 0.16140007972717285, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5340418219566345, + "rewards/margins": 7.688697814941406, + "rewards/rejected": -7.154655456542969, + "step": 358, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0257257704332292, + "grad_norm": 0.8609360456466675, + "learning_rate": 0.0001567664512426336, + "logits/chosen": -1.0916311740875244, + "logits/rejected": -1.097614049911499, + "logps/chosen": -6.557211875915527, + "logps/rejected": -84.11883544921875, + "loss": 0.4536070227622986, + "memory(GiB)": 46.73, + "nll_loss": 0.39151808619499207, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4971507489681244, + "rewards/margins": 7.762202739715576, + "rewards/rejected": -7.26505184173584, + "step": 359, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0285841893702545, + "grad_norm": 2.303415060043335, + "learning_rate": 0.0001565059722254246, + "logits/chosen": -1.0779087543487549, + "logits/rejected": -1.0951520204544067, + "logps/chosen": -3.8818159103393555, + "logps/rejected": -106.29981231689453, + "loss": 0.22627738118171692, + "memory(GiB)": 46.73, + "nll_loss": 0.2000780701637268, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6046518683433533, + "rewards/margins": 9.897167205810547, + "rewards/rejected": -9.292513847351074, + "step": 360, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.03144260830728, + "grad_norm": 1.3675633668899536, + "learning_rate": 0.0001562449287640781, + "logits/chosen": -1.0752346515655518, + "logits/rejected": -1.0898910760879517, + "logps/chosen": -6.105413913726807, + "logps/rejected": -89.15643310546875, + "loss": 0.2978951036930084, + "memory(GiB)": 46.73, + "nll_loss": 0.283588171005249, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3898117244243622, + "rewards/margins": 7.911345481872559, + "rewards/rejected": -7.521533966064453, + "step": 361, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0343010272443054, + "grad_norm": 6.952116012573242, + "learning_rate": 0.00015598332346618472, + "logits/chosen": -1.1288803815841675, + "logits/rejected": -1.1454200744628906, + "logps/chosen": -4.83287239074707, + "logps/rejected": -105.67863464355469, + "loss": 0.24368441104888916, + "memory(GiB)": 46.73, + "nll_loss": 0.18769891560077667, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.40421319007873535, + "rewards/margins": 9.764554023742676, + "rewards/rejected": -9.36034107208252, + "step": 362, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.037159446181331, + "grad_norm": 1.075246810913086, + "learning_rate": 0.00015572115894494753, + "logits/chosen": -1.1167821884155273, + "logits/rejected": -1.126716136932373, + "logps/chosen": -5.83702278137207, + "logps/rejected": -83.78435516357422, + "loss": 0.6275767087936401, + "memory(GiB)": 46.73, + "nll_loss": 0.49619928002357483, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2739230990409851, + "rewards/margins": 7.508330345153809, + "rewards/rejected": -7.2344069480896, + "step": 363, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0400178651183565, + "grad_norm": 2.651705026626587, + "learning_rate": 0.0001554584378191557, + "logits/chosen": -1.118470549583435, + "logits/rejected": -1.1314526796340942, + "logps/chosen": -4.532167911529541, + "logps/rejected": -109.85540771484375, + "loss": 0.33839932084083557, + "memory(GiB)": 46.73, + "nll_loss": 0.29753658175468445, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.300693541765213, + "rewards/margins": 10.05015754699707, + "rewards/rejected": -9.74946403503418, + "step": 364, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0428762840553818, + "grad_norm": 2.843981981277466, + "learning_rate": 0.00015519516271315833, + "logits/chosen": -1.1179580688476562, + "logits/rejected": -1.1344995498657227, + "logps/chosen": -3.897614002227783, + "logps/rejected": -110.58882904052734, + "loss": 0.21827109158039093, + "memory(GiB)": 46.73, + "nll_loss": 0.1813371628522873, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3872532844543457, + "rewards/margins": 9.676642417907715, + "rewards/rejected": -9.289389610290527, + "step": 365, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0457347029924073, + "grad_norm": 0.8926439881324768, + "learning_rate": 0.00015493133625683832, + "logits/chosen": -1.0487337112426758, + "logits/rejected": -1.0591659545898438, + "logps/chosen": -5.423582553863525, + "logps/rejected": -103.98403930664062, + "loss": 0.2396513819694519, + "memory(GiB)": 46.73, + "nll_loss": 0.1920444220304489, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.36182424426078796, + "rewards/margins": 9.282267570495605, + "rewards/rejected": -8.920443534851074, + "step": 366, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0485931219294329, + "grad_norm": 5.607733726501465, + "learning_rate": 0.00015466696108558611, + "logits/chosen": -1.0868735313415527, + "logits/rejected": -1.1046335697174072, + "logps/chosen": -2.328686475753784, + "logps/rejected": -110.52572631835938, + "loss": 0.2047678381204605, + "memory(GiB)": 46.73, + "nll_loss": 0.15454038977622986, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.42064905166625977, + "rewards/margins": 10.248493194580078, + "rewards/rejected": -9.82784366607666, + "step": 367, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0514515408664582, + "grad_norm": 3.384974956512451, + "learning_rate": 0.00015440203984027324, + "logits/chosen": -1.0706456899642944, + "logits/rejected": -1.0734856128692627, + "logps/chosen": -8.40677261352539, + "logps/rejected": -90.43633270263672, + "loss": 0.3508933186531067, + "memory(GiB)": 46.73, + "nll_loss": 0.28089454770088196, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6354080438613892, + "rewards/margins": 8.334720611572266, + "rewards/rejected": -7.699313640594482, + "step": 368, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0543099598034837, + "grad_norm": 8.536555290222168, + "learning_rate": 0.00015413657516722608, + "logits/chosen": -1.0756679773330688, + "logits/rejected": -1.0896883010864258, + "logps/chosen": -2.9808621406555176, + "logps/rejected": -115.16674041748047, + "loss": 0.19086603820323944, + "memory(GiB)": 46.73, + "nll_loss": 0.11452573537826538, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4531559944152832, + "rewards/margins": 10.596439361572266, + "rewards/rejected": -10.14328384399414, + "step": 369, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.057168378740509, + "grad_norm": 1.940089464187622, + "learning_rate": 0.0001538705697181993, + "logits/chosen": -1.0724232196807861, + "logits/rejected": -1.0894471406936646, + "logps/chosen": -5.458188533782959, + "logps/rejected": -92.23328399658203, + "loss": 0.3626580834388733, + "memory(GiB)": 46.73, + "nll_loss": 0.1961795538663864, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.302205353975296, + "rewards/margins": 8.254514694213867, + "rewards/rejected": -7.952309608459473, + "step": 370, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0600267976775346, + "grad_norm": 7.417636394500732, + "learning_rate": 0.00015360402615034957, + "logits/chosen": -1.0472326278686523, + "logits/rejected": -1.049625277519226, + "logps/chosen": -8.179616928100586, + "logps/rejected": -63.44961166381836, + "loss": 0.6974677443504333, + "memory(GiB)": 46.73, + "nll_loss": 0.5029023289680481, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.29456627368927, + "rewards/margins": 5.530611038208008, + "rewards/rejected": -5.236044883728027, + "step": 371, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0628852166145601, + "grad_norm": 4.58155632019043, + "learning_rate": 0.00015333694712620877, + "logits/chosen": -1.0107908248901367, + "logits/rejected": -1.03103506565094, + "logps/chosen": -3.0122299194335938, + "logps/rejected": -87.87651062011719, + "loss": 0.2748883366584778, + "memory(GiB)": 46.73, + "nll_loss": 0.19327932596206665, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3658236265182495, + "rewards/margins": 7.511802673339844, + "rewards/rejected": -7.145978927612305, + "step": 372, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.0657436355515855, + "grad_norm": 1.9569977521896362, + "learning_rate": 0.00015306933531365746, + "logits/chosen": -1.0274032354354858, + "logits/rejected": -1.0408649444580078, + "logps/chosen": -4.216259956359863, + "logps/rejected": -77.02142333984375, + "loss": 0.1719209998846054, + "memory(GiB)": 46.73, + "nll_loss": 0.1202804297208786, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.498973548412323, + "rewards/margins": 6.682814598083496, + "rewards/rejected": -6.183840274810791, + "step": 373, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.068602054488611, + "grad_norm": 1.8889274597167969, + "learning_rate": 0.00015280119338589848, + "logits/chosen": -0.9627959728240967, + "logits/rejected": -0.9700111150741577, + "logps/chosen": -4.429068565368652, + "logps/rejected": -58.58879089355469, + "loss": 0.31505152583122253, + "memory(GiB)": 46.73, + "nll_loss": 0.24982158839702606, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48795652389526367, + "rewards/margins": 5.2674665451049805, + "rewards/rejected": -4.779509544372559, + "step": 374, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0714604734256366, + "grad_norm": 1.3401929140090942, + "learning_rate": 0.00015253252402142988, + "logits/chosen": -0.9444267749786377, + "logits/rejected": -0.9516254663467407, + "logps/chosen": -5.844239711761475, + "logps/rejected": -56.261043548583984, + "loss": 0.5727149844169617, + "memory(GiB)": 46.73, + "nll_loss": 0.4068922996520996, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3124135732650757, + "rewards/margins": 4.691495895385742, + "rewards/rejected": -4.379082202911377, + "step": 375, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0743188923626619, + "grad_norm": 3.1873483657836914, + "learning_rate": 0.00015226332990401839, + "logits/chosen": -0.9815166592597961, + "logits/rejected": -0.9949151277542114, + "logps/chosen": -4.578482151031494, + "logps/rejected": -61.80070877075195, + "loss": 0.3074871897697449, + "memory(GiB)": 46.73, + "nll_loss": 0.2443370521068573, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37748435139656067, + "rewards/margins": 5.022083759307861, + "rewards/rejected": -4.644599437713623, + "step": 376, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0771773112996874, + "grad_norm": 3.210460662841797, + "learning_rate": 0.00015199361372267252, + "logits/chosen": -0.9962713718414307, + "logits/rejected": -1.007851243019104, + "logps/chosen": -4.6215314865112305, + "logps/rejected": -68.99275970458984, + "loss": 0.33263853192329407, + "memory(GiB)": 46.73, + "nll_loss": 0.2563571631908417, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3635731339454651, + "rewards/margins": 5.339460372924805, + "rewards/rejected": -4.975887775421143, + "step": 377, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0800357302367127, + "grad_norm": 1.1795045137405396, + "learning_rate": 0.0001517233781716158, + "logits/chosen": -0.9740598201751709, + "logits/rejected": -0.9786965250968933, + "logps/chosen": -3.0450801849365234, + "logps/rejected": -58.28498840332031, + "loss": 0.20879173278808594, + "memory(GiB)": 46.73, + "nll_loss": 0.1391848474740982, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3902430832386017, + "rewards/margins": 4.98201847076416, + "rewards/rejected": -4.591774940490723, + "step": 378, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0828941491737383, + "grad_norm": 0.8478718996047974, + "learning_rate": 0.0001514526259502597, + "logits/chosen": -1.014763355255127, + "logits/rejected": -1.0234493017196655, + "logps/chosen": -5.755362033843994, + "logps/rejected": -56.58897018432617, + "loss": 0.29453325271606445, + "memory(GiB)": 46.73, + "nll_loss": 0.24886007606983185, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6119623184204102, + "rewards/margins": 4.830573558807373, + "rewards/rejected": -4.218611240386963, + "step": 379, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0857525681107638, + "grad_norm": 1.2000700235366821, + "learning_rate": 0.0001511813597631768, + "logits/chosen": -1.08107328414917, + "logits/rejected": -1.0919263362884521, + "logps/chosen": -2.3718998432159424, + "logps/rejected": -70.58430480957031, + "loss": 0.14146487414836884, + "memory(GiB)": 46.73, + "nll_loss": 0.11342191696166992, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48773208260536194, + "rewards/margins": 5.9527997970581055, + "rewards/rejected": -5.4650678634643555, + "step": 380, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0886109870477891, + "grad_norm": 0.994286835193634, + "learning_rate": 0.00015090958232007382, + "logits/chosen": -1.0723847150802612, + "logits/rejected": -1.081552505493164, + "logps/chosen": -4.142213344573975, + "logps/rejected": -59.78821563720703, + "loss": 0.31306585669517517, + "memory(GiB)": 46.73, + "nll_loss": 0.19472181797027588, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.36915597319602966, + "rewards/margins": 5.192928314208984, + "rewards/rejected": -4.823772430419922, + "step": 381, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0914694059848147, + "grad_norm": 1.2460722923278809, + "learning_rate": 0.0001506372963357644, + "logits/chosen": -1.1130002737045288, + "logits/rejected": -1.1146095991134644, + "logps/chosen": -9.743265151977539, + "logps/rejected": -66.38863372802734, + "loss": 0.35199907422065735, + "memory(GiB)": 46.73, + "nll_loss": 0.3197867274284363, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6031234264373779, + "rewards/margins": 5.4538679122924805, + "rewards/rejected": -4.850744247436523, + "step": 382, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.09432782492184, + "grad_norm": 1.542410969734192, + "learning_rate": 0.000150364504530142, + "logits/chosen": -1.1817418336868286, + "logits/rejected": -1.2013391256332397, + "logps/chosen": -5.177500247955322, + "logps/rejected": -78.95667266845703, + "loss": 0.2238728106021881, + "memory(GiB)": 46.73, + "nll_loss": 0.20672012865543365, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6603532433509827, + "rewards/margins": 7.047100067138672, + "rewards/rejected": -6.386747360229492, + "step": 383, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.0971862438588655, + "grad_norm": 10.618709564208984, + "learning_rate": 0.0001500912096281529, + "logits/chosen": -1.1675359010696411, + "logits/rejected": -1.1800576448440552, + "logps/chosen": -6.0596442222595215, + "logps/rejected": -82.39451599121094, + "loss": 0.3103340268135071, + "memory(GiB)": 46.73, + "nll_loss": 0.2941910922527313, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.23652604222297668, + "rewards/margins": 6.875463485717773, + "rewards/rejected": -6.638937950134277, + "step": 384, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.100044662795891, + "grad_norm": 1.3329583406448364, + "learning_rate": 0.0001498174143597688, + "logits/chosen": -1.1695022583007812, + "logits/rejected": -1.1745272874832153, + "logps/chosen": -4.853740692138672, + "logps/rejected": -73.12336730957031, + "loss": 0.24817080795764923, + "memory(GiB)": 46.73, + "nll_loss": 0.2323508858680725, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5231865048408508, + "rewards/margins": 6.650723457336426, + "rewards/rejected": -6.127537250518799, + "step": 385, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1029030817329164, + "grad_norm": 1.2939307689666748, + "learning_rate": 0.0001495431214599596, + "logits/chosen": -1.2455010414123535, + "logits/rejected": -1.2690339088439941, + "logps/chosen": -4.194414138793945, + "logps/rejected": -100.75020599365234, + "loss": 0.4531107246875763, + "memory(GiB)": 46.73, + "nll_loss": 0.3706914484500885, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.35981571674346924, + "rewards/margins": 8.57312297821045, + "rewards/rejected": -8.213308334350586, + "step": 386, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.105761500669942, + "grad_norm": 2.0912704467773438, + "learning_rate": 0.0001492683336686661, + "logits/chosen": -1.1914197206497192, + "logits/rejected": -1.2101380825042725, + "logps/chosen": -1.7182801961898804, + "logps/rejected": -87.42121124267578, + "loss": 0.15902560949325562, + "memory(GiB)": 46.73, + "nll_loss": 0.12242907285690308, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.45987534523010254, + "rewards/margins": 7.868042945861816, + "rewards/rejected": -7.408167839050293, + "step": 387, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1086199196069675, + "grad_norm": 1.1176247596740723, + "learning_rate": 0.00014899305373077267, + "logits/chosen": -1.2531603574752808, + "logits/rejected": -1.2684531211853027, + "logps/chosen": -2.117079734802246, + "logps/rejected": -87.74042510986328, + "loss": 0.18193872272968292, + "memory(GiB)": 46.73, + "nll_loss": 0.15015342831611633, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4387218952178955, + "rewards/margins": 7.757615089416504, + "rewards/rejected": -7.3188934326171875, + "step": 388, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1114783385439928, + "grad_norm": 0.972709059715271, + "learning_rate": 0.00014871728439607966, + "logits/chosen": -1.2104300260543823, + "logits/rejected": -1.2282990217208862, + "logps/chosen": -3.3613080978393555, + "logps/rejected": -94.52223205566406, + "loss": 0.1493372619152069, + "memory(GiB)": 46.73, + "nll_loss": 0.14292338490486145, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5973756909370422, + "rewards/margins": 8.051233291625977, + "rewards/rejected": -7.453857421875, + "step": 389, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1143367574810183, + "grad_norm": 1.1937053203582764, + "learning_rate": 0.00014844102841927623, + "logits/chosen": -1.2560189962387085, + "logits/rejected": -1.2647898197174072, + "logps/chosen": -3.7985305786132812, + "logps/rejected": -75.83130645751953, + "loss": 0.23384623229503632, + "memory(GiB)": 46.73, + "nll_loss": 0.18301275372505188, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2770909070968628, + "rewards/margins": 6.391443729400635, + "rewards/rejected": -6.114353179931641, + "step": 390, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1171951764180437, + "grad_norm": 1.0092942714691162, + "learning_rate": 0.00014816428855991256, + "logits/chosen": -1.2596346139907837, + "logits/rejected": -1.2714850902557373, + "logps/chosen": -6.020136833190918, + "logps/rejected": -68.42110443115234, + "loss": 0.32318103313446045, + "memory(GiB)": 46.73, + "nll_loss": 0.2444128394126892, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.38019418716430664, + "rewards/margins": 6.058952808380127, + "rewards/rejected": -5.6787590980529785, + "step": 391, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1200535953550692, + "grad_norm": 12.279372215270996, + "learning_rate": 0.00014788706758237237, + "logits/chosen": -1.2402408123016357, + "logits/rejected": -1.2524936199188232, + "logps/chosen": -9.088288307189941, + "logps/rejected": -83.71780395507812, + "loss": 0.5434684157371521, + "memory(GiB)": 46.73, + "nll_loss": 0.3825962245464325, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3981444835662842, + "rewards/margins": 7.234827518463135, + "rewards/rejected": -6.836682319641113, + "step": 392, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1229120142920948, + "grad_norm": 11.173020362854004, + "learning_rate": 0.00014760936825584535, + "logits/chosen": -1.3199270963668823, + "logits/rejected": -1.3250387907028198, + "logps/chosen": -7.1048784255981445, + "logps/rejected": -64.97396850585938, + "loss": 0.38601505756378174, + "memory(GiB)": 46.73, + "nll_loss": 0.2887519598007202, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.37940722703933716, + "rewards/margins": 5.784918785095215, + "rewards/rejected": -5.405511856079102, + "step": 393, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.12577043322912, + "grad_norm": 3.846090078353882, + "learning_rate": 0.00014733119335429948, + "logits/chosen": -1.273574948310852, + "logits/rejected": -1.304163932800293, + "logps/chosen": -3.3201277256011963, + "logps/rejected": -104.27872467041016, + "loss": 0.12292776256799698, + "memory(GiB)": 46.73, + "nll_loss": 0.11733995378017426, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4839162826538086, + "rewards/margins": 8.810001373291016, + "rewards/rejected": -8.326085090637207, + "step": 394, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1286288521661456, + "grad_norm": 0.7386897802352905, + "learning_rate": 0.00014705254565645334, + "logits/chosen": -1.2930562496185303, + "logits/rejected": -1.3070048093795776, + "logps/chosen": -3.3808460235595703, + "logps/rejected": -87.94336700439453, + "loss": 0.15408602356910706, + "memory(GiB)": 46.73, + "nll_loss": 0.14752119779586792, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4112515151500702, + "rewards/margins": 7.620075225830078, + "rewards/rejected": -7.208824157714844, + "step": 395, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1314872711031712, + "grad_norm": 0.8473145365715027, + "learning_rate": 0.00014677342794574817, + "logits/chosen": -1.2756608724594116, + "logits/rejected": -1.3103110790252686, + "logps/chosen": -2.1913681030273438, + "logps/rejected": -98.67115020751953, + "loss": 0.1846894919872284, + "memory(GiB)": 46.73, + "nll_loss": 0.180893674492836, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4858021140098572, + "rewards/margins": 8.420744895935059, + "rewards/rejected": -7.934943199157715, + "step": 396, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1343456900401965, + "grad_norm": 1.5317679643630981, + "learning_rate": 0.00014649384301032044, + "logits/chosen": -1.2814905643463135, + "logits/rejected": -1.3005256652832031, + "logps/chosen": -1.5174694061279297, + "logps/rejected": -87.35885620117188, + "loss": 0.12383262068033218, + "memory(GiB)": 46.73, + "nll_loss": 0.10835046321153641, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44735920429229736, + "rewards/margins": 7.7608489990234375, + "rewards/rejected": -7.313488960266113, + "step": 397, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.137204108977222, + "grad_norm": 1.6518385410308838, + "learning_rate": 0.0001462137936429736, + "logits/chosen": -1.3178036212921143, + "logits/rejected": -1.3269606828689575, + "logps/chosen": -3.7774932384490967, + "logps/rejected": -70.43819427490234, + "loss": 0.24924607574939728, + "memory(GiB)": 46.73, + "nll_loss": 0.19433541595935822, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2736770212650299, + "rewards/margins": 6.038897514343262, + "rewards/rejected": -5.765220642089844, + "step": 398, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1400625279142473, + "grad_norm": 1.1277555227279663, + "learning_rate": 0.00014593328264115042, + "logits/chosen": -1.3218518495559692, + "logits/rejected": -1.338102102279663, + "logps/chosen": -5.340864181518555, + "logps/rejected": -76.87016296386719, + "loss": 0.3493357300758362, + "memory(GiB)": 46.73, + "nll_loss": 0.25427284836769104, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3287370502948761, + "rewards/margins": 6.68165397644043, + "rewards/rejected": -6.352917194366455, + "step": 399, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1429209468512729, + "grad_norm": 4.7161102294921875, + "learning_rate": 0.000145652312806905, + "logits/chosen": -1.2902297973632812, + "logits/rejected": -1.2931489944458008, + "logps/chosen": -5.8022236824035645, + "logps/rejected": -77.25333404541016, + "loss": 0.3741215467453003, + "memory(GiB)": 46.73, + "nll_loss": 0.2942506968975067, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3449039161205292, + "rewards/margins": 6.666882514953613, + "rewards/rejected": -6.3219780921936035, + "step": 400, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1457793657882984, + "grad_norm": 13.246755599975586, + "learning_rate": 0.00014537088694687475, + "logits/chosen": -1.3303780555725098, + "logits/rejected": -1.3321895599365234, + "logps/chosen": -5.475297927856445, + "logps/rejected": -84.30738830566406, + "loss": 0.2737537622451782, + "memory(GiB)": 46.73, + "nll_loss": 0.252432644367218, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.400252103805542, + "rewards/margins": 7.612529754638672, + "rewards/rejected": -7.212278366088867, + "step": 401, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1486377847253237, + "grad_norm": 1.5183851718902588, + "learning_rate": 0.0001450890078722524, + "logits/chosen": -1.2768632173538208, + "logits/rejected": -1.2883963584899902, + "logps/chosen": -6.603586196899414, + "logps/rejected": -75.68502044677734, + "loss": 0.2976156175136566, + "memory(GiB)": 46.73, + "nll_loss": 0.26498278975486755, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6158945560455322, + "rewards/margins": 6.887779235839844, + "rewards/rejected": -6.271884441375732, + "step": 402, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1514962036623493, + "grad_norm": 1.2054356336593628, + "learning_rate": 0.00014480667839875786, + "logits/chosen": -1.289682149887085, + "logits/rejected": -1.304053544998169, + "logps/chosen": -4.174172878265381, + "logps/rejected": -92.87583923339844, + "loss": 0.29464054107666016, + "memory(GiB)": 46.73, + "nll_loss": 0.24246171116828918, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5281142592430115, + "rewards/margins": 8.316887855529785, + "rewards/rejected": -7.788773536682129, + "step": 403, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1543546225993748, + "grad_norm": 1.2773363590240479, + "learning_rate": 0.0001445239013466101, + "logits/chosen": -1.3230645656585693, + "logits/rejected": -1.3197563886642456, + "logps/chosen": -4.9347124099731445, + "logps/rejected": -85.14564514160156, + "loss": 0.1755044162273407, + "memory(GiB)": 46.73, + "nll_loss": 0.16279785335063934, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4090490937232971, + "rewards/margins": 7.78640604019165, + "rewards/rejected": -7.377357482910156, + "step": 404, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.1572130415364001, + "grad_norm": 27.927875518798828, + "learning_rate": 0.00014424067954049903, + "logits/chosen": -1.3196823596954346, + "logits/rejected": -1.3405616283416748, + "logps/chosen": -4.248622894287109, + "logps/rejected": -94.78376770019531, + "loss": 0.4967496693134308, + "memory(GiB)": 46.73, + "nll_loss": 0.37453967332839966, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2362315058708191, + "rewards/margins": 7.911720275878906, + "rewards/rejected": -7.6754889488220215, + "step": 405, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1600714604734257, + "grad_norm": 1.4067364931106567, + "learning_rate": 0.00014395701580955723, + "logits/chosen": -1.2486661672592163, + "logits/rejected": -1.269938349723816, + "logps/chosen": -3.7746410369873047, + "logps/rejected": -95.56806945800781, + "loss": 0.2633632719516754, + "memory(GiB)": 46.73, + "nll_loss": 0.21375316381454468, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5535802841186523, + "rewards/margins": 8.59311580657959, + "rewards/rejected": -8.039534568786621, + "step": 406, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.162929879410451, + "grad_norm": 4.405129909515381, + "learning_rate": 0.00014367291298733178, + "logits/chosen": -1.2451786994934082, + "logits/rejected": -1.2523881196975708, + "logps/chosen": -7.29015588760376, + "logps/rejected": -84.21794128417969, + "loss": 0.31225040555000305, + "memory(GiB)": 46.73, + "nll_loss": 0.2892824411392212, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44759562611579895, + "rewards/margins": 7.486978530883789, + "rewards/rejected": -7.0393829345703125, + "step": 407, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1657882983474765, + "grad_norm": 1.350124716758728, + "learning_rate": 0.00014338837391175582, + "logits/chosen": -1.2725536823272705, + "logits/rejected": -1.2896746397018433, + "logps/chosen": -3.57419490814209, + "logps/rejected": -94.1634750366211, + "loss": 0.3036032021045685, + "memory(GiB)": 46.73, + "nll_loss": 0.27703234553337097, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4453233480453491, + "rewards/margins": 8.459342002868652, + "rewards/rejected": -8.014019966125488, + "step": 408, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.168646717284502, + "grad_norm": 2.680598497390747, + "learning_rate": 0.00014310340142512028, + "logits/chosen": -1.2726447582244873, + "logits/rejected": -1.2849714756011963, + "logps/chosen": -4.487876892089844, + "logps/rejected": -105.97708129882812, + "loss": 0.17320063710212708, + "memory(GiB)": 46.73, + "nll_loss": 0.14207664132118225, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2871077358722687, + "rewards/margins": 9.345542907714844, + "rewards/rejected": -9.058435440063477, + "step": 409, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1715051362215274, + "grad_norm": 1.2977643013000488, + "learning_rate": 0.00014281799837404552, + "logits/chosen": -1.2369587421417236, + "logits/rejected": -1.2519880533218384, + "logps/chosen": -3.1722519397735596, + "logps/rejected": -87.6946029663086, + "loss": 0.27433717250823975, + "memory(GiB)": 46.73, + "nll_loss": 0.1756080687046051, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.43238213658332825, + "rewards/margins": 7.913693428039551, + "rewards/rejected": -7.4813103675842285, + "step": 410, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.174363555158553, + "grad_norm": 4.359915256500244, + "learning_rate": 0.00014253216760945283, + "logits/chosen": -1.212538719177246, + "logits/rejected": -1.2241911888122559, + "logps/chosen": -3.465891122817993, + "logps/rejected": -95.1599349975586, + "loss": 0.2568645179271698, + "memory(GiB)": 46.73, + "nll_loss": 0.25212615728378296, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.29171866178512573, + "rewards/margins": 8.463183403015137, + "rewards/rejected": -8.171464920043945, + "step": 411, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1772219740955783, + "grad_norm": 6.41582727432251, + "learning_rate": 0.00014224591198653595, + "logits/chosen": -1.2008682489395142, + "logits/rejected": -1.210702657699585, + "logps/chosen": -7.061485290527344, + "logps/rejected": -72.23047637939453, + "loss": 0.8553668260574341, + "memory(GiB)": 46.73, + "nll_loss": 0.5689457654953003, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.3008919954299927, + "rewards/margins": 6.426004886627197, + "rewards/rejected": -6.125113010406494, + "step": 412, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.1800803930326038, + "grad_norm": 17.078575134277344, + "learning_rate": 0.00014195923436473258, + "logits/chosen": -1.128623127937317, + "logits/rejected": -1.1534677743911743, + "logps/chosen": -2.973088026046753, + "logps/rejected": -94.05462646484375, + "loss": 0.19254088401794434, + "memory(GiB)": 46.73, + "nll_loss": 0.16183622181415558, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37168949842453003, + "rewards/margins": 8.012508392333984, + "rewards/rejected": -7.6408185958862305, + "step": 413, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.1829388119696294, + "grad_norm": 0.7061187624931335, + "learning_rate": 0.00014167213760769588, + "logits/chosen": -1.1624064445495605, + "logits/rejected": -1.1710572242736816, + "logps/chosen": -6.01300048828125, + "logps/rejected": -81.90544891357422, + "loss": 0.28161901235580444, + "memory(GiB)": 46.73, + "nll_loss": 0.24062369763851166, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3918932378292084, + "rewards/margins": 7.115993499755859, + "rewards/rejected": -6.724100112915039, + "step": 414, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1857972309066547, + "grad_norm": 0.8015528321266174, + "learning_rate": 0.00014138462458326568, + "logits/chosen": -1.1726088523864746, + "logits/rejected": -1.1833385229110718, + "logps/chosen": -6.184147834777832, + "logps/rejected": -88.518310546875, + "loss": 0.28720641136169434, + "memory(GiB)": 46.73, + "nll_loss": 0.2499961256980896, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5268177390098572, + "rewards/margins": 7.87477970123291, + "rewards/rejected": -7.347961902618408, + "step": 415, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.1886556498436802, + "grad_norm": 1.2144743204116821, + "learning_rate": 0.00014109669816344004, + "logits/chosen": -1.1292197704315186, + "logits/rejected": -1.1369071006774902, + "logps/chosen": -5.179091930389404, + "logps/rejected": -90.02409362792969, + "loss": 0.289948970079422, + "memory(GiB)": 46.73, + "nll_loss": 0.23118160665035248, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5325126051902771, + "rewards/margins": 8.058305740356445, + "rewards/rejected": -7.525793552398682, + "step": 416, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.1915140687807058, + "grad_norm": 1.0072659254074097, + "learning_rate": 0.0001408083612243465, + "logits/chosen": -1.1827200651168823, + "logits/rejected": -1.2069463729858398, + "logps/chosen": -4.6436967849731445, + "logps/rejected": -106.73895263671875, + "loss": 0.3984032869338989, + "memory(GiB)": 46.73, + "nll_loss": 0.3136874735355377, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.41814562678337097, + "rewards/margins": 9.197477340698242, + "rewards/rejected": -8.779330253601074, + "step": 417, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.194372487717731, + "grad_norm": 53.66329574584961, + "learning_rate": 0.00014051961664621318, + "logits/chosen": -1.1490533351898193, + "logits/rejected": -1.1688562631607056, + "logps/chosen": -4.423655986785889, + "logps/rejected": -97.36763000488281, + "loss": 0.2450760006904602, + "memory(GiB)": 46.73, + "nll_loss": 0.2312186360359192, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6164323091506958, + "rewards/margins": 8.828019142150879, + "rewards/rejected": -8.211586952209473, + "step": 418, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.1972309066547566, + "grad_norm": 3.1319069862365723, + "learning_rate": 0.00014023046731334032, + "logits/chosen": -1.1919033527374268, + "logits/rejected": -1.2038265466690063, + "logps/chosen": -4.850213527679443, + "logps/rejected": -79.25477600097656, + "loss": 0.2641419470310211, + "memory(GiB)": 46.73, + "nll_loss": 0.2136654555797577, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6766065955162048, + "rewards/margins": 7.204361438751221, + "rewards/rejected": -6.527754783630371, + "step": 419, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.2000893255917822, + "grad_norm": 1.0065001249313354, + "learning_rate": 0.00013994091611407112, + "logits/chosen": -1.1787667274475098, + "logits/rejected": -1.2045613527297974, + "logps/chosen": -2.8472421169281006, + "logps/rejected": -105.08712005615234, + "loss": 0.1212020143866539, + "memory(GiB)": 46.73, + "nll_loss": 0.1145675852894783, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3931896686553955, + "rewards/margins": 9.183510780334473, + "rewards/rejected": -8.790321350097656, + "step": 420, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.2029477445288075, + "grad_norm": 2.516078472137451, + "learning_rate": 0.0001396509659407632, + "logits/chosen": -1.2433277368545532, + "logits/rejected": -1.2500237226486206, + "logps/chosen": -3.4099931716918945, + "logps/rejected": -81.68355560302734, + "loss": 0.21662066876888275, + "memory(GiB)": 46.73, + "nll_loss": 0.18431250751018524, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4809565544128418, + "rewards/margins": 7.408727169036865, + "rewards/rejected": -6.927770614624023, + "step": 421, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.205806163465833, + "grad_norm": 1.070208191871643, + "learning_rate": 0.00013936061968975957, + "logits/chosen": -1.2363523244857788, + "logits/rejected": -1.2570617198944092, + "logps/chosen": -4.615940570831299, + "logps/rejected": -93.6010513305664, + "loss": 0.24221770465373993, + "memory(GiB)": 46.73, + "nll_loss": 0.2085483819246292, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5028698444366455, + "rewards/margins": 8.165315628051758, + "rewards/rejected": -7.662446022033691, + "step": 422, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.2086645824028583, + "grad_norm": 0.9709579944610596, + "learning_rate": 0.00013906988026135956, + "logits/chosen": -1.2579833269119263, + "logits/rejected": -1.2686238288879395, + "logps/chosen": -5.4705376625061035, + "logps/rejected": -85.68134307861328, + "loss": 0.3086671531200409, + "memory(GiB)": 46.73, + "nll_loss": 0.2807824909687042, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.42558395862579346, + "rewards/margins": 7.466774940490723, + "rewards/rejected": -7.041190147399902, + "step": 423, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.2115230013398839, + "grad_norm": 1.1192522048950195, + "learning_rate": 0.00013877875055979023, + "logits/chosen": -1.2901450395584106, + "logits/rejected": -1.2925304174423218, + "logps/chosen": -7.668773651123047, + "logps/rejected": -70.98661804199219, + "loss": 0.3631104528903961, + "memory(GiB)": 46.73, + "nll_loss": 0.31808874011039734, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4034600853919983, + "rewards/margins": 6.177216053009033, + "rewards/rejected": -5.7737555503845215, + "step": 424, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2143814202769094, + "grad_norm": 1.203405499458313, + "learning_rate": 0.00013848723349317688, + "logits/chosen": -1.271082878112793, + "logits/rejected": -1.293760061264038, + "logps/chosen": -3.0228474140167236, + "logps/rejected": -106.1806640625, + "loss": 0.17642824351787567, + "memory(GiB)": 46.73, + "nll_loss": 0.16339841485023499, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4982394278049469, + "rewards/margins": 9.563376426696777, + "rewards/rejected": -9.065135955810547, + "step": 425, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2172398392139347, + "grad_norm": 0.8518316745758057, + "learning_rate": 0.00013819533197351438, + "logits/chosen": -1.3219232559204102, + "logits/rejected": -1.3383479118347168, + "logps/chosen": -4.452436447143555, + "logps/rejected": -97.7171859741211, + "loss": 0.2837337553501129, + "memory(GiB)": 46.73, + "nll_loss": 0.2675948739051819, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5727283954620361, + "rewards/margins": 9.178853988647461, + "rewards/rejected": -8.606125831604004, + "step": 426, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2200982581509603, + "grad_norm": 1.294920563697815, + "learning_rate": 0.00013790304891663792, + "logits/chosen": -1.3122917413711548, + "logits/rejected": -1.330684781074524, + "logps/chosen": -2.5727081298828125, + "logps/rejected": -97.04032897949219, + "loss": 0.23420938849449158, + "memory(GiB)": 46.73, + "nll_loss": 0.17399996519088745, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.49123436212539673, + "rewards/margins": 8.5830659866333, + "rewards/rejected": -8.09183120727539, + "step": 427, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2229566770879856, + "grad_norm": 1.3210828304290771, + "learning_rate": 0.00013761038724219388, + "logits/chosen": -1.295900821685791, + "logits/rejected": -1.3054581880569458, + "logps/chosen": -6.279821395874023, + "logps/rejected": -95.39372253417969, + "loss": 0.32580864429473877, + "memory(GiB)": 46.73, + "nll_loss": 0.2732087969779968, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3629838228225708, + "rewards/margins": 8.550825119018555, + "rewards/rejected": -8.187841415405273, + "step": 428, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2258150960250112, + "grad_norm": 2.9985227584838867, + "learning_rate": 0.0001373173498736107, + "logits/chosen": -1.288704752922058, + "logits/rejected": -1.3120356798171997, + "logps/chosen": -4.108103275299072, + "logps/rejected": -98.43057250976562, + "loss": 0.2225966602563858, + "memory(GiB)": 46.73, + "nll_loss": 0.20878230035305023, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6132968664169312, + "rewards/margins": 9.20932388305664, + "rewards/rejected": -8.596027374267578, + "step": 429, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2286735149620367, + "grad_norm": 2.3420937061309814, + "learning_rate": 0.00013702393973806967, + "logits/chosen": -1.2286124229431152, + "logits/rejected": -1.2492600679397583, + "logps/chosen": -5.495055675506592, + "logps/rejected": -83.2303237915039, + "loss": 0.22717006504535675, + "memory(GiB)": 46.73, + "nll_loss": 0.20513629913330078, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5127463936805725, + "rewards/margins": 7.726105690002441, + "rewards/rejected": -7.213359832763672, + "step": 430, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.231531933899062, + "grad_norm": 0.8680245280265808, + "learning_rate": 0.00013673015976647568, + "logits/chosen": -1.2850875854492188, + "logits/rejected": -1.2913092374801636, + "logps/chosen": -6.471378803253174, + "logps/rejected": -87.43525695800781, + "loss": 0.29818040132522583, + "memory(GiB)": 46.73, + "nll_loss": 0.25542551279067993, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6377506852149963, + "rewards/margins": 8.0104398727417, + "rewards/rejected": -7.372689247131348, + "step": 431, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2343903528360876, + "grad_norm": 1.0749446153640747, + "learning_rate": 0.00013643601289342803, + "logits/chosen": -1.2721213102340698, + "logits/rejected": -1.2773966789245605, + "logps/chosen": -3.4057223796844482, + "logps/rejected": -91.22700500488281, + "loss": 0.1517515331506729, + "memory(GiB)": 46.73, + "nll_loss": 0.14677660167217255, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40595370531082153, + "rewards/margins": 8.496070861816406, + "rewards/rejected": -8.090116500854492, + "step": 432, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.237248771773113, + "grad_norm": 0.8742938041687012, + "learning_rate": 0.00013614150205719085, + "logits/chosen": -1.3097087144851685, + "logits/rejected": -1.3255422115325928, + "logps/chosen": -3.3428828716278076, + "logps/rejected": -112.81401824951172, + "loss": 0.14485226571559906, + "memory(GiB)": 46.73, + "nll_loss": 0.12631869316101074, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.47337648272514343, + "rewards/margins": 10.406147956848145, + "rewards/rejected": -9.932769775390625, + "step": 433, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2401071907101384, + "grad_norm": 0.7771469354629517, + "learning_rate": 0.00013584663019966417, + "logits/chosen": -1.2172707319259644, + "logits/rejected": -1.2154616117477417, + "logps/chosen": -7.059861183166504, + "logps/rejected": -87.25150299072266, + "loss": 0.34314751625061035, + "memory(GiB)": 46.73, + "nll_loss": 0.28513815999031067, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.28648173809051514, + "rewards/margins": 7.758938789367676, + "rewards/rejected": -7.472456932067871, + "step": 434, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.242965609647164, + "grad_norm": 6.615478038787842, + "learning_rate": 0.00013555140026635414, + "logits/chosen": -1.2565209865570068, + "logits/rejected": -1.264001488685608, + "logps/chosen": -7.7678656578063965, + "logps/rejected": -102.24252319335938, + "loss": 0.13871826231479645, + "memory(GiB)": 46.73, + "nll_loss": 0.13072122633457184, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6000977754592896, + "rewards/margins": 9.453453063964844, + "rewards/rejected": -8.853355407714844, + "step": 435, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2458240285841893, + "grad_norm": 0.5910543203353882, + "learning_rate": 0.00013525581520634381, + "logits/chosen": -1.194077491760254, + "logits/rejected": -1.211206078529358, + "logps/chosen": -6.643336296081543, + "logps/rejected": -95.53460693359375, + "loss": 0.3519570529460907, + "memory(GiB)": 46.73, + "nll_loss": 0.33618804812431335, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7547551989555359, + "rewards/margins": 8.722167015075684, + "rewards/rejected": -7.967411518096924, + "step": 436, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2486824475212148, + "grad_norm": 1.195341944694519, + "learning_rate": 0.0001349598779722636, + "logits/chosen": -1.2183115482330322, + "logits/rejected": -1.2236500978469849, + "logps/chosen": -6.876954555511475, + "logps/rejected": -88.98007202148438, + "loss": 0.2813359200954437, + "memory(GiB)": 46.73, + "nll_loss": 0.2684388756752014, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3353041410446167, + "rewards/margins": 7.750663757324219, + "rewards/rejected": -7.4153594970703125, + "step": 437, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2515408664582404, + "grad_norm": 0.872073233127594, + "learning_rate": 0.00013466359152026195, + "logits/chosen": -1.2435060739517212, + "logits/rejected": -1.2493698596954346, + "logps/chosen": -7.454791069030762, + "logps/rejected": -85.75321960449219, + "loss": 0.2809821367263794, + "memory(GiB)": 46.73, + "nll_loss": 0.2567462623119354, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3945457637310028, + "rewards/margins": 7.449971675872803, + "rewards/rejected": -7.055425643920898, + "step": 438, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2543992853952657, + "grad_norm": 1.6541284322738647, + "learning_rate": 0.00013436695880997553, + "logits/chosen": -1.256369948387146, + "logits/rejected": -1.2683699131011963, + "logps/chosen": -5.130362510681152, + "logps/rejected": -94.84146881103516, + "loss": 0.3861837387084961, + "memory(GiB)": 46.73, + "nll_loss": 0.35058313608169556, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4951009154319763, + "rewards/margins": 8.740049362182617, + "rewards/rejected": -8.24494743347168, + "step": 439, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2572577043322912, + "grad_norm": 0.8177284002304077, + "learning_rate": 0.00013406998280449987, + "logits/chosen": -1.2140347957611084, + "logits/rejected": -1.222559928894043, + "logps/chosen": -4.193092346191406, + "logps/rejected": -86.39996337890625, + "loss": 0.27863699197769165, + "memory(GiB)": 46.73, + "nll_loss": 0.25425273180007935, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48477423191070557, + "rewards/margins": 8.047656059265137, + "rewards/rejected": -7.562881946563721, + "step": 440, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2601161232693165, + "grad_norm": 1.945068120956421, + "learning_rate": 0.00013377266647035974, + "logits/chosen": -1.201490879058838, + "logits/rejected": -1.2190073728561401, + "logps/chosen": -3.4713282585144043, + "logps/rejected": -91.55570983886719, + "loss": 0.24121132493019104, + "memory(GiB)": 46.73, + "nll_loss": 0.19668132066726685, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4186343848705292, + "rewards/margins": 8.065241813659668, + "rewards/rejected": -7.646607398986816, + "step": 441, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.262974542206342, + "grad_norm": 29.868745803833008, + "learning_rate": 0.00013347501277747955, + "logits/chosen": -1.241868495941162, + "logits/rejected": -1.255920171737671, + "logps/chosen": -2.4936649799346924, + "logps/rejected": -94.12937927246094, + "loss": 0.22337190806865692, + "memory(GiB)": 46.73, + "nll_loss": 0.1589697301387787, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3206178545951843, + "rewards/margins": 8.269994735717773, + "rewards/rejected": -7.949377536773682, + "step": 442, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.2658329611433676, + "grad_norm": 0.6225547194480896, + "learning_rate": 0.0001331770246991534, + "logits/chosen": -1.2288497686386108, + "logits/rejected": -1.2424108982086182, + "logps/chosen": -7.412257194519043, + "logps/rejected": -98.60154724121094, + "loss": 0.3624575436115265, + "memory(GiB)": 46.73, + "nll_loss": 0.3274103105068207, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6840518116950989, + "rewards/margins": 9.37939739227295, + "rewards/rejected": -8.695345878601074, + "step": 443, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.268691380080393, + "grad_norm": 40.07108688354492, + "learning_rate": 0.00013287870521201583, + "logits/chosen": -1.2206084728240967, + "logits/rejected": -1.2286522388458252, + "logps/chosen": -5.912662982940674, + "logps/rejected": -107.58220672607422, + "loss": 0.2583864629268646, + "memory(GiB)": 46.73, + "nll_loss": 0.22890999913215637, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.540444552898407, + "rewards/margins": 9.795575141906738, + "rewards/rejected": -9.255130767822266, + "step": 444, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2715497990174185, + "grad_norm": 0.7341138124465942, + "learning_rate": 0.00013258005729601177, + "logits/chosen": -1.211508870124817, + "logits/rejected": -1.2124762535095215, + "logps/chosen": -6.125351428985596, + "logps/rejected": -97.78089904785156, + "loss": 0.2630341053009033, + "memory(GiB)": 46.73, + "nll_loss": 0.21238940954208374, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3658996820449829, + "rewards/margins": 9.0274019241333, + "rewards/rejected": -8.66150188446045, + "step": 445, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.274408217954444, + "grad_norm": 1.2155957221984863, + "learning_rate": 0.00013228108393436685, + "logits/chosen": -1.1720253229141235, + "logits/rejected": -1.182066798210144, + "logps/chosen": -5.76838493347168, + "logps/rejected": -82.00324249267578, + "loss": 0.4643992483615875, + "memory(GiB)": 46.73, + "nll_loss": 0.40862181782722473, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5143325924873352, + "rewards/margins": 7.507829666137695, + "rewards/rejected": -6.993496894836426, + "step": 446, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2772666368914694, + "grad_norm": 6.123267650604248, + "learning_rate": 0.0001319817881135576, + "logits/chosen": -1.2267619371414185, + "logits/rejected": -1.2333106994628906, + "logps/chosen": -5.525717258453369, + "logps/rejected": -93.48272705078125, + "loss": 0.4229140281677246, + "memory(GiB)": 46.73, + "nll_loss": 0.36744216084480286, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.34462982416152954, + "rewards/margins": 8.51840591430664, + "rewards/rejected": -8.173775672912598, + "step": 447, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.280125055828495, + "grad_norm": 36.35102462768555, + "learning_rate": 0.00013168217282328174, + "logits/chosen": -1.244513988494873, + "logits/rejected": -1.2543288469314575, + "logps/chosen": -3.243824005126953, + "logps/rejected": -103.88795471191406, + "loss": 0.19224901497364044, + "memory(GiB)": 46.73, + "nll_loss": 0.13676151633262634, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4578501582145691, + "rewards/margins": 9.796440124511719, + "rewards/rejected": -9.33858871459961, + "step": 448, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2829834747655204, + "grad_norm": 0.7684857249259949, + "learning_rate": 0.00013138224105642803, + "logits/chosen": -1.2897181510925293, + "logits/rejected": -1.3069959878921509, + "logps/chosen": -2.2601726055145264, + "logps/rejected": -117.00337219238281, + "loss": 0.12171882390975952, + "memory(GiB)": 46.73, + "nll_loss": 0.10878898203372955, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.47879016399383545, + "rewards/margins": 10.791764259338379, + "rewards/rejected": -10.312973976135254, + "step": 449, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2858418937025458, + "grad_norm": 1.1565505266189575, + "learning_rate": 0.00013108199580904667, + "logits/chosen": -1.2609070539474487, + "logits/rejected": -1.2832667827606201, + "logps/chosen": -3.7138025760650635, + "logps/rejected": -120.03974914550781, + "loss": 0.2552796006202698, + "memory(GiB)": 46.73, + "nll_loss": 0.2516552209854126, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3557589054107666, + "rewards/margins": 11.129087448120117, + "rewards/rejected": -10.773327827453613, + "step": 450, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.2887003126395713, + "grad_norm": 1.058509111404419, + "learning_rate": 0.00013078144008031923, + "logits/chosen": -1.2376177310943604, + "logits/rejected": -1.254594087600708, + "logps/chosen": -4.495041370391846, + "logps/rejected": -103.95249938964844, + "loss": 0.24078714847564697, + "memory(GiB)": 46.73, + "nll_loss": 0.22126168012619019, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6826871037483215, + "rewards/margins": 9.435651779174805, + "rewards/rejected": -8.752964973449707, + "step": 451, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.2915587315765966, + "grad_norm": 1.2536028623580933, + "learning_rate": 0.00013048057687252865, + "logits/chosen": -1.2278149127960205, + "logits/rejected": -1.2435705661773682, + "logps/chosen": -5.1287713050842285, + "logps/rejected": -108.75577545166016, + "loss": 0.2327510118484497, + "memory(GiB)": 46.73, + "nll_loss": 0.1934833973646164, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3743947446346283, + "rewards/margins": 9.591495513916016, + "rewards/rejected": -9.217100143432617, + "step": 452, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.2944171505136222, + "grad_norm": 1.1801437139511108, + "learning_rate": 0.0001301794091910294, + "logits/chosen": -1.1996853351593018, + "logits/rejected": -1.212232232093811, + "logps/chosen": -5.606900691986084, + "logps/rejected": -97.51220703125, + "loss": 0.226387158036232, + "memory(GiB)": 46.73, + "nll_loss": 0.18147651851177216, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.35863998532295227, + "rewards/margins": 8.822105407714844, + "rewards/rejected": -8.46346664428711, + "step": 453, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.2972755694506475, + "grad_norm": 0.8085012435913086, + "learning_rate": 0.00012987794004421738, + "logits/chosen": -1.2282167673110962, + "logits/rejected": -1.2483009099960327, + "logps/chosen": -6.084074974060059, + "logps/rejected": -116.71503448486328, + "loss": 0.7732155919075012, + "memory(GiB)": 46.73, + "nll_loss": 0.7598755359649658, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.24433200061321259, + "rewards/margins": 10.193436622619629, + "rewards/rejected": -9.949104309082031, + "step": 454, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.300133988387673, + "grad_norm": 6.514425754547119, + "learning_rate": 0.0001295761724434997, + "logits/chosen": -1.2512998580932617, + "logits/rejected": -1.2541574239730835, + "logps/chosen": -4.655600547790527, + "logps/rejected": -101.07491302490234, + "loss": 0.23648858070373535, + "memory(GiB)": 46.73, + "nll_loss": 0.20019900798797607, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5059707760810852, + "rewards/margins": 9.593456268310547, + "rewards/rejected": -9.087486267089844, + "step": 455, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3029924073246986, + "grad_norm": 0.8636030554771423, + "learning_rate": 0.00012927410940326487, + "logits/chosen": -1.207863211631775, + "logits/rejected": -1.2212624549865723, + "logps/chosen": -7.982148170471191, + "logps/rejected": -98.51473999023438, + "loss": 0.35097599029541016, + "memory(GiB)": 46.73, + "nll_loss": 0.3070108890533447, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5857585072517395, + "rewards/margins": 9.116013526916504, + "rewards/rejected": -8.530255317687988, + "step": 456, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3058508262617239, + "grad_norm": 0.9966700673103333, + "learning_rate": 0.00012897175394085267, + "logits/chosen": -1.1829395294189453, + "logits/rejected": -1.2041140794754028, + "logps/chosen": -5.4352827072143555, + "logps/rejected": -98.21609497070312, + "loss": 0.21705986559391022, + "memory(GiB)": 46.73, + "nll_loss": 0.20047500729560852, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.58429354429245, + "rewards/margins": 9.176396369934082, + "rewards/rejected": -8.592103004455566, + "step": 457, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3087092451987494, + "grad_norm": 2.171597480773926, + "learning_rate": 0.00012866910907652373, + "logits/chosen": -1.1633059978485107, + "logits/rejected": -1.1853255033493042, + "logps/chosen": -5.978604316711426, + "logps/rejected": -105.99617004394531, + "loss": 0.2683447301387787, + "memory(GiB)": 46.73, + "nll_loss": 0.2629088759422302, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.42330706119537354, + "rewards/margins": 9.704293251037598, + "rewards/rejected": -9.280985832214355, + "step": 458, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.311567664135775, + "grad_norm": 1.2772369384765625, + "learning_rate": 0.0001283661778334297, + "logits/chosen": -1.1277825832366943, + "logits/rejected": -1.134521245956421, + "logps/chosen": -5.945641994476318, + "logps/rejected": -83.91475677490234, + "loss": 0.22780606150627136, + "memory(GiB)": 46.73, + "nll_loss": 0.1669580340385437, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.39180228114128113, + "rewards/margins": 7.6563615798950195, + "rewards/rejected": -7.264558792114258, + "step": 459, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3144260830728003, + "grad_norm": 1.3344827890396118, + "learning_rate": 0.00012806296323758274, + "logits/chosen": -1.1059662103652954, + "logits/rejected": -1.1256768703460693, + "logps/chosen": -4.297776699066162, + "logps/rejected": -115.46197509765625, + "loss": 0.21040144562721252, + "memory(GiB)": 46.73, + "nll_loss": 0.16639991104602814, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3483891189098358, + "rewards/margins": 10.405756950378418, + "rewards/rejected": -10.057367324829102, + "step": 460, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3172845020098258, + "grad_norm": 0.9670249223709106, + "learning_rate": 0.00012775946831782565, + "logits/chosen": -1.1543110609054565, + "logits/rejected": -1.1647398471832275, + "logps/chosen": -3.428140878677368, + "logps/rejected": -97.68719482421875, + "loss": 0.1907050460577011, + "memory(GiB)": 46.73, + "nll_loss": 0.17807704210281372, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5219950079917908, + "rewards/margins": 9.163191795349121, + "rewards/rejected": -8.641196250915527, + "step": 461, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3201429209468514, + "grad_norm": 2.3520402908325195, + "learning_rate": 0.0001274556961058012, + "logits/chosen": -1.158630132675171, + "logits/rejected": -1.1693530082702637, + "logps/chosen": -5.620915412902832, + "logps/rejected": -87.42037200927734, + "loss": 0.20385050773620605, + "memory(GiB)": 46.73, + "nll_loss": 0.1741238236427307, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.455614298582077, + "rewards/margins": 8.124811172485352, + "rewards/rejected": -7.669197082519531, + "step": 462, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3230013398838767, + "grad_norm": 2.3216702938079834, + "learning_rate": 0.00012715164963592228, + "logits/chosen": -1.0936330556869507, + "logits/rejected": -1.1035964488983154, + "logps/chosen": -4.416335582733154, + "logps/rejected": -96.47249603271484, + "loss": 0.2630074620246887, + "memory(GiB)": 46.73, + "nll_loss": 0.18668687343597412, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4110918939113617, + "rewards/margins": 8.527597427368164, + "rewards/rejected": -8.116504669189453, + "step": 463, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3258597588209022, + "grad_norm": 0.8408026099205017, + "learning_rate": 0.0001268473319453412, + "logits/chosen": -1.1004345417022705, + "logits/rejected": -1.1184501647949219, + "logps/chosen": -2.8537232875823975, + "logps/rejected": -102.44168853759766, + "loss": 0.23740537464618683, + "memory(GiB)": 46.73, + "nll_loss": 0.1830265074968338, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4311729073524475, + "rewards/margins": 9.219640731811523, + "rewards/rejected": -8.788467407226562, + "step": 464, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3287181777579278, + "grad_norm": 1.450626254081726, + "learning_rate": 0.00012654274607391957, + "logits/chosen": -1.1033786535263062, + "logits/rejected": -1.1105170249938965, + "logps/chosen": -6.705106735229492, + "logps/rejected": -87.78504943847656, + "loss": 0.46575862169265747, + "memory(GiB)": 46.73, + "nll_loss": 0.4206477999687195, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7023568153381348, + "rewards/margins": 8.287105560302734, + "rewards/rejected": -7.584749221801758, + "step": 465, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.331576596694953, + "grad_norm": 12.825742721557617, + "learning_rate": 0.0001262378950641979, + "logits/chosen": -1.1069098711013794, + "logits/rejected": -1.1303209066390991, + "logps/chosen": -3.534313678741455, + "logps/rejected": -100.05030059814453, + "loss": 0.22773195803165436, + "memory(GiB)": 46.73, + "nll_loss": 0.19116878509521484, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.40268319845199585, + "rewards/margins": 8.56247615814209, + "rewards/rejected": -8.159791946411133, + "step": 466, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3344350156319786, + "grad_norm": 1.016136884689331, + "learning_rate": 0.00012593278196136525, + "logits/chosen": -1.1097503900527954, + "logits/rejected": -1.1294606924057007, + "logps/chosen": -5.523367404937744, + "logps/rejected": -90.66973876953125, + "loss": 0.28550341725349426, + "memory(GiB)": 46.73, + "nll_loss": 0.23537136614322662, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3222227394580841, + "rewards/margins": 7.817280292510986, + "rewards/rejected": -7.495058059692383, + "step": 467, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.337293434569004, + "grad_norm": 1.0535191297531128, + "learning_rate": 0.00012562740981322864, + "logits/chosen": -1.1334688663482666, + "logits/rejected": -1.1453745365142822, + "logps/chosen": -3.900404214859009, + "logps/rejected": -112.88008880615234, + "loss": 0.22159262001514435, + "memory(GiB)": 46.73, + "nll_loss": 0.1639210730791092, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5866712331771851, + "rewards/margins": 10.50623607635498, + "rewards/rejected": -9.919564247131348, + "step": 468, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3401518535060295, + "grad_norm": 1.8240563869476318, + "learning_rate": 0.00012532178167018283, + "logits/chosen": -1.0918580293655396, + "logits/rejected": -1.0988843441009521, + "logps/chosen": -5.854885101318359, + "logps/rejected": -100.22276306152344, + "loss": 0.2839359641075134, + "memory(GiB)": 46.73, + "nll_loss": 0.2657544016838074, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5278545022010803, + "rewards/margins": 9.356338500976562, + "rewards/rejected": -8.828485488891602, + "step": 469, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3430102724430548, + "grad_norm": 0.8436217904090881, + "learning_rate": 0.00012501590058517964, + "logits/chosen": -1.1500940322875977, + "logits/rejected": -1.1596763134002686, + "logps/chosen": -3.293513298034668, + "logps/rejected": -106.26544189453125, + "loss": 0.13652381300926208, + "memory(GiB)": 46.73, + "nll_loss": 0.13459700345993042, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5411785244941711, + "rewards/margins": 9.85307502746582, + "rewards/rejected": -9.311896324157715, + "step": 470, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3458686913800804, + "grad_norm": 0.550817608833313, + "learning_rate": 0.00012470976961369764, + "logits/chosen": -1.1057863235473633, + "logits/rejected": -1.1126328706741333, + "logps/chosen": -5.491030693054199, + "logps/rejected": -106.27851104736328, + "loss": 0.19622550904750824, + "memory(GiB)": 46.73, + "nll_loss": 0.1904832124710083, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49577879905700684, + "rewards/margins": 9.822453498840332, + "rewards/rejected": -9.32667350769043, + "step": 471, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.348727110317106, + "grad_norm": 4.487310409545898, + "learning_rate": 0.00012440339181371148, + "logits/chosen": -1.1322486400604248, + "logits/rejected": -1.1392649412155151, + "logps/chosen": -3.9112868309020996, + "logps/rejected": -90.61821746826172, + "loss": 0.28306886553764343, + "memory(GiB)": 46.73, + "nll_loss": 0.27220627665519714, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5206503868103027, + "rewards/margins": 8.518290519714355, + "rewards/rejected": -7.9976396560668945, + "step": 472, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3515855292541312, + "grad_norm": 1.0256805419921875, + "learning_rate": 0.00012409677024566144, + "logits/chosen": -1.157659888267517, + "logits/rejected": -1.160758376121521, + "logps/chosen": -5.508733749389648, + "logps/rejected": -99.47381591796875, + "loss": 0.3204554319381714, + "memory(GiB)": 46.73, + "nll_loss": 0.2864115238189697, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5594931840896606, + "rewards/margins": 9.383455276489258, + "rewards/rejected": -8.823962211608887, + "step": 473, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3544439481911568, + "grad_norm": 68.41111755371094, + "learning_rate": 0.00012378990797242285, + "logits/chosen": -1.1831049919128418, + "logits/rejected": -1.1902449131011963, + "logps/chosen": -2.946296453475952, + "logps/rejected": -92.81370544433594, + "loss": 0.22099502384662628, + "memory(GiB)": 46.73, + "nll_loss": 0.20321857929229736, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44311076402664185, + "rewards/margins": 8.712024688720703, + "rewards/rejected": -8.268914222717285, + "step": 474, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3573023671281823, + "grad_norm": 1.3782514333724976, + "learning_rate": 0.00012348280805927542, + "logits/chosen": -1.1564871072769165, + "logits/rejected": -1.1731786727905273, + "logps/chosen": -5.935349941253662, + "logps/rejected": -107.916748046875, + "loss": 0.23125052452087402, + "memory(GiB)": 46.73, + "nll_loss": 0.22499611973762512, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4560752511024475, + "rewards/margins": 9.845476150512695, + "rewards/rejected": -9.389402389526367, + "step": 475, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 1.3601607860652076, + "grad_norm": 0.8205835819244385, + "learning_rate": 0.00012317547357387263, + "logits/chosen": -1.1861202716827393, + "logits/rejected": -1.2027050256729126, + "logps/chosen": -2.852313280105591, + "logps/rejected": -117.19053649902344, + "loss": 0.1630171239376068, + "memory(GiB)": 46.73, + "nll_loss": 0.13181191682815552, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2925358712673187, + "rewards/margins": 10.786885261535645, + "rewards/rejected": -10.49435043334961, + "step": 476, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3630192050022332, + "grad_norm": 0.634852409362793, + "learning_rate": 0.00012286790758621132, + "logits/chosen": -1.1698333024978638, + "logits/rejected": -1.1889692544937134, + "logps/chosen": -2.567922592163086, + "logps/rejected": -109.34284210205078, + "loss": 0.1461510807275772, + "memory(GiB)": 46.73, + "nll_loss": 0.13811776041984558, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5183812379837036, + "rewards/margins": 10.025300979614258, + "rewards/rejected": -9.506919860839844, + "step": 477, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3658776239392587, + "grad_norm": 0.9790384769439697, + "learning_rate": 0.00012256011316860057, + "logits/chosen": -1.1823296546936035, + "logits/rejected": -1.196981430053711, + "logps/chosen": -5.172409534454346, + "logps/rejected": -119.36044311523438, + "loss": 0.30066153407096863, + "memory(GiB)": 46.73, + "nll_loss": 0.29738298058509827, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40812885761260986, + "rewards/margins": 10.934396743774414, + "rewards/rejected": -10.526268005371094, + "step": 478, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.368736042876284, + "grad_norm": 0.8576183915138245, + "learning_rate": 0.00012225209339563145, + "logits/chosen": -1.208139181137085, + "logits/rejected": -1.2124953269958496, + "logps/chosen": -3.6746914386749268, + "logps/rejected": -101.1004867553711, + "loss": 0.3288338780403137, + "memory(GiB)": 46.73, + "nll_loss": 0.24615323543548584, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.3690415024757385, + "rewards/margins": 9.413076400756836, + "rewards/rejected": -9.044034957885742, + "step": 479, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3715944618133096, + "grad_norm": 9.197681427001953, + "learning_rate": 0.00012194385134414608, + "logits/chosen": -1.2143265008926392, + "logits/rejected": -1.2214550971984863, + "logps/chosen": -5.161376476287842, + "logps/rejected": -125.9130630493164, + "loss": 0.2579571604728699, + "memory(GiB)": 46.73, + "nll_loss": 0.1970270872116089, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6949900388717651, + "rewards/margins": 11.783352851867676, + "rewards/rejected": -11.088363647460938, + "step": 480, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.374452880750335, + "grad_norm": 1.8511130809783936, + "learning_rate": 0.0001216353900932069, + "logits/chosen": -1.1562559604644775, + "logits/rejected": -1.168640375137329, + "logps/chosen": -5.439113140106201, + "logps/rejected": -96.33733367919922, + "loss": 0.3344132602214813, + "memory(GiB)": 46.73, + "nll_loss": 0.27547821402549744, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4759036898612976, + "rewards/margins": 8.769606590270996, + "rewards/rejected": -8.293703079223633, + "step": 481, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 1.3773112996873604, + "grad_norm": 1.9160902500152588, + "learning_rate": 0.00012132671272406604, + "logits/chosen": -1.194909691810608, + "logits/rejected": -1.2107833623886108, + "logps/chosen": -2.7277703285217285, + "logps/rejected": -127.53395080566406, + "loss": 0.1612652838230133, + "memory(GiB)": 46.73, + "nll_loss": 0.14807657897472382, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6826515197753906, + "rewards/margins": 12.036901473999023, + "rewards/rejected": -11.354249954223633, + "step": 482, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3801697186243858, + "grad_norm": 1.5948599576950073, + "learning_rate": 0.00012101782232013436, + "logits/chosen": -1.220342755317688, + "logits/rejected": -1.2318834066390991, + "logps/chosen": -3.2254557609558105, + "logps/rejected": -120.2594985961914, + "loss": 0.247829407453537, + "memory(GiB)": 46.73, + "nll_loss": 0.17633874714374542, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3721011281013489, + "rewards/margins": 11.143303871154785, + "rewards/rejected": -10.771202087402344, + "step": 483, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3830281375614113, + "grad_norm": 29.203384399414062, + "learning_rate": 0.00012070872196695089, + "logits/chosen": -1.218416690826416, + "logits/rejected": -1.2325859069824219, + "logps/chosen": -4.859478950500488, + "logps/rejected": -124.26551818847656, + "loss": 0.25711649656295776, + "memory(GiB)": 46.73, + "nll_loss": 0.2555963695049286, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.731487512588501, + "rewards/margins": 11.709962844848633, + "rewards/rejected": -10.978474617004395, + "step": 484, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3858865564984368, + "grad_norm": 0.7737511396408081, + "learning_rate": 0.00012039941475215169, + "logits/chosen": -1.2052494287490845, + "logits/rejected": -1.2190189361572266, + "logps/chosen": -5.294344425201416, + "logps/rejected": -117.8834457397461, + "loss": 0.22346262633800507, + "memory(GiB)": 46.73, + "nll_loss": 0.19474081695079803, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3596336841583252, + "rewards/margins": 10.600529670715332, + "rewards/rejected": -10.240897178649902, + "step": 485, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3887449754354622, + "grad_norm": 0.8315601944923401, + "learning_rate": 0.0001200899037654393, + "logits/chosen": -1.2053380012512207, + "logits/rejected": -1.216891884803772, + "logps/chosen": -4.783374786376953, + "logps/rejected": -118.34504699707031, + "loss": 0.2385406792163849, + "memory(GiB)": 46.73, + "nll_loss": 0.21562349796295166, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41789931058883667, + "rewards/margins": 10.679019927978516, + "rewards/rejected": -10.261120796203613, + "step": 486, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3916033943724877, + "grad_norm": 0.9283787608146667, + "learning_rate": 0.00011978019209855174, + "logits/chosen": -1.2077966928482056, + "logits/rejected": -1.2322336435317993, + "logps/chosen": -4.940117359161377, + "logps/rejected": -145.7559051513672, + "loss": 0.19998067617416382, + "memory(GiB)": 46.73, + "nll_loss": 0.19920994341373444, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44787928462028503, + "rewards/margins": 13.026336669921875, + "rewards/rejected": -12.57845687866211, + "step": 487, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3944618133095132, + "grad_norm": 0.5662634372711182, + "learning_rate": 0.0001194702828452316, + "logits/chosen": -1.1853432655334473, + "logits/rejected": -1.1943426132202148, + "logps/chosen": -7.898364067077637, + "logps/rejected": -121.61571502685547, + "loss": 0.2524011433124542, + "memory(GiB)": 46.73, + "nll_loss": 0.22587642073631287, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3780076503753662, + "rewards/margins": 10.995363235473633, + "rewards/rejected": -10.617354393005371, + "step": 488, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.3973202322465386, + "grad_norm": 0.8601922988891602, + "learning_rate": 0.00011916017910119524, + "logits/chosen": -1.1929762363433838, + "logits/rejected": -1.2090179920196533, + "logps/chosen": -2.50203800201416, + "logps/rejected": -121.39696502685547, + "loss": 0.23803545534610748, + "memory(GiB)": 46.73, + "nll_loss": 0.1482609063386917, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.4478917121887207, + "rewards/margins": 11.308920860290527, + "rewards/rejected": -10.861029624938965, + "step": 489, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.400178651183564, + "grad_norm": 0.647240161895752, + "learning_rate": 0.0001188498839641018, + "logits/chosen": -1.2096933126449585, + "logits/rejected": -1.2204294204711914, + "logps/chosen": -2.4534082412719727, + "logps/rejected": -122.79830932617188, + "loss": 0.1649751216173172, + "memory(GiB)": 46.73, + "nll_loss": 0.1564660668373108, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44028615951538086, + "rewards/margins": 11.581570625305176, + "rewards/rejected": -11.141283988952637, + "step": 490, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.4030370701205896, + "grad_norm": 0.7389304041862488, + "learning_rate": 0.0001185394005335222, + "logits/chosen": -1.220829963684082, + "logits/rejected": -1.2447903156280518, + "logps/chosen": -8.018527030944824, + "logps/rejected": -111.50892639160156, + "loss": 0.4398428201675415, + "memory(GiB)": 46.73, + "nll_loss": 0.376664400100708, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3774624168872833, + "rewards/margins": 10.216268539428711, + "rewards/rejected": -9.838805198669434, + "step": 491, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.405895489057615, + "grad_norm": 2.56008243560791, + "learning_rate": 0.00011822873191090833, + "logits/chosen": -1.2262274026870728, + "logits/rejected": -1.2465121746063232, + "logps/chosen": -5.929446220397949, + "logps/rejected": -121.01249694824219, + "loss": 0.2873122990131378, + "memory(GiB)": 46.73, + "nll_loss": 0.2807019352912903, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8018953204154968, + "rewards/margins": 11.267487525939941, + "rewards/rejected": -10.465591430664062, + "step": 492, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.4087539079946405, + "grad_norm": 2.76714825630188, + "learning_rate": 0.0001179178811995619, + "logits/chosen": -1.245976448059082, + "logits/rejected": -1.2665190696716309, + "logps/chosen": -2.6952478885650635, + "logps/rejected": -131.0043182373047, + "loss": 0.13283787667751312, + "memory(GiB)": 46.73, + "nll_loss": 0.13157594203948975, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4866657853126526, + "rewards/margins": 12.227144241333008, + "rewards/rejected": -11.740479469299316, + "step": 493, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.411612326931666, + "grad_norm": 0.5778344869613647, + "learning_rate": 0.00011760685150460362, + "logits/chosen": -1.2286800146102905, + "logits/rejected": -1.2474695444107056, + "logps/chosen": -3.507291316986084, + "logps/rejected": -118.04898071289062, + "loss": 0.19644924998283386, + "memory(GiB)": 46.73, + "nll_loss": 0.1547624170780182, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5787097215652466, + "rewards/margins": 10.566407203674316, + "rewards/rejected": -9.98769760131836, + "step": 494, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.4144707458686914, + "grad_norm": 0.9482585787773132, + "learning_rate": 0.00011729564593294202, + "logits/chosen": -1.2618703842163086, + "logits/rejected": -1.2679365873336792, + "logps/chosen": -6.621640205383301, + "logps/rejected": -90.37300872802734, + "loss": 0.3605477511882782, + "memory(GiB)": 46.73, + "nll_loss": 0.2856094539165497, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6681168079376221, + "rewards/margins": 8.50804328918457, + "rewards/rejected": -7.839926719665527, + "step": 495, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.417329164805717, + "grad_norm": 1.035208821296692, + "learning_rate": 0.0001169842675932425, + "logits/chosen": -1.2108497619628906, + "logits/rejected": -1.2162362337112427, + "logps/chosen": -11.794290542602539, + "logps/rejected": -116.32825469970703, + "loss": 1.0830345153808594, + "memory(GiB)": 46.73, + "nll_loss": 0.856827974319458, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.44471532106399536, + "rewards/margins": 10.643159866333008, + "rewards/rejected": -10.198444366455078, + "step": 496, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4201875837427422, + "grad_norm": 89.72486877441406, + "learning_rate": 0.00011667271959589623, + "logits/chosen": -1.2603520154953003, + "logits/rejected": -1.280098557472229, + "logps/chosen": -5.925300121307373, + "logps/rejected": -112.99394226074219, + "loss": 0.4769900143146515, + "memory(GiB)": 46.73, + "nll_loss": 0.32546478509902954, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5293501615524292, + "rewards/margins": 10.35472297668457, + "rewards/rejected": -9.825372695922852, + "step": 497, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4230460026797678, + "grad_norm": 23.98358154296875, + "learning_rate": 0.00011636100505298917, + "logits/chosen": -1.1377421617507935, + "logits/rejected": -1.155126690864563, + "logps/chosen": -5.637790203094482, + "logps/rejected": -107.21414947509766, + "loss": 0.2201746255159378, + "memory(GiB)": 46.73, + "nll_loss": 0.19926278293132782, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.39236244559288025, + "rewards/margins": 9.218107223510742, + "rewards/rejected": -8.82574462890625, + "step": 498, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.425904421616793, + "grad_norm": 1.3702232837677002, + "learning_rate": 0.00011604912707827083, + "logits/chosen": -1.1983606815338135, + "logits/rejected": -1.2028909921646118, + "logps/chosen": -4.518444538116455, + "logps/rejected": -85.0959701538086, + "loss": 0.41947945952415466, + "memory(GiB)": 46.73, + "nll_loss": 0.3087552785873413, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.33132612705230713, + "rewards/margins": 7.8110456466674805, + "rewards/rejected": -7.479720115661621, + "step": 499, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4287628405538186, + "grad_norm": 47.98428726196289, + "learning_rate": 0.00011573708878712334, + "logits/chosen": -1.1333822011947632, + "logits/rejected": -1.1404212713241577, + "logps/chosen": -5.369108200073242, + "logps/rejected": -88.99859619140625, + "loss": 0.2577302157878876, + "memory(GiB)": 46.73, + "nll_loss": 0.24132868647575378, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.563679575920105, + "rewards/margins": 8.241194725036621, + "rewards/rejected": -7.677515029907227, + "step": 500, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4316212594908442, + "grad_norm": 0.9259874224662781, + "learning_rate": 0.00011542489329653024, + "logits/chosen": -1.208865761756897, + "logits/rejected": -1.2148855924606323, + "logps/chosen": -3.9202871322631836, + "logps/rejected": -83.33064270019531, + "loss": 0.23122766613960266, + "memory(GiB)": 46.73, + "nll_loss": 0.1727379858493805, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.31920304894447327, + "rewards/margins": 7.403501033782959, + "rewards/rejected": -7.084297180175781, + "step": 501, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.4344796784278695, + "grad_norm": 1.125532627105713, + "learning_rate": 0.00011511254372504531, + "logits/chosen": -1.1986217498779297, + "logits/rejected": -1.2092276811599731, + "logps/chosen": -3.3089041709899902, + "logps/rejected": -96.10748291015625, + "loss": 0.15806397795677185, + "memory(GiB)": 46.73, + "nll_loss": 0.14296883344650269, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48432743549346924, + "rewards/margins": 8.464982032775879, + "rewards/rejected": -7.980654716491699, + "step": 502, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.437338097364895, + "grad_norm": 1.2107607126235962, + "learning_rate": 0.00011480004319276146, + "logits/chosen": -1.139688491821289, + "logits/rejected": -1.1440945863723755, + "logps/chosen": -5.1867241859436035, + "logps/rejected": -73.35174560546875, + "loss": 0.3085225820541382, + "memory(GiB)": 46.73, + "nll_loss": 0.24397456645965576, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.36033540964126587, + "rewards/margins": 6.39411735534668, + "rewards/rejected": -6.0337815284729, + "step": 503, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.4401965163019206, + "grad_norm": 5.9218292236328125, + "learning_rate": 0.00011448739482127964, + "logits/chosen": -1.1547845602035522, + "logits/rejected": -1.1625118255615234, + "logps/chosen": -4.0660505294799805, + "logps/rejected": -88.60430145263672, + "loss": 0.22802509367465973, + "memory(GiB)": 46.73, + "nll_loss": 0.20198072493076324, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5234844088554382, + "rewards/margins": 7.882270336151123, + "rewards/rejected": -7.358785629272461, + "step": 504, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.443054935238946, + "grad_norm": 1.762481689453125, + "learning_rate": 0.00011417460173367749, + "logits/chosen": -1.1733976602554321, + "logits/rejected": -1.1826503276824951, + "logps/chosen": -2.589683771133423, + "logps/rejected": -87.47466278076172, + "loss": 0.18850570917129517, + "memory(GiB)": 46.73, + "nll_loss": 0.14593477547168732, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5842423439025879, + "rewards/margins": 8.038538932800293, + "rewards/rejected": -7.454297065734863, + "step": 505, + "train_speed(iter/s)": 0.005404 + }, + { + "epoch": 1.4459133541759714, + "grad_norm": 0.8148120641708374, + "learning_rate": 0.00011386166705447822, + "logits/chosen": -1.1997144222259521, + "logits/rejected": -1.2027227878570557, + "logps/chosen": -4.592447280883789, + "logps/rejected": -76.30319213867188, + "loss": 0.31897130608558655, + "memory(GiB)": 46.73, + "nll_loss": 0.279499351978302, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44331854581832886, + "rewards/margins": 6.904688358306885, + "rewards/rejected": -6.461369514465332, + "step": 506, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.448771773112997, + "grad_norm": 1.2374672889709473, + "learning_rate": 0.00011354859390961958, + "logits/chosen": -1.1905529499053955, + "logits/rejected": -1.2038395404815674, + "logps/chosen": -4.858891487121582, + "logps/rejected": -92.95069122314453, + "loss": 0.2493872344493866, + "memory(GiB)": 46.73, + "nll_loss": 0.22953400015830994, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5827652812004089, + "rewards/margins": 8.668669700622559, + "rewards/rejected": -8.085904121398926, + "step": 507, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4516301920500223, + "grad_norm": 1.2931541204452515, + "learning_rate": 0.00011323538542642227, + "logits/chosen": -1.110109806060791, + "logits/rejected": -1.1193634271621704, + "logps/chosen": -4.625039100646973, + "logps/rejected": -80.9062728881836, + "loss": 0.20781661570072174, + "memory(GiB)": 46.73, + "nll_loss": 0.18247604370117188, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5312872529029846, + "rewards/margins": 7.455812454223633, + "rewards/rejected": -6.924524784088135, + "step": 508, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4544886109870478, + "grad_norm": 1.048569679260254, + "learning_rate": 0.00011292204473355897, + "logits/chosen": -1.2067433595657349, + "logits/rejected": -1.2175577878952026, + "logps/chosen": -5.1852498054504395, + "logps/rejected": -94.29670715332031, + "loss": 0.27535420656204224, + "memory(GiB)": 46.73, + "nll_loss": 0.2682512700557709, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4187074303627014, + "rewards/margins": 8.540119171142578, + "rewards/rejected": -8.12141227722168, + "step": 509, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4573470299240732, + "grad_norm": 4.128075122833252, + "learning_rate": 0.00011260857496102308, + "logits/chosen": -1.1686019897460938, + "logits/rejected": -1.181231141090393, + "logps/chosen": -3.8015005588531494, + "logps/rejected": -83.12324523925781, + "loss": 0.25129976868629456, + "memory(GiB)": 46.73, + "nll_loss": 0.23475927114486694, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5385525226593018, + "rewards/margins": 7.2553253173828125, + "rewards/rejected": -6.716772079467773, + "step": 510, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4602054488610987, + "grad_norm": 1.234870195388794, + "learning_rate": 0.00011229497924009731, + "logits/chosen": -1.1313613653182983, + "logits/rejected": -1.1462265253067017, + "logps/chosen": -4.359948635101318, + "logps/rejected": -81.96128845214844, + "loss": 0.29682213068008423, + "memory(GiB)": 46.73, + "nll_loss": 0.2458692491054535, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.29223746061325073, + "rewards/margins": 7.110762119293213, + "rewards/rejected": -6.818524360656738, + "step": 511, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.463063867798124, + "grad_norm": 3.6918282508850098, + "learning_rate": 0.00011198126070332253, + "logits/chosen": -1.1628670692443848, + "logits/rejected": -1.1829794645309448, + "logps/chosen": -3.5093777179718018, + "logps/rejected": -99.69490814208984, + "loss": 0.1665382832288742, + "memory(GiB)": 46.73, + "nll_loss": 0.1274329423904419, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5227256417274475, + "rewards/margins": 8.994987487792969, + "rewards/rejected": -8.472262382507324, + "step": 512, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4659222867351496, + "grad_norm": 0.6721384525299072, + "learning_rate": 0.0001116674224844664, + "logits/chosen": -1.1727080345153809, + "logits/rejected": -1.1891160011291504, + "logps/chosen": -2.945639133453369, + "logps/rejected": -103.56698608398438, + "loss": 0.20559175312519073, + "memory(GiB)": 46.73, + "nll_loss": 0.13938431441783905, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4741285741329193, + "rewards/margins": 9.249117851257324, + "rewards/rejected": -8.774988174438477, + "step": 513, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4687807056721751, + "grad_norm": 6.535090923309326, + "learning_rate": 0.00011135346771849209, + "logits/chosen": -1.1876343488693237, + "logits/rejected": -1.195608139038086, + "logps/chosen": -11.41011905670166, + "logps/rejected": -87.87091064453125, + "loss": 0.8029640316963196, + "memory(GiB)": 46.73, + "nll_loss": 0.6119750142097473, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.16716431081295013, + "rewards/margins": 7.507657051086426, + "rewards/rejected": -7.340492248535156, + "step": 514, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4716391246092004, + "grad_norm": 1.00004243850708, + "learning_rate": 0.000111039399541527, + "logits/chosen": -1.2257870435714722, + "logits/rejected": -1.247442364692688, + "logps/chosen": -3.210059404373169, + "logps/rejected": -114.74640655517578, + "loss": 0.12618578970432281, + "memory(GiB)": 46.73, + "nll_loss": 0.11988845467567444, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.361129492521286, + "rewards/margins": 10.119677543640137, + "rewards/rejected": -9.75854778289795, + "step": 515, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.474497543546226, + "grad_norm": 1.151992678642273, + "learning_rate": 0.00011072522109083136, + "logits/chosen": -1.2160663604736328, + "logits/rejected": -1.223649263381958, + "logps/chosen": -5.680351734161377, + "logps/rejected": -93.8958511352539, + "loss": 0.21817338466644287, + "memory(GiB)": 46.73, + "nll_loss": 0.20911143720149994, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.34994593262672424, + "rewards/margins": 8.294967651367188, + "rewards/rejected": -7.945021629333496, + "step": 516, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4773559624832515, + "grad_norm": 0.7956191897392273, + "learning_rate": 0.00011041093550476707, + "logits/chosen": -1.1727287769317627, + "logits/rejected": -1.197590708732605, + "logps/chosen": -6.0897536277771, + "logps/rejected": -114.73556518554688, + "loss": 0.22368358075618744, + "memory(GiB)": 46.73, + "nll_loss": 0.17487390339374542, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.42228540778160095, + "rewards/margins": 10.215088844299316, + "rewards/rejected": -9.792802810668945, + "step": 517, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4802143814202768, + "grad_norm": 0.774364709854126, + "learning_rate": 0.00011009654592276602, + "logits/chosen": -1.2067716121673584, + "logits/rejected": -1.2088109254837036, + "logps/chosen": -6.949159145355225, + "logps/rejected": -90.97496795654297, + "loss": 0.20918475091457367, + "memory(GiB)": 46.73, + "nll_loss": 0.20520548522472382, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5352796912193298, + "rewards/margins": 8.326306343078613, + "rewards/rejected": -7.7910261154174805, + "step": 518, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.4830728003573024, + "grad_norm": 3.37893009185791, + "learning_rate": 0.00010978205548529901, + "logits/chosen": -1.2004296779632568, + "logits/rejected": -1.2116055488586426, + "logps/chosen": -3.89436411857605, + "logps/rejected": -95.7611312866211, + "loss": 0.4085824489593506, + "memory(GiB)": 46.73, + "nll_loss": 0.35265466570854187, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.37127387523651123, + "rewards/margins": 8.661355972290039, + "rewards/rejected": -8.290082931518555, + "step": 519, + "train_speed(iter/s)": 0.005405 + }, + { + "epoch": 1.485931219294328, + "grad_norm": 16.25596046447754, + "learning_rate": 0.00010946746733384438, + "logits/chosen": -1.2258524894714355, + "logits/rejected": -1.2375496625900269, + "logps/chosen": -5.31617546081543, + "logps/rejected": -109.71346282958984, + "loss": 0.13790036737918854, + "memory(GiB)": 46.73, + "nll_loss": 0.13614803552627563, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4368322193622589, + "rewards/margins": 10.197646141052246, + "rewards/rejected": -9.76081371307373, + "step": 520, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.4887896382313532, + "grad_norm": 0.502770185470581, + "learning_rate": 0.0001091527846108565, + "logits/chosen": -1.254034399986267, + "logits/rejected": -1.2636607885360718, + "logps/chosen": -3.331085205078125, + "logps/rejected": -97.47418975830078, + "loss": 0.22000513970851898, + "memory(GiB)": 46.73, + "nll_loss": 0.16505232453346252, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5080281496047974, + "rewards/margins": 9.02621078491211, + "rewards/rejected": -8.518182754516602, + "step": 521, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.4916480571683788, + "grad_norm": 1.0531229972839355, + "learning_rate": 0.00010883801045973425, + "logits/chosen": -1.1826633214950562, + "logits/rejected": -1.19447660446167, + "logps/chosen": -4.556516647338867, + "logps/rejected": -107.08341979980469, + "loss": 0.25091084837913513, + "memory(GiB)": 46.73, + "nll_loss": 0.24824769794940948, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.473566472530365, + "rewards/margins": 9.908580780029297, + "rewards/rejected": -9.435013771057129, + "step": 522, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.4945064761054043, + "grad_norm": 0.7932538986206055, + "learning_rate": 0.00010852314802479009, + "logits/chosen": -1.2365505695343018, + "logits/rejected": -1.248761534690857, + "logps/chosen": -5.015833854675293, + "logps/rejected": -103.74222564697266, + "loss": 0.2333514541387558, + "memory(GiB)": 46.73, + "nll_loss": 0.23029278218746185, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4175027012825012, + "rewards/margins": 9.160269737243652, + "rewards/rejected": -8.742767333984375, + "step": 523, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.4973648950424296, + "grad_norm": 1.06013822555542, + "learning_rate": 0.00010820820045121813, + "logits/chosen": -1.222113013267517, + "logits/rejected": -1.2319118976593018, + "logps/chosen": -5.657748699188232, + "logps/rejected": -99.86978149414062, + "loss": 0.24467575550079346, + "memory(GiB)": 46.73, + "nll_loss": 0.2282891571521759, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4060324430465698, + "rewards/margins": 9.202392578125, + "rewards/rejected": -8.796361923217773, + "step": 524, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.500223313979455, + "grad_norm": 2.980257987976074, + "learning_rate": 0.00010789317088506305, + "logits/chosen": -1.248826265335083, + "logits/rejected": -1.2513175010681152, + "logps/chosen": -5.99161958694458, + "logps/rejected": -85.02299499511719, + "loss": 0.2671952545642853, + "memory(GiB)": 46.73, + "nll_loss": 0.20313005149364471, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.5677384734153748, + "rewards/margins": 8.085262298583984, + "rewards/rejected": -7.517524719238281, + "step": 525, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5030817329164807, + "grad_norm": 2.408642053604126, + "learning_rate": 0.00010757806247318851, + "logits/chosen": -1.23759925365448, + "logits/rejected": -1.2442384958267212, + "logps/chosen": -5.353574275970459, + "logps/rejected": -89.49260711669922, + "loss": 0.3324205279350281, + "memory(GiB)": 46.73, + "nll_loss": 0.2696898877620697, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6186475157737732, + "rewards/margins": 8.384135246276855, + "rewards/rejected": -7.765487194061279, + "step": 526, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.505940151853506, + "grad_norm": 1.4788644313812256, + "learning_rate": 0.00010726287836324582, + "logits/chosen": -1.2341465950012207, + "logits/rejected": -1.2422211170196533, + "logps/chosen": -4.538509845733643, + "logps/rejected": -102.45213317871094, + "loss": 0.2807333469390869, + "memory(GiB)": 46.73, + "nll_loss": 0.2563856840133667, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.48188358545303345, + "rewards/margins": 9.553081512451172, + "rewards/rejected": -9.071197509765625, + "step": 527, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5087985707905314, + "grad_norm": 0.7929016947746277, + "learning_rate": 0.00010694762170364242, + "logits/chosen": -1.2391407489776611, + "logits/rejected": -1.249765157699585, + "logps/chosen": -2.7391014099121094, + "logps/rejected": -103.79396057128906, + "loss": 0.17492415010929108, + "memory(GiB)": 46.73, + "nll_loss": 0.17373135685920715, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.45701760053634644, + "rewards/margins": 9.713203430175781, + "rewards/rejected": -9.256185531616211, + "step": 528, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.511656989727557, + "grad_norm": 0.791999340057373, + "learning_rate": 0.00010663229564351041, + "logits/chosen": -1.2260950803756714, + "logits/rejected": -1.2434712648391724, + "logps/chosen": -5.709774017333984, + "logps/rejected": -98.61321258544922, + "loss": 0.23840050399303436, + "memory(GiB)": 46.73, + "nll_loss": 0.23402667045593262, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4017852544784546, + "rewards/margins": 8.891060829162598, + "rewards/rejected": -8.489274978637695, + "step": 529, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5145154086645825, + "grad_norm": 5.886305809020996, + "learning_rate": 0.00010631690333267521, + "logits/chosen": -1.1947157382965088, + "logits/rejected": -1.2065891027450562, + "logps/chosen": -5.48460054397583, + "logps/rejected": -95.61801147460938, + "loss": 0.3014085590839386, + "memory(GiB)": 46.73, + "nll_loss": 0.29200366139411926, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.46417590975761414, + "rewards/margins": 8.575323104858398, + "rewards/rejected": -8.1111478805542, + "step": 530, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5173738276016078, + "grad_norm": 2.0325398445129395, + "learning_rate": 0.00010600144792162399, + "logits/chosen": -1.151494026184082, + "logits/rejected": -1.1706622838974, + "logps/chosen": -2.6873748302459717, + "logps/rejected": -96.88280487060547, + "loss": 0.1879945695400238, + "memory(GiB)": 46.73, + "nll_loss": 0.18690775334835052, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49974530935287476, + "rewards/margins": 8.668235778808594, + "rewards/rejected": -8.168490409851074, + "step": 531, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5202322465386333, + "grad_norm": 1.101829171180725, + "learning_rate": 0.00010568593256147421, + "logits/chosen": -1.1817059516906738, + "logits/rejected": -1.1975884437561035, + "logps/chosen": -3.4241294860839844, + "logps/rejected": -99.36744689941406, + "loss": 0.16117167472839355, + "memory(GiB)": 46.73, + "nll_loss": 0.15802986919879913, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5246546864509583, + "rewards/margins": 8.936569213867188, + "rewards/rejected": -8.411913871765137, + "step": 532, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5230906654756589, + "grad_norm": 0.7341797947883606, + "learning_rate": 0.00010537036040394226, + "logits/chosen": -1.1905285120010376, + "logits/rejected": -1.2094738483428955, + "logps/chosen": -3.8606913089752197, + "logps/rejected": -100.25830078125, + "loss": 0.15881170332431793, + "memory(GiB)": 46.73, + "nll_loss": 0.1546865999698639, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6509500741958618, + "rewards/margins": 9.299416542053223, + "rewards/rejected": -8.648467063903809, + "step": 533, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5259490844126842, + "grad_norm": 1.048133373260498, + "learning_rate": 0.00010505473460131182, + "logits/chosen": -1.1491801738739014, + "logits/rejected": -1.1666440963745117, + "logps/chosen": -3.386275291442871, + "logps/rejected": -95.7393569946289, + "loss": 0.1639423668384552, + "memory(GiB)": 46.73, + "nll_loss": 0.14697596430778503, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41195330023765564, + "rewards/margins": 8.413421630859375, + "rewards/rejected": -8.00146770477295, + "step": 534, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5288075033497097, + "grad_norm": 0.7253103256225586, + "learning_rate": 0.00010473905830640238, + "logits/chosen": -1.2081520557403564, + "logits/rejected": -1.2300549745559692, + "logps/chosen": -4.6544599533081055, + "logps/rejected": -102.84630584716797, + "loss": 0.2066834568977356, + "memory(GiB)": 46.73, + "nll_loss": 0.18399091064929962, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5013687610626221, + "rewards/margins": 9.11780834197998, + "rewards/rejected": -8.616438865661621, + "step": 535, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5316659222867353, + "grad_norm": 0.8472306132316589, + "learning_rate": 0.00010442333467253789, + "logits/chosen": -1.1342350244522095, + "logits/rejected": -1.1452178955078125, + "logps/chosen": -6.043959140777588, + "logps/rejected": -86.95714569091797, + "loss": 0.30448004603385925, + "memory(GiB)": 46.73, + "nll_loss": 0.29562440514564514, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6062089800834656, + "rewards/margins": 7.933745861053467, + "rewards/rejected": -7.327536582946777, + "step": 536, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5345243412237606, + "grad_norm": 3.631605863571167, + "learning_rate": 0.00010410756685351517, + "logits/chosen": -1.1697407960891724, + "logits/rejected": -1.1903973817825317, + "logps/chosen": -2.9826488494873047, + "logps/rejected": -102.60981750488281, + "loss": 0.1628805547952652, + "memory(GiB)": 46.73, + "nll_loss": 0.1444227546453476, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4331924617290497, + "rewards/margins": 9.25413703918457, + "rewards/rejected": -8.820945739746094, + "step": 537, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.537382760160786, + "grad_norm": 4.747304439544678, + "learning_rate": 0.0001037917580035724, + "logits/chosen": -1.1395968198776245, + "logits/rejected": -1.1540745496749878, + "logps/chosen": -4.616944789886475, + "logps/rejected": -96.46205139160156, + "loss": 0.18046514689922333, + "memory(GiB)": 46.73, + "nll_loss": 0.15388183295726776, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4708944261074066, + "rewards/margins": 8.634149551391602, + "rewards/rejected": -8.163254737854004, + "step": 538, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5402411790978117, + "grad_norm": 1.0566221475601196, + "learning_rate": 0.00010347591127735754, + "logits/chosen": -1.1123058795928955, + "logits/rejected": -1.1218605041503906, + "logps/chosen": -4.521425247192383, + "logps/rejected": -98.85065460205078, + "loss": 0.25702419877052307, + "memory(GiB)": 46.73, + "nll_loss": 0.2428530752658844, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4769361615180969, + "rewards/margins": 9.206279754638672, + "rewards/rejected": -8.72934341430664, + "step": 539, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.543099598034837, + "grad_norm": 0.8213050365447998, + "learning_rate": 0.00010316002982989704, + "logits/chosen": -1.1132948398590088, + "logits/rejected": -1.129378080368042, + "logps/chosen": -2.907618522644043, + "logps/rejected": -92.56205749511719, + "loss": 0.19241493940353394, + "memory(GiB)": 46.73, + "nll_loss": 0.16153347492218018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5939139723777771, + "rewards/margins": 8.283432006835938, + "rewards/rejected": -7.689518451690674, + "step": 540, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5459580169718623, + "grad_norm": 0.8551529049873352, + "learning_rate": 0.00010284411681656408, + "logits/chosen": -1.2044731378555298, + "logits/rejected": -1.209726333618164, + "logps/chosen": -6.703289985656738, + "logps/rejected": -88.3790283203125, + "loss": 0.3231280446052551, + "memory(GiB)": 46.73, + "nll_loss": 0.30079561471939087, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6794237494468689, + "rewards/margins": 8.502208709716797, + "rewards/rejected": -7.822785377502441, + "step": 541, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5488164359088878, + "grad_norm": 1.2103654146194458, + "learning_rate": 0.00010252817539304718, + "logits/chosen": -1.1682829856872559, + "logits/rejected": -1.1821935176849365, + "logps/chosen": -8.161247253417969, + "logps/rejected": -91.14198303222656, + "loss": 0.7169775366783142, + "memory(GiB)": 46.73, + "nll_loss": 0.5195838212966919, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2014901340007782, + "rewards/margins": 8.132518768310547, + "rewards/rejected": -7.931027412414551, + "step": 542, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5516748548459134, + "grad_norm": 16.268648147583008, + "learning_rate": 0.00010221220871531869, + "logits/chosen": -1.1647533178329468, + "logits/rejected": -1.1727814674377441, + "logps/chosen": -4.000942707061768, + "logps/rejected": -95.975341796875, + "loss": 0.23619498312473297, + "memory(GiB)": 46.73, + "nll_loss": 0.20583844184875488, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6236611604690552, + "rewards/margins": 9.150650978088379, + "rewards/rejected": -8.526989936828613, + "step": 543, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5545332737829387, + "grad_norm": 0.8984525799751282, + "learning_rate": 0.00010189621993960319, + "logits/chosen": -1.1389577388763428, + "logits/rejected": -1.1588479280471802, + "logps/chosen": -2.0922861099243164, + "logps/rejected": -99.55612182617188, + "loss": 0.15487171709537506, + "memory(GiB)": 46.73, + "nll_loss": 0.11652800440788269, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4093736708164215, + "rewards/margins": 8.549884796142578, + "rewards/rejected": -8.140511512756348, + "step": 544, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5573916927199642, + "grad_norm": 8.225284576416016, + "learning_rate": 0.00010158021222234602, + "logits/chosen": -1.2096428871154785, + "logits/rejected": -1.2262201309204102, + "logps/chosen": -4.548305511474609, + "logps/rejected": -99.0030517578125, + "loss": 0.16668973863124847, + "memory(GiB)": 46.73, + "nll_loss": 0.15765738487243652, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5047243237495422, + "rewards/margins": 8.951805114746094, + "rewards/rejected": -8.447081565856934, + "step": 545, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5602501116569898, + "grad_norm": 0.8983806371688843, + "learning_rate": 0.00010126418872018169, + "logits/chosen": -1.1991511583328247, + "logits/rejected": -1.209883689880371, + "logps/chosen": -4.1333327293396, + "logps/rejected": -94.91553497314453, + "loss": 0.22168555855751038, + "memory(GiB)": 46.73, + "nll_loss": 0.20513451099395752, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5711698532104492, + "rewards/margins": 8.50210189819336, + "rewards/rejected": -7.930931568145752, + "step": 546, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.563108530594015, + "grad_norm": 1.7599843740463257, + "learning_rate": 0.00010094815258990241, + "logits/chosen": -1.1996725797653198, + "logits/rejected": -1.2069827318191528, + "logps/chosen": -7.075511455535889, + "logps/rejected": -77.37564086914062, + "loss": 0.34534481167793274, + "memory(GiB)": 46.73, + "nll_loss": 0.29777780175209045, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7596228122711182, + "rewards/margins": 7.05924129486084, + "rewards/rejected": -6.299618244171143, + "step": 547, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5659669495310407, + "grad_norm": 1.2366605997085571, + "learning_rate": 0.00010063210698842655, + "logits/chosen": -1.1746978759765625, + "logits/rejected": -1.1860934495925903, + "logps/chosen": -3.1920042037963867, + "logps/rejected": -96.23448181152344, + "loss": 0.13993731141090393, + "memory(GiB)": 46.73, + "nll_loss": 0.13228188455104828, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5295498967170715, + "rewards/margins": 8.722616195678711, + "rewards/rejected": -8.193065643310547, + "step": 548, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5688253684680662, + "grad_norm": 0.6894782185554504, + "learning_rate": 0.00010031605507276705, + "logits/chosen": -1.2104339599609375, + "logits/rejected": -1.2190818786621094, + "logps/chosen": -3.9462296962738037, + "logps/rejected": -91.4450912475586, + "loss": 0.21633976697921753, + "memory(GiB)": 46.73, + "nll_loss": 0.18217234313488007, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.48840969800949097, + "rewards/margins": 8.675142288208008, + "rewards/rejected": -8.18673324584961, + "step": 549, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5716837874050915, + "grad_norm": 0.7373618483543396, + "learning_rate": 0.0001, + "logits/chosen": -1.2142421007156372, + "logits/rejected": -1.2380558252334595, + "logps/chosen": -2.7597246170043945, + "logps/rejected": -105.89647674560547, + "loss": 0.20728927850723267, + "memory(GiB)": 46.73, + "nll_loss": 0.20096683502197266, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.515934944152832, + "rewards/margins": 9.024059295654297, + "rewards/rejected": -8.508124351501465, + "step": 550, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.574542206342117, + "grad_norm": 1.0780363082885742, + "learning_rate": 9.968394492723299e-05, + "logits/chosen": -1.1850985288619995, + "logits/rejected": -1.19618821144104, + "logps/chosen": -3.918487787246704, + "logps/rejected": -99.82266998291016, + "loss": 0.18428170680999756, + "memory(GiB)": 46.73, + "nll_loss": 0.1705784946680069, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.309816837310791, + "rewards/margins": 8.807823181152344, + "rewards/rejected": -8.498005867004395, + "step": 551, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5774006252791426, + "grad_norm": 0.6045752167701721, + "learning_rate": 9.936789301157347e-05, + "logits/chosen": -1.200334072113037, + "logits/rejected": -1.2195042371749878, + "logps/chosen": -3.4113171100616455, + "logps/rejected": -101.41400909423828, + "loss": 0.1890278160572052, + "memory(GiB)": 46.73, + "nll_loss": 0.16223224997520447, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6845565438270569, + "rewards/margins": 9.446554183959961, + "rewards/rejected": -8.761998176574707, + "step": 552, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.580259044216168, + "grad_norm": 0.6226416230201721, + "learning_rate": 9.905184741009764e-05, + "logits/chosen": -1.1828663349151611, + "logits/rejected": -1.2045037746429443, + "logps/chosen": -4.39558219909668, + "logps/rejected": -95.02586364746094, + "loss": 0.20744438469409943, + "memory(GiB)": 46.73, + "nll_loss": 0.19546304643154144, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3974071741104126, + "rewards/margins": 8.272377967834473, + "rewards/rejected": -7.874969959259033, + "step": 553, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.5831174631531932, + "grad_norm": 0.8041784763336182, + "learning_rate": 9.873581127981834e-05, + "logits/chosen": -1.2021336555480957, + "logits/rejected": -1.215855598449707, + "logps/chosen": -5.235670566558838, + "logps/rejected": -98.94778442382812, + "loss": 0.3087376654148102, + "memory(GiB)": 46.73, + "nll_loss": 0.30778488516807556, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.508550226688385, + "rewards/margins": 9.163681030273438, + "rewards/rejected": -8.655131340026855, + "step": 554, + "train_speed(iter/s)": 0.005406 + }, + { + "epoch": 1.585975882090219, + "grad_norm": 0.8672412633895874, + "learning_rate": 9.841978777765402e-05, + "logits/chosen": -1.2232412099838257, + "logits/rejected": -1.2419785261154175, + "logps/chosen": -4.191494464874268, + "logps/rejected": -115.4002914428711, + "loss": 0.14720436930656433, + "memory(GiB)": 46.73, + "nll_loss": 0.1216704249382019, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4956449568271637, + "rewards/margins": 10.168661117553711, + "rewards/rejected": -9.673015594482422, + "step": 555, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.5888343010272443, + "grad_norm": 0.7310967445373535, + "learning_rate": 9.81037800603968e-05, + "logits/chosen": -1.2371845245361328, + "logits/rejected": -1.2543206214904785, + "logps/chosen": -3.877095937728882, + "logps/rejected": -100.69743347167969, + "loss": 0.1970527470111847, + "memory(GiB)": 46.73, + "nll_loss": 0.1900380700826645, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4485085904598236, + "rewards/margins": 9.28439712524414, + "rewards/rejected": -8.835887908935547, + "step": 556, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.5916927199642696, + "grad_norm": 1.4273149967193604, + "learning_rate": 9.778779128468132e-05, + "logits/chosen": -1.2515287399291992, + "logits/rejected": -1.2682404518127441, + "logps/chosen": -3.310947895050049, + "logps/rejected": -96.26271057128906, + "loss": 0.1776140332221985, + "memory(GiB)": 46.73, + "nll_loss": 0.17431208491325378, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.46884265542030334, + "rewards/margins": 8.55155086517334, + "rewards/rejected": -8.082708358764648, + "step": 557, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.5945511389012952, + "grad_norm": 0.7328734993934631, + "learning_rate": 9.747182460695282e-05, + "logits/chosen": -1.2264363765716553, + "logits/rejected": -1.2469466924667358, + "logps/chosen": -3.252176284790039, + "logps/rejected": -101.14380645751953, + "loss": 0.16898810863494873, + "memory(GiB)": 46.73, + "nll_loss": 0.1429700255393982, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.537392258644104, + "rewards/margins": 9.478887557983398, + "rewards/rejected": -8.941495895385742, + "step": 558, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.5974095578383207, + "grad_norm": 0.5761097073554993, + "learning_rate": 9.715588318343593e-05, + "logits/chosen": -1.2373993396759033, + "logits/rejected": -1.2531373500823975, + "logps/chosen": -3.8606765270233154, + "logps/rejected": -99.5583724975586, + "loss": 0.17141491174697876, + "memory(GiB)": 46.73, + "nll_loss": 0.15882301330566406, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5505474209785461, + "rewards/margins": 8.967745780944824, + "rewards/rejected": -8.417198181152344, + "step": 559, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.600267976775346, + "grad_norm": 0.9028222560882568, + "learning_rate": 9.6839970170103e-05, + "logits/chosen": -1.205949068069458, + "logits/rejected": -1.2180453538894653, + "logps/chosen": -5.940152645111084, + "logps/rejected": -84.56391906738281, + "loss": 0.2950308620929718, + "memory(GiB)": 46.73, + "nll_loss": 0.23100607097148895, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.702341616153717, + "rewards/margins": 7.944380760192871, + "rewards/rejected": -7.242038726806641, + "step": 560, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6031263957123716, + "grad_norm": 1.0543800592422485, + "learning_rate": 9.652408872264249e-05, + "logits/chosen": -1.1957297325134277, + "logits/rejected": -1.2104666233062744, + "logps/chosen": -4.604339599609375, + "logps/rejected": -101.80133819580078, + "loss": 0.238393172621727, + "memory(GiB)": 46.73, + "nll_loss": 0.22904415428638458, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5547606348991394, + "rewards/margins": 9.415586471557617, + "rewards/rejected": -8.860825538635254, + "step": 561, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6059848146493971, + "grad_norm": 0.9146276116371155, + "learning_rate": 9.620824199642764e-05, + "logits/chosen": -1.228825569152832, + "logits/rejected": -1.2460359334945679, + "logps/chosen": -6.999305725097656, + "logps/rejected": -101.86087036132812, + "loss": 0.29198122024536133, + "memory(GiB)": 46.73, + "nll_loss": 0.27209144830703735, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5028784871101379, + "rewards/margins": 8.82616901397705, + "rewards/rejected": -8.32328987121582, + "step": 562, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6088432335864224, + "grad_norm": 0.9446074366569519, + "learning_rate": 9.589243314648482e-05, + "logits/chosen": -1.2695645093917847, + "logits/rejected": -1.2769098281860352, + "logps/chosen": -3.131113290786743, + "logps/rejected": -102.22225952148438, + "loss": 0.23388896882534027, + "memory(GiB)": 46.73, + "nll_loss": 0.18364675343036652, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.32783710956573486, + "rewards/margins": 9.313203811645508, + "rewards/rejected": -8.985366821289062, + "step": 563, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.611701652523448, + "grad_norm": 0.8410360217094421, + "learning_rate": 9.557666532746213e-05, + "logits/chosen": -1.2425626516342163, + "logits/rejected": -1.257200837135315, + "logps/chosen": -4.220077991485596, + "logps/rejected": -108.97372436523438, + "loss": 0.21360714733600616, + "memory(GiB)": 46.73, + "nll_loss": 0.18227827548980713, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5547472834587097, + "rewards/margins": 9.62452220916748, + "rewards/rejected": -9.069774627685547, + "step": 564, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6145600714604735, + "grad_norm": 3.650477409362793, + "learning_rate": 9.526094169359765e-05, + "logits/chosen": -1.2563040256500244, + "logits/rejected": -1.2690678834915161, + "logps/chosen": -4.583124160766602, + "logps/rejected": -89.01020050048828, + "loss": 0.3627120852470398, + "memory(GiB)": 46.73, + "nll_loss": 0.30041414499282837, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4141501188278198, + "rewards/margins": 8.265939712524414, + "rewards/rejected": -7.8517889976501465, + "step": 565, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6174184903974989, + "grad_norm": 9.177145957946777, + "learning_rate": 9.494526539868822e-05, + "logits/chosen": -1.217350721359253, + "logits/rejected": -1.2367099523544312, + "logps/chosen": -4.153363227844238, + "logps/rejected": -106.2103500366211, + "loss": 0.24249762296676636, + "memory(GiB)": 46.73, + "nll_loss": 0.23106533288955688, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5973933339118958, + "rewards/margins": 9.575693130493164, + "rewards/rejected": -8.978300094604492, + "step": 566, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6202769093345244, + "grad_norm": 0.7864315509796143, + "learning_rate": 9.462963959605778e-05, + "logits/chosen": -1.25490403175354, + "logits/rejected": -1.2653908729553223, + "logps/chosen": -7.570868015289307, + "logps/rejected": -98.19856262207031, + "loss": 0.8767191171646118, + "memory(GiB)": 46.73, + "nll_loss": 0.6035685539245605, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.30315718054771423, + "rewards/margins": 8.980510711669922, + "rewards/rejected": -8.677353858947754, + "step": 567, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.62313532827155, + "grad_norm": 3.0301690101623535, + "learning_rate": 9.43140674385258e-05, + "logits/chosen": -1.2209892272949219, + "logits/rejected": -1.2403444051742554, + "logps/chosen": -1.368801474571228, + "logps/rejected": -107.77033996582031, + "loss": 0.1274924874305725, + "memory(GiB)": 46.73, + "nll_loss": 0.10486172139644623, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48542851209640503, + "rewards/margins": 9.754288673400879, + "rewards/rejected": -9.26885986328125, + "step": 568, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6259937472085753, + "grad_norm": 0.9174420237541199, + "learning_rate": 9.399855207837606e-05, + "logits/chosen": -1.2614572048187256, + "logits/rejected": -1.273358702659607, + "logps/chosen": -4.721066951751709, + "logps/rejected": -93.51985931396484, + "loss": 0.16965904831886292, + "memory(GiB)": 46.73, + "nll_loss": 0.15142567455768585, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5274036526679993, + "rewards/margins": 8.461057662963867, + "rewards/rejected": -7.933653354644775, + "step": 569, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6288521661456006, + "grad_norm": 1.023853063583374, + "learning_rate": 9.368309666732481e-05, + "logits/chosen": -1.2322520017623901, + "logits/rejected": -1.2480456829071045, + "logps/chosen": -6.101306438446045, + "logps/rejected": -101.52810668945312, + "loss": 0.19685791432857513, + "memory(GiB)": 46.73, + "nll_loss": 0.19015911221504211, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41192999482154846, + "rewards/margins": 8.994438171386719, + "rewards/rejected": -8.582507133483887, + "step": 570, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6317105850826261, + "grad_norm": 0.6543206572532654, + "learning_rate": 9.336770435648964e-05, + "logits/chosen": -1.2358951568603516, + "logits/rejected": -1.2526280879974365, + "logps/chosen": -3.6635141372680664, + "logps/rejected": -99.887451171875, + "loss": 0.20197272300720215, + "memory(GiB)": 46.73, + "nll_loss": 0.16135680675506592, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5029939413070679, + "rewards/margins": 9.152663230895996, + "rewards/rejected": -8.649669647216797, + "step": 571, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6345690040196517, + "grad_norm": 3.662933588027954, + "learning_rate": 9.30523782963576e-05, + "logits/chosen": -1.230069637298584, + "logits/rejected": -1.2422807216644287, + "logps/chosen": -10.505573272705078, + "logps/rejected": -85.44378662109375, + "loss": 0.9089314937591553, + "memory(GiB)": 46.73, + "nll_loss": 0.6872246265411377, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4905371367931366, + "rewards/margins": 8.058351516723633, + "rewards/rejected": -7.567814350128174, + "step": 572, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.637427422956677, + "grad_norm": 1.039322853088379, + "learning_rate": 9.27371216367542e-05, + "logits/chosen": -1.2223392724990845, + "logits/rejected": -1.2409743070602417, + "logps/chosen": -3.3646481037139893, + "logps/rejected": -100.68852996826172, + "loss": 0.13831134140491486, + "memory(GiB)": 46.73, + "nll_loss": 0.12199953198432922, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4276912212371826, + "rewards/margins": 8.902277946472168, + "rewards/rejected": -8.474586486816406, + "step": 573, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6402858418937025, + "grad_norm": 0.6266536116600037, + "learning_rate": 9.242193752681149e-05, + "logits/chosen": -1.217388391494751, + "logits/rejected": -1.2337368726730347, + "logps/chosen": -10.087833404541016, + "logps/rejected": -106.16631317138672, + "loss": 0.27814164757728577, + "memory(GiB)": 46.73, + "nll_loss": 0.2720891833305359, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5779958963394165, + "rewards/margins": 9.594115257263184, + "rewards/rejected": -9.016119956970215, + "step": 574, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.643144260830728, + "grad_norm": 1.939039945602417, + "learning_rate": 9.210682911493696e-05, + "logits/chosen": -1.1878530979156494, + "logits/rejected": -1.1841703653335571, + "logps/chosen": -9.380166053771973, + "logps/rejected": -74.41200256347656, + "loss": 0.4060296416282654, + "memory(GiB)": 46.73, + "nll_loss": 0.34181496500968933, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.368032842874527, + "rewards/margins": 6.767005920410156, + "rewards/rejected": -6.398972511291504, + "step": 575, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6460026797677534, + "grad_norm": 1.4155151844024658, + "learning_rate": 9.179179954878191e-05, + "logits/chosen": -1.2296230792999268, + "logits/rejected": -1.2440543174743652, + "logps/chosen": -3.602640390396118, + "logps/rejected": -102.97189331054688, + "loss": 0.1902437061071396, + "memory(GiB)": 46.73, + "nll_loss": 0.17669150233268738, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4757131338119507, + "rewards/margins": 9.499579429626465, + "rewards/rejected": -9.023865699768066, + "step": 576, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.648861098704779, + "grad_norm": 0.6756049990653992, + "learning_rate": 9.147685197520995e-05, + "logits/chosen": -1.232581615447998, + "logits/rejected": -1.2494488954544067, + "logps/chosen": -3.071582317352295, + "logps/rejected": -104.58504486083984, + "loss": 0.15779809653759003, + "memory(GiB)": 46.73, + "nll_loss": 0.1385500133037567, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5847654342651367, + "rewards/margins": 9.329889297485352, + "rewards/rejected": -8.745122909545898, + "step": 577, + "train_speed(iter/s)": 0.005407 + }, + { + "epoch": 1.6517195176418045, + "grad_norm": 0.5691357254981995, + "learning_rate": 9.116198954026577e-05, + "logits/chosen": -1.2136074304580688, + "logits/rejected": -1.231778860092163, + "logps/chosen": -3.6910195350646973, + "logps/rejected": -104.98346710205078, + "loss": 0.2058335244655609, + "memory(GiB)": 46.73, + "nll_loss": 0.15693770349025726, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.24480776488780975, + "rewards/margins": 9.162877082824707, + "rewards/rejected": -8.918069839477539, + "step": 578, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6545779365788298, + "grad_norm": 0.98762047290802, + "learning_rate": 9.084721538914354e-05, + "logits/chosen": -1.1979000568389893, + "logits/rejected": -1.1992981433868408, + "logps/chosen": -8.207277297973633, + "logps/rejected": -76.73429107666016, + "loss": 0.38480570912361145, + "memory(GiB)": 46.73, + "nll_loss": 0.32915711402893066, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.424187570810318, + "rewards/margins": 7.018537521362305, + "rewards/rejected": -6.594350337982178, + "step": 579, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6574363555158553, + "grad_norm": 1.4615544080734253, + "learning_rate": 9.053253266615563e-05, + "logits/chosen": -1.2005051374435425, + "logits/rejected": -1.207005500793457, + "logps/chosen": -3.0953447818756104, + "logps/rejected": -90.17530822753906, + "loss": 0.20222529768943787, + "memory(GiB)": 46.73, + "nll_loss": 0.16874569654464722, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4227086007595062, + "rewards/margins": 8.343812942504883, + "rewards/rejected": -7.921104907989502, + "step": 580, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6602947744528809, + "grad_norm": 0.9963876605033875, + "learning_rate": 9.0217944514701e-05, + "logits/chosen": -1.2267546653747559, + "logits/rejected": -1.236647129058838, + "logps/chosen": -4.396671295166016, + "logps/rejected": -106.08937072753906, + "loss": 0.35176020860671997, + "memory(GiB)": 46.73, + "nll_loss": 0.3066858649253845, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40714532136917114, + "rewards/margins": 9.592981338500977, + "rewards/rejected": -9.185835838317871, + "step": 581, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6631531933899062, + "grad_norm": 4.256789684295654, + "learning_rate": 8.990345407723402e-05, + "logits/chosen": -1.2223454713821411, + "logits/rejected": -1.2440755367279053, + "logps/chosen": -4.9550347328186035, + "logps/rejected": -101.04862213134766, + "loss": 0.22037917375564575, + "memory(GiB)": 46.73, + "nll_loss": 0.21300825476646423, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4511691927909851, + "rewards/margins": 8.963902473449707, + "rewards/rejected": -8.512733459472656, + "step": 582, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6660116123269315, + "grad_norm": 1.3565281629562378, + "learning_rate": 8.958906449523294e-05, + "logits/chosen": -1.1865954399108887, + "logits/rejected": -1.2029664516448975, + "logps/chosen": -6.465363025665283, + "logps/rejected": -98.9941635131836, + "loss": 0.5277466177940369, + "memory(GiB)": 46.73, + "nll_loss": 0.4747985601425171, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5788065195083618, + "rewards/margins": 9.07010269165039, + "rewards/rejected": -8.49129581451416, + "step": 583, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6688700312639573, + "grad_norm": 19.33406639099121, + "learning_rate": 8.927477890916865e-05, + "logits/chosen": -1.146034598350525, + "logits/rejected": -1.1573537588119507, + "logps/chosen": -5.037684440612793, + "logps/rejected": -94.7759780883789, + "loss": 0.40787991881370544, + "memory(GiB)": 46.73, + "nll_loss": 0.3248973488807678, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.385827898979187, + "rewards/margins": 8.398825645446777, + "rewards/rejected": -8.0129976272583, + "step": 584, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6717284502009826, + "grad_norm": 11.837591171264648, + "learning_rate": 8.896060045847304e-05, + "logits/chosen": -1.1754140853881836, + "logits/rejected": -1.1862783432006836, + "logps/chosen": -4.227570056915283, + "logps/rejected": -103.70059204101562, + "loss": 0.21096792817115784, + "memory(GiB)": 46.73, + "nll_loss": 0.19895918667316437, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7301295399665833, + "rewards/margins": 9.55334186553955, + "rewards/rejected": -8.823212623596191, + "step": 585, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.674586869138008, + "grad_norm": 0.8223007321357727, + "learning_rate": 8.864653228150794e-05, + "logits/chosen": -1.1963828802108765, + "logits/rejected": -1.2057627439498901, + "logps/chosen": -5.076923847198486, + "logps/rejected": -97.21467590332031, + "loss": 0.2129833847284317, + "memory(GiB)": 46.73, + "nll_loss": 0.2047015130519867, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4923573136329651, + "rewards/margins": 9.023185729980469, + "rewards/rejected": -8.530828475952148, + "step": 586, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6774452880750335, + "grad_norm": 0.682444155216217, + "learning_rate": 8.833257751553365e-05, + "logits/chosen": -1.192571759223938, + "logits/rejected": -1.1966464519500732, + "logps/chosen": -5.998629570007324, + "logps/rejected": -95.70146179199219, + "loss": 0.24226294457912445, + "memory(GiB)": 46.73, + "nll_loss": 0.2067227065563202, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6862426996231079, + "rewards/margins": 8.965702056884766, + "rewards/rejected": -8.279458999633789, + "step": 587, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.680303707012059, + "grad_norm": 0.8181328177452087, + "learning_rate": 8.801873929667749e-05, + "logits/chosen": -1.1211837530136108, + "logits/rejected": -1.1410701274871826, + "logps/chosen": -3.5135490894317627, + "logps/rejected": -117.64289855957031, + "loss": 0.18599815666675568, + "memory(GiB)": 46.73, + "nll_loss": 0.14936751127243042, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3863241970539093, + "rewards/margins": 10.570147514343262, + "rewards/rejected": -10.183822631835938, + "step": 588, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6831621259490843, + "grad_norm": 1.1397695541381836, + "learning_rate": 8.77050207599027e-05, + "logits/chosen": -1.1019999980926514, + "logits/rejected": -1.1149682998657227, + "logps/chosen": -2.0262680053710938, + "logps/rejected": -104.42642211914062, + "loss": 0.15114909410476685, + "memory(GiB)": 46.73, + "nll_loss": 0.1371248960494995, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3417889177799225, + "rewards/margins": 9.413578033447266, + "rewards/rejected": -9.071789741516113, + "step": 589, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6860205448861099, + "grad_norm": 0.9280815124511719, + "learning_rate": 8.739142503897693e-05, + "logits/chosen": -1.1994444131851196, + "logits/rejected": -1.2191089391708374, + "logps/chosen": -3.230380058288574, + "logps/rejected": -116.66558837890625, + "loss": 0.19586162269115448, + "memory(GiB)": 46.73, + "nll_loss": 0.17760922014713287, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5155038833618164, + "rewards/margins": 10.553391456604004, + "rewards/rejected": -10.037887573242188, + "step": 590, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6888789638231354, + "grad_norm": 4.784222602844238, + "learning_rate": 8.707795526644106e-05, + "logits/chosen": -1.1569873094558716, + "logits/rejected": -1.1652321815490723, + "logps/chosen": -4.722146987915039, + "logps/rejected": -103.7422103881836, + "loss": 0.2793360948562622, + "memory(GiB)": 46.73, + "nll_loss": 0.23997855186462402, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7041978240013123, + "rewards/margins": 9.703722953796387, + "rewards/rejected": -8.99952507019043, + "step": 591, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6917373827601607, + "grad_norm": 0.943581759929657, + "learning_rate": 8.676461457357776e-05, + "logits/chosen": -1.1320044994354248, + "logits/rejected": -1.138698935508728, + "logps/chosen": -5.889208793640137, + "logps/rejected": -93.14749145507812, + "loss": 0.3549827039241791, + "memory(GiB)": 46.73, + "nll_loss": 0.32344335317611694, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3422737717628479, + "rewards/margins": 8.550951957702637, + "rewards/rejected": -8.20867919921875, + "step": 592, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6945958016971863, + "grad_norm": 2.039912462234497, + "learning_rate": 8.645140609038046e-05, + "logits/chosen": -1.098019003868103, + "logits/rejected": -1.115633487701416, + "logps/chosen": -3.978429079055786, + "logps/rejected": -117.03365325927734, + "loss": 0.17504629492759705, + "memory(GiB)": 46.73, + "nll_loss": 0.15153054893016815, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.606253445148468, + "rewards/margins": 10.49371337890625, + "rewards/rejected": -9.887459754943848, + "step": 593, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.6974542206342118, + "grad_norm": 1.539162039756775, + "learning_rate": 8.61383329455218e-05, + "logits/chosen": -1.1445422172546387, + "logits/rejected": -1.1526044607162476, + "logps/chosen": -4.6503682136535645, + "logps/rejected": -98.78849792480469, + "loss": 0.25876373052597046, + "memory(GiB)": 46.73, + "nll_loss": 0.24835312366485596, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.261483758687973, + "rewards/margins": 8.811944961547852, + "rewards/rejected": -8.550460815429688, + "step": 594, + "train_speed(iter/s)": 0.005408 + }, + { + "epoch": 1.7003126395712371, + "grad_norm": 9.246718406677246, + "learning_rate": 8.582539826632254e-05, + "logits/chosen": -1.1492161750793457, + "logits/rejected": -1.155732274055481, + "logps/chosen": -5.179446697235107, + "logps/rejected": -103.48001861572266, + "loss": 0.23773784935474396, + "memory(GiB)": 46.73, + "nll_loss": 0.22704634070396423, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6112527847290039, + "rewards/margins": 9.949883460998535, + "rewards/rejected": -9.338631629943848, + "step": 595, + "train_speed(iter/s)": 0.005409 + }, + { + "epoch": 1.7031710585082627, + "grad_norm": 0.8107644319534302, + "learning_rate": 8.55126051787204e-05, + "logits/chosen": -1.1577305793762207, + "logits/rejected": -1.1765245199203491, + "logps/chosen": -3.527681827545166, + "logps/rejected": -112.77857971191406, + "loss": 0.14476284384727478, + "memory(GiB)": 46.73, + "nll_loss": 0.14021086692810059, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6686225533485413, + "rewards/margins": 10.401530265808105, + "rewards/rejected": -9.732908248901367, + "step": 596, + "train_speed(iter/s)": 0.005409 + }, + { + "epoch": 1.7060294774452882, + "grad_norm": 0.5915255546569824, + "learning_rate": 8.519995680723854e-05, + "logits/chosen": -1.180711269378662, + "logits/rejected": -1.192284107208252, + "logps/chosen": -3.1985299587249756, + "logps/rejected": -103.07992553710938, + "loss": 0.14900489151477814, + "memory(GiB)": 46.73, + "nll_loss": 0.1284285932779312, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5310749411582947, + "rewards/margins": 9.687756538391113, + "rewards/rejected": -9.156682014465332, + "step": 597, + "train_speed(iter/s)": 0.005409 + }, + { + "epoch": 1.7088878963823135, + "grad_norm": 0.5708374381065369, + "learning_rate": 8.488745627495471e-05, + "logits/chosen": -1.1305077075958252, + "logits/rejected": -1.1556541919708252, + "logps/chosen": -2.296858787536621, + "logps/rejected": -129.15554809570312, + "loss": 0.18966425955295563, + "memory(GiB)": 46.73, + "nll_loss": 0.16467303037643433, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.36356276273727417, + "rewards/margins": 11.156661987304688, + "rewards/rejected": -10.793099403381348, + "step": 598, + "train_speed(iter/s)": 0.005409 + }, + { + "epoch": 1.7117463153193389, + "grad_norm": 2.8251218795776367, + "learning_rate": 8.457510670346976e-05, + "logits/chosen": -1.159468173980713, + "logits/rejected": -1.1627717018127441, + "logps/chosen": -4.14231014251709, + "logps/rejected": -90.7442855834961, + "loss": 0.24305839836597443, + "memory(GiB)": 46.73, + "nll_loss": 0.21578028798103333, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44796624779701233, + "rewards/margins": 8.427356719970703, + "rewards/rejected": -7.9793901443481445, + "step": 599, + "train_speed(iter/s)": 0.005409 + }, + { + "epoch": 1.7146047342563644, + "grad_norm": 0.8032998442649841, + "learning_rate": 8.426291121287668e-05, + "logits/chosen": -1.11725914478302, + "logits/rejected": -1.1244605779647827, + "logps/chosen": -4.1861982345581055, + "logps/rejected": -92.41063690185547, + "loss": 0.17941614985466003, + "memory(GiB)": 46.73, + "nll_loss": 0.17137563228607178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.407539427280426, + "rewards/margins": 8.353867530822754, + "rewards/rejected": -7.946327209472656, + "step": 600, + "train_speed(iter/s)": 0.005409 + }, + { + "epoch": 1.7146047342563644, + "eval_logits/chosen": -1.1357148885726929, + "eval_logits/rejected": -1.1456408500671387, + "eval_logps/chosen": -5.507038593292236, + "eval_logps/rejected": -92.07612609863281, + "eval_loss": 0.26907792687416077, + "eval_nll_loss": 0.23485247790813446, + "eval_rewards/accuracies": 0.982300877571106, + "eval_rewards/chosen": 0.42667603492736816, + "eval_rewards/margins": 8.225197792053223, + "eval_rewards/rejected": -7.798521995544434, + "eval_runtime": 265.8083, + "eval_samples_per_second": 0.425, + "eval_steps_per_second": 0.425, + "step": 600 + }, + { + "epoch": 1.71746315319339, + "grad_norm": 0.5689127445220947, + "learning_rate": 8.395087292172921e-05, + "logits/chosen": -1.1845214366912842, + "logits/rejected": -1.2025808095932007, + "logps/chosen": -1.7930316925048828, + "logps/rejected": -115.36644744873047, + "loss": 0.08309746533632278, + "memory(GiB)": 46.73, + "nll_loss": 0.06800209730863571, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.46668967604637146, + "rewards/margins": 10.267763137817383, + "rewards/rejected": -9.80107307434082, + "step": 601, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.7203215721304153, + "grad_norm": 0.4128093421459198, + "learning_rate": 8.363899494701086e-05, + "logits/chosen": -1.1646056175231934, + "logits/rejected": -1.172208547592163, + "logps/chosen": -6.8123860359191895, + "logps/rejected": -94.38031768798828, + "loss": 0.6606139540672302, + "memory(GiB)": 46.73, + "nll_loss": 0.47054457664489746, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.2928743362426758, + "rewards/margins": 8.511747360229492, + "rewards/rejected": -8.218873977661133, + "step": 602, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.7231799910674408, + "grad_norm": 17.9466609954834, + "learning_rate": 8.33272804041038e-05, + "logits/chosen": -1.1903241872787476, + "logits/rejected": -1.2006161212921143, + "logps/chosen": -1.96488618850708, + "logps/rejected": -86.98416900634766, + "loss": 0.19571945071220398, + "memory(GiB)": 46.73, + "nll_loss": 0.12956076860427856, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5292338132858276, + "rewards/margins": 8.149774551391602, + "rewards/rejected": -7.620540618896484, + "step": 603, + "train_speed(iter/s)": 0.005396 + }, + { + "epoch": 1.7260384100044663, + "grad_norm": 0.7187644839286804, + "learning_rate": 8.301573240675752e-05, + "logits/chosen": -1.1262531280517578, + "logits/rejected": -1.140869379043579, + "logps/chosen": -7.186244964599609, + "logps/rejected": -105.5767593383789, + "loss": 0.2748340368270874, + "memory(GiB)": 46.73, + "nll_loss": 0.2181284874677658, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4821949303150177, + "rewards/margins": 8.686951637268066, + "rewards/rejected": -8.204756736755371, + "step": 604, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7288968289414917, + "grad_norm": 1.1701804399490356, + "learning_rate": 8.2704354067058e-05, + "logits/chosen": -1.229970932006836, + "logits/rejected": -1.2415151596069336, + "logps/chosen": -3.912670612335205, + "logps/rejected": -96.19180297851562, + "loss": 0.2875363230705261, + "memory(GiB)": 46.73, + "nll_loss": 0.23937594890594482, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.41248124837875366, + "rewards/margins": 8.670553207397461, + "rewards/rejected": -8.258072853088379, + "step": 605, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7317552478785172, + "grad_norm": 4.315155982971191, + "learning_rate": 8.239314849539638e-05, + "logits/chosen": -1.2182215452194214, + "logits/rejected": -1.2354011535644531, + "logps/chosen": -4.708987712860107, + "logps/rejected": -119.11360168457031, + "loss": 0.5458219647407532, + "memory(GiB)": 46.73, + "nll_loss": 0.40526482462882996, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.22136862576007843, + "rewards/margins": 10.272619247436523, + "rewards/rejected": -10.051248550415039, + "step": 606, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7346136668155427, + "grad_norm": 3.1639983654022217, + "learning_rate": 8.208211880043812e-05, + "logits/chosen": -1.1820584535598755, + "logits/rejected": -1.2001395225524902, + "logps/chosen": -2.4597911834716797, + "logps/rejected": -120.22541809082031, + "loss": 0.1489083170890808, + "memory(GiB)": 46.73, + "nll_loss": 0.12029991298913956, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6557915210723877, + "rewards/margins": 11.194437026977539, + "rewards/rejected": -10.53864574432373, + "step": 607, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.737472085752568, + "grad_norm": 2.4347145557403564, + "learning_rate": 8.17712680890917e-05, + "logits/chosen": -1.212243914604187, + "logits/rejected": -1.22697114944458, + "logps/chosen": -3.6350185871124268, + "logps/rejected": -90.45594787597656, + "loss": 0.1942821741104126, + "memory(GiB)": 46.73, + "nll_loss": 0.1534501016139984, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5750898122787476, + "rewards/margins": 8.578381538391113, + "rewards/rejected": -8.003292083740234, + "step": 608, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7403305046895936, + "grad_norm": 0.6472948789596558, + "learning_rate": 8.146059946647782e-05, + "logits/chosen": -1.2153496742248535, + "logits/rejected": -1.2242867946624756, + "logps/chosen": -3.4136900901794434, + "logps/rejected": -82.82501220703125, + "loss": 0.16542817652225494, + "memory(GiB)": 46.73, + "nll_loss": 0.15195731818675995, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5285678505897522, + "rewards/margins": 7.61013126373291, + "rewards/rejected": -7.081563949584961, + "step": 609, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7431889236266191, + "grad_norm": 0.6857250928878784, + "learning_rate": 8.115011603589826e-05, + "logits/chosen": -1.1793605089187622, + "logits/rejected": -1.1929919719696045, + "logps/chosen": -3.4406254291534424, + "logps/rejected": -98.36747741699219, + "loss": 0.2728448808193207, + "memory(GiB)": 46.73, + "nll_loss": 0.21860109269618988, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5499365329742432, + "rewards/margins": 9.20262622833252, + "rewards/rejected": -8.652688980102539, + "step": 610, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7460473425636445, + "grad_norm": 1.0251792669296265, + "learning_rate": 8.083982089880477e-05, + "logits/chosen": -1.260735273361206, + "logits/rejected": -1.2722655534744263, + "logps/chosen": -2.7653603553771973, + "logps/rejected": -90.46491241455078, + "loss": 0.21464641392230988, + "memory(GiB)": 46.73, + "nll_loss": 0.1605410873889923, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4746001958847046, + "rewards/margins": 8.401023864746094, + "rewards/rejected": -7.926423072814941, + "step": 611, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7489057615006698, + "grad_norm": 1.4469356536865234, + "learning_rate": 8.052971715476842e-05, + "logits/chosen": -1.2575992345809937, + "logits/rejected": -1.2725930213928223, + "logps/chosen": -3.87493896484375, + "logps/rejected": -107.04155731201172, + "loss": 0.2182140350341797, + "memory(GiB)": 46.73, + "nll_loss": 0.16839709877967834, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6470860242843628, + "rewards/margins": 9.724501609802246, + "rewards/rejected": -9.077415466308594, + "step": 612, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7517641804376956, + "grad_norm": 0.9951202273368835, + "learning_rate": 8.021980790144827e-05, + "logits/chosen": -1.2438392639160156, + "logits/rejected": -1.2667877674102783, + "logps/chosen": -2.443464994430542, + "logps/rejected": -111.27606964111328, + "loss": 0.21300199627876282, + "memory(GiB)": 46.73, + "nll_loss": 0.20494098961353302, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.511634349822998, + "rewards/margins": 10.146453857421875, + "rewards/rejected": -9.634819030761719, + "step": 613, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7546225993747209, + "grad_norm": 1.8081765174865723, + "learning_rate": 7.991009623456072e-05, + "logits/chosen": -1.2732195854187012, + "logits/rejected": -1.2859796285629272, + "logps/chosen": -2.8509671688079834, + "logps/rejected": -100.18556213378906, + "loss": 0.18652215600013733, + "memory(GiB)": 46.73, + "nll_loss": 0.14973853528499603, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5410576462745667, + "rewards/margins": 9.196635246276855, + "rewards/rejected": -8.655577659606934, + "step": 614, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7574810183117462, + "grad_norm": 0.7432581782341003, + "learning_rate": 7.960058524784832e-05, + "logits/chosen": -1.2543963193893433, + "logits/rejected": -1.2693120241165161, + "logps/chosen": -3.452606678009033, + "logps/rejected": -120.65855407714844, + "loss": 0.14814871549606323, + "memory(GiB)": 46.73, + "nll_loss": 0.12885232269763947, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4775761365890503, + "rewards/margins": 11.281514167785645, + "rewards/rejected": -10.803937911987305, + "step": 615, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7603394372487717, + "grad_norm": 0.7075319886207581, + "learning_rate": 7.929127803304915e-05, + "logits/chosen": -1.2688357830047607, + "logits/rejected": -1.276627540588379, + "logps/chosen": -4.918938159942627, + "logps/rejected": -106.51580810546875, + "loss": 0.2689712345600128, + "memory(GiB)": 46.73, + "nll_loss": 0.21882139146327972, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3920802175998688, + "rewards/margins": 9.607563972473145, + "rewards/rejected": -9.215483665466309, + "step": 616, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7631978561857973, + "grad_norm": 1.1403652429580688, + "learning_rate": 7.898217767986562e-05, + "logits/chosen": -1.273037314414978, + "logits/rejected": -1.2761380672454834, + "logps/chosen": -6.625821113586426, + "logps/rejected": -85.25454711914062, + "loss": 0.36789366602897644, + "memory(GiB)": 46.73, + "nll_loss": 0.28557538986206055, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.49920541048049927, + "rewards/margins": 7.796347618103027, + "rewards/rejected": -7.297142028808594, + "step": 617, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7660562751228226, + "grad_norm": 9.335824966430664, + "learning_rate": 7.867328727593397e-05, + "logits/chosen": -1.3096352815628052, + "logits/rejected": -1.3141634464263916, + "logps/chosen": -4.814456462860107, + "logps/rejected": -92.47824096679688, + "loss": 0.36238977313041687, + "memory(GiB)": 46.73, + "nll_loss": 0.243287593126297, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.37459686398506165, + "rewards/margins": 8.336633682250977, + "rewards/rejected": -7.962037086486816, + "step": 618, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7689146940598481, + "grad_norm": 1.5570136308670044, + "learning_rate": 7.836460990679313e-05, + "logits/chosen": -1.3636045455932617, + "logits/rejected": -1.3825900554656982, + "logps/chosen": -4.613166332244873, + "logps/rejected": -118.72332000732422, + "loss": 0.2116784155368805, + "memory(GiB)": 46.73, + "nll_loss": 0.209022656083107, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7731083035469055, + "rewards/margins": 10.994028091430664, + "rewards/rejected": -10.22092056274414, + "step": 619, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.7717731129968737, + "grad_norm": 0.7922633290290833, + "learning_rate": 7.805614865585396e-05, + "logits/chosen": -1.3091944456100464, + "logits/rejected": -1.316933035850525, + "logps/chosen": -3.8784146308898926, + "logps/rejected": -126.78861236572266, + "loss": 0.12152136117219925, + "memory(GiB)": 46.73, + "nll_loss": 0.11782631278038025, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4741920828819275, + "rewards/margins": 11.795244216918945, + "rewards/rejected": -11.321053504943848, + "step": 620, + "train_speed(iter/s)": 0.005397 + }, + { + "epoch": 1.774631531933899, + "grad_norm": 0.6836639642715454, + "learning_rate": 7.774790660436858e-05, + "logits/chosen": -1.3928108215332031, + "logits/rejected": -1.4215530157089233, + "logps/chosen": -3.4057624340057373, + "logps/rejected": -142.04086303710938, + "loss": 0.1845034658908844, + "memory(GiB)": 46.73, + "nll_loss": 0.16980323195457458, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5302206873893738, + "rewards/margins": 13.118966102600098, + "rewards/rejected": -12.588746070861816, + "step": 621, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.7774899508709245, + "grad_norm": 6.991085052490234, + "learning_rate": 7.743988683139943e-05, + "logits/chosen": -1.3453571796417236, + "logits/rejected": -1.3684511184692383, + "logps/chosen": -5.252518653869629, + "logps/rejected": -133.31072998046875, + "loss": 0.20858323574066162, + "memory(GiB)": 46.73, + "nll_loss": 0.20254190266132355, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5752936601638794, + "rewards/margins": 12.213183403015137, + "rewards/rejected": -11.637889862060547, + "step": 622, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.78034836980795, + "grad_norm": 4.359181880950928, + "learning_rate": 7.713209241378872e-05, + "logits/chosen": -1.2878490686416626, + "logits/rejected": -1.3060500621795654, + "logps/chosen": -3.2410290241241455, + "logps/rejected": -127.3503646850586, + "loss": 0.17801642417907715, + "memory(GiB)": 46.73, + "nll_loss": 0.17661628127098083, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6783971190452576, + "rewards/margins": 11.938961029052734, + "rewards/rejected": -11.260563850402832, + "step": 623, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.7832067887449754, + "grad_norm": 0.7485926747322083, + "learning_rate": 7.682452642612733e-05, + "logits/chosen": -1.323854923248291, + "logits/rejected": -1.3345876932144165, + "logps/chosen": -7.461188316345215, + "logps/rejected": -113.36080932617188, + "loss": 0.28294721245765686, + "memory(GiB)": 46.73, + "nll_loss": 0.2697088122367859, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7665496468544006, + "rewards/margins": 10.277408599853516, + "rewards/rejected": -9.510859489440918, + "step": 624, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.786065207682001, + "grad_norm": 0.8652713894844055, + "learning_rate": 7.65171919407246e-05, + "logits/chosen": -1.3405261039733887, + "logits/rejected": -1.3571374416351318, + "logps/chosen": -3.0921409130096436, + "logps/rejected": -118.87600708007812, + "loss": 0.17847004532814026, + "memory(GiB)": 46.73, + "nll_loss": 0.14839963614940643, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4123997986316681, + "rewards/margins": 10.91650676727295, + "rewards/rejected": -10.504107475280762, + "step": 625, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.7889236266190265, + "grad_norm": 1.3180344104766846, + "learning_rate": 7.621009202757719e-05, + "logits/chosen": -1.3654556274414062, + "logits/rejected": -1.3729454278945923, + "logps/chosen": -5.795345783233643, + "logps/rejected": -122.83097839355469, + "loss": 0.23871037364006042, + "memory(GiB)": 46.73, + "nll_loss": 0.19673317670822144, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5445254445075989, + "rewards/margins": 11.494521141052246, + "rewards/rejected": -10.949995040893555, + "step": 626, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.7917820455560518, + "grad_norm": 0.6763105392456055, + "learning_rate": 7.590322975433857e-05, + "logits/chosen": -1.3876533508300781, + "logits/rejected": -1.4038093090057373, + "logps/chosen": -4.756526947021484, + "logps/rejected": -113.34770965576172, + "loss": 0.2270170897245407, + "memory(GiB)": 46.73, + "nll_loss": 0.21937969326972961, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7127946615219116, + "rewards/margins": 10.715826034545898, + "rewards/rejected": -10.003030776977539, + "step": 627, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.7946404644930771, + "grad_norm": 1.2457427978515625, + "learning_rate": 7.559660818628855e-05, + "logits/chosen": -1.3642257452011108, + "logits/rejected": -1.3769264221191406, + "logps/chosen": -3.014768123626709, + "logps/rejected": -121.77210235595703, + "loss": 0.14762888848781586, + "memory(GiB)": 46.73, + "nll_loss": 0.14068850874900818, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.375095009803772, + "rewards/margins": 11.27329158782959, + "rewards/rejected": -10.89819622039795, + "step": 628, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.797498883430103, + "grad_norm": 0.8837608098983765, + "learning_rate": 7.529023038630238e-05, + "logits/chosen": -1.3430863618850708, + "logits/rejected": -1.3552993535995483, + "logps/chosen": -5.123016834259033, + "logps/rejected": -108.41499328613281, + "loss": 0.21152086555957794, + "memory(GiB)": 46.73, + "nll_loss": 0.20837949216365814, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6010651588439941, + "rewards/margins": 9.848522186279297, + "rewards/rejected": -9.247457504272461, + "step": 629, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8003573023671282, + "grad_norm": 6.133004188537598, + "learning_rate": 7.49840994148204e-05, + "logits/chosen": -1.344904899597168, + "logits/rejected": -1.367358922958374, + "logps/chosen": -4.031676769256592, + "logps/rejected": -112.61686706542969, + "loss": 0.377747505903244, + "memory(GiB)": 46.73, + "nll_loss": 0.3464767038822174, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5361669063568115, + "rewards/margins": 10.34013557434082, + "rewards/rejected": -9.80396842956543, + "step": 630, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8032157213041535, + "grad_norm": 0.8749508261680603, + "learning_rate": 7.467821832981719e-05, + "logits/chosen": -1.3188172578811646, + "logits/rejected": -1.335577368736267, + "logps/chosen": -5.043167591094971, + "logps/rejected": -112.44739532470703, + "loss": 0.2038888782262802, + "memory(GiB)": 46.73, + "nll_loss": 0.19640286266803741, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6657987236976624, + "rewards/margins": 10.651543617248535, + "rewards/rejected": -9.985745429992676, + "step": 631, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.806074140241179, + "grad_norm": 0.6289976835250854, + "learning_rate": 7.437259018677136e-05, + "logits/chosen": -1.3327033519744873, + "logits/rejected": -1.3480082750320435, + "logps/chosen": -3.615278482437134, + "logps/rejected": -119.2198486328125, + "loss": 0.20541872084140778, + "memory(GiB)": 46.73, + "nll_loss": 0.1953929364681244, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3347194492816925, + "rewards/margins": 10.586311340332031, + "rewards/rejected": -10.251592636108398, + "step": 632, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8089325591782046, + "grad_norm": 1.1460577249526978, + "learning_rate": 7.406721803863475e-05, + "logits/chosen": -1.3531547784805298, + "logits/rejected": -1.3722925186157227, + "logps/chosen": -1.7670950889587402, + "logps/rejected": -140.48046875, + "loss": 0.14490243792533875, + "memory(GiB)": 46.73, + "nll_loss": 0.14003917574882507, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3310070335865021, + "rewards/margins": 13.185526847839355, + "rewards/rejected": -12.854520797729492, + "step": 633, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.81179097811523, + "grad_norm": 4.37379264831543, + "learning_rate": 7.376210493580212e-05, + "logits/chosen": -1.3406105041503906, + "logits/rejected": -1.3556296825408936, + "logps/chosen": -3.7733154296875, + "logps/rejected": -124.59563446044922, + "loss": 0.2903311848640442, + "memory(GiB)": 46.73, + "nll_loss": 0.28832513093948364, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3790757656097412, + "rewards/margins": 11.557982444763184, + "rewards/rejected": -11.178906440734863, + "step": 634, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8146493970522555, + "grad_norm": 4.76070499420166, + "learning_rate": 7.345725392608048e-05, + "logits/chosen": -1.348390817642212, + "logits/rejected": -1.3591151237487793, + "logps/chosen": -5.138166427612305, + "logps/rejected": -115.6446762084961, + "loss": 0.3292956054210663, + "memory(GiB)": 46.73, + "nll_loss": 0.2817382216453552, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.30544814467430115, + "rewards/margins": 10.786002159118652, + "rewards/rejected": -10.48055362701416, + "step": 635, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.817507815989281, + "grad_norm": 1.9394831657409668, + "learning_rate": 7.315266805465883e-05, + "logits/chosen": -1.2964552640914917, + "logits/rejected": -1.3200057744979858, + "logps/chosen": -3.403735399246216, + "logps/rejected": -123.78720092773438, + "loss": 0.17933297157287598, + "memory(GiB)": 46.73, + "nll_loss": 0.17736488580703735, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5881022214889526, + "rewards/margins": 11.664973258972168, + "rewards/rejected": -11.07686996459961, + "step": 636, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8203662349263063, + "grad_norm": 0.8564069867134094, + "learning_rate": 7.284835036407776e-05, + "logits/chosen": -1.336266279220581, + "logits/rejected": -1.3451544046401978, + "logps/chosen": -4.740027904510498, + "logps/rejected": -113.02291107177734, + "loss": 0.27193519473075867, + "memory(GiB)": 46.73, + "nll_loss": 0.21789833903312683, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5400663614273071, + "rewards/margins": 10.416783332824707, + "rewards/rejected": -9.876716613769531, + "step": 637, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8232246538633319, + "grad_norm": 0.9509347081184387, + "learning_rate": 7.254430389419879e-05, + "logits/chosen": -1.270435094833374, + "logits/rejected": -1.2815449237823486, + "logps/chosen": -3.3484411239624023, + "logps/rejected": -110.3446044921875, + "loss": 0.18270909786224365, + "memory(GiB)": 46.73, + "nll_loss": 0.16942772269248962, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.512046217918396, + "rewards/margins": 10.352546691894531, + "rewards/rejected": -9.840499877929688, + "step": 638, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8260830728003574, + "grad_norm": 0.5768864750862122, + "learning_rate": 7.22405316821744e-05, + "logits/chosen": -1.3135160207748413, + "logits/rejected": -1.3353259563446045, + "logps/chosen": -2.1458687782287598, + "logps/rejected": -120.35028076171875, + "loss": 0.1152193695306778, + "memory(GiB)": 46.73, + "nll_loss": 0.10469970852136612, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.46638453006744385, + "rewards/margins": 10.977595329284668, + "rewards/rejected": -10.511210441589355, + "step": 639, + "train_speed(iter/s)": 0.005398 + }, + { + "epoch": 1.8289414917373827, + "grad_norm": 0.7836558818817139, + "learning_rate": 7.193703676241725e-05, + "logits/chosen": -1.2732415199279785, + "logits/rejected": -1.2796140909194946, + "logps/chosen": -5.664248466491699, + "logps/rejected": -91.83935546875, + "loss": 0.41713982820510864, + "memory(GiB)": 46.73, + "nll_loss": 0.32591503858566284, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4501730799674988, + "rewards/margins": 8.382551193237305, + "rewards/rejected": -7.932378768920898, + "step": 640, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.831799910674408, + "grad_norm": 0.8730625510215759, + "learning_rate": 7.163382216657034e-05, + "logits/chosen": -1.2692418098449707, + "logits/rejected": -1.301629662513733, + "logps/chosen": -1.288639783859253, + "logps/rejected": -160.97267150878906, + "loss": 0.09459640830755234, + "memory(GiB)": 46.73, + "nll_loss": 0.09011334925889969, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4853152632713318, + "rewards/margins": 14.271899223327637, + "rewards/rejected": -13.786584854125977, + "step": 641, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8346583296114338, + "grad_norm": 0.5060243606567383, + "learning_rate": 7.133089092347627e-05, + "logits/chosen": -1.2539950609207153, + "logits/rejected": -1.2674380540847778, + "logps/chosen": -4.00560188293457, + "logps/rejected": -111.9576187133789, + "loss": 0.2435949742794037, + "memory(GiB)": 46.73, + "nll_loss": 0.24140885472297668, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6132622957229614, + "rewards/margins": 10.611983299255371, + "rewards/rejected": -9.998720169067383, + "step": 642, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8375167485484591, + "grad_norm": 1.167800784111023, + "learning_rate": 7.102824605914735e-05, + "logits/chosen": -1.264164924621582, + "logits/rejected": -1.2702038288116455, + "logps/chosen": -5.026443958282471, + "logps/rejected": -101.44984436035156, + "loss": 0.26005586981773376, + "memory(GiB)": 46.73, + "nll_loss": 0.22672684490680695, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48070228099823, + "rewards/margins": 9.517464637756348, + "rewards/rejected": -9.036762237548828, + "step": 643, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8403751674854845, + "grad_norm": 0.7475759983062744, + "learning_rate": 7.072589059673514e-05, + "logits/chosen": -1.3097971677780151, + "logits/rejected": -1.3304953575134277, + "logps/chosen": -3.952174186706543, + "logps/rejected": -125.90980529785156, + "loss": 0.3319244682788849, + "memory(GiB)": 46.73, + "nll_loss": 0.21963773667812347, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3299381732940674, + "rewards/margins": 11.375055313110352, + "rewards/rejected": -11.04511833190918, + "step": 644, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.84323358642251, + "grad_norm": 19.21202278137207, + "learning_rate": 7.042382755650032e-05, + "logits/chosen": -1.2788704633712769, + "logits/rejected": -1.3028172254562378, + "logps/chosen": -3.9370901584625244, + "logps/rejected": -126.76161193847656, + "loss": 0.16361507773399353, + "memory(GiB)": 46.73, + "nll_loss": 0.13888728618621826, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.47258222103118896, + "rewards/margins": 11.63074779510498, + "rewards/rejected": -11.158166885375977, + "step": 645, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8460920053595355, + "grad_norm": 0.6701921820640564, + "learning_rate": 7.012205995578267e-05, + "logits/chosen": -1.2379904985427856, + "logits/rejected": -1.2615790367126465, + "logps/chosen": -2.9081027507781982, + "logps/rejected": -123.61541748046875, + "loss": 0.16233164072036743, + "memory(GiB)": 46.73, + "nll_loss": 0.1606723517179489, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4661065340042114, + "rewards/margins": 11.18898868560791, + "rewards/rejected": -10.722882270812988, + "step": 646, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8489504242965609, + "grad_norm": 0.7222447395324707, + "learning_rate": 6.982059080897059e-05, + "logits/chosen": -1.2836098670959473, + "logits/rejected": -1.2917486429214478, + "logps/chosen": -3.8639073371887207, + "logps/rejected": -104.71327209472656, + "loss": 0.21296782791614532, + "memory(GiB)": 46.73, + "nll_loss": 0.1951403170824051, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5273296236991882, + "rewards/margins": 9.60672378540039, + "rewards/rejected": -9.079394340515137, + "step": 647, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.8518088432335864, + "grad_norm": 0.7563202977180481, + "learning_rate": 6.951942312747134e-05, + "logits/chosen": -1.2675378322601318, + "logits/rejected": -1.2755509614944458, + "logps/chosen": -6.645654201507568, + "logps/rejected": -103.13592529296875, + "loss": 0.27974945306777954, + "memory(GiB)": 46.73, + "nll_loss": 0.2530043423175812, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.584045946598053, + "rewards/margins": 9.444131851196289, + "rewards/rejected": -8.860086441040039, + "step": 648, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.854667262170612, + "grad_norm": 1.215735912322998, + "learning_rate": 6.921855991968078e-05, + "logits/chosen": -1.2765772342681885, + "logits/rejected": -1.2841192483901978, + "logps/chosen": -4.45599889755249, + "logps/rejected": -110.97665405273438, + "loss": 0.21567204594612122, + "memory(GiB)": 46.73, + "nll_loss": 0.18534396588802338, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.39356788992881775, + "rewards/margins": 10.287214279174805, + "rewards/rejected": -9.893646240234375, + "step": 649, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8575256811076373, + "grad_norm": 2.7902543544769287, + "learning_rate": 6.891800419095335e-05, + "logits/chosen": -1.3014237880706787, + "logits/rejected": -1.312886118888855, + "logps/chosen": -6.769974708557129, + "logps/rejected": -116.2103042602539, + "loss": 0.25906240940093994, + "memory(GiB)": 46.73, + "nll_loss": 0.23928385972976685, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7981483936309814, + "rewards/margins": 10.857406616210938, + "rewards/rejected": -10.059259414672852, + "step": 650, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8603841000446628, + "grad_norm": 1.3061541318893433, + "learning_rate": 6.861775894357198e-05, + "logits/chosen": -1.2520601749420166, + "logits/rejected": -1.262779712677002, + "logps/chosen": -5.169130802154541, + "logps/rejected": -106.49501037597656, + "loss": 0.24649611115455627, + "memory(GiB)": 46.73, + "nll_loss": 0.22475162148475647, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6006129384040833, + "rewards/margins": 9.921269416809082, + "rewards/rejected": -9.320656776428223, + "step": 651, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8632425189816884, + "grad_norm": 1.1500881910324097, + "learning_rate": 6.831782717671828e-05, + "logits/chosen": -1.3243428468704224, + "logits/rejected": -1.3408803939819336, + "logps/chosen": -3.5129246711730957, + "logps/rejected": -114.7535629272461, + "loss": 0.16800451278686523, + "memory(GiB)": 46.73, + "nll_loss": 0.1650160849094391, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5265602469444275, + "rewards/margins": 10.674477577209473, + "rewards/rejected": -10.147916793823242, + "step": 652, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8661009379187137, + "grad_norm": 0.8044180870056152, + "learning_rate": 6.801821188644242e-05, + "logits/chosen": -1.36525297164917, + "logits/rejected": -1.375981092453003, + "logps/chosen": -3.876332998275757, + "logps/rejected": -103.86865234375, + "loss": 0.2005651891231537, + "memory(GiB)": 46.73, + "nll_loss": 0.17257581651210785, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6263987421989441, + "rewards/margins": 9.682666778564453, + "rewards/rejected": -9.056267738342285, + "step": 653, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8689593568557392, + "grad_norm": 0.7117923498153687, + "learning_rate": 6.771891606563318e-05, + "logits/chosen": -1.2599382400512695, + "logits/rejected": -1.274010419845581, + "logps/chosen": -3.5532844066619873, + "logps/rejected": -107.72050476074219, + "loss": 0.2625138461589813, + "memory(GiB)": 46.73, + "nll_loss": 0.21689662337303162, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3454374074935913, + "rewards/margins": 9.692204475402832, + "rewards/rejected": -9.34676742553711, + "step": 654, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8718177757927648, + "grad_norm": 2.125316858291626, + "learning_rate": 6.741994270398826e-05, + "logits/chosen": -1.330776572227478, + "logits/rejected": -1.344359040260315, + "logps/chosen": -3.1112051010131836, + "logps/rejected": -106.1573715209961, + "loss": 0.16326259076595306, + "memory(GiB)": 46.73, + "nll_loss": 0.16014985740184784, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44455885887145996, + "rewards/margins": 9.886975288391113, + "rewards/rejected": -9.442416191101074, + "step": 655, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.87467619472979, + "grad_norm": 0.7575691342353821, + "learning_rate": 6.71212947879842e-05, + "logits/chosen": -1.3439936637878418, + "logits/rejected": -1.356628179550171, + "logps/chosen": -2.2696585655212402, + "logps/rejected": -101.44575500488281, + "loss": 0.14300636947155, + "memory(GiB)": 46.73, + "nll_loss": 0.13764385879039764, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5373290181159973, + "rewards/margins": 9.317428588867188, + "rewards/rejected": -8.780098915100098, + "step": 656, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8775346136668154, + "grad_norm": 0.592279314994812, + "learning_rate": 6.682297530084664e-05, + "logits/chosen": -1.3380376100540161, + "logits/rejected": -1.3524363040924072, + "logps/chosen": -6.481423377990723, + "logps/rejected": -113.6147689819336, + "loss": 0.26005515456199646, + "memory(GiB)": 46.73, + "nll_loss": 0.25132831931114197, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6584410071372986, + "rewards/margins": 10.201264381408691, + "rewards/rejected": -9.54282283782959, + "step": 657, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8803930326038412, + "grad_norm": 0.8957412242889404, + "learning_rate": 6.652498722252049e-05, + "logits/chosen": -1.2798575162887573, + "logits/rejected": -1.2862627506256104, + "logps/chosen": -4.732370853424072, + "logps/rejected": -89.04149627685547, + "loss": 0.3374495506286621, + "memory(GiB)": 46.73, + "nll_loss": 0.30817681550979614, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4829080104827881, + "rewards/margins": 8.177124977111816, + "rewards/rejected": -7.694216728210449, + "step": 658, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8832514515408665, + "grad_norm": 1.277299165725708, + "learning_rate": 6.622733352964025e-05, + "logits/chosen": -1.3507089614868164, + "logits/rejected": -1.3629826307296753, + "logps/chosen": -4.253856182098389, + "logps/rejected": -99.68025970458984, + "loss": 0.20950721204280853, + "memory(GiB)": 46.73, + "nll_loss": 0.1871398240327835, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4054906964302063, + "rewards/margins": 9.246431350708008, + "rewards/rejected": -8.840941429138184, + "step": 659, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8861098704778918, + "grad_norm": 0.8714025616645813, + "learning_rate": 6.593001719550016e-05, + "logits/chosen": -1.296878695487976, + "logits/rejected": -1.3038222789764404, + "logps/chosen": -4.94182014465332, + "logps/rejected": -94.9803466796875, + "loss": 0.19033871591091156, + "memory(GiB)": 46.73, + "nll_loss": 0.17941981554031372, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.42471638321876526, + "rewards/margins": 8.327040672302246, + "rewards/rejected": -7.902324676513672, + "step": 660, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8889682894149173, + "grad_norm": 0.8253157138824463, + "learning_rate": 6.563304119002451e-05, + "logits/chosen": -1.3093528747558594, + "logits/rejected": -1.3244248628616333, + "logps/chosen": -5.993863105773926, + "logps/rejected": -100.63095092773438, + "loss": 0.5593117475509644, + "memory(GiB)": 46.73, + "nll_loss": 0.4283536970615387, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5702846050262451, + "rewards/margins": 9.172146797180176, + "rewards/rejected": -8.601861000061035, + "step": 661, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8918267083519429, + "grad_norm": 25.315296173095703, + "learning_rate": 6.533640847973808e-05, + "logits/chosen": -1.2889041900634766, + "logits/rejected": -1.2987148761749268, + "logps/chosen": -3.3531904220581055, + "logps/rejected": -101.64501190185547, + "loss": 0.15289689600467682, + "memory(GiB)": 46.73, + "nll_loss": 0.13183356821537018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6400858759880066, + "rewards/margins": 9.589509010314941, + "rewards/rejected": -8.949423789978027, + "step": 662, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8946851272889682, + "grad_norm": 0.6394268870353699, + "learning_rate": 6.50401220277364e-05, + "logits/chosen": -1.2872529029846191, + "logits/rejected": -1.3098706007003784, + "logps/chosen": -4.84055757522583, + "logps/rejected": -112.51201629638672, + "loss": 0.5871531367301941, + "memory(GiB)": 46.73, + "nll_loss": 0.43112945556640625, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.48831021785736084, + "rewards/margins": 10.27175521850586, + "rewards/rejected": -9.783445358276367, + "step": 663, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.8975435462259937, + "grad_norm": 2.8964788913726807, + "learning_rate": 6.474418479365622e-05, + "logits/chosen": -1.282837986946106, + "logits/rejected": -1.285774827003479, + "logps/chosen": -8.157180786132812, + "logps/rejected": -92.5395278930664, + "loss": 0.2315860092639923, + "memory(GiB)": 46.73, + "nll_loss": 0.2284000813961029, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7858994007110596, + "rewards/margins": 8.78559684753418, + "rewards/rejected": -7.999697685241699, + "step": 664, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9004019651630193, + "grad_norm": 0.8511047959327698, + "learning_rate": 6.444859973364587e-05, + "logits/chosen": -1.2938660383224487, + "logits/rejected": -1.3118674755096436, + "logps/chosen": -3.9691340923309326, + "logps/rejected": -106.54265594482422, + "loss": 0.2253965139389038, + "memory(GiB)": 46.73, + "nll_loss": 0.15968890488147736, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49960803985595703, + "rewards/margins": 9.341988563537598, + "rewards/rejected": -8.842381477355957, + "step": 665, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9032603841000446, + "grad_norm": 0.5567864775657654, + "learning_rate": 6.415336980033585e-05, + "logits/chosen": -1.30922532081604, + "logits/rejected": -1.328365683555603, + "logps/chosen": -2.8081579208374023, + "logps/rejected": -113.6122817993164, + "loss": 0.20439419150352478, + "memory(GiB)": 46.73, + "nll_loss": 0.18372051417827606, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3098168969154358, + "rewards/margins": 10.348260879516602, + "rewards/rejected": -10.038445472717285, + "step": 666, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9061188030370702, + "grad_norm": 9.81278133392334, + "learning_rate": 6.385849794280915e-05, + "logits/chosen": -1.316828727722168, + "logits/rejected": -1.3409326076507568, + "logps/chosen": -2.031130075454712, + "logps/rejected": -106.19338989257812, + "loss": 0.14540082216262817, + "memory(GiB)": 46.73, + "nll_loss": 0.11819420754909515, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6250270009040833, + "rewards/margins": 9.933358192443848, + "rewards/rejected": -9.308330535888672, + "step": 667, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9089772219740957, + "grad_norm": 2.9741618633270264, + "learning_rate": 6.3563987106572e-05, + "logits/chosen": -1.2994283437728882, + "logits/rejected": -1.3059117794036865, + "logps/chosen": -4.3763322830200195, + "logps/rejected": -98.63020324707031, + "loss": 0.20989640057086945, + "memory(GiB)": 46.73, + "nll_loss": 0.20499569177627563, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4033859074115753, + "rewards/margins": 8.991562843322754, + "rewards/rejected": -8.588177680969238, + "step": 668, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.911835640911121, + "grad_norm": 0.934133768081665, + "learning_rate": 6.326984023352435e-05, + "logits/chosen": -1.2849228382110596, + "logits/rejected": -1.304962396621704, + "logps/chosen": -2.7252705097198486, + "logps/rejected": -114.20394134521484, + "loss": 0.16401462256908417, + "memory(GiB)": 46.73, + "nll_loss": 0.16158060729503632, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6825951337814331, + "rewards/margins": 10.86156940460205, + "rewards/rejected": -10.178974151611328, + "step": 669, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9146940598481463, + "grad_norm": 0.706195592880249, + "learning_rate": 6.297606026193036e-05, + "logits/chosen": -1.2965331077575684, + "logits/rejected": -1.3067684173583984, + "logps/chosen": -5.783702850341797, + "logps/rejected": -102.84695434570312, + "loss": 0.23226682841777802, + "memory(GiB)": 46.73, + "nll_loss": 0.22864435613155365, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.47119635343551636, + "rewards/margins": 9.723640441894531, + "rewards/rejected": -9.252445220947266, + "step": 670, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.917552478785172, + "grad_norm": 0.7782325744628906, + "learning_rate": 6.268265012638934e-05, + "logits/chosen": -1.3040504455566406, + "logits/rejected": -1.3242979049682617, + "logps/chosen": -5.526919841766357, + "logps/rejected": -114.40222930908203, + "loss": 0.2729805111885071, + "memory(GiB)": 46.73, + "nll_loss": 0.26506656408309937, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4165946841239929, + "rewards/margins": 10.218692779541016, + "rewards/rejected": -9.802099227905273, + "step": 671, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9204108977221974, + "grad_norm": 1.7584947347640991, + "learning_rate": 6.238961275780613e-05, + "logits/chosen": -1.329121470451355, + "logits/rejected": -1.3434271812438965, + "logps/chosen": -5.148283958435059, + "logps/rejected": -106.88273620605469, + "loss": 0.16379527747631073, + "memory(GiB)": 46.73, + "nll_loss": 0.15229424834251404, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41878870129585266, + "rewards/margins": 9.952224731445312, + "rewards/rejected": -9.53343677520752, + "step": 672, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9232693166592227, + "grad_norm": 0.772023618221283, + "learning_rate": 6.209695108336211e-05, + "logits/chosen": -1.324845314025879, + "logits/rejected": -1.3292207717895508, + "logps/chosen": -3.755115032196045, + "logps/rejected": -98.88433837890625, + "loss": 0.22213026881217957, + "memory(GiB)": 46.73, + "nll_loss": 0.19585399329662323, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5098289847373962, + "rewards/margins": 9.438490867614746, + "rewards/rejected": -8.928662300109863, + "step": 673, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9261277355962483, + "grad_norm": 0.6828939318656921, + "learning_rate": 6.180466802648563e-05, + "logits/chosen": -1.3263074159622192, + "logits/rejected": -1.3385473489761353, + "logps/chosen": -2.9277350902557373, + "logps/rejected": -107.61619567871094, + "loss": 0.18101422488689423, + "memory(GiB)": 46.73, + "nll_loss": 0.15924564003944397, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3217340111732483, + "rewards/margins": 9.498228073120117, + "rewards/rejected": -9.176494598388672, + "step": 674, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9289861545332738, + "grad_norm": 1.5087296962738037, + "learning_rate": 6.151276650682315e-05, + "logits/chosen": -1.2586640119552612, + "logits/rejected": -1.27299165725708, + "logps/chosen": -4.842021465301514, + "logps/rejected": -110.8651123046875, + "loss": 0.2104535698890686, + "memory(GiB)": 46.73, + "nll_loss": 0.19624516367912292, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6069389581680298, + "rewards/margins": 9.962318420410156, + "rewards/rejected": -9.355380058288574, + "step": 675, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9318445734702991, + "grad_norm": 0.7660964727401733, + "learning_rate": 6.122124944020977e-05, + "logits/chosen": -1.2959116697311401, + "logits/rejected": -1.3225114345550537, + "logps/chosen": -4.718099117279053, + "logps/rejected": -125.47923278808594, + "loss": 0.5585540533065796, + "memory(GiB)": 46.73, + "nll_loss": 0.4054650068283081, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4143763482570648, + "rewards/margins": 10.734457969665527, + "rewards/rejected": -10.32008171081543, + "step": 676, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9347029924073247, + "grad_norm": 2.9249446392059326, + "learning_rate": 6.0930119738640445e-05, + "logits/chosen": -1.282720685005188, + "logits/rejected": -1.2819023132324219, + "logps/chosen": -6.72110652923584, + "logps/rejected": -87.6020736694336, + "loss": 0.2858355939388275, + "memory(GiB)": 46.73, + "nll_loss": 0.2798173427581787, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6944171786308289, + "rewards/margins": 8.2020902633667, + "rewards/rejected": -7.5076727867126465, + "step": 677, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9375614113443502, + "grad_norm": 3.115387439727783, + "learning_rate": 6.063938031024048e-05, + "logits/chosen": -1.2956721782684326, + "logits/rejected": -1.3137578964233398, + "logps/chosen": -4.9737958908081055, + "logps/rejected": -103.87081146240234, + "loss": 0.41333433985710144, + "memory(GiB)": 46.73, + "nll_loss": 0.32286494970321655, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4960055649280548, + "rewards/margins": 8.867454528808594, + "rewards/rejected": -8.37144947052002, + "step": 678, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9404198302813755, + "grad_norm": 8.556899070739746, + "learning_rate": 6.034903405923681e-05, + "logits/chosen": -1.3017889261245728, + "logits/rejected": -1.3088685274124146, + "logps/chosen": -5.11128044128418, + "logps/rejected": -89.395263671875, + "loss": 0.23161855340003967, + "memory(GiB)": 46.73, + "nll_loss": 0.209635391831398, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.551887571811676, + "rewards/margins": 8.253191947937012, + "rewards/rejected": -7.7013044357299805, + "step": 679, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.943278249218401, + "grad_norm": 0.6750122308731079, + "learning_rate": 6.0059083885928926e-05, + "logits/chosen": -1.3443058729171753, + "logits/rejected": -1.3679203987121582, + "logps/chosen": -4.200978755950928, + "logps/rejected": -121.6429672241211, + "loss": 0.14882132411003113, + "memory(GiB)": 46.73, + "nll_loss": 0.14047406613826752, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6916794180870056, + "rewards/margins": 11.149093627929688, + "rewards/rejected": -10.457413673400879, + "step": 680, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9461366681554266, + "grad_norm": 3.7811436653137207, + "learning_rate": 5.976953268665971e-05, + "logits/chosen": -1.3269189596176147, + "logits/rejected": -1.3355252742767334, + "logps/chosen": -4.741105079650879, + "logps/rejected": -95.5803451538086, + "loss": 0.18303585052490234, + "memory(GiB)": 46.73, + "nll_loss": 0.14606527984142303, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8169770240783691, + "rewards/margins": 8.926080703735352, + "rewards/rejected": -8.109103202819824, + "step": 681, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.948995087092452, + "grad_norm": 0.9065592288970947, + "learning_rate": 5.948038335378683e-05, + "logits/chosen": -1.2741483449935913, + "logits/rejected": -1.288372278213501, + "logps/chosen": -3.3015213012695312, + "logps/rejected": -83.7618637084961, + "loss": 0.2943568825721741, + "memory(GiB)": 46.73, + "nll_loss": 0.21783985197544098, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.5525356531143188, + "rewards/margins": 7.655857563018799, + "rewards/rejected": -7.103321552276611, + "step": 682, + "train_speed(iter/s)": 0.005399 + }, + { + "epoch": 1.9518535060294775, + "grad_norm": 1.0822813510894775, + "learning_rate": 5.91916387756535e-05, + "logits/chosen": -1.3422785997390747, + "logits/rejected": -1.353929042816162, + "logps/chosen": -3.696439027786255, + "logps/rejected": -83.76953887939453, + "loss": 0.2142258882522583, + "memory(GiB)": 46.73, + "nll_loss": 0.17013080418109894, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6672707200050354, + "rewards/margins": 7.74099063873291, + "rewards/rejected": -7.073719501495361, + "step": 683, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.954711924966503, + "grad_norm": 0.7260097861289978, + "learning_rate": 5.8903301836559966e-05, + "logits/chosen": -1.370530605316162, + "logits/rejected": -1.3802154064178467, + "logps/chosen": -6.263431549072266, + "logps/rejected": -87.44656372070312, + "loss": 0.3457471430301666, + "memory(GiB)": 46.73, + "nll_loss": 0.3114210367202759, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4694344103336334, + "rewards/margins": 7.827997207641602, + "rewards/rejected": -7.358563423156738, + "step": 684, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9575703439035284, + "grad_norm": 0.98732590675354, + "learning_rate": 5.861537541673436e-05, + "logits/chosen": -1.292124629020691, + "logits/rejected": -1.304084062576294, + "logps/chosen": -4.441066265106201, + "logps/rejected": -99.29835510253906, + "loss": 0.40864118933677673, + "memory(GiB)": 46.73, + "nll_loss": 0.35176336765289307, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3288501501083374, + "rewards/margins": 8.98994255065918, + "rewards/rejected": -8.661092758178711, + "step": 685, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9604287628405537, + "grad_norm": 2.8306355476379395, + "learning_rate": 5.832786239230415e-05, + "logits/chosen": -1.341307282447815, + "logits/rejected": -1.3494575023651123, + "logps/chosen": -4.303823471069336, + "logps/rejected": -108.20519256591797, + "loss": 0.20767070353031158, + "memory(GiB)": 46.73, + "nll_loss": 0.16874229907989502, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5772908926010132, + "rewards/margins": 9.876459121704102, + "rewards/rejected": -9.29916763305664, + "step": 686, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9632871817775794, + "grad_norm": 1.0595661401748657, + "learning_rate": 5.804076563526744e-05, + "logits/chosen": -1.3210382461547852, + "logits/rejected": -1.335936427116394, + "logps/chosen": -1.7512412071228027, + "logps/rejected": -107.4802474975586, + "loss": 0.14855973422527313, + "memory(GiB)": 46.73, + "nll_loss": 0.10580422729253769, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.47398966550827026, + "rewards/margins": 10.063344955444336, + "rewards/rejected": -9.58935546875, + "step": 687, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9661456007146048, + "grad_norm": 1.0690404176712036, + "learning_rate": 5.775408801346407e-05, + "logits/chosen": -1.3550838232040405, + "logits/rejected": -1.356623649597168, + "logps/chosen": -5.809085845947266, + "logps/rejected": -89.94126892089844, + "loss": 0.27439332008361816, + "memory(GiB)": 46.73, + "nll_loss": 0.22611746191978455, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6475862264633179, + "rewards/margins": 8.384334564208984, + "rewards/rejected": -7.736748695373535, + "step": 688, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.96900401965163, + "grad_norm": 2.0467631816864014, + "learning_rate": 5.746783239054721e-05, + "logits/chosen": -1.3741295337677002, + "logits/rejected": -1.3841922283172607, + "logps/chosen": -4.964568138122559, + "logps/rejected": -88.7358169555664, + "loss": 0.6663780212402344, + "memory(GiB)": 46.73, + "nll_loss": 0.607894778251648, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.4510470926761627, + "rewards/margins": 8.151575088500977, + "rewards/rejected": -7.700528144836426, + "step": 689, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9718624385886556, + "grad_norm": 9.836221694946289, + "learning_rate": 5.718200162595449e-05, + "logits/chosen": -1.363444209098816, + "logits/rejected": -1.374962329864502, + "logps/chosen": -5.092153072357178, + "logps/rejected": -94.88340759277344, + "loss": 0.20714730024337769, + "memory(GiB)": 46.73, + "nll_loss": 0.18801794946193695, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4679247736930847, + "rewards/margins": 8.542611122131348, + "rewards/rejected": -8.074687004089355, + "step": 690, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9747208575256812, + "grad_norm": 0.7933641672134399, + "learning_rate": 5.6896598574879745e-05, + "logits/chosen": -1.2816342115402222, + "logits/rejected": -1.2929383516311646, + "logps/chosen": -3.448430299758911, + "logps/rejected": -86.89325714111328, + "loss": 0.19773589074611664, + "memory(GiB)": 46.73, + "nll_loss": 0.16216182708740234, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.45908814668655396, + "rewards/margins": 7.683626651763916, + "rewards/rejected": -7.2245378494262695, + "step": 691, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9775792764627065, + "grad_norm": 0.7447614073753357, + "learning_rate": 5.6611626088244194e-05, + "logits/chosen": -1.2754361629486084, + "logits/rejected": -1.2913568019866943, + "logps/chosen": -4.723841667175293, + "logps/rejected": -114.28559875488281, + "loss": 0.217029869556427, + "memory(GiB)": 46.73, + "nll_loss": 0.21108339726924896, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.552419900894165, + "rewards/margins": 10.366623878479004, + "rewards/rejected": -9.814202308654785, + "step": 692, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.980437695399732, + "grad_norm": 0.7340989708900452, + "learning_rate": 5.632708701266822e-05, + "logits/chosen": -1.3483805656433105, + "logits/rejected": -1.361656904220581, + "logps/chosen": -3.649254322052002, + "logps/rejected": -94.763916015625, + "loss": 0.11617171764373779, + "memory(GiB)": 46.73, + "nll_loss": 0.10703612118959427, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5086368918418884, + "rewards/margins": 8.350646018981934, + "rewards/rejected": -7.842009544372559, + "step": 693, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9832961143367576, + "grad_norm": 0.5886948704719543, + "learning_rate": 5.6042984190442797e-05, + "logits/chosen": -1.3470284938812256, + "logits/rejected": -1.3555852174758911, + "logps/chosen": -3.8740155696868896, + "logps/rejected": -85.09982299804688, + "loss": 0.24540625512599945, + "memory(GiB)": 46.73, + "nll_loss": 0.21094366908073425, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6043745279312134, + "rewards/margins": 7.761390209197998, + "rewards/rejected": -7.157015800476074, + "step": 694, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9861545332737829, + "grad_norm": 0.9088613986968994, + "learning_rate": 5.5759320459500996e-05, + "logits/chosen": -1.294097900390625, + "logits/rejected": -1.301591396331787, + "logps/chosen": -8.632216453552246, + "logps/rejected": -86.00621032714844, + "loss": 0.31499531865119934, + "memory(GiB)": 46.73, + "nll_loss": 0.30169758200645447, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7339040040969849, + "rewards/margins": 7.947988510131836, + "rewards/rejected": -7.214084625244141, + "step": 695, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9890129522108084, + "grad_norm": 0.9410954713821411, + "learning_rate": 5.547609865338994e-05, + "logits/chosen": -1.3490209579467773, + "logits/rejected": -1.36653470993042, + "logps/chosen": -3.855334520339966, + "logps/rejected": -100.82417297363281, + "loss": 0.1946963518857956, + "memory(GiB)": 46.73, + "nll_loss": 0.1695217490196228, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4291667640209198, + "rewards/margins": 8.582954406738281, + "rewards/rejected": -8.153787612915039, + "step": 696, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.991871371147834, + "grad_norm": 0.9446479678153992, + "learning_rate": 5.5193321601242156e-05, + "logits/chosen": -1.2942531108856201, + "logits/rejected": -1.3041220903396606, + "logps/chosen": -6.212667465209961, + "logps/rejected": -99.26578521728516, + "loss": 0.28405243158340454, + "memory(GiB)": 46.73, + "nll_loss": 0.24633678793907166, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.45503294467926025, + "rewards/margins": 9.119531631469727, + "rewards/rejected": -8.664498329162598, + "step": 697, + "train_speed(iter/s)": 0.0054 + }, + { + "epoch": 1.9947297900848593, + "grad_norm": 0.801936686038971, + "learning_rate": 5.491099212774763e-05, + "logits/chosen": -1.3422621488571167, + "logits/rejected": -1.3603028059005737, + "logps/chosen": -2.1552841663360596, + "logps/rejected": -95.64045715332031, + "loss": 0.17218460142612457, + "memory(GiB)": 46.73, + "nll_loss": 0.16264331340789795, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3500121235847473, + "rewards/margins": 8.44575309753418, + "rewards/rejected": -8.09574031829834, + "step": 698, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 1.9975882090218846, + "grad_norm": 0.893062174320221, + "learning_rate": 5.462911305312526e-05, + "logits/chosen": -1.3398520946502686, + "logits/rejected": -1.3459690809249878, + "logps/chosen": -2.4024996757507324, + "logps/rejected": -91.11569213867188, + "loss": 0.1802024245262146, + "memory(GiB)": 46.73, + "nll_loss": 0.12556976079940796, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4403124749660492, + "rewards/margins": 8.568432807922363, + "rewards/rejected": -8.128119468688965, + "step": 699, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0, + "grad_norm": 5.554687023162842, + "learning_rate": 5.434768719309501e-05, + "logits/chosen": -1.3195669651031494, + "logits/rejected": -1.3334029912948608, + "logps/chosen": -3.12284255027771, + "logps/rejected": -90.41193389892578, + "loss": 0.19962038099765778, + "memory(GiB)": 46.73, + "nll_loss": 0.15631449222564697, + "rewards/accuracies": 0.9629629850387573, + "rewards/chosen": 0.4614593982696533, + "rewards/margins": 7.9853901863098145, + "rewards/rejected": -7.52393102645874, + "step": 700, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.0028584189370253, + "grad_norm": 0.7382018566131592, + "learning_rate": 5.406671735884958e-05, + "logits/chosen": -1.31937837600708, + "logits/rejected": -1.3208019733428955, + "logps/chosen": -3.603522300720215, + "logps/rejected": -82.04541015625, + "loss": 0.21211326122283936, + "memory(GiB)": 46.73, + "nll_loss": 0.15621349215507507, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5101105570793152, + "rewards/margins": 7.389132499694824, + "rewards/rejected": -6.879022598266602, + "step": 701, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.005716837874051, + "grad_norm": 0.6500789523124695, + "learning_rate": 5.378620635702643e-05, + "logits/chosen": -1.3107669353485107, + "logits/rejected": -1.3187661170959473, + "logps/chosen": -2.401862382888794, + "logps/rejected": -74.21663665771484, + "loss": 0.19214877486228943, + "memory(GiB)": 46.73, + "nll_loss": 0.15796902775764465, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6314170956611633, + "rewards/margins": 6.921903610229492, + "rewards/rejected": -6.2904863357543945, + "step": 702, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0085752568110764, + "grad_norm": 0.5643107891082764, + "learning_rate": 5.35061569896796e-05, + "logits/chosen": -1.3577075004577637, + "logits/rejected": -1.3637503385543823, + "logps/chosen": -3.0552637577056885, + "logps/rejected": -72.03173065185547, + "loss": 0.13705869019031525, + "memory(GiB)": 46.73, + "nll_loss": 0.1205982118844986, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5661800503730774, + "rewards/margins": 6.688817024230957, + "rewards/rejected": -6.122636795043945, + "step": 703, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0114336757481017, + "grad_norm": 0.8152499198913574, + "learning_rate": 5.322657205425183e-05, + "logits/chosen": -1.3671040534973145, + "logits/rejected": -1.3767889738082886, + "logps/chosen": -2.06760835647583, + "logps/rejected": -91.6816635131836, + "loss": 0.1262805312871933, + "memory(GiB)": 46.73, + "nll_loss": 0.11861655116081238, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4480833113193512, + "rewards/margins": 8.306568145751953, + "rewards/rejected": -7.858485221862793, + "step": 704, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0142920946851275, + "grad_norm": 0.5312683582305908, + "learning_rate": 5.294745434354671e-05, + "logits/chosen": -1.3388588428497314, + "logits/rejected": -1.3574988842010498, + "logps/chosen": -1.744231939315796, + "logps/rejected": -107.92884826660156, + "loss": 0.06678034365177155, + "memory(GiB)": 46.73, + "nll_loss": 0.049260981380939484, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7083232402801514, + "rewards/margins": 10.067192077636719, + "rewards/rejected": -9.358870506286621, + "step": 705, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.017150513622153, + "grad_norm": 0.5014054775238037, + "learning_rate": 5.266880664570053e-05, + "logits/chosen": -1.3985620737075806, + "logits/rejected": -1.4070799350738525, + "logps/chosen": -3.5201594829559326, + "logps/rejected": -89.9655532836914, + "loss": 0.16251122951507568, + "memory(GiB)": 46.73, + "nll_loss": 0.13327711820602417, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6243622303009033, + "rewards/margins": 8.346537590026855, + "rewards/rejected": -7.7221760749816895, + "step": 706, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.020008932559178, + "grad_norm": 0.8896200060844421, + "learning_rate": 5.239063174415466e-05, + "logits/chosen": -1.3996846675872803, + "logits/rejected": -1.4094620943069458, + "logps/chosen": -4.70017671585083, + "logps/rejected": -94.6190414428711, + "loss": 0.20163139700889587, + "memory(GiB)": 46.73, + "nll_loss": 0.1798512190580368, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0199339389801025, + "rewards/margins": 8.901236534118652, + "rewards/rejected": -7.881302356719971, + "step": 707, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0228673514962034, + "grad_norm": 0.6634477376937866, + "learning_rate": 5.211293241762764e-05, + "logits/chosen": -1.4573795795440674, + "logits/rejected": -1.4657036066055298, + "logps/chosen": -3.595468521118164, + "logps/rejected": -99.15465545654297, + "loss": 0.1454685479402542, + "memory(GiB)": 46.73, + "nll_loss": 0.1412096917629242, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9684085249900818, + "rewards/margins": 9.598406791687012, + "rewards/rejected": -8.629999160766602, + "step": 708, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.025725770433229, + "grad_norm": 0.4990958273410797, + "learning_rate": 5.183571144008747e-05, + "logits/chosen": -1.464647650718689, + "logits/rejected": -1.4746804237365723, + "logps/chosen": -2.852874517440796, + "logps/rejected": -91.08935546875, + "loss": 0.160193532705307, + "memory(GiB)": 46.73, + "nll_loss": 0.15670600533485413, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5958665013313293, + "rewards/margins": 8.472614288330078, + "rewards/rejected": -7.8767476081848145, + "step": 709, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0285841893702545, + "grad_norm": 0.6225377321243286, + "learning_rate": 5.155897158072378e-05, + "logits/chosen": -1.5063742399215698, + "logits/rejected": -1.522721290588379, + "logps/chosen": -1.9705212116241455, + "logps/rejected": -121.17532348632812, + "loss": 0.08409148454666138, + "memory(GiB)": 46.73, + "nll_loss": 0.08197915554046631, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6765754222869873, + "rewards/margins": 11.44405460357666, + "rewards/rejected": -10.767478942871094, + "step": 710, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.03144260830728, + "grad_norm": 0.5770713686943054, + "learning_rate": 5.1282715603920374e-05, + "logits/chosen": -1.5320286750793457, + "logits/rejected": -1.5518614053726196, + "logps/chosen": -6.716513633728027, + "logps/rejected": -110.9957504272461, + "loss": 0.19623152911663055, + "memory(GiB)": 46.73, + "nll_loss": 0.1891591101884842, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6402191519737244, + "rewards/margins": 10.306550025939941, + "rewards/rejected": -9.666330337524414, + "step": 711, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0343010272443056, + "grad_norm": 0.6445726156234741, + "learning_rate": 5.1006946269227376e-05, + "logits/chosen": -1.49067223072052, + "logits/rejected": -1.4948961734771729, + "logps/chosen": -3.5928125381469727, + "logps/rejected": -87.59977722167969, + "loss": 0.14255580306053162, + "memory(GiB)": 46.73, + "nll_loss": 0.14030030369758606, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7219333052635193, + "rewards/margins": 8.310097694396973, + "rewards/rejected": -7.588164329528809, + "step": 712, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.037159446181331, + "grad_norm": 0.6341351270675659, + "learning_rate": 5.073166633133389e-05, + "logits/chosen": -1.5766968727111816, + "logits/rejected": -1.587092399597168, + "logps/chosen": -2.0322654247283936, + "logps/rejected": -98.49361419677734, + "loss": 0.1262267529964447, + "memory(GiB)": 46.73, + "nll_loss": 0.11367999762296677, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6843907833099365, + "rewards/margins": 9.339305877685547, + "rewards/rejected": -8.654915809631348, + "step": 713, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0400178651183563, + "grad_norm": 0.7600017786026001, + "learning_rate": 5.045687854004042e-05, + "logits/chosen": -1.5253121852874756, + "logits/rejected": -1.5327656269073486, + "logps/chosen": -2.819199323654175, + "logps/rejected": -122.22134399414062, + "loss": 0.11136095970869064, + "memory(GiB)": 46.73, + "nll_loss": 0.1008281484246254, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48294559121131897, + "rewards/margins": 11.306340217590332, + "rewards/rejected": -10.823394775390625, + "step": 714, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.042876284055382, + "grad_norm": 0.646041989326477, + "learning_rate": 5.01825856402312e-05, + "logits/chosen": -1.6005913019180298, + "logits/rejected": -1.6237785816192627, + "logps/chosen": -2.513141393661499, + "logps/rejected": -106.20286560058594, + "loss": 0.12050984054803848, + "memory(GiB)": 46.73, + "nll_loss": 0.11930551379919052, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6920363306999207, + "rewards/margins": 9.648955345153809, + "rewards/rejected": -8.956918716430664, + "step": 715, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0457347029924073, + "grad_norm": 0.6046995520591736, + "learning_rate": 4.99087903718471e-05, + "logits/chosen": -1.606223464012146, + "logits/rejected": -1.6436808109283447, + "logps/chosen": -1.5272647142410278, + "logps/rejected": -131.58401489257812, + "loss": 0.11919206380844116, + "memory(GiB)": 46.73, + "nll_loss": 0.09792602807283401, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6252794861793518, + "rewards/margins": 11.937460899353027, + "rewards/rejected": -11.31218147277832, + "step": 716, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0485931219294327, + "grad_norm": 1.2827632427215576, + "learning_rate": 4.963549546985799e-05, + "logits/chosen": -1.6043542623519897, + "logits/rejected": -1.6206470727920532, + "logps/chosen": -1.8725172281265259, + "logps/rejected": -102.03213500976562, + "loss": 0.13097313046455383, + "memory(GiB)": 46.73, + "nll_loss": 0.1279985010623932, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5102192163467407, + "rewards/margins": 9.184639930725098, + "rewards/rejected": -8.674420356750488, + "step": 717, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0514515408664584, + "grad_norm": 0.6364453434944153, + "learning_rate": 4.936270366423563e-05, + "logits/chosen": -1.6342445611953735, + "logits/rejected": -1.6388630867004395, + "logps/chosen": -3.203178644180298, + "logps/rejected": -110.25364685058594, + "loss": 0.1496572345495224, + "memory(GiB)": 46.73, + "nll_loss": 0.14746828377246857, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6244829297065735, + "rewards/margins": 10.414778709411621, + "rewards/rejected": -9.790295600891113, + "step": 718, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.0543099598034837, + "grad_norm": 1.0839275121688843, + "learning_rate": 4.9090417679926195e-05, + "logits/chosen": -1.6477729082107544, + "logits/rejected": -1.6559243202209473, + "logps/chosen": -2.1751749515533447, + "logps/rejected": -114.43892669677734, + "loss": 0.10991393774747849, + "memory(GiB)": 46.73, + "nll_loss": 0.10836468636989594, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5266481637954712, + "rewards/margins": 10.735066413879395, + "rewards/rejected": -10.208417892456055, + "step": 719, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.057168378740509, + "grad_norm": 0.5046917796134949, + "learning_rate": 4.88186402368232e-05, + "logits/chosen": -1.6776890754699707, + "logits/rejected": -1.701670527458191, + "logps/chosen": -2.6740882396698, + "logps/rejected": -135.4667510986328, + "loss": 0.13255618512630463, + "memory(GiB)": 46.73, + "nll_loss": 0.12441231310367584, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6434326767921448, + "rewards/margins": 12.391685485839844, + "rewards/rejected": -11.748252868652344, + "step": 720, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.060026797677535, + "grad_norm": 0.7640891075134277, + "learning_rate": 4.8547374049740354e-05, + "logits/chosen": -1.6784427165985107, + "logits/rejected": -1.689367413520813, + "logps/chosen": -4.439858913421631, + "logps/rejected": -116.31710815429688, + "loss": 0.17832107841968536, + "memory(GiB)": 46.73, + "nll_loss": 0.17599192261695862, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7900669574737549, + "rewards/margins": 11.103574752807617, + "rewards/rejected": -10.313508033752441, + "step": 721, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.06288521661456, + "grad_norm": 0.916210412979126, + "learning_rate": 4.8276621828384225e-05, + "logits/chosen": -1.6554255485534668, + "logits/rejected": -1.6821229457855225, + "logps/chosen": -1.9292747974395752, + "logps/rejected": -125.80508422851562, + "loss": 0.10639452189207077, + "memory(GiB)": 46.73, + "nll_loss": 0.0997253805398941, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7844244241714478, + "rewards/margins": 11.666866302490234, + "rewards/rejected": -10.882440567016602, + "step": 722, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0657436355515855, + "grad_norm": 0.5751746296882629, + "learning_rate": 4.800638627732751e-05, + "logits/chosen": -1.725898265838623, + "logits/rejected": -1.7359280586242676, + "logps/chosen": -2.285418748855591, + "logps/rejected": -117.50049591064453, + "loss": 0.1161622479557991, + "memory(GiB)": 46.73, + "nll_loss": 0.09694134443998337, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8232448697090149, + "rewards/margins": 11.284551620483398, + "rewards/rejected": -10.461305618286133, + "step": 723, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.068602054488611, + "grad_norm": 0.6991005539894104, + "learning_rate": 4.773667009598163e-05, + "logits/chosen": -1.7288771867752075, + "logits/rejected": -1.7394602298736572, + "logps/chosen": -3.0993452072143555, + "logps/rejected": -114.0384521484375, + "loss": 0.13271521031856537, + "memory(GiB)": 46.73, + "nll_loss": 0.1309974640607834, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8902750015258789, + "rewards/margins": 11.224279403686523, + "rewards/rejected": -10.334004402160645, + "step": 724, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0714604734256366, + "grad_norm": 0.717708170413971, + "learning_rate": 4.746747597857014e-05, + "logits/chosen": -1.7381887435913086, + "logits/rejected": -1.7586032152175903, + "logps/chosen": -3.0901057720184326, + "logps/rejected": -116.30864715576172, + "loss": 0.14192581176757812, + "memory(GiB)": 46.73, + "nll_loss": 0.13648167252540588, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7617445588111877, + "rewards/margins": 11.020862579345703, + "rewards/rejected": -10.25911808013916, + "step": 725, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.074318892362662, + "grad_norm": 0.7786213159561157, + "learning_rate": 4.719880661410153e-05, + "logits/chosen": -1.6829264163970947, + "logits/rejected": -1.7100300788879395, + "logps/chosen": -1.696429967880249, + "logps/rejected": -116.65681457519531, + "loss": 0.12481532990932465, + "memory(GiB)": 46.73, + "nll_loss": 0.12021290510892868, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.47501328587532043, + "rewards/margins": 10.90579605102539, + "rewards/rejected": -10.430782318115234, + "step": 726, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.077177311299687, + "grad_norm": 0.8564444780349731, + "learning_rate": 4.6930664686342526e-05, + "logits/chosen": -1.7280608415603638, + "logits/rejected": -1.7375504970550537, + "logps/chosen": -2.874122381210327, + "logps/rejected": -129.02975463867188, + "loss": 0.13600313663482666, + "memory(GiB)": 46.73, + "nll_loss": 0.1322639435529709, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5178536176681519, + "rewards/margins": 12.142501831054688, + "rewards/rejected": -11.624648094177246, + "step": 727, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.080035730236713, + "grad_norm": 2.468414068222046, + "learning_rate": 4.666305287379129e-05, + "logits/chosen": -1.6879026889801025, + "logits/rejected": -1.7079944610595703, + "logps/chosen": -3.1912660598754883, + "logps/rejected": -138.30685424804688, + "loss": 0.16840460896492004, + "memory(GiB)": 46.73, + "nll_loss": 0.1648813784122467, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.2080085277557373, + "rewards/margins": 13.236478805541992, + "rewards/rejected": -12.028470993041992, + "step": 728, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0828941491737383, + "grad_norm": 0.8098137378692627, + "learning_rate": 4.6395973849650456e-05, + "logits/chosen": -1.7033703327178955, + "logits/rejected": -1.719029426574707, + "logps/chosen": -3.1450066566467285, + "logps/rejected": -116.48741149902344, + "loss": 0.14289624989032745, + "memory(GiB)": 46.73, + "nll_loss": 0.12687478959560394, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5492764115333557, + "rewards/margins": 10.482539176940918, + "rewards/rejected": -9.933263778686523, + "step": 729, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0857525681107636, + "grad_norm": 0.7132099866867065, + "learning_rate": 4.612943028180072e-05, + "logits/chosen": -1.6585897207260132, + "logits/rejected": -1.675646424293518, + "logps/chosen": -2.4841561317443848, + "logps/rejected": -118.85638427734375, + "loss": 0.12736377120018005, + "memory(GiB)": 46.73, + "nll_loss": 0.10308001935482025, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.508740246295929, + "rewards/margins": 11.070262908935547, + "rewards/rejected": -10.561522483825684, + "step": 730, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0886109870477894, + "grad_norm": 0.5194377899169922, + "learning_rate": 4.586342483277396e-05, + "logits/chosen": -1.6939231157302856, + "logits/rejected": -1.7033421993255615, + "logps/chosen": -2.945922374725342, + "logps/rejected": -112.94274139404297, + "loss": 0.13661476969718933, + "memory(GiB)": 46.73, + "nll_loss": 0.13415244221687317, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7902134656906128, + "rewards/margins": 10.974791526794434, + "rewards/rejected": -10.184578895568848, + "step": 731, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0914694059848147, + "grad_norm": 0.8727378845214844, + "learning_rate": 4.559796015972677e-05, + "logits/chosen": -1.683030128479004, + "logits/rejected": -1.6943947076797485, + "logps/chosen": -3.6087183952331543, + "logps/rejected": -115.31521606445312, + "loss": 0.19977882504463196, + "memory(GiB)": 46.73, + "nll_loss": 0.16409388184547424, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5767125487327576, + "rewards/margins": 10.678343772888184, + "rewards/rejected": -10.101630210876465, + "step": 732, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.09432782492184, + "grad_norm": 0.9550994038581848, + "learning_rate": 4.533303891441388e-05, + "logits/chosen": -1.7100588083267212, + "logits/rejected": -1.7279833555221558, + "logps/chosen": -2.625103235244751, + "logps/rejected": -116.67841339111328, + "loss": 0.15604126453399658, + "memory(GiB)": 46.73, + "nll_loss": 0.15421541035175323, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5999993681907654, + "rewards/margins": 10.786684036254883, + "rewards/rejected": -10.186685562133789, + "step": 733, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.0971862438588658, + "grad_norm": 0.6655582189559937, + "learning_rate": 4.5068663743161686e-05, + "logits/chosen": -1.7050411701202393, + "logits/rejected": -1.7205008268356323, + "logps/chosen": -3.2177319526672363, + "logps/rejected": -127.66587829589844, + "loss": 0.13336561620235443, + "memory(GiB)": 46.73, + "nll_loss": 0.1308842897415161, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8900558948516846, + "rewards/margins": 12.344279289245605, + "rewards/rejected": -11.454222679138184, + "step": 734, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.100044662795891, + "grad_norm": 0.7084753513336182, + "learning_rate": 4.4804837286841686e-05, + "logits/chosen": -1.7348458766937256, + "logits/rejected": -1.74097740650177, + "logps/chosen": -2.4784886837005615, + "logps/rejected": -115.00691986083984, + "loss": 0.11979944258928299, + "memory(GiB)": 46.73, + "nll_loss": 0.11902526021003723, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7228187322616577, + "rewards/margins": 11.022592544555664, + "rewards/rejected": -10.299775123596191, + "step": 735, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.1029030817329164, + "grad_norm": 0.7655794024467468, + "learning_rate": 4.454156218084433e-05, + "logits/chosen": -1.7176027297973633, + "logits/rejected": -1.737367033958435, + "logps/chosen": -2.0084376335144043, + "logps/rejected": -125.28208923339844, + "loss": 0.13023331761360168, + "memory(GiB)": 46.73, + "nll_loss": 0.1288643777370453, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5075401663780212, + "rewards/margins": 11.424022674560547, + "rewards/rejected": -10.916481018066406, + "step": 736, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.105761500669942, + "grad_norm": 0.7896831631660461, + "learning_rate": 4.427884105505251e-05, + "logits/chosen": -1.7016427516937256, + "logits/rejected": -1.7272720336914062, + "logps/chosen": -3.91815447807312, + "logps/rejected": -142.9935302734375, + "loss": 0.2238529473543167, + "memory(GiB)": 46.73, + "nll_loss": 0.22090935707092285, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.37484681606292725, + "rewards/margins": 12.707845687866211, + "rewards/rejected": -12.33299732208252, + "step": 737, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.1086199196069675, + "grad_norm": 12.026676177978516, + "learning_rate": 4.4016676533815324e-05, + "logits/chosen": -1.7297816276550293, + "logits/rejected": -1.7420827150344849, + "logps/chosen": -2.4720804691314697, + "logps/rejected": -125.89964294433594, + "loss": 0.16339817643165588, + "memory(GiB)": 46.73, + "nll_loss": 0.16232505440711975, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5476446747779846, + "rewards/margins": 11.702983856201172, + "rewards/rejected": -11.155339241027832, + "step": 738, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.111478338543993, + "grad_norm": 1.414394736289978, + "learning_rate": 4.375507123592194e-05, + "logits/chosen": -1.6991113424301147, + "logits/rejected": -1.714755892753601, + "logps/chosen": -3.4832603931427, + "logps/rejected": -130.6119842529297, + "loss": 0.1240750402212143, + "memory(GiB)": 46.73, + "nll_loss": 0.12312482297420502, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49840059876441956, + "rewards/margins": 12.143492698669434, + "rewards/rejected": -11.645090103149414, + "step": 739, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.114336757481018, + "grad_norm": 0.6430306434631348, + "learning_rate": 4.349402777457537e-05, + "logits/chosen": -1.6896321773529053, + "logits/rejected": -1.7094862461090088, + "logps/chosen": -2.1210155487060547, + "logps/rejected": -133.11016845703125, + "loss": 0.11661946028470993, + "memory(GiB)": 46.73, + "nll_loss": 0.11605717241764069, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5362185835838318, + "rewards/margins": 12.352823257446289, + "rewards/rejected": -11.816605567932129, + "step": 740, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.117195176418044, + "grad_norm": 0.6329697966575623, + "learning_rate": 4.3233548757366436e-05, + "logits/chosen": -1.6787524223327637, + "logits/rejected": -1.6913310289382935, + "logps/chosen": -1.8568882942199707, + "logps/rejected": -95.99836730957031, + "loss": 0.1527225375175476, + "memory(GiB)": 46.73, + "nll_loss": 0.1344267576932907, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6739444136619568, + "rewards/margins": 8.90192985534668, + "rewards/rejected": -8.227986335754395, + "step": 741, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.120053595355069, + "grad_norm": 0.8138287663459778, + "learning_rate": 4.297363678624753e-05, + "logits/chosen": -1.7275301218032837, + "logits/rejected": -1.7589508295059204, + "logps/chosen": -1.4376156330108643, + "logps/rejected": -136.57284545898438, + "loss": 0.0878395289182663, + "memory(GiB)": 46.73, + "nll_loss": 0.08727831393480301, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6229580640792847, + "rewards/margins": 12.466249465942383, + "rewards/rejected": -11.843290328979492, + "step": 742, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1229120142920945, + "grad_norm": 0.6505977511405945, + "learning_rate": 4.271429445750692e-05, + "logits/chosen": -1.7142571210861206, + "logits/rejected": -1.7310396432876587, + "logps/chosen": -1.753830909729004, + "logps/rejected": -121.19338989257812, + "loss": 0.10254449397325516, + "memory(GiB)": 46.73, + "nll_loss": 0.10117828845977783, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6088793277740479, + "rewards/margins": 11.494156837463379, + "rewards/rejected": -10.885275840759277, + "step": 743, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1257704332291203, + "grad_norm": 0.5495070219039917, + "learning_rate": 4.245552436174253e-05, + "logits/chosen": -1.7415564060211182, + "logits/rejected": -1.7485125064849854, + "logps/chosen": -2.7452197074890137, + "logps/rejected": -121.05813598632812, + "loss": 0.12934887409210205, + "memory(GiB)": 46.73, + "nll_loss": 0.12875869870185852, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9706099629402161, + "rewards/margins": 11.918776512145996, + "rewards/rejected": -10.948166847229004, + "step": 744, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1286288521661456, + "grad_norm": 0.6341418027877808, + "learning_rate": 4.21973290838362e-05, + "logits/chosen": -1.7050449848175049, + "logits/rejected": -1.7371711730957031, + "logps/chosen": -2.296316146850586, + "logps/rejected": -126.93817138671875, + "loss": 0.12343169003725052, + "memory(GiB)": 46.73, + "nll_loss": 0.11587755382061005, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7295063734054565, + "rewards/margins": 11.936881065368652, + "rewards/rejected": -11.207374572753906, + "step": 745, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.131487271103171, + "grad_norm": 0.9399663209915161, + "learning_rate": 4.1939711202927936e-05, + "logits/chosen": -1.6567258834838867, + "logits/rejected": -1.6777889728546143, + "logps/chosen": -3.963951826095581, + "logps/rejected": -111.61817932128906, + "loss": 0.18954475224018097, + "memory(GiB)": 46.73, + "nll_loss": 0.1747589260339737, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5586780309677124, + "rewards/margins": 10.387514114379883, + "rewards/rejected": -9.828836441040039, + "step": 746, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1343456900401967, + "grad_norm": 0.5456673502922058, + "learning_rate": 4.168267329239002e-05, + "logits/chosen": -1.6570465564727783, + "logits/rejected": -1.6693735122680664, + "logps/chosen": -3.4366085529327393, + "logps/rejected": -115.15528106689453, + "loss": 0.1558106392621994, + "memory(GiB)": 46.73, + "nll_loss": 0.14104154706001282, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.46783921122550964, + "rewards/margins": 10.435863494873047, + "rewards/rejected": -9.968024253845215, + "step": 747, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.137204108977222, + "grad_norm": 1.1644296646118164, + "learning_rate": 4.142621791980138e-05, + "logits/chosen": -1.7093998193740845, + "logits/rejected": -1.7273249626159668, + "logps/chosen": -2.527416944503784, + "logps/rejected": -124.19613647460938, + "loss": 0.11928348988294601, + "memory(GiB)": 46.73, + "nll_loss": 0.11651065200567245, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4832688570022583, + "rewards/margins": 11.187657356262207, + "rewards/rejected": -10.704388618469238, + "step": 748, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1400625279142473, + "grad_norm": 0.6623984575271606, + "learning_rate": 4.11703476469218e-05, + "logits/chosen": -1.7346500158309937, + "logits/rejected": -1.7358237504959106, + "logps/chosen": -4.151916027069092, + "logps/rejected": -108.73068237304688, + "loss": 0.1444595456123352, + "memory(GiB)": 46.73, + "nll_loss": 0.14280128479003906, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.705640435218811, + "rewards/margins": 10.313786506652832, + "rewards/rejected": -9.608145713806152, + "step": 749, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.142920946851273, + "grad_norm": 0.5999913811683655, + "learning_rate": 4.09150650296666e-05, + "logits/chosen": -1.689178228378296, + "logits/rejected": -1.7057077884674072, + "logps/chosen": -2.7739779949188232, + "logps/rejected": -117.21680450439453, + "loss": 0.11793866008520126, + "memory(GiB)": 46.73, + "nll_loss": 0.1133996844291687, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6371058821678162, + "rewards/margins": 10.845322608947754, + "rewards/rejected": -10.20821762084961, + "step": 750, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1457793657882984, + "grad_norm": 0.616504967212677, + "learning_rate": 4.0660372618080787e-05, + "logits/chosen": -1.705957055091858, + "logits/rejected": -1.720078706741333, + "logps/chosen": -1.91254460811615, + "logps/rejected": -104.59209442138672, + "loss": 0.15148289501667023, + "memory(GiB)": 46.73, + "nll_loss": 0.14934603869915009, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5575397610664368, + "rewards/margins": 9.8103666305542, + "rewards/rejected": -9.252824783325195, + "step": 751, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.1486377847253237, + "grad_norm": 0.6763497591018677, + "learning_rate": 4.0406272956313895e-05, + "logits/chosen": -1.73313307762146, + "logits/rejected": -1.739758014678955, + "logps/chosen": -4.059084892272949, + "logps/rejected": -107.08638000488281, + "loss": 0.13731777667999268, + "memory(GiB)": 46.73, + "nll_loss": 0.1345837116241455, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.484380841255188, + "rewards/margins": 10.125937461853027, + "rewards/rejected": -9.641556739807129, + "step": 752, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.151496203662349, + "grad_norm": 0.6765409111976624, + "learning_rate": 4.015276858259427e-05, + "logits/chosen": -1.713019609451294, + "logits/rejected": -1.7212321758270264, + "logps/chosen": -2.8288121223449707, + "logps/rejected": -115.45738220214844, + "loss": 0.19622966647148132, + "memory(GiB)": 46.73, + "nll_loss": 0.16696611046791077, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6339028477668762, + "rewards/margins": 10.791833877563477, + "rewards/rejected": -10.157931327819824, + "step": 753, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.154354622599375, + "grad_norm": 0.7982415556907654, + "learning_rate": 3.989986202920397e-05, + "logits/chosen": -1.7288676500320435, + "logits/rejected": -1.7484595775604248, + "logps/chosen": -2.475815534591675, + "logps/rejected": -108.9861068725586, + "loss": 0.15874387323856354, + "memory(GiB)": 46.73, + "nll_loss": 0.1394469439983368, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.48281630873680115, + "rewards/margins": 9.926338195800781, + "rewards/rejected": -9.443522453308105, + "step": 754, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1572130415364, + "grad_norm": 0.6383085250854492, + "learning_rate": 3.964755582245335e-05, + "logits/chosen": -1.7366212606430054, + "logits/rejected": -1.7480270862579346, + "logps/chosen": -3.7524828910827637, + "logps/rejected": -124.93280029296875, + "loss": 0.16495665907859802, + "memory(GiB)": 46.73, + "nll_loss": 0.16129866242408752, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7390357255935669, + "rewards/margins": 11.99774169921875, + "rewards/rejected": -11.258706092834473, + "step": 755, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1600714604734255, + "grad_norm": 11.229231834411621, + "learning_rate": 3.939585248265576e-05, + "logits/chosen": -1.6887023448944092, + "logits/rejected": -1.7098785638809204, + "logps/chosen": -1.5743474960327148, + "logps/rejected": -125.05543518066406, + "loss": 0.15721367299556732, + "memory(GiB)": 46.73, + "nll_loss": 0.10757317394018173, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.5603189468383789, + "rewards/margins": 11.491580963134766, + "rewards/rejected": -10.931262969970703, + "step": 756, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1629298794104512, + "grad_norm": 0.6276991963386536, + "learning_rate": 3.914475452410257e-05, + "logits/chosen": -1.7208404541015625, + "logits/rejected": -1.7312361001968384, + "logps/chosen": -2.457312822341919, + "logps/rejected": -105.10942840576172, + "loss": 0.12477224320173264, + "memory(GiB)": 46.73, + "nll_loss": 0.11921665072441101, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8507872223854065, + "rewards/margins": 10.100202560424805, + "rewards/rejected": -9.249414443969727, + "step": 757, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1657882983474765, + "grad_norm": 0.38204801082611084, + "learning_rate": 3.889426445503779e-05, + "logits/chosen": -1.7382487058639526, + "logits/rejected": -1.7489298582077026, + "logps/chosen": -2.2348647117614746, + "logps/rejected": -117.04852294921875, + "loss": 0.09758877009153366, + "memory(GiB)": 46.73, + "nll_loss": 0.09699364751577377, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7443951368331909, + "rewards/margins": 11.229491233825684, + "rewards/rejected": -10.485095977783203, + "step": 758, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.168646717284502, + "grad_norm": 0.5256333351135254, + "learning_rate": 3.864438477763327e-05, + "logits/chosen": -1.733298659324646, + "logits/rejected": -1.7572256326675415, + "logps/chosen": -2.88501238822937, + "logps/rejected": -126.08180236816406, + "loss": 0.10684897005558014, + "memory(GiB)": 46.73, + "nll_loss": 0.10602684319019318, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5964562892913818, + "rewards/margins": 11.40107536315918, + "rewards/rejected": -10.804619789123535, + "step": 759, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.1715051362215276, + "grad_norm": 0.5174509286880493, + "learning_rate": 3.839511798796357e-05, + "logits/chosen": -1.7838695049285889, + "logits/rejected": -1.799968957901001, + "logps/chosen": -3.1636159420013428, + "logps/rejected": -154.8913116455078, + "loss": 0.14846816658973694, + "memory(GiB)": 46.73, + "nll_loss": 0.14811007678508759, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7431506514549255, + "rewards/margins": 14.516936302185059, + "rewards/rejected": -13.773785591125488, + "step": 760, + "train_speed(iter/s)": 0.005401 + }, + { + "epoch": 2.174363555158553, + "grad_norm": 0.7228491306304932, + "learning_rate": 3.814646657598104e-05, + "logits/chosen": -1.7531218528747559, + "logits/rejected": -1.777261734008789, + "logps/chosen": -2.1842851638793945, + "logps/rejected": -112.90637969970703, + "loss": 0.10662516206502914, + "memory(GiB)": 46.73, + "nll_loss": 0.09334062784910202, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5663318634033203, + "rewards/margins": 10.066019058227539, + "rewards/rejected": -9.499687194824219, + "step": 761, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1772219740955783, + "grad_norm": 0.6269167065620422, + "learning_rate": 3.789843302549096e-05, + "logits/chosen": -1.7703839540481567, + "logits/rejected": -1.780287504196167, + "logps/chosen": -2.7307345867156982, + "logps/rejected": -122.10258483886719, + "loss": 0.15339156985282898, + "memory(GiB)": 46.73, + "nll_loss": 0.13365858793258667, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6474071145057678, + "rewards/margins": 11.623534202575684, + "rewards/rejected": -10.976127624511719, + "step": 762, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.180080393032604, + "grad_norm": 0.6452962756156921, + "learning_rate": 3.7651019814126654e-05, + "logits/chosen": -1.6857422590255737, + "logits/rejected": -1.7062132358551025, + "logps/chosen": -3.037238836288452, + "logps/rejected": -132.969970703125, + "loss": 0.15664508938789368, + "memory(GiB)": 46.73, + "nll_loss": 0.14627954363822937, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6218290328979492, + "rewards/margins": 12.158147811889648, + "rewards/rejected": -11.536317825317383, + "step": 763, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1829388119696294, + "grad_norm": 1.2026190757751465, + "learning_rate": 3.740422941332496e-05, + "logits/chosen": -1.739600419998169, + "logits/rejected": -1.7670246362686157, + "logps/chosen": -2.065814256668091, + "logps/rejected": -127.63172912597656, + "loss": 0.12204542756080627, + "memory(GiB)": 46.73, + "nll_loss": 0.12009820342063904, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5392940044403076, + "rewards/margins": 11.599030494689941, + "rewards/rejected": -11.059735298156738, + "step": 764, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1857972309066547, + "grad_norm": 0.539072573184967, + "learning_rate": 3.7158064288301244e-05, + "logits/chosen": -1.7427868843078613, + "logits/rejected": -1.7634449005126953, + "logps/chosen": -1.8705532550811768, + "logps/rejected": -125.5798110961914, + "loss": 0.13085120916366577, + "memory(GiB)": 46.73, + "nll_loss": 0.109225794672966, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5458089709281921, + "rewards/margins": 11.635404586791992, + "rewards/rejected": -11.089594841003418, + "step": 765, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.18865564984368, + "grad_norm": 0.9112529158592224, + "learning_rate": 3.691252689802502e-05, + "logits/chosen": -1.6936545372009277, + "logits/rejected": -1.7068877220153809, + "logps/chosen": -5.790098667144775, + "logps/rejected": -112.80413055419922, + "loss": 0.2206256240606308, + "memory(GiB)": 46.73, + "nll_loss": 0.21952351927757263, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6771332025527954, + "rewards/margins": 10.539006233215332, + "rewards/rejected": -9.861872673034668, + "step": 766, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1915140687807058, + "grad_norm": 0.8130010962486267, + "learning_rate": 3.6667619695195285e-05, + "logits/chosen": -1.7631025314331055, + "logits/rejected": -1.7726210355758667, + "logps/chosen": -3.349720001220703, + "logps/rejected": -105.22746276855469, + "loss": 0.18691176176071167, + "memory(GiB)": 46.73, + "nll_loss": 0.17924201488494873, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7146871089935303, + "rewards/margins": 9.890175819396973, + "rewards/rejected": -9.175488471984863, + "step": 767, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.194372487717731, + "grad_norm": 1.0899032354354858, + "learning_rate": 3.6423345126216045e-05, + "logits/chosen": -1.7186263799667358, + "logits/rejected": -1.7368674278259277, + "logps/chosen": -2.324446201324463, + "logps/rejected": -118.56622314453125, + "loss": 0.16899357736110687, + "memory(GiB)": 46.73, + "nll_loss": 0.1636049896478653, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6314736604690552, + "rewards/margins": 11.031686782836914, + "rewards/rejected": -10.400211334228516, + "step": 768, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.1972309066547564, + "grad_norm": 0.7936761975288391, + "learning_rate": 3.6179705631171746e-05, + "logits/chosen": -1.703823208808899, + "logits/rejected": -1.7315338850021362, + "logps/chosen": -2.9620230197906494, + "logps/rejected": -143.7433319091797, + "loss": 0.13453835248947144, + "memory(GiB)": 46.73, + "nll_loss": 0.12804599106311798, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.769576370716095, + "rewards/margins": 13.67524528503418, + "rewards/rejected": -12.905670166015625, + "step": 769, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.200089325591782, + "grad_norm": 0.9569531083106995, + "learning_rate": 3.593670364380316e-05, + "logits/chosen": -1.694765567779541, + "logits/rejected": -1.7086044549942017, + "logps/chosen": -2.6550450325012207, + "logps/rejected": -126.60090637207031, + "loss": 0.22317641973495483, + "memory(GiB)": 46.73, + "nll_loss": 0.1666475385427475, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5760101079940796, + "rewards/margins": 12.053494453430176, + "rewards/rejected": -11.477484703063965, + "step": 770, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2029477445288075, + "grad_norm": 0.7008557915687561, + "learning_rate": 3.569434159148283e-05, + "logits/chosen": -1.681830644607544, + "logits/rejected": -1.7102689743041992, + "logps/chosen": -1.4984784126281738, + "logps/rejected": -152.89645385742188, + "loss": 0.08517744392156601, + "memory(GiB)": 46.73, + "nll_loss": 0.06586003303527832, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7491201162338257, + "rewards/margins": 14.39028263092041, + "rewards/rejected": -13.641162872314453, + "step": 771, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.205806163465833, + "grad_norm": 0.4644488990306854, + "learning_rate": 3.545262189519092e-05, + "logits/chosen": -1.7865322828292847, + "logits/rejected": -1.7923797369003296, + "logps/chosen": -2.8405375480651855, + "logps/rejected": -138.0335693359375, + "loss": 0.14850133657455444, + "memory(GiB)": 46.73, + "nll_loss": 0.14815452694892883, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4763367772102356, + "rewards/margins": 13.229516983032227, + "rewards/rejected": -12.753180503845215, + "step": 772, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2086645824028586, + "grad_norm": 0.8949534893035889, + "learning_rate": 3.5211546969491095e-05, + "logits/chosen": -1.751487135887146, + "logits/rejected": -1.7620105743408203, + "logps/chosen": -1.7669379711151123, + "logps/rejected": -119.79267883300781, + "loss": 0.10754434764385223, + "memory(GiB)": 46.73, + "nll_loss": 0.10662030428647995, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4996607303619385, + "rewards/margins": 11.162941932678223, + "rewards/rejected": -10.663281440734863, + "step": 773, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.211523001339884, + "grad_norm": 0.7084648609161377, + "learning_rate": 3.49711192225063e-05, + "logits/chosen": -1.682307481765747, + "logits/rejected": -1.7079421281814575, + "logps/chosen": -2.9968488216400146, + "logps/rejected": -134.74200439453125, + "loss": 0.09475664794445038, + "memory(GiB)": 46.73, + "nll_loss": 0.084076888859272, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5336630940437317, + "rewards/margins": 12.228374481201172, + "rewards/rejected": -11.694710731506348, + "step": 774, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.214381420276909, + "grad_norm": 0.5224748253822327, + "learning_rate": 3.4731341055894785e-05, + "logits/chosen": -1.72243070602417, + "logits/rejected": -1.7281838655471802, + "logps/chosen": -2.824965238571167, + "logps/rejected": -115.74949645996094, + "loss": 0.17388476431369781, + "memory(GiB)": 46.73, + "nll_loss": 0.14388418197631836, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4050171971321106, + "rewards/margins": 10.795921325683594, + "rewards/rejected": -10.39090347290039, + "step": 775, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.217239839213935, + "grad_norm": 0.7625648975372314, + "learning_rate": 3.4492214864825965e-05, + "logits/chosen": -1.6454460620880127, + "logits/rejected": -1.677930235862732, + "logps/chosen": -1.8394455909729004, + "logps/rejected": -150.86842346191406, + "loss": 0.10291773825883865, + "memory(GiB)": 46.73, + "nll_loss": 0.09716804325580597, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7498948574066162, + "rewards/margins": 13.786081314086914, + "rewards/rejected": -13.036186218261719, + "step": 776, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2200982581509603, + "grad_norm": 0.5313823819160461, + "learning_rate": 3.425374303795675e-05, + "logits/chosen": -1.7055084705352783, + "logits/rejected": -1.7109901905059814, + "logps/chosen": -3.196258068084717, + "logps/rejected": -104.67936706542969, + "loss": 0.13488231599330902, + "memory(GiB)": 46.73, + "nll_loss": 0.12887902557849884, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.43103182315826416, + "rewards/margins": 9.69394302368164, + "rewards/rejected": -9.262910842895508, + "step": 777, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2229566770879856, + "grad_norm": 0.45489898324012756, + "learning_rate": 3.401592795740739e-05, + "logits/chosen": -1.7363502979278564, + "logits/rejected": -1.7455774545669556, + "logps/chosen": -3.791541814804077, + "logps/rejected": -127.68539428710938, + "loss": 0.15376096963882446, + "memory(GiB)": 46.73, + "nll_loss": 0.15042446553707123, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6921437382698059, + "rewards/margins": 12.30968189239502, + "rewards/rejected": -11.617538452148438, + "step": 778, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.225815096025011, + "grad_norm": 0.9365268349647522, + "learning_rate": 3.3778771998737934e-05, + "logits/chosen": -1.6844940185546875, + "logits/rejected": -1.7032924890518188, + "logps/chosen": -3.275221109390259, + "logps/rejected": -137.47164916992188, + "loss": 0.15848176181316376, + "memory(GiB)": 46.73, + "nll_loss": 0.15660107135772705, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5174179673194885, + "rewards/margins": 12.837626457214355, + "rewards/rejected": -12.320207595825195, + "step": 779, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2286735149620367, + "grad_norm": 0.6778178811073303, + "learning_rate": 3.3542277530924374e-05, + "logits/chosen": -1.6570497751235962, + "logits/rejected": -1.7019526958465576, + "logps/chosen": -1.7437933683395386, + "logps/rejected": -138.32015991210938, + "loss": 0.09863787889480591, + "memory(GiB)": 46.73, + "nll_loss": 0.09677759557962418, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6153618097305298, + "rewards/margins": 12.391786575317383, + "rewards/rejected": -11.776426315307617, + "step": 780, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.231531933899062, + "grad_norm": 0.4646144509315491, + "learning_rate": 3.330644691633492e-05, + "logits/chosen": -1.6599035263061523, + "logits/rejected": -1.69225013256073, + "logps/chosen": -1.6837167739868164, + "logps/rejected": -164.30398559570312, + "loss": 0.09873135387897491, + "memory(GiB)": 46.73, + "nll_loss": 0.09822063148021698, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6354748010635376, + "rewards/margins": 15.040769577026367, + "rewards/rejected": -14.405292510986328, + "step": 781, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2343903528360873, + "grad_norm": 0.6401258111000061, + "learning_rate": 3.3071282510706624e-05, + "logits/chosen": -1.6564258337020874, + "logits/rejected": -1.693245768547058, + "logps/chosen": -1.5007685422897339, + "logps/rejected": -136.3229217529297, + "loss": 0.09584607928991318, + "memory(GiB)": 46.73, + "nll_loss": 0.09055926650762558, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5642552375793457, + "rewards/margins": 12.582983016967773, + "rewards/rejected": -12.01872730255127, + "step": 782, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.237248771773113, + "grad_norm": 0.5455237030982971, + "learning_rate": 3.283678666312154e-05, + "logits/chosen": -1.688979148864746, + "logits/rejected": -1.696632981300354, + "logps/chosen": -3.467952013015747, + "logps/rejected": -122.91952514648438, + "loss": 0.14648161828517914, + "memory(GiB)": 46.73, + "nll_loss": 0.144728884100914, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8166089057922363, + "rewards/margins": 12.023063659667969, + "rewards/rejected": -11.20645523071289, + "step": 783, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2401071907101384, + "grad_norm": 0.9562914967536926, + "learning_rate": 3.260296171598358e-05, + "logits/chosen": -1.7287250757217407, + "logits/rejected": -1.7348930835723877, + "logps/chosen": -3.420701265335083, + "logps/rejected": -107.7225112915039, + "loss": 0.17758214473724365, + "memory(GiB)": 46.73, + "nll_loss": 0.15587428212165833, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6694732904434204, + "rewards/margins": 10.439946174621582, + "rewards/rejected": -9.770472526550293, + "step": 784, + "train_speed(iter/s)": 0.005402 + }, + { + "epoch": 2.2429656096471637, + "grad_norm": 0.6848970651626587, + "learning_rate": 3.236981000499485e-05, + "logits/chosen": -1.6658862829208374, + "logits/rejected": -1.6751506328582764, + "logps/chosen": -2.954430341720581, + "logps/rejected": -113.62657165527344, + "loss": 0.15038307011127472, + "memory(GiB)": 46.73, + "nll_loss": 0.14674027264118195, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6098470687866211, + "rewards/margins": 10.768763542175293, + "rewards/rejected": -10.158916473388672, + "step": 785, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2458240285841895, + "grad_norm": 0.6783968806266785, + "learning_rate": 3.2137333859132466e-05, + "logits/chosen": -1.6658713817596436, + "logits/rejected": -1.6860020160675049, + "logps/chosen": -1.8329298496246338, + "logps/rejected": -136.6328125, + "loss": 0.11154640465974808, + "memory(GiB)": 46.73, + "nll_loss": 0.11017812043428421, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7413030862808228, + "rewards/margins": 13.236644744873047, + "rewards/rejected": -12.495339393615723, + "step": 786, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.248682447521215, + "grad_norm": 0.5898379683494568, + "learning_rate": 3.1905535600625314e-05, + "logits/chosen": -1.676591396331787, + "logits/rejected": -1.6916677951812744, + "logps/chosen": -3.6847083568573, + "logps/rejected": -131.96946716308594, + "loss": 0.11107183992862701, + "memory(GiB)": 46.73, + "nll_loss": 0.09921784698963165, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3924238085746765, + "rewards/margins": 12.32601547241211, + "rewards/rejected": -11.933591842651367, + "step": 787, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.25154086645824, + "grad_norm": 9.934392929077148, + "learning_rate": 3.167441754493066e-05, + "logits/chosen": -1.6075174808502197, + "logits/rejected": -1.6402552127838135, + "logps/chosen": -5.406757354736328, + "logps/rejected": -125.26739501953125, + "loss": 0.5008838772773743, + "memory(GiB)": 46.73, + "nll_loss": 0.21078495681285858, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.32979682087898254, + "rewards/margins": 10.943861961364746, + "rewards/rejected": -10.614065170288086, + "step": 788, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.254399285395266, + "grad_norm": 0.6809211373329163, + "learning_rate": 3.144398200071128e-05, + "logits/chosen": -1.6855800151824951, + "logits/rejected": -1.6980534791946411, + "logps/chosen": -2.5400819778442383, + "logps/rejected": -114.75363159179688, + "loss": 0.1503981649875641, + "memory(GiB)": 46.73, + "nll_loss": 0.12278814613819122, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6013644337654114, + "rewards/margins": 10.973652839660645, + "rewards/rejected": -10.37228775024414, + "step": 789, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2572577043322912, + "grad_norm": 0.6184489727020264, + "learning_rate": 3.121423126981217e-05, + "logits/chosen": -1.644142985343933, + "logits/rejected": -1.659967303276062, + "logps/chosen": -4.191022872924805, + "logps/rejected": -114.24392700195312, + "loss": 0.1494584083557129, + "memory(GiB)": 46.73, + "nll_loss": 0.135895237326622, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9744225740432739, + "rewards/margins": 11.152600288391113, + "rewards/rejected": -10.178176879882812, + "step": 790, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2601161232693165, + "grad_norm": 0.7756046652793884, + "learning_rate": 3.0985167647237756e-05, + "logits/chosen": -1.7134742736816406, + "logits/rejected": -1.7250508069992065, + "logps/chosen": -2.833266258239746, + "logps/rejected": -119.01715087890625, + "loss": 0.1561891734600067, + "memory(GiB)": 46.73, + "nll_loss": 0.13894352316856384, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5146474242210388, + "rewards/margins": 11.285941123962402, + "rewards/rejected": -10.771294593811035, + "step": 791, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2629745422063423, + "grad_norm": 0.6245182752609253, + "learning_rate": 3.075679342112874e-05, + "logits/chosen": -1.640115737915039, + "logits/rejected": -1.6473097801208496, + "logps/chosen": -3.92708683013916, + "logps/rejected": -110.22953796386719, + "loss": 0.3563145697116852, + "memory(GiB)": 46.73, + "nll_loss": 0.3547799587249756, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4437691867351532, + "rewards/margins": 10.290136337280273, + "rewards/rejected": -9.846367835998535, + "step": 792, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2658329611433676, + "grad_norm": 8.907173156738281, + "learning_rate": 3.052911087273949e-05, + "logits/chosen": -1.6591439247131348, + "logits/rejected": -1.6838045120239258, + "logps/chosen": -1.6061533689498901, + "logps/rejected": -136.19979858398438, + "loss": 0.10105100274085999, + "memory(GiB)": 46.73, + "nll_loss": 0.08847977221012115, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7345350980758667, + "rewards/margins": 12.696416854858398, + "rewards/rejected": -11.961880683898926, + "step": 793, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.268691380080393, + "grad_norm": 0.6540257334709167, + "learning_rate": 3.0302122276415056e-05, + "logits/chosen": -1.6991549730300903, + "logits/rejected": -1.7236639261245728, + "logps/chosen": -3.227992534637451, + "logps/rejected": -145.28456115722656, + "loss": 0.15280549228191376, + "memory(GiB)": 46.73, + "nll_loss": 0.14838962256908417, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5916187763214111, + "rewards/margins": 13.367993354797363, + "rewards/rejected": -12.776374816894531, + "step": 794, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2715497990174187, + "grad_norm": 0.7351321578025818, + "learning_rate": 3.0075829899568597e-05, + "logits/chosen": -1.6017165184020996, + "logits/rejected": -1.6121318340301514, + "logps/chosen": -3.3314077854156494, + "logps/rejected": -128.59197998046875, + "loss": 0.17674173414707184, + "memory(GiB)": 46.73, + "nll_loss": 0.13497605919837952, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7480218410491943, + "rewards/margins": 12.017620086669922, + "rewards/rejected": -11.269598007202148, + "step": 795, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.274408217954444, + "grad_norm": 0.7349981069564819, + "learning_rate": 2.9850236002658595e-05, + "logits/chosen": -1.6180601119995117, + "logits/rejected": -1.629482388496399, + "logps/chosen": -3.289719581604004, + "logps/rejected": -130.05755615234375, + "loss": 0.12025503069162369, + "memory(GiB)": 46.73, + "nll_loss": 0.119521364569664, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7377493381500244, + "rewards/margins": 12.549837112426758, + "rewards/rejected": -11.812088012695312, + "step": 796, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2772666368914694, + "grad_norm": 0.45565128326416016, + "learning_rate": 2.9625342839166316e-05, + "logits/chosen": -1.7096292972564697, + "logits/rejected": -1.7318222522735596, + "logps/chosen": -2.09987211227417, + "logps/rejected": -137.1615447998047, + "loss": 0.0756252259016037, + "memory(GiB)": 46.73, + "nll_loss": 0.07524615526199341, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6224530935287476, + "rewards/margins": 12.75358772277832, + "rewards/rejected": -12.131135940551758, + "step": 797, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2801250558284947, + "grad_norm": 0.5187860131263733, + "learning_rate": 2.940115265557345e-05, + "logits/chosen": -1.6489043235778809, + "logits/rejected": -1.67991042137146, + "logps/chosen": -1.8865444660186768, + "logps/rejected": -122.9993667602539, + "loss": 0.1377023160457611, + "memory(GiB)": 46.73, + "nll_loss": 0.12219592928886414, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7240051627159119, + "rewards/margins": 11.111031532287598, + "rewards/rejected": -10.3870267868042, + "step": 798, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2829834747655204, + "grad_norm": 0.637151837348938, + "learning_rate": 2.917766769133937e-05, + "logits/chosen": -1.6871957778930664, + "logits/rejected": -1.702707290649414, + "logps/chosen": -2.857081174850464, + "logps/rejected": -118.28166961669922, + "loss": 0.1422526240348816, + "memory(GiB)": 46.73, + "nll_loss": 0.14158561825752258, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5195335745811462, + "rewards/margins": 11.0984468460083, + "rewards/rejected": -10.578912734985352, + "step": 799, + "train_speed(iter/s)": 0.005403 + }, + { + "epoch": 2.2858418937025458, + "grad_norm": 0.6244106292724609, + "learning_rate": 2.8954890178879178e-05, + "logits/chosen": -1.678558588027954, + "logits/rejected": -1.6917924880981445, + "logps/chosen": -3.7977027893066406, + "logps/rejected": -119.4873046875, + "loss": 0.18403074145317078, + "memory(GiB)": 46.73, + "nll_loss": 0.1719832867383957, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.816820502281189, + "rewards/margins": 11.37762451171875, + "rewards/rejected": -10.56080436706543, + "step": 800, + "train_speed(iter/s)": 0.005404 + } + ], + "logging_steps": 1, + "max_steps": 1047, + "num_input_tokens_seen": 0, + "num_train_epochs": 3, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.606176109986054e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +}