{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.14292094685127288, "eval_steps": 300, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002858418937025458, "grad_norm": 10.349462509155273, "learning_rate": 3.7735849056603773e-06, "logits/chosen": -0.6422490477561951, "logits/rejected": -0.6447486877441406, "logps/chosen": -6.999429225921631, "logps/rejected": -13.433603286743164, "loss": 1.3778549432754517, "memory(GiB)": 46.73, "nll_loss": 0.6847077012062073, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005273 }, { "epoch": 0.005716837874050916, "grad_norm": 11.263213157653809, "learning_rate": 7.547169811320755e-06, "logits/chosen": -0.6429960131645203, "logits/rejected": -0.6454926133155823, "logps/chosen": -9.604641914367676, "logps/rejected": -13.53369140625, "loss": 1.4975696802139282, "memory(GiB)": 46.73, "nll_loss": 0.8044224381446838, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005366 }, { "epoch": 0.008575256811076373, "grad_norm": 9.09404182434082, "learning_rate": 1.1320754716981132e-05, "logits/chosen": -0.6486532092094421, "logits/rejected": -0.6493248343467712, "logps/chosen": -7.69912576675415, "logps/rejected": -17.816326141357422, "loss": 1.2593896389007568, "memory(GiB)": 46.73, "nll_loss": 0.5679630637168884, "rewards/accuracies": 0.625, "rewards/chosen": 0.0031128099653869867, "rewards/margins": 0.0035441224463284016, "rewards/rejected": -0.00043131227721460164, "step": 3, "train_speed(iter/s)": 0.005419 }, { "epoch": 0.011433675748101831, "grad_norm": 13.314420700073242, "learning_rate": 1.509433962264151e-05, "logits/chosen": -0.6668453812599182, "logits/rejected": -0.6718658804893494, "logps/chosen": -6.061755180358887, "logps/rejected": -13.643918991088867, "loss": 1.4406771659851074, "memory(GiB)": 46.73, "nll_loss": 0.7477570176124573, "rewards/accuracies": 0.53125, "rewards/chosen": 0.008774133399128914, "rewards/margins": 0.0006008772179484367, "rewards/rejected": 0.008173256181180477, "step": 4, "train_speed(iter/s)": 0.005446 }, { "epoch": 0.014292094685127288, "grad_norm": 12.340804100036621, "learning_rate": 1.8867924528301888e-05, "logits/chosen": -0.6321276426315308, "logits/rejected": -0.6321861743927002, "logps/chosen": -11.234216690063477, "logps/rejected": -11.82645034790039, "loss": 1.3690662384033203, "memory(GiB)": 46.73, "nll_loss": 0.6870464086532593, "rewards/accuracies": 0.6875, "rewards/chosen": 0.032103873789310455, "rewards/margins": 0.022960105910897255, "rewards/rejected": 0.0091437678784132, "step": 5, "train_speed(iter/s)": 0.005444 }, { "epoch": 0.017150513622152745, "grad_norm": 13.995262145996094, "learning_rate": 2.2641509433962265e-05, "logits/chosen": -0.6530164480209351, "logits/rejected": -0.6550691723823547, "logps/chosen": -8.742744445800781, "logps/rejected": -12.622247695922852, "loss": 1.3672001361846924, "memory(GiB)": 46.73, "nll_loss": 0.702350378036499, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0800265222787857, "rewards/margins": 0.06047351285815239, "rewards/rejected": 0.019553007557988167, "step": 6, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.020008932559178204, "grad_norm": 10.019857406616211, "learning_rate": 2.641509433962264e-05, "logits/chosen": -0.6211694478988647, "logits/rejected": -0.6214967370033264, "logps/chosen": -6.935382843017578, "logps/rejected": -13.613279342651367, "loss": 1.2412631511688232, "memory(GiB)": 46.73, "nll_loss": 0.5651571154594421, "rewards/accuracies": 0.59375, "rewards/chosen": 0.13799861073493958, "rewards/margins": 0.053141627460718155, "rewards/rejected": 0.08485697209835052, "step": 7, "train_speed(iter/s)": 0.005441 }, { "epoch": 0.022867351496203663, "grad_norm": 6.375326633453369, "learning_rate": 3.018867924528302e-05, "logits/chosen": -0.6666778326034546, "logits/rejected": -0.6678147315979004, "logps/chosen": -8.114872932434082, "logps/rejected": -13.392560958862305, "loss": 1.1162137985229492, "memory(GiB)": 46.73, "nll_loss": 0.4446101784706116, "rewards/accuracies": 0.59375, "rewards/chosen": 0.20063960552215576, "rewards/margins": 0.09723334014415741, "rewards/rejected": 0.10340625792741776, "step": 8, "train_speed(iter/s)": 0.005426 }, { "epoch": 0.02572577043322912, "grad_norm": 4.046472549438477, "learning_rate": 3.39622641509434e-05, "logits/chosen": -0.5842044949531555, "logits/rejected": -0.5892153382301331, "logps/chosen": -13.877073287963867, "logps/rejected": -14.116576194763184, "loss": 1.259205937385559, "memory(GiB)": 46.73, "nll_loss": 0.5605449676513672, "rewards/accuracies": 0.53125, "rewards/chosen": 0.1392103135585785, "rewards/margins": 0.09627523273229599, "rewards/rejected": 0.0429350808262825, "step": 9, "train_speed(iter/s)": 0.005422 }, { "epoch": 0.028584189370254576, "grad_norm": 7.625533103942871, "learning_rate": 3.7735849056603776e-05, "logits/chosen": -0.6210353374481201, "logits/rejected": -0.6224341988563538, "logps/chosen": -8.32575798034668, "logps/rejected": -11.715011596679688, "loss": 1.2772942781448364, "memory(GiB)": 46.73, "nll_loss": 0.48597079515457153, "rewards/accuracies": 0.4375, "rewards/chosen": -0.043191827833652496, "rewards/margins": 0.029505327343940735, "rewards/rejected": -0.07269717007875443, "step": 10, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.03144260830728004, "grad_norm": 11.961934089660645, "learning_rate": 4.150943396226415e-05, "logits/chosen": -0.6265634298324585, "logits/rejected": -0.6289808750152588, "logps/chosen": -7.129470348358154, "logps/rejected": -11.932583808898926, "loss": 1.447466254234314, "memory(GiB)": 46.73, "nll_loss": 0.6552329659461975, "rewards/accuracies": 0.46875, "rewards/chosen": -0.00290237320587039, "rewards/margins": 0.06162097677588463, "rewards/rejected": -0.0645233541727066, "step": 11, "train_speed(iter/s)": 0.005473 }, { "epoch": 0.03430102724430549, "grad_norm": 10.154479026794434, "learning_rate": 4.528301886792453e-05, "logits/chosen": -0.6388624906539917, "logits/rejected": -0.639370858669281, "logps/chosen": -9.490407943725586, "logps/rejected": -12.88676643371582, "loss": 1.4875458478927612, "memory(GiB)": 46.73, "nll_loss": 0.6468713283538818, "rewards/accuracies": 0.4375, "rewards/chosen": -0.10463112592697144, "rewards/margins": -0.059477299451828, "rewards/rejected": -0.04515381157398224, "step": 12, "train_speed(iter/s)": 0.005465 }, { "epoch": 0.03715944618133095, "grad_norm": 4.091860771179199, "learning_rate": 4.9056603773584906e-05, "logits/chosen": -0.6680133938789368, "logits/rejected": -0.6711105108261108, "logps/chosen": -5.56148099899292, "logps/rejected": -13.865943908691406, "loss": 1.0154482126235962, "memory(GiB)": 46.73, "nll_loss": 0.35444653034210205, "rewards/accuracies": 0.65625, "rewards/chosen": 0.12190410494804382, "rewards/margins": 0.3293726444244385, "rewards/rejected": -0.20746850967407227, "step": 13, "train_speed(iter/s)": 0.00546 }, { "epoch": 0.04001786511835641, "grad_norm": 3.039910316467285, "learning_rate": 5.283018867924528e-05, "logits/chosen": -0.6245446801185608, "logits/rejected": -0.6280595660209656, "logps/chosen": -7.042474269866943, "logps/rejected": -14.88280963897705, "loss": 0.9986085295677185, "memory(GiB)": 46.73, "nll_loss": 0.32772910594940186, "rewards/accuracies": 0.59375, "rewards/chosen": 0.08946945518255234, "rewards/margins": 0.2548743188381195, "rewards/rejected": -0.16540484130382538, "step": 14, "train_speed(iter/s)": 0.005463 }, { "epoch": 0.042876284055381866, "grad_norm": 2.8388617038726807, "learning_rate": 5.660377358490566e-05, "logits/chosen": -0.613956868648529, "logits/rejected": -0.6150951385498047, "logps/chosen": -5.398593902587891, "logps/rejected": -10.984697341918945, "loss": 0.9217166900634766, "memory(GiB)": 46.73, "nll_loss": 0.21436992287635803, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2490297257900238, "rewards/margins": 0.12685683369636536, "rewards/rejected": 0.12217291444540024, "step": 15, "train_speed(iter/s)": 0.005464 }, { "epoch": 0.045734702992407325, "grad_norm": 3.623399257659912, "learning_rate": 6.037735849056604e-05, "logits/chosen": -0.5890456438064575, "logits/rejected": -0.5907201766967773, "logps/chosen": -7.65773868560791, "logps/rejected": -15.24480152130127, "loss": 1.130638837814331, "memory(GiB)": 46.73, "nll_loss": 0.33376482129096985, "rewards/accuracies": 0.46875, "rewards/chosen": 0.14319562911987305, "rewards/margins": 0.01443251222372055, "rewards/rejected": 0.1287631392478943, "step": 16, "train_speed(iter/s)": 0.00546 }, { "epoch": 0.048593121929432784, "grad_norm": 2.9850075244903564, "learning_rate": 6.415094339622641e-05, "logits/chosen": -0.5228931903839111, "logits/rejected": -0.524716854095459, "logps/chosen": -10.135262489318848, "logps/rejected": -14.072588920593262, "loss": 1.2770482301712036, "memory(GiB)": 46.73, "nll_loss": 0.48515522480010986, "rewards/accuracies": 0.40625, "rewards/chosen": 0.13618236780166626, "rewards/margins": -0.09462341666221619, "rewards/rejected": 0.23080575466156006, "step": 17, "train_speed(iter/s)": 0.005473 }, { "epoch": 0.05145154086645824, "grad_norm": 2.2746193408966064, "learning_rate": 6.79245283018868e-05, "logits/chosen": -0.5764032006263733, "logits/rejected": -0.5762047171592712, "logps/chosen": -11.675098419189453, "logps/rejected": -10.994297981262207, "loss": 1.2022521495819092, "memory(GiB)": 46.73, "nll_loss": 0.4671342372894287, "rewards/accuracies": 0.46875, "rewards/chosen": 0.1593710482120514, "rewards/margins": -0.00844080001115799, "rewards/rejected": 0.1678118258714676, "step": 18, "train_speed(iter/s)": 0.005468 }, { "epoch": 0.0543099598034837, "grad_norm": 2.324984312057495, "learning_rate": 7.169811320754717e-05, "logits/chosen": -0.567690908908844, "logits/rejected": -0.569066047668457, "logps/chosen": -9.0728120803833, "logps/rejected": -12.268661499023438, "loss": 1.1060843467712402, "memory(GiB)": 46.73, "nll_loss": 0.41300466656684875, "rewards/accuracies": 0.53125, "rewards/chosen": 0.23081830143928528, "rewards/margins": 0.0710553377866745, "rewards/rejected": 0.15976294875144958, "step": 19, "train_speed(iter/s)": 0.005463 }, { "epoch": 0.05716837874050915, "grad_norm": 2.0991458892822266, "learning_rate": 7.547169811320755e-05, "logits/chosen": -0.6091416478157043, "logits/rejected": -0.6100034117698669, "logps/chosen": -4.26762056350708, "logps/rejected": -11.32187557220459, "loss": 1.0021699666976929, "memory(GiB)": 46.73, "nll_loss": 0.2933175265789032, "rewards/accuracies": 0.4375, "rewards/chosen": 0.15655732154846191, "rewards/margins": 0.008277412503957748, "rewards/rejected": 0.14827993512153625, "step": 20, "train_speed(iter/s)": 0.005467 }, { "epoch": 0.06002679767753461, "grad_norm": 3.4958455562591553, "learning_rate": 7.924528301886794e-05, "logits/chosen": -0.571921706199646, "logits/rejected": -0.572878360748291, "logps/chosen": -9.612298965454102, "logps/rejected": -12.484085083007812, "loss": 1.1795949935913086, "memory(GiB)": 46.73, "nll_loss": 0.46760252118110657, "rewards/accuracies": 0.53125, "rewards/chosen": 0.14643912017345428, "rewards/margins": 0.0200117826461792, "rewards/rejected": 0.12642733752727509, "step": 21, "train_speed(iter/s)": 0.005467 }, { "epoch": 0.06288521661456008, "grad_norm": 3.175546169281006, "learning_rate": 8.30188679245283e-05, "logits/chosen": -0.6108006834983826, "logits/rejected": -0.6111243367195129, "logps/chosen": -6.207424163818359, "logps/rejected": -7.818144798278809, "loss": 1.1549935340881348, "memory(GiB)": 46.73, "nll_loss": 0.4683927893638611, "rewards/accuracies": 0.5625, "rewards/chosen": 0.23285990953445435, "rewards/margins": 0.06634702533483505, "rewards/rejected": 0.16651292145252228, "step": 22, "train_speed(iter/s)": 0.00547 }, { "epoch": 0.06574363555158554, "grad_norm": 2.4531869888305664, "learning_rate": 8.679245283018869e-05, "logits/chosen": -0.6012008190155029, "logits/rejected": -0.6021928191184998, "logps/chosen": -5.598664283752441, "logps/rejected": -13.262667655944824, "loss": 0.9260164499282837, "memory(GiB)": 46.73, "nll_loss": 0.33532270789146423, "rewards/accuracies": 0.625, "rewards/chosen": 0.3285560607910156, "rewards/margins": 0.3157665431499481, "rewards/rejected": 0.012789532542228699, "step": 23, "train_speed(iter/s)": 0.005467 }, { "epoch": 0.06860205448861098, "grad_norm": 2.328031301498413, "learning_rate": 9.056603773584906e-05, "logits/chosen": -0.567432165145874, "logits/rejected": -0.5704118609428406, "logps/chosen": -4.026985168457031, "logps/rejected": -14.904813766479492, "loss": 0.8984246253967285, "memory(GiB)": 46.73, "nll_loss": 0.26223480701446533, "rewards/accuracies": 0.59375, "rewards/chosen": 0.26638248562812805, "rewards/margins": 0.22430934011936188, "rewards/rejected": 0.042073119431734085, "step": 24, "train_speed(iter/s)": 0.005466 }, { "epoch": 0.07146047342563644, "grad_norm": 3.5119378566741943, "learning_rate": 9.433962264150944e-05, "logits/chosen": -0.5709348320960999, "logits/rejected": -0.5688645243644714, "logps/chosen": -7.716845989227295, "logps/rejected": -7.868927955627441, "loss": 1.113297462463379, "memory(GiB)": 46.73, "nll_loss": 0.3660878837108612, "rewards/accuracies": 0.5, "rewards/chosen": 0.2273256480693817, "rewards/margins": -0.0022776294499635696, "rewards/rejected": 0.22960326075553894, "step": 25, "train_speed(iter/s)": 0.005475 }, { "epoch": 0.0743188923626619, "grad_norm": 3.2336673736572266, "learning_rate": 9.811320754716981e-05, "logits/chosen": -0.589956521987915, "logits/rejected": -0.587726354598999, "logps/chosen": -10.072855949401855, "logps/rejected": -12.857810974121094, "loss": 1.0991942882537842, "memory(GiB)": 46.73, "nll_loss": 0.40110355615615845, "rewards/accuracies": 0.5, "rewards/chosen": 0.17576897144317627, "rewards/margins": 0.11343260109424591, "rewards/rejected": 0.062336355447769165, "step": 26, "train_speed(iter/s)": 0.005466 }, { "epoch": 0.07717731129968736, "grad_norm": 2.6813321113586426, "learning_rate": 0.0001018867924528302, "logits/chosen": -0.5832359194755554, "logits/rejected": -0.5860565304756165, "logps/chosen": -8.197118759155273, "logps/rejected": -17.45244598388672, "loss": 0.8366767764091492, "memory(GiB)": 46.73, "nll_loss": 0.2886262536048889, "rewards/accuracies": 0.71875, "rewards/chosen": 0.3297504186630249, "rewards/margins": 0.48295390605926514, "rewards/rejected": -0.15320347249507904, "step": 27, "train_speed(iter/s)": 0.00547 }, { "epoch": 0.08003573023671282, "grad_norm": 3.3800203800201416, "learning_rate": 0.00010566037735849057, "logits/chosen": -0.6005962491035461, "logits/rejected": -0.6035608053207397, "logps/chosen": -9.117904663085938, "logps/rejected": -18.400161743164062, "loss": 1.0143071413040161, "memory(GiB)": 46.73, "nll_loss": 0.4276316463947296, "rewards/accuracies": 0.65625, "rewards/chosen": 0.271901398897171, "rewards/margins": 0.4319708049297333, "rewards/rejected": -0.16006940603256226, "step": 28, "train_speed(iter/s)": 0.005468 }, { "epoch": 0.08289414917373827, "grad_norm": 5.461134433746338, "learning_rate": 0.00010943396226415095, "logits/chosen": -0.5596082210540771, "logits/rejected": -0.5635167360305786, "logps/chosen": -7.607837200164795, "logps/rejected": -23.174358367919922, "loss": 0.803045928478241, "memory(GiB)": 46.73, "nll_loss": 0.32165294885635376, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3834715783596039, "rewards/margins": 0.7214637994766235, "rewards/rejected": -0.33799219131469727, "step": 29, "train_speed(iter/s)": 0.005464 }, { "epoch": 0.08575256811076373, "grad_norm": 3.3377506732940674, "learning_rate": 0.00011320754716981132, "logits/chosen": -0.6003558039665222, "logits/rejected": -0.6016712188720703, "logps/chosen": -7.941157817840576, "logps/rejected": -10.564404487609863, "loss": 1.0737202167510986, "memory(GiB)": 46.73, "nll_loss": 0.3314566910266876, "rewards/accuracies": 0.59375, "rewards/chosen": 0.1379927098751068, "rewards/margins": 0.08670535683631897, "rewards/rejected": 0.05128733813762665, "step": 30, "train_speed(iter/s)": 0.005461 }, { "epoch": 0.08861098704778919, "grad_norm": 3.4214563369750977, "learning_rate": 0.0001169811320754717, "logits/chosen": -0.5186684727668762, "logits/rejected": -0.5189406275749207, "logps/chosen": -6.143683910369873, "logps/rejected": -25.88001251220703, "loss": 0.7792238593101501, "memory(GiB)": 46.73, "nll_loss": 0.2514691948890686, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2757991552352905, "rewards/margins": 0.5156725645065308, "rewards/rejected": -0.23987337946891785, "step": 31, "train_speed(iter/s)": 0.005459 }, { "epoch": 0.09146940598481465, "grad_norm": 4.645272731781006, "learning_rate": 0.00012075471698113207, "logits/chosen": -0.5988867282867432, "logits/rejected": -0.6016397476196289, "logps/chosen": -5.776233673095703, "logps/rejected": -22.404544830322266, "loss": 0.8892383575439453, "memory(GiB)": 46.73, "nll_loss": 0.4011368155479431, "rewards/accuracies": 0.75, "rewards/chosen": 0.22715790569782257, "rewards/margins": 0.7724226713180542, "rewards/rejected": -0.545264720916748, "step": 32, "train_speed(iter/s)": 0.005454 }, { "epoch": 0.09432782492184011, "grad_norm": 4.586422443389893, "learning_rate": 0.00012452830188679244, "logits/chosen": -0.5782912969589233, "logits/rejected": -0.5768243670463562, "logps/chosen": -10.939208984375, "logps/rejected": -13.486640930175781, "loss": 1.1607584953308105, "memory(GiB)": 46.73, "nll_loss": 0.5877886414527893, "rewards/accuracies": 0.65625, "rewards/chosen": 0.21317529678344727, "rewards/margins": 0.4141784906387329, "rewards/rejected": -0.20100319385528564, "step": 33, "train_speed(iter/s)": 0.005457 }, { "epoch": 0.09718624385886557, "grad_norm": 4.306042671203613, "learning_rate": 0.00012830188679245283, "logits/chosen": -0.6019578576087952, "logits/rejected": -0.6082974076271057, "logps/chosen": -7.5170578956604, "logps/rejected": -24.889406204223633, "loss": 0.9509016275405884, "memory(GiB)": 46.73, "nll_loss": 0.4247076213359833, "rewards/accuracies": 0.75, "rewards/chosen": 0.10510760545730591, "rewards/margins": 0.8037927150726318, "rewards/rejected": -0.6986850500106812, "step": 34, "train_speed(iter/s)": 0.005456 }, { "epoch": 0.10004466279589103, "grad_norm": 3.002274751663208, "learning_rate": 0.0001320754716981132, "logits/chosen": -0.6133092641830444, "logits/rejected": -0.6127456426620483, "logps/chosen": -8.859593391418457, "logps/rejected": -17.02096939086914, "loss": 0.8848217129707336, "memory(GiB)": 46.73, "nll_loss": 0.3480006456375122, "rewards/accuracies": 0.71875, "rewards/chosen": 0.25863486528396606, "rewards/margins": 0.5611037015914917, "rewards/rejected": -0.302468866109848, "step": 35, "train_speed(iter/s)": 0.005457 }, { "epoch": 0.10290308173291648, "grad_norm": 4.299287796020508, "learning_rate": 0.0001358490566037736, "logits/chosen": -0.5725032091140747, "logits/rejected": -0.5725142359733582, "logps/chosen": -8.371686935424805, "logps/rejected": -17.657852172851562, "loss": 0.8825864791870117, "memory(GiB)": 46.73, "nll_loss": 0.3603641390800476, "rewards/accuracies": 0.78125, "rewards/chosen": 0.23154468834400177, "rewards/margins": 0.6240193843841553, "rewards/rejected": -0.3924746811389923, "step": 36, "train_speed(iter/s)": 0.005457 }, { "epoch": 0.10576150066994194, "grad_norm": 4.354315757751465, "learning_rate": 0.00013962264150943395, "logits/chosen": -0.5943324565887451, "logits/rejected": -0.5940991044044495, "logps/chosen": -7.657552719116211, "logps/rejected": -16.183917999267578, "loss": 0.8160735964775085, "memory(GiB)": 46.73, "nll_loss": 0.3588046133518219, "rewards/accuracies": 0.84375, "rewards/chosen": 0.27544379234313965, "rewards/margins": 0.7471473217010498, "rewards/rejected": -0.4717034101486206, "step": 37, "train_speed(iter/s)": 0.005452 }, { "epoch": 0.1086199196069674, "grad_norm": 7.916697978973389, "learning_rate": 0.00014339622641509434, "logits/chosen": -0.5676888227462769, "logits/rejected": -0.5714080929756165, "logps/chosen": -6.698662757873535, "logps/rejected": -17.954235076904297, "loss": 1.052018642425537, "memory(GiB)": 46.73, "nll_loss": 0.49374452233314514, "rewards/accuracies": 0.78125, "rewards/chosen": 0.16338011622428894, "rewards/margins": 0.42942774295806885, "rewards/rejected": -0.2660475969314575, "step": 38, "train_speed(iter/s)": 0.005452 }, { "epoch": 0.11147833854399285, "grad_norm": 3.7271363735198975, "learning_rate": 0.00014716981132075472, "logits/chosen": -0.6097766160964966, "logits/rejected": -0.6135396957397461, "logps/chosen": -7.30006217956543, "logps/rejected": -22.168495178222656, "loss": 0.7729511857032776, "memory(GiB)": 46.73, "nll_loss": 0.3125499188899994, "rewards/accuracies": 0.78125, "rewards/chosen": 0.28066012263298035, "rewards/margins": 0.8108583092689514, "rewards/rejected": -0.5301981568336487, "step": 39, "train_speed(iter/s)": 0.00545 }, { "epoch": 0.1143367574810183, "grad_norm": 2.960145950317383, "learning_rate": 0.0001509433962264151, "logits/chosen": -0.6132208108901978, "logits/rejected": -0.6163071990013123, "logps/chosen": -7.024638652801514, "logps/rejected": -21.298852920532227, "loss": 0.8106734752655029, "memory(GiB)": 46.73, "nll_loss": 0.37238579988479614, "rewards/accuracies": 0.78125, "rewards/chosen": 0.39458420872688293, "rewards/margins": 0.8476477265357971, "rewards/rejected": -0.45306357741355896, "step": 40, "train_speed(iter/s)": 0.005445 }, { "epoch": 0.11719517641804376, "grad_norm": 4.3203630447387695, "learning_rate": 0.0001547169811320755, "logits/chosen": -0.5976248979568481, "logits/rejected": -0.6002449989318848, "logps/chosen": -5.656615257263184, "logps/rejected": -16.032827377319336, "loss": 0.9440045952796936, "memory(GiB)": 46.73, "nll_loss": 0.33253738284111023, "rewards/accuracies": 0.59375, "rewards/chosen": 0.14414586126804352, "rewards/margins": 0.5006409287452698, "rewards/rejected": -0.35649505257606506, "step": 41, "train_speed(iter/s)": 0.005445 }, { "epoch": 0.12005359535506922, "grad_norm": 4.646491527557373, "learning_rate": 0.00015849056603773587, "logits/chosen": -0.5956608653068542, "logits/rejected": -0.5956603288650513, "logps/chosen": -11.719463348388672, "logps/rejected": -27.070579528808594, "loss": 1.0076483488082886, "memory(GiB)": 46.73, "nll_loss": 0.5070124268531799, "rewards/accuracies": 0.71875, "rewards/chosen": 0.15291725099086761, "rewards/margins": 0.7710469961166382, "rewards/rejected": -0.6181297898292542, "step": 42, "train_speed(iter/s)": 0.005446 }, { "epoch": 0.12291201429209468, "grad_norm": 4.248917102813721, "learning_rate": 0.00016226415094339625, "logits/chosen": -0.6100150942802429, "logits/rejected": -0.6142972111701965, "logps/chosen": -6.201865196228027, "logps/rejected": -19.82131004333496, "loss": 0.7969534993171692, "memory(GiB)": 46.73, "nll_loss": 0.31225427985191345, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20218679308891296, "rewards/margins": 0.705444872379303, "rewards/rejected": -0.5032580494880676, "step": 43, "train_speed(iter/s)": 0.005448 }, { "epoch": 0.12577043322912015, "grad_norm": 3.1864066123962402, "learning_rate": 0.0001660377358490566, "logits/chosen": -0.6078452467918396, "logits/rejected": -0.6100336909294128, "logps/chosen": -8.217609405517578, "logps/rejected": -18.432086944580078, "loss": 0.945781409740448, "memory(GiB)": 46.73, "nll_loss": 0.4447736442089081, "rewards/accuracies": 0.8125, "rewards/chosen": 0.16747131943702698, "rewards/margins": 0.6352076530456543, "rewards/rejected": -0.46773630380630493, "step": 44, "train_speed(iter/s)": 0.005451 }, { "epoch": 0.1286288521661456, "grad_norm": 2.8247904777526855, "learning_rate": 0.000169811320754717, "logits/chosen": -0.6424505710601807, "logits/rejected": -0.6455634236335754, "logps/chosen": -4.626930236816406, "logps/rejected": -18.966289520263672, "loss": 0.6525614261627197, "memory(GiB)": 46.73, "nll_loss": 0.20949943363666534, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1935967355966568, "rewards/margins": 0.7181073427200317, "rewards/rejected": -0.5245105624198914, "step": 45, "train_speed(iter/s)": 0.005449 }, { "epoch": 0.13148727110317107, "grad_norm": 5.167090892791748, "learning_rate": 0.00017358490566037738, "logits/chosen": -0.6390554308891296, "logits/rejected": -0.6455981731414795, "logps/chosen": -7.457905292510986, "logps/rejected": -22.238759994506836, "loss": 0.7052859663963318, "memory(GiB)": 46.73, "nll_loss": 0.3145278990268707, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3406547009944916, "rewards/margins": 0.9184964895248413, "rewards/rejected": -0.5778417587280273, "step": 46, "train_speed(iter/s)": 0.005446 }, { "epoch": 0.1343456900401965, "grad_norm": 3.110797166824341, "learning_rate": 0.00017735849056603776, "logits/chosen": -0.6957284212112427, "logits/rejected": -0.6984925866127014, "logps/chosen": -6.335500717163086, "logps/rejected": -26.946069717407227, "loss": 0.6684616804122925, "memory(GiB)": 46.73, "nll_loss": 0.27696001529693604, "rewards/accuracies": 0.78125, "rewards/chosen": 0.36519789695739746, "rewards/margins": 1.261197805404663, "rewards/rejected": -0.8960000276565552, "step": 47, "train_speed(iter/s)": 0.005445 }, { "epoch": 0.13720410897722196, "grad_norm": 5.592209815979004, "learning_rate": 0.00018113207547169812, "logits/chosen": -0.6557337641716003, "logits/rejected": -0.6595371961593628, "logps/chosen": -6.262232780456543, "logps/rejected": -22.550495147705078, "loss": 0.844598650932312, "memory(GiB)": 46.73, "nll_loss": 0.32042089104652405, "rewards/accuracies": 0.71875, "rewards/chosen": 0.098446786403656, "rewards/margins": 1.1042643785476685, "rewards/rejected": -1.0058175325393677, "step": 48, "train_speed(iter/s)": 0.005444 }, { "epoch": 0.14006252791424742, "grad_norm": 5.518631458282471, "learning_rate": 0.0001849056603773585, "logits/chosen": -0.7261903285980225, "logits/rejected": -0.7333111763000488, "logps/chosen": -6.155282020568848, "logps/rejected": -28.635177612304688, "loss": 0.7839219570159912, "memory(GiB)": 46.73, "nll_loss": 0.3167538046836853, "rewards/accuracies": 0.75, "rewards/chosen": 0.18123595416545868, "rewards/margins": 1.343546986579895, "rewards/rejected": -1.1623109579086304, "step": 49, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.14292094685127288, "grad_norm": 5.368433475494385, "learning_rate": 0.00018867924528301889, "logits/chosen": -0.7460846304893494, "logits/rejected": -0.7433331608772278, "logps/chosen": -8.476225852966309, "logps/rejected": -20.479339599609375, "loss": 1.041689395904541, "memory(GiB)": 46.73, "nll_loss": 0.5162184834480286, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07575411349534988, "rewards/margins": 0.8544278144836426, "rewards/rejected": -0.7786736488342285, "step": 50, "train_speed(iter/s)": 0.005439 } ], "logging_steps": 1, "max_steps": 1047, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.488196344152064e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }