Instructions to use cragtmp/2gt6-200 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/2gt6-200 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/2gt6-200") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.5716837874050915, | |
| "eval_steps": 300, | |
| "global_step": 200, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002858418937025458, | |
| "grad_norm": 10.349462509155273, | |
| "learning_rate": 3.7735849056603773e-06, | |
| "logits/chosen": -0.6422490477561951, | |
| "logits/rejected": -0.6447486877441406, | |
| "logps/chosen": -6.999429225921631, | |
| "logps/rejected": -13.433603286743164, | |
| "loss": 1.3778549432754517, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6847077012062073, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005273 | |
| }, | |
| { | |
| "epoch": 0.005716837874050916, | |
| "grad_norm": 11.263213157653809, | |
| "learning_rate": 7.547169811320755e-06, | |
| "logits/chosen": -0.6429960131645203, | |
| "logits/rejected": -0.6454926133155823, | |
| "logps/chosen": -9.604641914367676, | |
| "logps/rejected": -13.53369140625, | |
| "loss": 1.4975696802139282, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.8044224381446838, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005366 | |
| }, | |
| { | |
| "epoch": 0.008575256811076373, | |
| "grad_norm": 9.09404182434082, | |
| "learning_rate": 1.1320754716981132e-05, | |
| "logits/chosen": -0.6486532092094421, | |
| "logits/rejected": -0.6493248343467712, | |
| "logps/chosen": -7.69912576675415, | |
| "logps/rejected": -17.816326141357422, | |
| "loss": 1.2593896389007568, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5679630637168884, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0031128099653869867, | |
| "rewards/margins": 0.0035441224463284016, | |
| "rewards/rejected": -0.00043131227721460164, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005419 | |
| }, | |
| { | |
| "epoch": 0.011433675748101831, | |
| "grad_norm": 13.314420700073242, | |
| "learning_rate": 1.509433962264151e-05, | |
| "logits/chosen": -0.6668453812599182, | |
| "logits/rejected": -0.6718658804893494, | |
| "logps/chosen": -6.061755180358887, | |
| "logps/rejected": -13.643918991088867, | |
| "loss": 1.4406771659851074, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7477570176124573, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.008774133399128914, | |
| "rewards/margins": 0.0006008772179484367, | |
| "rewards/rejected": 0.008173256181180477, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005446 | |
| }, | |
| { | |
| "epoch": 0.014292094685127288, | |
| "grad_norm": 12.340804100036621, | |
| "learning_rate": 1.8867924528301888e-05, | |
| "logits/chosen": -0.6321276426315308, | |
| "logits/rejected": -0.6321861743927002, | |
| "logps/chosen": -11.234216690063477, | |
| "logps/rejected": -11.82645034790039, | |
| "loss": 1.3690662384033203, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6870464086532593, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.032103873789310455, | |
| "rewards/margins": 0.022960105910897255, | |
| "rewards/rejected": 0.0091437678784132, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005444 | |
| }, | |
| { | |
| "epoch": 0.017150513622152745, | |
| "grad_norm": 13.995262145996094, | |
| "learning_rate": 2.2641509433962265e-05, | |
| "logits/chosen": -0.6530164480209351, | |
| "logits/rejected": -0.6550691723823547, | |
| "logps/chosen": -8.742744445800781, | |
| "logps/rejected": -12.622247695922852, | |
| "loss": 1.3672001361846924, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.702350378036499, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0800265222787857, | |
| "rewards/margins": 0.06047351285815239, | |
| "rewards/rejected": 0.019553007557988167, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.020008932559178204, | |
| "grad_norm": 10.019857406616211, | |
| "learning_rate": 2.641509433962264e-05, | |
| "logits/chosen": -0.6211694478988647, | |
| "logits/rejected": -0.6214967370033264, | |
| "logps/chosen": -6.935382843017578, | |
| "logps/rejected": -13.613279342651367, | |
| "loss": 1.2412631511688232, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5651571154594421, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.13799861073493958, | |
| "rewards/margins": 0.053141627460718155, | |
| "rewards/rejected": 0.08485697209835052, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.022867351496203663, | |
| "grad_norm": 6.375326633453369, | |
| "learning_rate": 3.018867924528302e-05, | |
| "logits/chosen": -0.6666778326034546, | |
| "logits/rejected": -0.6678147315979004, | |
| "logps/chosen": -8.114872932434082, | |
| "logps/rejected": -13.392560958862305, | |
| "loss": 1.1162137985229492, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4446101784706116, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.20063960552215576, | |
| "rewards/margins": 0.09723334014415741, | |
| "rewards/rejected": 0.10340625792741776, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.02572577043322912, | |
| "grad_norm": 4.046472549438477, | |
| "learning_rate": 3.39622641509434e-05, | |
| "logits/chosen": -0.5842044949531555, | |
| "logits/rejected": -0.5892153382301331, | |
| "logps/chosen": -13.877073287963867, | |
| "logps/rejected": -14.116576194763184, | |
| "loss": 1.259205937385559, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5605449676513672, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.1392103135585785, | |
| "rewards/margins": 0.09627523273229599, | |
| "rewards/rejected": 0.0429350808262825, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005422 | |
| }, | |
| { | |
| "epoch": 0.028584189370254576, | |
| "grad_norm": 7.625533103942871, | |
| "learning_rate": 3.7735849056603776e-05, | |
| "logits/chosen": -0.6210353374481201, | |
| "logits/rejected": -0.6224341988563538, | |
| "logps/chosen": -8.32575798034668, | |
| "logps/rejected": -11.715011596679688, | |
| "loss": 1.2772942781448364, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.48597079515457153, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.043191827833652496, | |
| "rewards/margins": 0.029505327343940735, | |
| "rewards/rejected": -0.07269717007875443, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.03144260830728004, | |
| "grad_norm": 11.961934089660645, | |
| "learning_rate": 4.150943396226415e-05, | |
| "logits/chosen": -0.6265634298324585, | |
| "logits/rejected": -0.6289808750152588, | |
| "logps/chosen": -7.129470348358154, | |
| "logps/rejected": -11.932583808898926, | |
| "loss": 1.447466254234314, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6552329659461975, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.00290237320587039, | |
| "rewards/margins": 0.06162097677588463, | |
| "rewards/rejected": -0.0645233541727066, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005473 | |
| }, | |
| { | |
| "epoch": 0.03430102724430549, | |
| "grad_norm": 10.154479026794434, | |
| "learning_rate": 4.528301886792453e-05, | |
| "logits/chosen": -0.6388624906539917, | |
| "logits/rejected": -0.639370858669281, | |
| "logps/chosen": -9.490407943725586, | |
| "logps/rejected": -12.88676643371582, | |
| "loss": 1.4875458478927612, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6468713283538818, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.10463112592697144, | |
| "rewards/margins": -0.059477299451828, | |
| "rewards/rejected": -0.04515381157398224, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005465 | |
| }, | |
| { | |
| "epoch": 0.03715944618133095, | |
| "grad_norm": 4.091860771179199, | |
| "learning_rate": 4.9056603773584906e-05, | |
| "logits/chosen": -0.6680133938789368, | |
| "logits/rejected": -0.6711105108261108, | |
| "logps/chosen": -5.56148099899292, | |
| "logps/rejected": -13.865943908691406, | |
| "loss": 1.0154482126235962, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.35444653034210205, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.12190410494804382, | |
| "rewards/margins": 0.3293726444244385, | |
| "rewards/rejected": -0.20746850967407227, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.00546 | |
| }, | |
| { | |
| "epoch": 0.04001786511835641, | |
| "grad_norm": 3.039910316467285, | |
| "learning_rate": 5.283018867924528e-05, | |
| "logits/chosen": -0.6245446801185608, | |
| "logits/rejected": -0.6280595660209656, | |
| "logps/chosen": -7.042474269866943, | |
| "logps/rejected": -14.88280963897705, | |
| "loss": 0.9986085295677185, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32772910594940186, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.08946945518255234, | |
| "rewards/margins": 0.2548743188381195, | |
| "rewards/rejected": -0.16540484130382538, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005463 | |
| }, | |
| { | |
| "epoch": 0.042876284055381866, | |
| "grad_norm": 2.8388617038726807, | |
| "learning_rate": 5.660377358490566e-05, | |
| "logits/chosen": -0.613956868648529, | |
| "logits/rejected": -0.6150951385498047, | |
| "logps/chosen": -5.398593902587891, | |
| "logps/rejected": -10.984697341918945, | |
| "loss": 0.9217166900634766, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.21436992287635803, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2490297257900238, | |
| "rewards/margins": 0.12685683369636536, | |
| "rewards/rejected": 0.12217291444540024, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005464 | |
| }, | |
| { | |
| "epoch": 0.045734702992407325, | |
| "grad_norm": 3.623399257659912, | |
| "learning_rate": 6.037735849056604e-05, | |
| "logits/chosen": -0.5890456438064575, | |
| "logits/rejected": -0.5907201766967773, | |
| "logps/chosen": -7.65773868560791, | |
| "logps/rejected": -15.24480152130127, | |
| "loss": 1.130638837814331, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33376482129096985, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.14319562911987305, | |
| "rewards/margins": 0.01443251222372055, | |
| "rewards/rejected": 0.1287631392478943, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.00546 | |
| }, | |
| { | |
| "epoch": 0.048593121929432784, | |
| "grad_norm": 2.9850075244903564, | |
| "learning_rate": 6.415094339622641e-05, | |
| "logits/chosen": -0.5228931903839111, | |
| "logits/rejected": -0.524716854095459, | |
| "logps/chosen": -10.135262489318848, | |
| "logps/rejected": -14.072588920593262, | |
| "loss": 1.2770482301712036, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.48515522480010986, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": 0.13618236780166626, | |
| "rewards/margins": -0.09462341666221619, | |
| "rewards/rejected": 0.23080575466156006, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005473 | |
| }, | |
| { | |
| "epoch": 0.05145154086645824, | |
| "grad_norm": 2.2746193408966064, | |
| "learning_rate": 6.79245283018868e-05, | |
| "logits/chosen": -0.5764032006263733, | |
| "logits/rejected": -0.5762047171592712, | |
| "logps/chosen": -11.675098419189453, | |
| "logps/rejected": -10.994297981262207, | |
| "loss": 1.2022521495819092, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4671342372894287, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.1593710482120514, | |
| "rewards/margins": -0.00844080001115799, | |
| "rewards/rejected": 0.1678118258714676, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005468 | |
| }, | |
| { | |
| "epoch": 0.0543099598034837, | |
| "grad_norm": 2.324984312057495, | |
| "learning_rate": 7.169811320754717e-05, | |
| "logits/chosen": -0.567690908908844, | |
| "logits/rejected": -0.569066047668457, | |
| "logps/chosen": -9.0728120803833, | |
| "logps/rejected": -12.268661499023438, | |
| "loss": 1.1060843467712402, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.41300466656684875, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.23081830143928528, | |
| "rewards/margins": 0.0710553377866745, | |
| "rewards/rejected": 0.15976294875144958, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.005463 | |
| }, | |
| { | |
| "epoch": 0.05716837874050915, | |
| "grad_norm": 2.0991458892822266, | |
| "learning_rate": 7.547169811320755e-05, | |
| "logits/chosen": -0.6091416478157043, | |
| "logits/rejected": -0.6100034117698669, | |
| "logps/chosen": -4.26762056350708, | |
| "logps/rejected": -11.32187557220459, | |
| "loss": 1.0021699666976929, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2933175265789032, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.15655732154846191, | |
| "rewards/margins": 0.008277412503957748, | |
| "rewards/rejected": 0.14827993512153625, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005467 | |
| }, | |
| { | |
| "epoch": 0.06002679767753461, | |
| "grad_norm": 3.4958455562591553, | |
| "learning_rate": 7.924528301886794e-05, | |
| "logits/chosen": -0.571921706199646, | |
| "logits/rejected": -0.572878360748291, | |
| "logps/chosen": -9.612298965454102, | |
| "logps/rejected": -12.484085083007812, | |
| "loss": 1.1795949935913086, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.46760252118110657, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.14643912017345428, | |
| "rewards/margins": 0.0200117826461792, | |
| "rewards/rejected": 0.12642733752727509, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005467 | |
| }, | |
| { | |
| "epoch": 0.06288521661456008, | |
| "grad_norm": 3.175546169281006, | |
| "learning_rate": 8.30188679245283e-05, | |
| "logits/chosen": -0.6108006834983826, | |
| "logits/rejected": -0.6111243367195129, | |
| "logps/chosen": -6.207424163818359, | |
| "logps/rejected": -7.818144798278809, | |
| "loss": 1.1549935340881348, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4683927893638611, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.23285990953445435, | |
| "rewards/margins": 0.06634702533483505, | |
| "rewards/rejected": 0.16651292145252228, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.00547 | |
| }, | |
| { | |
| "epoch": 0.06574363555158554, | |
| "grad_norm": 2.4531869888305664, | |
| "learning_rate": 8.679245283018869e-05, | |
| "logits/chosen": -0.6012008190155029, | |
| "logits/rejected": -0.6021928191184998, | |
| "logps/chosen": -5.598664283752441, | |
| "logps/rejected": -13.262667655944824, | |
| "loss": 0.9260164499282837, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33532270789146423, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.3285560607910156, | |
| "rewards/margins": 0.3157665431499481, | |
| "rewards/rejected": 0.012789532542228699, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005467 | |
| }, | |
| { | |
| "epoch": 0.06860205448861098, | |
| "grad_norm": 2.328031301498413, | |
| "learning_rate": 9.056603773584906e-05, | |
| "logits/chosen": -0.567432165145874, | |
| "logits/rejected": -0.5704118609428406, | |
| "logps/chosen": -4.026985168457031, | |
| "logps/rejected": -14.904813766479492, | |
| "loss": 0.8984246253967285, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.26223480701446533, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.26638248562812805, | |
| "rewards/margins": 0.22430934011936188, | |
| "rewards/rejected": 0.042073119431734085, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005466 | |
| }, | |
| { | |
| "epoch": 0.07146047342563644, | |
| "grad_norm": 3.5119378566741943, | |
| "learning_rate": 9.433962264150944e-05, | |
| "logits/chosen": -0.5709348320960999, | |
| "logits/rejected": -0.5688645243644714, | |
| "logps/chosen": -7.716845989227295, | |
| "logps/rejected": -7.868927955627441, | |
| "loss": 1.113297462463379, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3660878837108612, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.2273256480693817, | |
| "rewards/margins": -0.0022776294499635696, | |
| "rewards/rejected": 0.22960326075553894, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005475 | |
| }, | |
| { | |
| "epoch": 0.0743188923626619, | |
| "grad_norm": 3.2336673736572266, | |
| "learning_rate": 9.811320754716981e-05, | |
| "logits/chosen": -0.589956521987915, | |
| "logits/rejected": -0.587726354598999, | |
| "logps/chosen": -10.072855949401855, | |
| "logps/rejected": -12.857810974121094, | |
| "loss": 1.0991942882537842, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.40110355615615845, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.17576897144317627, | |
| "rewards/margins": 0.11343260109424591, | |
| "rewards/rejected": 0.062336355447769165, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005466 | |
| }, | |
| { | |
| "epoch": 0.07717731129968736, | |
| "grad_norm": 2.6813321113586426, | |
| "learning_rate": 0.0001018867924528302, | |
| "logits/chosen": -0.5832359194755554, | |
| "logits/rejected": -0.5860565304756165, | |
| "logps/chosen": -8.197118759155273, | |
| "logps/rejected": -17.45244598388672, | |
| "loss": 0.8366767764091492, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2886262536048889, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3297504186630249, | |
| "rewards/margins": 0.48295390605926514, | |
| "rewards/rejected": -0.15320347249507904, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.00547 | |
| }, | |
| { | |
| "epoch": 0.08003573023671282, | |
| "grad_norm": 3.3800203800201416, | |
| "learning_rate": 0.00010566037735849057, | |
| "logits/chosen": -0.6005962491035461, | |
| "logits/rejected": -0.6035608053207397, | |
| "logps/chosen": -9.117904663085938, | |
| "logps/rejected": -18.400161743164062, | |
| "loss": 1.0143071413040161, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4276316463947296, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.271901398897171, | |
| "rewards/margins": 0.4319708049297333, | |
| "rewards/rejected": -0.16006940603256226, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005468 | |
| }, | |
| { | |
| "epoch": 0.08289414917373827, | |
| "grad_norm": 5.461134433746338, | |
| "learning_rate": 0.00010943396226415095, | |
| "logits/chosen": -0.5596082210540771, | |
| "logits/rejected": -0.5635167360305786, | |
| "logps/chosen": -7.607837200164795, | |
| "logps/rejected": -23.174358367919922, | |
| "loss": 0.803045928478241, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32165294885635376, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3834715783596039, | |
| "rewards/margins": 0.7214637994766235, | |
| "rewards/rejected": -0.33799219131469727, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005464 | |
| }, | |
| { | |
| "epoch": 0.08575256811076373, | |
| "grad_norm": 3.3377506732940674, | |
| "learning_rate": 0.00011320754716981132, | |
| "logits/chosen": -0.6003558039665222, | |
| "logits/rejected": -0.6016712188720703, | |
| "logps/chosen": -7.941157817840576, | |
| "logps/rejected": -10.564404487609863, | |
| "loss": 1.0737202167510986, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3314566910266876, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.1379927098751068, | |
| "rewards/margins": 0.08670535683631897, | |
| "rewards/rejected": 0.05128733813762665, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005461 | |
| }, | |
| { | |
| "epoch": 0.08861098704778919, | |
| "grad_norm": 3.4214563369750977, | |
| "learning_rate": 0.0001169811320754717, | |
| "logits/chosen": -0.5186684727668762, | |
| "logits/rejected": -0.5189406275749207, | |
| "logps/chosen": -6.143683910369873, | |
| "logps/rejected": -25.88001251220703, | |
| "loss": 0.7792238593101501, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2514691948890686, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2757991552352905, | |
| "rewards/margins": 0.5156725645065308, | |
| "rewards/rejected": -0.23987337946891785, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005459 | |
| }, | |
| { | |
| "epoch": 0.09146940598481465, | |
| "grad_norm": 4.645272731781006, | |
| "learning_rate": 0.00012075471698113207, | |
| "logits/chosen": -0.5988867282867432, | |
| "logits/rejected": -0.6016397476196289, | |
| "logps/chosen": -5.776233673095703, | |
| "logps/rejected": -22.404544830322266, | |
| "loss": 0.8892383575439453, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4011368155479431, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.22715790569782257, | |
| "rewards/margins": 0.7724226713180542, | |
| "rewards/rejected": -0.545264720916748, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005454 | |
| }, | |
| { | |
| "epoch": 0.09432782492184011, | |
| "grad_norm": 4.586422443389893, | |
| "learning_rate": 0.00012452830188679244, | |
| "logits/chosen": -0.5782912969589233, | |
| "logits/rejected": -0.5768243670463562, | |
| "logps/chosen": -10.939208984375, | |
| "logps/rejected": -13.486640930175781, | |
| "loss": 1.1607584953308105, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5877886414527893, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.21317529678344727, | |
| "rewards/margins": 0.4141784906387329, | |
| "rewards/rejected": -0.20100319385528564, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005457 | |
| }, | |
| { | |
| "epoch": 0.09718624385886557, | |
| "grad_norm": 4.306042671203613, | |
| "learning_rate": 0.00012830188679245283, | |
| "logits/chosen": -0.6019578576087952, | |
| "logits/rejected": -0.6082974076271057, | |
| "logps/chosen": -7.5170578956604, | |
| "logps/rejected": -24.889406204223633, | |
| "loss": 0.9509016275405884, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4247076213359833, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.10510760545730591, | |
| "rewards/margins": 0.8037927150726318, | |
| "rewards/rejected": -0.6986850500106812, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005456 | |
| }, | |
| { | |
| "epoch": 0.10004466279589103, | |
| "grad_norm": 3.002274751663208, | |
| "learning_rate": 0.0001320754716981132, | |
| "logits/chosen": -0.6133092641830444, | |
| "logits/rejected": -0.6127456426620483, | |
| "logps/chosen": -8.859593391418457, | |
| "logps/rejected": -17.02096939086914, | |
| "loss": 0.8848217129707336, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3480006456375122, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.25863486528396606, | |
| "rewards/margins": 0.5611037015914917, | |
| "rewards/rejected": -0.302468866109848, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005457 | |
| }, | |
| { | |
| "epoch": 0.10290308173291648, | |
| "grad_norm": 4.299287796020508, | |
| "learning_rate": 0.0001358490566037736, | |
| "logits/chosen": -0.5725032091140747, | |
| "logits/rejected": -0.5725142359733582, | |
| "logps/chosen": -8.371686935424805, | |
| "logps/rejected": -17.657852172851562, | |
| "loss": 0.8825864791870117, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3603641390800476, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.23154468834400177, | |
| "rewards/margins": 0.6240193843841553, | |
| "rewards/rejected": -0.3924746811389923, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005457 | |
| }, | |
| { | |
| "epoch": 0.10576150066994194, | |
| "grad_norm": 4.354315757751465, | |
| "learning_rate": 0.00013962264150943395, | |
| "logits/chosen": -0.5943324565887451, | |
| "logits/rejected": -0.5940991044044495, | |
| "logps/chosen": -7.657552719116211, | |
| "logps/rejected": -16.183917999267578, | |
| "loss": 0.8160735964775085, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3588046133518219, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.27544379234313965, | |
| "rewards/margins": 0.7471473217010498, | |
| "rewards/rejected": -0.4717034101486206, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005452 | |
| }, | |
| { | |
| "epoch": 0.1086199196069674, | |
| "grad_norm": 7.916697978973389, | |
| "learning_rate": 0.00014339622641509434, | |
| "logits/chosen": -0.5676888227462769, | |
| "logits/rejected": -0.5714080929756165, | |
| "logps/chosen": -6.698662757873535, | |
| "logps/rejected": -17.954235076904297, | |
| "loss": 1.052018642425537, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.49374452233314514, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.16338011622428894, | |
| "rewards/margins": 0.42942774295806885, | |
| "rewards/rejected": -0.2660475969314575, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005452 | |
| }, | |
| { | |
| "epoch": 0.11147833854399285, | |
| "grad_norm": 3.7271363735198975, | |
| "learning_rate": 0.00014716981132075472, | |
| "logits/chosen": -0.6097766160964966, | |
| "logits/rejected": -0.6135396957397461, | |
| "logps/chosen": -7.30006217956543, | |
| "logps/rejected": -22.168495178222656, | |
| "loss": 0.7729511857032776, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3125499188899994, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.28066012263298035, | |
| "rewards/margins": 0.8108583092689514, | |
| "rewards/rejected": -0.5301981568336487, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.00545 | |
| }, | |
| { | |
| "epoch": 0.1143367574810183, | |
| "grad_norm": 2.960145950317383, | |
| "learning_rate": 0.0001509433962264151, | |
| "logits/chosen": -0.6132208108901978, | |
| "logits/rejected": -0.6163071990013123, | |
| "logps/chosen": -7.024638652801514, | |
| "logps/rejected": -21.298852920532227, | |
| "loss": 0.8106734752655029, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.37238579988479614, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.39458420872688293, | |
| "rewards/margins": 0.8476477265357971, | |
| "rewards/rejected": -0.45306357741355896, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005445 | |
| }, | |
| { | |
| "epoch": 0.11719517641804376, | |
| "grad_norm": 4.3203630447387695, | |
| "learning_rate": 0.0001547169811320755, | |
| "logits/chosen": -0.5976248979568481, | |
| "logits/rejected": -0.6002449989318848, | |
| "logps/chosen": -5.656615257263184, | |
| "logps/rejected": -16.032827377319336, | |
| "loss": 0.9440045952796936, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33253738284111023, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.14414586126804352, | |
| "rewards/margins": 0.5006409287452698, | |
| "rewards/rejected": -0.35649505257606506, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005445 | |
| }, | |
| { | |
| "epoch": 0.12005359535506922, | |
| "grad_norm": 4.646491527557373, | |
| "learning_rate": 0.00015849056603773587, | |
| "logits/chosen": -0.5956608653068542, | |
| "logits/rejected": -0.5956603288650513, | |
| "logps/chosen": -11.719463348388672, | |
| "logps/rejected": -27.070579528808594, | |
| "loss": 1.0076483488082886, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5070124268531799, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.15291725099086761, | |
| "rewards/margins": 0.7710469961166382, | |
| "rewards/rejected": -0.6181297898292542, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005446 | |
| }, | |
| { | |
| "epoch": 0.12291201429209468, | |
| "grad_norm": 4.248917102813721, | |
| "learning_rate": 0.00016226415094339625, | |
| "logits/chosen": -0.6100150942802429, | |
| "logits/rejected": -0.6142972111701965, | |
| "logps/chosen": -6.201865196228027, | |
| "logps/rejected": -19.82131004333496, | |
| "loss": 0.7969534993171692, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.31225427985191345, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20218679308891296, | |
| "rewards/margins": 0.705444872379303, | |
| "rewards/rejected": -0.5032580494880676, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005448 | |
| }, | |
| { | |
| "epoch": 0.12577043322912015, | |
| "grad_norm": 3.1864066123962402, | |
| "learning_rate": 0.0001660377358490566, | |
| "logits/chosen": -0.6078452467918396, | |
| "logits/rejected": -0.6100336909294128, | |
| "logps/chosen": -8.217609405517578, | |
| "logps/rejected": -18.432086944580078, | |
| "loss": 0.945781409740448, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4447736442089081, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16747131943702698, | |
| "rewards/margins": 0.6352076530456543, | |
| "rewards/rejected": -0.46773630380630493, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005451 | |
| }, | |
| { | |
| "epoch": 0.1286288521661456, | |
| "grad_norm": 2.8247904777526855, | |
| "learning_rate": 0.000169811320754717, | |
| "logits/chosen": -0.6424505710601807, | |
| "logits/rejected": -0.6455634236335754, | |
| "logps/chosen": -4.626930236816406, | |
| "logps/rejected": -18.966289520263672, | |
| "loss": 0.6525614261627197, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.20949943363666534, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1935967355966568, | |
| "rewards/margins": 0.7181073427200317, | |
| "rewards/rejected": -0.5245105624198914, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005449 | |
| }, | |
| { | |
| "epoch": 0.13148727110317107, | |
| "grad_norm": 5.167090892791748, | |
| "learning_rate": 0.00017358490566037738, | |
| "logits/chosen": -0.6390554308891296, | |
| "logits/rejected": -0.6455981731414795, | |
| "logps/chosen": -7.457905292510986, | |
| "logps/rejected": -22.238759994506836, | |
| "loss": 0.7052859663963318, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3145278990268707, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3406547009944916, | |
| "rewards/margins": 0.9184964895248413, | |
| "rewards/rejected": -0.5778417587280273, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005446 | |
| }, | |
| { | |
| "epoch": 0.1343456900401965, | |
| "grad_norm": 3.110797166824341, | |
| "learning_rate": 0.00017735849056603776, | |
| "logits/chosen": -0.6957284212112427, | |
| "logits/rejected": -0.6984925866127014, | |
| "logps/chosen": -6.335500717163086, | |
| "logps/rejected": -26.946069717407227, | |
| "loss": 0.6684616804122925, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.27696001529693604, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.36519789695739746, | |
| "rewards/margins": 1.261197805404663, | |
| "rewards/rejected": -0.8960000276565552, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005445 | |
| }, | |
| { | |
| "epoch": 0.13720410897722196, | |
| "grad_norm": 5.592209815979004, | |
| "learning_rate": 0.00018113207547169812, | |
| "logits/chosen": -0.6557337641716003, | |
| "logits/rejected": -0.6595371961593628, | |
| "logps/chosen": -6.262232780456543, | |
| "logps/rejected": -22.550495147705078, | |
| "loss": 0.844598650932312, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32042089104652405, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.098446786403656, | |
| "rewards/margins": 1.1042643785476685, | |
| "rewards/rejected": -1.0058175325393677, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005444 | |
| }, | |
| { | |
| "epoch": 0.14006252791424742, | |
| "grad_norm": 5.518631458282471, | |
| "learning_rate": 0.0001849056603773585, | |
| "logits/chosen": -0.7261903285980225, | |
| "logits/rejected": -0.7333111763000488, | |
| "logps/chosen": -6.155282020568848, | |
| "logps/rejected": -28.635177612304688, | |
| "loss": 0.7839219570159912, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3167538046836853, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.18123595416545868, | |
| "rewards/margins": 1.343546986579895, | |
| "rewards/rejected": -1.1623109579086304, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.14292094685127288, | |
| "grad_norm": 5.368433475494385, | |
| "learning_rate": 0.00018867924528301889, | |
| "logits/chosen": -0.7460846304893494, | |
| "logits/rejected": -0.7433331608772278, | |
| "logps/chosen": -8.476225852966309, | |
| "logps/rejected": -20.479339599609375, | |
| "loss": 1.041689395904541, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5162184834480286, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07575411349534988, | |
| "rewards/margins": 0.8544278144836426, | |
| "rewards/rejected": -0.7786736488342285, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.14577936578829834, | |
| "grad_norm": 12.666760444641113, | |
| "learning_rate": 0.00019245283018867927, | |
| "logits/chosen": -0.7423916459083557, | |
| "logits/rejected": -0.7536158561706543, | |
| "logps/chosen": -4.518327713012695, | |
| "logps/rejected": -25.71565818786621, | |
| "loss": 0.8285016417503357, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.38353338837623596, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.25002920627593994, | |
| "rewards/margins": 1.0534642934799194, | |
| "rewards/rejected": -0.8034350872039795, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.1486377847253238, | |
| "grad_norm": 5.63993501663208, | |
| "learning_rate": 0.00019622641509433963, | |
| "logits/chosen": -0.7661195993423462, | |
| "logits/rejected": -0.7684649229049683, | |
| "logps/chosen": -5.303972244262695, | |
| "logps/rejected": -20.424297332763672, | |
| "loss": 0.7760183811187744, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.30550119280815125, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.17865437269210815, | |
| "rewards/margins": 0.9522275328636169, | |
| "rewards/rejected": -0.7735730409622192, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.15149620366234925, | |
| "grad_norm": 3.208770275115967, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.7615375518798828, | |
| "logits/rejected": -0.7639837861061096, | |
| "logps/chosen": -7.793338775634766, | |
| "logps/rejected": -22.267044067382812, | |
| "loss": 0.6889612078666687, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2784683108329773, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21318240463733673, | |
| "rewards/margins": 1.1274638175964355, | |
| "rewards/rejected": -0.9142814874649048, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.1543546225993747, | |
| "grad_norm": 4.603616714477539, | |
| "learning_rate": 0.00019999950054470762, | |
| "logits/chosen": -0.7416525483131409, | |
| "logits/rejected": -0.7468435168266296, | |
| "logps/chosen": -11.753125190734863, | |
| "logps/rejected": -23.24603271484375, | |
| "loss": 0.9534075856208801, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.42802760004997253, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2138495296239853, | |
| "rewards/margins": 0.8852367997169495, | |
| "rewards/rejected": -0.6713871955871582, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.15721304153640017, | |
| "grad_norm": 3.226914405822754, | |
| "learning_rate": 0.00019999800218381956, | |
| "logits/chosen": -0.782919704914093, | |
| "logits/rejected": -0.7837254405021667, | |
| "logps/chosen": -10.437933921813965, | |
| "logps/rejected": -21.950359344482422, | |
| "loss": 0.7319959998130798, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.28649967908859253, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.17146320641040802, | |
| "rewards/margins": 0.9873074889183044, | |
| "rewards/rejected": -0.8158442974090576, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.16007146047342563, | |
| "grad_norm": 5.957598686218262, | |
| "learning_rate": 0.00019999550493230315, | |
| "logits/chosen": -0.7622566819190979, | |
| "logits/rejected": -0.7720569968223572, | |
| "logps/chosen": -9.299139022827148, | |
| "logps/rejected": -25.902114868164062, | |
| "loss": 1.0733510255813599, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5738880634307861, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1327313929796219, | |
| "rewards/margins": 1.0297049283981323, | |
| "rewards/rejected": -0.8969735503196716, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.1629298794104511, | |
| "grad_norm": 4.4198760986328125, | |
| "learning_rate": 0.00019999200881510367, | |
| "logits/chosen": -0.7777268886566162, | |
| "logits/rejected": -0.7817560434341431, | |
| "logps/chosen": -8.051362037658691, | |
| "logps/rejected": -16.21352767944336, | |
| "loss": 0.9994087815284729, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5157659649848938, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3178602159023285, | |
| "rewards/margins": 0.7738386392593384, | |
| "rewards/rejected": -0.4559784233570099, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.16578829834747655, | |
| "grad_norm": 10.918800354003906, | |
| "learning_rate": 0.00019998751386714417, | |
| "logits/chosen": -0.7735524773597717, | |
| "logits/rejected": -0.7762777209281921, | |
| "logps/chosen": -6.026726245880127, | |
| "logps/rejected": -20.445030212402344, | |
| "loss": 0.8424608707427979, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4571954309940338, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3362487852573395, | |
| "rewards/margins": 1.0223908424377441, | |
| "rewards/rejected": -0.6861420273780823, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.168646717284502, | |
| "grad_norm": 6.003457546234131, | |
| "learning_rate": 0.00019998202013332526, | |
| "logits/chosen": -0.7671990394592285, | |
| "logits/rejected": -0.7679510712623596, | |
| "logps/chosen": -7.208020210266113, | |
| "logps/rejected": -16.45644187927246, | |
| "loss": 0.8400717377662659, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3789638876914978, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19236475229263306, | |
| "rewards/margins": 0.8348343372344971, | |
| "rewards/rejected": -0.6424695253372192, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.17150513622152747, | |
| "grad_norm": 2.5898213386535645, | |
| "learning_rate": 0.00019997552766852432, | |
| "logits/chosen": -0.800130307674408, | |
| "logits/rejected": -0.8043981790542603, | |
| "logps/chosen": -6.655481815338135, | |
| "logps/rejected": -24.4234619140625, | |
| "loss": 0.6945982575416565, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3340861201286316, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3088517487049103, | |
| "rewards/margins": 1.2354176044464111, | |
| "rewards/rejected": -0.9265658855438232, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.17436355515855292, | |
| "grad_norm": 3.626788377761841, | |
| "learning_rate": 0.00019996803653759532, | |
| "logits/chosen": -0.7841392159461975, | |
| "logits/rejected": -0.7904000282287598, | |
| "logps/chosen": -4.378767013549805, | |
| "logps/rejected": -26.130855560302734, | |
| "loss": 0.5890128016471863, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2802823781967163, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2776252329349518, | |
| "rewards/margins": 1.491828203201294, | |
| "rewards/rejected": -1.2142030000686646, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.17722197409557838, | |
| "grad_norm": 6.747097492218018, | |
| "learning_rate": 0.00019995954681536798, | |
| "logits/chosen": -0.7469812035560608, | |
| "logits/rejected": -0.7426640391349792, | |
| "logps/chosen": -11.407801628112793, | |
| "logps/rejected": -19.764530181884766, | |
| "loss": 1.1509681940078735, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4816472828388214, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.023781299591064453, | |
| "rewards/margins": 0.7125381231307983, | |
| "rewards/rejected": -0.7363194227218628, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.18008039303260384, | |
| "grad_norm": 6.9256978034973145, | |
| "learning_rate": 0.00019995005858664696, | |
| "logits/chosen": -0.819698691368103, | |
| "logits/rejected": -0.8221041560173035, | |
| "logps/chosen": -7.0722761154174805, | |
| "logps/rejected": -30.66091537475586, | |
| "loss": 0.9850404262542725, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.42992380261421204, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07954245805740356, | |
| "rewards/margins": 1.697967767715454, | |
| "rewards/rejected": -1.6184254884719849, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.1829388119696293, | |
| "grad_norm": 5.373042106628418, | |
| "learning_rate": 0.00019993957194621128, | |
| "logits/chosen": -0.8020437955856323, | |
| "logits/rejected": -0.8022991418838501, | |
| "logps/chosen": -12.086634635925293, | |
| "logps/rejected": -21.337501525878906, | |
| "loss": 0.9992907643318176, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.46714556217193604, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.11581222712993622, | |
| "rewards/margins": 1.0597875118255615, | |
| "rewards/rejected": -0.9439753293991089, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.18579723090665476, | |
| "grad_norm": 3.77294921875, | |
| "learning_rate": 0.00019992808699881303, | |
| "logits/chosen": -0.7432379722595215, | |
| "logits/rejected": -0.7440240979194641, | |
| "logps/chosen": -6.54131555557251, | |
| "logps/rejected": -25.4437255859375, | |
| "loss": 0.8025262951850891, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4345034658908844, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1653081476688385, | |
| "rewards/margins": 1.261300802230835, | |
| "rewards/rejected": -1.0959926843643188, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.18865564984368022, | |
| "grad_norm": 3.9820404052734375, | |
| "learning_rate": 0.0001999156038591766, | |
| "logits/chosen": -0.754156231880188, | |
| "logits/rejected": -0.7619881629943848, | |
| "logps/chosen": -6.165823459625244, | |
| "logps/rejected": -23.689210891723633, | |
| "loss": 0.7558284997940063, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.35462892055511475, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18967051804065704, | |
| "rewards/margins": 0.9685844779014587, | |
| "rewards/rejected": -0.7789139151573181, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.19151406878070568, | |
| "grad_norm": 4.361135482788086, | |
| "learning_rate": 0.00019990212265199738, | |
| "logits/chosen": -0.7575560212135315, | |
| "logits/rejected": -0.7635327577590942, | |
| "logps/chosen": -4.563057899475098, | |
| "logps/rejected": -24.856014251708984, | |
| "loss": 0.7012404203414917, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3292723000049591, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.360738068819046, | |
| "rewards/margins": 1.0550967454910278, | |
| "rewards/rejected": -0.6943586468696594, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.19437248771773113, | |
| "grad_norm": 8.01318359375, | |
| "learning_rate": 0.00019988764351194056, | |
| "logits/chosen": -0.7201259136199951, | |
| "logits/rejected": -0.7213173508644104, | |
| "logps/chosen": -14.019023895263672, | |
| "logps/rejected": -23.463457107543945, | |
| "loss": 1.155617594718933, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6643218994140625, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.16900399327278137, | |
| "rewards/margins": 0.8244603276252747, | |
| "rewards/rejected": -0.6554563641548157, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.1972309066547566, | |
| "grad_norm": 4.880486488342285, | |
| "learning_rate": 0.00019987216658363984, | |
| "logits/chosen": -0.7603176832199097, | |
| "logits/rejected": -0.7611086368560791, | |
| "logps/chosen": -7.871481418609619, | |
| "logps/rejected": -18.355331420898438, | |
| "loss": 0.9050899744033813, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4671905040740967, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14834776520729065, | |
| "rewards/margins": 0.9282243251800537, | |
| "rewards/rejected": -0.7798765897750854, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.20008932559178205, | |
| "grad_norm": 36.09653854370117, | |
| "learning_rate": 0.00019985569202169584, | |
| "logits/chosen": -0.826109766960144, | |
| "logits/rejected": -0.8319188952445984, | |
| "logps/chosen": -7.292363166809082, | |
| "logps/rejected": -19.279315948486328, | |
| "loss": 0.906982421875, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4692971408367157, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.17047010362148285, | |
| "rewards/margins": 0.9899492859840393, | |
| "rewards/rejected": -0.8194791674613953, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005443 | |
| }, | |
| { | |
| "epoch": 0.2029477445288075, | |
| "grad_norm": 5.051456451416016, | |
| "learning_rate": 0.00019983821999067475, | |
| "logits/chosen": -0.7659405469894409, | |
| "logits/rejected": -0.773281991481781, | |
| "logps/chosen": -7.996345520019531, | |
| "logps/rejected": -16.987951278686523, | |
| "loss": 0.9166132211685181, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.43807780742645264, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2428373396396637, | |
| "rewards/margins": 0.7172515988349915, | |
| "rewards/rejected": -0.47441428899765015, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005444 | |
| }, | |
| { | |
| "epoch": 0.20580616346583297, | |
| "grad_norm": 3.3546969890594482, | |
| "learning_rate": 0.00019981975066510655, | |
| "logits/chosen": -0.7702159285545349, | |
| "logits/rejected": -0.7756153345108032, | |
| "logps/chosen": -3.096975088119507, | |
| "logps/rejected": -24.7138671875, | |
| "loss": 0.6350318193435669, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.20447328686714172, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23610374331474304, | |
| "rewards/margins": 1.1568939685821533, | |
| "rewards/rejected": -0.9207903146743774, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.20866458240285843, | |
| "grad_norm": 3.3056812286376953, | |
| "learning_rate": 0.00019980028422948322, | |
| "logits/chosen": -0.7785294651985168, | |
| "logits/rejected": -0.7796329259872437, | |
| "logps/chosen": -6.459807395935059, | |
| "logps/rejected": -18.2646541595459, | |
| "loss": 0.7826670408248901, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.299204021692276, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.17048794031143188, | |
| "rewards/margins": 0.8538780212402344, | |
| "rewards/rejected": -0.6833901405334473, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.2115230013398839, | |
| "grad_norm": 2.804248094558716, | |
| "learning_rate": 0.00019977982087825713, | |
| "logits/chosen": -0.7178574204444885, | |
| "logits/rejected": -0.7222320437431335, | |
| "logps/chosen": -5.382746696472168, | |
| "logps/rejected": -21.648345947265625, | |
| "loss": 0.6176108717918396, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2642488479614258, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3241485357284546, | |
| "rewards/margins": 1.1783626079559326, | |
| "rewards/rejected": -0.854214072227478, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.21438142027690935, | |
| "grad_norm": 2.3271028995513916, | |
| "learning_rate": 0.0001997583608158388, | |
| "logits/chosen": -0.7665284872055054, | |
| "logits/rejected": -0.7763013243675232, | |
| "logps/chosen": -3.597620725631714, | |
| "logps/rejected": -28.286640167236328, | |
| "loss": 0.4727986454963684, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.1368505358695984, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.36978626251220703, | |
| "rewards/margins": 1.460551142692566, | |
| "rewards/rejected": -1.0907649993896484, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.2172398392139348, | |
| "grad_norm": 5.8310160636901855, | |
| "learning_rate": 0.00019973590425659507, | |
| "logits/chosen": -0.7936246991157532, | |
| "logits/rejected": -0.7950795888900757, | |
| "logps/chosen": -8.558622360229492, | |
| "logps/rejected": -22.39399528503418, | |
| "loss": 0.7566131949424744, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4084041714668274, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.26708710193634033, | |
| "rewards/margins": 1.3221920728683472, | |
| "rewards/rejected": -1.0551048517227173, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.22009825815096026, | |
| "grad_norm": 4.89293909072876, | |
| "learning_rate": 0.0001997124514248469, | |
| "logits/chosen": -0.8093288540840149, | |
| "logits/rejected": -0.8106516003608704, | |
| "logps/chosen": -12.884543418884277, | |
| "logps/rejected": -22.5157413482666, | |
| "loss": 1.130676507949829, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7112829685211182, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10567857325077057, | |
| "rewards/margins": 1.2312006950378418, | |
| "rewards/rejected": -1.1255221366882324, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.2229566770879857, | |
| "grad_norm": 7.881620407104492, | |
| "learning_rate": 0.00019968800255486713, | |
| "logits/chosen": -0.8169571161270142, | |
| "logits/rejected": -0.8179275393486023, | |
| "logps/chosen": -6.7093825340271, | |
| "logps/rejected": -29.32290267944336, | |
| "loss": 0.8154858350753784, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3944161534309387, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16114036738872528, | |
| "rewards/margins": 1.4641916751861572, | |
| "rewards/rejected": -1.3030513525009155, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.22581509602501115, | |
| "grad_norm": 2.513998031616211, | |
| "learning_rate": 0.00019966255789087808, | |
| "logits/chosen": -0.8547464609146118, | |
| "logits/rejected": -0.8608615398406982, | |
| "logps/chosen": -7.297125339508057, | |
| "logps/rejected": -27.81803321838379, | |
| "loss": 0.6003709435462952, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.29905110597610474, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13682395219802856, | |
| "rewards/margins": 1.487520456314087, | |
| "rewards/rejected": -1.3506965637207031, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.2286735149620366, | |
| "grad_norm": 22.424015045166016, | |
| "learning_rate": 0.0001996361176870492, | |
| "logits/chosen": -0.8499366044998169, | |
| "logits/rejected": -0.863770604133606, | |
| "logps/chosen": -8.103764533996582, | |
| "logps/rejected": -35.18703842163086, | |
| "loss": 0.7495014071464539, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5106410980224609, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2272297590970993, | |
| "rewards/margins": 1.9457027912139893, | |
| "rewards/rejected": -1.7184730768203735, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.23153193389906207, | |
| "grad_norm": 4.0974273681640625, | |
| "learning_rate": 0.00019960868220749448, | |
| "logits/chosen": -0.8633654117584229, | |
| "logits/rejected": -0.8727495670318604, | |
| "logps/chosen": -5.683876991271973, | |
| "logps/rejected": -34.967037200927734, | |
| "loss": 0.6187952756881714, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32927608489990234, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2094997614622116, | |
| "rewards/margins": 2.0794010162353516, | |
| "rewards/rejected": -1.8699012994766235, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.23439035283608753, | |
| "grad_norm": 3.275705575942993, | |
| "learning_rate": 0.00019958025172626986, | |
| "logits/chosen": -0.8937872648239136, | |
| "logits/rejected": -0.9034286737442017, | |
| "logps/chosen": -11.346511840820312, | |
| "logps/rejected": -35.471927642822266, | |
| "loss": 0.7466462850570679, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4821043014526367, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2012697458267212, | |
| "rewards/margins": 1.9956668615341187, | |
| "rewards/rejected": -1.7943971157073975, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.237248771773113, | |
| "grad_norm": 8.550602912902832, | |
| "learning_rate": 0.0001995508265273704, | |
| "logits/chosen": -0.9247998595237732, | |
| "logits/rejected": -0.934203028678894, | |
| "logps/chosen": -7.0234270095825195, | |
| "logps/rejected": -40.43362808227539, | |
| "loss": 0.6714224219322205, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.36930039525032043, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.015845157206058502, | |
| "rewards/margins": 2.3306310176849365, | |
| "rewards/rejected": -2.3464760780334473, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.24010719071013845, | |
| "grad_norm": 10.380730628967285, | |
| "learning_rate": 0.00019952040690472748, | |
| "logits/chosen": -0.89071124792099, | |
| "logits/rejected": -0.896521806716919, | |
| "logps/chosen": -9.274986267089844, | |
| "logps/rejected": -31.167112350463867, | |
| "loss": 0.9556330442428589, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4726044833660126, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.055123914033174515, | |
| "rewards/margins": 1.99386465549469, | |
| "rewards/rejected": -1.9387409687042236, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.2429656096471639, | |
| "grad_norm": 59.343536376953125, | |
| "learning_rate": 0.00019948899316220604, | |
| "logits/chosen": -0.86629319190979, | |
| "logits/rejected": -0.8767050504684448, | |
| "logps/chosen": -6.04016637802124, | |
| "logps/rejected": -28.20957374572754, | |
| "loss": 0.725101888179779, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.40447694063186646, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.29112857580184937, | |
| "rewards/margins": 1.845672369003296, | |
| "rewards/rejected": -1.5545437335968018, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.24582402858418936, | |
| "grad_norm": 6.300822734832764, | |
| "learning_rate": 0.0001994565856136012, | |
| "logits/chosen": -0.8398523330688477, | |
| "logits/rejected": -0.8439276814460754, | |
| "logps/chosen": -7.2902045249938965, | |
| "logps/rejected": -32.82334899902344, | |
| "loss": 0.5805257558822632, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4190253019332886, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3955605626106262, | |
| "rewards/margins": 2.423994302749634, | |
| "rewards/rejected": -2.0284337997436523, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.24868244752121482, | |
| "grad_norm": 43.768619537353516, | |
| "learning_rate": 0.0001994231845826354, | |
| "logits/chosen": -0.8710224628448486, | |
| "logits/rejected": -0.8721168637275696, | |
| "logps/chosen": -7.397428035736084, | |
| "logps/rejected": -29.24224853515625, | |
| "loss": 1.1686397790908813, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7285480499267578, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.11831004917621613, | |
| "rewards/margins": 1.2224053144454956, | |
| "rewards/rejected": -1.3407154083251953, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.2515408664582403, | |
| "grad_norm": 39.749202728271484, | |
| "learning_rate": 0.00019938879040295508, | |
| "logits/chosen": -0.8551483750343323, | |
| "logits/rejected": -0.8542779684066772, | |
| "logps/chosen": -10.534215927124023, | |
| "logps/rejected": -26.982810974121094, | |
| "loss": 1.2515333890914917, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7181237936019897, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.03403427451848984, | |
| "rewards/margins": 1.2902536392211914, | |
| "rewards/rejected": -1.32428777217865, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.25439928539526574, | |
| "grad_norm": 10.098331451416016, | |
| "learning_rate": 0.00019935340341812737, | |
| "logits/chosen": -0.8135808706283569, | |
| "logits/rejected": -0.8137494325637817, | |
| "logps/chosen": -9.00113582611084, | |
| "logps/rejected": -22.338396072387695, | |
| "loss": 0.9040060639381409, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5397258400917053, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04357346147298813, | |
| "rewards/margins": 1.2031430006027222, | |
| "rewards/rejected": -1.159569501876831, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.2572577043322912, | |
| "grad_norm": 8.489130973815918, | |
| "learning_rate": 0.00019931702398163657, | |
| "logits/chosen": -0.8590521216392517, | |
| "logits/rejected": -0.8651595711708069, | |
| "logps/chosen": -8.849437713623047, | |
| "logps/rejected": -27.54432487487793, | |
| "loss": 0.8707167506217957, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.48353832960128784, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.06561100482940674, | |
| "rewards/margins": 1.1353689432144165, | |
| "rewards/rejected": -1.0697578191757202, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.26011612326931666, | |
| "grad_norm": 5.018461227416992, | |
| "learning_rate": 0.00019927965245688072, | |
| "logits/chosen": -0.8591816425323486, | |
| "logits/rejected": -0.8660668730735779, | |
| "logps/chosen": -11.013117790222168, | |
| "logps/rejected": -27.660642623901367, | |
| "loss": 0.9352516531944275, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.541546106338501, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2031691074371338, | |
| "rewards/margins": 1.437905192375183, | |
| "rewards/rejected": -1.2347362041473389, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.26297454220634214, | |
| "grad_norm": 6.94728946685791, | |
| "learning_rate": 0.00019924128921716797, | |
| "logits/chosen": -0.8400283455848694, | |
| "logits/rejected": -0.8450547456741333, | |
| "logps/chosen": -9.49151611328125, | |
| "logps/rejected": -28.902881622314453, | |
| "loss": 0.806583821773529, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3471754193305969, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21784308552742004, | |
| "rewards/margins": 1.679865837097168, | |
| "rewards/rejected": -1.4620226621627808, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.2658329611433676, | |
| "grad_norm": 2.8959178924560547, | |
| "learning_rate": 0.00019920193464571275, | |
| "logits/chosen": -0.839047372341156, | |
| "logits/rejected": -0.8450105786323547, | |
| "logps/chosen": -10.59231948852539, | |
| "logps/rejected": -29.6372013092041, | |
| "loss": 0.7759805917739868, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5248351097106934, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3599660098552704, | |
| "rewards/margins": 1.950143575668335, | |
| "rewards/rejected": -1.5901774168014526, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.268691380080393, | |
| "grad_norm": 5.318148612976074, | |
| "learning_rate": 0.00019916158913563207, | |
| "logits/chosen": -0.8162392377853394, | |
| "logits/rejected": -0.8246886730194092, | |
| "logps/chosen": -5.6260833740234375, | |
| "logps/rejected": -29.538055419921875, | |
| "loss": 0.6956499218940735, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.38102442026138306, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2292197048664093, | |
| "rewards/margins": 1.7469617128372192, | |
| "rewards/rejected": -1.5177420377731323, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.2715497990174185, | |
| "grad_norm": 4.5264787673950195, | |
| "learning_rate": 0.00019912025308994148, | |
| "logits/chosen": -0.8437933325767517, | |
| "logits/rejected": -0.8463299870491028, | |
| "logps/chosen": -8.831324577331543, | |
| "logps/rejected": -26.610977172851562, | |
| "loss": 0.7661141157150269, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4225902557373047, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12178793549537659, | |
| "rewards/margins": 1.467708945274353, | |
| "rewards/rejected": -1.3459210395812988, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.2744082179544439, | |
| "grad_norm": 5.978212356567383, | |
| "learning_rate": 0.00019907792692155113, | |
| "logits/chosen": -0.7815445065498352, | |
| "logits/rejected": -0.78977370262146, | |
| "logps/chosen": -6.673672199249268, | |
| "logps/rejected": -33.78847122192383, | |
| "loss": 0.7695144414901733, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5254613757133484, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2026345133781433, | |
| "rewards/margins": 1.8294543027877808, | |
| "rewards/rejected": -1.6268197298049927, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.2772666368914694, | |
| "grad_norm": 9.170755386352539, | |
| "learning_rate": 0.00019903461105326154, | |
| "logits/chosen": -0.8260455131530762, | |
| "logits/rejected": -0.830398678779602, | |
| "logps/chosen": -6.689513206481934, | |
| "logps/rejected": -22.671979904174805, | |
| "loss": 0.7065067291259766, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32698267698287964, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2753945589065552, | |
| "rewards/margins": 1.3633196353912354, | |
| "rewards/rejected": -1.0879249572753906, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.28012505582849484, | |
| "grad_norm": 3.521716594696045, | |
| "learning_rate": 0.00019899030591775957, | |
| "logits/chosen": -0.7963160872459412, | |
| "logits/rejected": -0.8014420866966248, | |
| "logps/chosen": -7.337916851043701, | |
| "logps/rejected": -28.08383560180664, | |
| "loss": 0.61917644739151, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3110499680042267, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.23168900609016418, | |
| "rewards/margins": 1.7576744556427002, | |
| "rewards/rejected": -1.525985598564148, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.2829834747655203, | |
| "grad_norm": 5.793614864349365, | |
| "learning_rate": 0.00019894501195761392, | |
| "logits/chosen": -0.8137191534042358, | |
| "logits/rejected": -0.8227260708808899, | |
| "logps/chosen": -6.954023838043213, | |
| "logps/rejected": -35.75700378417969, | |
| "loss": 0.6259573698043823, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33839166164398193, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.26017990708351135, | |
| "rewards/margins": 2.326916217803955, | |
| "rewards/rejected": -2.0667362213134766, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.28584189370254576, | |
| "grad_norm": 5.138144493103027, | |
| "learning_rate": 0.00019889872962527072, | |
| "logits/chosen": -0.8491114377975464, | |
| "logits/rejected": -0.8503983020782471, | |
| "logps/chosen": -5.965326309204102, | |
| "logps/rejected": -24.436853408813477, | |
| "loss": 0.9054074287414551, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3898293972015381, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10434619337320328, | |
| "rewards/margins": 1.369442105293274, | |
| "rewards/rejected": -1.265095829963684, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.28870031263957124, | |
| "grad_norm": 3.6206700801849365, | |
| "learning_rate": 0.00019885145938304907, | |
| "logits/chosen": -0.8245471119880676, | |
| "logits/rejected": -0.8329594135284424, | |
| "logps/chosen": -12.563156127929688, | |
| "logps/rejected": -31.796875, | |
| "loss": 0.6779420971870422, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.36515456438064575, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2728801667690277, | |
| "rewards/margins": 2.0701961517333984, | |
| "rewards/rejected": -1.797316074371338, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.2915587315765967, | |
| "grad_norm": 4.129011154174805, | |
| "learning_rate": 0.0001988032017031364, | |
| "logits/chosen": -0.7823147773742676, | |
| "logits/rejected": -0.7900741696357727, | |
| "logps/chosen": -5.765602111816406, | |
| "logps/rejected": -31.836132049560547, | |
| "loss": 0.533344030380249, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3198188543319702, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3069157004356384, | |
| "rewards/margins": 2.2244224548339844, | |
| "rewards/rejected": -1.9175068140029907, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.29441715051362216, | |
| "grad_norm": 7.285937786102295, | |
| "learning_rate": 0.00019875395706758388, | |
| "logits/chosen": -0.8199520707130432, | |
| "logits/rejected": -0.8266770839691162, | |
| "logps/chosen": -6.686117172241211, | |
| "logps/rejected": -35.52680969238281, | |
| "loss": 0.6140994429588318, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33540287613868713, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3744865357875824, | |
| "rewards/margins": 2.1863038539886475, | |
| "rewards/rejected": -1.8118171691894531, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.2972755694506476, | |
| "grad_norm": 4.08017110824585, | |
| "learning_rate": 0.0001987037259683013, | |
| "logits/chosen": -0.7858948707580566, | |
| "logits/rejected": -0.7929791808128357, | |
| "logps/chosen": -6.60341215133667, | |
| "logps/rejected": -32.91640853881836, | |
| "loss": 0.49151238799095154, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.26134875416755676, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3017127513885498, | |
| "rewards/margins": 2.313183546066284, | |
| "rewards/rejected": -2.0114707946777344, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.3001339883876731, | |
| "grad_norm": 6.110865116119385, | |
| "learning_rate": 0.00019865250890705247, | |
| "logits/chosen": -0.8439383506774902, | |
| "logits/rejected": -0.8605507612228394, | |
| "logps/chosen": -5.249790668487549, | |
| "logps/rejected": -45.18266677856445, | |
| "loss": 0.665439248085022, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4175432622432709, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19819766283035278, | |
| "rewards/margins": 2.974789619445801, | |
| "rewards/rejected": -2.776592254638672, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.3029924073246985, | |
| "grad_norm": 8.704270362854004, | |
| "learning_rate": 0.00019860030639545003, | |
| "logits/chosen": -0.8581717610359192, | |
| "logits/rejected": -0.8701122403144836, | |
| "logps/chosen": -8.200727462768555, | |
| "logps/rejected": -39.06196975708008, | |
| "loss": 0.9722508788108826, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6783410310745239, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09280453622341156, | |
| "rewards/margins": 2.520831823348999, | |
| "rewards/rejected": -2.4280271530151367, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.305850826261724, | |
| "grad_norm": 6.919908046722412, | |
| "learning_rate": 0.00019854711895495036, | |
| "logits/chosen": -0.8861989974975586, | |
| "logits/rejected": -0.8968295454978943, | |
| "logps/chosen": -4.962037563323975, | |
| "logps/rejected": -40.77632522583008, | |
| "loss": 0.5569091439247131, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.37660181522369385, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.30795052647590637, | |
| "rewards/margins": 3.064462184906006, | |
| "rewards/rejected": -2.756511688232422, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3087092451987494, | |
| "grad_norm": 4.996776580810547, | |
| "learning_rate": 0.00019849294711684845, | |
| "logits/chosen": -0.9625644683837891, | |
| "logits/rejected": -0.972130298614502, | |
| "logps/chosen": -8.820281028747559, | |
| "logps/rejected": -50.21597671508789, | |
| "loss": 0.7489598989486694, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5024483799934387, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.26294729113578796, | |
| "rewards/margins": 3.5292611122131348, | |
| "rewards/rejected": -3.2663135528564453, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3115676641357749, | |
| "grad_norm": 6.157798767089844, | |
| "learning_rate": 0.00019843779142227256, | |
| "logits/chosen": -0.8762018084526062, | |
| "logits/rejected": -0.882946789264679, | |
| "logps/chosen": -7.924221992492676, | |
| "logps/rejected": -43.705806732177734, | |
| "loss": 0.6497112512588501, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3160628080368042, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.10452399402856827, | |
| "rewards/margins": 3.319636106491089, | |
| "rewards/rejected": -3.2151122093200684, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.31442608307280034, | |
| "grad_norm": 15.488557815551758, | |
| "learning_rate": 0.00019838165242217875, | |
| "logits/chosen": -0.863703727722168, | |
| "logits/rejected": -0.8713690042495728, | |
| "logps/chosen": -6.335309028625488, | |
| "logps/rejected": -46.15715026855469, | |
| "loss": 0.871519923210144, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5997005701065063, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15678179264068604, | |
| "rewards/margins": 3.3330183029174805, | |
| "rewards/rejected": -3.176236629486084, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.31728450200982583, | |
| "grad_norm": 4.969946384429932, | |
| "learning_rate": 0.0001983245306773454, | |
| "logits/chosen": -0.8029311895370483, | |
| "logits/rejected": -0.8069216012954712, | |
| "logps/chosen": -5.91574764251709, | |
| "logps/rejected": -26.575307846069336, | |
| "loss": 0.6512956619262695, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2922568917274475, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.20303387939929962, | |
| "rewards/margins": 1.892715573310852, | |
| "rewards/rejected": -1.6896816492080688, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.32014292094685126, | |
| "grad_norm": 6.895030498504639, | |
| "learning_rate": 0.0001982664267583677, | |
| "logits/chosen": -0.8168566226959229, | |
| "logits/rejected": -0.8292732238769531, | |
| "logps/chosen": -5.602714538574219, | |
| "logps/rejected": -31.50632667541504, | |
| "loss": 0.8574928641319275, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5075439810752869, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.010208956897258759, | |
| "rewards/margins": 1.8891350030899048, | |
| "rewards/rejected": -1.8789262771606445, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.32300133988387675, | |
| "grad_norm": 4.541954040527344, | |
| "learning_rate": 0.00019820734124565182, | |
| "logits/chosen": -0.7733545899391174, | |
| "logits/rejected": -0.7771452069282532, | |
| "logps/chosen": -6.299251079559326, | |
| "logps/rejected": -27.075977325439453, | |
| "loss": 0.7081068754196167, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3878493905067444, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13715356588363647, | |
| "rewards/margins": 1.6064281463623047, | |
| "rewards/rejected": -1.4692747592926025, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3258597588209022, | |
| "grad_norm": 3.1780240535736084, | |
| "learning_rate": 0.00019814727472940917, | |
| "logits/chosen": -0.7537604570388794, | |
| "logits/rejected": -0.7559649348258972, | |
| "logps/chosen": -11.733123779296875, | |
| "logps/rejected": -27.673603057861328, | |
| "loss": 0.71772301197052, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.42100292444229126, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21125301718711853, | |
| "rewards/margins": 1.6915286779403687, | |
| "rewards/rejected": -1.4802757501602173, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.32871817775792767, | |
| "grad_norm": 3.8751778602600098, | |
| "learning_rate": 0.00019808622780965066, | |
| "logits/chosen": -0.7520322799682617, | |
| "logits/rejected": -0.7543449401855469, | |
| "logps/chosen": -7.260441303253174, | |
| "logps/rejected": -29.127504348754883, | |
| "loss": 0.6945881843566895, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3524607717990875, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.26789340376853943, | |
| "rewards/margins": 1.691644549369812, | |
| "rewards/rejected": -1.4237512350082397, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.3315765966949531, | |
| "grad_norm": 3.0139174461364746, | |
| "learning_rate": 0.0001980242010961803, | |
| "logits/chosen": -0.7901269793510437, | |
| "logits/rejected": -0.7972939014434814, | |
| "logps/chosen": -7.289261341094971, | |
| "logps/rejected": -47.759063720703125, | |
| "loss": 0.5331582427024841, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.38446128368377686, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3029555678367615, | |
| "rewards/margins": 2.9576172828674316, | |
| "rewards/rejected": -2.6546616554260254, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.3344350156319786, | |
| "grad_norm": 3.233109712600708, | |
| "learning_rate": 0.00019796119520858955, | |
| "logits/chosen": -0.7568274140357971, | |
| "logits/rejected": -0.7630717158317566, | |
| "logps/chosen": -10.064506530761719, | |
| "logps/rejected": -32.50635528564453, | |
| "loss": 0.789489209651947, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4839721918106079, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3997339606285095, | |
| "rewards/margins": 2.3508408069610596, | |
| "rewards/rejected": -1.9511069059371948, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.337293434569004, | |
| "grad_norm": 6.901320934295654, | |
| "learning_rate": 0.0001978972107762509, | |
| "logits/chosen": -0.7462923526763916, | |
| "logits/rejected": -0.7441357970237732, | |
| "logps/chosen": -10.976001739501953, | |
| "logps/rejected": -31.10492706298828, | |
| "loss": 0.7512857913970947, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.43077993392944336, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1536616086959839, | |
| "rewards/margins": 2.106844186782837, | |
| "rewards/rejected": -1.953182578086853, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.3401518535060295, | |
| "grad_norm": 2.286742925643921, | |
| "learning_rate": 0.00019783224843831162, | |
| "logits/chosen": -0.7183930277824402, | |
| "logits/rejected": -0.7182736396789551, | |
| "logps/chosen": -8.731864929199219, | |
| "logps/rejected": -33.98211669921875, | |
| "loss": 0.6520930528640747, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3684110939502716, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2964346706867218, | |
| "rewards/margins": 2.4515674114227295, | |
| "rewards/rejected": -2.15513277053833, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.34301027244305493, | |
| "grad_norm": 4.936792850494385, | |
| "learning_rate": 0.00019776630884368738, | |
| "logits/chosen": -0.7660694122314453, | |
| "logits/rejected": -0.776424765586853, | |
| "logps/chosen": -4.871070861816406, | |
| "logps/rejected": -47.67111587524414, | |
| "loss": 0.4515693187713623, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.30822524428367615, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.38517045974731445, | |
| "rewards/margins": 3.7489230632781982, | |
| "rewards/rejected": -3.363752841949463, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3458686913800804, | |
| "grad_norm": 9.613821983337402, | |
| "learning_rate": 0.00019769939265105573, | |
| "logits/chosen": -0.7732415795326233, | |
| "logits/rejected": -0.7863773703575134, | |
| "logps/chosen": -4.910383701324463, | |
| "logps/rejected": -44.046382904052734, | |
| "loss": 0.6085942983627319, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3416149616241455, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3152579069137573, | |
| "rewards/margins": 3.380157470703125, | |
| "rewards/rejected": -3.0648996829986572, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.34872711031710585, | |
| "grad_norm": 5.3062744140625, | |
| "learning_rate": 0.00019763150052884966, | |
| "logits/chosen": -0.7940014004707336, | |
| "logits/rejected": -0.8029736280441284, | |
| "logps/chosen": -3.551081895828247, | |
| "logps/rejected": -38.06512451171875, | |
| "loss": 0.42784249782562256, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.25387704372406006, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37009117007255554, | |
| "rewards/margins": 2.841196298599243, | |
| "rewards/rejected": -2.471104860305786, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.35158552925413133, | |
| "grad_norm": 1.533804178237915, | |
| "learning_rate": 0.0001975626331552507, | |
| "logits/chosen": -0.8097442984580994, | |
| "logits/rejected": -0.8176737427711487, | |
| "logps/chosen": -3.7899668216705322, | |
| "logps/rejected": -51.7594108581543, | |
| "loss": 0.3041819632053375, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2387474924325943, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.35475367307662964, | |
| "rewards/margins": 4.306023597717285, | |
| "rewards/rejected": -3.9512698650360107, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.35444394819115677, | |
| "grad_norm": 4.373802661895752, | |
| "learning_rate": 0.00019749279121818235, | |
| "logits/chosen": -0.7605909705162048, | |
| "logits/rejected": -0.770943284034729, | |
| "logps/chosen": -8.83084774017334, | |
| "logps/rejected": -59.24419021606445, | |
| "loss": 0.5374789834022522, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.39307644963264465, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14716514945030212, | |
| "rewards/margins": 4.3210930824279785, | |
| "rewards/rejected": -4.173928260803223, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.3573023671281822, | |
| "grad_norm": 6.3563103675842285, | |
| "learning_rate": 0.0001974219754153032, | |
| "logits/chosen": -0.8258897066116333, | |
| "logits/rejected": -0.8272631168365479, | |
| "logps/chosen": -7.77381706237793, | |
| "logps/rejected": -41.343414306640625, | |
| "loss": 0.6204044818878174, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33825787901878357, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.12217142432928085, | |
| "rewards/margins": 3.0349438190460205, | |
| "rewards/rejected": -2.9127724170684814, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3601607860652077, | |
| "grad_norm": 9.85932731628418, | |
| "learning_rate": 0.00019735018645399967, | |
| "logits/chosen": -0.8187968730926514, | |
| "logits/rejected": -0.8283690214157104, | |
| "logps/chosen": -4.5190534591674805, | |
| "logps/rejected": -45.119789123535156, | |
| "loss": 0.5073397755622864, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33468902111053467, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.34614282846450806, | |
| "rewards/margins": 3.5951905250549316, | |
| "rewards/rejected": -3.2490477561950684, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.3630192050022331, | |
| "grad_norm": 3.943042039871216, | |
| "learning_rate": 0.00019727742505137936, | |
| "logits/chosen": -0.7813420295715332, | |
| "logits/rejected": -0.7975005507469177, | |
| "logps/chosen": -7.530571937561035, | |
| "logps/rejected": -53.51607894897461, | |
| "loss": 0.46567243337631226, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2742045819759369, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23301076889038086, | |
| "rewards/margins": 3.9482827186584473, | |
| "rewards/rejected": -3.7152719497680664, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.3658776239392586, | |
| "grad_norm": 1.9621978998184204, | |
| "learning_rate": 0.00019720369193426365, | |
| "logits/chosen": -0.7805514335632324, | |
| "logits/rejected": -0.7947923541069031, | |
| "logps/chosen": -4.593271255493164, | |
| "logps/rejected": -51.02714157104492, | |
| "loss": 0.3543168008327484, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2695479393005371, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3205646574497223, | |
| "rewards/margins": 3.938343048095703, | |
| "rewards/rejected": -3.6177780628204346, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.36873604287628403, | |
| "grad_norm": 6.375858783721924, | |
| "learning_rate": 0.00019712898783918038, | |
| "logits/chosen": -0.7720431089401245, | |
| "logits/rejected": -0.7774226069450378, | |
| "logps/chosen": -3.9679479598999023, | |
| "logps/rejected": -39.059242248535156, | |
| "loss": 0.42859622836112976, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2718777060508728, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.335873007774353, | |
| "rewards/margins": 3.0524649620056152, | |
| "rewards/rejected": -2.7165920734405518, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.3715944618133095, | |
| "grad_norm": 20.90467643737793, | |
| "learning_rate": 0.00019705331351235674, | |
| "logits/chosen": -0.7668591737747192, | |
| "logits/rejected": -0.7685776948928833, | |
| "logps/chosen": -9.782769203186035, | |
| "logps/rejected": -33.2745361328125, | |
| "loss": 1.310682773590088, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.8834658861160278, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.039194077253341675, | |
| "rewards/margins": 2.1344308853149414, | |
| "rewards/rejected": -2.1736247539520264, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37445288075033495, | |
| "grad_norm": 2.3716464042663574, | |
| "learning_rate": 0.00019697666970971153, | |
| "logits/chosen": -0.7852880954742432, | |
| "logits/rejected": -0.7899134755134583, | |
| "logps/chosen": -6.234109878540039, | |
| "logps/rejected": -42.3105354309082, | |
| "loss": 0.4260920286178589, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.25257518887519836, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3239039182662964, | |
| "rewards/margins": 3.0808892250061035, | |
| "rewards/rejected": -2.7569851875305176, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.37731129968736044, | |
| "grad_norm": 17.186786651611328, | |
| "learning_rate": 0.00019689905719684782, | |
| "logits/chosen": -0.7246553301811218, | |
| "logits/rejected": -0.739700198173523, | |
| "logps/chosen": -4.994725227355957, | |
| "logps/rejected": -37.61749267578125, | |
| "loss": 0.7901899814605713, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.529437243938446, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3914901614189148, | |
| "rewards/margins": 2.7029402256011963, | |
| "rewards/rejected": -2.311450242996216, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.38016971862438587, | |
| "grad_norm": 19.44753646850586, | |
| "learning_rate": 0.00019682047674904525, | |
| "logits/chosen": -0.7204717993736267, | |
| "logits/rejected": -0.7237159013748169, | |
| "logps/chosen": -10.331472396850586, | |
| "logps/rejected": -44.90771484375, | |
| "loss": 0.9498412609100342, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6981635093688965, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13750669360160828, | |
| "rewards/margins": 3.0414295196533203, | |
| "rewards/rejected": -2.9039225578308105, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.38302813756141135, | |
| "grad_norm": 2.630051612854004, | |
| "learning_rate": 0.00019674092915125218, | |
| "logits/chosen": -0.7359256148338318, | |
| "logits/rejected": -0.7523387670516968, | |
| "logps/chosen": -5.2792582511901855, | |
| "logps/rejected": -53.244354248046875, | |
| "loss": 0.37174469232559204, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.19531044363975525, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.35951948165893555, | |
| "rewards/margins": 3.9146037101745605, | |
| "rewards/rejected": -3.555084228515625, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.3858865564984368, | |
| "grad_norm": 8.38878059387207, | |
| "learning_rate": 0.00019666041519807802, | |
| "logits/chosen": -0.7512345910072327, | |
| "logits/rejected": -0.7590532302856445, | |
| "logps/chosen": -7.108774662017822, | |
| "logps/rejected": -49.24845886230469, | |
| "loss": 0.515214741230011, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.35548365116119385, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11580058932304382, | |
| "rewards/margins": 3.6866679191589355, | |
| "rewards/rejected": -3.5708670616149902, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.38874497543546227, | |
| "grad_norm": 7.971051216125488, | |
| "learning_rate": 0.0001965789356937852, | |
| "logits/chosen": -0.7898239493370056, | |
| "logits/rejected": -0.7973160743713379, | |
| "logps/chosen": -9.885854721069336, | |
| "logps/rejected": -55.670047760009766, | |
| "loss": 0.7229015827178955, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.43035101890563965, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13693107664585114, | |
| "rewards/margins": 3.9661924839019775, | |
| "rewards/rejected": -3.829261541366577, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.3916033943724877, | |
| "grad_norm": 6.154712677001953, | |
| "learning_rate": 0.00019649649145228102, | |
| "logits/chosen": -0.7895013689994812, | |
| "logits/rejected": -0.7943228483200073, | |
| "logps/chosen": -5.192661285400391, | |
| "logps/rejected": -39.91571044921875, | |
| "loss": 0.5592948794364929, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.22298313677310944, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19678261876106262, | |
| "rewards/margins": 2.95813250541687, | |
| "rewards/rejected": -2.761349678039551, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3944618133095132, | |
| "grad_norm": 2.1893486976623535, | |
| "learning_rate": 0.0001964130832971098, | |
| "logits/chosen": -0.7978731393814087, | |
| "logits/rejected": -0.808353066444397, | |
| "logps/chosen": -7.741363048553467, | |
| "logps/rejected": -49.584014892578125, | |
| "loss": 0.4424561560153961, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3187883198261261, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3768758773803711, | |
| "rewards/margins": 3.4152517318725586, | |
| "rewards/rejected": -3.0383756160736084, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3973202322465386, | |
| "grad_norm": 3.585315465927124, | |
| "learning_rate": 0.0001963287120614444, | |
| "logits/chosen": -0.8294897079467773, | |
| "logits/rejected": -0.8371224403381348, | |
| "logps/chosen": -4.645942211151123, | |
| "logps/rejected": -41.52901840209961, | |
| "loss": 0.5509465336799622, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3694899380207062, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15256014466285706, | |
| "rewards/margins": 3.042027473449707, | |
| "rewards/rejected": -2.8894670009613037, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.4001786511835641, | |
| "grad_norm": 3.1583364009857178, | |
| "learning_rate": 0.00019624337858807807, | |
| "logits/chosen": -0.8058665990829468, | |
| "logits/rejected": -0.802970290184021, | |
| "logps/chosen": -12.615983009338379, | |
| "logps/rejected": -42.576560974121094, | |
| "loss": 0.47237128019332886, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.28210973739624023, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.08335088193416595, | |
| "rewards/margins": 2.9341583251953125, | |
| "rewards/rejected": -3.0175094604492188, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.40303707012058954, | |
| "grad_norm": 1.9583823680877686, | |
| "learning_rate": 0.00019615708372941587, | |
| "logits/chosen": -0.7773740887641907, | |
| "logits/rejected": -0.7813900113105774, | |
| "logps/chosen": -7.43025016784668, | |
| "logps/rejected": -48.81037521362305, | |
| "loss": 0.45620426535606384, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2858808636665344, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14979784190654755, | |
| "rewards/margins": 3.327134847640991, | |
| "rewards/rejected": -3.177337169647217, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.405895489057615, | |
| "grad_norm": 17.376474380493164, | |
| "learning_rate": 0.00019606982834746627, | |
| "logits/chosen": -0.8055461645126343, | |
| "logits/rejected": -0.8150217533111572, | |
| "logps/chosen": -9.388490676879883, | |
| "logps/rejected": -43.86671447753906, | |
| "loss": 1.0983664989471436, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7692541480064392, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1326138973236084, | |
| "rewards/margins": 2.8655741214752197, | |
| "rewards/rejected": -2.7329602241516113, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.40875390799464045, | |
| "grad_norm": 35.17894744873047, | |
| "learning_rate": 0.00019598161331383257, | |
| "logits/chosen": -0.8625121116638184, | |
| "logits/rejected": -0.871791422367096, | |
| "logps/chosen": -9.16450023651123, | |
| "logps/rejected": -47.45623016357422, | |
| "loss": 0.7930290102958679, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.543784499168396, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08059316873550415, | |
| "rewards/margins": 3.273069381713867, | |
| "rewards/rejected": -3.192476272583008, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.41161232693166594, | |
| "grad_norm": 4.112196445465088, | |
| "learning_rate": 0.00019589243950970402, | |
| "logits/chosen": -0.8877297043800354, | |
| "logits/rejected": -0.8911035060882568, | |
| "logps/chosen": -6.215106964111328, | |
| "logps/rejected": -41.89563751220703, | |
| "loss": 0.3530213236808777, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.20008514821529388, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3117275834083557, | |
| "rewards/margins": 3.073056221008301, | |
| "rewards/rejected": -2.76132869720459, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.41447074586869137, | |
| "grad_norm": 12.758796691894531, | |
| "learning_rate": 0.00019580230782584722, | |
| "logits/chosen": -0.8928901553153992, | |
| "logits/rejected": -0.8998609781265259, | |
| "logps/chosen": -5.406792640686035, | |
| "logps/rejected": -40.006412506103516, | |
| "loss": 0.5003563165664673, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.30671095848083496, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23732616007328033, | |
| "rewards/margins": 2.932386636734009, | |
| "rewards/rejected": -2.6950607299804688, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.41732916480571686, | |
| "grad_norm": 4.014595985412598, | |
| "learning_rate": 0.00019571121916259706, | |
| "logits/chosen": -0.887598991394043, | |
| "logits/rejected": -0.8942646384239197, | |
| "logps/chosen": -4.3415961265563965, | |
| "logps/rejected": -46.59621810913086, | |
| "loss": 0.36891594529151917, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2651711106300354, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.36169373989105225, | |
| "rewards/margins": 3.6561460494995117, | |
| "rewards/rejected": -3.294452428817749, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.4201875837427423, | |
| "grad_norm": 10.37033462524414, | |
| "learning_rate": 0.00019561917442984788, | |
| "logits/chosen": -0.8872988224029541, | |
| "logits/rejected": -0.8909754753112793, | |
| "logps/chosen": -7.036233901977539, | |
| "logps/rejected": -44.856361389160156, | |
| "loss": 0.5071041584014893, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4129847586154938, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.29683101177215576, | |
| "rewards/margins": 3.6587531566619873, | |
| "rewards/rejected": -3.361922025680542, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.4230460026797678, | |
| "grad_norm": 12.54053783416748, | |
| "learning_rate": 0.00019552617454704428, | |
| "logits/chosen": -0.909309983253479, | |
| "logits/rejected": -0.9173017144203186, | |
| "logps/chosen": -5.930859088897705, | |
| "logps/rejected": -46.784332275390625, | |
| "loss": 0.6537680625915527, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.521246075630188, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25368478894233704, | |
| "rewards/margins": 3.396470308303833, | |
| "rewards/rejected": -3.1427857875823975, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.4259044216167932, | |
| "grad_norm": 2.5870954990386963, | |
| "learning_rate": 0.00019543222044317188, | |
| "logits/chosen": -0.8764325976371765, | |
| "logits/rejected": -0.881737232208252, | |
| "logps/chosen": -5.638083457946777, | |
| "logps/rejected": -47.27805709838867, | |
| "loss": 0.3462856113910675, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.22526228427886963, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3174706697463989, | |
| "rewards/margins": 3.5086669921875, | |
| "rewards/rejected": -3.1911962032318115, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.4287628405538187, | |
| "grad_norm": 9.161517143249512, | |
| "learning_rate": 0.00019533731305674818, | |
| "logits/chosen": -0.8732975721359253, | |
| "logits/rejected": -0.8769663572311401, | |
| "logps/chosen": -9.518259048461914, | |
| "logps/rejected": -42.666114807128906, | |
| "loss": 0.9442892670631409, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6460040211677551, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07534892857074738, | |
| "rewards/margins": 3.1069083213806152, | |
| "rewards/rejected": -3.0315592288970947, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.4316212594908441, | |
| "grad_norm": 17.615604400634766, | |
| "learning_rate": 0.00019524145333581317, | |
| "logits/chosen": -0.8912621736526489, | |
| "logits/rejected": -0.8975273966789246, | |
| "logps/chosen": -10.543143272399902, | |
| "logps/rejected": -44.90479278564453, | |
| "loss": 1.2651307582855225, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7548849582672119, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.13807448744773865, | |
| "rewards/margins": 3.1065428256988525, | |
| "rewards/rejected": -3.244617223739624, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.4344796784278696, | |
| "grad_norm": 2.197153091430664, | |
| "learning_rate": 0.00019514464223791965, | |
| "logits/chosen": -0.8220558762550354, | |
| "logits/rejected": -0.8305569291114807, | |
| "logps/chosen": -7.629626274108887, | |
| "logps/rejected": -46.86054229736328, | |
| "loss": 0.5103957653045654, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4139241874217987, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3421666920185089, | |
| "rewards/margins": 3.841639995574951, | |
| "rewards/rejected": -3.4994730949401855, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.43733809736489504, | |
| "grad_norm": 2.0711119174957275, | |
| "learning_rate": 0.00019504688073012397, | |
| "logits/chosen": -0.8169566988945007, | |
| "logits/rejected": -0.8239966034889221, | |
| "logps/chosen": -6.1432342529296875, | |
| "logps/rejected": -42.3114013671875, | |
| "loss": 0.4369783401489258, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.22974222898483276, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2705279588699341, | |
| "rewards/margins": 2.976038932800293, | |
| "rewards/rejected": -2.7055106163024902, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.4401965163019205, | |
| "grad_norm": 11.810593605041504, | |
| "learning_rate": 0.00019494816978897616, | |
| "logits/chosen": -0.8318780064582825, | |
| "logits/rejected": -0.8391178846359253, | |
| "logps/chosen": -7.192132472991943, | |
| "logps/rejected": -39.354427337646484, | |
| "loss": 0.6350818872451782, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.475485622882843, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3430967926979065, | |
| "rewards/margins": 2.803071975708008, | |
| "rewards/rejected": -2.459975004196167, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.44305493523894596, | |
| "grad_norm": 2.665921688079834, | |
| "learning_rate": 0.0001948485104005103, | |
| "logits/chosen": -0.8109292984008789, | |
| "logits/rejected": -0.8165513277053833, | |
| "logps/chosen": -4.813442230224609, | |
| "logps/rejected": -38.313106536865234, | |
| "loss": 0.6565403938293457, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4435839056968689, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.25875312089920044, | |
| "rewards/margins": 3.050962209701538, | |
| "rewards/rejected": -2.7922089099884033, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.4459133541759714, | |
| "grad_norm": 2.126662015914917, | |
| "learning_rate": 0.00019474790356023455, | |
| "logits/chosen": -0.8104051351547241, | |
| "logits/rejected": -0.8165953755378723, | |
| "logps/chosen": -4.292057514190674, | |
| "logps/rejected": -44.862060546875, | |
| "loss": 0.309725821018219, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.18593546748161316, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3211231231689453, | |
| "rewards/margins": 3.5143370628356934, | |
| "rewards/rejected": -3.193213939666748, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.4487717731129969, | |
| "grad_norm": 3.4068145751953125, | |
| "learning_rate": 0.00019464635027312128, | |
| "logits/chosen": -0.8355593681335449, | |
| "logits/rejected": -0.8380401730537415, | |
| "logps/chosen": -6.426550388336182, | |
| "logps/rejected": -44.43500518798828, | |
| "loss": 0.6942108273506165, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4586290121078491, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1291281133890152, | |
| "rewards/margins": 3.1570847034454346, | |
| "rewards/rejected": -3.02795672416687, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.4516301920500223, | |
| "grad_norm": 4.667487621307373, | |
| "learning_rate": 0.00019454385155359702, | |
| "logits/chosen": -0.849906325340271, | |
| "logits/rejected": -0.8568750619888306, | |
| "logps/chosen": -9.276833534240723, | |
| "logps/rejected": -49.35503387451172, | |
| "loss": 0.4330065846443176, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2498662769794464, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3473469913005829, | |
| "rewards/margins": 4.031757354736328, | |
| "rewards/rejected": -3.684410572052002, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.4544886109870478, | |
| "grad_norm": 1.687165379524231, | |
| "learning_rate": 0.00019444040842553237, | |
| "logits/chosen": -0.890581488609314, | |
| "logits/rejected": -0.9015938639640808, | |
| "logps/chosen": -3.249390125274658, | |
| "logps/rejected": -57.22711181640625, | |
| "loss": 0.362801194190979, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.22434672713279724, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2739589512348175, | |
| "rewards/margins": 4.31603479385376, | |
| "rewards/rejected": -4.0420756340026855, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.4573470299240732, | |
| "grad_norm": 12.536514282226562, | |
| "learning_rate": 0.00019433602192223164, | |
| "logits/chosen": -0.8646700382232666, | |
| "logits/rejected": -0.872589111328125, | |
| "logps/chosen": -6.172619342803955, | |
| "logps/rejected": -48.3273811340332, | |
| "loss": 0.6447067856788635, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32002851366996765, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.09112294018268585, | |
| "rewards/margins": 3.2884745597839355, | |
| "rewards/rejected": -3.1973516941070557, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.4602054488610987, | |
| "grad_norm": 3.207699775695801, | |
| "learning_rate": 0.00019423069308642266, | |
| "logits/chosen": -0.8848387002944946, | |
| "logits/rejected": -0.8890655636787415, | |
| "logps/chosen": -6.779003620147705, | |
| "logps/rejected": -52.09819030761719, | |
| "loss": 0.35991424322128296, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.26353347301483154, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40888625383377075, | |
| "rewards/margins": 4.320865631103516, | |
| "rewards/rejected": -3.9119794368743896, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.46306386779812414, | |
| "grad_norm": 13.387569427490234, | |
| "learning_rate": 0.00019412442297024637, | |
| "logits/chosen": -0.8957618474960327, | |
| "logits/rejected": -0.8995543718338013, | |
| "logps/chosen": -8.413171768188477, | |
| "logps/rejected": -39.29925537109375, | |
| "loss": 0.7494506239891052, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4951186180114746, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.03331068903207779, | |
| "rewards/margins": 2.7600255012512207, | |
| "rewards/rejected": -2.726714849472046, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.4659222867351496, | |
| "grad_norm": 14.89892578125, | |
| "learning_rate": 0.00019401721263524616, | |
| "logits/chosen": -0.8836920261383057, | |
| "logits/rejected": -0.8899936079978943, | |
| "logps/chosen": -8.512656211853027, | |
| "logps/rejected": -46.419029235839844, | |
| "loss": 0.5585404634475708, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3683706820011139, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24114097654819489, | |
| "rewards/margins": 3.47017240524292, | |
| "rewards/rejected": -3.229031562805176, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.46878070567217506, | |
| "grad_norm": 14.938558578491211, | |
| "learning_rate": 0.0001939090631523574, | |
| "logits/chosen": -0.935294508934021, | |
| "logits/rejected": -0.9457290768623352, | |
| "logps/chosen": -7.823429107666016, | |
| "logps/rejected": -56.9812126159668, | |
| "loss": 1.0811909437179565, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7688519954681396, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.035027798265218735, | |
| "rewards/margins": 3.6944613456726074, | |
| "rewards/rejected": -3.729489326477051, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.47163912460920054, | |
| "grad_norm": 8.26276683807373, | |
| "learning_rate": 0.00019379997560189675, | |
| "logits/chosen": -0.9381538033485413, | |
| "logits/rejected": -0.9450898170471191, | |
| "logps/chosen": -6.668002605438232, | |
| "logps/rejected": -51.126930236816406, | |
| "loss": 0.5152188539505005, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4229362905025482, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14181563258171082, | |
| "rewards/margins": 4.032417297363281, | |
| "rewards/rejected": -3.890601873397827, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.474497543546226, | |
| "grad_norm": 5.228875160217285, | |
| "learning_rate": 0.00019368995107355133, | |
| "logits/chosen": -0.9465993642807007, | |
| "logits/rejected": -0.9516839981079102, | |
| "logps/chosen": -6.645859718322754, | |
| "logps/rejected": -49.824649810791016, | |
| "loss": 0.6003601551055908, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4243951737880707, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1566632241010666, | |
| "rewards/margins": 3.7477457523345947, | |
| "rewards/rejected": -3.5910823345184326, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.47735596248325146, | |
| "grad_norm": 11.680534362792969, | |
| "learning_rate": 0.00019357899066636773, | |
| "logits/chosen": -0.9604209661483765, | |
| "logits/rejected": -0.9663453102111816, | |
| "logps/chosen": -11.16219711303711, | |
| "logps/rejected": -54.03529357910156, | |
| "loss": 0.6696478128433228, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5087156295776367, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24885831773281097, | |
| "rewards/margins": 4.16080379486084, | |
| "rewards/rejected": -3.9119460582733154, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.4802143814202769, | |
| "grad_norm": 6.519625663757324, | |
| "learning_rate": 0.00019346709548874127, | |
| "logits/chosen": -0.9105353355407715, | |
| "logits/rejected": -0.9168953895568848, | |
| "logps/chosen": -7.151789665222168, | |
| "logps/rejected": -51.146156311035156, | |
| "loss": 0.538978099822998, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.38577884435653687, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.34396299719810486, | |
| "rewards/margins": 4.075203895568848, | |
| "rewards/rejected": -3.731240749359131, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.4830728003573024, | |
| "grad_norm": 11.481460571289062, | |
| "learning_rate": 0.0001933542666584047, | |
| "logits/chosen": -0.9098703265190125, | |
| "logits/rejected": -0.9205840826034546, | |
| "logps/chosen": -9.062050819396973, | |
| "logps/rejected": -64.49413299560547, | |
| "loss": 0.526665985584259, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.40413621068000793, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2691805362701416, | |
| "rewards/margins": 5.563024044036865, | |
| "rewards/rejected": -5.293843746185303, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.4859312192943278, | |
| "grad_norm": 13.25565242767334, | |
| "learning_rate": 0.0001932405053024171, | |
| "logits/chosen": -0.9104465246200562, | |
| "logits/rejected": -0.917874276638031, | |
| "logps/chosen": -11.206613540649414, | |
| "logps/rejected": -57.438724517822266, | |
| "loss": 1.0738518238067627, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6307643055915833, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05714952200651169, | |
| "rewards/margins": 4.167277812957764, | |
| "rewards/rejected": -4.110127925872803, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.4887896382313533, | |
| "grad_norm": 17.771833419799805, | |
| "learning_rate": 0.00019312581255715277, | |
| "logits/chosen": -0.8956343531608582, | |
| "logits/rejected": -0.9024403691291809, | |
| "logps/chosen": -13.308263778686523, | |
| "logps/rejected": -65.24011993408203, | |
| "loss": 0.9896730184555054, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5083594918251038, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0635133907198906, | |
| "rewards/margins": 4.961539268493652, | |
| "rewards/rejected": -5.025052547454834, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.4916480571683787, | |
| "grad_norm": 6.4772748947143555, | |
| "learning_rate": 0.00019301018956828964, | |
| "logits/chosen": -0.898830771446228, | |
| "logits/rejected": -0.9118731021881104, | |
| "logps/chosen": -8.135079383850098, | |
| "logps/rejected": -57.8392333984375, | |
| "loss": 0.5032879710197449, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3064589500427246, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2829325497150421, | |
| "rewards/margins": 4.001053333282471, | |
| "rewards/rejected": -3.718120574951172, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.4945064761054042, | |
| "grad_norm": 6.827486515045166, | |
| "learning_rate": 0.000192893637490798, | |
| "logits/chosen": -0.8352851867675781, | |
| "logits/rejected": -0.8436259627342224, | |
| "logps/chosen": -6.111320972442627, | |
| "logps/rejected": -51.995445251464844, | |
| "loss": 0.5788933038711548, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.27805906534194946, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23611441254615784, | |
| "rewards/margins": 3.686123847961426, | |
| "rewards/rejected": -3.450009346008301, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.49736489504242964, | |
| "grad_norm": 3.4567549228668213, | |
| "learning_rate": 0.00019277615748892885, | |
| "logits/chosen": -0.785612165927887, | |
| "logits/rejected": -0.7931377291679382, | |
| "logps/chosen": -7.273856163024902, | |
| "logps/rejected": -36.88285446166992, | |
| "loss": 0.5589325428009033, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.37298017740249634, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4650301933288574, | |
| "rewards/margins": 2.7481539249420166, | |
| "rewards/rejected": -2.283123731613159, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.5002233139794551, | |
| "grad_norm": 4.234227180480957, | |
| "learning_rate": 0.00019265775073620245, | |
| "logits/chosen": -0.7631555795669556, | |
| "logits/rejected": -0.7687059044837952, | |
| "logps/chosen": -6.337590217590332, | |
| "logps/rejected": -35.29618453979492, | |
| "loss": 0.6258898377418518, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3696868121623993, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.21472924947738647, | |
| "rewards/margins": 2.4024829864501953, | |
| "rewards/rejected": -2.187753915786743, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5030817329164806, | |
| "grad_norm": 2.355490207672119, | |
| "learning_rate": 0.00019253841841539632, | |
| "logits/chosen": -0.7690540552139282, | |
| "logits/rejected": -0.7676496505737305, | |
| "logps/chosen": -12.918010711669922, | |
| "logps/rejected": -30.43984603881836, | |
| "loss": 0.6801320910453796, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.42714056372642517, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2977921664714813, | |
| "rewards/margins": 2.146160125732422, | |
| "rewards/rejected": -1.8483679294586182, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.505940151853506, | |
| "grad_norm": 1.5704671144485474, | |
| "learning_rate": 0.0001924181617185336, | |
| "logits/chosen": -0.7616850137710571, | |
| "logits/rejected": -0.767928957939148, | |
| "logps/chosen": -6.664812088012695, | |
| "logps/rejected": -37.411277770996094, | |
| "loss": 0.42176908254623413, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2451857030391693, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.489712655544281, | |
| "rewards/margins": 2.708432674407959, | |
| "rewards/rejected": -2.218719959259033, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5087985707905315, | |
| "grad_norm": 2.1187188625335693, | |
| "learning_rate": 0.00019229698184687128, | |
| "logits/chosen": -0.7447081804275513, | |
| "logits/rejected": -0.7508732080459595, | |
| "logps/chosen": -5.233465671539307, | |
| "logps/rejected": -35.176971435546875, | |
| "loss": 0.5185775756835938, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.336780309677124, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.44237199425697327, | |
| "rewards/margins": 2.7804007530212402, | |
| "rewards/rejected": -2.3380286693573, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5116569897275569, | |
| "grad_norm": 3.629459857940674, | |
| "learning_rate": 0.00019217488001088784, | |
| "logits/chosen": -0.7853379249572754, | |
| "logits/rejected": -0.8011223673820496, | |
| "logps/chosen": -5.379916667938232, | |
| "logps/rejected": -53.26487731933594, | |
| "loss": 0.368004709482193, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2341601699590683, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32777413725852966, | |
| "rewards/margins": 3.8236327171325684, | |
| "rewards/rejected": -3.4958581924438477, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5145154086645825, | |
| "grad_norm": 6.440499782562256, | |
| "learning_rate": 0.00019205185743027147, | |
| "logits/chosen": -0.8589999079704285, | |
| "logits/rejected": -0.8642404079437256, | |
| "logps/chosen": -7.5277910232543945, | |
| "logps/rejected": -48.523780822753906, | |
| "loss": 0.4521387219429016, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.30114930868148804, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.30447474122047424, | |
| "rewards/margins": 3.6830883026123047, | |
| "rewards/rejected": -3.3786139488220215, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5173738276016079, | |
| "grad_norm": 1.3223450183868408, | |
| "learning_rate": 0.00019192791533390776, | |
| "logits/chosen": -0.8698243498802185, | |
| "logits/rejected": -0.8859831094741821, | |
| "logps/chosen": -5.199261665344238, | |
| "logps/rejected": -53.24699783325195, | |
| "loss": 0.32750457525253296, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2843254506587982, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5321836471557617, | |
| "rewards/margins": 4.558604717254639, | |
| "rewards/rejected": -4.026421070098877, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.5202322465386333, | |
| "grad_norm": 6.235518932342529, | |
| "learning_rate": 0.0001918030549598674, | |
| "logits/chosen": -0.8939491510391235, | |
| "logits/rejected": -0.9015032052993774, | |
| "logps/chosen": -6.817130088806152, | |
| "logps/rejected": -48.4378662109375, | |
| "loss": 0.8820070028305054, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5765649676322937, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1285572648048401, | |
| "rewards/margins": 3.808832883834839, | |
| "rewards/rejected": -3.6802756786346436, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.5230906654756587, | |
| "grad_norm": 2.177001476287842, | |
| "learning_rate": 0.00019167727755539394, | |
| "logits/chosen": -0.9257232546806335, | |
| "logits/rejected": -0.934444785118103, | |
| "logps/chosen": -5.833935737609863, | |
| "logps/rejected": -59.789955139160156, | |
| "loss": 0.6103315949440002, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.42996734380722046, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15345799922943115, | |
| "rewards/margins": 5.012732982635498, | |
| "rewards/rejected": -4.859274387359619, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5259490844126843, | |
| "grad_norm": 5.315007209777832, | |
| "learning_rate": 0.00019155058437689114, | |
| "logits/chosen": -0.9314823150634766, | |
| "logits/rejected": -0.9416366815567017, | |
| "logps/chosen": -6.756455421447754, | |
| "logps/rejected": -56.72506332397461, | |
| "loss": 0.7174702286720276, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.523749589920044, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12303046137094498, | |
| "rewards/margins": 4.29641580581665, | |
| "rewards/rejected": -4.173385143280029, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.5288075033497097, | |
| "grad_norm": 3.7265548706054688, | |
| "learning_rate": 0.00019142297668991055, | |
| "logits/chosen": -0.9351843595504761, | |
| "logits/rejected": -0.9576059579849243, | |
| "logps/chosen": -5.578176021575928, | |
| "logps/rejected": -59.8486328125, | |
| "loss": 0.6304588317871094, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.46496981382369995, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3721676766872406, | |
| "rewards/margins": 4.994194507598877, | |
| "rewards/rejected": -4.622026443481445, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5316659222867351, | |
| "grad_norm": 4.928941249847412, | |
| "learning_rate": 0.00019129445576913888, | |
| "logits/chosen": -0.8918996453285217, | |
| "logits/rejected": -0.9014327526092529, | |
| "logps/chosen": -5.464908123016357, | |
| "logps/rejected": -53.11490249633789, | |
| "loss": 0.8896833658218384, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6313154697418213, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12775132060050964, | |
| "rewards/margins": 4.158487796783447, | |
| "rewards/rejected": -4.030736923217773, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5345243412237606, | |
| "grad_norm": 7.509690284729004, | |
| "learning_rate": 0.00019116502289838523, | |
| "logits/chosen": -0.8859353065490723, | |
| "logits/rejected": -0.9015785455703735, | |
| "logps/chosen": -4.673905372619629, | |
| "logps/rejected": -70.63243865966797, | |
| "loss": 0.3962274491786957, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3365238308906555, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3394577205181122, | |
| "rewards/margins": 5.691706657409668, | |
| "rewards/rejected": -5.352249622344971, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.537382760160786, | |
| "grad_norm": 1.5954922437667847, | |
| "learning_rate": 0.00019103467937056824, | |
| "logits/chosen": -0.9184845685958862, | |
| "logits/rejected": -0.9304262399673462, | |
| "logps/chosen": -4.041568756103516, | |
| "logps/rejected": -76.92243957519531, | |
| "loss": 0.3016416132450104, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.18911761045455933, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4253259301185608, | |
| "rewards/margins": 6.5727128982543945, | |
| "rewards/rejected": -6.1473870277404785, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5402411790978116, | |
| "grad_norm": 2.318643808364868, | |
| "learning_rate": 0.0001909034264877032, | |
| "logits/chosen": -0.8512060642242432, | |
| "logits/rejected": -0.856816291809082, | |
| "logps/chosen": -7.1723408699035645, | |
| "logps/rejected": -48.11109161376953, | |
| "loss": 0.4600585699081421, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3386399745941162, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33302804827690125, | |
| "rewards/margins": 4.015811443328857, | |
| "rewards/rejected": -3.682783365249634, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.543099598034837, | |
| "grad_norm": 1.4476327896118164, | |
| "learning_rate": 0.0001907712655608891, | |
| "logits/chosen": -0.8637464642524719, | |
| "logits/rejected": -0.8820706009864807, | |
| "logps/chosen": -3.2855453491210938, | |
| "logps/rejected": -71.99874114990234, | |
| "loss": 0.293333500623703, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.18421968817710876, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.28944161534309387, | |
| "rewards/margins": 5.838719844818115, | |
| "rewards/rejected": -5.549278259277344, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5459580169718624, | |
| "grad_norm": 4.899955749511719, | |
| "learning_rate": 0.0001906381979102953, | |
| "logits/chosen": -0.9037999510765076, | |
| "logits/rejected": -0.9121489524841309, | |
| "logps/chosen": -9.670417785644531, | |
| "logps/rejected": -52.208683013916016, | |
| "loss": 0.5949208736419678, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.38334017992019653, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15043097734451294, | |
| "rewards/margins": 4.171907901763916, | |
| "rewards/rejected": -4.021476745605469, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5488164359088878, | |
| "grad_norm": 12.610368728637695, | |
| "learning_rate": 0.00019050422486514878, | |
| "logits/chosen": -0.840286374092102, | |
| "logits/rejected": -0.8606438636779785, | |
| "logps/chosen": -8.77206039428711, | |
| "logps/rejected": -61.208587646484375, | |
| "loss": 0.6860842108726501, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.49322137236595154, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2522002160549164, | |
| "rewards/margins": 4.72483491897583, | |
| "rewards/rejected": -4.472634792327881, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5516748548459134, | |
| "grad_norm": 7.451924800872803, | |
| "learning_rate": 0.0001903693477637204, | |
| "logits/chosen": -0.8095037937164307, | |
| "logits/rejected": -0.8195419311523438, | |
| "logps/chosen": -4.377245903015137, | |
| "logps/rejected": -58.97959518432617, | |
| "loss": 0.2787761986255646, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.24894402921199799, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3338276147842407, | |
| "rewards/margins": 4.592215061187744, | |
| "rewards/rejected": -4.258387088775635, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5545332737829388, | |
| "grad_norm": 1.0700743198394775, | |
| "learning_rate": 0.00019023356795331182, | |
| "logits/chosen": -0.8574849963188171, | |
| "logits/rejected": -0.871565043926239, | |
| "logps/chosen": -9.894993782043457, | |
| "logps/rejected": -60.1685676574707, | |
| "loss": 0.446493536233902, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3630823493003845, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3332892954349518, | |
| "rewards/margins": 4.909541606903076, | |
| "rewards/rejected": -4.576252460479736, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5573916927199642, | |
| "grad_norm": 1.5138012170791626, | |
| "learning_rate": 0.0001900968867902419, | |
| "logits/chosen": -0.8919128775596619, | |
| "logits/rejected": -0.8939546942710876, | |
| "logps/chosen": -4.437774181365967, | |
| "logps/rejected": -52.1574592590332, | |
| "loss": 0.2619098424911499, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.20320795476436615, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3197801113128662, | |
| "rewards/margins": 4.577724456787109, | |
| "rewards/rejected": -4.257944583892822, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5602501116569897, | |
| "grad_norm": 3.5410804748535156, | |
| "learning_rate": 0.00018995930563983334, | |
| "logits/chosen": -0.8741534352302551, | |
| "logits/rejected": -0.8824887871742249, | |
| "logps/chosen": -5.8234734535217285, | |
| "logps/rejected": -49.77042770385742, | |
| "loss": 0.421186625957489, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3348409831523895, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.49023908376693726, | |
| "rewards/margins": 4.286158084869385, | |
| "rewards/rejected": -3.7959189414978027, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.5631085305940152, | |
| "grad_norm": 1.9928661584854126, | |
| "learning_rate": 0.0001898208258763987, | |
| "logits/chosen": -0.8889397382736206, | |
| "logits/rejected": -0.9006186127662659, | |
| "logps/chosen": -4.572671890258789, | |
| "logps/rejected": -61.800926208496094, | |
| "loss": 0.355736643075943, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.29381096363067627, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31399890780448914, | |
| "rewards/margins": 4.928988456726074, | |
| "rewards/rejected": -4.614989757537842, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5659669495310407, | |
| "grad_norm": 14.296086311340332, | |
| "learning_rate": 0.00018968144888322709, | |
| "logits/chosen": -0.8595174551010132, | |
| "logits/rejected": -0.861739993095398, | |
| "logps/chosen": -7.95827054977417, | |
| "logps/rejected": -51.00768280029297, | |
| "loss": 0.9002599120140076, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5538756251335144, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06036340817809105, | |
| "rewards/margins": 3.8160269260406494, | |
| "rewards/rejected": -3.7556633949279785, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5688253684680661, | |
| "grad_norm": 6.8623809814453125, | |
| "learning_rate": 0.00018954117605257, | |
| "logits/chosen": -0.9402197003364563, | |
| "logits/rejected": -0.953208863735199, | |
| "logps/chosen": -4.058620929718018, | |
| "logps/rejected": -63.09252166748047, | |
| "loss": 0.5629696249961853, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3906901776790619, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.26179081201553345, | |
| "rewards/margins": 5.211573123931885, | |
| "rewards/rejected": -4.949782371520996, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.5716837874050915, | |
| "grad_norm": 7.293510913848877, | |
| "learning_rate": 0.00018940000878562758, | |
| "logits/chosen": -0.9181431531906128, | |
| "logits/rejected": -0.9206308722496033, | |
| "logps/chosen": -7.505152702331543, | |
| "logps/rejected": -51.558433532714844, | |
| "loss": 0.4831893742084503, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3287861943244934, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1301122009754181, | |
| "rewards/margins": 4.108443737030029, | |
| "rewards/rejected": -3.9783310890197754, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.005428 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1047, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.3999247892582236e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |