Instructions to use cragtmp/2gt6-50 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/2gt6-50 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/2gt6-50") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.14292094685127288, | |
| "eval_steps": 300, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002858418937025458, | |
| "grad_norm": 10.349462509155273, | |
| "learning_rate": 3.7735849056603773e-06, | |
| "logits/chosen": -0.6422490477561951, | |
| "logits/rejected": -0.6447486877441406, | |
| "logps/chosen": -6.999429225921631, | |
| "logps/rejected": -13.433603286743164, | |
| "loss": 1.3778549432754517, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6847077012062073, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005273 | |
| }, | |
| { | |
| "epoch": 0.005716837874050916, | |
| "grad_norm": 11.263213157653809, | |
| "learning_rate": 7.547169811320755e-06, | |
| "logits/chosen": -0.6429960131645203, | |
| "logits/rejected": -0.6454926133155823, | |
| "logps/chosen": -9.604641914367676, | |
| "logps/rejected": -13.53369140625, | |
| "loss": 1.4975696802139282, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.8044224381446838, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005366 | |
| }, | |
| { | |
| "epoch": 0.008575256811076373, | |
| "grad_norm": 9.09404182434082, | |
| "learning_rate": 1.1320754716981132e-05, | |
| "logits/chosen": -0.6486532092094421, | |
| "logits/rejected": -0.6493248343467712, | |
| "logps/chosen": -7.69912576675415, | |
| "logps/rejected": -17.816326141357422, | |
| "loss": 1.2593896389007568, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5679630637168884, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0031128099653869867, | |
| "rewards/margins": 0.0035441224463284016, | |
| "rewards/rejected": -0.00043131227721460164, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005419 | |
| }, | |
| { | |
| "epoch": 0.011433675748101831, | |
| "grad_norm": 13.314420700073242, | |
| "learning_rate": 1.509433962264151e-05, | |
| "logits/chosen": -0.6668453812599182, | |
| "logits/rejected": -0.6718658804893494, | |
| "logps/chosen": -6.061755180358887, | |
| "logps/rejected": -13.643918991088867, | |
| "loss": 1.4406771659851074, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.7477570176124573, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.008774133399128914, | |
| "rewards/margins": 0.0006008772179484367, | |
| "rewards/rejected": 0.008173256181180477, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005446 | |
| }, | |
| { | |
| "epoch": 0.014292094685127288, | |
| "grad_norm": 12.340804100036621, | |
| "learning_rate": 1.8867924528301888e-05, | |
| "logits/chosen": -0.6321276426315308, | |
| "logits/rejected": -0.6321861743927002, | |
| "logps/chosen": -11.234216690063477, | |
| "logps/rejected": -11.82645034790039, | |
| "loss": 1.3690662384033203, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6870464086532593, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.032103873789310455, | |
| "rewards/margins": 0.022960105910897255, | |
| "rewards/rejected": 0.0091437678784132, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005444 | |
| }, | |
| { | |
| "epoch": 0.017150513622152745, | |
| "grad_norm": 13.995262145996094, | |
| "learning_rate": 2.2641509433962265e-05, | |
| "logits/chosen": -0.6530164480209351, | |
| "logits/rejected": -0.6550691723823547, | |
| "logps/chosen": -8.742744445800781, | |
| "logps/rejected": -12.622247695922852, | |
| "loss": 1.3672001361846924, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.702350378036499, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0800265222787857, | |
| "rewards/margins": 0.06047351285815239, | |
| "rewards/rejected": 0.019553007557988167, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.020008932559178204, | |
| "grad_norm": 10.019857406616211, | |
| "learning_rate": 2.641509433962264e-05, | |
| "logits/chosen": -0.6211694478988647, | |
| "logits/rejected": -0.6214967370033264, | |
| "logps/chosen": -6.935382843017578, | |
| "logps/rejected": -13.613279342651367, | |
| "loss": 1.2412631511688232, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5651571154594421, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.13799861073493958, | |
| "rewards/margins": 0.053141627460718155, | |
| "rewards/rejected": 0.08485697209835052, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.022867351496203663, | |
| "grad_norm": 6.375326633453369, | |
| "learning_rate": 3.018867924528302e-05, | |
| "logits/chosen": -0.6666778326034546, | |
| "logits/rejected": -0.6678147315979004, | |
| "logps/chosen": -8.114872932434082, | |
| "logps/rejected": -13.392560958862305, | |
| "loss": 1.1162137985229492, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4446101784706116, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.20063960552215576, | |
| "rewards/margins": 0.09723334014415741, | |
| "rewards/rejected": 0.10340625792741776, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.02572577043322912, | |
| "grad_norm": 4.046472549438477, | |
| "learning_rate": 3.39622641509434e-05, | |
| "logits/chosen": -0.5842044949531555, | |
| "logits/rejected": -0.5892153382301331, | |
| "logps/chosen": -13.877073287963867, | |
| "logps/rejected": -14.116576194763184, | |
| "loss": 1.259205937385559, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5605449676513672, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.1392103135585785, | |
| "rewards/margins": 0.09627523273229599, | |
| "rewards/rejected": 0.0429350808262825, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005422 | |
| }, | |
| { | |
| "epoch": 0.028584189370254576, | |
| "grad_norm": 7.625533103942871, | |
| "learning_rate": 3.7735849056603776e-05, | |
| "logits/chosen": -0.6210353374481201, | |
| "logits/rejected": -0.6224341988563538, | |
| "logps/chosen": -8.32575798034668, | |
| "logps/rejected": -11.715011596679688, | |
| "loss": 1.2772942781448364, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.48597079515457153, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.043191827833652496, | |
| "rewards/margins": 0.029505327343940735, | |
| "rewards/rejected": -0.07269717007875443, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.03144260830728004, | |
| "grad_norm": 11.961934089660645, | |
| "learning_rate": 4.150943396226415e-05, | |
| "logits/chosen": -0.6265634298324585, | |
| "logits/rejected": -0.6289808750152588, | |
| "logps/chosen": -7.129470348358154, | |
| "logps/rejected": -11.932583808898926, | |
| "loss": 1.447466254234314, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6552329659461975, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.00290237320587039, | |
| "rewards/margins": 0.06162097677588463, | |
| "rewards/rejected": -0.0645233541727066, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005473 | |
| }, | |
| { | |
| "epoch": 0.03430102724430549, | |
| "grad_norm": 10.154479026794434, | |
| "learning_rate": 4.528301886792453e-05, | |
| "logits/chosen": -0.6388624906539917, | |
| "logits/rejected": -0.639370858669281, | |
| "logps/chosen": -9.490407943725586, | |
| "logps/rejected": -12.88676643371582, | |
| "loss": 1.4875458478927612, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.6468713283538818, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.10463112592697144, | |
| "rewards/margins": -0.059477299451828, | |
| "rewards/rejected": -0.04515381157398224, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005465 | |
| }, | |
| { | |
| "epoch": 0.03715944618133095, | |
| "grad_norm": 4.091860771179199, | |
| "learning_rate": 4.9056603773584906e-05, | |
| "logits/chosen": -0.6680133938789368, | |
| "logits/rejected": -0.6711105108261108, | |
| "logps/chosen": -5.56148099899292, | |
| "logps/rejected": -13.865943908691406, | |
| "loss": 1.0154482126235962, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.35444653034210205, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.12190410494804382, | |
| "rewards/margins": 0.3293726444244385, | |
| "rewards/rejected": -0.20746850967407227, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.00546 | |
| }, | |
| { | |
| "epoch": 0.04001786511835641, | |
| "grad_norm": 3.039910316467285, | |
| "learning_rate": 5.283018867924528e-05, | |
| "logits/chosen": -0.6245446801185608, | |
| "logits/rejected": -0.6280595660209656, | |
| "logps/chosen": -7.042474269866943, | |
| "logps/rejected": -14.88280963897705, | |
| "loss": 0.9986085295677185, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32772910594940186, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.08946945518255234, | |
| "rewards/margins": 0.2548743188381195, | |
| "rewards/rejected": -0.16540484130382538, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005463 | |
| }, | |
| { | |
| "epoch": 0.042876284055381866, | |
| "grad_norm": 2.8388617038726807, | |
| "learning_rate": 5.660377358490566e-05, | |
| "logits/chosen": -0.613956868648529, | |
| "logits/rejected": -0.6150951385498047, | |
| "logps/chosen": -5.398593902587891, | |
| "logps/rejected": -10.984697341918945, | |
| "loss": 0.9217166900634766, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.21436992287635803, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2490297257900238, | |
| "rewards/margins": 0.12685683369636536, | |
| "rewards/rejected": 0.12217291444540024, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005464 | |
| }, | |
| { | |
| "epoch": 0.045734702992407325, | |
| "grad_norm": 3.623399257659912, | |
| "learning_rate": 6.037735849056604e-05, | |
| "logits/chosen": -0.5890456438064575, | |
| "logits/rejected": -0.5907201766967773, | |
| "logps/chosen": -7.65773868560791, | |
| "logps/rejected": -15.24480152130127, | |
| "loss": 1.130638837814331, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33376482129096985, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.14319562911987305, | |
| "rewards/margins": 0.01443251222372055, | |
| "rewards/rejected": 0.1287631392478943, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.00546 | |
| }, | |
| { | |
| "epoch": 0.048593121929432784, | |
| "grad_norm": 2.9850075244903564, | |
| "learning_rate": 6.415094339622641e-05, | |
| "logits/chosen": -0.5228931903839111, | |
| "logits/rejected": -0.524716854095459, | |
| "logps/chosen": -10.135262489318848, | |
| "logps/rejected": -14.072588920593262, | |
| "loss": 1.2770482301712036, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.48515522480010986, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": 0.13618236780166626, | |
| "rewards/margins": -0.09462341666221619, | |
| "rewards/rejected": 0.23080575466156006, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005473 | |
| }, | |
| { | |
| "epoch": 0.05145154086645824, | |
| "grad_norm": 2.2746193408966064, | |
| "learning_rate": 6.79245283018868e-05, | |
| "logits/chosen": -0.5764032006263733, | |
| "logits/rejected": -0.5762047171592712, | |
| "logps/chosen": -11.675098419189453, | |
| "logps/rejected": -10.994297981262207, | |
| "loss": 1.2022521495819092, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4671342372894287, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.1593710482120514, | |
| "rewards/margins": -0.00844080001115799, | |
| "rewards/rejected": 0.1678118258714676, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005468 | |
| }, | |
| { | |
| "epoch": 0.0543099598034837, | |
| "grad_norm": 2.324984312057495, | |
| "learning_rate": 7.169811320754717e-05, | |
| "logits/chosen": -0.567690908908844, | |
| "logits/rejected": -0.569066047668457, | |
| "logps/chosen": -9.0728120803833, | |
| "logps/rejected": -12.268661499023438, | |
| "loss": 1.1060843467712402, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.41300466656684875, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.23081830143928528, | |
| "rewards/margins": 0.0710553377866745, | |
| "rewards/rejected": 0.15976294875144958, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.005463 | |
| }, | |
| { | |
| "epoch": 0.05716837874050915, | |
| "grad_norm": 2.0991458892822266, | |
| "learning_rate": 7.547169811320755e-05, | |
| "logits/chosen": -0.6091416478157043, | |
| "logits/rejected": -0.6100034117698669, | |
| "logps/chosen": -4.26762056350708, | |
| "logps/rejected": -11.32187557220459, | |
| "loss": 1.0021699666976929, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2933175265789032, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.15655732154846191, | |
| "rewards/margins": 0.008277412503957748, | |
| "rewards/rejected": 0.14827993512153625, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005467 | |
| }, | |
| { | |
| "epoch": 0.06002679767753461, | |
| "grad_norm": 3.4958455562591553, | |
| "learning_rate": 7.924528301886794e-05, | |
| "logits/chosen": -0.571921706199646, | |
| "logits/rejected": -0.572878360748291, | |
| "logps/chosen": -9.612298965454102, | |
| "logps/rejected": -12.484085083007812, | |
| "loss": 1.1795949935913086, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.46760252118110657, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.14643912017345428, | |
| "rewards/margins": 0.0200117826461792, | |
| "rewards/rejected": 0.12642733752727509, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005467 | |
| }, | |
| { | |
| "epoch": 0.06288521661456008, | |
| "grad_norm": 3.175546169281006, | |
| "learning_rate": 8.30188679245283e-05, | |
| "logits/chosen": -0.6108006834983826, | |
| "logits/rejected": -0.6111243367195129, | |
| "logps/chosen": -6.207424163818359, | |
| "logps/rejected": -7.818144798278809, | |
| "loss": 1.1549935340881348, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4683927893638611, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.23285990953445435, | |
| "rewards/margins": 0.06634702533483505, | |
| "rewards/rejected": 0.16651292145252228, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.00547 | |
| }, | |
| { | |
| "epoch": 0.06574363555158554, | |
| "grad_norm": 2.4531869888305664, | |
| "learning_rate": 8.679245283018869e-05, | |
| "logits/chosen": -0.6012008190155029, | |
| "logits/rejected": -0.6021928191184998, | |
| "logps/chosen": -5.598664283752441, | |
| "logps/rejected": -13.262667655944824, | |
| "loss": 0.9260164499282837, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33532270789146423, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.3285560607910156, | |
| "rewards/margins": 0.3157665431499481, | |
| "rewards/rejected": 0.012789532542228699, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005467 | |
| }, | |
| { | |
| "epoch": 0.06860205448861098, | |
| "grad_norm": 2.328031301498413, | |
| "learning_rate": 9.056603773584906e-05, | |
| "logits/chosen": -0.567432165145874, | |
| "logits/rejected": -0.5704118609428406, | |
| "logps/chosen": -4.026985168457031, | |
| "logps/rejected": -14.904813766479492, | |
| "loss": 0.8984246253967285, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.26223480701446533, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.26638248562812805, | |
| "rewards/margins": 0.22430934011936188, | |
| "rewards/rejected": 0.042073119431734085, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005466 | |
| }, | |
| { | |
| "epoch": 0.07146047342563644, | |
| "grad_norm": 3.5119378566741943, | |
| "learning_rate": 9.433962264150944e-05, | |
| "logits/chosen": -0.5709348320960999, | |
| "logits/rejected": -0.5688645243644714, | |
| "logps/chosen": -7.716845989227295, | |
| "logps/rejected": -7.868927955627441, | |
| "loss": 1.113297462463379, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3660878837108612, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.2273256480693817, | |
| "rewards/margins": -0.0022776294499635696, | |
| "rewards/rejected": 0.22960326075553894, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005475 | |
| }, | |
| { | |
| "epoch": 0.0743188923626619, | |
| "grad_norm": 3.2336673736572266, | |
| "learning_rate": 9.811320754716981e-05, | |
| "logits/chosen": -0.589956521987915, | |
| "logits/rejected": -0.587726354598999, | |
| "logps/chosen": -10.072855949401855, | |
| "logps/rejected": -12.857810974121094, | |
| "loss": 1.0991942882537842, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.40110355615615845, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.17576897144317627, | |
| "rewards/margins": 0.11343260109424591, | |
| "rewards/rejected": 0.062336355447769165, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005466 | |
| }, | |
| { | |
| "epoch": 0.07717731129968736, | |
| "grad_norm": 2.6813321113586426, | |
| "learning_rate": 0.0001018867924528302, | |
| "logits/chosen": -0.5832359194755554, | |
| "logits/rejected": -0.5860565304756165, | |
| "logps/chosen": -8.197118759155273, | |
| "logps/rejected": -17.45244598388672, | |
| "loss": 0.8366767764091492, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2886262536048889, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3297504186630249, | |
| "rewards/margins": 0.48295390605926514, | |
| "rewards/rejected": -0.15320347249507904, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.00547 | |
| }, | |
| { | |
| "epoch": 0.08003573023671282, | |
| "grad_norm": 3.3800203800201416, | |
| "learning_rate": 0.00010566037735849057, | |
| "logits/chosen": -0.6005962491035461, | |
| "logits/rejected": -0.6035608053207397, | |
| "logps/chosen": -9.117904663085938, | |
| "logps/rejected": -18.400161743164062, | |
| "loss": 1.0143071413040161, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4276316463947296, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.271901398897171, | |
| "rewards/margins": 0.4319708049297333, | |
| "rewards/rejected": -0.16006940603256226, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005468 | |
| }, | |
| { | |
| "epoch": 0.08289414917373827, | |
| "grad_norm": 5.461134433746338, | |
| "learning_rate": 0.00010943396226415095, | |
| "logits/chosen": -0.5596082210540771, | |
| "logits/rejected": -0.5635167360305786, | |
| "logps/chosen": -7.607837200164795, | |
| "logps/rejected": -23.174358367919922, | |
| "loss": 0.803045928478241, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32165294885635376, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3834715783596039, | |
| "rewards/margins": 0.7214637994766235, | |
| "rewards/rejected": -0.33799219131469727, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005464 | |
| }, | |
| { | |
| "epoch": 0.08575256811076373, | |
| "grad_norm": 3.3377506732940674, | |
| "learning_rate": 0.00011320754716981132, | |
| "logits/chosen": -0.6003558039665222, | |
| "logits/rejected": -0.6016712188720703, | |
| "logps/chosen": -7.941157817840576, | |
| "logps/rejected": -10.564404487609863, | |
| "loss": 1.0737202167510986, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3314566910266876, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.1379927098751068, | |
| "rewards/margins": 0.08670535683631897, | |
| "rewards/rejected": 0.05128733813762665, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005461 | |
| }, | |
| { | |
| "epoch": 0.08861098704778919, | |
| "grad_norm": 3.4214563369750977, | |
| "learning_rate": 0.0001169811320754717, | |
| "logits/chosen": -0.5186684727668762, | |
| "logits/rejected": -0.5189406275749207, | |
| "logps/chosen": -6.143683910369873, | |
| "logps/rejected": -25.88001251220703, | |
| "loss": 0.7792238593101501, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.2514691948890686, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2757991552352905, | |
| "rewards/margins": 0.5156725645065308, | |
| "rewards/rejected": -0.23987337946891785, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005459 | |
| }, | |
| { | |
| "epoch": 0.09146940598481465, | |
| "grad_norm": 4.645272731781006, | |
| "learning_rate": 0.00012075471698113207, | |
| "logits/chosen": -0.5988867282867432, | |
| "logits/rejected": -0.6016397476196289, | |
| "logps/chosen": -5.776233673095703, | |
| "logps/rejected": -22.404544830322266, | |
| "loss": 0.8892383575439453, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4011368155479431, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.22715790569782257, | |
| "rewards/margins": 0.7724226713180542, | |
| "rewards/rejected": -0.545264720916748, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005454 | |
| }, | |
| { | |
| "epoch": 0.09432782492184011, | |
| "grad_norm": 4.586422443389893, | |
| "learning_rate": 0.00012452830188679244, | |
| "logits/chosen": -0.5782912969589233, | |
| "logits/rejected": -0.5768243670463562, | |
| "logps/chosen": -10.939208984375, | |
| "logps/rejected": -13.486640930175781, | |
| "loss": 1.1607584953308105, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5877886414527893, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.21317529678344727, | |
| "rewards/margins": 0.4141784906387329, | |
| "rewards/rejected": -0.20100319385528564, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005457 | |
| }, | |
| { | |
| "epoch": 0.09718624385886557, | |
| "grad_norm": 4.306042671203613, | |
| "learning_rate": 0.00012830188679245283, | |
| "logits/chosen": -0.6019578576087952, | |
| "logits/rejected": -0.6082974076271057, | |
| "logps/chosen": -7.5170578956604, | |
| "logps/rejected": -24.889406204223633, | |
| "loss": 0.9509016275405884, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4247076213359833, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.10510760545730591, | |
| "rewards/margins": 0.8037927150726318, | |
| "rewards/rejected": -0.6986850500106812, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005456 | |
| }, | |
| { | |
| "epoch": 0.10004466279589103, | |
| "grad_norm": 3.002274751663208, | |
| "learning_rate": 0.0001320754716981132, | |
| "logits/chosen": -0.6133092641830444, | |
| "logits/rejected": -0.6127456426620483, | |
| "logps/chosen": -8.859593391418457, | |
| "logps/rejected": -17.02096939086914, | |
| "loss": 0.8848217129707336, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3480006456375122, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.25863486528396606, | |
| "rewards/margins": 0.5611037015914917, | |
| "rewards/rejected": -0.302468866109848, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005457 | |
| }, | |
| { | |
| "epoch": 0.10290308173291648, | |
| "grad_norm": 4.299287796020508, | |
| "learning_rate": 0.0001358490566037736, | |
| "logits/chosen": -0.5725032091140747, | |
| "logits/rejected": -0.5725142359733582, | |
| "logps/chosen": -8.371686935424805, | |
| "logps/rejected": -17.657852172851562, | |
| "loss": 0.8825864791870117, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3603641390800476, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.23154468834400177, | |
| "rewards/margins": 0.6240193843841553, | |
| "rewards/rejected": -0.3924746811389923, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005457 | |
| }, | |
| { | |
| "epoch": 0.10576150066994194, | |
| "grad_norm": 4.354315757751465, | |
| "learning_rate": 0.00013962264150943395, | |
| "logits/chosen": -0.5943324565887451, | |
| "logits/rejected": -0.5940991044044495, | |
| "logps/chosen": -7.657552719116211, | |
| "logps/rejected": -16.183917999267578, | |
| "loss": 0.8160735964775085, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3588046133518219, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.27544379234313965, | |
| "rewards/margins": 0.7471473217010498, | |
| "rewards/rejected": -0.4717034101486206, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005452 | |
| }, | |
| { | |
| "epoch": 0.1086199196069674, | |
| "grad_norm": 7.916697978973389, | |
| "learning_rate": 0.00014339622641509434, | |
| "logits/chosen": -0.5676888227462769, | |
| "logits/rejected": -0.5714080929756165, | |
| "logps/chosen": -6.698662757873535, | |
| "logps/rejected": -17.954235076904297, | |
| "loss": 1.052018642425537, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.49374452233314514, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.16338011622428894, | |
| "rewards/margins": 0.42942774295806885, | |
| "rewards/rejected": -0.2660475969314575, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005452 | |
| }, | |
| { | |
| "epoch": 0.11147833854399285, | |
| "grad_norm": 3.7271363735198975, | |
| "learning_rate": 0.00014716981132075472, | |
| "logits/chosen": -0.6097766160964966, | |
| "logits/rejected": -0.6135396957397461, | |
| "logps/chosen": -7.30006217956543, | |
| "logps/rejected": -22.168495178222656, | |
| "loss": 0.7729511857032776, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3125499188899994, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.28066012263298035, | |
| "rewards/margins": 0.8108583092689514, | |
| "rewards/rejected": -0.5301981568336487, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.00545 | |
| }, | |
| { | |
| "epoch": 0.1143367574810183, | |
| "grad_norm": 2.960145950317383, | |
| "learning_rate": 0.0001509433962264151, | |
| "logits/chosen": -0.6132208108901978, | |
| "logits/rejected": -0.6163071990013123, | |
| "logps/chosen": -7.024638652801514, | |
| "logps/rejected": -21.298852920532227, | |
| "loss": 0.8106734752655029, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.37238579988479614, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.39458420872688293, | |
| "rewards/margins": 0.8476477265357971, | |
| "rewards/rejected": -0.45306357741355896, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005445 | |
| }, | |
| { | |
| "epoch": 0.11719517641804376, | |
| "grad_norm": 4.3203630447387695, | |
| "learning_rate": 0.0001547169811320755, | |
| "logits/chosen": -0.5976248979568481, | |
| "logits/rejected": -0.6002449989318848, | |
| "logps/chosen": -5.656615257263184, | |
| "logps/rejected": -16.032827377319336, | |
| "loss": 0.9440045952796936, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.33253738284111023, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.14414586126804352, | |
| "rewards/margins": 0.5006409287452698, | |
| "rewards/rejected": -0.35649505257606506, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005445 | |
| }, | |
| { | |
| "epoch": 0.12005359535506922, | |
| "grad_norm": 4.646491527557373, | |
| "learning_rate": 0.00015849056603773587, | |
| "logits/chosen": -0.5956608653068542, | |
| "logits/rejected": -0.5956603288650513, | |
| "logps/chosen": -11.719463348388672, | |
| "logps/rejected": -27.070579528808594, | |
| "loss": 1.0076483488082886, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5070124268531799, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.15291725099086761, | |
| "rewards/margins": 0.7710469961166382, | |
| "rewards/rejected": -0.6181297898292542, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005446 | |
| }, | |
| { | |
| "epoch": 0.12291201429209468, | |
| "grad_norm": 4.248917102813721, | |
| "learning_rate": 0.00016226415094339625, | |
| "logits/chosen": -0.6100150942802429, | |
| "logits/rejected": -0.6142972111701965, | |
| "logps/chosen": -6.201865196228027, | |
| "logps/rejected": -19.82131004333496, | |
| "loss": 0.7969534993171692, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.31225427985191345, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20218679308891296, | |
| "rewards/margins": 0.705444872379303, | |
| "rewards/rejected": -0.5032580494880676, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005448 | |
| }, | |
| { | |
| "epoch": 0.12577043322912015, | |
| "grad_norm": 3.1864066123962402, | |
| "learning_rate": 0.0001660377358490566, | |
| "logits/chosen": -0.6078452467918396, | |
| "logits/rejected": -0.6100336909294128, | |
| "logps/chosen": -8.217609405517578, | |
| "logps/rejected": -18.432086944580078, | |
| "loss": 0.945781409740448, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.4447736442089081, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16747131943702698, | |
| "rewards/margins": 0.6352076530456543, | |
| "rewards/rejected": -0.46773630380630493, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005451 | |
| }, | |
| { | |
| "epoch": 0.1286288521661456, | |
| "grad_norm": 2.8247904777526855, | |
| "learning_rate": 0.000169811320754717, | |
| "logits/chosen": -0.6424505710601807, | |
| "logits/rejected": -0.6455634236335754, | |
| "logps/chosen": -4.626930236816406, | |
| "logps/rejected": -18.966289520263672, | |
| "loss": 0.6525614261627197, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.20949943363666534, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1935967355966568, | |
| "rewards/margins": 0.7181073427200317, | |
| "rewards/rejected": -0.5245105624198914, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005449 | |
| }, | |
| { | |
| "epoch": 0.13148727110317107, | |
| "grad_norm": 5.167090892791748, | |
| "learning_rate": 0.00017358490566037738, | |
| "logits/chosen": -0.6390554308891296, | |
| "logits/rejected": -0.6455981731414795, | |
| "logps/chosen": -7.457905292510986, | |
| "logps/rejected": -22.238759994506836, | |
| "loss": 0.7052859663963318, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3145278990268707, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3406547009944916, | |
| "rewards/margins": 0.9184964895248413, | |
| "rewards/rejected": -0.5778417587280273, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005446 | |
| }, | |
| { | |
| "epoch": 0.1343456900401965, | |
| "grad_norm": 3.110797166824341, | |
| "learning_rate": 0.00017735849056603776, | |
| "logits/chosen": -0.6957284212112427, | |
| "logits/rejected": -0.6984925866127014, | |
| "logps/chosen": -6.335500717163086, | |
| "logps/rejected": -26.946069717407227, | |
| "loss": 0.6684616804122925, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.27696001529693604, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.36519789695739746, | |
| "rewards/margins": 1.261197805404663, | |
| "rewards/rejected": -0.8960000276565552, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005445 | |
| }, | |
| { | |
| "epoch": 0.13720410897722196, | |
| "grad_norm": 5.592209815979004, | |
| "learning_rate": 0.00018113207547169812, | |
| "logits/chosen": -0.6557337641716003, | |
| "logits/rejected": -0.6595371961593628, | |
| "logps/chosen": -6.262232780456543, | |
| "logps/rejected": -22.550495147705078, | |
| "loss": 0.844598650932312, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.32042089104652405, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.098446786403656, | |
| "rewards/margins": 1.1042643785476685, | |
| "rewards/rejected": -1.0058175325393677, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005444 | |
| }, | |
| { | |
| "epoch": 0.14006252791424742, | |
| "grad_norm": 5.518631458282471, | |
| "learning_rate": 0.0001849056603773585, | |
| "logits/chosen": -0.7261903285980225, | |
| "logits/rejected": -0.7333111763000488, | |
| "logps/chosen": -6.155282020568848, | |
| "logps/rejected": -28.635177612304688, | |
| "loss": 0.7839219570159912, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.3167538046836853, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.18123595416545868, | |
| "rewards/margins": 1.343546986579895, | |
| "rewards/rejected": -1.1623109579086304, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.14292094685127288, | |
| "grad_norm": 5.368433475494385, | |
| "learning_rate": 0.00018867924528301889, | |
| "logits/chosen": -0.7460846304893494, | |
| "logits/rejected": -0.7433331608772278, | |
| "logps/chosen": -8.476225852966309, | |
| "logps/rejected": -20.479339599609375, | |
| "loss": 1.041689395904541, | |
| "memory(GiB)": 46.73, | |
| "nll_loss": 0.5162184834480286, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07575411349534988, | |
| "rewards/margins": 0.8544278144836426, | |
| "rewards/rejected": -0.7786736488342285, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.005439 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1047, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.488196344152064e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |