Instructions to use cragtmp/taskgt705-50 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/taskgt705-50 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/taskgt705-50") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.11157601115760112, | |
| "eval_steps": 300, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0022315202231520223, | |
| "grad_norm": 11.248553276062012, | |
| "learning_rate": 4.444444444444445e-06, | |
| "logits/chosen": -0.48349103331565857, | |
| "logits/rejected": -0.652603030204773, | |
| "logps/chosen": -8.859519004821777, | |
| "logps/rejected": -16.016435623168945, | |
| "loss": 1.3468515872955322, | |
| "memory(GiB)": 33.34, | |
| "nll_loss": 0.6537042856216431, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.010678 | |
| }, | |
| { | |
| "epoch": 0.004463040446304045, | |
| "grad_norm": 8.97808837890625, | |
| "learning_rate": 8.88888888888889e-06, | |
| "logits/chosen": -0.5174899101257324, | |
| "logits/rejected": -0.6262180805206299, | |
| "logps/chosen": -9.287378311157227, | |
| "logps/rejected": -13.981985092163086, | |
| "loss": 1.290852665901184, | |
| "memory(GiB)": 36.2, | |
| "nll_loss": 0.5977055430412292, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.010974 | |
| }, | |
| { | |
| "epoch": 0.0066945606694560665, | |
| "grad_norm": 7.36937141418457, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "logits/chosen": -0.42612141370773315, | |
| "logits/rejected": -0.6118584871292114, | |
| "logps/chosen": -6.56147575378418, | |
| "logps/rejected": -16.162681579589844, | |
| "loss": 1.1864153146743774, | |
| "memory(GiB)": 36.2, | |
| "nll_loss": 0.492550790309906, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.0009138870518654585, | |
| "rewards/margins": -0.0012306026183068752, | |
| "rewards/rejected": 0.00031671510078012943, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.011052 | |
| }, | |
| { | |
| "epoch": 0.00892608089260809, | |
| "grad_norm": 7.918132305145264, | |
| "learning_rate": 1.777777777777778e-05, | |
| "logits/chosen": -0.5244420170783997, | |
| "logits/rejected": -0.6519989371299744, | |
| "logps/chosen": -7.461406707763672, | |
| "logps/rejected": -17.006786346435547, | |
| "loss": 1.3234074115753174, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 0.6342031359672546, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0032776433508843184, | |
| "rewards/margins": 0.008089437149465084, | |
| "rewards/rejected": -0.004811794031411409, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.011094 | |
| }, | |
| { | |
| "epoch": 0.011157601115760111, | |
| "grad_norm": 9.900442123413086, | |
| "learning_rate": 2.2222222222222223e-05, | |
| "logits/chosen": -0.5073186159133911, | |
| "logits/rejected": -0.6049282550811768, | |
| "logps/chosen": -7.057607650756836, | |
| "logps/rejected": -15.16832447052002, | |
| "loss": 1.071779489517212, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 0.40041351318359375, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.022623565047979355, | |
| "rewards/margins": 0.04467733949422836, | |
| "rewards/rejected": -0.02205377072095871, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.011121 | |
| }, | |
| { | |
| "epoch": 0.013389121338912133, | |
| "grad_norm": 5.12174129486084, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "logits/chosen": -0.48164039850234985, | |
| "logits/rejected": -0.5844419002532959, | |
| "logps/chosen": -6.2985005378723145, | |
| "logps/rejected": -16.83810043334961, | |
| "loss": 1.2731884717941284, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 0.600845992565155, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.010373853147029877, | |
| "rewards/margins": 0.046181634068489075, | |
| "rewards/rejected": -0.0358077809214592, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.011143 | |
| }, | |
| { | |
| "epoch": 0.015620641562064157, | |
| "grad_norm": 4.1249213218688965, | |
| "learning_rate": 3.111111111111111e-05, | |
| "logits/chosen": -0.5566272735595703, | |
| "logits/rejected": -0.6051127910614014, | |
| "logps/chosen": -5.424515724182129, | |
| "logps/rejected": -11.893548011779785, | |
| "loss": 1.1159045696258545, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 0.46413302421569824, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.009653191082179546, | |
| "rewards/margins": 0.11444520205259323, | |
| "rewards/rejected": -0.10479200631380081, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.011163 | |
| }, | |
| { | |
| "epoch": 0.01785216178521618, | |
| "grad_norm": 3.8928415775299072, | |
| "learning_rate": 3.555555555555556e-05, | |
| "logits/chosen": -0.5597310662269592, | |
| "logits/rejected": -0.6341894268989563, | |
| "logps/chosen": -6.350505352020264, | |
| "logps/rejected": -20.239299774169922, | |
| "loss": 0.8606890439987183, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 0.3352409899234772, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.018700765445828438, | |
| "rewards/margins": 0.419380784034729, | |
| "rewards/rejected": -0.4380815923213959, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.011179 | |
| }, | |
| { | |
| "epoch": 0.0200836820083682, | |
| "grad_norm": 7.264344692230225, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.500182569026947, | |
| "logits/rejected": -0.595187246799469, | |
| "logps/chosen": -16.194358825683594, | |
| "logps/rejected": -20.5479793548584, | |
| "loss": 1.6191558837890625, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 1.0435733795166016, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.21446219086647034, | |
| "rewards/margins": 0.40107572078704834, | |
| "rewards/rejected": -0.6155378818511963, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.011188 | |
| }, | |
| { | |
| "epoch": 0.022315202231520222, | |
| "grad_norm": 7.542423725128174, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "logits/chosen": -0.41380318999290466, | |
| "logits/rejected": -0.5418319702148438, | |
| "logps/chosen": -10.30124568939209, | |
| "logps/rejected": -26.6314697265625, | |
| "loss": 1.2661710977554321, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 0.6692220568656921, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.29620301723480225, | |
| "rewards/margins": 0.5043031573295593, | |
| "rewards/rejected": -0.8005062341690063, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.01119 | |
| }, | |
| { | |
| "epoch": 0.024546722454672244, | |
| "grad_norm": 12.055508613586426, | |
| "learning_rate": 4.888888888888889e-05, | |
| "logits/chosen": -0.45050907135009766, | |
| "logits/rejected": -0.5843921899795532, | |
| "logps/chosen": -15.530860900878906, | |
| "logps/rejected": -27.80389976501465, | |
| "loss": 1.6187087297439575, | |
| "memory(GiB)": 39.28, | |
| "nll_loss": 1.0532186031341553, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.47808465361595154, | |
| "rewards/margins": 0.41364309191703796, | |
| "rewards/rejected": -0.8917278051376343, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.011193 | |
| }, | |
| { | |
| "epoch": 0.026778242677824266, | |
| "grad_norm": 6.556560516357422, | |
| "learning_rate": 5.333333333333333e-05, | |
| "logits/chosen": -0.4449861943721771, | |
| "logits/rejected": -0.5602853894233704, | |
| "logps/chosen": -10.715709686279297, | |
| "logps/rejected": -27.810680389404297, | |
| "loss": 1.2998032569885254, | |
| "memory(GiB)": 42.68, | |
| "nll_loss": 0.6746751070022583, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.33532828092575073, | |
| "rewards/margins": 0.39097556471824646, | |
| "rewards/rejected": -0.7263038754463196, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.011193 | |
| }, | |
| { | |
| "epoch": 0.02900976290097629, | |
| "grad_norm": 6.815319061279297, | |
| "learning_rate": 5.7777777777777776e-05, | |
| "logits/chosen": -0.45461201667785645, | |
| "logits/rejected": -0.5696772933006287, | |
| "logps/chosen": -8.947586059570312, | |
| "logps/rejected": -23.452707290649414, | |
| "loss": 1.347914218902588, | |
| "memory(GiB)": 42.68, | |
| "nll_loss": 0.7918389439582825, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.14807622134685516, | |
| "rewards/margins": 0.4436675012111664, | |
| "rewards/rejected": -0.5917437076568604, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.011196 | |
| }, | |
| { | |
| "epoch": 0.031241283124128313, | |
| "grad_norm": 4.015015125274658, | |
| "learning_rate": 6.222222222222222e-05, | |
| "logits/chosen": -0.4277312457561493, | |
| "logits/rejected": -0.5162039995193481, | |
| "logps/chosen": -7.859683513641357, | |
| "logps/rejected": -25.14496612548828, | |
| "loss": 1.1709389686584473, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.5424311757087708, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09304673224687576, | |
| "rewards/margins": 0.27104437351226807, | |
| "rewards/rejected": -0.36409106850624084, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.011191 | |
| }, | |
| { | |
| "epoch": 0.03347280334728033, | |
| "grad_norm": 2.5992424488067627, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.4692430794239044, | |
| "logits/rejected": -0.5111399292945862, | |
| "logps/chosen": -8.574230194091797, | |
| "logps/rejected": -16.565174102783203, | |
| "loss": 1.1323829889297485, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.5113993287086487, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.08413823693990707, | |
| "rewards/margins": 0.19407325983047485, | |
| "rewards/rejected": -0.27821147441864014, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.011195 | |
| }, | |
| { | |
| "epoch": 0.03570432357043236, | |
| "grad_norm": 2.479030132293701, | |
| "learning_rate": 7.111111111111112e-05, | |
| "logits/chosen": -0.38820019364356995, | |
| "logits/rejected": -0.5241715908050537, | |
| "logps/chosen": -4.694685935974121, | |
| "logps/rejected": -19.62047576904297, | |
| "loss": 1.052955985069275, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.47422000765800476, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.06994247436523438, | |
| "rewards/margins": 0.2729727327823639, | |
| "rewards/rejected": -0.2030302733182907, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.011196 | |
| }, | |
| { | |
| "epoch": 0.03793584379358438, | |
| "grad_norm": 2.1875240802764893, | |
| "learning_rate": 7.555555555555556e-05, | |
| "logits/chosen": -0.4483625292778015, | |
| "logits/rejected": -0.5458305478096008, | |
| "logps/chosen": -9.014262199401855, | |
| "logps/rejected": -18.748149871826172, | |
| "loss": 1.2149709463119507, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.6185500621795654, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1215842068195343, | |
| "rewards/margins": 0.24843284487724304, | |
| "rewards/rejected": -0.12684863805770874, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.011197 | |
| }, | |
| { | |
| "epoch": 0.0401673640167364, | |
| "grad_norm": 2.639186382293701, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.4394489824771881, | |
| "logits/rejected": -0.48552829027175903, | |
| "logps/chosen": -9.954276084899902, | |
| "logps/rejected": -14.681390762329102, | |
| "loss": 1.1648714542388916, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.46223676204681396, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.011617322452366352, | |
| "rewards/margins": 0.034979358315467834, | |
| "rewards/rejected": -0.02336202934384346, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.011199 | |
| }, | |
| { | |
| "epoch": 0.042398884239888426, | |
| "grad_norm": 2.351567029953003, | |
| "learning_rate": 8.444444444444444e-05, | |
| "logits/chosen": -0.4882590174674988, | |
| "logits/rejected": -0.5300821661949158, | |
| "logps/chosen": -7.595667362213135, | |
| "logps/rejected": -17.29962921142578, | |
| "loss": 1.1524200439453125, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.5075826644897461, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06894361972808838, | |
| "rewards/margins": 0.13017994165420532, | |
| "rewards/rejected": -0.061236318200826645, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.011201 | |
| }, | |
| { | |
| "epoch": 0.044630404463040445, | |
| "grad_norm": 2.8206121921539307, | |
| "learning_rate": 8.888888888888889e-05, | |
| "logits/chosen": -0.4782502055168152, | |
| "logits/rejected": -0.5565172433853149, | |
| "logps/chosen": -6.507530212402344, | |
| "logps/rejected": -13.604747772216797, | |
| "loss": 1.089160442352295, | |
| "memory(GiB)": 46.13, | |
| "nll_loss": 0.45874831080436707, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.06730557233095169, | |
| "rewards/margins": 0.18410882353782654, | |
| "rewards/rejected": -0.11680323630571365, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.011206 | |
| }, | |
| { | |
| "epoch": 0.04686192468619247, | |
| "grad_norm": 2.452335834503174, | |
| "learning_rate": 9.333333333333334e-05, | |
| "logits/chosen": -0.4106925129890442, | |
| "logits/rejected": -0.48896345496177673, | |
| "logps/chosen": -7.722554683685303, | |
| "logps/rejected": -22.094852447509766, | |
| "loss": 1.153997540473938, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5091268420219421, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.060057930648326874, | |
| "rewards/margins": 0.16068722307682037, | |
| "rewards/rejected": -0.1006293073296547, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.04909344490934449, | |
| "grad_norm": 2.3324975967407227, | |
| "learning_rate": 9.777777777777778e-05, | |
| "logits/chosen": -0.4366399943828583, | |
| "logits/rejected": -0.4600733816623688, | |
| "logps/chosen": -9.774506568908691, | |
| "logps/rejected": -14.850456237792969, | |
| "loss": 1.185971975326538, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5413804650306702, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.08716820925474167, | |
| "rewards/margins": 0.17242644727230072, | |
| "rewards/rejected": -0.08525823801755905, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.051324965132496514, | |
| "grad_norm": 2.7291500568389893, | |
| "learning_rate": 0.00010222222222222222, | |
| "logits/chosen": -0.4168204665184021, | |
| "logits/rejected": -0.5373830795288086, | |
| "logps/chosen": -7.675040245056152, | |
| "logps/rejected": -20.635356903076172, | |
| "loss": 1.1511971950531006, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.4784548282623291, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.05419651046395302, | |
| "rewards/margins": 0.0959930419921875, | |
| "rewards/rejected": -0.04179652780294418, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.05355648535564853, | |
| "grad_norm": 2.6357204914093018, | |
| "learning_rate": 0.00010666666666666667, | |
| "logits/chosen": -0.39612719416618347, | |
| "logits/rejected": -0.4547193944454193, | |
| "logps/chosen": -9.427398681640625, | |
| "logps/rejected": -20.611848831176758, | |
| "loss": 1.0459527969360352, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.42900872230529785, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.0577767938375473, | |
| "rewards/margins": 0.24017955362796783, | |
| "rewards/rejected": -0.18240275979042053, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.011203 | |
| }, | |
| { | |
| "epoch": 0.05578800557880056, | |
| "grad_norm": 2.7458126544952393, | |
| "learning_rate": 0.00011111111111111112, | |
| "logits/chosen": -0.3978196978569031, | |
| "logits/rejected": -0.4898090958595276, | |
| "logps/chosen": -9.801487922668457, | |
| "logps/rejected": -21.7921199798584, | |
| "loss": 1.1577973365783691, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5382578372955322, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03896612673997879, | |
| "rewards/margins": 0.24017201364040375, | |
| "rewards/rejected": -0.20120586454868317, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.011205 | |
| }, | |
| { | |
| "epoch": 0.05801952580195258, | |
| "grad_norm": 4.185514450073242, | |
| "learning_rate": 0.00011555555555555555, | |
| "logits/chosen": -0.43978849053382874, | |
| "logits/rejected": -0.5358645915985107, | |
| "logps/chosen": -4.664649963378906, | |
| "logps/rejected": -18.568632125854492, | |
| "loss": 0.9911558032035828, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.39514851570129395, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.01693350076675415, | |
| "rewards/margins": 0.28997230529785156, | |
| "rewards/rejected": -0.3069058060646057, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.0602510460251046, | |
| "grad_norm": 2.983151912689209, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.46957868337631226, | |
| "logits/rejected": -0.5086190700531006, | |
| "logps/chosen": -14.16710376739502, | |
| "logps/rejected": -15.19424819946289, | |
| "loss": 1.3119632005691528, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.732680082321167, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1205766424536705, | |
| "rewards/margins": 0.2763415277004242, | |
| "rewards/rejected": -0.1557648628950119, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.06248256624825663, | |
| "grad_norm": 3.7991929054260254, | |
| "learning_rate": 0.00012444444444444444, | |
| "logits/chosen": -0.3287929892539978, | |
| "logits/rejected": -0.46299535036087036, | |
| "logps/chosen": -6.527912616729736, | |
| "logps/rejected": -23.983104705810547, | |
| "loss": 1.0033739805221558, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.44460976123809814, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07841134071350098, | |
| "rewards/margins": 0.3698306679725647, | |
| "rewards/rejected": -0.29141926765441895, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.011207 | |
| }, | |
| { | |
| "epoch": 0.06471408647140865, | |
| "grad_norm": 3.0063183307647705, | |
| "learning_rate": 0.00012888888888888892, | |
| "logits/chosen": -0.3735123574733734, | |
| "logits/rejected": -0.458845853805542, | |
| "logps/chosen": -7.325934886932373, | |
| "logps/rejected": -21.65030288696289, | |
| "loss": 1.0098869800567627, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.477042555809021, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.025919266045093536, | |
| "rewards/margins": 0.47939103841781616, | |
| "rewards/rejected": -0.4534717798233032, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.011208 | |
| }, | |
| { | |
| "epoch": 0.06694560669456066, | |
| "grad_norm": 2.6957406997680664, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.3790513873100281, | |
| "logits/rejected": -0.4815320372581482, | |
| "logps/chosen": -6.8280110359191895, | |
| "logps/rejected": -22.987621307373047, | |
| "loss": 1.0349267721176147, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5045362114906311, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09961891919374466, | |
| "rewards/margins": 0.4102502763271332, | |
| "rewards/rejected": -0.3106313645839691, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.011209 | |
| }, | |
| { | |
| "epoch": 0.06917712691771269, | |
| "grad_norm": 2.7142391204833984, | |
| "learning_rate": 0.0001377777777777778, | |
| "logits/chosen": -0.36308056116104126, | |
| "logits/rejected": -0.44216084480285645, | |
| "logps/chosen": -5.850837230682373, | |
| "logps/rejected": -21.365463256835938, | |
| "loss": 0.9850523471832275, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.43448853492736816, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0431375615298748, | |
| "rewards/margins": 0.3983423113822937, | |
| "rewards/rejected": -0.3552047610282898, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.07140864714086471, | |
| "grad_norm": 3.897137403488159, | |
| "learning_rate": 0.00014222222222222224, | |
| "logits/chosen": -0.3979527950286865, | |
| "logits/rejected": -0.43778184056282043, | |
| "logps/chosen": -10.285924911499023, | |
| "logps/rejected": -18.7073974609375, | |
| "loss": 1.1233854293823242, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5153944492340088, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.026699109002947807, | |
| "rewards/margins": 0.23945647478103638, | |
| "rewards/rejected": -0.21275737881660461, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.07364016736401674, | |
| "grad_norm": 3.93380069732666, | |
| "learning_rate": 0.00014666666666666666, | |
| "logits/chosen": -0.2758394777774811, | |
| "logits/rejected": -0.37545740604400635, | |
| "logps/chosen": -12.159762382507324, | |
| "logps/rejected": -24.926610946655273, | |
| "loss": 1.2487003803253174, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.6138952970504761, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09166956692934036, | |
| "rewards/margins": 0.2808037996292114, | |
| "rewards/rejected": -0.3724733591079712, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.07587168758716877, | |
| "grad_norm": 3.21878981590271, | |
| "learning_rate": 0.0001511111111111111, | |
| "logits/chosen": -0.24420826137065887, | |
| "logits/rejected": -0.38765522837638855, | |
| "logps/chosen": -6.041399955749512, | |
| "logps/rejected": -22.503984451293945, | |
| "loss": 0.9895752668380737, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.44009482860565186, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.010253368876874447, | |
| "rewards/margins": 0.5208209753036499, | |
| "rewards/rejected": -0.5105676054954529, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.07810320781032078, | |
| "grad_norm": 5.1504316329956055, | |
| "learning_rate": 0.00015555555555555556, | |
| "logits/chosen": -0.2664889693260193, | |
| "logits/rejected": -0.40212178230285645, | |
| "logps/chosen": -5.9132609367370605, | |
| "logps/rejected": -24.527639389038086, | |
| "loss": 0.8355879187583923, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.4006969928741455, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.03980417177081108, | |
| "rewards/margins": 0.8774286508560181, | |
| "rewards/rejected": -0.9172328114509583, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.0803347280334728, | |
| "grad_norm": 3.388197660446167, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.25354304909706116, | |
| "logits/rejected": -0.33330878615379333, | |
| "logps/chosen": -9.807186126708984, | |
| "logps/rejected": -22.963045120239258, | |
| "loss": 1.1024540662765503, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.6454060673713684, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.001722879707813263, | |
| "rewards/margins": 0.8297844529151917, | |
| "rewards/rejected": -0.8315073847770691, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.08256624825662483, | |
| "grad_norm": 2.596273899078369, | |
| "learning_rate": 0.00016444444444444444, | |
| "logits/chosen": -0.21093566715717316, | |
| "logits/rejected": -0.3617200553417206, | |
| "logps/chosen": -2.8380072116851807, | |
| "logps/rejected": -30.42251968383789, | |
| "loss": 0.6882003545761108, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.2877930700778961, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06296033412218094, | |
| "rewards/margins": 1.0582321882247925, | |
| "rewards/rejected": -0.9952719211578369, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.01121 | |
| }, | |
| { | |
| "epoch": 0.08479776847977685, | |
| "grad_norm": 2.358452796936035, | |
| "learning_rate": 0.00016888888888888889, | |
| "logits/chosen": -0.2989475429058075, | |
| "logits/rejected": -0.37469911575317383, | |
| "logps/chosen": -6.1970534324646, | |
| "logps/rejected": -19.100358963012695, | |
| "loss": 0.8981406092643738, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.3934318423271179, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.002394435927271843, | |
| "rewards/margins": 0.6755657196044922, | |
| "rewards/rejected": -0.6731712818145752, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.011211 | |
| }, | |
| { | |
| "epoch": 0.08702928870292886, | |
| "grad_norm": 2.9299051761627197, | |
| "learning_rate": 0.00017333333333333334, | |
| "logits/chosen": -0.2796667516231537, | |
| "logits/rejected": -0.34129300713539124, | |
| "logps/chosen": -8.498173713684082, | |
| "logps/rejected": -26.264965057373047, | |
| "loss": 1.012364387512207, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.586083173751831, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07207094132900238, | |
| "rewards/margins": 1.1341111660003662, | |
| "rewards/rejected": -1.0620403289794922, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.08926080892608089, | |
| "grad_norm": 3.547189474105835, | |
| "learning_rate": 0.00017777777777777779, | |
| "logits/chosen": -0.28194305300712585, | |
| "logits/rejected": -0.33060967922210693, | |
| "logps/chosen": -7.982609748840332, | |
| "logps/rejected": -20.187652587890625, | |
| "loss": 0.9403265118598938, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.42783123254776, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.002833280712366104, | |
| "rewards/margins": 0.7690448760986328, | |
| "rewards/rejected": -0.7662116289138794, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.09149232914923291, | |
| "grad_norm": 3.4967706203460693, | |
| "learning_rate": 0.00018222222222222224, | |
| "logits/chosen": -0.21270643174648285, | |
| "logits/rejected": -0.3004887104034424, | |
| "logps/chosen": -5.226779937744141, | |
| "logps/rejected": -22.208778381347656, | |
| "loss": 0.8620257377624512, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.3914262056350708, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.018529795110225677, | |
| "rewards/margins": 0.9286664128303528, | |
| "rewards/rejected": -0.9101365804672241, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.011213 | |
| }, | |
| { | |
| "epoch": 0.09372384937238494, | |
| "grad_norm": 6.100057601928711, | |
| "learning_rate": 0.0001866666666666667, | |
| "logits/chosen": -0.29974937438964844, | |
| "logits/rejected": -0.36353808641433716, | |
| "logps/chosen": -10.446137428283691, | |
| "logps/rejected": -22.973119735717773, | |
| "loss": 1.2477580308914185, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.6882976293563843, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.2526606023311615, | |
| "rewards/margins": 0.5461662411689758, | |
| "rewards/rejected": -0.7988268136978149, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.09595536959553697, | |
| "grad_norm": 4.625721454620361, | |
| "learning_rate": 0.00019111111111111114, | |
| "logits/chosen": -0.21875600516796112, | |
| "logits/rejected": -0.3691503405570984, | |
| "logps/chosen": -8.029109001159668, | |
| "logps/rejected": -33.986671447753906, | |
| "loss": 0.9927695989608765, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.6190873384475708, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.10942590236663818, | |
| "rewards/margins": 1.7278107404708862, | |
| "rewards/rejected": -1.837236762046814, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.09818688981868898, | |
| "grad_norm": 4.994227886199951, | |
| "learning_rate": 0.00019555555555555556, | |
| "logits/chosen": -0.25192195177078247, | |
| "logits/rejected": -0.32522761821746826, | |
| "logps/chosen": -9.805305480957031, | |
| "logps/rejected": -34.161895751953125, | |
| "loss": 0.9997942447662354, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.6020480990409851, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.30676746368408203, | |
| "rewards/margins": 1.7450387477874756, | |
| "rewards/rejected": -2.0518062114715576, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.011214 | |
| }, | |
| { | |
| "epoch": 0.100418410041841, | |
| "grad_norm": 4.717008590698242, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.33617067337036133, | |
| "logits/rejected": -0.35846105217933655, | |
| "logps/chosen": -9.175792694091797, | |
| "logps/rejected": -21.536231994628906, | |
| "loss": 1.014683485031128, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5040097236633301, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.014129618182778358, | |
| "rewards/margins": 0.7111825942993164, | |
| "rewards/rejected": -0.6970530152320862, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.10264993026499303, | |
| "grad_norm": 3.089895248413086, | |
| "learning_rate": 0.0001999993185874369, | |
| "logits/chosen": -0.3643554747104645, | |
| "logits/rejected": -0.3828020393848419, | |
| "logps/chosen": -11.385210990905762, | |
| "logps/rejected": -27.30405044555664, | |
| "loss": 0.9333115220069885, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5031883120536804, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.08416246622800827, | |
| "rewards/margins": 1.1319228410720825, | |
| "rewards/rejected": -1.216085433959961, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.10488145048814505, | |
| "grad_norm": 4.295483589172363, | |
| "learning_rate": 0.00019999727435903407, | |
| "logits/chosen": -0.3375833332538605, | |
| "logits/rejected": -0.44685542583465576, | |
| "logps/chosen": -4.36940336227417, | |
| "logps/rejected": -21.149555206298828, | |
| "loss": 0.959221601486206, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.42982059717178345, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.15477100014686584, | |
| "rewards/margins": 0.5941969752311707, | |
| "rewards/rejected": -0.4394259452819824, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.011216 | |
| }, | |
| { | |
| "epoch": 0.10711297071129706, | |
| "grad_norm": 2.4132261276245117, | |
| "learning_rate": 0.0001999938673426507, | |
| "logits/chosen": -0.3103625178337097, | |
| "logits/rejected": -0.4320617616176605, | |
| "logps/chosen": -5.777155876159668, | |
| "logps/rejected": -20.897228240966797, | |
| "loss": 0.9094122648239136, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.41829684376716614, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18217116594314575, | |
| "rewards/margins": 0.714988112449646, | |
| "rewards/rejected": -0.5328169465065002, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.011216 | |
| }, | |
| { | |
| "epoch": 0.10934449093444909, | |
| "grad_norm": 2.716282367706299, | |
| "learning_rate": 0.00019998909758471852, | |
| "logits/chosen": -0.3802068829536438, | |
| "logits/rejected": -0.4424472749233246, | |
| "logps/chosen": -7.844504356384277, | |
| "logps/rejected": -21.755281448364258, | |
| "loss": 1.0127230882644653, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.5032894611358643, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.07639233767986298, | |
| "rewards/margins": 0.79319167137146, | |
| "rewards/rejected": -0.7167993187904358, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.011217 | |
| }, | |
| { | |
| "epoch": 0.11157601115760112, | |
| "grad_norm": 3.5755205154418945, | |
| "learning_rate": 0.000199982965150241, | |
| "logits/chosen": -0.32785969972610474, | |
| "logits/rejected": -0.384295791387558, | |
| "logps/chosen": -12.152947425842285, | |
| "logps/rejected": -21.354625701904297, | |
| "loss": 1.1883673667907715, | |
| "memory(GiB)": 46.71, | |
| "nll_loss": 0.6465156674385071, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.11994989961385727, | |
| "rewards/margins": 0.5093130469322205, | |
| "rewards/rejected": -0.6292628645896912, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.011217 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 896, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.728739939863757e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |