Instructions to use cragtmp/pair05r16-50 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/pair05r16-50 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/pair05r16-50") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.12574662055957248, | |
| "eval_steps": 300, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002514932411191449, | |
| "grad_norm": 5.559185028076172, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "logits/chosen": -0.5158984065055847, | |
| "logits/rejected": -0.6433685421943665, | |
| "logps/chosen": -8.879493713378906, | |
| "logps/rejected": -18.298219680786133, | |
| "loss": 1.2430726289749146, | |
| "memory(GiB)": 30.69, | |
| "nll_loss": 0.5499253869056702, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.010477 | |
| }, | |
| { | |
| "epoch": 0.005029864822382898, | |
| "grad_norm": 5.400235176086426, | |
| "learning_rate": 6.666666666666667e-06, | |
| "logits/chosen": -0.5219721794128418, | |
| "logits/rejected": -0.6263731718063354, | |
| "logps/chosen": -4.77984094619751, | |
| "logps/rejected": -15.150838851928711, | |
| "loss": 1.0675525665283203, | |
| "memory(GiB)": 33.9, | |
| "nll_loss": 0.3744054436683655, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.010866 | |
| }, | |
| { | |
| "epoch": 0.007544797233574348, | |
| "grad_norm": 7.852550983428955, | |
| "learning_rate": 1e-05, | |
| "logits/chosen": -0.48881009221076965, | |
| "logits/rejected": -0.6540625691413879, | |
| "logps/chosen": -4.714770793914795, | |
| "logps/rejected": -17.99374008178711, | |
| "loss": 1.0851404666900635, | |
| "memory(GiB)": 33.9, | |
| "nll_loss": 0.3894187808036804, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.002094469266012311, | |
| "rewards/margins": -0.004971538204699755, | |
| "rewards/rejected": 0.0028770684730261564, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.011002 | |
| }, | |
| { | |
| "epoch": 0.010059729644765796, | |
| "grad_norm": 10.150762557983398, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "logits/chosen": -0.4506370425224304, | |
| "logits/rejected": -0.6422093510627747, | |
| "logps/chosen": -3.6849846839904785, | |
| "logps/rejected": -21.201997756958008, | |
| "loss": 1.092491865158081, | |
| "memory(GiB)": 37.36, | |
| "nll_loss": 0.4020901322364807, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.007022961974143982, | |
| "rewards/margins": 0.0057290042750537395, | |
| "rewards/rejected": 0.001293957349844277, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.011051 | |
| }, | |
| { | |
| "epoch": 0.012574662055957246, | |
| "grad_norm": 6.588510036468506, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "logits/chosen": -0.4159216284751892, | |
| "logits/rejected": -0.5884239673614502, | |
| "logps/chosen": -8.611150741577148, | |
| "logps/rejected": -19.931533813476562, | |
| "loss": 1.1986628770828247, | |
| "memory(GiB)": 37.36, | |
| "nll_loss": 0.5155895948410034, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.005048489198088646, | |
| "rewards/margins": 0.020845137536525726, | |
| "rewards/rejected": -0.01579664833843708, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.011086 | |
| }, | |
| { | |
| "epoch": 0.015089594467148696, | |
| "grad_norm": 3.965754508972168, | |
| "learning_rate": 2e-05, | |
| "logits/chosen": -0.47118157148361206, | |
| "logits/rejected": -0.5790206789970398, | |
| "logps/chosen": -9.572708129882812, | |
| "logps/rejected": -19.066829681396484, | |
| "loss": 1.1965497732162476, | |
| "memory(GiB)": 37.36, | |
| "nll_loss": 0.5279884338378906, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.006116065196692944, | |
| "rewards/margins": 0.05174415558576584, | |
| "rewards/rejected": -0.04562808945775032, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.01111 | |
| }, | |
| { | |
| "epoch": 0.017604526878340146, | |
| "grad_norm": 2.719625234603882, | |
| "learning_rate": 2.3333333333333336e-05, | |
| "logits/chosen": -0.40740644931793213, | |
| "logits/rejected": -0.5419386029243469, | |
| "logps/chosen": -9.413152694702148, | |
| "logps/rejected": -24.703401565551758, | |
| "loss": 1.1549676656723022, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5149396061897278, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.02250390499830246, | |
| "rewards/margins": 0.12123934924602509, | |
| "rewards/rejected": -0.14374326169490814, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.011114 | |
| }, | |
| { | |
| "epoch": 0.020119459289531592, | |
| "grad_norm": 3.325852394104004, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "logits/chosen": -0.4091758728027344, | |
| "logits/rejected": -0.5692812204360962, | |
| "logps/chosen": -5.904629230499268, | |
| "logps/rejected": -20.752662658691406, | |
| "loss": 1.0213468074798584, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3945533037185669, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.041384391486644745, | |
| "rewards/margins": 0.17802417278289795, | |
| "rewards/rejected": -0.2194085717201233, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.011127 | |
| }, | |
| { | |
| "epoch": 0.022634391700723042, | |
| "grad_norm": 3.5531411170959473, | |
| "learning_rate": 3e-05, | |
| "logits/chosen": -0.3281947374343872, | |
| "logits/rejected": -0.5156837701797485, | |
| "logps/chosen": -5.975313186645508, | |
| "logps/rejected": -27.066158294677734, | |
| "loss": 0.8695712089538574, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3611774742603302, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0457351878285408, | |
| "rewards/margins": 0.4895857870578766, | |
| "rewards/rejected": -0.443850576877594, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.011136 | |
| }, | |
| { | |
| "epoch": 0.025149324111914492, | |
| "grad_norm": 4.356088161468506, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "logits/chosen": -0.43971675634384155, | |
| "logits/rejected": -0.5702978372573853, | |
| "logps/chosen": -6.376318454742432, | |
| "logps/rejected": -19.42030143737793, | |
| "loss": 1.0046417713165283, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.42133060097694397, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.17984721064567566, | |
| "rewards/margins": 0.43266722559928894, | |
| "rewards/rejected": -0.6125144362449646, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.01115 | |
| }, | |
| { | |
| "epoch": 0.027664256523105942, | |
| "grad_norm": 3.9732213020324707, | |
| "learning_rate": 3.6666666666666666e-05, | |
| "logits/chosen": -0.4561832845211029, | |
| "logits/rejected": -0.6065505146980286, | |
| "logps/chosen": -6.498957633972168, | |
| "logps/rejected": -27.428552627563477, | |
| "loss": 0.9565106630325317, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.40273764729499817, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.12391924858093262, | |
| "rewards/margins": 0.5706068277359009, | |
| "rewards/rejected": -0.6945260763168335, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.011161 | |
| }, | |
| { | |
| "epoch": 0.030179188934297392, | |
| "grad_norm": 2.2540578842163086, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.42088037729263306, | |
| "logits/rejected": -0.6009025573730469, | |
| "logps/chosen": -4.243446350097656, | |
| "logps/rejected": -26.567686080932617, | |
| "loss": 0.7599425911903381, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.28007903695106506, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.14110325276851654, | |
| "rewards/margins": 0.6590132713317871, | |
| "rewards/rejected": -0.8001165390014648, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.011171 | |
| }, | |
| { | |
| "epoch": 0.03269412134548884, | |
| "grad_norm": 6.460833549499512, | |
| "learning_rate": 4.3333333333333334e-05, | |
| "logits/chosen": -0.4136754274368286, | |
| "logits/rejected": -0.5452494621276855, | |
| "logps/chosen": -7.585506439208984, | |
| "logps/rejected": -21.19340705871582, | |
| "loss": 1.223608136177063, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.6720148921012878, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.25483113527297974, | |
| "rewards/margins": 0.49035438895225525, | |
| "rewards/rejected": -0.7451854944229126, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.011181 | |
| }, | |
| { | |
| "epoch": 0.03520905375668029, | |
| "grad_norm": 4.092947006225586, | |
| "learning_rate": 4.666666666666667e-05, | |
| "logits/chosen": -0.527854323387146, | |
| "logits/rejected": -0.5994939804077148, | |
| "logps/chosen": -8.185604095458984, | |
| "logps/rejected": -17.946279525756836, | |
| "loss": 1.2557107210159302, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.66472989320755, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.145107239484787, | |
| "rewards/margins": 0.41058170795440674, | |
| "rewards/rejected": -0.5556889772415161, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.011194 | |
| }, | |
| { | |
| "epoch": 0.03772398616787174, | |
| "grad_norm": 3.926342248916626, | |
| "learning_rate": 5e-05, | |
| "logits/chosen": -0.407508909702301, | |
| "logits/rejected": -0.5949459075927734, | |
| "logps/chosen": -3.4148104190826416, | |
| "logps/rejected": -22.69104766845703, | |
| "loss": 0.8548452258110046, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.40506720542907715, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.025914989411830902, | |
| "rewards/margins": 0.6952927708625793, | |
| "rewards/rejected": -0.7212077379226685, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.0112 | |
| }, | |
| { | |
| "epoch": 0.040238918579063185, | |
| "grad_norm": 2.4273853302001953, | |
| "learning_rate": 5.333333333333333e-05, | |
| "logits/chosen": -0.3462049961090088, | |
| "logits/rejected": -0.58342045545578, | |
| "logps/chosen": -3.8651039600372314, | |
| "logps/rejected": -28.470134735107422, | |
| "loss": 0.821665346622467, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3309793472290039, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04178892821073532, | |
| "rewards/margins": 0.5164157152175903, | |
| "rewards/rejected": -0.4746267795562744, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.011202 | |
| }, | |
| { | |
| "epoch": 0.04275385099025464, | |
| "grad_norm": 1.8921568393707275, | |
| "learning_rate": 5.666666666666667e-05, | |
| "logits/chosen": -0.5054872632026672, | |
| "logits/rejected": -0.6153637170791626, | |
| "logps/chosen": -1.8910857439041138, | |
| "logps/rejected": -16.781475067138672, | |
| "loss": 0.7665270566940308, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.2412014603614807, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04062865674495697, | |
| "rewards/margins": 0.41468262672424316, | |
| "rewards/rejected": -0.3740540146827698, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.011212 | |
| }, | |
| { | |
| "epoch": 0.045268783401446085, | |
| "grad_norm": 3.2724339962005615, | |
| "learning_rate": 6e-05, | |
| "logits/chosen": -0.45994284749031067, | |
| "logits/rejected": -0.5327339768409729, | |
| "logps/chosen": -8.705971717834473, | |
| "logps/rejected": -17.33376121520996, | |
| "loss": 1.2050995826721191, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5643416047096252, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.048418305814266205, | |
| "rewards/margins": 0.16582812368869781, | |
| "rewards/rejected": -0.21424642205238342, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.04778371581263754, | |
| "grad_norm": 2.6650567054748535, | |
| "learning_rate": 6.333333333333333e-05, | |
| "logits/chosen": -0.48406994342803955, | |
| "logits/rejected": -0.5535129308700562, | |
| "logps/chosen": -10.087296485900879, | |
| "logps/rejected": -17.584102630615234, | |
| "loss": 1.1602699756622314, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5509804487228394, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.005405411124229431, | |
| "rewards/margins": 0.23162491619586945, | |
| "rewards/rejected": -0.23703034222126007, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.01122 | |
| }, | |
| { | |
| "epoch": 0.050298648223828984, | |
| "grad_norm": 2.393120527267456, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.4699333906173706, | |
| "logits/rejected": -0.5745525360107422, | |
| "logps/chosen": -5.482749938964844, | |
| "logps/rejected": -15.294036865234375, | |
| "loss": 1.0463979244232178, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.40886539220809937, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.030414806678891182, | |
| "rewards/margins": 0.18470264971256256, | |
| "rewards/rejected": -0.15428784489631653, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.011224 | |
| }, | |
| { | |
| "epoch": 0.05281358063502043, | |
| "grad_norm": 1.7328065633773804, | |
| "learning_rate": 7e-05, | |
| "logits/chosen": -0.5130109190940857, | |
| "logits/rejected": -0.6171243190765381, | |
| "logps/chosen": -8.619268417358398, | |
| "logps/rejected": -18.43971824645996, | |
| "loss": 1.1801689863204956, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.6120539903640747, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07324957102537155, | |
| "rewards/margins": 0.3033149242401123, | |
| "rewards/rejected": -0.23006536066532135, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 0.055328513046211884, | |
| "grad_norm": 2.848578691482544, | |
| "learning_rate": 7.333333333333333e-05, | |
| "logits/chosen": -0.46683233976364136, | |
| "logits/rejected": -0.5329924821853638, | |
| "logps/chosen": -4.357663154602051, | |
| "logps/rejected": -15.35399055480957, | |
| "loss": 0.9406945705413818, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3216635584831238, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.010179778560996056, | |
| "rewards/margins": 0.2008945494890213, | |
| "rewards/rejected": -0.21107429265975952, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.011229 | |
| }, | |
| { | |
| "epoch": 0.05784344545740333, | |
| "grad_norm": 1.7426271438598633, | |
| "learning_rate": 7.666666666666667e-05, | |
| "logits/chosen": -0.5002316236495972, | |
| "logits/rejected": -0.5488481521606445, | |
| "logps/chosen": -5.690494537353516, | |
| "logps/rejected": -15.590461730957031, | |
| "loss": 0.9775924682617188, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.355554461479187, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.009325886145234108, | |
| "rewards/margins": 0.18430516123771667, | |
| "rewards/rejected": -0.1749793142080307, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.060358377868594784, | |
| "grad_norm": 1.8518409729003906, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.5258264541625977, | |
| "logits/rejected": -0.5805689096450806, | |
| "logps/chosen": -9.133979797363281, | |
| "logps/rejected": -17.886051177978516, | |
| "loss": 1.1810051202774048, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.6029603481292725, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.04269062727689743, | |
| "rewards/margins": 0.2787190079689026, | |
| "rewards/rejected": -0.23602835834026337, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.06287331027978624, | |
| "grad_norm": 2.4842066764831543, | |
| "learning_rate": 8.333333333333334e-05, | |
| "logits/chosen": -0.44220152497291565, | |
| "logits/rejected": -0.5788168907165527, | |
| "logps/chosen": -4.989194869995117, | |
| "logps/rejected": -18.047056198120117, | |
| "loss": 1.0011777877807617, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.4066605269908905, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.021916719153523445, | |
| "rewards/margins": 0.2587287425994873, | |
| "rewards/rejected": -0.236812025308609, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.06538824269097768, | |
| "grad_norm": 1.766322135925293, | |
| "learning_rate": 8.666666666666667e-05, | |
| "logits/chosen": -0.3389984369277954, | |
| "logits/rejected": -0.543292224407196, | |
| "logps/chosen": -11.735610961914062, | |
| "logps/rejected": -26.25033950805664, | |
| "loss": 1.0063844919204712, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5172990560531616, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07315510511398315, | |
| "rewards/margins": 0.5734083652496338, | |
| "rewards/rejected": -0.5002533197402954, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.06790317510216913, | |
| "grad_norm": 3.3314130306243896, | |
| "learning_rate": 9e-05, | |
| "logits/chosen": -0.37741950154304504, | |
| "logits/rejected": -0.5884826183319092, | |
| "logps/chosen": -5.442512035369873, | |
| "logps/rejected": -27.738323211669922, | |
| "loss": 0.8821365237236023, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.4055330753326416, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.03083166666328907, | |
| "rewards/margins": 0.6056570410728455, | |
| "rewards/rejected": -0.6364887952804565, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.07041810751336058, | |
| "grad_norm": 2.849647283554077, | |
| "learning_rate": 9.333333333333334e-05, | |
| "logits/chosen": -0.4310716688632965, | |
| "logits/rejected": -0.5529810190200806, | |
| "logps/chosen": -8.224971771240234, | |
| "logps/rejected": -26.79846954345703, | |
| "loss": 0.8747767806053162, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.45313140749931335, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.07478700578212738, | |
| "rewards/margins": 0.8052245378494263, | |
| "rewards/rejected": -0.8800115585327148, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.07293303992455202, | |
| "grad_norm": 2.247368097305298, | |
| "learning_rate": 9.666666666666667e-05, | |
| "logits/chosen": -0.37296879291534424, | |
| "logits/rejected": -0.5259015560150146, | |
| "logps/chosen": -6.546780109405518, | |
| "logps/rejected": -25.603477478027344, | |
| "loss": 0.9804578423500061, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.4873877465724945, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.046319298446178436, | |
| "rewards/margins": 0.5485984086990356, | |
| "rewards/rejected": -0.5949177145957947, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.07544797233574348, | |
| "grad_norm": 1.7451585531234741, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.36992424726486206, | |
| "logits/rejected": -0.45540890097618103, | |
| "logps/chosen": -6.483048439025879, | |
| "logps/rejected": -18.744525909423828, | |
| "loss": 0.9453181624412537, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.37866073846817017, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0520947091281414, | |
| "rewards/margins": 0.33587026596069336, | |
| "rewards/rejected": -0.28377556800842285, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.07796290474693493, | |
| "grad_norm": 2.8843863010406494, | |
| "learning_rate": 0.00010333333333333334, | |
| "logits/chosen": -0.3973531723022461, | |
| "logits/rejected": -0.4880366325378418, | |
| "logps/chosen": -6.5046491622924805, | |
| "logps/rejected": -18.793209075927734, | |
| "loss": 1.0352380275726318, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.514582097530365, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.06333249807357788, | |
| "rewards/margins": 0.5268359780311584, | |
| "rewards/rejected": -0.4635034203529358, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.08047783715812637, | |
| "grad_norm": 1.9934616088867188, | |
| "learning_rate": 0.00010666666666666667, | |
| "logits/chosen": -0.38435813784599304, | |
| "logits/rejected": -0.4866703450679779, | |
| "logps/chosen": -5.984093189239502, | |
| "logps/rejected": -28.37721061706543, | |
| "loss": 0.9228850603103638, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3919341564178467, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08762034773826599, | |
| "rewards/margins": 0.4990919232368469, | |
| "rewards/rejected": -0.41147157549858093, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.08299276956931782, | |
| "grad_norm": 2.605156421661377, | |
| "learning_rate": 0.00011000000000000002, | |
| "logits/chosen": -0.3683161437511444, | |
| "logits/rejected": -0.4800977110862732, | |
| "logps/chosen": -6.79887056350708, | |
| "logps/rejected": -18.521530151367188, | |
| "loss": 0.9287618398666382, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.4155515730381012, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.062238909304142, | |
| "rewards/margins": 0.4814634323120117, | |
| "rewards/rejected": -0.41922450065612793, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.08550770198050928, | |
| "grad_norm": 2.1593198776245117, | |
| "learning_rate": 0.00011333333333333334, | |
| "logits/chosen": -0.3462904989719391, | |
| "logits/rejected": -0.4482634663581848, | |
| "logps/chosen": -4.484028339385986, | |
| "logps/rejected": -22.155223846435547, | |
| "loss": 0.8287199139595032, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3564324378967285, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.011370105668902397, | |
| "rewards/margins": 0.8015316724777222, | |
| "rewards/rejected": -0.8129018545150757, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.08802263439170073, | |
| "grad_norm": 2.1223862171173096, | |
| "learning_rate": 0.00011666666666666668, | |
| "logits/chosen": -0.23746490478515625, | |
| "logits/rejected": -0.4123544991016388, | |
| "logps/chosen": -4.062009334564209, | |
| "logps/rejected": -30.214771270751953, | |
| "loss": 0.8381334543228149, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.45768678188323975, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06588438153266907, | |
| "rewards/margins": 1.1650195121765137, | |
| "rewards/rejected": -1.0991352796554565, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.09053756680289217, | |
| "grad_norm": 1.7519793510437012, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.274143248796463, | |
| "logits/rejected": -0.4072067439556122, | |
| "logps/chosen": -7.12678861618042, | |
| "logps/rejected": -29.586929321289062, | |
| "loss": 0.7818687558174133, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.38336753845214844, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.030900314450263977, | |
| "rewards/margins": 1.0601840019226074, | |
| "rewards/rejected": -1.0292836427688599, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.09305249921408362, | |
| "grad_norm": 2.2621781826019287, | |
| "learning_rate": 0.00012333333333333334, | |
| "logits/chosen": -0.30612003803253174, | |
| "logits/rejected": -0.44930776953697205, | |
| "logps/chosen": -5.637537956237793, | |
| "logps/rejected": -30.86564064025879, | |
| "loss": 0.7518173456192017, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.4073091149330139, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.1094760149717331, | |
| "rewards/margins": 1.2509604692459106, | |
| "rewards/rejected": -1.3604364395141602, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.011245 | |
| }, | |
| { | |
| "epoch": 0.09556743162527508, | |
| "grad_norm": 2.6005046367645264, | |
| "learning_rate": 0.00012666666666666666, | |
| "logits/chosen": -0.36841830611228943, | |
| "logits/rejected": -0.44501256942749023, | |
| "logps/chosen": -8.786764144897461, | |
| "logps/rejected": -21.693777084350586, | |
| "loss": 0.967311441898346, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5350124835968018, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.05166015028953552, | |
| "rewards/margins": 0.9184513092041016, | |
| "rewards/rejected": -0.9701113700866699, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 0.09808236403646652, | |
| "grad_norm": 7.679723262786865, | |
| "learning_rate": 0.00013000000000000002, | |
| "logits/chosen": -0.3933795094490051, | |
| "logits/rejected": -0.4303474426269531, | |
| "logps/chosen": -9.630545616149902, | |
| "logps/rejected": -25.0108642578125, | |
| "loss": 1.1940371990203857, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.6422770023345947, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.19723013043403625, | |
| "rewards/margins": 0.8150386214256287, | |
| "rewards/rejected": -1.0122687816619873, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 0.10059729644765797, | |
| "grad_norm": 2.497746229171753, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.3561173677444458, | |
| "logits/rejected": -0.4964173436164856, | |
| "logps/chosen": -6.288295269012451, | |
| "logps/rejected": -28.722339630126953, | |
| "loss": 0.7734813690185547, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.35979557037353516, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.020053118467330933, | |
| "rewards/margins": 1.0713183879852295, | |
| "rewards/rejected": -1.0512654781341553, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 0.10311222885884942, | |
| "grad_norm": 3.900786876678467, | |
| "learning_rate": 0.00013666666666666666, | |
| "logits/chosen": -0.30438148975372314, | |
| "logits/rejected": -0.4660162031650543, | |
| "logps/chosen": -9.80126953125, | |
| "logps/rejected": -22.89883804321289, | |
| "loss": 1.0617499351501465, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5348615646362305, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.037312038242816925, | |
| "rewards/margins": 0.48836010694503784, | |
| "rewards/rejected": -0.4510480761528015, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 0.10562716127004086, | |
| "grad_norm": 4.212996006011963, | |
| "learning_rate": 0.00014, | |
| "logits/chosen": -0.37392380833625793, | |
| "logits/rejected": -0.4811669588088989, | |
| "logps/chosen": -8.54138469696045, | |
| "logps/rejected": -24.88803482055664, | |
| "loss": 0.9449828267097473, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.40984830260276794, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.078499935567379, | |
| "rewards/margins": 0.6149317026138306, | |
| "rewards/rejected": -0.6934316754341125, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.011249 | |
| }, | |
| { | |
| "epoch": 0.10814209368123232, | |
| "grad_norm": 2.7297940254211426, | |
| "learning_rate": 0.00014333333333333334, | |
| "logits/chosen": -0.22235050797462463, | |
| "logits/rejected": -0.44656193256378174, | |
| "logps/chosen": -3.8628368377685547, | |
| "logps/rejected": -29.070890426635742, | |
| "loss": 0.6864454746246338, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3404179513454437, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10101112723350525, | |
| "rewards/margins": 1.1784940958023071, | |
| "rewards/rejected": -1.0774829387664795, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.011247 | |
| }, | |
| { | |
| "epoch": 0.11065702609242377, | |
| "grad_norm": 4.357929229736328, | |
| "learning_rate": 0.00014666666666666666, | |
| "logits/chosen": -0.3152369558811188, | |
| "logits/rejected": -0.4675106406211853, | |
| "logps/chosen": -8.47473430633545, | |
| "logps/rejected": -35.49666976928711, | |
| "loss": 0.8841890096664429, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.543793261051178, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.2599925100803375, | |
| "rewards/margins": 1.5472975969314575, | |
| "rewards/rejected": -1.8072898387908936, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 0.11317195850361522, | |
| "grad_norm": 4.053813934326172, | |
| "learning_rate": 0.00015000000000000001, | |
| "logits/chosen": -0.47932106256484985, | |
| "logits/rejected": -0.5357992053031921, | |
| "logps/chosen": -10.139131546020508, | |
| "logps/rejected": -29.30261993408203, | |
| "loss": 1.0090879201889038, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.6002873182296753, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.2646394371986389, | |
| "rewards/margins": 1.3857942819595337, | |
| "rewards/rejected": -1.6504336595535278, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.01125 | |
| }, | |
| { | |
| "epoch": 0.11568689091480666, | |
| "grad_norm": 3.4071342945098877, | |
| "learning_rate": 0.00015333333333333334, | |
| "logits/chosen": -0.35965389013290405, | |
| "logits/rejected": -0.4886631965637207, | |
| "logps/chosen": -6.492125988006592, | |
| "logps/rejected": -33.90357971191406, | |
| "loss": 0.9477238655090332, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.5519906878471375, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.13393068313598633, | |
| "rewards/margins": 1.3498430252075195, | |
| "rewards/rejected": -1.4837737083435059, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.011251 | |
| }, | |
| { | |
| "epoch": 0.11820182332599811, | |
| "grad_norm": 1.5676898956298828, | |
| "learning_rate": 0.00015666666666666666, | |
| "logits/chosen": -0.3339039087295532, | |
| "logits/rejected": -0.5405474305152893, | |
| "logps/chosen": -5.18754768371582, | |
| "logps/rejected": -34.61940383911133, | |
| "loss": 0.5877978205680847, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.26233971118927, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04858784377574921, | |
| "rewards/margins": 1.4838428497314453, | |
| "rewards/rejected": -1.4352549314498901, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 0.12071675573718957, | |
| "grad_norm": 1.7600055932998657, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.38554954528808594, | |
| "logits/rejected": -0.5349220633506775, | |
| "logps/chosen": -5.35024356842041, | |
| "logps/rejected": -30.936561584472656, | |
| "loss": 0.7445188760757446, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3484676480293274, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.04428477957844734, | |
| "rewards/margins": 1.158116340637207, | |
| "rewards/rejected": -1.2024011611938477, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 0.12323168814838101, | |
| "grad_norm": 1.8286348581314087, | |
| "learning_rate": 0.00016333333333333334, | |
| "logits/chosen": -0.3060781955718994, | |
| "logits/rejected": -0.5333737134933472, | |
| "logps/chosen": -4.790343761444092, | |
| "logps/rejected": -32.540409088134766, | |
| "loss": 0.6686277985572815, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3360018730163574, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0967080146074295, | |
| "rewards/margins": 1.285821795463562, | |
| "rewards/rejected": -1.1891138553619385, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 0.12574662055957248, | |
| "grad_norm": 1.8983184099197388, | |
| "learning_rate": 0.0001666666666666667, | |
| "logits/chosen": -0.22582519054412842, | |
| "logits/rejected": -0.47035256028175354, | |
| "logps/chosen": -6.48522424697876, | |
| "logps/rejected": -32.73487091064453, | |
| "loss": 0.8076327443122864, | |
| "memory(GiB)": 40.85, | |
| "nll_loss": 0.3926582336425781, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.01478707417845726, | |
| "rewards/margins": 1.167083501815796, | |
| "rewards/rejected": -1.1522964239120483, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.011253 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1191, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.7419712375750656e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |