Instructions to use cragtmp/task3f2-150 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/task3f2-150 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/task3f2-150") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.12102569274602254, | |
| "eval_steps": 300, | |
| "global_step": 150, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0008068379516401503, | |
| "grad_norm": 9.261910438537598, | |
| "learning_rate": 3.225806451612903e-06, | |
| "logits/chosen": -0.6039718985557556, | |
| "logits/rejected": -0.6058337688446045, | |
| "logps/chosen": -7.412725925445557, | |
| "logps/rejected": -11.413676261901855, | |
| "loss": 1.2381761074066162, | |
| "memory(GiB)": 46.32, | |
| "nll_loss": 0.5450288653373718, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005524 | |
| }, | |
| { | |
| "epoch": 0.0016136759032803006, | |
| "grad_norm": 5.391567230224609, | |
| "learning_rate": 6.451612903225806e-06, | |
| "logits/chosen": -0.6199994087219238, | |
| "logits/rejected": -0.6217825412750244, | |
| "logps/chosen": -7.599736213684082, | |
| "logps/rejected": -15.575040817260742, | |
| "loss": 1.1066936254501343, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41354650259017944, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005546 | |
| }, | |
| { | |
| "epoch": 0.002420513854920451, | |
| "grad_norm": 6.5534772872924805, | |
| "learning_rate": 9.67741935483871e-06, | |
| "logits/chosen": -0.6068329811096191, | |
| "logits/rejected": -0.6103144288063049, | |
| "logps/chosen": -11.938759803771973, | |
| "logps/rejected": -14.32825756072998, | |
| "loss": 1.267569661140442, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5742746591567993, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0005358309717848897, | |
| "rewards/margins": -0.00011114418157376349, | |
| "rewards/rejected": 0.0006469750078395009, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005487 | |
| }, | |
| { | |
| "epoch": 0.003227351806560601, | |
| "grad_norm": 3.4633655548095703, | |
| "learning_rate": 1.2903225806451613e-05, | |
| "logits/chosen": -0.6417700052261353, | |
| "logits/rejected": -0.638687789440155, | |
| "logps/chosen": -10.244372367858887, | |
| "logps/rejected": -8.448144912719727, | |
| "loss": 1.1101956367492676, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4145403802394867, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.002526381518691778, | |
| "rewards/margins": -0.004837517160922289, | |
| "rewards/rejected": 0.0023111351765692234, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005482 | |
| }, | |
| { | |
| "epoch": 0.004034189758200751, | |
| "grad_norm": 9.884061813354492, | |
| "learning_rate": 1.6129032258064517e-05, | |
| "logits/chosen": -0.6263395547866821, | |
| "logits/rejected": -0.6316207647323608, | |
| "logps/chosen": -8.768255233764648, | |
| "logps/rejected": -12.074126243591309, | |
| "loss": 1.2384487390518188, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5502734780311584, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.011151458136737347, | |
| "rewards/margins": 0.010235130786895752, | |
| "rewards/rejected": 0.0009163276990875602, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.004841027709840902, | |
| "grad_norm": 9.879764556884766, | |
| "learning_rate": 1.935483870967742e-05, | |
| "logits/chosen": -0.6110924482345581, | |
| "logits/rejected": -0.6128084063529968, | |
| "logps/chosen": -11.146334648132324, | |
| "logps/rejected": -12.724503517150879, | |
| "loss": 1.246738314628601, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5631918907165527, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.02471097745001316, | |
| "rewards/margins": 0.02056196704506874, | |
| "rewards/rejected": 0.004149014595896006, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.0056478656614810515, | |
| "grad_norm": 3.7321648597717285, | |
| "learning_rate": 2.258064516129032e-05, | |
| "logits/chosen": -0.6434396505355835, | |
| "logits/rejected": -0.6456248164176941, | |
| "logps/chosen": -12.346940994262695, | |
| "logps/rejected": -13.585854530334473, | |
| "loss": 1.25950026512146, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5602214932441711, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.01709746941924095, | |
| "rewards/margins": -0.004833616316318512, | |
| "rewards/rejected": 0.021931089460849762, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005511 | |
| }, | |
| { | |
| "epoch": 0.006454703613121202, | |
| "grad_norm": 6.577890872955322, | |
| "learning_rate": 2.5806451612903226e-05, | |
| "logits/chosen": -0.6166916489601135, | |
| "logits/rejected": -0.6146227717399597, | |
| "logps/chosen": -16.807830810546875, | |
| "logps/rejected": -11.38271427154541, | |
| "loss": 1.2828420400619507, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5101535320281982, | |
| "rewards/accuracies": 0.25, | |
| "rewards/chosen": -0.04314221069216728, | |
| "rewards/margins": -0.13309986889362335, | |
| "rewards/rejected": 0.08995765447616577, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.007261541564761352, | |
| "grad_norm": 3.5513713359832764, | |
| "learning_rate": 2.9032258064516133e-05, | |
| "logits/chosen": -0.5994153022766113, | |
| "logits/rejected": -0.6015004515647888, | |
| "logps/chosen": -11.679065704345703, | |
| "logps/rejected": -12.411300659179688, | |
| "loss": 1.171980857849121, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4982386827468872, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.035934723913669586, | |
| "rewards/margins": 0.08020534366369247, | |
| "rewards/rejected": -0.04427062347531319, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005483 | |
| }, | |
| { | |
| "epoch": 0.008068379516401502, | |
| "grad_norm": 7.633578777313232, | |
| "learning_rate": 3.2258064516129034e-05, | |
| "logits/chosen": -0.6122820377349854, | |
| "logits/rejected": -0.6125556826591492, | |
| "logps/chosen": -12.382171630859375, | |
| "logps/rejected": -10.675874710083008, | |
| "loss": 1.3903008699417114, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6006877422332764, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.08313174545764923, | |
| "rewards/margins": -0.13078533113002777, | |
| "rewards/rejected": 0.04765357822179794, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.008875217468041654, | |
| "grad_norm": 4.818623065948486, | |
| "learning_rate": 3.548387096774194e-05, | |
| "logits/chosen": -0.6364253759384155, | |
| "logits/rejected": -0.6395613551139832, | |
| "logps/chosen": -7.883171558380127, | |
| "logps/rejected": -15.457681655883789, | |
| "loss": 1.1344804763793945, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46768438816070557, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.008294675499200821, | |
| "rewards/margins": 0.10872506350278854, | |
| "rewards/rejected": -0.10043041408061981, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.009682055419681803, | |
| "grad_norm": 3.8297243118286133, | |
| "learning_rate": 3.870967741935484e-05, | |
| "logits/chosen": -0.6082768440246582, | |
| "logits/rejected": -0.6128782629966736, | |
| "logps/chosen": -10.993257522583008, | |
| "logps/rejected": -14.49487018585205, | |
| "loss": 1.1111013889312744, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42791634798049927, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.013819348067045212, | |
| "rewards/margins": 0.08211039006710052, | |
| "rewards/rejected": -0.09592973440885544, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005476 | |
| }, | |
| { | |
| "epoch": 0.010488893371321953, | |
| "grad_norm": 3.1733834743499756, | |
| "learning_rate": 4.1935483870967746e-05, | |
| "logits/chosen": -0.597683846950531, | |
| "logits/rejected": -0.6003975868225098, | |
| "logps/chosen": -7.611721038818359, | |
| "logps/rejected": -13.589990615844727, | |
| "loss": 0.9966970682144165, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3590569496154785, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09378139674663544, | |
| "rewards/margins": 0.16571055352687836, | |
| "rewards/rejected": -0.07192917168140411, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.005488 | |
| }, | |
| { | |
| "epoch": 0.011295731322962103, | |
| "grad_norm": 5.364157676696777, | |
| "learning_rate": 4.516129032258064e-05, | |
| "logits/chosen": -0.5847792029380798, | |
| "logits/rejected": -0.5856592655181885, | |
| "logps/chosen": -11.617069244384766, | |
| "logps/rejected": -11.611367225646973, | |
| "loss": 1.2788419723510742, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5410674214363098, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.037577953189611435, | |
| "rewards/margins": -0.04553454369306564, | |
| "rewards/rejected": 0.08311249315738678, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.012102569274602255, | |
| "grad_norm": 3.436879873275757, | |
| "learning_rate": 4.8387096774193554e-05, | |
| "logits/chosen": -0.5832479596138, | |
| "logits/rejected": -0.5832363367080688, | |
| "logps/chosen": -9.650967597961426, | |
| "logps/rejected": -11.376352310180664, | |
| "loss": 1.0634793043136597, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34024038910865784, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.05362201854586601, | |
| "rewards/margins": -0.029222950339317322, | |
| "rewards/rejected": 0.08284495770931244, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.012909407226242404, | |
| "grad_norm": 3.2199597358703613, | |
| "learning_rate": 5.161290322580645e-05, | |
| "logits/chosen": -0.6036816239356995, | |
| "logits/rejected": -0.606670618057251, | |
| "logps/chosen": -10.059551239013672, | |
| "logps/rejected": -16.143247604370117, | |
| "loss": 1.0622740983963013, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3808459937572479, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.11249684542417526, | |
| "rewards/margins": 0.040876831859350204, | |
| "rewards/rejected": 0.07162001729011536, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.013716245177882554, | |
| "grad_norm": 3.376516819000244, | |
| "learning_rate": 5.4838709677419355e-05, | |
| "logits/chosen": -0.5811513662338257, | |
| "logits/rejected": -0.5822936296463013, | |
| "logps/chosen": -10.964933395385742, | |
| "logps/rejected": -13.541594505310059, | |
| "loss": 1.1284891366958618, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43761852383613586, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.11780606210231781, | |
| "rewards/margins": 0.02046366035938263, | |
| "rewards/rejected": 0.09734240174293518, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.014523083129522704, | |
| "grad_norm": 3.292140245437622, | |
| "learning_rate": 5.8064516129032266e-05, | |
| "logits/chosen": -0.5822582840919495, | |
| "logits/rejected": -0.5867500305175781, | |
| "logps/chosen": -8.11985969543457, | |
| "logps/rejected": -14.659163475036621, | |
| "loss": 1.0471278429031372, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40266352891921997, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.14493001997470856, | |
| "rewards/margins": 0.1153046265244484, | |
| "rewards/rejected": 0.029625393450260162, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.015329921081162856, | |
| "grad_norm": 3.320802688598633, | |
| "learning_rate": 6.129032258064517e-05, | |
| "logits/chosen": -0.5760956406593323, | |
| "logits/rejected": -0.5776647925376892, | |
| "logps/chosen": -9.478979110717773, | |
| "logps/rejected": -11.301219940185547, | |
| "loss": 1.1243548393249512, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48838871717453003, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20540697872638702, | |
| "rewards/margins": 0.14464649558067322, | |
| "rewards/rejected": 0.06076047942042351, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.016136759032803004, | |
| "grad_norm": 2.7910656929016113, | |
| "learning_rate": 6.451612903225807e-05, | |
| "logits/chosen": -0.5840404033660889, | |
| "logits/rejected": -0.582589864730835, | |
| "logps/chosen": -13.635812759399414, | |
| "logps/rejected": -10.431557655334473, | |
| "loss": 1.2548669576644897, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.55869460105896, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.13213564455509186, | |
| "rewards/margins": 0.044300854206085205, | |
| "rewards/rejected": 0.08783479034900665, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.016943596984443157, | |
| "grad_norm": 2.2573604583740234, | |
| "learning_rate": 6.774193548387096e-05, | |
| "logits/chosen": -0.5839393734931946, | |
| "logits/rejected": -0.5850896835327148, | |
| "logps/chosen": -7.3839006423950195, | |
| "logps/rejected": -9.574810028076172, | |
| "loss": 0.9415242075920105, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.372197687625885, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2435840666294098, | |
| "rewards/margins": 0.30735281109809875, | |
| "rewards/rejected": -0.06376874446868896, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.017750434936083307, | |
| "grad_norm": 2.90157413482666, | |
| "learning_rate": 7.096774193548388e-05, | |
| "logits/chosen": -0.6114062070846558, | |
| "logits/rejected": -0.6119735240936279, | |
| "logps/chosen": -8.486170768737793, | |
| "logps/rejected": -12.086725234985352, | |
| "loss": 1.0081067085266113, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34981024265289307, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.10258002579212189, | |
| "rewards/margins": 0.12462681531906128, | |
| "rewards/rejected": -0.02204679138958454, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.018557272887723457, | |
| "grad_norm": 2.4457335472106934, | |
| "learning_rate": 7.419354838709677e-05, | |
| "logits/chosen": -0.5648061037063599, | |
| "logits/rejected": -0.5674125552177429, | |
| "logps/chosen": -12.962445259094238, | |
| "logps/rejected": -15.476969718933105, | |
| "loss": 1.0199884176254272, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4421077072620392, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.13948869705200195, | |
| "rewards/margins": 0.31703731417655945, | |
| "rewards/rejected": -0.17754864692687988, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.019364110839363607, | |
| "grad_norm": 2.250957489013672, | |
| "learning_rate": 7.741935483870968e-05, | |
| "logits/chosen": -0.5476934313774109, | |
| "logits/rejected": -0.5497113466262817, | |
| "logps/chosen": -6.839375972747803, | |
| "logps/rejected": -12.336576461791992, | |
| "loss": 0.9127413630485535, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3841688632965088, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2666690945625305, | |
| "rewards/margins": 0.42246347665786743, | |
| "rewards/rejected": -0.1557943969964981, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.020170948791003757, | |
| "grad_norm": 3.6742801666259766, | |
| "learning_rate": 8.064516129032258e-05, | |
| "logits/chosen": -0.5886849164962769, | |
| "logits/rejected": -0.5897050499916077, | |
| "logps/chosen": -8.534127235412598, | |
| "logps/rejected": -11.815479278564453, | |
| "loss": 1.0272297859191895, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41876962780952454, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.13335689902305603, | |
| "rewards/margins": 0.27482476830482483, | |
| "rewards/rejected": -0.1414678543806076, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005513 | |
| }, | |
| { | |
| "epoch": 0.020977786742643906, | |
| "grad_norm": 2.5902981758117676, | |
| "learning_rate": 8.387096774193549e-05, | |
| "logits/chosen": -0.5303969979286194, | |
| "logits/rejected": -0.5350589752197266, | |
| "logps/chosen": -9.592369079589844, | |
| "logps/rejected": -17.837379455566406, | |
| "loss": 0.9073010087013245, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3275393545627594, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1778128743171692, | |
| "rewards/margins": 0.31808584928512573, | |
| "rewards/rejected": -0.14027300477027893, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.021784624694284056, | |
| "grad_norm": 3.656003952026367, | |
| "learning_rate": 8.709677419354839e-05, | |
| "logits/chosen": -0.5741274356842041, | |
| "logits/rejected": -0.5759863257408142, | |
| "logps/chosen": -7.401767253875732, | |
| "logps/rejected": -9.595519065856934, | |
| "loss": 0.9837043881416321, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34733644127845764, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.16637372970581055, | |
| "rewards/margins": 0.22424587607383728, | |
| "rewards/rejected": -0.05787213519215584, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.00551 | |
| }, | |
| { | |
| "epoch": 0.022591462645924206, | |
| "grad_norm": 3.6425983905792236, | |
| "learning_rate": 9.032258064516129e-05, | |
| "logits/chosen": -0.5271302461624146, | |
| "logits/rejected": -0.5281438231468201, | |
| "logps/chosen": -10.050779342651367, | |
| "logps/rejected": -13.247575759887695, | |
| "loss": 1.0190500020980835, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4030058681964874, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.022431861609220505, | |
| "rewards/margins": 0.22834232449531555, | |
| "rewards/rejected": -0.20591047406196594, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005522 | |
| }, | |
| { | |
| "epoch": 0.02339830059756436, | |
| "grad_norm": 4.539236545562744, | |
| "learning_rate": 9.35483870967742e-05, | |
| "logits/chosen": -0.574794352054596, | |
| "logits/rejected": -0.5771020650863647, | |
| "logps/chosen": -7.9426727294921875, | |
| "logps/rejected": -11.816813468933105, | |
| "loss": 1.0435985326766968, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4821586310863495, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.17023718357086182, | |
| "rewards/margins": 0.36495453119277954, | |
| "rewards/rejected": -0.19471733272075653, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005525 | |
| }, | |
| { | |
| "epoch": 0.02420513854920451, | |
| "grad_norm": 3.463172674179077, | |
| "learning_rate": 9.677419354838711e-05, | |
| "logits/chosen": -0.5663347244262695, | |
| "logits/rejected": -0.5671164393424988, | |
| "logps/chosen": -8.761878967285156, | |
| "logps/rejected": -16.922607421875, | |
| "loss": 0.8841907978057861, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37557756900787354, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23288068175315857, | |
| "rewards/margins": 0.47043219208717346, | |
| "rewards/rejected": -0.2375514954328537, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005522 | |
| }, | |
| { | |
| "epoch": 0.02501197650084466, | |
| "grad_norm": 7.054537296295166, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.5485356450080872, | |
| "logits/rejected": -0.5510388612747192, | |
| "logps/chosen": -8.1714506149292, | |
| "logps/rejected": -15.964082717895508, | |
| "loss": 1.0905145406723022, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48109474778175354, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.14875195920467377, | |
| "rewards/margins": 0.23288127779960632, | |
| "rewards/rejected": -0.08412933349609375, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005519 | |
| }, | |
| { | |
| "epoch": 0.02581881445248481, | |
| "grad_norm": 2.8915627002716064, | |
| "learning_rate": 0.0001032258064516129, | |
| "logits/chosen": -0.5415224432945251, | |
| "logits/rejected": -0.5406837463378906, | |
| "logps/chosen": -12.312981605529785, | |
| "logps/rejected": -14.444657325744629, | |
| "loss": 0.9778124094009399, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4027611017227173, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11852823942899704, | |
| "rewards/margins": 0.3213120102882385, | |
| "rewards/rejected": -0.2027837634086609, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.02662565240412496, | |
| "grad_norm": 4.721103191375732, | |
| "learning_rate": 0.0001064516129032258, | |
| "logits/chosen": -0.5442328453063965, | |
| "logits/rejected": -0.5437616109848022, | |
| "logps/chosen": -9.491182327270508, | |
| "logps/rejected": -18.31528663635254, | |
| "loss": 1.1582751274108887, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5736849904060364, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.03584306687116623, | |
| "rewards/margins": 0.35881760716438293, | |
| "rewards/rejected": -0.3229745626449585, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.02743249035576511, | |
| "grad_norm": 4.470694065093994, | |
| "learning_rate": 0.00010967741935483871, | |
| "logits/chosen": -0.49901843070983887, | |
| "logits/rejected": -0.5027262568473816, | |
| "logps/chosen": -6.029642105102539, | |
| "logps/rejected": -17.065149307250977, | |
| "loss": 0.7831717133522034, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2735077142715454, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.172469824552536, | |
| "rewards/margins": 0.6490951180458069, | |
| "rewards/rejected": -0.4766252934932709, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005511 | |
| }, | |
| { | |
| "epoch": 0.02823932830740526, | |
| "grad_norm": 4.086674690246582, | |
| "learning_rate": 0.00011290322580645163, | |
| "logits/chosen": -0.5251173377037048, | |
| "logits/rejected": -0.5295683145523071, | |
| "logps/chosen": -10.127384185791016, | |
| "logps/rejected": -19.261646270751953, | |
| "loss": 0.90782630443573, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37643295526504517, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.059490665793418884, | |
| "rewards/margins": 0.5788955688476562, | |
| "rewards/rejected": -0.5194048881530762, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005516 | |
| }, | |
| { | |
| "epoch": 0.02904616625904541, | |
| "grad_norm": 3.153599977493286, | |
| "learning_rate": 0.00011612903225806453, | |
| "logits/chosen": -0.5580551624298096, | |
| "logits/rejected": -0.561299741268158, | |
| "logps/chosen": -7.748661518096924, | |
| "logps/rejected": -18.775835037231445, | |
| "loss": 0.8323644995689392, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30874526500701904, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.17774799466133118, | |
| "rewards/margins": 0.58444744348526, | |
| "rewards/rejected": -0.4066994786262512, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005518 | |
| }, | |
| { | |
| "epoch": 0.02985300421068556, | |
| "grad_norm": 5.963130950927734, | |
| "learning_rate": 0.00011935483870967743, | |
| "logits/chosen": -0.5691896080970764, | |
| "logits/rejected": -0.5704917907714844, | |
| "logps/chosen": -5.695924282073975, | |
| "logps/rejected": -15.709531784057617, | |
| "loss": 0.8581907153129578, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32061102986335754, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.13813850283622742, | |
| "rewards/margins": 0.42923206090927124, | |
| "rewards/rejected": -0.2910935878753662, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005516 | |
| }, | |
| { | |
| "epoch": 0.03065984216232571, | |
| "grad_norm": 3.532068967819214, | |
| "learning_rate": 0.00012258064516129034, | |
| "logits/chosen": -0.5251184105873108, | |
| "logits/rejected": -0.5261702537536621, | |
| "logps/chosen": -8.303949356079102, | |
| "logps/rejected": -13.649654388427734, | |
| "loss": 0.9825394153594971, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39365747570991516, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.07552488148212433, | |
| "rewards/margins": 0.2995148003101349, | |
| "rewards/rejected": -0.22398996353149414, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.03146668011396586, | |
| "grad_norm": 2.9115569591522217, | |
| "learning_rate": 0.00012580645161290322, | |
| "logits/chosen": -0.5716837048530579, | |
| "logits/rejected": -0.5749698281288147, | |
| "logps/chosen": -7.206816673278809, | |
| "logps/rejected": -15.77934741973877, | |
| "loss": 0.7430101633071899, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27266308665275574, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.20229285955429077, | |
| "rewards/margins": 0.6254266500473022, | |
| "rewards/rejected": -0.42313385009765625, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.03227351806560601, | |
| "grad_norm": 4.647506237030029, | |
| "learning_rate": 0.00012903225806451613, | |
| "logits/chosen": -0.5296156406402588, | |
| "logits/rejected": -0.5295798778533936, | |
| "logps/chosen": -10.529404640197754, | |
| "logps/rejected": -16.44548988342285, | |
| "loss": 0.900071918964386, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3727172613143921, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08702702820301056, | |
| "rewards/margins": 0.4926542341709137, | |
| "rewards/rejected": -0.40562722086906433, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005514 | |
| }, | |
| { | |
| "epoch": 0.03308035601724616, | |
| "grad_norm": 3.4815561771392822, | |
| "learning_rate": 0.00013225806451612905, | |
| "logits/chosen": -0.5586342811584473, | |
| "logits/rejected": -0.5603877305984497, | |
| "logps/chosen": -7.803877830505371, | |
| "logps/rejected": -18.412734985351562, | |
| "loss": 0.8854644298553467, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37826117873191833, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.08443664014339447, | |
| "rewards/margins": 0.6363339424133301, | |
| "rewards/rejected": -0.5518972873687744, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005514 | |
| }, | |
| { | |
| "epoch": 0.033887193968886314, | |
| "grad_norm": 3.6079483032226562, | |
| "learning_rate": 0.00013548387096774193, | |
| "logits/chosen": -0.5233692526817322, | |
| "logits/rejected": -0.5257354378700256, | |
| "logps/chosen": -11.989986419677734, | |
| "logps/rejected": -17.48329734802246, | |
| "loss": 0.9667509198188782, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4528670608997345, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14738641679286957, | |
| "rewards/margins": 0.5997685194015503, | |
| "rewards/rejected": -0.4523821473121643, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005512 | |
| }, | |
| { | |
| "epoch": 0.03469403192052646, | |
| "grad_norm": 5.491096019744873, | |
| "learning_rate": 0.00013870967741935487, | |
| "logits/chosen": -0.5798231363296509, | |
| "logits/rejected": -0.5843824148178101, | |
| "logps/chosen": -8.180625915527344, | |
| "logps/rejected": -19.614505767822266, | |
| "loss": 1.0811830759048462, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5651165246963501, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.018763888627290726, | |
| "rewards/margins": 0.5782932043075562, | |
| "rewards/rejected": -0.5595293641090393, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.035500869872166614, | |
| "grad_norm": 5.715328216552734, | |
| "learning_rate": 0.00014193548387096775, | |
| "logits/chosen": -0.5562050342559814, | |
| "logits/rejected": -0.5585284233093262, | |
| "logps/chosen": -9.799619674682617, | |
| "logps/rejected": -13.962825775146484, | |
| "loss": 1.046175479888916, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5247361660003662, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0660993829369545, | |
| "rewards/margins": 0.557608425617218, | |
| "rewards/rejected": -0.4915090799331665, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.03630770782380676, | |
| "grad_norm": 4.065413951873779, | |
| "learning_rate": 0.00014516129032258066, | |
| "logits/chosen": -0.5717958807945251, | |
| "logits/rejected": -0.5754877924919128, | |
| "logps/chosen": -10.432125091552734, | |
| "logps/rejected": -17.75714111328125, | |
| "loss": 0.9775079488754272, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4804929792881012, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.16446207463741302, | |
| "rewards/margins": 0.5844215154647827, | |
| "rewards/rejected": -0.4199594557285309, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005513 | |
| }, | |
| { | |
| "epoch": 0.037114545775446914, | |
| "grad_norm": 4.507160663604736, | |
| "learning_rate": 0.00014838709677419355, | |
| "logits/chosen": -0.5544827580451965, | |
| "logits/rejected": -0.5517963171005249, | |
| "logps/chosen": -10.039278030395508, | |
| "logps/rejected": -16.44822120666504, | |
| "loss": 0.9198786020278931, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3649781346321106, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11493994295597076, | |
| "rewards/margins": 0.5548471808433533, | |
| "rewards/rejected": -0.4399072825908661, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005512 | |
| }, | |
| { | |
| "epoch": 0.03792138372708706, | |
| "grad_norm": 4.040234565734863, | |
| "learning_rate": 0.00015161290322580646, | |
| "logits/chosen": -0.5704259276390076, | |
| "logits/rejected": -0.5716680884361267, | |
| "logps/chosen": -7.400537967681885, | |
| "logps/rejected": -17.6054744720459, | |
| "loss": 0.9134971499443054, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3412809669971466, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.03388240188360214, | |
| "rewards/margins": 0.4440326392650604, | |
| "rewards/rejected": -0.4101502001285553, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005512 | |
| }, | |
| { | |
| "epoch": 0.038728221678727213, | |
| "grad_norm": 2.9642419815063477, | |
| "learning_rate": 0.00015483870967741937, | |
| "logits/chosen": -0.5867742300033569, | |
| "logits/rejected": -0.5912387371063232, | |
| "logps/chosen": -9.146940231323242, | |
| "logps/rejected": -16.374706268310547, | |
| "loss": 0.9059248566627502, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3897300958633423, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1047089472413063, | |
| "rewards/margins": 0.5065208673477173, | |
| "rewards/rejected": -0.4018118679523468, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005514 | |
| }, | |
| { | |
| "epoch": 0.03953505963036737, | |
| "grad_norm": 3.087217330932617, | |
| "learning_rate": 0.00015806451612903225, | |
| "logits/chosen": -0.5874481201171875, | |
| "logits/rejected": -0.5872229337692261, | |
| "logps/chosen": -6.086337566375732, | |
| "logps/rejected": -10.504037857055664, | |
| "loss": 0.8798851370811462, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33263421058654785, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20601165294647217, | |
| "rewards/margins": 0.4658709466457367, | |
| "rewards/rejected": -0.2598593533039093, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005513 | |
| }, | |
| { | |
| "epoch": 0.04034189758200751, | |
| "grad_norm": 3.16754150390625, | |
| "learning_rate": 0.00016129032258064516, | |
| "logits/chosen": -0.5708128809928894, | |
| "logits/rejected": -0.5798742175102234, | |
| "logps/chosen": -6.393083572387695, | |
| "logps/rejected": -19.668724060058594, | |
| "loss": 0.8404853343963623, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34996694326400757, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.21206828951835632, | |
| "rewards/margins": 0.5756057500839233, | |
| "rewards/rejected": -0.363537460565567, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.005516 | |
| }, | |
| { | |
| "epoch": 0.041148735533647667, | |
| "grad_norm": 2.4009766578674316, | |
| "learning_rate": 0.00016451612903225807, | |
| "logits/chosen": -0.5599406361579895, | |
| "logits/rejected": -0.5625043511390686, | |
| "logps/chosen": -7.262391090393066, | |
| "logps/rejected": -15.73720932006836, | |
| "loss": 0.8113247752189636, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28076890110969543, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14269490540027618, | |
| "rewards/margins": 0.47564250230789185, | |
| "rewards/rejected": -0.33294758200645447, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.04195557348528781, | |
| "grad_norm": 3.129634380340576, | |
| "learning_rate": 0.00016774193548387098, | |
| "logits/chosen": -0.5937235355377197, | |
| "logits/rejected": -0.5938248038291931, | |
| "logps/chosen": -5.393199920654297, | |
| "logps/rejected": -15.786672592163086, | |
| "loss": 0.7831435799598694, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2872075140476227, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19873687624931335, | |
| "rewards/margins": 0.5569283366203308, | |
| "rewards/rejected": -0.35819149017333984, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.042762411436927966, | |
| "grad_norm": 3.2887256145477295, | |
| "learning_rate": 0.0001709677419354839, | |
| "logits/chosen": -0.5820189118385315, | |
| "logits/rejected": -0.5850119590759277, | |
| "logps/chosen": -7.764882564544678, | |
| "logps/rejected": -16.894685745239258, | |
| "loss": 0.8994213342666626, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3770924210548401, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20706558227539062, | |
| "rewards/margins": 0.5472366213798523, | |
| "rewards/rejected": -0.34017103910446167, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.04356924938856811, | |
| "grad_norm": 3.7313735485076904, | |
| "learning_rate": 0.00017419354838709678, | |
| "logits/chosen": -0.5833962559700012, | |
| "logits/rejected": -0.5876143574714661, | |
| "logps/chosen": -8.130949020385742, | |
| "logps/rejected": -20.79953384399414, | |
| "loss": 0.9545141458511353, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4539381265640259, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.10515612363815308, | |
| "rewards/margins": 0.612572968006134, | |
| "rewards/rejected": -0.5074167847633362, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.044376087340208266, | |
| "grad_norm": 5.652868747711182, | |
| "learning_rate": 0.0001774193548387097, | |
| "logits/chosen": -0.5960416793823242, | |
| "logits/rejected": -0.5957224369049072, | |
| "logps/chosen": -12.674562454223633, | |
| "logps/rejected": -15.591826438903809, | |
| "loss": 1.1736092567443848, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5310375690460205, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.11839848756790161, | |
| "rewards/margins": 0.40016603469848633, | |
| "rewards/rejected": -0.5185645222663879, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.04518292529184841, | |
| "grad_norm": 4.002370834350586, | |
| "learning_rate": 0.00018064516129032257, | |
| "logits/chosen": -0.5776931643486023, | |
| "logits/rejected": -0.5789185166358948, | |
| "logps/chosen": -12.67449951171875, | |
| "logps/rejected": -16.919376373291016, | |
| "loss": 1.087173342704773, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4873568117618561, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.15739397704601288, | |
| "rewards/margins": 0.39120250940322876, | |
| "rewards/rejected": -0.5485965013504028, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.045989763243488566, | |
| "grad_norm": 3.5529890060424805, | |
| "learning_rate": 0.00018387096774193548, | |
| "logits/chosen": -0.5732367634773254, | |
| "logits/rejected": -0.5760124921798706, | |
| "logps/chosen": -4.22891902923584, | |
| "logps/rejected": -18.773733139038086, | |
| "loss": 0.6395769119262695, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.23632453382015228, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12576641142368317, | |
| "rewards/margins": 0.908116340637207, | |
| "rewards/rejected": -0.7823498845100403, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.04679660119512872, | |
| "grad_norm": 2.638253927230835, | |
| "learning_rate": 0.0001870967741935484, | |
| "logits/chosen": -0.5618959069252014, | |
| "logits/rejected": -0.5671476721763611, | |
| "logps/chosen": -8.717156410217285, | |
| "logps/rejected": -22.3723087310791, | |
| "loss": 0.8119103312492371, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4192086458206177, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18826748430728912, | |
| "rewards/margins": 0.8515651226043701, | |
| "rewards/rejected": -0.6632976531982422, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.047603439146768865, | |
| "grad_norm": 4.416356086730957, | |
| "learning_rate": 0.0001903225806451613, | |
| "logits/chosen": -0.5946109294891357, | |
| "logits/rejected": -0.5949057340621948, | |
| "logps/chosen": -10.825102806091309, | |
| "logps/rejected": -15.580466270446777, | |
| "loss": 0.9124961495399475, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43738603591918945, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1081230640411377, | |
| "rewards/margins": 0.6975550651550293, | |
| "rewards/rejected": -0.5894321203231812, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.04841027709840902, | |
| "grad_norm": 3.548480272293091, | |
| "learning_rate": 0.00019354838709677422, | |
| "logits/chosen": -0.576353907585144, | |
| "logits/rejected": -0.5807583928108215, | |
| "logps/chosen": -10.603282928466797, | |
| "logps/rejected": -20.904390335083008, | |
| "loss": 1.033903956413269, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5458623170852661, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.10141083598136902, | |
| "rewards/margins": 0.9133819341659546, | |
| "rewards/rejected": -0.8119711875915527, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.049217115050049165, | |
| "grad_norm": 4.239978790283203, | |
| "learning_rate": 0.0001967741935483871, | |
| "logits/chosen": -0.6159774661064148, | |
| "logits/rejected": -0.6157845258712769, | |
| "logps/chosen": -13.034204483032227, | |
| "logps/rejected": -21.466520309448242, | |
| "loss": 0.9954748153686523, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5168237090110779, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.15371613204479218, | |
| "rewards/margins": 0.9087806940078735, | |
| "rewards/rejected": -1.0624967813491821, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.05002395300168932, | |
| "grad_norm": 4.418153285980225, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.586484968662262, | |
| "logits/rejected": -0.5885915756225586, | |
| "logps/chosen": -6.359810829162598, | |
| "logps/rejected": -18.686431884765625, | |
| "loss": 0.7993831634521484, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3223803639411926, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1565569043159485, | |
| "rewards/margins": 0.8297788500785828, | |
| "rewards/rejected": -0.6732219457626343, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.050830790953329465, | |
| "grad_norm": 3.898704767227173, | |
| "learning_rate": 0.00019999964378142156, | |
| "logits/chosen": -0.5732013583183289, | |
| "logits/rejected": -0.5774887800216675, | |
| "logps/chosen": -12.98630142211914, | |
| "logps/rejected": -19.34124755859375, | |
| "loss": 0.9075384140014648, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39192017912864685, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.19289077818393707, | |
| "rewards/margins": 0.6732712388038635, | |
| "rewards/rejected": -0.48038047552108765, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.05163762890496962, | |
| "grad_norm": 6.278528213500977, | |
| "learning_rate": 0.00019999857512822402, | |
| "logits/chosen": -0.6075332760810852, | |
| "logits/rejected": -0.6084203124046326, | |
| "logps/chosen": -14.246075630187988, | |
| "logps/rejected": -20.948959350585938, | |
| "loss": 1.0685752630233765, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5815572142601013, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.03303433582186699, | |
| "rewards/margins": 0.8266364336013794, | |
| "rewards/rejected": -0.8596707582473755, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.052444466856609764, | |
| "grad_norm": 4.589393615722656, | |
| "learning_rate": 0.00019999679404802089, | |
| "logits/chosen": -0.596097469329834, | |
| "logits/rejected": -0.5986034870147705, | |
| "logps/chosen": -8.450502395629883, | |
| "logps/rejected": -21.070066452026367, | |
| "loss": 0.7867013812065125, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31530463695526123, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13920006155967712, | |
| "rewards/margins": 0.9423296451568604, | |
| "rewards/rejected": -0.8031294941902161, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.05325130480824992, | |
| "grad_norm": 4.376217365264893, | |
| "learning_rate": 0.00019999430055350122, | |
| "logits/chosen": -0.5758836269378662, | |
| "logits/rejected": -0.5734565854072571, | |
| "logps/chosen": -10.774827003479004, | |
| "logps/rejected": -19.021907806396484, | |
| "loss": 0.7909982800483704, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3997192680835724, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23606787621974945, | |
| "rewards/margins": 1.0521141290664673, | |
| "rewards/rejected": -0.8160461783409119, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.05405814275989007, | |
| "grad_norm": 6.438971042633057, | |
| "learning_rate": 0.00019999109466242962, | |
| "logits/chosen": -0.5718088150024414, | |
| "logits/rejected": -0.5745964050292969, | |
| "logps/chosen": -6.671931266784668, | |
| "logps/rejected": -20.429231643676758, | |
| "loss": 0.8954067230224609, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45071539282798767, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10935470461845398, | |
| "rewards/margins": 0.8583554029464722, | |
| "rewards/rejected": -0.7490006685256958, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.05486498071153022, | |
| "grad_norm": 11.16286849975586, | |
| "learning_rate": 0.00019998717639764602, | |
| "logits/chosen": -0.5820534229278564, | |
| "logits/rejected": -0.5849663019180298, | |
| "logps/chosen": -9.799468040466309, | |
| "logps/rejected": -18.977890014648438, | |
| "loss": 1.29269278049469, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7049438953399658, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.04825415089726448, | |
| "rewards/margins": 0.5465254783630371, | |
| "rewards/rejected": -0.5947796702384949, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.05567181866317037, | |
| "grad_norm": 9.413622856140137, | |
| "learning_rate": 0.00019998254578706563, | |
| "logits/chosen": -0.5850585699081421, | |
| "logits/rejected": -0.5874402523040771, | |
| "logps/chosen": -8.903966903686523, | |
| "logps/rejected": -14.843938827514648, | |
| "loss": 1.3027069568634033, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.744307279586792, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0512365885078907, | |
| "rewards/margins": 0.5854336619377136, | |
| "rewards/rejected": -0.6366702318191528, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.05647865661481052, | |
| "grad_norm": 7.333382606506348, | |
| "learning_rate": 0.00019997720286367863, | |
| "logits/chosen": -0.545200765132904, | |
| "logits/rejected": -0.5484716296195984, | |
| "logps/chosen": -7.334113121032715, | |
| "logps/rejected": -22.56316375732422, | |
| "loss": 1.0189334154129028, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5383400321006775, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.061847541481256485, | |
| "rewards/margins": 0.6559779644012451, | |
| "rewards/rejected": -0.5941305160522461, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.05728549456645067, | |
| "grad_norm": 2.8849799633026123, | |
| "learning_rate": 0.00019997114766554997, | |
| "logits/chosen": -0.5629354119300842, | |
| "logits/rejected": -0.5669021606445312, | |
| "logps/chosen": -8.698752403259277, | |
| "logps/rejected": -21.85867691040039, | |
| "loss": 0.8375651836395264, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3549819886684418, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.09854352474212646, | |
| "rewards/margins": 0.7027413845062256, | |
| "rewards/rejected": -0.6041979193687439, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.05809233251809082, | |
| "grad_norm": 2.6733391284942627, | |
| "learning_rate": 0.00019996438023581913, | |
| "logits/chosen": -0.5319232940673828, | |
| "logits/rejected": -0.5331096649169922, | |
| "logps/chosen": -10.13166332244873, | |
| "logps/rejected": -13.18635368347168, | |
| "loss": 1.014970302581787, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4217461347579956, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.14793364703655243, | |
| "rewards/margins": 0.3788456618785858, | |
| "rewards/rejected": -0.2309119999408722, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.05889917046973097, | |
| "grad_norm": 2.497257947921753, | |
| "learning_rate": 0.00019995690062269984, | |
| "logits/chosen": -0.5789859294891357, | |
| "logits/rejected": -0.5805359482765198, | |
| "logps/chosen": -8.139568328857422, | |
| "logps/rejected": -10.85029411315918, | |
| "loss": 0.9546566605567932, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4216194450855255, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.24104151129722595, | |
| "rewards/margins": 0.5254760980606079, | |
| "rewards/rejected": -0.28443461656570435, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.05970600842137112, | |
| "grad_norm": 2.8535268306732178, | |
| "learning_rate": 0.00019994870887947962, | |
| "logits/chosen": -0.5778383612632751, | |
| "logits/rejected": -0.5768096446990967, | |
| "logps/chosen": -8.49053955078125, | |
| "logps/rejected": -12.854878425598145, | |
| "loss": 1.0000758171081543, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37848562002182007, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1054978221654892, | |
| "rewards/margins": 0.3462926149368286, | |
| "rewards/rejected": -0.24079479277133942, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.06051284637301127, | |
| "grad_norm": 2.198607921600342, | |
| "learning_rate": 0.00019993980506451947, | |
| "logits/chosen": -0.530400276184082, | |
| "logits/rejected": -0.530858039855957, | |
| "logps/chosen": -9.152666091918945, | |
| "logps/rejected": -11.464343070983887, | |
| "loss": 0.9745745658874512, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38881367444992065, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1783803254365921, | |
| "rewards/margins": 0.3315035402774811, | |
| "rewards/rejected": -0.1531231850385666, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.06131968432465142, | |
| "grad_norm": 2.461601972579956, | |
| "learning_rate": 0.0001999301892412535, | |
| "logits/chosen": -0.5405219197273254, | |
| "logits/rejected": -0.5390282869338989, | |
| "logps/chosen": -10.537997245788574, | |
| "logps/rejected": -15.066913604736328, | |
| "loss": 0.966386079788208, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38977545499801636, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.09291838109493256, | |
| "rewards/margins": 0.3533533811569214, | |
| "rewards/rejected": -0.26043495535850525, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06212652227629157, | |
| "grad_norm": 2.0999796390533447, | |
| "learning_rate": 0.00019991986147818838, | |
| "logits/chosen": -0.5443933010101318, | |
| "logits/rejected": -0.5435047149658203, | |
| "logps/chosen": -12.143755912780762, | |
| "logps/rejected": -15.766691207885742, | |
| "loss": 0.8939065337181091, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.415660560131073, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23248028755187988, | |
| "rewards/margins": 0.5352811217308044, | |
| "rewards/rejected": -0.30280083417892456, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.06293336022793172, | |
| "grad_norm": 2.9244306087493896, | |
| "learning_rate": 0.00019990882184890295, | |
| "logits/chosen": -0.5794655680656433, | |
| "logits/rejected": -0.5853484869003296, | |
| "logps/chosen": -7.884565353393555, | |
| "logps/rejected": -20.136926651000977, | |
| "loss": 0.8564450740814209, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34705159068107605, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.14532405138015747, | |
| "rewards/margins": 0.5069437623023987, | |
| "rewards/rejected": -0.3616198003292084, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.06374019817957187, | |
| "grad_norm": 3.461670160293579, | |
| "learning_rate": 0.00019989707043204763, | |
| "logits/chosen": -0.5491142868995667, | |
| "logits/rejected": -0.553898811340332, | |
| "logps/chosen": -7.547114372253418, | |
| "logps/rejected": -18.740121841430664, | |
| "loss": 0.9405392408370972, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48508715629577637, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.128400981426239, | |
| "rewards/margins": 0.6999501585960388, | |
| "rewards/rejected": -0.5715491771697998, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.06454703613121202, | |
| "grad_norm": 4.165892601013184, | |
| "learning_rate": 0.0001998846073113439, | |
| "logits/chosen": -0.6084208488464355, | |
| "logits/rejected": -0.6092680096626282, | |
| "logps/chosen": -12.750446319580078, | |
| "logps/rejected": -19.53608512878418, | |
| "loss": 1.0978946685791016, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5877176523208618, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1369042694568634, | |
| "rewards/margins": 0.6248282194137573, | |
| "rewards/rejected": -0.48792392015457153, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06535387408285218, | |
| "grad_norm": 2.287846565246582, | |
| "learning_rate": 0.00019987143257558365, | |
| "logits/chosen": -0.59499192237854, | |
| "logits/rejected": -0.5972949862480164, | |
| "logps/chosen": -4.519835948944092, | |
| "logps/rejected": -19.02901840209961, | |
| "loss": 0.58124840259552, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.15051494538784027, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19695766270160675, | |
| "rewards/margins": 0.9730147123336792, | |
| "rewards/rejected": -0.7760570049285889, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.06616071203449232, | |
| "grad_norm": 7.103982448577881, | |
| "learning_rate": 0.00019985754631862855, | |
| "logits/chosen": -0.5857492089271545, | |
| "logits/rejected": -0.5895102024078369, | |
| "logps/chosen": -8.903070449829102, | |
| "logps/rejected": -26.571044921875, | |
| "loss": 0.7599916458129883, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3342111110687256, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14196240901947021, | |
| "rewards/margins": 0.8281382322311401, | |
| "rewards/rejected": -0.6861758232116699, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.06696754998613247, | |
| "grad_norm": 3.764488697052002, | |
| "learning_rate": 0.00019984294863940955, | |
| "logits/chosen": -0.6067830324172974, | |
| "logits/rejected": -0.6086009740829468, | |
| "logps/chosen": -9.9881591796875, | |
| "logps/rejected": -19.09541893005371, | |
| "loss": 0.9752427339553833, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5045859217643738, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.14939813315868378, | |
| "rewards/margins": 0.8939868211746216, | |
| "rewards/rejected": -0.7445887327194214, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06777438793777263, | |
| "grad_norm": 3.3293344974517822, | |
| "learning_rate": 0.00019982763964192585, | |
| "logits/chosen": -0.6330868601799011, | |
| "logits/rejected": -0.6393448710441589, | |
| "logps/chosen": -4.902453899383545, | |
| "logps/rejected": -24.94113540649414, | |
| "loss": 0.7244248390197754, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3735058009624481, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17604736983776093, | |
| "rewards/margins": 1.2982165813446045, | |
| "rewards/rejected": -1.1221693754196167, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06858122588941278, | |
| "grad_norm": 5.892284393310547, | |
| "learning_rate": 0.00019981161943524443, | |
| "logits/chosen": -0.6240598559379578, | |
| "logits/rejected": -0.620481550693512, | |
| "logps/chosen": -14.60393238067627, | |
| "logps/rejected": -13.365829467773438, | |
| "loss": 1.1541650295257568, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48222166299819946, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.09302416443824768, | |
| "rewards/margins": 0.41544342041015625, | |
| "rewards/rejected": -0.5084675550460815, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.0055 | |
| }, | |
| { | |
| "epoch": 0.06938806384105292, | |
| "grad_norm": 4.056751251220703, | |
| "learning_rate": 0.00019979488813349933, | |
| "logits/chosen": -0.6613398194313049, | |
| "logits/rejected": -0.6640070080757141, | |
| "logps/chosen": -9.50975227355957, | |
| "logps/rejected": -21.119707107543945, | |
| "loss": 0.8987840414047241, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.52927565574646, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1999521553516388, | |
| "rewards/margins": 1.1560636758804321, | |
| "rewards/rejected": -0.956111490726471, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.07019490179269307, | |
| "grad_norm": 4.351650238037109, | |
| "learning_rate": 0.0001997774458558904, | |
| "logits/chosen": -0.6547818779945374, | |
| "logits/rejected": -0.6571143269538879, | |
| "logps/chosen": -8.668737411499023, | |
| "logps/rejected": -20.79534149169922, | |
| "loss": 0.9775034785270691, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4770965874195099, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.02099284902215004, | |
| "rewards/margins": 0.8633284568786621, | |
| "rewards/rejected": -0.84233558177948, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.07100173974433323, | |
| "grad_norm": 2.8774800300598145, | |
| "learning_rate": 0.00019975929272668296, | |
| "logits/chosen": -0.6759516000747681, | |
| "logits/rejected": -0.6824960708618164, | |
| "logps/chosen": -4.7266716957092285, | |
| "logps/rejected": -26.10918426513672, | |
| "loss": 0.5549903512001038, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.271104097366333, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25939324498176575, | |
| "rewards/margins": 1.6003111600875854, | |
| "rewards/rejected": -1.340917944908142, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.07180857769597337, | |
| "grad_norm": 2.8334577083587646, | |
| "learning_rate": 0.00019974042887520668, | |
| "logits/chosen": -0.6535760164260864, | |
| "logits/rejected": -0.6572569608688354, | |
| "logps/chosen": -13.957544326782227, | |
| "logps/rejected": -18.16533851623535, | |
| "loss": 0.9486314654350281, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5478147268295288, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2579638957977295, | |
| "rewards/margins": 0.9477146863937378, | |
| "rewards/rejected": -0.6897507905960083, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.07261541564761352, | |
| "grad_norm": 5.422155380249023, | |
| "learning_rate": 0.00019972085443585463, | |
| "logits/chosen": -0.6767461895942688, | |
| "logits/rejected": -0.6799700260162354, | |
| "logps/chosen": -7.507997512817383, | |
| "logps/rejected": -20.19240951538086, | |
| "loss": 0.8118898868560791, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4057508111000061, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11586537212133408, | |
| "rewards/margins": 1.0757473707199097, | |
| "rewards/rejected": -0.9598820805549622, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.07342225359925368, | |
| "grad_norm": 5.541498184204102, | |
| "learning_rate": 0.0001997005695480824, | |
| "logits/chosen": -0.6398351788520813, | |
| "logits/rejected": -0.642162024974823, | |
| "logps/chosen": -10.117485046386719, | |
| "logps/rejected": -21.747928619384766, | |
| "loss": 0.8823437094688416, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.47223997116088867, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.04489222913980484, | |
| "rewards/margins": 1.1613836288452148, | |
| "rewards/rejected": -1.2062758207321167, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.07422909155089383, | |
| "grad_norm": 2.0107967853546143, | |
| "learning_rate": 0.000199679574356407, | |
| "logits/chosen": -0.6938130855560303, | |
| "logits/rejected": -0.7009856104850769, | |
| "logps/chosen": -6.915675163269043, | |
| "logps/rejected": -28.84608268737793, | |
| "loss": 0.5776476860046387, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3677330017089844, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3187498152256012, | |
| "rewards/margins": 1.8727707862854004, | |
| "rewards/rejected": -1.554020881652832, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07503592950253397, | |
| "grad_norm": 3.5870676040649414, | |
| "learning_rate": 0.0001996578690104061, | |
| "logits/chosen": -0.673453688621521, | |
| "logits/rejected": -0.676167905330658, | |
| "logps/chosen": -10.7222318649292, | |
| "logps/rejected": -28.77056884765625, | |
| "loss": 0.950826108455658, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5682229399681091, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09744307398796082, | |
| "rewards/margins": 1.4789444208145142, | |
| "rewards/rejected": -1.381501317024231, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07584276745417412, | |
| "grad_norm": 4.2534661293029785, | |
| "learning_rate": 0.00019963545366471653, | |
| "logits/chosen": -0.6709739565849304, | |
| "logits/rejected": -0.6747978925704956, | |
| "logps/chosen": -8.219854354858398, | |
| "logps/rejected": -29.13772201538086, | |
| "loss": 0.6954976320266724, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35414204001426697, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10512235760688782, | |
| "rewards/margins": 1.6458101272583008, | |
| "rewards/rejected": -1.5406877994537354, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.07664960540581428, | |
| "grad_norm": 7.663514614105225, | |
| "learning_rate": 0.0001996123284790336, | |
| "logits/chosen": -0.6834441423416138, | |
| "logits/rejected": -0.6848198771476746, | |
| "logps/chosen": -17.666513442993164, | |
| "logps/rejected": -19.222387313842773, | |
| "loss": 1.197723388671875, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6848238110542297, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.06468406319618225, | |
| "rewards/margins": 0.8658308982849121, | |
| "rewards/rejected": -0.9305148720741272, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07745644335745443, | |
| "grad_norm": 16.187767028808594, | |
| "learning_rate": 0.0001995884936181097, | |
| "logits/chosen": -0.7171504497528076, | |
| "logits/rejected": -0.7210450172424316, | |
| "logps/chosen": -4.8772172927856445, | |
| "logps/rejected": -27.164329528808594, | |
| "loss": 0.7958053946495056, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.437197208404541, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04156189411878586, | |
| "rewards/margins": 1.4321556091308594, | |
| "rewards/rejected": -1.3905936479568481, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07826328130909457, | |
| "grad_norm": 4.373692989349365, | |
| "learning_rate": 0.00019956394925175328, | |
| "logits/chosen": -0.720712423324585, | |
| "logits/rejected": -0.7263769507408142, | |
| "logps/chosen": -8.969646453857422, | |
| "logps/rejected": -27.35487174987793, | |
| "loss": 0.8684384822845459, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4593147337436676, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.039580605924129486, | |
| "rewards/margins": 1.404889702796936, | |
| "rewards/rejected": -1.3653091192245483, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07907011926073473, | |
| "grad_norm": 3.1712353229522705, | |
| "learning_rate": 0.00019953869555482752, | |
| "logits/chosen": -0.6926038265228271, | |
| "logits/rejected": -0.6906510591506958, | |
| "logps/chosen": -10.361411094665527, | |
| "logps/rejected": -19.763336181640625, | |
| "loss": 1.0741034746170044, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5404018759727478, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0025314167141914368, | |
| "rewards/margins": 0.9160726070404053, | |
| "rewards/rejected": -0.9135411381721497, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07987695721237488, | |
| "grad_norm": 5.8308796882629395, | |
| "learning_rate": 0.00019951273270724906, | |
| "logits/chosen": -0.6417246460914612, | |
| "logits/rejected": -0.6460192203521729, | |
| "logps/chosen": -10.923144340515137, | |
| "logps/rejected": -23.332698822021484, | |
| "loss": 1.129643201828003, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5929185748100281, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.004452264867722988, | |
| "rewards/margins": 0.6838414669036865, | |
| "rewards/rejected": -0.6882937550544739, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.08068379516401503, | |
| "grad_norm": 4.135215759277344, | |
| "learning_rate": 0.00019948606089398698, | |
| "logits/chosen": -0.6685535907745361, | |
| "logits/rejected": -0.6693455576896667, | |
| "logps/chosen": -11.88547134399414, | |
| "logps/rejected": -19.97165298461914, | |
| "loss": 0.9190454483032227, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39345046877861023, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.05392542481422424, | |
| "rewards/margins": 0.8620406985282898, | |
| "rewards/rejected": -0.8081153035163879, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.08149063311565517, | |
| "grad_norm": 3.957230806350708, | |
| "learning_rate": 0.0001994586803050611, | |
| "logits/chosen": -0.6953858137130737, | |
| "logits/rejected": -0.6939084529876709, | |
| "logps/chosen": -11.101150512695312, | |
| "logps/rejected": -19.7403621673584, | |
| "loss": 1.0100737810134888, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45983725786209106, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.061330053955316544, | |
| "rewards/margins": 0.847295880317688, | |
| "rewards/rejected": -0.7859657406806946, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08229747106729533, | |
| "grad_norm": 2.8322761058807373, | |
| "learning_rate": 0.00019943059113554097, | |
| "logits/chosen": -0.6899937987327576, | |
| "logits/rejected": -0.6942430734634399, | |
| "logps/chosen": -8.74088191986084, | |
| "logps/rejected": -20.522974014282227, | |
| "loss": 0.8782400488853455, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3525587320327759, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05973733961582184, | |
| "rewards/margins": 0.882931113243103, | |
| "rewards/rejected": -0.8231937289237976, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08310430901893548, | |
| "grad_norm": 2.8728346824645996, | |
| "learning_rate": 0.00019940179358554424, | |
| "logits/chosen": -0.6615633964538574, | |
| "logits/rejected": -0.6650048494338989, | |
| "logps/chosen": -8.035341262817383, | |
| "logps/rejected": -13.233177185058594, | |
| "loss": 0.95281982421875, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39267757534980774, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.12954209744930267, | |
| "rewards/margins": 0.4833866357803345, | |
| "rewards/rejected": -0.3538445234298706, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.08391114697057563, | |
| "grad_norm": 2.8015527725219727, | |
| "learning_rate": 0.00019937228786023542, | |
| "logits/chosen": -0.6321871280670166, | |
| "logits/rejected": -0.6367396116256714, | |
| "logps/chosen": -9.781261444091797, | |
| "logps/rejected": -18.408084869384766, | |
| "loss": 0.9027690887451172, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4244646430015564, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18980520963668823, | |
| "rewards/margins": 0.7434633374214172, | |
| "rewards/rejected": -0.5536580681800842, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08471798492221577, | |
| "grad_norm": 3.581929922103882, | |
| "learning_rate": 0.00019934207416982415, | |
| "logits/chosen": -0.6718648076057434, | |
| "logits/rejected": -0.6737468242645264, | |
| "logps/chosen": -10.535398483276367, | |
| "logps/rejected": -15.517889022827148, | |
| "loss": 0.9467408657073975, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4431319832801819, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.24101108312606812, | |
| "rewards/margins": 0.5848699808120728, | |
| "rewards/rejected": -0.34385889768600464, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.08552482287385593, | |
| "grad_norm": 2.7180511951446533, | |
| "learning_rate": 0.00019931115272956405, | |
| "logits/chosen": -0.6360980272293091, | |
| "logits/rejected": -0.6395881175994873, | |
| "logps/chosen": -5.562260627746582, | |
| "logps/rejected": -16.978702545166016, | |
| "loss": 0.9048807621002197, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3790769577026367, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1927444040775299, | |
| "rewards/margins": 0.6174324750900269, | |
| "rewards/rejected": -0.42468804121017456, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.08633166082549608, | |
| "grad_norm": 2.7166309356689453, | |
| "learning_rate": 0.00019927952375975094, | |
| "logits/chosen": -0.6151095628738403, | |
| "logits/rejected": -0.6214062571525574, | |
| "logps/chosen": -8.704106330871582, | |
| "logps/rejected": -15.980009078979492, | |
| "loss": 0.9614640474319458, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41800737380981445, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.22499363124370575, | |
| "rewards/margins": 0.5540027618408203, | |
| "rewards/rejected": -0.32900911569595337, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.08713849877713623, | |
| "grad_norm": 3.3143904209136963, | |
| "learning_rate": 0.00019924718748572136, | |
| "logits/chosen": -0.6602830290794373, | |
| "logits/rejected": -0.6590928435325623, | |
| "logps/chosen": -14.48482608795166, | |
| "logps/rejected": -13.489812850952148, | |
| "loss": 1.1007349491119385, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38938888907432556, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.005462644621729851, | |
| "rewards/margins": 0.18356555700302124, | |
| "rewards/rejected": -0.18902820348739624, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.08794533672877639, | |
| "grad_norm": 3.3967649936676025, | |
| "learning_rate": 0.00019921414413785095, | |
| "logits/chosen": -0.6139819025993347, | |
| "logits/rejected": -0.6160064935684204, | |
| "logps/chosen": -10.462146759033203, | |
| "logps/rejected": -13.9368896484375, | |
| "loss": 1.1163440942764282, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5643093585968018, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.13518843054771423, | |
| "rewards/margins": 0.5490553379058838, | |
| "rewards/rejected": -0.41386690735816956, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.08875217468041653, | |
| "grad_norm": 2.125051498413086, | |
| "learning_rate": 0.00019918039395155278, | |
| "logits/chosen": -0.5581845641136169, | |
| "logits/rejected": -0.5609419345855713, | |
| "logps/chosen": -8.664159774780273, | |
| "logps/rejected": -16.96472930908203, | |
| "loss": 0.8410020470619202, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3336779773235321, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.24867044389247894, | |
| "rewards/margins": 0.6479009985923767, | |
| "rewards/rejected": -0.3992305099964142, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.08955901263205668, | |
| "grad_norm": 2.7272698879241943, | |
| "learning_rate": 0.00019914593716727574, | |
| "logits/chosen": -0.640306830406189, | |
| "logits/rejected": -0.6392278075218201, | |
| "logps/chosen": -10.320524215698242, | |
| "logps/rejected": -15.357645034790039, | |
| "loss": 0.9050614237785339, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3744095265865326, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.228946715593338, | |
| "rewards/margins": 0.46916335821151733, | |
| "rewards/rejected": -0.24021662771701813, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09036585058369682, | |
| "grad_norm": 2.552009344100952, | |
| "learning_rate": 0.0001991107740305027, | |
| "logits/chosen": -0.6064003109931946, | |
| "logits/rejected": -0.607029914855957, | |
| "logps/chosen": -10.730403900146484, | |
| "logps/rejected": -20.569438934326172, | |
| "loss": 0.9093858003616333, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4844813346862793, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.320293128490448, | |
| "rewards/margins": 0.8029977083206177, | |
| "rewards/rejected": -0.48270460963249207, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09117268853533698, | |
| "grad_norm": 2.875828742980957, | |
| "learning_rate": 0.00019907490479174902, | |
| "logits/chosen": -0.6465886831283569, | |
| "logits/rejected": -0.6483381986618042, | |
| "logps/chosen": -6.758854389190674, | |
| "logps/rejected": -20.76754379272461, | |
| "loss": 0.7010505199432373, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29428812861442566, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3071742653846741, | |
| "rewards/margins": 1.1479661464691162, | |
| "rewards/rejected": -0.8407919406890869, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.09197952648697713, | |
| "grad_norm": 2.3188178539276123, | |
| "learning_rate": 0.00019903832970656038, | |
| "logits/chosen": -0.6288142800331116, | |
| "logits/rejected": -0.6315409541130066, | |
| "logps/chosen": -8.855584144592285, | |
| "logps/rejected": -20.421592712402344, | |
| "loss": 0.841801106929779, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38135236501693726, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19283419847488403, | |
| "rewards/margins": 0.8724038004875183, | |
| "rewards/rejected": -0.6795696020126343, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09278636443861728, | |
| "grad_norm": 3.3676164150238037, | |
| "learning_rate": 0.00019900104903551133, | |
| "logits/chosen": -0.6541582345962524, | |
| "logits/rejected": -0.6580868363380432, | |
| "logps/chosen": -8.595276832580566, | |
| "logps/rejected": -24.14297866821289, | |
| "loss": 0.7960852980613708, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4363185465335846, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10038560628890991, | |
| "rewards/margins": 1.4183127880096436, | |
| "rewards/rejected": -1.3179271221160889, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.09359320239025744, | |
| "grad_norm": 3.721660614013672, | |
| "learning_rate": 0.00019896306304420324, | |
| "logits/chosen": -0.6533216834068298, | |
| "logits/rejected": -0.6518760919570923, | |
| "logps/chosen": -9.710081100463867, | |
| "logps/rejected": -20.333324432373047, | |
| "loss": 0.842086911201477, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38858363032341003, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1398862600326538, | |
| "rewards/margins": 1.0419015884399414, | |
| "rewards/rejected": -0.9020152688026428, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09440004034189758, | |
| "grad_norm": 4.8206281661987305, | |
| "learning_rate": 0.0001989243720032624, | |
| "logits/chosen": -0.7102867364883423, | |
| "logits/rejected": -0.712573230266571, | |
| "logps/chosen": -14.843620300292969, | |
| "logps/rejected": -23.658788681030273, | |
| "loss": 1.1279860734939575, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5651426315307617, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.09467095881700516, | |
| "rewards/margins": 0.9923723340034485, | |
| "rewards/rejected": -1.087043285369873, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09520687829353773, | |
| "grad_norm": 3.194643020629883, | |
| "learning_rate": 0.00019888497618833815, | |
| "logits/chosen": -0.6824992895126343, | |
| "logits/rejected": -0.6856632232666016, | |
| "logps/chosen": -7.8865065574646, | |
| "logps/rejected": -22.186447143554688, | |
| "loss": 0.8166104555130005, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3872619867324829, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1935729682445526, | |
| "rewards/margins": 1.2844107151031494, | |
| "rewards/rejected": -1.090837836265564, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09601371624517788, | |
| "grad_norm": 5.332725524902344, | |
| "learning_rate": 0.00019884487588010092, | |
| "logits/chosen": -0.6963211894035339, | |
| "logits/rejected": -0.695375382900238, | |
| "logps/chosen": -12.522785186767578, | |
| "logps/rejected": -21.899364471435547, | |
| "loss": 1.200064778327942, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5619924068450928, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.2353927493095398, | |
| "rewards/margins": 0.7032212018966675, | |
| "rewards/rejected": -0.9386140704154968, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.09682055419681804, | |
| "grad_norm": 3.189750909805298, | |
| "learning_rate": 0.0001988040713642402, | |
| "logits/chosen": -0.7008529305458069, | |
| "logits/rejected": -0.7020596265792847, | |
| "logps/chosen": -7.352071285247803, | |
| "logps/rejected": -26.472599029541016, | |
| "loss": 0.6796355843544006, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30471816658973694, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0883897989988327, | |
| "rewards/margins": 1.43672513961792, | |
| "rewards/rejected": -1.3483351469039917, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09762739214845818, | |
| "grad_norm": 3.5756847858428955, | |
| "learning_rate": 0.00019876256293146257, | |
| "logits/chosen": -0.6855241060256958, | |
| "logits/rejected": -0.6870216131210327, | |
| "logps/chosen": -9.13197135925293, | |
| "logps/rejected": -25.256893157958984, | |
| "loss": 0.9965449571609497, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5001046061515808, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.036015622317790985, | |
| "rewards/margins": 1.1710847616195679, | |
| "rewards/rejected": -1.1350692510604858, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09843423010009833, | |
| "grad_norm": 2.60425066947937, | |
| "learning_rate": 0.0001987203508774895, | |
| "logits/chosen": -0.7040928602218628, | |
| "logits/rejected": -0.7042312026023865, | |
| "logps/chosen": -8.471722602844238, | |
| "logps/rejected": -26.018938064575195, | |
| "loss": 0.8459987640380859, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4736276865005493, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24268555641174316, | |
| "rewards/margins": 1.318163514137268, | |
| "rewards/rejected": -1.075477957725525, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.09924106805173849, | |
| "grad_norm": 4.30864143371582, | |
| "learning_rate": 0.0001986774355030553, | |
| "logits/chosen": -0.6747640371322632, | |
| "logits/rejected": -0.677899956703186, | |
| "logps/chosen": -14.706789016723633, | |
| "logps/rejected": -16.56774139404297, | |
| "loss": 1.2364513874053955, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6511675119400024, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08759675920009613, | |
| "rewards/margins": 0.6008309721946716, | |
| "rewards/rejected": -0.5132341384887695, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10004790600337864, | |
| "grad_norm": 6.867242813110352, | |
| "learning_rate": 0.00019863381711390508, | |
| "logits/chosen": -0.6869674324989319, | |
| "logits/rejected": -0.6902846693992615, | |
| "logps/chosen": -7.829675197601318, | |
| "logps/rejected": -20.095809936523438, | |
| "loss": 1.043180227279663, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.530769944190979, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11925126612186432, | |
| "rewards/margins": 0.697571337223053, | |
| "rewards/rejected": -0.5783200860023499, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10085474395501878, | |
| "grad_norm": 3.041438579559326, | |
| "learning_rate": 0.0001985894960207925, | |
| "logits/chosen": -0.6505750417709351, | |
| "logits/rejected": -0.6511614918708801, | |
| "logps/chosen": -9.314833641052246, | |
| "logps/rejected": -27.15659523010254, | |
| "loss": 0.7252060174942017, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39295029640197754, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24510648846626282, | |
| "rewards/margins": 1.2805438041687012, | |
| "rewards/rejected": -1.0354374647140503, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10166158190665893, | |
| "grad_norm": 2.509321689605713, | |
| "learning_rate": 0.00019854447253947743, | |
| "logits/chosen": -0.6497823596000671, | |
| "logits/rejected": -0.6492441892623901, | |
| "logps/chosen": -8.02572250366211, | |
| "logps/rejected": -20.3783016204834, | |
| "loss": 0.7982934713363647, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33212146162986755, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.17764505743980408, | |
| "rewards/margins": 0.8625535368919373, | |
| "rewards/rejected": -0.6849085092544556, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.10246841985829909, | |
| "grad_norm": 3.6529700756073, | |
| "learning_rate": 0.0001984987469907239, | |
| "logits/chosen": -0.6466098427772522, | |
| "logits/rejected": -0.6480077505111694, | |
| "logps/chosen": -9.548334121704102, | |
| "logps/rejected": -16.65062141418457, | |
| "loss": 0.914322555065155, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4001502990722656, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1684979647397995, | |
| "rewards/margins": 0.6629449129104614, | |
| "rewards/rejected": -0.49444690346717834, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10327525780993924, | |
| "grad_norm": 3.3696913719177246, | |
| "learning_rate": 0.00019845231970029773, | |
| "logits/chosen": -0.679688572883606, | |
| "logits/rejected": -0.6820145845413208, | |
| "logps/chosen": -10.874924659729004, | |
| "logps/rejected": -24.826372146606445, | |
| "loss": 0.9800686240196228, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4543137848377228, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.048351842910051346, | |
| "rewards/margins": 0.8677961230278015, | |
| "rewards/rejected": -0.9161479473114014, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.10408209576157938, | |
| "grad_norm": 2.5419607162475586, | |
| "learning_rate": 0.00019840519099896414, | |
| "logits/chosen": -0.6618849039077759, | |
| "logits/rejected": -0.6671789288520813, | |
| "logps/chosen": -8.426337242126465, | |
| "logps/rejected": -25.797517776489258, | |
| "loss": 0.6974806189537048, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2836017608642578, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18303632736206055, | |
| "rewards/margins": 1.1003562211990356, | |
| "rewards/rejected": -0.9173198938369751, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10488893371321953, | |
| "grad_norm": 3.4203388690948486, | |
| "learning_rate": 0.00019835736122248557, | |
| "logits/chosen": -0.6606203317642212, | |
| "logits/rejected": -0.6571654677391052, | |
| "logps/chosen": -14.509614944458008, | |
| "logps/rejected": -15.079629898071289, | |
| "loss": 1.101165771484375, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5219094157218933, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07395613193511963, | |
| "rewards/margins": 0.5427431464195251, | |
| "rewards/rejected": -0.46878698468208313, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10569577166485969, | |
| "grad_norm": 2.7750000953674316, | |
| "learning_rate": 0.00019830883071161908, | |
| "logits/chosen": -0.7152451276779175, | |
| "logits/rejected": -0.7131951451301575, | |
| "logps/chosen": -9.166630744934082, | |
| "logps/rejected": -19.46819305419922, | |
| "loss": 0.7933439016342163, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3753884732723236, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26774072647094727, | |
| "rewards/margins": 1.0882644653320312, | |
| "rewards/rejected": -0.8205236196517944, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10650260961649984, | |
| "grad_norm": 3.1810927391052246, | |
| "learning_rate": 0.00019825959981211407, | |
| "logits/chosen": -0.714146614074707, | |
| "logits/rejected": -0.7095440626144409, | |
| "logps/chosen": -11.571531295776367, | |
| "logps/rejected": -14.685908317565918, | |
| "loss": 0.8970522880554199, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38512641191482544, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09674864262342453, | |
| "rewards/margins": 0.5926439762115479, | |
| "rewards/rejected": -0.4958953261375427, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10730944756813998, | |
| "grad_norm": 2.839996099472046, | |
| "learning_rate": 0.00019820966887470974, | |
| "logits/chosen": -0.7237828373908997, | |
| "logits/rejected": -0.7276051640510559, | |
| "logps/chosen": -7.241865158081055, | |
| "logps/rejected": -21.9840145111084, | |
| "loss": 0.7037227153778076, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29994940757751465, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18205267190933228, | |
| "rewards/margins": 1.1148442029953003, | |
| "rewards/rejected": -0.9327914714813232, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10811628551978014, | |
| "grad_norm": 2.8896915912628174, | |
| "learning_rate": 0.0001981590382551327, | |
| "logits/chosen": -0.796456515789032, | |
| "logits/rejected": -0.7955406308174133, | |
| "logps/chosen": -11.131935119628906, | |
| "logps/rejected": -19.525293350219727, | |
| "loss": 0.8993673920631409, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4546453356742859, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.21719151735305786, | |
| "rewards/margins": 1.081808090209961, | |
| "rewards/rejected": -0.8646165728569031, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.10892312347142029, | |
| "grad_norm": 3.5537540912628174, | |
| "learning_rate": 0.00019810770831409425, | |
| "logits/chosen": -0.7755017876625061, | |
| "logits/rejected": -0.7809926271438599, | |
| "logps/chosen": -7.181600093841553, | |
| "logps/rejected": -19.379724502563477, | |
| "loss": 0.7135071754455566, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32976531982421875, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26019349694252014, | |
| "rewards/margins": 1.110938310623169, | |
| "rewards/rejected": -0.850744903087616, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10972996142306043, | |
| "grad_norm": 3.5955300331115723, | |
| "learning_rate": 0.00019805567941728796, | |
| "logits/chosen": -0.799392819404602, | |
| "logits/rejected": -0.8029282689094543, | |
| "logps/chosen": -9.87437629699707, | |
| "logps/rejected": -23.02663230895996, | |
| "loss": 0.9438092708587646, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5196709036827087, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07922995835542679, | |
| "rewards/margins": 1.070724606513977, | |
| "rewards/rejected": -0.9914946556091309, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.11053679937470058, | |
| "grad_norm": 3.7304859161376953, | |
| "learning_rate": 0.00019800295193538704, | |
| "logits/chosen": -0.8160181641578674, | |
| "logits/rejected": -0.8219972848892212, | |
| "logps/chosen": -7.596125602722168, | |
| "logps/rejected": -20.225994110107422, | |
| "loss": 0.8485299348831177, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43994730710983276, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.26360729336738586, | |
| "rewards/margins": 0.9658780694007874, | |
| "rewards/rejected": -0.7022708058357239, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.11134363732634074, | |
| "grad_norm": 4.919328689575195, | |
| "learning_rate": 0.00019794952624404167, | |
| "logits/chosen": -0.7996560335159302, | |
| "logits/rejected": -0.801249623298645, | |
| "logps/chosen": -9.867749214172363, | |
| "logps/rejected": -22.316190719604492, | |
| "loss": 0.8283427357673645, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4471050798892975, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13889475166797638, | |
| "rewards/margins": 1.224007248878479, | |
| "rewards/rejected": -1.085112452507019, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.11215047527798089, | |
| "grad_norm": 2.821730136871338, | |
| "learning_rate": 0.0001978954027238763, | |
| "logits/chosen": -0.818955659866333, | |
| "logits/rejected": -0.8183013796806335, | |
| "logps/chosen": -6.504258632659912, | |
| "logps/rejected": -14.602479934692383, | |
| "loss": 0.7571634650230408, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29162290692329407, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1784059852361679, | |
| "rewards/margins": 0.8354285955429077, | |
| "rewards/rejected": -0.6570225954055786, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.11295731322962103, | |
| "grad_norm": 2.481306552886963, | |
| "learning_rate": 0.000197840581760487, | |
| "logits/chosen": -0.8251004219055176, | |
| "logits/rejected": -0.8243045210838318, | |
| "logps/chosen": -13.736132621765137, | |
| "logps/rejected": -17.749977111816406, | |
| "loss": 0.8052379488945007, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4064967930316925, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3237007260322571, | |
| "rewards/margins": 1.295701026916504, | |
| "rewards/rejected": -0.9720003008842468, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.1137641511812612, | |
| "grad_norm": 2.695176601409912, | |
| "learning_rate": 0.00019778506374443873, | |
| "logits/chosen": -0.7545077800750732, | |
| "logits/rejected": -0.7596877813339233, | |
| "logps/chosen": -5.598147869110107, | |
| "logps/rejected": -26.760784149169922, | |
| "loss": 0.6858201026916504, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3311798572540283, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19224056601524353, | |
| "rewards/margins": 1.6802706718444824, | |
| "rewards/rejected": -1.488029956817627, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11457098913290134, | |
| "grad_norm": 2.5371341705322266, | |
| "learning_rate": 0.0001977288490712624, | |
| "logits/chosen": -0.8187113404273987, | |
| "logits/rejected": -0.8256463408470154, | |
| "logps/chosen": -9.480502128601074, | |
| "logps/rejected": -26.96666717529297, | |
| "loss": 0.6809464693069458, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3261586129665375, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2214924842119217, | |
| "rewards/margins": 1.2070807218551636, | |
| "rewards/rejected": -0.9855883121490479, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11537782708454149, | |
| "grad_norm": 3.33156681060791, | |
| "learning_rate": 0.00019767193814145226, | |
| "logits/chosen": -0.8148999214172363, | |
| "logits/rejected": -0.8154037594795227, | |
| "logps/chosen": -16.6685848236084, | |
| "logps/rejected": -16.219863891601562, | |
| "loss": 1.1351004838943481, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6261444091796875, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.06986582279205322, | |
| "rewards/margins": 0.7546349763870239, | |
| "rewards/rejected": -0.6847692728042603, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11618466503618163, | |
| "grad_norm": 2.587169647216797, | |
| "learning_rate": 0.00019761433136046295, | |
| "logits/chosen": -0.7679372429847717, | |
| "logits/rejected": -0.7711334824562073, | |
| "logps/chosen": -6.84797477722168, | |
| "logps/rejected": -25.882503509521484, | |
| "loss": 0.6460772752761841, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2581600844860077, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.25230705738067627, | |
| "rewards/margins": 1.5044541358947754, | |
| "rewards/rejected": -1.2521469593048096, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1169915029878218, | |
| "grad_norm": 3.816577911376953, | |
| "learning_rate": 0.00019755602913870655, | |
| "logits/chosen": -0.7486031651496887, | |
| "logits/rejected": -0.7545804977416992, | |
| "logps/chosen": -11.378320693969727, | |
| "logps/rejected": -23.90165901184082, | |
| "loss": 1.0280418395996094, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5588870644569397, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10084515064954758, | |
| "rewards/margins": 1.0778629779815674, | |
| "rewards/rejected": -0.9770178198814392, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.11779834093946194, | |
| "grad_norm": 3.1183438301086426, | |
| "learning_rate": 0.00019749703189154971, | |
| "logits/chosen": -0.7663331031799316, | |
| "logits/rejected": -0.7778096199035645, | |
| "logps/chosen": -7.461820602416992, | |
| "logps/rejected": -26.446916580200195, | |
| "loss": 0.6639739274978638, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28250494599342346, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.04964678734540939, | |
| "rewards/margins": 1.1681914329528809, | |
| "rewards/rejected": -1.1185446977615356, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11860517889110209, | |
| "grad_norm": 2.613725423812866, | |
| "learning_rate": 0.00019743734003931082, | |
| "logits/chosen": -0.808351993560791, | |
| "logits/rejected": -0.8136962652206421, | |
| "logps/chosen": -7.89247989654541, | |
| "logps/rejected": -23.955371856689453, | |
| "loss": 0.8511161804199219, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39823463559150696, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.12871581315994263, | |
| "rewards/margins": 1.055700659751892, | |
| "rewards/rejected": -0.9269847869873047, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11941201684274225, | |
| "grad_norm": 3.0128729343414307, | |
| "learning_rate": 0.00019737695400725677, | |
| "logits/chosen": -0.7927097678184509, | |
| "logits/rejected": -0.7919667959213257, | |
| "logps/chosen": -9.877785682678223, | |
| "logps/rejected": -23.477703094482422, | |
| "loss": 0.7262363433837891, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3177878260612488, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.12437373399734497, | |
| "rewards/margins": 1.1551289558410645, | |
| "rewards/rejected": -1.0307551622390747, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1202188547943824, | |
| "grad_norm": 2.5007247924804688, | |
| "learning_rate": 0.0001973158742256001, | |
| "logits/chosen": -0.815912663936615, | |
| "logits/rejected": -0.8240575194358826, | |
| "logps/chosen": -7.251335620880127, | |
| "logps/rejected": -23.904563903808594, | |
| "loss": 0.7742622494697571, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3948196470737457, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16877779364585876, | |
| "rewards/margins": 1.3302054405212402, | |
| "rewards/rejected": -1.1614277362823486, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12102569274602254, | |
| "grad_norm": 2.996128559112549, | |
| "learning_rate": 0.0001972541011294959, | |
| "logits/chosen": -0.8276554346084595, | |
| "logits/rejected": -0.832274317741394, | |
| "logps/chosen": -9.810141563415527, | |
| "logps/rejected": -24.295639038085938, | |
| "loss": 0.733322262763977, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34396567940711975, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.03486320376396179, | |
| "rewards/margins": 1.2224383354187012, | |
| "rewards/rejected": -1.1875752210617065, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.005495 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1239, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0977195623354204e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |