Instructions to use cragtmp/task3f2-550 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/task3f2-550 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/task3f2-550") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 300, | |
| "best_metric": 0.73294115, | |
| "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task3_dpo_gt6_task2_gt30.3+task3gt5_0.1vp_idk0614.json/v0-20250614-165413/checkpoint-300", | |
| "epoch": 0.44376087340208265, | |
| "eval_steps": 300, | |
| "global_step": 550, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0008068379516401503, | |
| "grad_norm": 9.261910438537598, | |
| "learning_rate": 3.225806451612903e-06, | |
| "logits/chosen": -0.6039718985557556, | |
| "logits/rejected": -0.6058337688446045, | |
| "logps/chosen": -7.412725925445557, | |
| "logps/rejected": -11.413676261901855, | |
| "loss": 1.2381761074066162, | |
| "memory(GiB)": 46.32, | |
| "nll_loss": 0.5450288653373718, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005524 | |
| }, | |
| { | |
| "epoch": 0.0016136759032803006, | |
| "grad_norm": 5.391567230224609, | |
| "learning_rate": 6.451612903225806e-06, | |
| "logits/chosen": -0.6199994087219238, | |
| "logits/rejected": -0.6217825412750244, | |
| "logps/chosen": -7.599736213684082, | |
| "logps/rejected": -15.575040817260742, | |
| "loss": 1.1066936254501343, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41354650259017944, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005546 | |
| }, | |
| { | |
| "epoch": 0.002420513854920451, | |
| "grad_norm": 6.5534772872924805, | |
| "learning_rate": 9.67741935483871e-06, | |
| "logits/chosen": -0.6068329811096191, | |
| "logits/rejected": -0.6103144288063049, | |
| "logps/chosen": -11.938759803771973, | |
| "logps/rejected": -14.32825756072998, | |
| "loss": 1.267569661140442, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5742746591567993, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0005358309717848897, | |
| "rewards/margins": -0.00011114418157376349, | |
| "rewards/rejected": 0.0006469750078395009, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005487 | |
| }, | |
| { | |
| "epoch": 0.003227351806560601, | |
| "grad_norm": 3.4633655548095703, | |
| "learning_rate": 1.2903225806451613e-05, | |
| "logits/chosen": -0.6417700052261353, | |
| "logits/rejected": -0.638687789440155, | |
| "logps/chosen": -10.244372367858887, | |
| "logps/rejected": -8.448144912719727, | |
| "loss": 1.1101956367492676, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4145403802394867, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.002526381518691778, | |
| "rewards/margins": -0.004837517160922289, | |
| "rewards/rejected": 0.0023111351765692234, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005482 | |
| }, | |
| { | |
| "epoch": 0.004034189758200751, | |
| "grad_norm": 9.884061813354492, | |
| "learning_rate": 1.6129032258064517e-05, | |
| "logits/chosen": -0.6263395547866821, | |
| "logits/rejected": -0.6316207647323608, | |
| "logps/chosen": -8.768255233764648, | |
| "logps/rejected": -12.074126243591309, | |
| "loss": 1.2384487390518188, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5502734780311584, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.011151458136737347, | |
| "rewards/margins": 0.010235130786895752, | |
| "rewards/rejected": 0.0009163276990875602, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.004841027709840902, | |
| "grad_norm": 9.879764556884766, | |
| "learning_rate": 1.935483870967742e-05, | |
| "logits/chosen": -0.6110924482345581, | |
| "logits/rejected": -0.6128084063529968, | |
| "logps/chosen": -11.146334648132324, | |
| "logps/rejected": -12.724503517150879, | |
| "loss": 1.246738314628601, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5631918907165527, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.02471097745001316, | |
| "rewards/margins": 0.02056196704506874, | |
| "rewards/rejected": 0.004149014595896006, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.0056478656614810515, | |
| "grad_norm": 3.7321648597717285, | |
| "learning_rate": 2.258064516129032e-05, | |
| "logits/chosen": -0.6434396505355835, | |
| "logits/rejected": -0.6456248164176941, | |
| "logps/chosen": -12.346940994262695, | |
| "logps/rejected": -13.585854530334473, | |
| "loss": 1.25950026512146, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5602214932441711, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.01709746941924095, | |
| "rewards/margins": -0.004833616316318512, | |
| "rewards/rejected": 0.021931089460849762, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005511 | |
| }, | |
| { | |
| "epoch": 0.006454703613121202, | |
| "grad_norm": 6.577890872955322, | |
| "learning_rate": 2.5806451612903226e-05, | |
| "logits/chosen": -0.6166916489601135, | |
| "logits/rejected": -0.6146227717399597, | |
| "logps/chosen": -16.807830810546875, | |
| "logps/rejected": -11.38271427154541, | |
| "loss": 1.2828420400619507, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5101535320281982, | |
| "rewards/accuracies": 0.25, | |
| "rewards/chosen": -0.04314221069216728, | |
| "rewards/margins": -0.13309986889362335, | |
| "rewards/rejected": 0.08995765447616577, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.007261541564761352, | |
| "grad_norm": 3.5513713359832764, | |
| "learning_rate": 2.9032258064516133e-05, | |
| "logits/chosen": -0.5994153022766113, | |
| "logits/rejected": -0.6015004515647888, | |
| "logps/chosen": -11.679065704345703, | |
| "logps/rejected": -12.411300659179688, | |
| "loss": 1.171980857849121, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4982386827468872, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.035934723913669586, | |
| "rewards/margins": 0.08020534366369247, | |
| "rewards/rejected": -0.04427062347531319, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005483 | |
| }, | |
| { | |
| "epoch": 0.008068379516401502, | |
| "grad_norm": 7.633578777313232, | |
| "learning_rate": 3.2258064516129034e-05, | |
| "logits/chosen": -0.6122820377349854, | |
| "logits/rejected": -0.6125556826591492, | |
| "logps/chosen": -12.382171630859375, | |
| "logps/rejected": -10.675874710083008, | |
| "loss": 1.3903008699417114, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6006877422332764, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.08313174545764923, | |
| "rewards/margins": -0.13078533113002777, | |
| "rewards/rejected": 0.04765357822179794, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.008875217468041654, | |
| "grad_norm": 4.818623065948486, | |
| "learning_rate": 3.548387096774194e-05, | |
| "logits/chosen": -0.6364253759384155, | |
| "logits/rejected": -0.6395613551139832, | |
| "logps/chosen": -7.883171558380127, | |
| "logps/rejected": -15.457681655883789, | |
| "loss": 1.1344804763793945, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46768438816070557, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.008294675499200821, | |
| "rewards/margins": 0.10872506350278854, | |
| "rewards/rejected": -0.10043041408061981, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.009682055419681803, | |
| "grad_norm": 3.8297243118286133, | |
| "learning_rate": 3.870967741935484e-05, | |
| "logits/chosen": -0.6082768440246582, | |
| "logits/rejected": -0.6128782629966736, | |
| "logps/chosen": -10.993257522583008, | |
| "logps/rejected": -14.49487018585205, | |
| "loss": 1.1111013889312744, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42791634798049927, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.013819348067045212, | |
| "rewards/margins": 0.08211039006710052, | |
| "rewards/rejected": -0.09592973440885544, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005476 | |
| }, | |
| { | |
| "epoch": 0.010488893371321953, | |
| "grad_norm": 3.1733834743499756, | |
| "learning_rate": 4.1935483870967746e-05, | |
| "logits/chosen": -0.597683846950531, | |
| "logits/rejected": -0.6003975868225098, | |
| "logps/chosen": -7.611721038818359, | |
| "logps/rejected": -13.589990615844727, | |
| "loss": 0.9966970682144165, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3590569496154785, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.09378139674663544, | |
| "rewards/margins": 0.16571055352687836, | |
| "rewards/rejected": -0.07192917168140411, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.005488 | |
| }, | |
| { | |
| "epoch": 0.011295731322962103, | |
| "grad_norm": 5.364157676696777, | |
| "learning_rate": 4.516129032258064e-05, | |
| "logits/chosen": -0.5847792029380798, | |
| "logits/rejected": -0.5856592655181885, | |
| "logps/chosen": -11.617069244384766, | |
| "logps/rejected": -11.611367225646973, | |
| "loss": 1.2788419723510742, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5410674214363098, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.037577953189611435, | |
| "rewards/margins": -0.04553454369306564, | |
| "rewards/rejected": 0.08311249315738678, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.012102569274602255, | |
| "grad_norm": 3.436879873275757, | |
| "learning_rate": 4.8387096774193554e-05, | |
| "logits/chosen": -0.5832479596138, | |
| "logits/rejected": -0.5832363367080688, | |
| "logps/chosen": -9.650967597961426, | |
| "logps/rejected": -11.376352310180664, | |
| "loss": 1.0634793043136597, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34024038910865784, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.05362201854586601, | |
| "rewards/margins": -0.029222950339317322, | |
| "rewards/rejected": 0.08284495770931244, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.012909407226242404, | |
| "grad_norm": 3.2199597358703613, | |
| "learning_rate": 5.161290322580645e-05, | |
| "logits/chosen": -0.6036816239356995, | |
| "logits/rejected": -0.606670618057251, | |
| "logps/chosen": -10.059551239013672, | |
| "logps/rejected": -16.143247604370117, | |
| "loss": 1.0622740983963013, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3808459937572479, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.11249684542417526, | |
| "rewards/margins": 0.040876831859350204, | |
| "rewards/rejected": 0.07162001729011536, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.013716245177882554, | |
| "grad_norm": 3.376516819000244, | |
| "learning_rate": 5.4838709677419355e-05, | |
| "logits/chosen": -0.5811513662338257, | |
| "logits/rejected": -0.5822936296463013, | |
| "logps/chosen": -10.964933395385742, | |
| "logps/rejected": -13.541594505310059, | |
| "loss": 1.1284891366958618, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43761852383613586, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.11780606210231781, | |
| "rewards/margins": 0.02046366035938263, | |
| "rewards/rejected": 0.09734240174293518, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.014523083129522704, | |
| "grad_norm": 3.292140245437622, | |
| "learning_rate": 5.8064516129032266e-05, | |
| "logits/chosen": -0.5822582840919495, | |
| "logits/rejected": -0.5867500305175781, | |
| "logps/chosen": -8.11985969543457, | |
| "logps/rejected": -14.659163475036621, | |
| "loss": 1.0471278429031372, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40266352891921997, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.14493001997470856, | |
| "rewards/margins": 0.1153046265244484, | |
| "rewards/rejected": 0.029625393450260162, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.015329921081162856, | |
| "grad_norm": 3.320802688598633, | |
| "learning_rate": 6.129032258064517e-05, | |
| "logits/chosen": -0.5760956406593323, | |
| "logits/rejected": -0.5776647925376892, | |
| "logps/chosen": -9.478979110717773, | |
| "logps/rejected": -11.301219940185547, | |
| "loss": 1.1243548393249512, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48838871717453003, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20540697872638702, | |
| "rewards/margins": 0.14464649558067322, | |
| "rewards/rejected": 0.06076047942042351, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.016136759032803004, | |
| "grad_norm": 2.7910656929016113, | |
| "learning_rate": 6.451612903225807e-05, | |
| "logits/chosen": -0.5840404033660889, | |
| "logits/rejected": -0.582589864730835, | |
| "logps/chosen": -13.635812759399414, | |
| "logps/rejected": -10.431557655334473, | |
| "loss": 1.2548669576644897, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.55869460105896, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.13213564455509186, | |
| "rewards/margins": 0.044300854206085205, | |
| "rewards/rejected": 0.08783479034900665, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.016943596984443157, | |
| "grad_norm": 2.2573604583740234, | |
| "learning_rate": 6.774193548387096e-05, | |
| "logits/chosen": -0.5839393734931946, | |
| "logits/rejected": -0.5850896835327148, | |
| "logps/chosen": -7.3839006423950195, | |
| "logps/rejected": -9.574810028076172, | |
| "loss": 0.9415242075920105, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.372197687625885, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2435840666294098, | |
| "rewards/margins": 0.30735281109809875, | |
| "rewards/rejected": -0.06376874446868896, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.017750434936083307, | |
| "grad_norm": 2.90157413482666, | |
| "learning_rate": 7.096774193548388e-05, | |
| "logits/chosen": -0.6114062070846558, | |
| "logits/rejected": -0.6119735240936279, | |
| "logps/chosen": -8.486170768737793, | |
| "logps/rejected": -12.086725234985352, | |
| "loss": 1.0081067085266113, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34981024265289307, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.10258002579212189, | |
| "rewards/margins": 0.12462681531906128, | |
| "rewards/rejected": -0.02204679138958454, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.018557272887723457, | |
| "grad_norm": 2.4457335472106934, | |
| "learning_rate": 7.419354838709677e-05, | |
| "logits/chosen": -0.5648061037063599, | |
| "logits/rejected": -0.5674125552177429, | |
| "logps/chosen": -12.962445259094238, | |
| "logps/rejected": -15.476969718933105, | |
| "loss": 1.0199884176254272, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4421077072620392, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.13948869705200195, | |
| "rewards/margins": 0.31703731417655945, | |
| "rewards/rejected": -0.17754864692687988, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.019364110839363607, | |
| "grad_norm": 2.250957489013672, | |
| "learning_rate": 7.741935483870968e-05, | |
| "logits/chosen": -0.5476934313774109, | |
| "logits/rejected": -0.5497113466262817, | |
| "logps/chosen": -6.839375972747803, | |
| "logps/rejected": -12.336576461791992, | |
| "loss": 0.9127413630485535, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3841688632965088, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2666690945625305, | |
| "rewards/margins": 0.42246347665786743, | |
| "rewards/rejected": -0.1557943969964981, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.020170948791003757, | |
| "grad_norm": 3.6742801666259766, | |
| "learning_rate": 8.064516129032258e-05, | |
| "logits/chosen": -0.5886849164962769, | |
| "logits/rejected": -0.5897050499916077, | |
| "logps/chosen": -8.534127235412598, | |
| "logps/rejected": -11.815479278564453, | |
| "loss": 1.0272297859191895, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41876962780952454, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.13335689902305603, | |
| "rewards/margins": 0.27482476830482483, | |
| "rewards/rejected": -0.1414678543806076, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005513 | |
| }, | |
| { | |
| "epoch": 0.020977786742643906, | |
| "grad_norm": 2.5902981758117676, | |
| "learning_rate": 8.387096774193549e-05, | |
| "logits/chosen": -0.5303969979286194, | |
| "logits/rejected": -0.5350589752197266, | |
| "logps/chosen": -9.592369079589844, | |
| "logps/rejected": -17.837379455566406, | |
| "loss": 0.9073010087013245, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3275393545627594, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1778128743171692, | |
| "rewards/margins": 0.31808584928512573, | |
| "rewards/rejected": -0.14027300477027893, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.021784624694284056, | |
| "grad_norm": 3.656003952026367, | |
| "learning_rate": 8.709677419354839e-05, | |
| "logits/chosen": -0.5741274356842041, | |
| "logits/rejected": -0.5759863257408142, | |
| "logps/chosen": -7.401767253875732, | |
| "logps/rejected": -9.595519065856934, | |
| "loss": 0.9837043881416321, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34733644127845764, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.16637372970581055, | |
| "rewards/margins": 0.22424587607383728, | |
| "rewards/rejected": -0.05787213519215584, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.00551 | |
| }, | |
| { | |
| "epoch": 0.022591462645924206, | |
| "grad_norm": 3.6425983905792236, | |
| "learning_rate": 9.032258064516129e-05, | |
| "logits/chosen": -0.5271302461624146, | |
| "logits/rejected": -0.5281438231468201, | |
| "logps/chosen": -10.050779342651367, | |
| "logps/rejected": -13.247575759887695, | |
| "loss": 1.0190500020980835, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4030058681964874, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.022431861609220505, | |
| "rewards/margins": 0.22834232449531555, | |
| "rewards/rejected": -0.20591047406196594, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005522 | |
| }, | |
| { | |
| "epoch": 0.02339830059756436, | |
| "grad_norm": 4.539236545562744, | |
| "learning_rate": 9.35483870967742e-05, | |
| "logits/chosen": -0.574794352054596, | |
| "logits/rejected": -0.5771020650863647, | |
| "logps/chosen": -7.9426727294921875, | |
| "logps/rejected": -11.816813468933105, | |
| "loss": 1.0435985326766968, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4821586310863495, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.17023718357086182, | |
| "rewards/margins": 0.36495453119277954, | |
| "rewards/rejected": -0.19471733272075653, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005525 | |
| }, | |
| { | |
| "epoch": 0.02420513854920451, | |
| "grad_norm": 3.463172674179077, | |
| "learning_rate": 9.677419354838711e-05, | |
| "logits/chosen": -0.5663347244262695, | |
| "logits/rejected": -0.5671164393424988, | |
| "logps/chosen": -8.761878967285156, | |
| "logps/rejected": -16.922607421875, | |
| "loss": 0.8841907978057861, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37557756900787354, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23288068175315857, | |
| "rewards/margins": 0.47043219208717346, | |
| "rewards/rejected": -0.2375514954328537, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005522 | |
| }, | |
| { | |
| "epoch": 0.02501197650084466, | |
| "grad_norm": 7.054537296295166, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.5485356450080872, | |
| "logits/rejected": -0.5510388612747192, | |
| "logps/chosen": -8.1714506149292, | |
| "logps/rejected": -15.964082717895508, | |
| "loss": 1.0905145406723022, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48109474778175354, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.14875195920467377, | |
| "rewards/margins": 0.23288127779960632, | |
| "rewards/rejected": -0.08412933349609375, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005519 | |
| }, | |
| { | |
| "epoch": 0.02581881445248481, | |
| "grad_norm": 2.8915627002716064, | |
| "learning_rate": 0.0001032258064516129, | |
| "logits/chosen": -0.5415224432945251, | |
| "logits/rejected": -0.5406837463378906, | |
| "logps/chosen": -12.312981605529785, | |
| "logps/rejected": -14.444657325744629, | |
| "loss": 0.9778124094009399, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4027611017227173, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11852823942899704, | |
| "rewards/margins": 0.3213120102882385, | |
| "rewards/rejected": -0.2027837634086609, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.02662565240412496, | |
| "grad_norm": 4.721103191375732, | |
| "learning_rate": 0.0001064516129032258, | |
| "logits/chosen": -0.5442328453063965, | |
| "logits/rejected": -0.5437616109848022, | |
| "logps/chosen": -9.491182327270508, | |
| "logps/rejected": -18.31528663635254, | |
| "loss": 1.1582751274108887, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5736849904060364, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.03584306687116623, | |
| "rewards/margins": 0.35881760716438293, | |
| "rewards/rejected": -0.3229745626449585, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.02743249035576511, | |
| "grad_norm": 4.470694065093994, | |
| "learning_rate": 0.00010967741935483871, | |
| "logits/chosen": -0.49901843070983887, | |
| "logits/rejected": -0.5027262568473816, | |
| "logps/chosen": -6.029642105102539, | |
| "logps/rejected": -17.065149307250977, | |
| "loss": 0.7831717133522034, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2735077142715454, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.172469824552536, | |
| "rewards/margins": 0.6490951180458069, | |
| "rewards/rejected": -0.4766252934932709, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005511 | |
| }, | |
| { | |
| "epoch": 0.02823932830740526, | |
| "grad_norm": 4.086674690246582, | |
| "learning_rate": 0.00011290322580645163, | |
| "logits/chosen": -0.5251173377037048, | |
| "logits/rejected": -0.5295683145523071, | |
| "logps/chosen": -10.127384185791016, | |
| "logps/rejected": -19.261646270751953, | |
| "loss": 0.90782630443573, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37643295526504517, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.059490665793418884, | |
| "rewards/margins": 0.5788955688476562, | |
| "rewards/rejected": -0.5194048881530762, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005516 | |
| }, | |
| { | |
| "epoch": 0.02904616625904541, | |
| "grad_norm": 3.153599977493286, | |
| "learning_rate": 0.00011612903225806453, | |
| "logits/chosen": -0.5580551624298096, | |
| "logits/rejected": -0.561299741268158, | |
| "logps/chosen": -7.748661518096924, | |
| "logps/rejected": -18.775835037231445, | |
| "loss": 0.8323644995689392, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30874526500701904, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.17774799466133118, | |
| "rewards/margins": 0.58444744348526, | |
| "rewards/rejected": -0.4066994786262512, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005518 | |
| }, | |
| { | |
| "epoch": 0.02985300421068556, | |
| "grad_norm": 5.963130950927734, | |
| "learning_rate": 0.00011935483870967743, | |
| "logits/chosen": -0.5691896080970764, | |
| "logits/rejected": -0.5704917907714844, | |
| "logps/chosen": -5.695924282073975, | |
| "logps/rejected": -15.709531784057617, | |
| "loss": 0.8581907153129578, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32061102986335754, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.13813850283622742, | |
| "rewards/margins": 0.42923206090927124, | |
| "rewards/rejected": -0.2910935878753662, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005516 | |
| }, | |
| { | |
| "epoch": 0.03065984216232571, | |
| "grad_norm": 3.532068967819214, | |
| "learning_rate": 0.00012258064516129034, | |
| "logits/chosen": -0.5251184105873108, | |
| "logits/rejected": -0.5261702537536621, | |
| "logps/chosen": -8.303949356079102, | |
| "logps/rejected": -13.649654388427734, | |
| "loss": 0.9825394153594971, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39365747570991516, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.07552488148212433, | |
| "rewards/margins": 0.2995148003101349, | |
| "rewards/rejected": -0.22398996353149414, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.03146668011396586, | |
| "grad_norm": 2.9115569591522217, | |
| "learning_rate": 0.00012580645161290322, | |
| "logits/chosen": -0.5716837048530579, | |
| "logits/rejected": -0.5749698281288147, | |
| "logps/chosen": -7.206816673278809, | |
| "logps/rejected": -15.77934741973877, | |
| "loss": 0.7430101633071899, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27266308665275574, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.20229285955429077, | |
| "rewards/margins": 0.6254266500473022, | |
| "rewards/rejected": -0.42313385009765625, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005515 | |
| }, | |
| { | |
| "epoch": 0.03227351806560601, | |
| "grad_norm": 4.647506237030029, | |
| "learning_rate": 0.00012903225806451613, | |
| "logits/chosen": -0.5296156406402588, | |
| "logits/rejected": -0.5295798778533936, | |
| "logps/chosen": -10.529404640197754, | |
| "logps/rejected": -16.44548988342285, | |
| "loss": 0.900071918964386, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3727172613143921, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08702702820301056, | |
| "rewards/margins": 0.4926542341709137, | |
| "rewards/rejected": -0.40562722086906433, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005514 | |
| }, | |
| { | |
| "epoch": 0.03308035601724616, | |
| "grad_norm": 3.4815561771392822, | |
| "learning_rate": 0.00013225806451612905, | |
| "logits/chosen": -0.5586342811584473, | |
| "logits/rejected": -0.5603877305984497, | |
| "logps/chosen": -7.803877830505371, | |
| "logps/rejected": -18.412734985351562, | |
| "loss": 0.8854644298553467, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37826117873191833, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.08443664014339447, | |
| "rewards/margins": 0.6363339424133301, | |
| "rewards/rejected": -0.5518972873687744, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005514 | |
| }, | |
| { | |
| "epoch": 0.033887193968886314, | |
| "grad_norm": 3.6079483032226562, | |
| "learning_rate": 0.00013548387096774193, | |
| "logits/chosen": -0.5233692526817322, | |
| "logits/rejected": -0.5257354378700256, | |
| "logps/chosen": -11.989986419677734, | |
| "logps/rejected": -17.48329734802246, | |
| "loss": 0.9667509198188782, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4528670608997345, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14738641679286957, | |
| "rewards/margins": 0.5997685194015503, | |
| "rewards/rejected": -0.4523821473121643, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005512 | |
| }, | |
| { | |
| "epoch": 0.03469403192052646, | |
| "grad_norm": 5.491096019744873, | |
| "learning_rate": 0.00013870967741935487, | |
| "logits/chosen": -0.5798231363296509, | |
| "logits/rejected": -0.5843824148178101, | |
| "logps/chosen": -8.180625915527344, | |
| "logps/rejected": -19.614505767822266, | |
| "loss": 1.0811830759048462, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5651165246963501, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.018763888627290726, | |
| "rewards/margins": 0.5782932043075562, | |
| "rewards/rejected": -0.5595293641090393, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.035500869872166614, | |
| "grad_norm": 5.715328216552734, | |
| "learning_rate": 0.00014193548387096775, | |
| "logits/chosen": -0.5562050342559814, | |
| "logits/rejected": -0.5585284233093262, | |
| "logps/chosen": -9.799619674682617, | |
| "logps/rejected": -13.962825775146484, | |
| "loss": 1.046175479888916, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5247361660003662, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0660993829369545, | |
| "rewards/margins": 0.557608425617218, | |
| "rewards/rejected": -0.4915090799331665, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.03630770782380676, | |
| "grad_norm": 4.065413951873779, | |
| "learning_rate": 0.00014516129032258066, | |
| "logits/chosen": -0.5717958807945251, | |
| "logits/rejected": -0.5754877924919128, | |
| "logps/chosen": -10.432125091552734, | |
| "logps/rejected": -17.75714111328125, | |
| "loss": 0.9775079488754272, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4804929792881012, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.16446207463741302, | |
| "rewards/margins": 0.5844215154647827, | |
| "rewards/rejected": -0.4199594557285309, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005513 | |
| }, | |
| { | |
| "epoch": 0.037114545775446914, | |
| "grad_norm": 4.507160663604736, | |
| "learning_rate": 0.00014838709677419355, | |
| "logits/chosen": -0.5544827580451965, | |
| "logits/rejected": -0.5517963171005249, | |
| "logps/chosen": -10.039278030395508, | |
| "logps/rejected": -16.44822120666504, | |
| "loss": 0.9198786020278931, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3649781346321106, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11493994295597076, | |
| "rewards/margins": 0.5548471808433533, | |
| "rewards/rejected": -0.4399072825908661, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005512 | |
| }, | |
| { | |
| "epoch": 0.03792138372708706, | |
| "grad_norm": 4.040234565734863, | |
| "learning_rate": 0.00015161290322580646, | |
| "logits/chosen": -0.5704259276390076, | |
| "logits/rejected": -0.5716680884361267, | |
| "logps/chosen": -7.400537967681885, | |
| "logps/rejected": -17.6054744720459, | |
| "loss": 0.9134971499443054, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3412809669971466, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.03388240188360214, | |
| "rewards/margins": 0.4440326392650604, | |
| "rewards/rejected": -0.4101502001285553, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005512 | |
| }, | |
| { | |
| "epoch": 0.038728221678727213, | |
| "grad_norm": 2.9642419815063477, | |
| "learning_rate": 0.00015483870967741937, | |
| "logits/chosen": -0.5867742300033569, | |
| "logits/rejected": -0.5912387371063232, | |
| "logps/chosen": -9.146940231323242, | |
| "logps/rejected": -16.374706268310547, | |
| "loss": 0.9059248566627502, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3897300958633423, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1047089472413063, | |
| "rewards/margins": 0.5065208673477173, | |
| "rewards/rejected": -0.4018118679523468, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005514 | |
| }, | |
| { | |
| "epoch": 0.03953505963036737, | |
| "grad_norm": 3.087217330932617, | |
| "learning_rate": 0.00015806451612903225, | |
| "logits/chosen": -0.5874481201171875, | |
| "logits/rejected": -0.5872229337692261, | |
| "logps/chosen": -6.086337566375732, | |
| "logps/rejected": -10.504037857055664, | |
| "loss": 0.8798851370811462, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33263421058654785, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20601165294647217, | |
| "rewards/margins": 0.4658709466457367, | |
| "rewards/rejected": -0.2598593533039093, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005513 | |
| }, | |
| { | |
| "epoch": 0.04034189758200751, | |
| "grad_norm": 3.16754150390625, | |
| "learning_rate": 0.00016129032258064516, | |
| "logits/chosen": -0.5708128809928894, | |
| "logits/rejected": -0.5798742175102234, | |
| "logps/chosen": -6.393083572387695, | |
| "logps/rejected": -19.668724060058594, | |
| "loss": 0.8404853343963623, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34996694326400757, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.21206828951835632, | |
| "rewards/margins": 0.5756057500839233, | |
| "rewards/rejected": -0.363537460565567, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.005516 | |
| }, | |
| { | |
| "epoch": 0.041148735533647667, | |
| "grad_norm": 2.4009766578674316, | |
| "learning_rate": 0.00016451612903225807, | |
| "logits/chosen": -0.5599406361579895, | |
| "logits/rejected": -0.5625043511390686, | |
| "logps/chosen": -7.262391090393066, | |
| "logps/rejected": -15.73720932006836, | |
| "loss": 0.8113247752189636, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28076890110969543, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14269490540027618, | |
| "rewards/margins": 0.47564250230789185, | |
| "rewards/rejected": -0.33294758200645447, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.04195557348528781, | |
| "grad_norm": 3.129634380340576, | |
| "learning_rate": 0.00016774193548387098, | |
| "logits/chosen": -0.5937235355377197, | |
| "logits/rejected": -0.5938248038291931, | |
| "logps/chosen": -5.393199920654297, | |
| "logps/rejected": -15.786672592163086, | |
| "loss": 0.7831435799598694, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2872075140476227, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19873687624931335, | |
| "rewards/margins": 0.5569283366203308, | |
| "rewards/rejected": -0.35819149017333984, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.042762411436927966, | |
| "grad_norm": 3.2887256145477295, | |
| "learning_rate": 0.0001709677419354839, | |
| "logits/chosen": -0.5820189118385315, | |
| "logits/rejected": -0.5850119590759277, | |
| "logps/chosen": -7.764882564544678, | |
| "logps/rejected": -16.894685745239258, | |
| "loss": 0.8994213342666626, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3770924210548401, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20706558227539062, | |
| "rewards/margins": 0.5472366213798523, | |
| "rewards/rejected": -0.34017103910446167, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.04356924938856811, | |
| "grad_norm": 3.7313735485076904, | |
| "learning_rate": 0.00017419354838709678, | |
| "logits/chosen": -0.5833962559700012, | |
| "logits/rejected": -0.5876143574714661, | |
| "logps/chosen": -8.130949020385742, | |
| "logps/rejected": -20.79953384399414, | |
| "loss": 0.9545141458511353, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4539381265640259, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.10515612363815308, | |
| "rewards/margins": 0.612572968006134, | |
| "rewards/rejected": -0.5074167847633362, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.044376087340208266, | |
| "grad_norm": 5.652868747711182, | |
| "learning_rate": 0.0001774193548387097, | |
| "logits/chosen": -0.5960416793823242, | |
| "logits/rejected": -0.5957224369049072, | |
| "logps/chosen": -12.674562454223633, | |
| "logps/rejected": -15.591826438903809, | |
| "loss": 1.1736092567443848, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5310375690460205, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.11839848756790161, | |
| "rewards/margins": 0.40016603469848633, | |
| "rewards/rejected": -0.5185645222663879, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.04518292529184841, | |
| "grad_norm": 4.002370834350586, | |
| "learning_rate": 0.00018064516129032257, | |
| "logits/chosen": -0.5776931643486023, | |
| "logits/rejected": -0.5789185166358948, | |
| "logps/chosen": -12.67449951171875, | |
| "logps/rejected": -16.919376373291016, | |
| "loss": 1.087173342704773, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4873568117618561, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.15739397704601288, | |
| "rewards/margins": 0.39120250940322876, | |
| "rewards/rejected": -0.5485965013504028, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.045989763243488566, | |
| "grad_norm": 3.5529890060424805, | |
| "learning_rate": 0.00018387096774193548, | |
| "logits/chosen": -0.5732367634773254, | |
| "logits/rejected": -0.5760124921798706, | |
| "logps/chosen": -4.22891902923584, | |
| "logps/rejected": -18.773733139038086, | |
| "loss": 0.6395769119262695, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.23632453382015228, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12576641142368317, | |
| "rewards/margins": 0.908116340637207, | |
| "rewards/rejected": -0.7823498845100403, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.04679660119512872, | |
| "grad_norm": 2.638253927230835, | |
| "learning_rate": 0.0001870967741935484, | |
| "logits/chosen": -0.5618959069252014, | |
| "logits/rejected": -0.5671476721763611, | |
| "logps/chosen": -8.717156410217285, | |
| "logps/rejected": -22.3723087310791, | |
| "loss": 0.8119103312492371, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4192086458206177, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18826748430728912, | |
| "rewards/margins": 0.8515651226043701, | |
| "rewards/rejected": -0.6632976531982422, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.047603439146768865, | |
| "grad_norm": 4.416356086730957, | |
| "learning_rate": 0.0001903225806451613, | |
| "logits/chosen": -0.5946109294891357, | |
| "logits/rejected": -0.5949057340621948, | |
| "logps/chosen": -10.825102806091309, | |
| "logps/rejected": -15.580466270446777, | |
| "loss": 0.9124961495399475, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43738603591918945, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1081230640411377, | |
| "rewards/margins": 0.6975550651550293, | |
| "rewards/rejected": -0.5894321203231812, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.04841027709840902, | |
| "grad_norm": 3.548480272293091, | |
| "learning_rate": 0.00019354838709677422, | |
| "logits/chosen": -0.576353907585144, | |
| "logits/rejected": -0.5807583928108215, | |
| "logps/chosen": -10.603282928466797, | |
| "logps/rejected": -20.904390335083008, | |
| "loss": 1.033903956413269, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5458623170852661, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.10141083598136902, | |
| "rewards/margins": 0.9133819341659546, | |
| "rewards/rejected": -0.8119711875915527, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.049217115050049165, | |
| "grad_norm": 4.239978790283203, | |
| "learning_rate": 0.0001967741935483871, | |
| "logits/chosen": -0.6159774661064148, | |
| "logits/rejected": -0.6157845258712769, | |
| "logps/chosen": -13.034204483032227, | |
| "logps/rejected": -21.466520309448242, | |
| "loss": 0.9954748153686523, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5168237090110779, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.15371613204479218, | |
| "rewards/margins": 0.9087806940078735, | |
| "rewards/rejected": -1.0624967813491821, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.05002395300168932, | |
| "grad_norm": 4.418153285980225, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.586484968662262, | |
| "logits/rejected": -0.5885915756225586, | |
| "logps/chosen": -6.359810829162598, | |
| "logps/rejected": -18.686431884765625, | |
| "loss": 0.7993831634521484, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3223803639411926, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1565569043159485, | |
| "rewards/margins": 0.8297788500785828, | |
| "rewards/rejected": -0.6732219457626343, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.050830790953329465, | |
| "grad_norm": 3.898704767227173, | |
| "learning_rate": 0.00019999964378142156, | |
| "logits/chosen": -0.5732013583183289, | |
| "logits/rejected": -0.5774887800216675, | |
| "logps/chosen": -12.98630142211914, | |
| "logps/rejected": -19.34124755859375, | |
| "loss": 0.9075384140014648, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39192017912864685, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.19289077818393707, | |
| "rewards/margins": 0.6732712388038635, | |
| "rewards/rejected": -0.48038047552108765, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.05163762890496962, | |
| "grad_norm": 6.278528213500977, | |
| "learning_rate": 0.00019999857512822402, | |
| "logits/chosen": -0.6075332760810852, | |
| "logits/rejected": -0.6084203124046326, | |
| "logps/chosen": -14.246075630187988, | |
| "logps/rejected": -20.948959350585938, | |
| "loss": 1.0685752630233765, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5815572142601013, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.03303433582186699, | |
| "rewards/margins": 0.8266364336013794, | |
| "rewards/rejected": -0.8596707582473755, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.052444466856609764, | |
| "grad_norm": 4.589393615722656, | |
| "learning_rate": 0.00019999679404802089, | |
| "logits/chosen": -0.596097469329834, | |
| "logits/rejected": -0.5986034870147705, | |
| "logps/chosen": -8.450502395629883, | |
| "logps/rejected": -21.070066452026367, | |
| "loss": 0.7867013812065125, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31530463695526123, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13920006155967712, | |
| "rewards/margins": 0.9423296451568604, | |
| "rewards/rejected": -0.8031294941902161, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005508 | |
| }, | |
| { | |
| "epoch": 0.05325130480824992, | |
| "grad_norm": 4.376217365264893, | |
| "learning_rate": 0.00019999430055350122, | |
| "logits/chosen": -0.5758836269378662, | |
| "logits/rejected": -0.5734565854072571, | |
| "logps/chosen": -10.774827003479004, | |
| "logps/rejected": -19.021907806396484, | |
| "loss": 0.7909982800483704, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3997192680835724, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23606787621974945, | |
| "rewards/margins": 1.0521141290664673, | |
| "rewards/rejected": -0.8160461783409119, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.05405814275989007, | |
| "grad_norm": 6.438971042633057, | |
| "learning_rate": 0.00019999109466242962, | |
| "logits/chosen": -0.5718088150024414, | |
| "logits/rejected": -0.5745964050292969, | |
| "logps/chosen": -6.671931266784668, | |
| "logps/rejected": -20.429231643676758, | |
| "loss": 0.8954067230224609, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45071539282798767, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10935470461845398, | |
| "rewards/margins": 0.8583554029464722, | |
| "rewards/rejected": -0.7490006685256958, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005509 | |
| }, | |
| { | |
| "epoch": 0.05486498071153022, | |
| "grad_norm": 11.16286849975586, | |
| "learning_rate": 0.00019998717639764602, | |
| "logits/chosen": -0.5820534229278564, | |
| "logits/rejected": -0.5849663019180298, | |
| "logps/chosen": -9.799468040466309, | |
| "logps/rejected": -18.977890014648438, | |
| "loss": 1.29269278049469, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7049438953399658, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.04825415089726448, | |
| "rewards/margins": 0.5465254783630371, | |
| "rewards/rejected": -0.5947796702384949, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.05567181866317037, | |
| "grad_norm": 9.413622856140137, | |
| "learning_rate": 0.00019998254578706563, | |
| "logits/chosen": -0.5850585699081421, | |
| "logits/rejected": -0.5874402523040771, | |
| "logps/chosen": -8.903966903686523, | |
| "logps/rejected": -14.843938827514648, | |
| "loss": 1.3027069568634033, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.744307279586792, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0512365885078907, | |
| "rewards/margins": 0.5854336619377136, | |
| "rewards/rejected": -0.6366702318191528, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.05647865661481052, | |
| "grad_norm": 7.333382606506348, | |
| "learning_rate": 0.00019997720286367863, | |
| "logits/chosen": -0.545200765132904, | |
| "logits/rejected": -0.5484716296195984, | |
| "logps/chosen": -7.334113121032715, | |
| "logps/rejected": -22.56316375732422, | |
| "loss": 1.0189334154129028, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5383400321006775, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.061847541481256485, | |
| "rewards/margins": 0.6559779644012451, | |
| "rewards/rejected": -0.5941305160522461, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.05728549456645067, | |
| "grad_norm": 2.8849799633026123, | |
| "learning_rate": 0.00019997114766554997, | |
| "logits/chosen": -0.5629354119300842, | |
| "logits/rejected": -0.5669021606445312, | |
| "logps/chosen": -8.698752403259277, | |
| "logps/rejected": -21.85867691040039, | |
| "loss": 0.8375651836395264, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3549819886684418, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.09854352474212646, | |
| "rewards/margins": 0.7027413845062256, | |
| "rewards/rejected": -0.6041979193687439, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.05809233251809082, | |
| "grad_norm": 2.6733391284942627, | |
| "learning_rate": 0.00019996438023581913, | |
| "logits/chosen": -0.5319232940673828, | |
| "logits/rejected": -0.5331096649169922, | |
| "logps/chosen": -10.13166332244873, | |
| "logps/rejected": -13.18635368347168, | |
| "loss": 1.014970302581787, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4217461347579956, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.14793364703655243, | |
| "rewards/margins": 0.3788456618785858, | |
| "rewards/rejected": -0.2309119999408722, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005505 | |
| }, | |
| { | |
| "epoch": 0.05889917046973097, | |
| "grad_norm": 2.497257947921753, | |
| "learning_rate": 0.00019995690062269984, | |
| "logits/chosen": -0.5789859294891357, | |
| "logits/rejected": -0.5805359482765198, | |
| "logps/chosen": -8.139568328857422, | |
| "logps/rejected": -10.85029411315918, | |
| "loss": 0.9546566605567932, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4216194450855255, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.24104151129722595, | |
| "rewards/margins": 0.5254760980606079, | |
| "rewards/rejected": -0.28443461656570435, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.05970600842137112, | |
| "grad_norm": 2.8535268306732178, | |
| "learning_rate": 0.00019994870887947962, | |
| "logits/chosen": -0.5778383612632751, | |
| "logits/rejected": -0.5768096446990967, | |
| "logps/chosen": -8.49053955078125, | |
| "logps/rejected": -12.854878425598145, | |
| "loss": 1.0000758171081543, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37848562002182007, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1054978221654892, | |
| "rewards/margins": 0.3462926149368286, | |
| "rewards/rejected": -0.24079479277133942, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.06051284637301127, | |
| "grad_norm": 2.198607921600342, | |
| "learning_rate": 0.00019993980506451947, | |
| "logits/chosen": -0.530400276184082, | |
| "logits/rejected": -0.530858039855957, | |
| "logps/chosen": -9.152666091918945, | |
| "logps/rejected": -11.464343070983887, | |
| "loss": 0.9745745658874512, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38881367444992065, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1783803254365921, | |
| "rewards/margins": 0.3315035402774811, | |
| "rewards/rejected": -0.1531231850385666, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.06131968432465142, | |
| "grad_norm": 2.461601972579956, | |
| "learning_rate": 0.0001999301892412535, | |
| "logits/chosen": -0.5405219197273254, | |
| "logits/rejected": -0.5390282869338989, | |
| "logps/chosen": -10.537997245788574, | |
| "logps/rejected": -15.066913604736328, | |
| "loss": 0.966386079788208, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38977545499801636, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.09291838109493256, | |
| "rewards/margins": 0.3533533811569214, | |
| "rewards/rejected": -0.26043495535850525, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06212652227629157, | |
| "grad_norm": 2.0999796390533447, | |
| "learning_rate": 0.00019991986147818838, | |
| "logits/chosen": -0.5443933010101318, | |
| "logits/rejected": -0.5435047149658203, | |
| "logps/chosen": -12.143755912780762, | |
| "logps/rejected": -15.766691207885742, | |
| "loss": 0.8939065337181091, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.415660560131073, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23248028755187988, | |
| "rewards/margins": 0.5352811217308044, | |
| "rewards/rejected": -0.30280083417892456, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.06293336022793172, | |
| "grad_norm": 2.9244306087493896, | |
| "learning_rate": 0.00019990882184890295, | |
| "logits/chosen": -0.5794655680656433, | |
| "logits/rejected": -0.5853484869003296, | |
| "logps/chosen": -7.884565353393555, | |
| "logps/rejected": -20.136926651000977, | |
| "loss": 0.8564450740814209, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34705159068107605, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.14532405138015747, | |
| "rewards/margins": 0.5069437623023987, | |
| "rewards/rejected": -0.3616198003292084, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.06374019817957187, | |
| "grad_norm": 3.461670160293579, | |
| "learning_rate": 0.00019989707043204763, | |
| "logits/chosen": -0.5491142868995667, | |
| "logits/rejected": -0.553898811340332, | |
| "logps/chosen": -7.547114372253418, | |
| "logps/rejected": -18.740121841430664, | |
| "loss": 0.9405392408370972, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48508715629577637, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.128400981426239, | |
| "rewards/margins": 0.6999501585960388, | |
| "rewards/rejected": -0.5715491771697998, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.06454703613121202, | |
| "grad_norm": 4.165892601013184, | |
| "learning_rate": 0.0001998846073113439, | |
| "logits/chosen": -0.6084208488464355, | |
| "logits/rejected": -0.6092680096626282, | |
| "logps/chosen": -12.750446319580078, | |
| "logps/rejected": -19.53608512878418, | |
| "loss": 1.0978946685791016, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5877176523208618, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1369042694568634, | |
| "rewards/margins": 0.6248282194137573, | |
| "rewards/rejected": -0.48792392015457153, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06535387408285218, | |
| "grad_norm": 2.287846565246582, | |
| "learning_rate": 0.00019987143257558365, | |
| "logits/chosen": -0.59499192237854, | |
| "logits/rejected": -0.5972949862480164, | |
| "logps/chosen": -4.519835948944092, | |
| "logps/rejected": -19.02901840209961, | |
| "loss": 0.58124840259552, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.15051494538784027, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19695766270160675, | |
| "rewards/margins": 0.9730147123336792, | |
| "rewards/rejected": -0.7760570049285889, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.005506 | |
| }, | |
| { | |
| "epoch": 0.06616071203449232, | |
| "grad_norm": 7.103982448577881, | |
| "learning_rate": 0.00019985754631862855, | |
| "logits/chosen": -0.5857492089271545, | |
| "logits/rejected": -0.5895102024078369, | |
| "logps/chosen": -8.903070449829102, | |
| "logps/rejected": -26.571044921875, | |
| "loss": 0.7599916458129883, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3342111110687256, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14196240901947021, | |
| "rewards/margins": 0.8281382322311401, | |
| "rewards/rejected": -0.6861758232116699, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.06696754998613247, | |
| "grad_norm": 3.764488697052002, | |
| "learning_rate": 0.00019984294863940955, | |
| "logits/chosen": -0.6067830324172974, | |
| "logits/rejected": -0.6086009740829468, | |
| "logps/chosen": -9.9881591796875, | |
| "logps/rejected": -19.09541893005371, | |
| "loss": 0.9752427339553833, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5045859217643738, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.14939813315868378, | |
| "rewards/margins": 0.8939868211746216, | |
| "rewards/rejected": -0.7445887327194214, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06777438793777263, | |
| "grad_norm": 3.3293344974517822, | |
| "learning_rate": 0.00019982763964192585, | |
| "logits/chosen": -0.6330868601799011, | |
| "logits/rejected": -0.6393448710441589, | |
| "logps/chosen": -4.902453899383545, | |
| "logps/rejected": -24.94113540649414, | |
| "loss": 0.7244248390197754, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3735058009624481, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17604736983776093, | |
| "rewards/margins": 1.2982165813446045, | |
| "rewards/rejected": -1.1221693754196167, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.06858122588941278, | |
| "grad_norm": 5.892284393310547, | |
| "learning_rate": 0.00019981161943524443, | |
| "logits/chosen": -0.6240598559379578, | |
| "logits/rejected": -0.620481550693512, | |
| "logps/chosen": -14.60393238067627, | |
| "logps/rejected": -13.365829467773438, | |
| "loss": 1.1541650295257568, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48222166299819946, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.09302416443824768, | |
| "rewards/margins": 0.41544342041015625, | |
| "rewards/rejected": -0.5084675550460815, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.0055 | |
| }, | |
| { | |
| "epoch": 0.06938806384105292, | |
| "grad_norm": 4.056751251220703, | |
| "learning_rate": 0.00019979488813349933, | |
| "logits/chosen": -0.6613398194313049, | |
| "logits/rejected": -0.6640070080757141, | |
| "logps/chosen": -9.50975227355957, | |
| "logps/rejected": -21.119707107543945, | |
| "loss": 0.8987840414047241, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.52927565574646, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1999521553516388, | |
| "rewards/margins": 1.1560636758804321, | |
| "rewards/rejected": -0.956111490726471, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.07019490179269307, | |
| "grad_norm": 4.351650238037109, | |
| "learning_rate": 0.0001997774458558904, | |
| "logits/chosen": -0.6547818779945374, | |
| "logits/rejected": -0.6571143269538879, | |
| "logps/chosen": -8.668737411499023, | |
| "logps/rejected": -20.79534149169922, | |
| "loss": 0.9775034785270691, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4770965874195099, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.02099284902215004, | |
| "rewards/margins": 0.8633284568786621, | |
| "rewards/rejected": -0.84233558177948, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.07100173974433323, | |
| "grad_norm": 2.8774800300598145, | |
| "learning_rate": 0.00019975929272668296, | |
| "logits/chosen": -0.6759516000747681, | |
| "logits/rejected": -0.6824960708618164, | |
| "logps/chosen": -4.7266716957092285, | |
| "logps/rejected": -26.10918426513672, | |
| "loss": 0.5549903512001038, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.271104097366333, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25939324498176575, | |
| "rewards/margins": 1.6003111600875854, | |
| "rewards/rejected": -1.340917944908142, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.07180857769597337, | |
| "grad_norm": 2.8334577083587646, | |
| "learning_rate": 0.00019974042887520668, | |
| "logits/chosen": -0.6535760164260864, | |
| "logits/rejected": -0.6572569608688354, | |
| "logps/chosen": -13.957544326782227, | |
| "logps/rejected": -18.16533851623535, | |
| "loss": 0.9486314654350281, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5478147268295288, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2579638957977295, | |
| "rewards/margins": 0.9477146863937378, | |
| "rewards/rejected": -0.6897507905960083, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.07261541564761352, | |
| "grad_norm": 5.422155380249023, | |
| "learning_rate": 0.00019972085443585463, | |
| "logits/chosen": -0.6767461895942688, | |
| "logits/rejected": -0.6799700260162354, | |
| "logps/chosen": -7.507997512817383, | |
| "logps/rejected": -20.19240951538086, | |
| "loss": 0.8118898868560791, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4057508111000061, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11586537212133408, | |
| "rewards/margins": 1.0757473707199097, | |
| "rewards/rejected": -0.9598820805549622, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.07342225359925368, | |
| "grad_norm": 5.541498184204102, | |
| "learning_rate": 0.0001997005695480824, | |
| "logits/chosen": -0.6398351788520813, | |
| "logits/rejected": -0.642162024974823, | |
| "logps/chosen": -10.117485046386719, | |
| "logps/rejected": -21.747928619384766, | |
| "loss": 0.8823437094688416, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.47223997116088867, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.04489222913980484, | |
| "rewards/margins": 1.1613836288452148, | |
| "rewards/rejected": -1.2062758207321167, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005504 | |
| }, | |
| { | |
| "epoch": 0.07422909155089383, | |
| "grad_norm": 2.0107967853546143, | |
| "learning_rate": 0.000199679574356407, | |
| "logits/chosen": -0.6938130855560303, | |
| "logits/rejected": -0.7009856104850769, | |
| "logps/chosen": -6.915675163269043, | |
| "logps/rejected": -28.84608268737793, | |
| "loss": 0.5776476860046387, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3677330017089844, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3187498152256012, | |
| "rewards/margins": 1.8727707862854004, | |
| "rewards/rejected": -1.554020881652832, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07503592950253397, | |
| "grad_norm": 3.5870676040649414, | |
| "learning_rate": 0.0001996578690104061, | |
| "logits/chosen": -0.673453688621521, | |
| "logits/rejected": -0.676167905330658, | |
| "logps/chosen": -10.7222318649292, | |
| "logps/rejected": -28.77056884765625, | |
| "loss": 0.950826108455658, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5682229399681091, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09744307398796082, | |
| "rewards/margins": 1.4789444208145142, | |
| "rewards/rejected": -1.381501317024231, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07584276745417412, | |
| "grad_norm": 4.2534661293029785, | |
| "learning_rate": 0.00019963545366471653, | |
| "logits/chosen": -0.6709739565849304, | |
| "logits/rejected": -0.6747978925704956, | |
| "logps/chosen": -8.219854354858398, | |
| "logps/rejected": -29.13772201538086, | |
| "loss": 0.6954976320266724, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35414204001426697, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10512235760688782, | |
| "rewards/margins": 1.6458101272583008, | |
| "rewards/rejected": -1.5406877994537354, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.07664960540581428, | |
| "grad_norm": 7.663514614105225, | |
| "learning_rate": 0.0001996123284790336, | |
| "logits/chosen": -0.6834441423416138, | |
| "logits/rejected": -0.6848198771476746, | |
| "logps/chosen": -17.666513442993164, | |
| "logps/rejected": -19.222387313842773, | |
| "loss": 1.197723388671875, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6848238110542297, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.06468406319618225, | |
| "rewards/margins": 0.8658308982849121, | |
| "rewards/rejected": -0.9305148720741272, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07745644335745443, | |
| "grad_norm": 16.187767028808594, | |
| "learning_rate": 0.0001995884936181097, | |
| "logits/chosen": -0.7171504497528076, | |
| "logits/rejected": -0.7210450172424316, | |
| "logps/chosen": -4.8772172927856445, | |
| "logps/rejected": -27.164329528808594, | |
| "loss": 0.7958053946495056, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.437197208404541, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04156189411878586, | |
| "rewards/margins": 1.4321556091308594, | |
| "rewards/rejected": -1.3905936479568481, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07826328130909457, | |
| "grad_norm": 4.373692989349365, | |
| "learning_rate": 0.00019956394925175328, | |
| "logits/chosen": -0.720712423324585, | |
| "logits/rejected": -0.7263769507408142, | |
| "logps/chosen": -8.969646453857422, | |
| "logps/rejected": -27.35487174987793, | |
| "loss": 0.8684384822845459, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4593147337436676, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.039580605924129486, | |
| "rewards/margins": 1.404889702796936, | |
| "rewards/rejected": -1.3653091192245483, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07907011926073473, | |
| "grad_norm": 3.1712353229522705, | |
| "learning_rate": 0.00019953869555482752, | |
| "logits/chosen": -0.6926038265228271, | |
| "logits/rejected": -0.6906510591506958, | |
| "logps/chosen": -10.361411094665527, | |
| "logps/rejected": -19.763336181640625, | |
| "loss": 1.0741034746170044, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5404018759727478, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0025314167141914368, | |
| "rewards/margins": 0.9160726070404053, | |
| "rewards/rejected": -0.9135411381721497, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.07987695721237488, | |
| "grad_norm": 5.8308796882629395, | |
| "learning_rate": 0.00019951273270724906, | |
| "logits/chosen": -0.6417246460914612, | |
| "logits/rejected": -0.6460192203521729, | |
| "logps/chosen": -10.923144340515137, | |
| "logps/rejected": -23.332698822021484, | |
| "loss": 1.129643201828003, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5929185748100281, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.004452264867722988, | |
| "rewards/margins": 0.6838414669036865, | |
| "rewards/rejected": -0.6882937550544739, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.08068379516401503, | |
| "grad_norm": 4.135215759277344, | |
| "learning_rate": 0.00019948606089398698, | |
| "logits/chosen": -0.6685535907745361, | |
| "logits/rejected": -0.6693455576896667, | |
| "logps/chosen": -11.88547134399414, | |
| "logps/rejected": -19.97165298461914, | |
| "loss": 0.9190454483032227, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39345046877861023, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.05392542481422424, | |
| "rewards/margins": 0.8620406985282898, | |
| "rewards/rejected": -0.8081153035163879, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.08149063311565517, | |
| "grad_norm": 3.957230806350708, | |
| "learning_rate": 0.0001994586803050611, | |
| "logits/chosen": -0.6953858137130737, | |
| "logits/rejected": -0.6939084529876709, | |
| "logps/chosen": -11.101150512695312, | |
| "logps/rejected": -19.7403621673584, | |
| "loss": 1.0100737810134888, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45983725786209106, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.061330053955316544, | |
| "rewards/margins": 0.847295880317688, | |
| "rewards/rejected": -0.7859657406806946, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08229747106729533, | |
| "grad_norm": 2.8322761058807373, | |
| "learning_rate": 0.00019943059113554097, | |
| "logits/chosen": -0.6899937987327576, | |
| "logits/rejected": -0.6942430734634399, | |
| "logps/chosen": -8.74088191986084, | |
| "logps/rejected": -20.522974014282227, | |
| "loss": 0.8782400488853455, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3525587320327759, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05973733961582184, | |
| "rewards/margins": 0.882931113243103, | |
| "rewards/rejected": -0.8231937289237976, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08310430901893548, | |
| "grad_norm": 2.8728346824645996, | |
| "learning_rate": 0.00019940179358554424, | |
| "logits/chosen": -0.6615633964538574, | |
| "logits/rejected": -0.6650048494338989, | |
| "logps/chosen": -8.035341262817383, | |
| "logps/rejected": -13.233177185058594, | |
| "loss": 0.95281982421875, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39267757534980774, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.12954209744930267, | |
| "rewards/margins": 0.4833866357803345, | |
| "rewards/rejected": -0.3538445234298706, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.08391114697057563, | |
| "grad_norm": 2.8015527725219727, | |
| "learning_rate": 0.00019937228786023542, | |
| "logits/chosen": -0.6321871280670166, | |
| "logits/rejected": -0.6367396116256714, | |
| "logps/chosen": -9.781261444091797, | |
| "logps/rejected": -18.408084869384766, | |
| "loss": 0.9027690887451172, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4244646430015564, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18980520963668823, | |
| "rewards/margins": 0.7434633374214172, | |
| "rewards/rejected": -0.5536580681800842, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08471798492221577, | |
| "grad_norm": 3.581929922103882, | |
| "learning_rate": 0.00019934207416982415, | |
| "logits/chosen": -0.6718648076057434, | |
| "logits/rejected": -0.6737468242645264, | |
| "logps/chosen": -10.535398483276367, | |
| "logps/rejected": -15.517889022827148, | |
| "loss": 0.9467408657073975, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4431319832801819, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.24101108312606812, | |
| "rewards/margins": 0.5848699808120728, | |
| "rewards/rejected": -0.34385889768600464, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.08552482287385593, | |
| "grad_norm": 2.7180511951446533, | |
| "learning_rate": 0.00019931115272956405, | |
| "logits/chosen": -0.6360980272293091, | |
| "logits/rejected": -0.6395881175994873, | |
| "logps/chosen": -5.562260627746582, | |
| "logps/rejected": -16.978702545166016, | |
| "loss": 0.9048807621002197, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3790769577026367, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1927444040775299, | |
| "rewards/margins": 0.6174324750900269, | |
| "rewards/rejected": -0.42468804121017456, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.08633166082549608, | |
| "grad_norm": 2.7166309356689453, | |
| "learning_rate": 0.00019927952375975094, | |
| "logits/chosen": -0.6151095628738403, | |
| "logits/rejected": -0.6214062571525574, | |
| "logps/chosen": -8.704106330871582, | |
| "logps/rejected": -15.980009078979492, | |
| "loss": 0.9614640474319458, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41800737380981445, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.22499363124370575, | |
| "rewards/margins": 0.5540027618408203, | |
| "rewards/rejected": -0.32900911569595337, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.08713849877713623, | |
| "grad_norm": 3.3143904209136963, | |
| "learning_rate": 0.00019924718748572136, | |
| "logits/chosen": -0.6602830290794373, | |
| "logits/rejected": -0.6590928435325623, | |
| "logps/chosen": -14.48482608795166, | |
| "logps/rejected": -13.489812850952148, | |
| "loss": 1.1007349491119385, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38938888907432556, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.005462644621729851, | |
| "rewards/margins": 0.18356555700302124, | |
| "rewards/rejected": -0.18902820348739624, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.08794533672877639, | |
| "grad_norm": 3.3967649936676025, | |
| "learning_rate": 0.00019921414413785095, | |
| "logits/chosen": -0.6139819025993347, | |
| "logits/rejected": -0.6160064935684204, | |
| "logps/chosen": -10.462146759033203, | |
| "logps/rejected": -13.9368896484375, | |
| "loss": 1.1163440942764282, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5643093585968018, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.13518843054771423, | |
| "rewards/margins": 0.5490553379058838, | |
| "rewards/rejected": -0.41386690735816956, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.08875217468041653, | |
| "grad_norm": 2.125051498413086, | |
| "learning_rate": 0.00019918039395155278, | |
| "logits/chosen": -0.5581845641136169, | |
| "logits/rejected": -0.5609419345855713, | |
| "logps/chosen": -8.664159774780273, | |
| "logps/rejected": -16.96472930908203, | |
| "loss": 0.8410020470619202, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3336779773235321, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.24867044389247894, | |
| "rewards/margins": 0.6479009985923767, | |
| "rewards/rejected": -0.3992305099964142, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.08955901263205668, | |
| "grad_norm": 2.7272698879241943, | |
| "learning_rate": 0.00019914593716727574, | |
| "logits/chosen": -0.640306830406189, | |
| "logits/rejected": -0.6392278075218201, | |
| "logps/chosen": -10.320524215698242, | |
| "logps/rejected": -15.357645034790039, | |
| "loss": 0.9050614237785339, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3744095265865326, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.228946715593338, | |
| "rewards/margins": 0.46916335821151733, | |
| "rewards/rejected": -0.24021662771701813, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09036585058369682, | |
| "grad_norm": 2.552009344100952, | |
| "learning_rate": 0.0001991107740305027, | |
| "logits/chosen": -0.6064003109931946, | |
| "logits/rejected": -0.607029914855957, | |
| "logps/chosen": -10.730403900146484, | |
| "logps/rejected": -20.569438934326172, | |
| "loss": 0.9093858003616333, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4844813346862793, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.320293128490448, | |
| "rewards/margins": 0.8029977083206177, | |
| "rewards/rejected": -0.48270460963249207, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09117268853533698, | |
| "grad_norm": 2.875828742980957, | |
| "learning_rate": 0.00019907490479174902, | |
| "logits/chosen": -0.6465886831283569, | |
| "logits/rejected": -0.6483381986618042, | |
| "logps/chosen": -6.758854389190674, | |
| "logps/rejected": -20.76754379272461, | |
| "loss": 0.7010505199432373, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29428812861442566, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3071742653846741, | |
| "rewards/margins": 1.1479661464691162, | |
| "rewards/rejected": -0.8407919406890869, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.09197952648697713, | |
| "grad_norm": 2.3188178539276123, | |
| "learning_rate": 0.00019903832970656038, | |
| "logits/chosen": -0.6288142800331116, | |
| "logits/rejected": -0.6315409541130066, | |
| "logps/chosen": -8.855584144592285, | |
| "logps/rejected": -20.421592712402344, | |
| "loss": 0.841801106929779, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38135236501693726, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19283419847488403, | |
| "rewards/margins": 0.8724038004875183, | |
| "rewards/rejected": -0.6795696020126343, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09278636443861728, | |
| "grad_norm": 3.3676164150238037, | |
| "learning_rate": 0.00019900104903551133, | |
| "logits/chosen": -0.6541582345962524, | |
| "logits/rejected": -0.6580868363380432, | |
| "logps/chosen": -8.595276832580566, | |
| "logps/rejected": -24.14297866821289, | |
| "loss": 0.7960852980613708, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4363185465335846, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10038560628890991, | |
| "rewards/margins": 1.4183127880096436, | |
| "rewards/rejected": -1.3179271221160889, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.09359320239025744, | |
| "grad_norm": 3.721660614013672, | |
| "learning_rate": 0.00019896306304420324, | |
| "logits/chosen": -0.6533216834068298, | |
| "logits/rejected": -0.6518760919570923, | |
| "logps/chosen": -9.710081100463867, | |
| "logps/rejected": -20.333324432373047, | |
| "loss": 0.842086911201477, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38858363032341003, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1398862600326538, | |
| "rewards/margins": 1.0419015884399414, | |
| "rewards/rejected": -0.9020152688026428, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09440004034189758, | |
| "grad_norm": 4.8206281661987305, | |
| "learning_rate": 0.0001989243720032624, | |
| "logits/chosen": -0.7102867364883423, | |
| "logits/rejected": -0.712573230266571, | |
| "logps/chosen": -14.843620300292969, | |
| "logps/rejected": -23.658788681030273, | |
| "loss": 1.1279860734939575, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5651426315307617, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.09467095881700516, | |
| "rewards/margins": 0.9923723340034485, | |
| "rewards/rejected": -1.087043285369873, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09520687829353773, | |
| "grad_norm": 3.194643020629883, | |
| "learning_rate": 0.00019888497618833815, | |
| "logits/chosen": -0.6824992895126343, | |
| "logits/rejected": -0.6856632232666016, | |
| "logps/chosen": -7.8865065574646, | |
| "logps/rejected": -22.186447143554688, | |
| "loss": 0.8166104555130005, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3872619867324829, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1935729682445526, | |
| "rewards/margins": 1.2844107151031494, | |
| "rewards/rejected": -1.090837836265564, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09601371624517788, | |
| "grad_norm": 5.332725524902344, | |
| "learning_rate": 0.00019884487588010092, | |
| "logits/chosen": -0.6963211894035339, | |
| "logits/rejected": -0.695375382900238, | |
| "logps/chosen": -12.522785186767578, | |
| "logps/rejected": -21.899364471435547, | |
| "loss": 1.200064778327942, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5619924068450928, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.2353927493095398, | |
| "rewards/margins": 0.7032212018966675, | |
| "rewards/rejected": -0.9386140704154968, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.09682055419681804, | |
| "grad_norm": 3.189750909805298, | |
| "learning_rate": 0.0001988040713642402, | |
| "logits/chosen": -0.7008529305458069, | |
| "logits/rejected": -0.7020596265792847, | |
| "logps/chosen": -7.352071285247803, | |
| "logps/rejected": -26.472599029541016, | |
| "loss": 0.6796355843544006, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30471816658973694, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0883897989988327, | |
| "rewards/margins": 1.43672513961792, | |
| "rewards/rejected": -1.3483351469039917, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09762739214845818, | |
| "grad_norm": 3.5756847858428955, | |
| "learning_rate": 0.00019876256293146257, | |
| "logits/chosen": -0.6855241060256958, | |
| "logits/rejected": -0.6870216131210327, | |
| "logps/chosen": -9.13197135925293, | |
| "logps/rejected": -25.256893157958984, | |
| "loss": 0.9965449571609497, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5001046061515808, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.036015622317790985, | |
| "rewards/margins": 1.1710847616195679, | |
| "rewards/rejected": -1.1350692510604858, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.09843423010009833, | |
| "grad_norm": 2.60425066947937, | |
| "learning_rate": 0.0001987203508774895, | |
| "logits/chosen": -0.7040928602218628, | |
| "logits/rejected": -0.7042312026023865, | |
| "logps/chosen": -8.471722602844238, | |
| "logps/rejected": -26.018938064575195, | |
| "loss": 0.8459987640380859, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4736276865005493, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24268555641174316, | |
| "rewards/margins": 1.318163514137268, | |
| "rewards/rejected": -1.075477957725525, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.09924106805173849, | |
| "grad_norm": 4.30864143371582, | |
| "learning_rate": 0.0001986774355030553, | |
| "logits/chosen": -0.6747640371322632, | |
| "logits/rejected": -0.677899956703186, | |
| "logps/chosen": -14.706789016723633, | |
| "logps/rejected": -16.56774139404297, | |
| "loss": 1.2364513874053955, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6511675119400024, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08759675920009613, | |
| "rewards/margins": 0.6008309721946716, | |
| "rewards/rejected": -0.5132341384887695, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10004790600337864, | |
| "grad_norm": 6.867242813110352, | |
| "learning_rate": 0.00019863381711390508, | |
| "logits/chosen": -0.6869674324989319, | |
| "logits/rejected": -0.6902846693992615, | |
| "logps/chosen": -7.829675197601318, | |
| "logps/rejected": -20.095809936523438, | |
| "loss": 1.043180227279663, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.530769944190979, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11925126612186432, | |
| "rewards/margins": 0.697571337223053, | |
| "rewards/rejected": -0.5783200860023499, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10085474395501878, | |
| "grad_norm": 3.041438579559326, | |
| "learning_rate": 0.0001985894960207925, | |
| "logits/chosen": -0.6505750417709351, | |
| "logits/rejected": -0.6511614918708801, | |
| "logps/chosen": -9.314833641052246, | |
| "logps/rejected": -27.15659523010254, | |
| "loss": 0.7252060174942017, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39295029640197754, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24510648846626282, | |
| "rewards/margins": 1.2805438041687012, | |
| "rewards/rejected": -1.0354374647140503, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10166158190665893, | |
| "grad_norm": 2.509321689605713, | |
| "learning_rate": 0.00019854447253947743, | |
| "logits/chosen": -0.6497823596000671, | |
| "logits/rejected": -0.6492441892623901, | |
| "logps/chosen": -8.02572250366211, | |
| "logps/rejected": -20.3783016204834, | |
| "loss": 0.7982934713363647, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33212146162986755, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.17764505743980408, | |
| "rewards/margins": 0.8625535368919373, | |
| "rewards/rejected": -0.6849085092544556, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.10246841985829909, | |
| "grad_norm": 3.6529700756073, | |
| "learning_rate": 0.0001984987469907239, | |
| "logits/chosen": -0.6466098427772522, | |
| "logits/rejected": -0.6480077505111694, | |
| "logps/chosen": -9.548334121704102, | |
| "logps/rejected": -16.65062141418457, | |
| "loss": 0.914322555065155, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4001502990722656, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1684979647397995, | |
| "rewards/margins": 0.6629449129104614, | |
| "rewards/rejected": -0.49444690346717834, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10327525780993924, | |
| "grad_norm": 3.3696913719177246, | |
| "learning_rate": 0.00019845231970029773, | |
| "logits/chosen": -0.679688572883606, | |
| "logits/rejected": -0.6820145845413208, | |
| "logps/chosen": -10.874924659729004, | |
| "logps/rejected": -24.826372146606445, | |
| "loss": 0.9800686240196228, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4543137848377228, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.048351842910051346, | |
| "rewards/margins": 0.8677961230278015, | |
| "rewards/rejected": -0.9161479473114014, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.10408209576157938, | |
| "grad_norm": 2.5419607162475586, | |
| "learning_rate": 0.00019840519099896414, | |
| "logits/chosen": -0.6618849039077759, | |
| "logits/rejected": -0.6671789288520813, | |
| "logps/chosen": -8.426337242126465, | |
| "logps/rejected": -25.797517776489258, | |
| "loss": 0.6974806189537048, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2836017608642578, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18303632736206055, | |
| "rewards/margins": 1.1003562211990356, | |
| "rewards/rejected": -0.9173198938369751, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10488893371321953, | |
| "grad_norm": 3.4203388690948486, | |
| "learning_rate": 0.00019835736122248557, | |
| "logits/chosen": -0.6606203317642212, | |
| "logits/rejected": -0.6571654677391052, | |
| "logps/chosen": -14.509614944458008, | |
| "logps/rejected": -15.079629898071289, | |
| "loss": 1.101165771484375, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5219094157218933, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07395613193511963, | |
| "rewards/margins": 0.5427431464195251, | |
| "rewards/rejected": -0.46878698468208313, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10569577166485969, | |
| "grad_norm": 2.7750000953674316, | |
| "learning_rate": 0.00019830883071161908, | |
| "logits/chosen": -0.7152451276779175, | |
| "logits/rejected": -0.7131951451301575, | |
| "logps/chosen": -9.166630744934082, | |
| "logps/rejected": -19.46819305419922, | |
| "loss": 0.7933439016342163, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3753884732723236, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26774072647094727, | |
| "rewards/margins": 1.0882644653320312, | |
| "rewards/rejected": -0.8205236196517944, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10650260961649984, | |
| "grad_norm": 3.1810927391052246, | |
| "learning_rate": 0.00019825959981211407, | |
| "logits/chosen": -0.714146614074707, | |
| "logits/rejected": -0.7095440626144409, | |
| "logps/chosen": -11.571531295776367, | |
| "logps/rejected": -14.685908317565918, | |
| "loss": 0.8970522880554199, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38512641191482544, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09674864262342453, | |
| "rewards/margins": 0.5926439762115479, | |
| "rewards/rejected": -0.4958953261375427, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10730944756813998, | |
| "grad_norm": 2.839996099472046, | |
| "learning_rate": 0.00019820966887470974, | |
| "logits/chosen": -0.7237828373908997, | |
| "logits/rejected": -0.7276051640510559, | |
| "logps/chosen": -7.241865158081055, | |
| "logps/rejected": -21.9840145111084, | |
| "loss": 0.7037227153778076, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29994940757751465, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18205267190933228, | |
| "rewards/margins": 1.1148442029953003, | |
| "rewards/rejected": -0.9327914714813232, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.10811628551978014, | |
| "grad_norm": 2.8896915912628174, | |
| "learning_rate": 0.0001981590382551327, | |
| "logits/chosen": -0.796456515789032, | |
| "logits/rejected": -0.7955406308174133, | |
| "logps/chosen": -11.131935119628906, | |
| "logps/rejected": -19.525293350219727, | |
| "loss": 0.8993673920631409, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4546453356742859, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.21719151735305786, | |
| "rewards/margins": 1.081808090209961, | |
| "rewards/rejected": -0.8646165728569031, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.10892312347142029, | |
| "grad_norm": 3.5537540912628174, | |
| "learning_rate": 0.00019810770831409425, | |
| "logits/chosen": -0.7755017876625061, | |
| "logits/rejected": -0.7809926271438599, | |
| "logps/chosen": -7.181600093841553, | |
| "logps/rejected": -19.379724502563477, | |
| "loss": 0.7135071754455566, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32976531982421875, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.26019349694252014, | |
| "rewards/margins": 1.110938310623169, | |
| "rewards/rejected": -0.850744903087616, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.10972996142306043, | |
| "grad_norm": 3.5955300331115723, | |
| "learning_rate": 0.00019805567941728796, | |
| "logits/chosen": -0.799392819404602, | |
| "logits/rejected": -0.8029282689094543, | |
| "logps/chosen": -9.87437629699707, | |
| "logps/rejected": -23.02663230895996, | |
| "loss": 0.9438092708587646, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5196709036827087, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07922995835542679, | |
| "rewards/margins": 1.070724606513977, | |
| "rewards/rejected": -0.9914946556091309, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.11053679937470058, | |
| "grad_norm": 3.7304859161376953, | |
| "learning_rate": 0.00019800295193538704, | |
| "logits/chosen": -0.8160181641578674, | |
| "logits/rejected": -0.8219972848892212, | |
| "logps/chosen": -7.596125602722168, | |
| "logps/rejected": -20.225994110107422, | |
| "loss": 0.8485299348831177, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43994730710983276, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.26360729336738586, | |
| "rewards/margins": 0.9658780694007874, | |
| "rewards/rejected": -0.7022708058357239, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.11134363732634074, | |
| "grad_norm": 4.919328689575195, | |
| "learning_rate": 0.00019794952624404167, | |
| "logits/chosen": -0.7996560335159302, | |
| "logits/rejected": -0.801249623298645, | |
| "logps/chosen": -9.867749214172363, | |
| "logps/rejected": -22.316190719604492, | |
| "loss": 0.8283427357673645, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4471050798892975, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13889475166797638, | |
| "rewards/margins": 1.224007248878479, | |
| "rewards/rejected": -1.085112452507019, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.11215047527798089, | |
| "grad_norm": 2.821730136871338, | |
| "learning_rate": 0.0001978954027238763, | |
| "logits/chosen": -0.818955659866333, | |
| "logits/rejected": -0.8183013796806335, | |
| "logps/chosen": -6.504258632659912, | |
| "logps/rejected": -14.602479934692383, | |
| "loss": 0.7571634650230408, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29162290692329407, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1784059852361679, | |
| "rewards/margins": 0.8354285955429077, | |
| "rewards/rejected": -0.6570225954055786, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.11295731322962103, | |
| "grad_norm": 2.481306552886963, | |
| "learning_rate": 0.000197840581760487, | |
| "logits/chosen": -0.8251004219055176, | |
| "logits/rejected": -0.8243045210838318, | |
| "logps/chosen": -13.736132621765137, | |
| "logps/rejected": -17.749977111816406, | |
| "loss": 0.8052379488945007, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4064967930316925, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.3237007260322571, | |
| "rewards/margins": 1.295701026916504, | |
| "rewards/rejected": -0.9720003008842468, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.1137641511812612, | |
| "grad_norm": 2.695176601409912, | |
| "learning_rate": 0.00019778506374443873, | |
| "logits/chosen": -0.7545077800750732, | |
| "logits/rejected": -0.7596877813339233, | |
| "logps/chosen": -5.598147869110107, | |
| "logps/rejected": -26.760784149169922, | |
| "loss": 0.6858201026916504, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3311798572540283, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19224056601524353, | |
| "rewards/margins": 1.6802706718444824, | |
| "rewards/rejected": -1.488029956817627, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11457098913290134, | |
| "grad_norm": 2.5371341705322266, | |
| "learning_rate": 0.0001977288490712624, | |
| "logits/chosen": -0.8187113404273987, | |
| "logits/rejected": -0.8256463408470154, | |
| "logps/chosen": -9.480502128601074, | |
| "logps/rejected": -26.96666717529297, | |
| "loss": 0.6809464693069458, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3261586129665375, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2214924842119217, | |
| "rewards/margins": 1.2070807218551636, | |
| "rewards/rejected": -0.9855883121490479, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11537782708454149, | |
| "grad_norm": 3.33156681060791, | |
| "learning_rate": 0.00019767193814145226, | |
| "logits/chosen": -0.8148999214172363, | |
| "logits/rejected": -0.8154037594795227, | |
| "logps/chosen": -16.6685848236084, | |
| "logps/rejected": -16.219863891601562, | |
| "loss": 1.1351004838943481, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6261444091796875, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.06986582279205322, | |
| "rewards/margins": 0.7546349763870239, | |
| "rewards/rejected": -0.6847692728042603, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11618466503618163, | |
| "grad_norm": 2.587169647216797, | |
| "learning_rate": 0.00019761433136046295, | |
| "logits/chosen": -0.7679372429847717, | |
| "logits/rejected": -0.7711334824562073, | |
| "logps/chosen": -6.84797477722168, | |
| "logps/rejected": -25.882503509521484, | |
| "loss": 0.6460772752761841, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2581600844860077, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.25230705738067627, | |
| "rewards/margins": 1.5044541358947754, | |
| "rewards/rejected": -1.2521469593048096, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1169915029878218, | |
| "grad_norm": 3.816577911376953, | |
| "learning_rate": 0.00019755602913870655, | |
| "logits/chosen": -0.7486031651496887, | |
| "logits/rejected": -0.7545804977416992, | |
| "logps/chosen": -11.378320693969727, | |
| "logps/rejected": -23.90165901184082, | |
| "loss": 1.0280418395996094, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5588870644569397, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10084515064954758, | |
| "rewards/margins": 1.0778629779815674, | |
| "rewards/rejected": -0.9770178198814392, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.11779834093946194, | |
| "grad_norm": 3.1183438301086426, | |
| "learning_rate": 0.00019749703189154971, | |
| "logits/chosen": -0.7663331031799316, | |
| "logits/rejected": -0.7778096199035645, | |
| "logps/chosen": -7.461820602416992, | |
| "logps/rejected": -26.446916580200195, | |
| "loss": 0.6639739274978638, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28250494599342346, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.04964678734540939, | |
| "rewards/margins": 1.1681914329528809, | |
| "rewards/rejected": -1.1185446977615356, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11860517889110209, | |
| "grad_norm": 2.613725423812866, | |
| "learning_rate": 0.00019743734003931082, | |
| "logits/chosen": -0.808351993560791, | |
| "logits/rejected": -0.8136962652206421, | |
| "logps/chosen": -7.89247989654541, | |
| "logps/rejected": -23.955371856689453, | |
| "loss": 0.8511161804199219, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39823463559150696, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.12871581315994263, | |
| "rewards/margins": 1.055700659751892, | |
| "rewards/rejected": -0.9269847869873047, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11941201684274225, | |
| "grad_norm": 3.0128729343414307, | |
| "learning_rate": 0.00019737695400725677, | |
| "logits/chosen": -0.7927097678184509, | |
| "logits/rejected": -0.7919667959213257, | |
| "logps/chosen": -9.877785682678223, | |
| "logps/rejected": -23.477703094482422, | |
| "loss": 0.7262363433837891, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3177878260612488, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.12437373399734497, | |
| "rewards/margins": 1.1551289558410645, | |
| "rewards/rejected": -1.0307551622390747, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1202188547943824, | |
| "grad_norm": 2.5007247924804688, | |
| "learning_rate": 0.0001973158742256001, | |
| "logits/chosen": -0.815912663936615, | |
| "logits/rejected": -0.8240575194358826, | |
| "logps/chosen": -7.251335620880127, | |
| "logps/rejected": -23.904563903808594, | |
| "loss": 0.7742622494697571, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3948196470737457, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16877779364585876, | |
| "rewards/margins": 1.3302054405212402, | |
| "rewards/rejected": -1.1614277362823486, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12102569274602254, | |
| "grad_norm": 2.996128559112549, | |
| "learning_rate": 0.0001972541011294959, | |
| "logits/chosen": -0.8276554346084595, | |
| "logits/rejected": -0.832274317741394, | |
| "logps/chosen": -9.810141563415527, | |
| "logps/rejected": -24.295639038085938, | |
| "loss": 0.733322262763977, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34396567940711975, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.03486320376396179, | |
| "rewards/margins": 1.2224383354187012, | |
| "rewards/rejected": -1.1875752210617065, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12183253069766269, | |
| "grad_norm": 3.6684677600860596, | |
| "learning_rate": 0.0001971916351590386, | |
| "logits/chosen": -0.8309310674667358, | |
| "logits/rejected": -0.8319404721260071, | |
| "logps/chosen": -13.512450218200684, | |
| "logps/rejected": -28.13376808166504, | |
| "loss": 0.8970531821250916, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5336953997612, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.07107365131378174, | |
| "rewards/margins": 1.3276447057724, | |
| "rewards/rejected": -1.3987183570861816, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.12263936864930285, | |
| "grad_norm": 3.4376490116119385, | |
| "learning_rate": 0.00019712847675925903, | |
| "logits/chosen": -0.8819084763526917, | |
| "logits/rejected": -0.8899849653244019, | |
| "logps/chosen": -9.134736061096191, | |
| "logps/rejected": -25.074691772460938, | |
| "loss": 0.7725754976272583, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.44169238209724426, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.20537638664245605, | |
| "rewards/margins": 1.4855870008468628, | |
| "rewards/rejected": -1.2802107334136963, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.12344620660094299, | |
| "grad_norm": 5.506346225738525, | |
| "learning_rate": 0.00019706462638012105, | |
| "logits/chosen": -0.9026679992675781, | |
| "logits/rejected": -0.908703088760376, | |
| "logps/chosen": -13.740835189819336, | |
| "logps/rejected": -25.73556900024414, | |
| "loss": 1.2033629417419434, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6762228608131409, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.11278621852397919, | |
| "rewards/margins": 1.2870286703109741, | |
| "rewards/rejected": -1.3998148441314697, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.12425304455258314, | |
| "grad_norm": 4.886820316314697, | |
| "learning_rate": 0.00019700008447651854, | |
| "logits/chosen": -0.8641173839569092, | |
| "logits/rejected": -0.859977662563324, | |
| "logps/chosen": -13.57033634185791, | |
| "logps/rejected": -26.01408576965332, | |
| "loss": 1.2000961303710938, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5635690093040466, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.19201046228408813, | |
| "rewards/margins": 1.3229352235794067, | |
| "rewards/rejected": -1.51494562625885, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.12505988250422329, | |
| "grad_norm": 3.3179073333740234, | |
| "learning_rate": 0.00019693485150827197, | |
| "logits/chosen": -0.8760464191436768, | |
| "logits/rejected": -0.8815669417381287, | |
| "logps/chosen": -9.239191055297852, | |
| "logps/rejected": -28.241233825683594, | |
| "loss": 0.6995830535888672, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3207743167877197, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1987459361553192, | |
| "rewards/margins": 1.7694886922836304, | |
| "rewards/rejected": -1.5707426071166992, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.12586672045586345, | |
| "grad_norm": 5.6134161949157715, | |
| "learning_rate": 0.0001968689279401253, | |
| "logits/chosen": -0.8809852600097656, | |
| "logits/rejected": -0.8887759447097778, | |
| "logps/chosen": -7.534684181213379, | |
| "logps/rejected": -30.649181365966797, | |
| "loss": 1.0883609056472778, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7660683393478394, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2163163125514984, | |
| "rewards/margins": 1.8669637441635132, | |
| "rewards/rejected": -1.6506474018096924, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1266735584075036, | |
| "grad_norm": 2.5959808826446533, | |
| "learning_rate": 0.0001968023142417424, | |
| "logits/chosen": -0.8142418265342712, | |
| "logits/rejected": -0.8186179995536804, | |
| "logps/chosen": -9.635229110717773, | |
| "logps/rejected": -32.11575698852539, | |
| "loss": 0.6578619480133057, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3367811441421509, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.21614979207515717, | |
| "rewards/margins": 2.128612518310547, | |
| "rewards/rejected": -1.912462592124939, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12748039635914374, | |
| "grad_norm": 3.154606342315674, | |
| "learning_rate": 0.00019673501088770414, | |
| "logits/chosen": -0.8146523237228394, | |
| "logits/rejected": -0.8199130892753601, | |
| "logps/chosen": -12.74015998840332, | |
| "logps/rejected": -16.670421600341797, | |
| "loss": 0.9762111306190491, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5080199837684631, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18415355682373047, | |
| "rewards/margins": 0.8309141397476196, | |
| "rewards/rejected": -0.6467605233192444, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.1282872343107839, | |
| "grad_norm": 6.67454719543457, | |
| "learning_rate": 0.00019666701835750457, | |
| "logits/chosen": -0.8286721110343933, | |
| "logits/rejected": -0.8334258794784546, | |
| "logps/chosen": -8.225419044494629, | |
| "logps/rejected": -17.38351821899414, | |
| "loss": 0.9775789380073547, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5453903079032898, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.15067297220230103, | |
| "rewards/margins": 0.9060754776000977, | |
| "rewards/rejected": -0.7554025650024414, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12909407226242403, | |
| "grad_norm": 3.848874092102051, | |
| "learning_rate": 0.00019659833713554773, | |
| "logits/chosen": -0.7873284816741943, | |
| "logits/rejected": -0.7915123105049133, | |
| "logps/chosen": -10.267017364501953, | |
| "logps/rejected": -25.254423141479492, | |
| "loss": 0.8222072124481201, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43752118945121765, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18684861063957214, | |
| "rewards/margins": 1.191467523574829, | |
| "rewards/rejected": -1.0046190023422241, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1299009102140642, | |
| "grad_norm": 8.467432975769043, | |
| "learning_rate": 0.00019652896771114414, | |
| "logits/chosen": -0.7907496094703674, | |
| "logits/rejected": -0.7956827878952026, | |
| "logps/chosen": -12.749449729919434, | |
| "logps/rejected": -20.143428802490234, | |
| "loss": 1.2200610637664795, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7363396883010864, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.01990276202559471, | |
| "rewards/margins": 0.667390763759613, | |
| "rewards/rejected": -0.647487998008728, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.13070774816570435, | |
| "grad_norm": 3.0088865756988525, | |
| "learning_rate": 0.00019645891057850742, | |
| "logits/chosen": -0.7298374176025391, | |
| "logits/rejected": -0.732286274433136, | |
| "logps/chosen": -15.880043029785156, | |
| "logps/rejected": -24.578083038330078, | |
| "loss": 0.8190960884094238, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4379112124443054, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2654583156108856, | |
| "rewards/margins": 1.3646464347839355, | |
| "rewards/rejected": -1.099188208580017, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.13151458611734448, | |
| "grad_norm": 5.012711524963379, | |
| "learning_rate": 0.00019638816623675058, | |
| "logits/chosen": -0.7988470196723938, | |
| "logits/rejected": -0.8017285466194153, | |
| "logps/chosen": -9.470846176147461, | |
| "logps/rejected": -25.236000061035156, | |
| "loss": 0.798559844493866, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32053616642951965, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.05605325102806091, | |
| "rewards/margins": 1.3247337341308594, | |
| "rewards/rejected": -1.268680453300476, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.13232142406898464, | |
| "grad_norm": 5.894308567047119, | |
| "learning_rate": 0.00019631673518988261, | |
| "logits/chosen": -0.7558510303497314, | |
| "logits/rejected": -0.7591589689254761, | |
| "logps/chosen": -8.896431922912598, | |
| "logps/rejected": -26.477436065673828, | |
| "loss": 0.7629649043083191, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35155194997787476, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04630519449710846, | |
| "rewards/margins": 1.3866008520126343, | |
| "rewards/rejected": -1.340295672416687, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.1331282620206248, | |
| "grad_norm": 4.07641077041626, | |
| "learning_rate": 0.0001962446179468048, | |
| "logits/chosen": -0.7340226173400879, | |
| "logits/rejected": -0.7390322089195251, | |
| "logps/chosen": -7.206872463226318, | |
| "logps/rejected": -30.465621948242188, | |
| "loss": 0.7621070742607117, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3923991620540619, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.12836496531963348, | |
| "rewards/margins": 1.729160189628601, | |
| "rewards/rejected": -1.6007951498031616, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.13393509997226494, | |
| "grad_norm": 4.966350078582764, | |
| "learning_rate": 0.00019617181502130723, | |
| "logits/chosen": -0.7315192222595215, | |
| "logits/rejected": -0.7316710352897644, | |
| "logps/chosen": -9.406560897827148, | |
| "logps/rejected": -20.61480712890625, | |
| "loss": 0.9099687337875366, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3969041705131531, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.084879070520401, | |
| "rewards/margins": 0.9290111064910889, | |
| "rewards/rejected": -0.844132125377655, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.1347419379239051, | |
| "grad_norm": 2.8620102405548096, | |
| "learning_rate": 0.00019609832693206494, | |
| "logits/chosen": -0.6981790065765381, | |
| "logits/rejected": -0.6956609487533569, | |
| "logps/chosen": -11.53895092010498, | |
| "logps/rejected": -17.151912689208984, | |
| "loss": 0.7675348520278931, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.364923357963562, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22551363706588745, | |
| "rewards/margins": 0.959013044834137, | |
| "rewards/rejected": -0.73349928855896, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.13554877587554526, | |
| "grad_norm": 3.910537004470825, | |
| "learning_rate": 0.00019602415420263443, | |
| "logits/chosen": -0.7344207763671875, | |
| "logits/rejected": -0.7377809286117554, | |
| "logps/chosen": -9.725975036621094, | |
| "logps/rejected": -26.63901138305664, | |
| "loss": 0.9027658104896545, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4818994700908661, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0954769030213356, | |
| "rewards/margins": 1.3119255304336548, | |
| "rewards/rejected": -1.2164486646652222, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1363556138271854, | |
| "grad_norm": 2.7541050910949707, | |
| "learning_rate": 0.00019594929736144976, | |
| "logits/chosen": -0.7230939865112305, | |
| "logits/rejected": -0.7268710732460022, | |
| "logps/chosen": -6.102090835571289, | |
| "logps/rejected": -22.030675888061523, | |
| "loss": 0.8178823590278625, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4109593629837036, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2232162207365036, | |
| "rewards/margins": 1.0571808815002441, | |
| "rewards/rejected": -0.8339645862579346, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.13716245177882555, | |
| "grad_norm": 2.1247079372406006, | |
| "learning_rate": 0.00019587375694181888, | |
| "logits/chosen": -0.7419747114181519, | |
| "logits/rejected": -0.7435666918754578, | |
| "logps/chosen": -10.772944450378418, | |
| "logps/rejected": -17.87366485595703, | |
| "loss": 0.7673830389976501, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3707871735095978, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2476326823234558, | |
| "rewards/margins": 0.9303527474403381, | |
| "rewards/rejected": -0.6827200055122375, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1379692897304657, | |
| "grad_norm": 3.058112382888794, | |
| "learning_rate": 0.00019579753348191982, | |
| "logits/chosen": -0.7581822276115417, | |
| "logits/rejected": -0.7616063356399536, | |
| "logps/chosen": -10.94616413116455, | |
| "logps/rejected": -22.71567153930664, | |
| "loss": 0.9573794603347778, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4561714828014374, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.10372941941022873, | |
| "rewards/margins": 0.9039929509162903, | |
| "rewards/rejected": -0.8002634644508362, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.13877612768210584, | |
| "grad_norm": 5.104068756103516, | |
| "learning_rate": 0.00019572062752479683, | |
| "logits/chosen": -0.7440593242645264, | |
| "logits/rejected": -0.7444762587547302, | |
| "logps/chosen": -13.373594284057617, | |
| "logps/rejected": -21.11050033569336, | |
| "loss": 0.9622430801391602, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6134111881256104, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.17188113927841187, | |
| "rewards/margins": 1.2960879802703857, | |
| "rewards/rejected": -1.1242069005966187, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.139582965633746, | |
| "grad_norm": 3.6643261909484863, | |
| "learning_rate": 0.00019564303961835654, | |
| "logits/chosen": -0.7351651787757874, | |
| "logits/rejected": -0.7340760827064514, | |
| "logps/chosen": -13.493339538574219, | |
| "logps/rejected": -29.00867462158203, | |
| "loss": 0.8059775233268738, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4561418890953064, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07504750788211823, | |
| "rewards/margins": 1.5861859321594238, | |
| "rewards/rejected": -1.5111385583877563, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.14038980358538614, | |
| "grad_norm": 3.840665102005005, | |
| "learning_rate": 0.00019556477031536397, | |
| "logits/chosen": -0.7632665634155273, | |
| "logits/rejected": -0.7688808441162109, | |
| "logps/chosen": -7.488624572753906, | |
| "logps/rejected": -27.777238845825195, | |
| "loss": 0.7469439506530762, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.378052294254303, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07338213175535202, | |
| "rewards/margins": 1.5290367603302002, | |
| "rewards/rejected": -1.4556546211242676, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1411966415370263, | |
| "grad_norm": 2.548142671585083, | |
| "learning_rate": 0.00019548582017343878, | |
| "logits/chosen": -0.7821887731552124, | |
| "logits/rejected": -0.7840255498886108, | |
| "logps/chosen": -9.051867485046387, | |
| "logps/rejected": -26.980369567871094, | |
| "loss": 0.6677172183990479, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3486889600753784, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10505867004394531, | |
| "rewards/margins": 1.3984501361846924, | |
| "rewards/rejected": -1.2933913469314575, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.14200347948866646, | |
| "grad_norm": 3.0442428588867188, | |
| "learning_rate": 0.00019540618975505107, | |
| "logits/chosen": -0.7756679058074951, | |
| "logits/rejected": -0.7768942713737488, | |
| "logps/chosen": -9.436080932617188, | |
| "logps/rejected": -24.625957489013672, | |
| "loss": 0.7269696593284607, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3957803249359131, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.18510255217552185, | |
| "rewards/margins": 1.5727849006652832, | |
| "rewards/rejected": -1.3876824378967285, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1428103174403066, | |
| "grad_norm": 4.40380859375, | |
| "learning_rate": 0.00019532587962751757, | |
| "logits/chosen": -0.7868165969848633, | |
| "logits/rejected": -0.7917428016662598, | |
| "logps/chosen": -12.063282012939453, | |
| "logps/rejected": -26.304283142089844, | |
| "loss": 0.8930169343948364, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5761467814445496, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2778218984603882, | |
| "rewards/margins": 1.7966634035110474, | |
| "rewards/rejected": -1.5188415050506592, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.14361715539194675, | |
| "grad_norm": 6.159250259399414, | |
| "learning_rate": 0.0001952448903629974, | |
| "logits/chosen": -0.8135851621627808, | |
| "logits/rejected": -0.8196555972099304, | |
| "logps/chosen": -16.506568908691406, | |
| "logps/rejected": -26.224693298339844, | |
| "loss": 1.118604302406311, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5594882965087891, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.20946675539016724, | |
| "rewards/margins": 1.0000211000442505, | |
| "rewards/rejected": -1.209487795829773, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1444239933435869, | |
| "grad_norm": 3.561173439025879, | |
| "learning_rate": 0.00019516322253848828, | |
| "logits/chosen": -0.8224231600761414, | |
| "logits/rejected": -0.8233227729797363, | |
| "logps/chosen": -8.352205276489258, | |
| "logps/rejected": -23.940982818603516, | |
| "loss": 0.7962292432785034, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4265138804912567, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2205028533935547, | |
| "rewards/margins": 1.6108112335205078, | |
| "rewards/rejected": -1.3903082609176636, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.14523083129522704, | |
| "grad_norm": 3.16656756401062, | |
| "learning_rate": 0.00019508087673582205, | |
| "logits/chosen": -0.8061304688453674, | |
| "logits/rejected": -0.8118202090263367, | |
| "logps/chosen": -8.317770004272461, | |
| "logps/rejected": -26.48977279663086, | |
| "loss": 0.7722903490066528, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37005698680877686, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.028686638921499252, | |
| "rewards/margins": 1.5126442909240723, | |
| "rewards/rejected": -1.4839575290679932, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.1460376692468672, | |
| "grad_norm": 3.15301513671875, | |
| "learning_rate": 0.00019499785354166083, | |
| "logits/chosen": -0.7916308641433716, | |
| "logits/rejected": -0.7952077984809875, | |
| "logps/chosen": -7.383344650268555, | |
| "logps/rejected": -32.59227752685547, | |
| "loss": 0.7744749784469604, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4444514214992523, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0771065428853035, | |
| "rewards/margins": 2.1048974990844727, | |
| "rewards/rejected": -2.0277910232543945, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.14684450719850736, | |
| "grad_norm": 2.6223182678222656, | |
| "learning_rate": 0.00019491415354749272, | |
| "logits/chosen": -0.7739111185073853, | |
| "logits/rejected": -0.7772398591041565, | |
| "logps/chosen": -6.630223274230957, | |
| "logps/rejected": -26.15964126586914, | |
| "loss": 0.693659245967865, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3340071141719818, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1530786156654358, | |
| "rewards/margins": 1.5430837869644165, | |
| "rewards/rejected": -1.3900052309036255, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.1476513451501475, | |
| "grad_norm": 2.088421106338501, | |
| "learning_rate": 0.00019482977734962753, | |
| "logits/chosen": -0.7808999419212341, | |
| "logits/rejected": -0.7902572154998779, | |
| "logps/chosen": -8.449446678161621, | |
| "logps/rejected": -31.33694076538086, | |
| "loss": 0.5712997913360596, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31176620721817017, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.27892935276031494, | |
| "rewards/margins": 2.0656492710113525, | |
| "rewards/rejected": -1.7867200374603271, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.14845818310178766, | |
| "grad_norm": 4.234419345855713, | |
| "learning_rate": 0.00019474472554919272, | |
| "logits/chosen": -0.8170475959777832, | |
| "logits/rejected": -0.825502872467041, | |
| "logps/chosen": -9.795135498046875, | |
| "logps/rejected": -31.384075164794922, | |
| "loss": 0.7613832354545593, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3808598518371582, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.14184550940990448, | |
| "rewards/margins": 1.434211254119873, | |
| "rewards/rejected": -1.2923656702041626, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.1492650210534278, | |
| "grad_norm": 2.047487735748291, | |
| "learning_rate": 0.00019465899875212888, | |
| "logits/chosen": -0.794952929019928, | |
| "logits/rejected": -0.8015525937080383, | |
| "logps/chosen": -6.017518043518066, | |
| "logps/rejected": -19.722206115722656, | |
| "loss": 0.6337971091270447, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28807568550109863, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24735234677791595, | |
| "rewards/margins": 1.255548119544983, | |
| "rewards/rejected": -1.0081957578659058, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.15007185900506795, | |
| "grad_norm": 3.8246495723724365, | |
| "learning_rate": 0.00019457259756918552, | |
| "logits/chosen": -0.8133244514465332, | |
| "logits/rejected": -0.8167756199836731, | |
| "logps/chosen": -10.089277267456055, | |
| "logps/rejected": -26.579971313476562, | |
| "loss": 0.7682158946990967, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3842141926288605, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10676907747983932, | |
| "rewards/margins": 1.6904234886169434, | |
| "rewards/rejected": -1.5836546421051025, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.1508786969567081, | |
| "grad_norm": 4.293128490447998, | |
| "learning_rate": 0.00019448552261591687, | |
| "logits/chosen": -0.81524658203125, | |
| "logits/rejected": -0.8198854327201843, | |
| "logps/chosen": -12.067436218261719, | |
| "logps/rejected": -23.448137283325195, | |
| "loss": 0.9188786149024963, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5105058550834656, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.23126842081546783, | |
| "rewards/margins": 1.3146940469741821, | |
| "rewards/rejected": -1.083425760269165, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.15168553490834824, | |
| "grad_norm": 5.430900573730469, | |
| "learning_rate": 0.00019439777451267718, | |
| "logits/chosen": -0.8615626096725464, | |
| "logits/rejected": -0.8717396855354309, | |
| "logps/chosen": -12.81668472290039, | |
| "logps/rejected": -33.20039367675781, | |
| "loss": 0.8604999780654907, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5934706926345825, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07574808597564697, | |
| "rewards/margins": 2.146501064300537, | |
| "rewards/rejected": -2.0707528591156006, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.1524923728599884, | |
| "grad_norm": 5.0244140625, | |
| "learning_rate": 0.00019430935388461656, | |
| "logits/chosen": -0.8756387233734131, | |
| "logits/rejected": -0.8824178576469421, | |
| "logps/chosen": -9.554489135742188, | |
| "logps/rejected": -33.99430847167969, | |
| "loss": 0.7015911936759949, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4163678288459778, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21942490339279175, | |
| "rewards/margins": 2.339784622192383, | |
| "rewards/rejected": -2.1203596591949463, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.15329921081162856, | |
| "grad_norm": 5.72052526473999, | |
| "learning_rate": 0.0001942202613616764, | |
| "logits/chosen": -0.8696508407592773, | |
| "logits/rejected": -0.8797045350074768, | |
| "logps/chosen": -8.161410331726074, | |
| "logps/rejected": -31.448095321655273, | |
| "loss": 0.6777075529098511, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.36822211742401123, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.29191264510154724, | |
| "rewards/margins": 1.8597280979156494, | |
| "rewards/rejected": -1.5678153038024902, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.1541060487632687, | |
| "grad_norm": 9.510895729064941, | |
| "learning_rate": 0.00019413049757858496, | |
| "logits/chosen": -0.8756559491157532, | |
| "logits/rejected": -0.8811758756637573, | |
| "logps/chosen": -9.792702674865723, | |
| "logps/rejected": -34.0648078918457, | |
| "loss": 0.8311678767204285, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.47524788975715637, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09086283296346664, | |
| "rewards/margins": 2.250915050506592, | |
| "rewards/rejected": -2.1600520610809326, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.15491288671490885, | |
| "grad_norm": 2.9663641452789307, | |
| "learning_rate": 0.0001940400631748528, | |
| "logits/chosen": -0.8579489588737488, | |
| "logits/rejected": -0.8665011525154114, | |
| "logps/chosen": -8.948463439941406, | |
| "logps/rejected": -39.376953125, | |
| "loss": 0.6801427602767944, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4235433042049408, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.021937131881713867, | |
| "rewards/margins": 2.60715913772583, | |
| "rewards/rejected": -2.585222005844116, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.15571972466654901, | |
| "grad_norm": 4.202517509460449, | |
| "learning_rate": 0.0001939489587947682, | |
| "logits/chosen": -0.8559134006500244, | |
| "logits/rejected": -0.8664484620094299, | |
| "logps/chosen": -6.8310418128967285, | |
| "logps/rejected": -31.699092864990234, | |
| "loss": 0.6303547024726868, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32207247614860535, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2676079273223877, | |
| "rewards/margins": 2.117737293243408, | |
| "rewards/rejected": -1.8501293659210205, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.15652656261818915, | |
| "grad_norm": 2.568023681640625, | |
| "learning_rate": 0.00019385718508739262, | |
| "logits/chosen": -0.8656299710273743, | |
| "logits/rejected": -0.8692151308059692, | |
| "logps/chosen": -8.725165367126465, | |
| "logps/rejected": -33.851287841796875, | |
| "loss": 0.7019908428192139, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41890949010849, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18432064354419708, | |
| "rewards/margins": 2.251908302307129, | |
| "rewards/rejected": -2.0675878524780273, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.1573334005698293, | |
| "grad_norm": 8.88502025604248, | |
| "learning_rate": 0.000193764742706556, | |
| "logits/chosen": -0.8621362447738647, | |
| "logits/rejected": -0.8639461994171143, | |
| "logps/chosen": -11.037799835205078, | |
| "logps/rejected": -21.885807037353516, | |
| "loss": 1.035823941230774, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5726286768913269, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.020187322050333023, | |
| "rewards/margins": 1.3119888305664062, | |
| "rewards/rejected": -1.2918013334274292, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.15814023852146947, | |
| "grad_norm": 5.145761489868164, | |
| "learning_rate": 0.00019367163231085227, | |
| "logits/chosen": -0.8333749771118164, | |
| "logits/rejected": -0.8401883840560913, | |
| "logps/chosen": -12.062631607055664, | |
| "logps/rejected": -28.78449249267578, | |
| "loss": 0.7770197987556458, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41585007309913635, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08489862084388733, | |
| "rewards/margins": 1.6114108562469482, | |
| "rewards/rejected": -1.5265123844146729, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.1589470764731096, | |
| "grad_norm": 9.907797813415527, | |
| "learning_rate": 0.00019357785456363452, | |
| "logits/chosen": -0.8024821281433105, | |
| "logits/rejected": -0.809442937374115, | |
| "logps/chosen": -10.157941818237305, | |
| "logps/rejected": -25.024654388427734, | |
| "loss": 1.1124495267868042, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5751543045043945, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.056628137826919556, | |
| "rewards/margins": 1.3617597818374634, | |
| "rewards/rejected": -1.4183878898620605, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.15975391442474976, | |
| "grad_norm": 5.390470027923584, | |
| "learning_rate": 0.00019348341013301014, | |
| "logits/chosen": -0.8071514368057251, | |
| "logits/rejected": -0.8174934387207031, | |
| "logps/chosen": -8.75635814666748, | |
| "logps/rejected": -33.552799224853516, | |
| "loss": 0.6396787166595459, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39103907346725464, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2289201021194458, | |
| "rewards/margins": 1.8501532077789307, | |
| "rewards/rejected": -1.6212331056594849, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.1605607523763899, | |
| "grad_norm": 2.6979644298553467, | |
| "learning_rate": 0.00019338829969183644, | |
| "logits/chosen": -0.810739278793335, | |
| "logits/rejected": -0.8188509941101074, | |
| "logps/chosen": -7.122466087341309, | |
| "logps/rejected": -26.984783172607422, | |
| "loss": 0.7288452386856079, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3455110192298889, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12697723507881165, | |
| "rewards/margins": 1.6645798683166504, | |
| "rewards/rejected": -1.5376026630401611, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.16136759032803005, | |
| "grad_norm": 3.698697805404663, | |
| "learning_rate": 0.00019329252391771555, | |
| "logits/chosen": -0.7774844765663147, | |
| "logits/rejected": -0.7780304551124573, | |
| "logps/chosen": -12.480424880981445, | |
| "logps/rejected": -22.409971237182617, | |
| "loss": 0.9710755944252014, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5477850437164307, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16317154467105865, | |
| "rewards/margins": 1.5441625118255615, | |
| "rewards/rejected": -1.380990982055664, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.1621744282796702, | |
| "grad_norm": 2.8351235389709473, | |
| "learning_rate": 0.00019319608349298962, | |
| "logits/chosen": -0.8196174502372742, | |
| "logits/rejected": -0.8330628275871277, | |
| "logps/chosen": -7.196435928344727, | |
| "logps/rejected": -30.938335418701172, | |
| "loss": 0.6695919632911682, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31925174593925476, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.21494938433170319, | |
| "rewards/margins": 1.952761173248291, | |
| "rewards/rejected": -1.737811803817749, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.16298126623131035, | |
| "grad_norm": 5.542436599731445, | |
| "learning_rate": 0.0001930989791047361, | |
| "logits/chosen": -0.7954035997390747, | |
| "logits/rejected": -0.7969664335250854, | |
| "logps/chosen": -10.17538070678711, | |
| "logps/rejected": -20.19991683959961, | |
| "loss": 0.8598300218582153, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46379411220550537, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1660608947277069, | |
| "rewards/margins": 1.2763766050338745, | |
| "rewards/rejected": -1.1103156805038452, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1637881041829505, | |
| "grad_norm": 5.940423011779785, | |
| "learning_rate": 0.00019300121144476276, | |
| "logits/chosen": -0.8003661632537842, | |
| "logits/rejected": -0.8022105097770691, | |
| "logps/chosen": -7.63640022277832, | |
| "logps/rejected": -24.617435455322266, | |
| "loss": 0.8151254057884216, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3810645043849945, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07057296484708786, | |
| "rewards/margins": 1.2225996255874634, | |
| "rewards/rejected": -1.1520267724990845, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.16459494213459067, | |
| "grad_norm": 2.6105964183807373, | |
| "learning_rate": 0.00019290278120960265, | |
| "logits/chosen": -0.7997848391532898, | |
| "logits/rejected": -0.805422306060791, | |
| "logps/chosen": -14.606799125671387, | |
| "logps/rejected": -31.826797485351562, | |
| "loss": 0.77715665102005, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43484237790107727, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.14822271466255188, | |
| "rewards/margins": 1.6973564624786377, | |
| "rewards/rejected": -1.5491337776184082, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.1654017800862308, | |
| "grad_norm": 2.472439765930176, | |
| "learning_rate": 0.00019280368910050942, | |
| "logits/chosen": -0.8194397687911987, | |
| "logits/rejected": -0.8225022554397583, | |
| "logps/chosen": -11.139198303222656, | |
| "logps/rejected": -29.919803619384766, | |
| "loss": 0.6480454206466675, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3610724210739136, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.27185019850730896, | |
| "rewards/margins": 1.6965210437774658, | |
| "rewards/rejected": -1.4246705770492554, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.16620861803787096, | |
| "grad_norm": 2.494168758392334, | |
| "learning_rate": 0.00019270393582345206, | |
| "logits/chosen": -0.7520598769187927, | |
| "logits/rejected": -0.7561833262443542, | |
| "logps/chosen": -6.9641194343566895, | |
| "logps/rejected": -28.728130340576172, | |
| "loss": 0.5702533721923828, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29727238416671753, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28327614068984985, | |
| "rewards/margins": 1.785872220993042, | |
| "rewards/rejected": -1.5025960206985474, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.16701545598951112, | |
| "grad_norm": 4.714883327484131, | |
| "learning_rate": 0.00019260352208910997, | |
| "logits/chosen": -0.8163325786590576, | |
| "logits/rejected": -0.8220417499542236, | |
| "logps/chosen": -9.346306800842285, | |
| "logps/rejected": -24.412797927856445, | |
| "loss": 0.8744742274284363, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45610249042510986, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13759079575538635, | |
| "rewards/margins": 1.5552394390106201, | |
| "rewards/rejected": -1.4176486730575562, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.16782229394115125, | |
| "grad_norm": 4.433586597442627, | |
| "learning_rate": 0.0001925024486128679, | |
| "logits/chosen": -0.7977516055107117, | |
| "logits/rejected": -0.7999525666236877, | |
| "logps/chosen": -6.685362339019775, | |
| "logps/rejected": -30.688045501708984, | |
| "loss": 0.7153071165084839, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4366532862186432, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.29755526781082153, | |
| "rewards/margins": 2.2702927589416504, | |
| "rewards/rejected": -1.972737431526184, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.1686291318927914, | |
| "grad_norm": 4.401594161987305, | |
| "learning_rate": 0.00019240071611481086, | |
| "logits/chosen": -0.8025681376457214, | |
| "logits/rejected": -0.8077267408370972, | |
| "logps/chosen": -13.663830757141113, | |
| "logps/rejected": -24.164400100708008, | |
| "loss": 1.104232668876648, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6018862724304199, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.03685776889324188, | |
| "rewards/margins": 1.151037573814392, | |
| "rewards/rejected": -1.1141799688339233, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.16943596984443154, | |
| "grad_norm": 4.337040424346924, | |
| "learning_rate": 0.00019229832531971895, | |
| "logits/chosen": -0.7619237899780273, | |
| "logits/rejected": -0.7677690982818604, | |
| "logps/chosen": -9.870525360107422, | |
| "logps/rejected": -29.796783447265625, | |
| "loss": 0.7632872462272644, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.44924822449684143, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.225393608212471, | |
| "rewards/margins": 1.9376754760742188, | |
| "rewards/rejected": -1.7122818231582642, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.1702428077960717, | |
| "grad_norm": 3.420403480529785, | |
| "learning_rate": 0.00019219527695706225, | |
| "logits/chosen": -0.8083672523498535, | |
| "logits/rejected": -0.8105168342590332, | |
| "logps/chosen": -11.423739433288574, | |
| "logps/rejected": -28.65767478942871, | |
| "loss": 0.821802020072937, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4434516131877899, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.02067011035978794, | |
| "rewards/margins": 1.7222641706466675, | |
| "rewards/rejected": -1.742934226989746, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.17104964574771186, | |
| "grad_norm": 3.6967742443084717, | |
| "learning_rate": 0.0001920915717609956, | |
| "logits/chosen": -0.7133735418319702, | |
| "logits/rejected": -0.7154325246810913, | |
| "logps/chosen": -10.63201904296875, | |
| "logps/rejected": -32.25654220581055, | |
| "loss": 0.787774384021759, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4298105239868164, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.11374176293611526, | |
| "rewards/margins": 1.7497272491455078, | |
| "rewards/rejected": -1.6359853744506836, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.171856483699352, | |
| "grad_norm": 2.264280319213867, | |
| "learning_rate": 0.00019198721047035332, | |
| "logits/chosen": -0.7573313117027283, | |
| "logits/rejected": -0.7648686766624451, | |
| "logps/chosen": -6.39276123046875, | |
| "logps/rejected": -36.62308883666992, | |
| "loss": 0.5318189859390259, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.290658563375473, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.29253923892974854, | |
| "rewards/margins": 2.4327423572540283, | |
| "rewards/rejected": -2.1402029991149902, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.17266332165099216, | |
| "grad_norm": 5.493023872375488, | |
| "learning_rate": 0.00019188219382864404, | |
| "logits/chosen": -0.7108193039894104, | |
| "logits/rejected": -0.7183860540390015, | |
| "logps/chosen": -9.189270973205566, | |
| "logps/rejected": -31.597461700439453, | |
| "loss": 0.7931143045425415, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.416747510433197, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.12628071010112762, | |
| "rewards/margins": 2.070514440536499, | |
| "rewards/rejected": -1.944233775138855, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.17347015960263232, | |
| "grad_norm": 4.492797374725342, | |
| "learning_rate": 0.00019177652258404537, | |
| "logits/chosen": -0.6989372968673706, | |
| "logits/rejected": -0.7087696194648743, | |
| "logps/chosen": -8.885594367980957, | |
| "logps/rejected": -34.03559112548828, | |
| "loss": 0.6859308481216431, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3817839026451111, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.28730612993240356, | |
| "rewards/margins": 2.0253334045410156, | |
| "rewards/rejected": -1.7380273342132568, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.17427699755427245, | |
| "grad_norm": 3.6368393898010254, | |
| "learning_rate": 0.00019167019748939846, | |
| "logits/chosen": -0.6883965134620667, | |
| "logits/rejected": -0.6965335607528687, | |
| "logps/chosen": -10.925715446472168, | |
| "logps/rejected": -27.23555564880371, | |
| "loss": 0.8080936074256897, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4929322898387909, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2524645924568176, | |
| "rewards/margins": 1.5861448049545288, | |
| "rewards/rejected": -1.333680272102356, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1750838355059126, | |
| "grad_norm": 5.671794414520264, | |
| "learning_rate": 0.00019156321930220282, | |
| "logits/chosen": -0.691314160823822, | |
| "logits/rejected": -0.6934138536453247, | |
| "logps/chosen": -9.144570350646973, | |
| "logps/rejected": -25.588308334350586, | |
| "loss": 0.662991464138031, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3658694326877594, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18018078804016113, | |
| "rewards/margins": 1.5743441581726074, | |
| "rewards/rejected": -1.3941633701324463, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.17589067345755277, | |
| "grad_norm": 2.1973373889923096, | |
| "learning_rate": 0.00019145558878461082, | |
| "logits/chosen": -0.6576846241950989, | |
| "logits/rejected": -0.6600756049156189, | |
| "logps/chosen": -6.376984596252441, | |
| "logps/rejected": -29.26129150390625, | |
| "loss": 0.6061776280403137, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2504776120185852, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.19691388309001923, | |
| "rewards/margins": 1.7360740900039673, | |
| "rewards/rejected": -1.5391600131988525, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1766975114091929, | |
| "grad_norm": 2.812636137008667, | |
| "learning_rate": 0.0001913473067034222, | |
| "logits/chosen": -0.6517618298530579, | |
| "logits/rejected": -0.6520282626152039, | |
| "logps/chosen": -8.633819580078125, | |
| "logps/rejected": -33.03736877441406, | |
| "loss": 0.6993431448936462, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29945075511932373, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.11881062388420105, | |
| "rewards/margins": 2.108510971069336, | |
| "rewards/rejected": -1.9897003173828125, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.17750434936083306, | |
| "grad_norm": 7.618241786956787, | |
| "learning_rate": 0.00019123837383007883, | |
| "logits/chosen": -0.644814133644104, | |
| "logits/rejected": -0.6507334113121033, | |
| "logps/chosen": -13.946501731872559, | |
| "logps/rejected": -32.865543365478516, | |
| "loss": 1.0418133735656738, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7301790714263916, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10093473643064499, | |
| "rewards/margins": 2.085968017578125, | |
| "rewards/rejected": -1.9850331544876099, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.17831118731247322, | |
| "grad_norm": 4.556211948394775, | |
| "learning_rate": 0.0001911287909406589, | |
| "logits/chosen": -0.6804370880126953, | |
| "logits/rejected": -0.6847546696662903, | |
| "logps/chosen": -12.122690200805664, | |
| "logps/rejected": -36.90291976928711, | |
| "loss": 0.6899932622909546, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3899839520454407, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09739936888217926, | |
| "rewards/margins": 2.288754940032959, | |
| "rewards/rejected": -2.1913557052612305, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.17911802526411336, | |
| "grad_norm": 6.417980194091797, | |
| "learning_rate": 0.00019101855881587166, | |
| "logits/chosen": -0.7121025919914246, | |
| "logits/rejected": -0.7198390364646912, | |
| "logps/chosen": -10.071988105773926, | |
| "logps/rejected": -30.89111328125, | |
| "loss": 1.0868934392929077, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7049968242645264, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.059290315955877304, | |
| "rewards/margins": 2.18007755279541, | |
| "rewards/rejected": -2.1207873821258545, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.17992486321575352, | |
| "grad_norm": 3.5655276775360107, | |
| "learning_rate": 0.00019090767824105173, | |
| "logits/chosen": -0.7064835429191589, | |
| "logits/rejected": -0.7118909358978271, | |
| "logps/chosen": -9.299367904663086, | |
| "logps/rejected": -33.5615234375, | |
| "loss": 0.5532280802726746, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3098145127296448, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1762467920780182, | |
| "rewards/margins": 2.1976656913757324, | |
| "rewards/rejected": -2.0214192867279053, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18073170116739365, | |
| "grad_norm": 3.168497085571289, | |
| "learning_rate": 0.00019079615000615352, | |
| "logits/chosen": -0.7555636763572693, | |
| "logits/rejected": -0.7638076543807983, | |
| "logps/chosen": -6.343996524810791, | |
| "logps/rejected": -35.11958694458008, | |
| "loss": 0.544819712638855, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2573380768299103, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08291390538215637, | |
| "rewards/margins": 2.359328269958496, | |
| "rewards/rejected": -2.276414394378662, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1815385391190338, | |
| "grad_norm": 3.8726441860198975, | |
| "learning_rate": 0.00019068397490574563, | |
| "logits/chosen": -0.7438031435012817, | |
| "logits/rejected": -0.7529388070106506, | |
| "logps/chosen": -7.913335800170898, | |
| "logps/rejected": -42.34702682495117, | |
| "loss": 0.6369010210037231, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40800100564956665, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10036337375640869, | |
| "rewards/margins": 2.888615131378174, | |
| "rewards/rejected": -2.7882518768310547, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.18234537707067397, | |
| "grad_norm": 3.78493595123291, | |
| "learning_rate": 0.00019057115373900514, | |
| "logits/chosen": -0.6967946290969849, | |
| "logits/rejected": -0.7004595994949341, | |
| "logps/chosen": -10.167012214660645, | |
| "logps/rejected": -32.77048873901367, | |
| "loss": 0.6220114231109619, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.351274311542511, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23287636041641235, | |
| "rewards/margins": 2.1248767375946045, | |
| "rewards/rejected": -1.8920003175735474, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1831522150223141, | |
| "grad_norm": 4.551224231719971, | |
| "learning_rate": 0.00019045768730971196, | |
| "logits/chosen": -0.7525245547294617, | |
| "logits/rejected": -0.7602270841598511, | |
| "logps/chosen": -7.277904987335205, | |
| "logps/rejected": -39.11262130737305, | |
| "loss": 0.49062812328338623, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.24764156341552734, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2196008712053299, | |
| "rewards/margins": 2.6062889099121094, | |
| "rewards/rejected": -2.386688232421875, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18395905297395426, | |
| "grad_norm": 3.352492094039917, | |
| "learning_rate": 0.00019034357642624313, | |
| "logits/chosen": -0.7168059349060059, | |
| "logits/rejected": -0.7239040732383728, | |
| "logps/chosen": -14.352468490600586, | |
| "logps/rejected": -43.02729415893555, | |
| "loss": 0.9112517833709717, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6249459981918335, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.11119358241558075, | |
| "rewards/margins": 2.6521291732788086, | |
| "rewards/rejected": -2.7633233070373535, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18476589092559442, | |
| "grad_norm": 9.10729694366455, | |
| "learning_rate": 0.00019022882190156693, | |
| "logits/chosen": -0.7800168991088867, | |
| "logits/rejected": -0.7834780216217041, | |
| "logps/chosen": -6.645830154418945, | |
| "logps/rejected": -37.247894287109375, | |
| "loss": 0.6339117288589478, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3112393617630005, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1333404928445816, | |
| "rewards/margins": 2.6678478717803955, | |
| "rewards/rejected": -2.5345070362091064, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18557272887723456, | |
| "grad_norm": 8.036460876464844, | |
| "learning_rate": 0.0001901134245532372, | |
| "logits/chosen": -0.7188634276390076, | |
| "logits/rejected": -0.7256328463554382, | |
| "logps/chosen": -8.977944374084473, | |
| "logps/rejected": -39.439598083496094, | |
| "loss": 0.7736544609069824, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40554046630859375, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07693760097026825, | |
| "rewards/margins": 2.647231101989746, | |
| "rewards/rejected": -2.570293426513672, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18637956682887472, | |
| "grad_norm": 14.515076637268066, | |
| "learning_rate": 0.00018999738520338765, | |
| "logits/chosen": -0.7673274874687195, | |
| "logits/rejected": -0.7723326086997986, | |
| "logps/chosen": -11.787941932678223, | |
| "logps/rejected": -31.827787399291992, | |
| "loss": 1.2146649360656738, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7273156642913818, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.19174721837043762, | |
| "rewards/margins": 1.6821880340576172, | |
| "rewards/rejected": -1.8739351034164429, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18718640478051488, | |
| "grad_norm": 5.435638904571533, | |
| "learning_rate": 0.00018988070467872565, | |
| "logits/chosen": -0.6913294792175293, | |
| "logits/rejected": -0.6982335448265076, | |
| "logps/chosen": -8.256817817687988, | |
| "logps/rejected": -33.933128356933594, | |
| "loss": 0.7231890559196472, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42718639969825745, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2676782011985779, | |
| "rewards/margins": 2.2451353073120117, | |
| "rewards/rejected": -1.977457046508789, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.187993242732155, | |
| "grad_norm": 4.923380374908447, | |
| "learning_rate": 0.00018976338381052662, | |
| "logits/chosen": -0.6979964971542358, | |
| "logits/rejected": -0.6987626552581787, | |
| "logps/chosen": -9.278888702392578, | |
| "logps/rejected": -31.988529205322266, | |
| "loss": 0.7011741399765015, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3678920269012451, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.17272722721099854, | |
| "rewards/margins": 2.0346527099609375, | |
| "rewards/rejected": -1.8619252443313599, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.18880008068379517, | |
| "grad_norm": 5.102010250091553, | |
| "learning_rate": 0.00018964542343462802, | |
| "logits/chosen": -0.7147118449211121, | |
| "logits/rejected": -0.7210678458213806, | |
| "logps/chosen": -11.869325637817383, | |
| "logps/rejected": -26.554332733154297, | |
| "loss": 0.7859650254249573, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4002649784088135, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16828711330890656, | |
| "rewards/margins": 1.6456825733184814, | |
| "rewards/rejected": -1.4773954153060913, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1896069186354353, | |
| "grad_norm": 2.8259975910186768, | |
| "learning_rate": 0.0001895268243914234, | |
| "logits/chosen": -0.7181320786476135, | |
| "logits/rejected": -0.7195937633514404, | |
| "logps/chosen": -9.674834251403809, | |
| "logps/rejected": -26.982505798339844, | |
| "loss": 0.7054999470710754, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3795202672481537, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19310441613197327, | |
| "rewards/margins": 1.8784090280532837, | |
| "rewards/rejected": -1.6853046417236328, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.19041375658707546, | |
| "grad_norm": 2.970991373062134, | |
| "learning_rate": 0.0001894075875258564, | |
| "logits/chosen": -0.7360837459564209, | |
| "logits/rejected": -0.7415453195571899, | |
| "logps/chosen": -7.354928493499756, | |
| "logps/rejected": -26.934494018554688, | |
| "loss": 0.7415454983711243, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37382036447525024, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.24830269813537598, | |
| "rewards/margins": 1.7458440065383911, | |
| "rewards/rejected": -1.4975413084030151, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.19122059453871562, | |
| "grad_norm": 2.9580154418945312, | |
| "learning_rate": 0.00018928771368741475, | |
| "logits/chosen": -0.6901527643203735, | |
| "logits/rejected": -0.6940097808837891, | |
| "logps/chosen": -7.6646575927734375, | |
| "logps/rejected": -28.092966079711914, | |
| "loss": 0.7272118330001831, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4050924777984619, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22855332493782043, | |
| "rewards/margins": 1.7601354122161865, | |
| "rewards/rejected": -1.531581997871399, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.19202743249035575, | |
| "grad_norm": 5.010228633880615, | |
| "learning_rate": 0.00018916720373012426, | |
| "logits/chosen": -0.7200859785079956, | |
| "logits/rejected": -0.7226930260658264, | |
| "logps/chosen": -10.032082557678223, | |
| "logps/rejected": -19.060348510742188, | |
| "loss": 0.8445019125938416, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42176133394241333, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18809281289577484, | |
| "rewards/margins": 1.2276759147644043, | |
| "rewards/rejected": -1.0395830869674683, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19283427044199591, | |
| "grad_norm": 8.475236892700195, | |
| "learning_rate": 0.0001890460585125426, | |
| "logits/chosen": -0.7142471075057983, | |
| "logits/rejected": -0.7235907912254333, | |
| "logps/chosen": -6.3985443115234375, | |
| "logps/rejected": -33.978721618652344, | |
| "loss": 0.6591022610664368, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43263474106788635, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22361797094345093, | |
| "rewards/margins": 2.1702280044555664, | |
| "rewards/rejected": -1.9466102123260498, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19364110839363607, | |
| "grad_norm": 3.6248912811279297, | |
| "learning_rate": 0.00018892427889775332, | |
| "logits/chosen": -0.7144255638122559, | |
| "logits/rejected": -0.7168291807174683, | |
| "logps/chosen": -9.34170150756836, | |
| "logps/rejected": -30.304466247558594, | |
| "loss": 0.6725300550460815, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39394479990005493, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13639676570892334, | |
| "rewards/margins": 1.9869462251663208, | |
| "rewards/rejected": -1.850549578666687, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1944479463452762, | |
| "grad_norm": 6.973753452301025, | |
| "learning_rate": 0.00018880186575335968, | |
| "logits/chosen": -0.6703215837478638, | |
| "logits/rejected": -0.6775541305541992, | |
| "logps/chosen": -12.076030731201172, | |
| "logps/rejected": -28.837940216064453, | |
| "loss": 0.7876323461532593, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4970223605632782, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.17666694521903992, | |
| "rewards/margins": 1.7176096439361572, | |
| "rewards/rejected": -1.540942668914795, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19525478429691637, | |
| "grad_norm": 3.2324650287628174, | |
| "learning_rate": 0.00018867881995147836, | |
| "logits/chosen": -0.7113248705863953, | |
| "logits/rejected": -0.7163888216018677, | |
| "logps/chosen": -9.168296813964844, | |
| "logps/rejected": -34.54369354248047, | |
| "loss": 0.6157009601593018, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37985488772392273, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.28986138105392456, | |
| "rewards/margins": 2.2379894256591797, | |
| "rewards/rejected": -1.9481279850006104, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19606162224855653, | |
| "grad_norm": 2.7521631717681885, | |
| "learning_rate": 0.00018855514236873337, | |
| "logits/chosen": -0.7281562089920044, | |
| "logits/rejected": -0.734757661819458, | |
| "logps/chosen": -7.001053333282471, | |
| "logps/rejected": -33.900177001953125, | |
| "loss": 0.5766606330871582, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3622375726699829, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.30857908725738525, | |
| "rewards/margins": 2.3744540214538574, | |
| "rewards/rejected": -2.0658748149871826, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19686846020019666, | |
| "grad_norm": 3.977639675140381, | |
| "learning_rate": 0.0001884308338862498, | |
| "logits/chosen": -0.6999315023422241, | |
| "logits/rejected": -0.7055974006652832, | |
| "logps/chosen": -8.435256004333496, | |
| "logps/rejected": -33.67347717285156, | |
| "loss": 0.590577244758606, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35361507534980774, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2805049419403076, | |
| "rewards/margins": 2.308706283569336, | |
| "rewards/rejected": -2.0282013416290283, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19767529815183682, | |
| "grad_norm": 9.163761138916016, | |
| "learning_rate": 0.00018830589538964746, | |
| "logits/chosen": -0.7660690546035767, | |
| "logits/rejected": -0.7758455276489258, | |
| "logps/chosen": -8.95065975189209, | |
| "logps/rejected": -33.142677307128906, | |
| "loss": 0.8324503302574158, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42908376455307007, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11282955855131149, | |
| "rewards/margins": 2.1978847980499268, | |
| "rewards/rejected": -2.085055351257324, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.19848213610347698, | |
| "grad_norm": 4.68986701965332, | |
| "learning_rate": 0.00018818032776903466, | |
| "logits/chosen": -0.7814006805419922, | |
| "logits/rejected": -0.7920705676078796, | |
| "logps/chosen": -8.228378295898438, | |
| "logps/rejected": -46.880313873291016, | |
| "loss": 0.6729190349578857, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4284536838531494, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0902179628610611, | |
| "rewards/margins": 3.1966192722320557, | |
| "rewards/rejected": -3.106401205062866, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1992889740551171, | |
| "grad_norm": 5.915354251861572, | |
| "learning_rate": 0.00018805413191900168, | |
| "logits/chosen": -0.7995182871818542, | |
| "logits/rejected": -0.805888295173645, | |
| "logps/chosen": -12.739469528198242, | |
| "logps/rejected": -35.06949996948242, | |
| "loss": 0.7942692041397095, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43145498633384705, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.08451483398675919, | |
| "rewards/margins": 2.140747547149658, | |
| "rewards/rejected": -2.22526216506958, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.20009581200675727, | |
| "grad_norm": 7.71060848236084, | |
| "learning_rate": 0.00018792730873861473, | |
| "logits/chosen": -0.8068017363548279, | |
| "logits/rejected": -0.8110726475715637, | |
| "logps/chosen": -11.049007415771484, | |
| "logps/rejected": -39.38182067871094, | |
| "loss": 0.8510176539421082, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4571390151977539, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.20343750715255737, | |
| "rewards/margins": 2.1684627532958984, | |
| "rewards/rejected": -2.3719000816345215, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.2009026499583974, | |
| "grad_norm": 9.637003898620605, | |
| "learning_rate": 0.00018779985913140924, | |
| "logits/chosen": -0.7676049470901489, | |
| "logits/rejected": -0.7769947648048401, | |
| "logps/chosen": -8.674398422241211, | |
| "logps/rejected": -48.47040557861328, | |
| "loss": 0.9282071590423584, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6683814525604248, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.20568305253982544, | |
| "rewards/margins": 3.0397698879241943, | |
| "rewards/rejected": -3.245452642440796, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.20170948791003757, | |
| "grad_norm": 8.807076454162598, | |
| "learning_rate": 0.0001876717840053836, | |
| "logits/chosen": -0.7096577882766724, | |
| "logits/rejected": -0.7144345641136169, | |
| "logps/chosen": -17.149080276489258, | |
| "logps/rejected": -33.67993927001953, | |
| "loss": 1.056300401687622, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6277230381965637, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.030492231249809265, | |
| "rewards/margins": 2.3309168815612793, | |
| "rewards/rejected": -2.3614089488983154, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.20251632586167773, | |
| "grad_norm": 4.773517608642578, | |
| "learning_rate": 0.00018754308427299256, | |
| "logits/chosen": -0.6819360852241516, | |
| "logits/rejected": -0.6919792294502258, | |
| "logps/chosen": -10.13283634185791, | |
| "logps/rejected": -36.599456787109375, | |
| "loss": 0.8876217007637024, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.47694316506385803, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.12443971633911133, | |
| "rewards/margins": 2.1682839393615723, | |
| "rewards/rejected": -2.2927236557006836, | |
| "step": 251, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.20332316381331786, | |
| "grad_norm": 4.1274027824401855, | |
| "learning_rate": 0.00018741376085114087, | |
| "logits/chosen": -0.7192296981811523, | |
| "logits/rejected": -0.7263290882110596, | |
| "logps/chosen": -16.484987258911133, | |
| "logps/rejected": -34.811126708984375, | |
| "loss": 0.8948942422866821, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5631111860275269, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.20992696285247803, | |
| "rewards/margins": 2.0608201026916504, | |
| "rewards/rejected": -1.8508930206298828, | |
| "step": 252, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.20413000176495802, | |
| "grad_norm": 4.913299560546875, | |
| "learning_rate": 0.0001872838146611766, | |
| "logits/chosen": -0.6601164937019348, | |
| "logits/rejected": -0.6605373620986938, | |
| "logps/chosen": -12.14169979095459, | |
| "logps/rejected": -26.232892990112305, | |
| "loss": 0.8705669045448303, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4974067509174347, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2535248100757599, | |
| "rewards/margins": 1.8131681680679321, | |
| "rewards/rejected": -1.5596435070037842, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.20493683971659818, | |
| "grad_norm": 2.4414825439453125, | |
| "learning_rate": 0.0001871532466288847, | |
| "logits/chosen": -0.6655547618865967, | |
| "logits/rejected": -0.6710434556007385, | |
| "logps/chosen": -7.641450881958008, | |
| "logps/rejected": -27.024456024169922, | |
| "loss": 0.5410662293434143, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2969762682914734, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2998022437095642, | |
| "rewards/margins": 1.8008990287780762, | |
| "rewards/rejected": -1.5010967254638672, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.2057436776682383, | |
| "grad_norm": 9.875016212463379, | |
| "learning_rate": 0.0001870220576844804, | |
| "logits/chosen": -0.6554844379425049, | |
| "logits/rejected": -0.6586723923683167, | |
| "logps/chosen": -10.128920555114746, | |
| "logps/rejected": -28.380104064941406, | |
| "loss": 1.077211856842041, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.703222930431366, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11552818864583969, | |
| "rewards/margins": 1.8149248361587524, | |
| "rewards/rejected": -1.6993966102600098, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.20655051561987847, | |
| "grad_norm": 2.7163054943084717, | |
| "learning_rate": 0.0001868902487626024, | |
| "logits/chosen": -0.725955605506897, | |
| "logits/rejected": -0.7319348454475403, | |
| "logps/chosen": -6.896210193634033, | |
| "logps/rejected": -30.118925094604492, | |
| "loss": 0.5430217385292053, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2342616319656372, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2470369040966034, | |
| "rewards/margins": 1.7953723669052124, | |
| "rewards/rejected": -1.548335313796997, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.20735735357151863, | |
| "grad_norm": 3.3832037448883057, | |
| "learning_rate": 0.00018675782080230648, | |
| "logits/chosen": -0.6649719476699829, | |
| "logits/rejected": -0.6653549671173096, | |
| "logps/chosen": -6.564362049102783, | |
| "logps/rejected": -26.97052764892578, | |
| "loss": 0.6336417198181152, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33324965834617615, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07798978686332703, | |
| "rewards/margins": 1.5198760032653809, | |
| "rewards/rejected": -1.4418861865997314, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.20816419152315876, | |
| "grad_norm": 4.554774761199951, | |
| "learning_rate": 0.00018662477474705864, | |
| "logits/chosen": -0.6891136169433594, | |
| "logits/rejected": -0.7018118500709534, | |
| "logps/chosen": -10.358716011047363, | |
| "logps/rejected": -33.35871124267578, | |
| "loss": 0.944884181022644, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.515121579170227, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15751619637012482, | |
| "rewards/margins": 1.947699785232544, | |
| "rewards/rejected": -1.790183663368225, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.20897102947479892, | |
| "grad_norm": 6.9074788093566895, | |
| "learning_rate": 0.00018649111154472842, | |
| "logits/chosen": -0.6972513794898987, | |
| "logits/rejected": -0.7002527117729187, | |
| "logps/chosen": -9.99314022064209, | |
| "logps/rejected": -20.69109344482422, | |
| "loss": 1.1074203252792358, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6453499794006348, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05247223377227783, | |
| "rewards/margins": 1.2508971691131592, | |
| "rewards/rejected": -1.1984249353408813, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.20977786742643906, | |
| "grad_norm": 6.223460674285889, | |
| "learning_rate": 0.00018635683214758214, | |
| "logits/chosen": -0.7319504022598267, | |
| "logits/rejected": -0.7356070280075073, | |
| "logps/chosen": -8.844853401184082, | |
| "logps/rejected": -32.97547912597656, | |
| "loss": 0.7976398468017578, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.425577849149704, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04917633533477783, | |
| "rewards/margins": 1.9350166320800781, | |
| "rewards/rejected": -1.8858401775360107, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21058470537807922, | |
| "grad_norm": 6.114218711853027, | |
| "learning_rate": 0.00018622193751227607, | |
| "logits/chosen": -0.7542300820350647, | |
| "logits/rejected": -0.7576084733009338, | |
| "logps/chosen": -5.740233898162842, | |
| "logps/rejected": -24.60858917236328, | |
| "loss": 0.5687559247016907, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27638113498687744, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23254472017288208, | |
| "rewards/margins": 1.7274789810180664, | |
| "rewards/rejected": -1.49493408203125, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.21139154332971938, | |
| "grad_norm": 3.313537836074829, | |
| "learning_rate": 0.00018608642859984978, | |
| "logits/chosen": -0.8011643886566162, | |
| "logits/rejected": -0.803293764591217, | |
| "logps/chosen": -9.771310806274414, | |
| "logps/rejected": -28.634235382080078, | |
| "loss": 0.7911385893821716, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41166451573371887, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.265075147151947, | |
| "rewards/margins": 2.063453197479248, | |
| "rewards/rejected": -1.7983779907226562, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.2121983812813595, | |
| "grad_norm": 3.156975746154785, | |
| "learning_rate": 0.00018595030637571906, | |
| "logits/chosen": -0.7707415223121643, | |
| "logits/rejected": -0.7777128219604492, | |
| "logps/chosen": -10.236924171447754, | |
| "logps/rejected": -30.459064483642578, | |
| "loss": 0.6563097238540649, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3598516285419464, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24525853991508484, | |
| "rewards/margins": 2.071570873260498, | |
| "rewards/rejected": -1.82631254196167, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21300521923299967, | |
| "grad_norm": 4.330559730529785, | |
| "learning_rate": 0.00018581357180966925, | |
| "logits/chosen": -0.8070797920227051, | |
| "logits/rejected": -0.8171977400779724, | |
| "logps/chosen": -9.34181022644043, | |
| "logps/rejected": -32.88754653930664, | |
| "loss": 0.8858993053436279, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.49547457695007324, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.15189547836780548, | |
| "rewards/margins": 1.979980230331421, | |
| "rewards/rejected": -1.828084945678711, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21381205718463983, | |
| "grad_norm": 5.864645957946777, | |
| "learning_rate": 0.00018567622587584818, | |
| "logits/chosen": -0.7768454551696777, | |
| "logits/rejected": -0.781791090965271, | |
| "logps/chosen": -8.989236831665039, | |
| "logps/rejected": -33.998809814453125, | |
| "loss": 0.748650848865509, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46606677770614624, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22831673920154572, | |
| "rewards/margins": 2.1091978549957275, | |
| "rewards/rejected": -1.8808808326721191, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.21461889513627996, | |
| "grad_norm": 8.510169982910156, | |
| "learning_rate": 0.00018553826955275936, | |
| "logits/chosen": -0.8200643062591553, | |
| "logits/rejected": -0.8230538368225098, | |
| "logps/chosen": -14.249617576599121, | |
| "logps/rejected": -25.856830596923828, | |
| "loss": 1.2568143606185913, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.629042387008667, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.19409911334514618, | |
| "rewards/margins": 1.33782160282135, | |
| "rewards/rejected": -1.5319206714630127, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21542573308792012, | |
| "grad_norm": 3.2720420360565186, | |
| "learning_rate": 0.00018539970382325482, | |
| "logits/chosen": -0.8381865620613098, | |
| "logits/rejected": -0.8415036201477051, | |
| "logps/chosen": -7.8104567527771, | |
| "logps/rejected": -31.601917266845703, | |
| "loss": 0.5837196111679077, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.24857257306575775, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14021825790405273, | |
| "rewards/margins": 2.0099189281463623, | |
| "rewards/rejected": -1.8697006702423096, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21623257103956028, | |
| "grad_norm": 3.4341468811035156, | |
| "learning_rate": 0.00018526052967452836, | |
| "logits/chosen": -0.7830556631088257, | |
| "logits/rejected": -0.7897158265113831, | |
| "logps/chosen": -11.684428215026855, | |
| "logps/rejected": -36.22364044189453, | |
| "loss": 0.7827985882759094, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48799192905426025, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.08203143626451492, | |
| "rewards/margins": 1.9769901037216187, | |
| "rewards/rejected": -1.89495849609375, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21703940899120042, | |
| "grad_norm": 3.692969799041748, | |
| "learning_rate": 0.00018512074809810833, | |
| "logits/chosen": -0.7967461347579956, | |
| "logits/rejected": -0.7945878505706787, | |
| "logps/chosen": -10.929898262023926, | |
| "logps/rejected": -23.94034194946289, | |
| "loss": 0.7881439924240112, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3369988203048706, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08296848833560944, | |
| "rewards/margins": 1.621280550956726, | |
| "rewards/rejected": -1.5383120775222778, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21784624694284058, | |
| "grad_norm": 6.830929756164551, | |
| "learning_rate": 0.00018498036008985058, | |
| "logits/chosen": -0.746848464012146, | |
| "logits/rejected": -0.7509756684303284, | |
| "logps/chosen": -9.608593940734863, | |
| "logps/rejected": -38.34101867675781, | |
| "loss": 0.7576542496681213, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4260023534297943, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.09650997817516327, | |
| "rewards/margins": 2.168517589569092, | |
| "rewards/rejected": -2.072007656097412, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21865308489448074, | |
| "grad_norm": 4.689668655395508, | |
| "learning_rate": 0.0001848393666499315, | |
| "logits/chosen": -0.7876875996589661, | |
| "logits/rejected": -0.796357274055481, | |
| "logps/chosen": -12.614479064941406, | |
| "logps/rejected": -27.662067413330078, | |
| "loss": 0.9168095588684082, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.52295982837677, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0025606881827116013, | |
| "rewards/margins": 1.4409575462341309, | |
| "rewards/rejected": -1.43839693069458, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.21945992284612087, | |
| "grad_norm": 5.61292028427124, | |
| "learning_rate": 0.00018469776878284072, | |
| "logits/chosen": -0.7697591781616211, | |
| "logits/rejected": -0.775164008140564, | |
| "logps/chosen": -5.527304649353027, | |
| "logps/rejected": -25.911758422851562, | |
| "loss": 0.7468432188034058, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32815924286842346, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.20197589695453644, | |
| "rewards/margins": 1.5008738040924072, | |
| "rewards/rejected": -1.2988977432250977, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.22026676079776103, | |
| "grad_norm": 2.823660373687744, | |
| "learning_rate": 0.00018455556749737403, | |
| "logits/chosen": -0.8068636059761047, | |
| "logits/rejected": -0.8074927926063538, | |
| "logps/chosen": -9.97484016418457, | |
| "logps/rejected": -21.8039608001709, | |
| "loss": 0.8325120210647583, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4089290499687195, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19321191310882568, | |
| "rewards/margins": 1.4057273864746094, | |
| "rewards/rejected": -1.2125153541564941, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.22107359874940116, | |
| "grad_norm": 2.5285258293151855, | |
| "learning_rate": 0.00018441276380662625, | |
| "logits/chosen": -0.7656555771827698, | |
| "logits/rejected": -0.7663451433181763, | |
| "logps/chosen": -10.646867752075195, | |
| "logps/rejected": -22.98876953125, | |
| "loss": 0.7855734825134277, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.382598340511322, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23073698580265045, | |
| "rewards/margins": 1.3868789672851562, | |
| "rewards/rejected": -1.156141996383667, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.22188043670104132, | |
| "grad_norm": 3.1718196868896484, | |
| "learning_rate": 0.00018426935872798393, | |
| "logits/chosen": -0.6983739137649536, | |
| "logits/rejected": -0.7074112892150879, | |
| "logps/chosen": -9.201760292053223, | |
| "logps/rejected": -32.77637481689453, | |
| "loss": 0.8582974672317505, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4306548535823822, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09240508079528809, | |
| "rewards/margins": 1.7474827766418457, | |
| "rewards/rejected": -1.6550780534744263, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.22268727465268148, | |
| "grad_norm": 2.530366897583008, | |
| "learning_rate": 0.00018412535328311814, | |
| "logits/chosen": -0.7532445192337036, | |
| "logits/rejected": -0.7571496963500977, | |
| "logps/chosen": -11.776863098144531, | |
| "logps/rejected": -21.776357650756836, | |
| "loss": 0.7927124500274658, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3979222774505615, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3263438642024994, | |
| "rewards/margins": 1.1879689693450928, | |
| "rewards/rejected": -0.8616250157356262, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.22349411260432162, | |
| "grad_norm": 2.8776495456695557, | |
| "learning_rate": 0.00018398074849797715, | |
| "logits/chosen": -0.7302210927009583, | |
| "logits/rejected": -0.7333999276161194, | |
| "logps/chosen": -8.04594612121582, | |
| "logps/rejected": -25.69329833984375, | |
| "loss": 0.8354058861732483, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4014919400215149, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08311442285776138, | |
| "rewards/margins": 1.4473011493682861, | |
| "rewards/rejected": -1.3641867637634277, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.22430095055596178, | |
| "grad_norm": 3.1463992595672607, | |
| "learning_rate": 0.00018383554540277923, | |
| "logits/chosen": -0.7314996719360352, | |
| "logits/rejected": -0.7379679679870605, | |
| "logps/chosen": -12.349081039428711, | |
| "logps/rejected": -30.154521942138672, | |
| "loss": 0.7297593355178833, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4262910485267639, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.09422469139099121, | |
| "rewards/margins": 1.8524787425994873, | |
| "rewards/rejected": -1.758254051208496, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.22510778850760194, | |
| "grad_norm": 3.694409132003784, | |
| "learning_rate": 0.00018368974503200515, | |
| "logits/chosen": -0.6736661195755005, | |
| "logits/rejected": -0.6801973581314087, | |
| "logps/chosen": -7.8128252029418945, | |
| "logps/rejected": -34.619964599609375, | |
| "loss": 0.5409353971481323, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27240046858787537, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14602825045585632, | |
| "rewards/margins": 2.1955599784851074, | |
| "rewards/rejected": -2.0495314598083496, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.22591462645924207, | |
| "grad_norm": 3.1639299392700195, | |
| "learning_rate": 0.00018354334842439097, | |
| "logits/chosen": -0.6950223445892334, | |
| "logits/rejected": -0.6963911056518555, | |
| "logps/chosen": -11.003353118896484, | |
| "logps/rejected": -29.378337860107422, | |
| "loss": 0.6718952059745789, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41621553897857666, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2978552281856537, | |
| "rewards/margins": 2.314960479736328, | |
| "rewards/rejected": -2.0171055793762207, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.22672146441088223, | |
| "grad_norm": 10.265737533569336, | |
| "learning_rate": 0.00018339635662292043, | |
| "logits/chosen": -0.6680774688720703, | |
| "logits/rejected": -0.6708887219429016, | |
| "logps/chosen": -9.037369728088379, | |
| "logps/rejected": -28.595491409301758, | |
| "loss": 0.7751729488372803, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45015332102775574, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.26366156339645386, | |
| "rewards/margins": 2.183614492416382, | |
| "rewards/rejected": -1.9199527502059937, | |
| "step": 281, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.2275283023625224, | |
| "grad_norm": 2.1682872772216797, | |
| "learning_rate": 0.00018324877067481783, | |
| "logits/chosen": -0.6989454627037048, | |
| "logits/rejected": -0.7062041759490967, | |
| "logps/chosen": -6.304581642150879, | |
| "logps/rejected": -36.81526565551758, | |
| "loss": 0.4870501458644867, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27354732155799866, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.25899404287338257, | |
| "rewards/margins": 2.644915819168091, | |
| "rewards/rejected": -2.3859219551086426, | |
| "step": 282, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.22833514031416252, | |
| "grad_norm": 5.862631797790527, | |
| "learning_rate": 0.00018310059163154026, | |
| "logits/chosen": -0.6766980886459351, | |
| "logits/rejected": -0.6787369847297668, | |
| "logps/chosen": -5.963343620300293, | |
| "logps/rejected": -32.693424224853516, | |
| "loss": 0.6418428421020508, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.36004289984703064, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10292582958936691, | |
| "rewards/margins": 2.3059544563293457, | |
| "rewards/rejected": -2.203028917312622, | |
| "step": 283, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.22914197826580268, | |
| "grad_norm": 12.034624099731445, | |
| "learning_rate": 0.00018295182054877028, | |
| "logits/chosen": -0.6584015488624573, | |
| "logits/rejected": -0.6568421125411987, | |
| "logps/chosen": -9.409889221191406, | |
| "logps/rejected": -29.433473587036133, | |
| "loss": 0.779122531414032, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4608069658279419, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09724374115467072, | |
| "rewards/margins": 2.0178637504577637, | |
| "rewards/rejected": -1.920620083808899, | |
| "step": 284, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.22994881621744284, | |
| "grad_norm": 2.7027676105499268, | |
| "learning_rate": 0.00018280245848640837, | |
| "logits/chosen": -0.6325287222862244, | |
| "logits/rejected": -0.638849675655365, | |
| "logps/chosen": -11.803849220275879, | |
| "logps/rejected": -34.92605209350586, | |
| "loss": 0.6200695633888245, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3835636377334595, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3289586305618286, | |
| "rewards/margins": 2.4051361083984375, | |
| "rewards/rejected": -2.0761775970458984, | |
| "step": 285, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.23075565416908297, | |
| "grad_norm": 12.6409330368042, | |
| "learning_rate": 0.0001826525065085654, | |
| "logits/chosen": -0.6875444054603577, | |
| "logits/rejected": -0.6914835572242737, | |
| "logps/chosen": -6.616847038269043, | |
| "logps/rejected": -32.69636917114258, | |
| "loss": 0.7483028173446655, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41258829832077026, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1584882140159607, | |
| "rewards/margins": 2.2999954223632812, | |
| "rewards/rejected": -2.141507387161255, | |
| "step": 286, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.23156249212072313, | |
| "grad_norm": 11.6520357131958, | |
| "learning_rate": 0.00018250196568355488, | |
| "logits/chosen": -0.6649547219276428, | |
| "logits/rejected": -0.6693803071975708, | |
| "logps/chosen": -7.23736572265625, | |
| "logps/rejected": -35.56175994873047, | |
| "loss": 0.8851901888847351, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.555623471736908, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04522712156176567, | |
| "rewards/margins": 2.2976298332214355, | |
| "rewards/rejected": -2.2524030208587646, | |
| "step": 287, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.23236933007236327, | |
| "grad_norm": 4.304396152496338, | |
| "learning_rate": 0.0001823508370838857, | |
| "logits/chosen": -0.6312321424484253, | |
| "logits/rejected": -0.6436812281608582, | |
| "logps/chosen": -5.798044204711914, | |
| "logps/rejected": -41.38832092285156, | |
| "loss": 0.4446811079978943, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2366604506969452, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19939535856246948, | |
| "rewards/margins": 2.506988525390625, | |
| "rewards/rejected": -2.3075931072235107, | |
| "step": 288, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.23317616802400343, | |
| "grad_norm": 3.2178378105163574, | |
| "learning_rate": 0.00018219912178625406, | |
| "logits/chosen": -0.667951762676239, | |
| "logits/rejected": -0.6722462773323059, | |
| "logps/chosen": -8.273347854614258, | |
| "logps/rejected": -38.93374252319336, | |
| "loss": 0.5589238405227661, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33250439167022705, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24894192814826965, | |
| "rewards/margins": 2.7763476371765137, | |
| "rewards/rejected": -2.5274055004119873, | |
| "step": 289, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.2339830059756436, | |
| "grad_norm": 19.13467025756836, | |
| "learning_rate": 0.0001820468208715362, | |
| "logits/chosen": -0.658998429775238, | |
| "logits/rejected": -0.6624220609664917, | |
| "logps/chosen": -10.623708724975586, | |
| "logps/rejected": -35.898441314697266, | |
| "loss": 0.8776594400405884, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.504928469657898, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.03749624639749527, | |
| "rewards/margins": 2.421245813369751, | |
| "rewards/rejected": -2.3837497234344482, | |
| "step": 290, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.23478984392728372, | |
| "grad_norm": 14.0836181640625, | |
| "learning_rate": 0.00018189393542478036, | |
| "logits/chosen": -0.6700485348701477, | |
| "logits/rejected": -0.6811757683753967, | |
| "logps/chosen": -13.918525695800781, | |
| "logps/rejected": -31.985313415527344, | |
| "loss": 0.8883711695671082, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.494065523147583, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.11007653176784515, | |
| "rewards/margins": 1.8538110256195068, | |
| "rewards/rejected": -1.7437344789505005, | |
| "step": 291, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.23559668187892388, | |
| "grad_norm": 1.916353464126587, | |
| "learning_rate": 0.00018174046653519929, | |
| "logits/chosen": -0.6249253749847412, | |
| "logits/rejected": -0.6350105404853821, | |
| "logps/chosen": -6.613706588745117, | |
| "logps/rejected": -31.679109573364258, | |
| "loss": 0.5259463787078857, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28351810574531555, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.37387514114379883, | |
| "rewards/margins": 2.260230302810669, | |
| "rewards/rejected": -1.8863551616668701, | |
| "step": 292, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.23640351983056404, | |
| "grad_norm": 3.460676431655884, | |
| "learning_rate": 0.0001815864152961624, | |
| "logits/chosen": -0.7058864831924438, | |
| "logits/rejected": -0.7104409337043762, | |
| "logps/chosen": -9.832937240600586, | |
| "logps/rejected": -33.203758239746094, | |
| "loss": 0.7486201524734497, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4414381682872772, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.05328599363565445, | |
| "rewards/margins": 1.9007527828216553, | |
| "rewards/rejected": -1.8474667072296143, | |
| "step": 293, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.23721035778220417, | |
| "grad_norm": 4.965317249298096, | |
| "learning_rate": 0.00018143178280518793, | |
| "logits/chosen": -0.6664391756057739, | |
| "logits/rejected": -0.672810971736908, | |
| "logps/chosen": -9.997623443603516, | |
| "logps/rejected": -40.18428039550781, | |
| "loss": 0.6516451239585876, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40531888604164124, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.053340502083301544, | |
| "rewards/margins": 3.017876625061035, | |
| "rewards/rejected": -2.964535713195801, | |
| "step": 294, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.23801719573384433, | |
| "grad_norm": 11.654240608215332, | |
| "learning_rate": 0.00018127657016393523, | |
| "logits/chosen": -0.6823023557662964, | |
| "logits/rejected": -0.6858367919921875, | |
| "logps/chosen": -13.494540214538574, | |
| "logps/rejected": -26.149335861206055, | |
| "loss": 1.2284287214279175, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7871044874191284, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1301741600036621, | |
| "rewards/margins": 1.65839684009552, | |
| "rewards/rejected": -1.528222680091858, | |
| "step": 295, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.2388240336854845, | |
| "grad_norm": 6.048635005950928, | |
| "learning_rate": 0.00018112077847819678, | |
| "logits/chosen": -0.6762900352478027, | |
| "logits/rejected": -0.6797853708267212, | |
| "logps/chosen": -9.212943077087402, | |
| "logps/rejected": -35.503047943115234, | |
| "loss": 0.6458551287651062, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4156365990638733, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07666485011577606, | |
| "rewards/margins": 2.67659592628479, | |
| "rewards/rejected": -2.599931240081787, | |
| "step": 296, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.23963087163712463, | |
| "grad_norm": 17.950830459594727, | |
| "learning_rate": 0.00018096440885789053, | |
| "logits/chosen": -0.7045325040817261, | |
| "logits/rejected": -0.7085095643997192, | |
| "logps/chosen": -5.067245960235596, | |
| "logps/rejected": -32.400596618652344, | |
| "loss": 0.6414408087730408, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35441699624061584, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19392728805541992, | |
| "rewards/margins": 2.3720614910125732, | |
| "rewards/rejected": -2.1781344413757324, | |
| "step": 297, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.2404377095887648, | |
| "grad_norm": 2.869894504547119, | |
| "learning_rate": 0.00018080746241705168, | |
| "logits/chosen": -0.679808497428894, | |
| "logits/rejected": -0.681736409664154, | |
| "logps/chosen": -10.83769416809082, | |
| "logps/rejected": -28.55279541015625, | |
| "loss": 0.7392024397850037, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42105916142463684, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.23800711333751678, | |
| "rewards/margins": 1.8557734489440918, | |
| "rewards/rejected": -1.617766261100769, | |
| "step": 298, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.24124454754040492, | |
| "grad_norm": 3.0865039825439453, | |
| "learning_rate": 0.000180649940273825, | |
| "logits/chosen": -0.7064599990844727, | |
| "logits/rejected": -0.7154704928398132, | |
| "logps/chosen": -6.157724380493164, | |
| "logps/rejected": -37.746639251708984, | |
| "loss": 0.5655427575111389, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30769801139831543, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08631336688995361, | |
| "rewards/margins": 2.3150007724761963, | |
| "rewards/rejected": -2.228687286376953, | |
| "step": 299, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.24205138549204508, | |
| "grad_norm": 2.7285871505737305, | |
| "learning_rate": 0.00018049184355045677, | |
| "logits/chosen": -0.7136423587799072, | |
| "logits/rejected": -0.7151377201080322, | |
| "logps/chosen": -7.438178062438965, | |
| "logps/rejected": -25.823518753051758, | |
| "loss": 0.6484540104866028, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3245176076889038, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.27408692240715027, | |
| "rewards/margins": 1.6197888851165771, | |
| "rewards/rejected": -1.345702052116394, | |
| "step": 300, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.24205138549204508, | |
| "eval_logits/chosen": -0.7073344588279724, | |
| "eval_logits/rejected": -0.7110338807106018, | |
| "eval_logps/chosen": -9.127958297729492, | |
| "eval_logps/rejected": -32.3641242980957, | |
| "eval_loss": 0.7329411506652832, | |
| "eval_nll_loss": 0.40398380160331726, | |
| "eval_rewards/accuracies": 0.8450000286102295, | |
| "eval_rewards/chosen": 0.10664533823728561, | |
| "eval_rewards/margins": 2.0523765087127686, | |
| "eval_rewards/rejected": -1.9457309246063232, | |
| "eval_runtime": 935.6049, | |
| "eval_samples_per_second": 0.428, | |
| "eval_steps_per_second": 0.428, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.24285822344368524, | |
| "grad_norm": 6.436818599700928, | |
| "learning_rate": 0.0001803331733732868, | |
| "logits/chosen": -0.6776125431060791, | |
| "logits/rejected": -0.6814741492271423, | |
| "logps/chosen": -10.345755577087402, | |
| "logps/rejected": -31.87610626220703, | |
| "loss": 1.0051960945129395, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5581401586532593, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.17682184278964996, | |
| "rewards/margins": 1.9412140846252441, | |
| "rewards/rejected": -2.1180360317230225, | |
| "step": 301, | |
| "train_speed(iter/s)": 0.005403 | |
| }, | |
| { | |
| "epoch": 0.24366506139532537, | |
| "grad_norm": 6.0017781257629395, | |
| "learning_rate": 0.0001801739308727404, | |
| "logits/chosen": -0.7074002027511597, | |
| "logits/rejected": -0.713377058506012, | |
| "logps/chosen": -12.075335502624512, | |
| "logps/rejected": -23.198413848876953, | |
| "loss": 0.854468822479248, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5477906465530396, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22885334491729736, | |
| "rewards/margins": 1.5375834703445435, | |
| "rewards/rejected": -1.308730125427246, | |
| "step": 302, | |
| "train_speed(iter/s)": 0.005403 | |
| }, | |
| { | |
| "epoch": 0.24447189934696553, | |
| "grad_norm": 4.944755554199219, | |
| "learning_rate": 0.0001800141171833203, | |
| "logits/chosen": -0.6664037108421326, | |
| "logits/rejected": -0.6715153455734253, | |
| "logps/chosen": -10.99780559539795, | |
| "logps/rejected": -40.38133239746094, | |
| "loss": 1.0467002391815186, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7734127640724182, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23875761032104492, | |
| "rewards/margins": 2.768630027770996, | |
| "rewards/rejected": -2.529872417449951, | |
| "step": 303, | |
| "train_speed(iter/s)": 0.005404 | |
| }, | |
| { | |
| "epoch": 0.2452787372986057, | |
| "grad_norm": 13.264330863952637, | |
| "learning_rate": 0.0001798537334435986, | |
| "logits/chosen": -0.6581575870513916, | |
| "logits/rejected": -0.6663908362388611, | |
| "logps/chosen": -9.642528533935547, | |
| "logps/rejected": -34.64740753173828, | |
| "loss": 1.2485740184783936, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.8329651355743408, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.05902397632598877, | |
| "rewards/margins": 2.0006673336029053, | |
| "rewards/rejected": -2.0596914291381836, | |
| "step": 304, | |
| "train_speed(iter/s)": 0.005404 | |
| }, | |
| { | |
| "epoch": 0.24608557525024582, | |
| "grad_norm": 2.709535598754883, | |
| "learning_rate": 0.00017969278079620868, | |
| "logits/chosen": -0.6512877941131592, | |
| "logits/rejected": -0.6544854640960693, | |
| "logps/chosen": -6.917822360992432, | |
| "logps/rejected": -36.45574951171875, | |
| "loss": 0.436959445476532, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.23888030648231506, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.07531990855932236, | |
| "rewards/margins": 2.534837007522583, | |
| "rewards/rejected": -2.459517240524292, | |
| "step": 305, | |
| "train_speed(iter/s)": 0.005404 | |
| }, | |
| { | |
| "epoch": 0.24689241320188599, | |
| "grad_norm": 4.297156810760498, | |
| "learning_rate": 0.000179531260387837, | |
| "logits/chosen": -0.6876344084739685, | |
| "logits/rejected": -0.6926863789558411, | |
| "logps/chosen": -10.314577102661133, | |
| "logps/rejected": -42.0067138671875, | |
| "loss": 0.6266589164733887, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.405265212059021, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.048373833298683167, | |
| "rewards/margins": 2.6945550441741943, | |
| "rewards/rejected": -2.646181344985962, | |
| "step": 306, | |
| "train_speed(iter/s)": 0.005405 | |
| }, | |
| { | |
| "epoch": 0.24769925115352615, | |
| "grad_norm": 2.3430275917053223, | |
| "learning_rate": 0.00017936917336921492, | |
| "logits/chosen": -0.660620927810669, | |
| "logits/rejected": -0.6698962450027466, | |
| "logps/chosen": -10.098029136657715, | |
| "logps/rejected": -38.27429962158203, | |
| "loss": 0.6127811670303345, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42024731636047363, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12339803576469421, | |
| "rewards/margins": 2.775909423828125, | |
| "rewards/rejected": -2.6525111198425293, | |
| "step": 307, | |
| "train_speed(iter/s)": 0.005405 | |
| }, | |
| { | |
| "epoch": 0.24850608910516628, | |
| "grad_norm": 7.701032638549805, | |
| "learning_rate": 0.00017920652089511066, | |
| "logits/chosen": -0.6981559991836548, | |
| "logits/rejected": -0.7051110863685608, | |
| "logps/chosen": -12.91336441040039, | |
| "logps/rejected": -39.74778747558594, | |
| "loss": 0.7809062600135803, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43491145968437195, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.01711910218000412, | |
| "rewards/margins": 2.6014857292175293, | |
| "rewards/rejected": -2.618604898452759, | |
| "step": 308, | |
| "train_speed(iter/s)": 0.005406 | |
| }, | |
| { | |
| "epoch": 0.24931292705680644, | |
| "grad_norm": 8.226758003234863, | |
| "learning_rate": 0.00017904330412432082, | |
| "logits/chosen": -0.6544554829597473, | |
| "logits/rejected": -0.6588922739028931, | |
| "logps/chosen": -7.886651039123535, | |
| "logps/rejected": -37.24707794189453, | |
| "loss": 0.6507235169410706, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.36367952823638916, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.008459217846393585, | |
| "rewards/margins": 2.5813100337982178, | |
| "rewards/rejected": -2.5728507041931152, | |
| "step": 309, | |
| "train_speed(iter/s)": 0.005406 | |
| }, | |
| { | |
| "epoch": 0.25011976500844657, | |
| "grad_norm": 2.985854387283325, | |
| "learning_rate": 0.00017887952421966231, | |
| "logits/chosen": -0.6596094369888306, | |
| "logits/rejected": -0.6650587916374207, | |
| "logps/chosen": -9.925427436828613, | |
| "logps/rejected": -37.92117691040039, | |
| "loss": 0.589540958404541, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3470298945903778, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2002800703048706, | |
| "rewards/margins": 2.7566845417022705, | |
| "rewards/rejected": -2.5564048290252686, | |
| "step": 310, | |
| "train_speed(iter/s)": 0.005406 | |
| }, | |
| { | |
| "epoch": 0.25092660296008673, | |
| "grad_norm": 8.586225509643555, | |
| "learning_rate": 0.00017871518234796412, | |
| "logits/chosen": -0.7069643139839172, | |
| "logits/rejected": -0.7040101885795593, | |
| "logps/chosen": -10.918496131896973, | |
| "logps/rejected": -22.552764892578125, | |
| "loss": 0.869647204875946, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39224955439567566, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07749204337596893, | |
| "rewards/margins": 1.6755130290985107, | |
| "rewards/rejected": -1.598021149635315, | |
| "step": 311, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.2517334409117269, | |
| "grad_norm": 3.319561243057251, | |
| "learning_rate": 0.00017855027968005874, | |
| "logits/chosen": -0.643227756023407, | |
| "logits/rejected": -0.6550837755203247, | |
| "logps/chosen": -6.8077073097229, | |
| "logps/rejected": -39.095035552978516, | |
| "loss": 0.6082978844642639, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3355411887168884, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.21203100681304932, | |
| "rewards/margins": 2.4175777435302734, | |
| "rewards/rejected": -2.2055468559265137, | |
| "step": 312, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.25254027886336705, | |
| "grad_norm": 3.8709287643432617, | |
| "learning_rate": 0.00017838481739077404, | |
| "logits/chosen": -0.6760554313659668, | |
| "logits/rejected": -0.682180643081665, | |
| "logps/chosen": -7.9441633224487305, | |
| "logps/rejected": -27.414325714111328, | |
| "loss": 0.7799100279808044, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4338618814945221, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2233610451221466, | |
| "rewards/margins": 1.7509660720825195, | |
| "rewards/rejected": -1.5276049375534058, | |
| "step": 313, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.2533471168150072, | |
| "grad_norm": 5.0154218673706055, | |
| "learning_rate": 0.00017821879665892487, | |
| "logits/chosen": -0.6456589698791504, | |
| "logits/rejected": -0.649111270904541, | |
| "logps/chosen": -9.17154312133789, | |
| "logps/rejected": -32.664093017578125, | |
| "loss": 0.6070997714996338, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31872257590293884, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.005728209391236305, | |
| "rewards/margins": 1.877259612083435, | |
| "rewards/rejected": -1.8715312480926514, | |
| "step": 314, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.2541539547666473, | |
| "grad_norm": 2.769273042678833, | |
| "learning_rate": 0.00017805221866730458, | |
| "logits/chosen": -0.6285029649734497, | |
| "logits/rejected": -0.6361050605773926, | |
| "logps/chosen": -10.298542976379395, | |
| "logps/rejected": -27.911968231201172, | |
| "loss": 0.6473672986030579, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37400925159454346, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.33300700783729553, | |
| "rewards/margins": 1.5457414388656616, | |
| "rewards/rejected": -1.2127344608306885, | |
| "step": 315, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.2549607927182875, | |
| "grad_norm": 2.675525426864624, | |
| "learning_rate": 0.00017788508460267677, | |
| "logits/chosen": -0.633998692035675, | |
| "logits/rejected": -0.6368559002876282, | |
| "logps/chosen": -8.035248756408691, | |
| "logps/rejected": -33.8181266784668, | |
| "loss": 0.5450462698936462, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2956991195678711, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.12976329028606415, | |
| "rewards/margins": 2.3313686847686768, | |
| "rewards/rejected": -2.2016055583953857, | |
| "step": 316, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.25576763066992764, | |
| "grad_norm": 2.2619502544403076, | |
| "learning_rate": 0.0001777173956557665, | |
| "logits/chosen": -0.6891807317733765, | |
| "logits/rejected": -0.6903274059295654, | |
| "logps/chosen": -10.693523406982422, | |
| "logps/rejected": -31.01398468017578, | |
| "loss": 0.6650394797325134, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38576623797416687, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2987612187862396, | |
| "rewards/margins": 1.9871487617492676, | |
| "rewards/rejected": -1.6883876323699951, | |
| "step": 317, | |
| "train_speed(iter/s)": 0.005407 | |
| }, | |
| { | |
| "epoch": 0.2565744686215678, | |
| "grad_norm": 7.991454124450684, | |
| "learning_rate": 0.0001775491530212522, | |
| "logits/chosen": -0.6753562688827515, | |
| "logits/rejected": -0.6762648820877075, | |
| "logps/chosen": -11.517782211303711, | |
| "logps/rejected": -26.93805503845215, | |
| "loss": 1.165069580078125, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6551721096038818, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.02389012649655342, | |
| "rewards/margins": 1.3221609592437744, | |
| "rewards/rejected": -1.2982707023620605, | |
| "step": 318, | |
| "train_speed(iter/s)": 0.005408 | |
| }, | |
| { | |
| "epoch": 0.25738130657320796, | |
| "grad_norm": 9.860249519348145, | |
| "learning_rate": 0.00017738035789775696, | |
| "logits/chosen": -0.7479084730148315, | |
| "logits/rejected": -0.7518092393875122, | |
| "logps/chosen": -5.844160079956055, | |
| "logps/rejected": -35.683162689208984, | |
| "loss": 0.5556322932243347, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3325543999671936, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10462158918380737, | |
| "rewards/margins": 2.546602487564087, | |
| "rewards/rejected": -2.4419808387756348, | |
| "step": 319, | |
| "train_speed(iter/s)": 0.005409 | |
| }, | |
| { | |
| "epoch": 0.25818814452484806, | |
| "grad_norm": 3.9844655990600586, | |
| "learning_rate": 0.00017721101148783985, | |
| "logits/chosen": -0.7617798447608948, | |
| "logits/rejected": -0.7641586661338806, | |
| "logps/chosen": -8.093914031982422, | |
| "logps/rejected": -35.221988677978516, | |
| "loss": 0.6888319849967957, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4659794867038727, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08299870789051056, | |
| "rewards/margins": 2.34136700630188, | |
| "rewards/rejected": -2.258368492126465, | |
| "step": 320, | |
| "train_speed(iter/s)": 0.005409 | |
| }, | |
| { | |
| "epoch": 0.2589949824764882, | |
| "grad_norm": 7.946180820465088, | |
| "learning_rate": 0.00017704111499798768, | |
| "logits/chosen": -0.7791930437088013, | |
| "logits/rejected": -0.7833006381988525, | |
| "logps/chosen": -6.748149871826172, | |
| "logps/rejected": -36.56504440307617, | |
| "loss": 0.8274538516998291, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5019730925559998, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09792216122150421, | |
| "rewards/margins": 2.4872283935546875, | |
| "rewards/rejected": -2.3893063068389893, | |
| "step": 321, | |
| "train_speed(iter/s)": 0.005409 | |
| }, | |
| { | |
| "epoch": 0.2598018204281284, | |
| "grad_norm": 7.7827467918396, | |
| "learning_rate": 0.00017687066963860615, | |
| "logits/chosen": -0.7987972497940063, | |
| "logits/rejected": -0.8094179034233093, | |
| "logps/chosen": -3.5310564041137695, | |
| "logps/rejected": -32.73319625854492, | |
| "loss": 0.4403470754623413, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.1688545197248459, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2623920440673828, | |
| "rewards/margins": 2.187939405441284, | |
| "rewards/rejected": -1.925547480583191, | |
| "step": 322, | |
| "train_speed(iter/s)": 0.00541 | |
| }, | |
| { | |
| "epoch": 0.26060865837976854, | |
| "grad_norm": 3.664057493209839, | |
| "learning_rate": 0.0001766996766240114, | |
| "logits/chosen": -0.8535178899765015, | |
| "logits/rejected": -0.8564468622207642, | |
| "logps/chosen": -12.827454566955566, | |
| "logps/rejected": -35.108741760253906, | |
| "loss": 0.7213603258132935, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.47191280126571655, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.34138235449790955, | |
| "rewards/margins": 2.7680537700653076, | |
| "rewards/rejected": -2.426671266555786, | |
| "step": 323, | |
| "train_speed(iter/s)": 0.00541 | |
| }, | |
| { | |
| "epoch": 0.2614154963314087, | |
| "grad_norm": 3.6671972274780273, | |
| "learning_rate": 0.0001765281371724211, | |
| "logits/chosen": -0.8640937209129333, | |
| "logits/rejected": -0.8603441119194031, | |
| "logps/chosen": -9.051156997680664, | |
| "logps/rejected": -32.042171478271484, | |
| "loss": 0.5764932036399841, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3475058972835541, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24964334070682526, | |
| "rewards/margins": 2.6217854022979736, | |
| "rewards/rejected": -2.3721418380737305, | |
| "step": 324, | |
| "train_speed(iter/s)": 0.00541 | |
| }, | |
| { | |
| "epoch": 0.26222233428304886, | |
| "grad_norm": 4.343052864074707, | |
| "learning_rate": 0.00017635605250594606, | |
| "logits/chosen": -0.9237393140792847, | |
| "logits/rejected": -0.9191243648529053, | |
| "logps/chosen": -9.570093154907227, | |
| "logps/rejected": -26.344640731811523, | |
| "loss": 0.6133550405502319, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3041512668132782, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2187902331352234, | |
| "rewards/margins": 1.9347566366195679, | |
| "rewards/rejected": -1.7159663438796997, | |
| "step": 325, | |
| "train_speed(iter/s)": 0.00541 | |
| }, | |
| { | |
| "epoch": 0.26302917223468897, | |
| "grad_norm": 13.972990989685059, | |
| "learning_rate": 0.00017618342385058145, | |
| "logits/chosen": -0.9064996242523193, | |
| "logits/rejected": -0.9114649295806885, | |
| "logps/chosen": -10.548544883728027, | |
| "logps/rejected": -39.158992767333984, | |
| "loss": 0.9647412300109863, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6664921045303345, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14826549589633942, | |
| "rewards/margins": 2.8863561153411865, | |
| "rewards/rejected": -2.738090753555298, | |
| "step": 326, | |
| "train_speed(iter/s)": 0.00541 | |
| }, | |
| { | |
| "epoch": 0.26383601018632913, | |
| "grad_norm": 4.962406635284424, | |
| "learning_rate": 0.0001760102524361979, | |
| "logits/chosen": -0.9307440519332886, | |
| "logits/rejected": -0.9374938607215881, | |
| "logps/chosen": -11.971577644348145, | |
| "logps/rejected": -43.166099548339844, | |
| "loss": 0.7845494747161865, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4260358214378357, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.014196585863828659, | |
| "rewards/margins": 2.70448637008667, | |
| "rewards/rejected": -2.7186827659606934, | |
| "step": 327, | |
| "train_speed(iter/s)": 0.00541 | |
| }, | |
| { | |
| "epoch": 0.2646428481379693, | |
| "grad_norm": 6.3026509284973145, | |
| "learning_rate": 0.00017583653949653297, | |
| "logits/chosen": -0.9104486703872681, | |
| "logits/rejected": -0.9133187532424927, | |
| "logps/chosen": -7.545221328735352, | |
| "logps/rejected": -42.58152770996094, | |
| "loss": 0.6194388270378113, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38448214530944824, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.12115807086229324, | |
| "rewards/margins": 3.0233232975006104, | |
| "rewards/rejected": -2.902165412902832, | |
| "step": 328, | |
| "train_speed(iter/s)": 0.005411 | |
| }, | |
| { | |
| "epoch": 0.26544968608960945, | |
| "grad_norm": 4.22109317779541, | |
| "learning_rate": 0.00017566228626918212, | |
| "logits/chosen": -0.8536132574081421, | |
| "logits/rejected": -0.863903284072876, | |
| "logps/chosen": -9.604391098022461, | |
| "logps/rejected": -38.25326919555664, | |
| "loss": 0.7549124956130981, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43309736251831055, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.11497168242931366, | |
| "rewards/margins": 2.4954819679260254, | |
| "rewards/rejected": -2.380510091781616, | |
| "step": 329, | |
| "train_speed(iter/s)": 0.005411 | |
| }, | |
| { | |
| "epoch": 0.2662565240412496, | |
| "grad_norm": 3.372162103652954, | |
| "learning_rate": 0.0001754874939955901, | |
| "logits/chosen": -0.8504335880279541, | |
| "logits/rejected": -0.8582204580307007, | |
| "logps/chosen": -13.342264175415039, | |
| "logps/rejected": -36.4522590637207, | |
| "loss": 0.9137426614761353, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6495134830474854, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.36808696389198303, | |
| "rewards/margins": 2.6845757961273193, | |
| "rewards/rejected": -2.316488742828369, | |
| "step": 330, | |
| "train_speed(iter/s)": 0.005412 | |
| }, | |
| { | |
| "epoch": 0.2670633619928897, | |
| "grad_norm": 2.032322883605957, | |
| "learning_rate": 0.00017531216392104203, | |
| "logits/chosen": -0.8323754072189331, | |
| "logits/rejected": -0.8362606763839722, | |
| "logps/chosen": -9.349749565124512, | |
| "logps/rejected": -38.68825149536133, | |
| "loss": 0.6108371019363403, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4490174949169159, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.4555152654647827, | |
| "rewards/margins": 3.0110297203063965, | |
| "rewards/rejected": -2.555514335632324, | |
| "step": 331, | |
| "train_speed(iter/s)": 0.005413 | |
| }, | |
| { | |
| "epoch": 0.2678701999445299, | |
| "grad_norm": 2.1273860931396484, | |
| "learning_rate": 0.00017513629729465455, | |
| "logits/chosen": -0.8378605842590332, | |
| "logits/rejected": -0.8425085544586182, | |
| "logps/chosen": -7.634585380554199, | |
| "logps/rejected": -34.26400375366211, | |
| "loss": 0.5199471712112427, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3184734284877777, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.24010597169399261, | |
| "rewards/margins": 2.4833943843841553, | |
| "rewards/rejected": -2.243288516998291, | |
| "step": 332, | |
| "train_speed(iter/s)": 0.005414 | |
| }, | |
| { | |
| "epoch": 0.26867703789617003, | |
| "grad_norm": 13.832210540771484, | |
| "learning_rate": 0.0001749598953693668, | |
| "logits/chosen": -0.8178601264953613, | |
| "logits/rejected": -0.8171352744102478, | |
| "logps/chosen": -7.816558361053467, | |
| "logps/rejected": -27.310321807861328, | |
| "loss": 0.8487988710403442, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5664465427398682, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13675397634506226, | |
| "rewards/margins": 2.1682660579681396, | |
| "rewards/rejected": -2.0315120220184326, | |
| "step": 333, | |
| "train_speed(iter/s)": 0.005414 | |
| }, | |
| { | |
| "epoch": 0.2694838758478102, | |
| "grad_norm": 4.107896327972412, | |
| "learning_rate": 0.00017478295940193163, | |
| "logits/chosen": -0.8216401934623718, | |
| "logits/rejected": -0.8330098986625671, | |
| "logps/chosen": -8.207337379455566, | |
| "logps/rejected": -38.14511489868164, | |
| "loss": 0.8124181032180786, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4575313925743103, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.033875416964292526, | |
| "rewards/margins": 2.214970350265503, | |
| "rewards/rejected": -2.1810948848724365, | |
| "step": 334, | |
| "train_speed(iter/s)": 0.005415 | |
| }, | |
| { | |
| "epoch": 0.27029071379945036, | |
| "grad_norm": 2.043121814727783, | |
| "learning_rate": 0.00017460549065290666, | |
| "logits/chosen": -0.7847851514816284, | |
| "logits/rejected": -0.7903647422790527, | |
| "logps/chosen": -11.188026428222656, | |
| "logps/rejected": -31.82864761352539, | |
| "loss": 0.5849981904029846, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3552479147911072, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3021475374698639, | |
| "rewards/margins": 2.2114672660827637, | |
| "rewards/rejected": -1.909319519996643, | |
| "step": 335, | |
| "train_speed(iter/s)": 0.005415 | |
| }, | |
| { | |
| "epoch": 0.2710975517510905, | |
| "grad_norm": 2.116966962814331, | |
| "learning_rate": 0.0001744274903866452, | |
| "logits/chosen": -0.770881712436676, | |
| "logits/rejected": -0.7834229469299316, | |
| "logps/chosen": -3.7972168922424316, | |
| "logps/rejected": -37.75122833251953, | |
| "loss": 0.3996497392654419, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2140352874994278, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.27353012561798096, | |
| "rewards/margins": 2.583765983581543, | |
| "rewards/rejected": -2.3102359771728516, | |
| "step": 336, | |
| "train_speed(iter/s)": 0.005415 | |
| }, | |
| { | |
| "epoch": 0.2719043897027306, | |
| "grad_norm": 4.1290411949157715, | |
| "learning_rate": 0.00017424895987128722, | |
| "logits/chosen": -0.786916971206665, | |
| "logits/rejected": -0.7911162376403809, | |
| "logps/chosen": -9.502747535705566, | |
| "logps/rejected": -32.8641357421875, | |
| "loss": 0.7896320819854736, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4624251425266266, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.12185362726449966, | |
| "rewards/margins": 2.144758701324463, | |
| "rewards/rejected": -2.022905111312866, | |
| "step": 337, | |
| "train_speed(iter/s)": 0.005415 | |
| }, | |
| { | |
| "epoch": 0.2727112276543708, | |
| "grad_norm": 1.9379422664642334, | |
| "learning_rate": 0.0001740699003787505, | |
| "logits/chosen": -0.8224512338638306, | |
| "logits/rejected": -0.8290694355964661, | |
| "logps/chosen": -5.654224872589111, | |
| "logps/rejected": -40.40040588378906, | |
| "loss": 0.32085683941841125, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.17423731088638306, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2838688790798187, | |
| "rewards/margins": 2.9954781532287598, | |
| "rewards/rejected": -2.711609363555908, | |
| "step": 338, | |
| "train_speed(iter/s)": 0.005415 | |
| }, | |
| { | |
| "epoch": 0.27351806560601094, | |
| "grad_norm": 2.5411887168884277, | |
| "learning_rate": 0.00017389031318472143, | |
| "logits/chosen": -0.8840833306312561, | |
| "logits/rejected": -0.8846546411514282, | |
| "logps/chosen": -14.506649017333984, | |
| "logps/rejected": -35.60776901245117, | |
| "loss": 0.6948885917663574, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4158177375793457, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05735927075147629, | |
| "rewards/margins": 2.4177799224853516, | |
| "rewards/rejected": -2.3604207038879395, | |
| "step": 339, | |
| "train_speed(iter/s)": 0.005415 | |
| }, | |
| { | |
| "epoch": 0.2743249035576511, | |
| "grad_norm": 4.5371856689453125, | |
| "learning_rate": 0.00017371019956864583, | |
| "logits/chosen": -0.8519307374954224, | |
| "logits/rejected": -0.8563728928565979, | |
| "logps/chosen": -18.773422241210938, | |
| "logps/rejected": -25.609325408935547, | |
| "loss": 1.2189257144927979, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7953273057937622, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.14804774522781372, | |
| "rewards/margins": 1.684711217880249, | |
| "rewards/rejected": -1.5366634130477905, | |
| "step": 340, | |
| "train_speed(iter/s)": 0.005416 | |
| }, | |
| { | |
| "epoch": 0.27513174150929126, | |
| "grad_norm": 5.0346455574035645, | |
| "learning_rate": 0.00017352956081372007, | |
| "logits/chosen": -0.901013970375061, | |
| "logits/rejected": -0.9049715995788574, | |
| "logps/chosen": -8.963022232055664, | |
| "logps/rejected": -34.29716110229492, | |
| "loss": 0.8155198097229004, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40066373348236084, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.041613977402448654, | |
| "rewards/margins": 2.3150718212127686, | |
| "rewards/rejected": -2.3566856384277344, | |
| "step": 341, | |
| "train_speed(iter/s)": 0.005416 | |
| }, | |
| { | |
| "epoch": 0.2759385794609314, | |
| "grad_norm": 4.706645488739014, | |
| "learning_rate": 0.00017334839820688176, | |
| "logits/chosen": -0.8764183521270752, | |
| "logits/rejected": -0.8793443441390991, | |
| "logps/chosen": -11.185328483581543, | |
| "logps/rejected": -27.840126037597656, | |
| "loss": 0.8221145868301392, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.36857330799102783, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.029647603631019592, | |
| "rewards/margins": 1.7318322658538818, | |
| "rewards/rejected": -1.7021846771240234, | |
| "step": 342, | |
| "train_speed(iter/s)": 0.005416 | |
| }, | |
| { | |
| "epoch": 0.2767454174125715, | |
| "grad_norm": 3.4059722423553467, | |
| "learning_rate": 0.00017316671303880065, | |
| "logits/chosen": -0.8800357580184937, | |
| "logits/rejected": -0.8856234550476074, | |
| "logps/chosen": -10.418521881103516, | |
| "logps/rejected": -44.70547866821289, | |
| "loss": 0.621554970741272, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41401058435440063, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.08430502563714981, | |
| "rewards/margins": 3.2389299869537354, | |
| "rewards/rejected": -3.1546249389648438, | |
| "step": 343, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.2775522553642117, | |
| "grad_norm": 8.598644256591797, | |
| "learning_rate": 0.00017298450660386934, | |
| "logits/chosen": -0.8565375208854675, | |
| "logits/rejected": -0.8581067323684692, | |
| "logps/chosen": -11.926506042480469, | |
| "logps/rejected": -36.14910888671875, | |
| "loss": 0.7724243998527527, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41390153765678406, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.05219612270593643, | |
| "rewards/margins": 2.1874096393585205, | |
| "rewards/rejected": -2.239605665206909, | |
| "step": 344, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.27835909331585185, | |
| "grad_norm": 5.491206645965576, | |
| "learning_rate": 0.00017280178020019418, | |
| "logits/chosen": -0.8360708951950073, | |
| "logits/rejected": -0.8349617123603821, | |
| "logps/chosen": -9.427896499633789, | |
| "logps/rejected": -29.778169631958008, | |
| "loss": 0.7176328301429749, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46471166610717773, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3919517695903778, | |
| "rewards/margins": 2.2337028980255127, | |
| "rewards/rejected": -1.841751217842102, | |
| "step": 345, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.279165931267492, | |
| "grad_norm": 2.732307195663452, | |
| "learning_rate": 0.000172618535129586, | |
| "logits/chosen": -0.8330416083335876, | |
| "logits/rejected": -0.8343455195426941, | |
| "logps/chosen": -13.94620418548584, | |
| "logps/rejected": -34.905059814453125, | |
| "loss": 0.6391770243644714, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40491989254951477, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.024340404197573662, | |
| "rewards/margins": 2.191556453704834, | |
| "rewards/rejected": -2.1672160625457764, | |
| "step": 346, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.27997276921913217, | |
| "grad_norm": 2.748098373413086, | |
| "learning_rate": 0.00017243477269755073, | |
| "logits/chosen": -0.8207265138626099, | |
| "logits/rejected": -0.8255487680435181, | |
| "logps/chosen": -8.841146469116211, | |
| "logps/rejected": -40.18748092651367, | |
| "loss": 0.5847609043121338, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4391492009162903, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18971768021583557, | |
| "rewards/margins": 3.0055530071258545, | |
| "rewards/rejected": -2.815835475921631, | |
| "step": 347, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.28077960717077227, | |
| "grad_norm": 8.588139533996582, | |
| "learning_rate": 0.00017225049421328023, | |
| "logits/chosen": -0.8355762362480164, | |
| "logits/rejected": -0.8387144804000854, | |
| "logps/chosen": -8.67043399810791, | |
| "logps/rejected": -34.789730072021484, | |
| "loss": 0.5931243896484375, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30945685505867004, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06438732147216797, | |
| "rewards/margins": 2.153982639312744, | |
| "rewards/rejected": -2.089595317840576, | |
| "step": 348, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.28158644512241243, | |
| "grad_norm": 2.7876644134521484, | |
| "learning_rate": 0.00017206570098964293, | |
| "logits/chosen": -0.8504444360733032, | |
| "logits/rejected": -0.8515408635139465, | |
| "logps/chosen": -10.413717269897461, | |
| "logps/rejected": -31.34994888305664, | |
| "loss": 0.5911897420883179, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3716551661491394, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2757214307785034, | |
| "rewards/margins": 2.5438179969787598, | |
| "rewards/rejected": -2.268096446990967, | |
| "step": 349, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.2823932830740526, | |
| "grad_norm": 2.771085262298584, | |
| "learning_rate": 0.00017188039434317437, | |
| "logits/chosen": -0.7710286974906921, | |
| "logits/rejected": -0.7747238874435425, | |
| "logps/chosen": -11.302440643310547, | |
| "logps/rejected": -31.574066162109375, | |
| "loss": 0.7104746103286743, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.44341009855270386, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2658320367336273, | |
| "rewards/margins": 2.1740376949310303, | |
| "rewards/rejected": -1.908205509185791, | |
| "step": 350, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.28320012102569275, | |
| "grad_norm": 8.733509063720703, | |
| "learning_rate": 0.00017169457559406795, | |
| "logits/chosen": -0.7990887761116028, | |
| "logits/rejected": -0.8017781376838684, | |
| "logps/chosen": -10.448628425598145, | |
| "logps/rejected": -32.143943786621094, | |
| "loss": 1.2729414701461792, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.8385729789733887, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.18963520228862762, | |
| "rewards/margins": 1.997046947479248, | |
| "rewards/rejected": -2.1866822242736816, | |
| "step": 351, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.2840069589773329, | |
| "grad_norm": 3.8308520317077637, | |
| "learning_rate": 0.00017150824606616553, | |
| "logits/chosen": -0.7534295320510864, | |
| "logits/rejected": -0.7567183971405029, | |
| "logps/chosen": -7.442231178283691, | |
| "logps/rejected": -32.14317321777344, | |
| "loss": 0.5511249899864197, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34539952874183655, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26004305481910706, | |
| "rewards/margins": 2.451585531234741, | |
| "rewards/rejected": -2.191542387008667, | |
| "step": 352, | |
| "train_speed(iter/s)": 0.005417 | |
| }, | |
| { | |
| "epoch": 0.2848137969289731, | |
| "grad_norm": 3.919644832611084, | |
| "learning_rate": 0.00017132140708694786, | |
| "logits/chosen": -0.7558514475822449, | |
| "logits/rejected": -0.7550539970397949, | |
| "logps/chosen": -8.997418403625488, | |
| "logps/rejected": -29.441905975341797, | |
| "loss": 0.6320300698280334, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3772739768028259, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2652067542076111, | |
| "rewards/margins": 2.186215877532959, | |
| "rewards/rejected": -1.9210093021392822, | |
| "step": 353, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.2856206348806132, | |
| "grad_norm": 20.330293655395508, | |
| "learning_rate": 0.0001711340599875253, | |
| "logits/chosen": -0.7443191409111023, | |
| "logits/rejected": -0.7491686344146729, | |
| "logps/chosen": -11.211926460266113, | |
| "logps/rejected": -37.2029914855957, | |
| "loss": 1.2416906356811523, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7969366908073425, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.1411081850528717, | |
| "rewards/margins": 2.08335542678833, | |
| "rewards/rejected": -2.22446346282959, | |
| "step": 354, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.28642747283225334, | |
| "grad_norm": 13.989158630371094, | |
| "learning_rate": 0.00017094620610262815, | |
| "logits/chosen": -0.7479000091552734, | |
| "logits/rejected": -0.750941812992096, | |
| "logps/chosen": -11.775254249572754, | |
| "logps/rejected": -35.6055908203125, | |
| "loss": 1.2802770137786865, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7870579957962036, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.2751302123069763, | |
| "rewards/margins": 1.906927227973938, | |
| "rewards/rejected": -2.1820573806762695, | |
| "step": 355, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.2872343107838935, | |
| "grad_norm": 7.8280930519104, | |
| "learning_rate": 0.0001707578467705973, | |
| "logits/chosen": -0.7759760022163391, | |
| "logits/rejected": -0.7844580411911011, | |
| "logps/chosen": -7.402548789978027, | |
| "logps/rejected": -38.92572784423828, | |
| "loss": 0.7681185603141785, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5315437912940979, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.005034878849983215, | |
| "rewards/margins": 2.443704128265381, | |
| "rewards/rejected": -2.438669443130493, | |
| "step": 356, | |
| "train_speed(iter/s)": 0.005418 | |
| }, | |
| { | |
| "epoch": 0.28804114873553366, | |
| "grad_norm": 24.46771812438965, | |
| "learning_rate": 0.00017056898333337462, | |
| "logits/chosen": -0.7455392479896545, | |
| "logits/rejected": -0.7464004755020142, | |
| "logps/chosen": -15.696362495422363, | |
| "logps/rejected": -36.21916198730469, | |
| "loss": 0.699033796787262, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42450839281082153, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19790178537368774, | |
| "rewards/margins": 2.3564441204071045, | |
| "rewards/rejected": -2.1585421562194824, | |
| "step": 357, | |
| "train_speed(iter/s)": 0.005419 | |
| }, | |
| { | |
| "epoch": 0.2888479866871738, | |
| "grad_norm": 3.165498971939087, | |
| "learning_rate": 0.0001703796171364934, | |
| "logits/chosen": -0.7834245562553406, | |
| "logits/rejected": -0.7828773260116577, | |
| "logps/chosen": -8.231873512268066, | |
| "logps/rejected": -30.543338775634766, | |
| "loss": 0.7491443753242493, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4628988206386566, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24111242592334747, | |
| "rewards/margins": 2.3805058002471924, | |
| "rewards/rejected": -2.1393933296203613, | |
| "step": 358, | |
| "train_speed(iter/s)": 0.005419 | |
| }, | |
| { | |
| "epoch": 0.2896548246388139, | |
| "grad_norm": 2.6455235481262207, | |
| "learning_rate": 0.00017018974952906884, | |
| "logits/chosen": -0.8238362073898315, | |
| "logits/rejected": -0.8289802670478821, | |
| "logps/chosen": -6.384030818939209, | |
| "logps/rejected": -37.180633544921875, | |
| "loss": 0.5261876583099365, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28632083535194397, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.18914461135864258, | |
| "rewards/margins": 2.69685959815979, | |
| "rewards/rejected": -2.5077149868011475, | |
| "step": 359, | |
| "train_speed(iter/s)": 0.005419 | |
| }, | |
| { | |
| "epoch": 0.2904616625904541, | |
| "grad_norm": 2.369776964187622, | |
| "learning_rate": 0.00016999938186378825, | |
| "logits/chosen": -0.7982887625694275, | |
| "logits/rejected": -0.8035246729850769, | |
| "logps/chosen": -6.851421356201172, | |
| "logps/rejected": -45.864418029785156, | |
| "loss": 0.5188026428222656, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3399565815925598, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3176203966140747, | |
| "rewards/margins": 3.4621381759643555, | |
| "rewards/rejected": -3.144517660140991, | |
| "step": 360, | |
| "train_speed(iter/s)": 0.00542 | |
| }, | |
| { | |
| "epoch": 0.29126850054209424, | |
| "grad_norm": 3.786916971206665, | |
| "learning_rate": 0.0001698085154969017, | |
| "logits/chosen": -0.8295035362243652, | |
| "logits/rejected": -0.8320608139038086, | |
| "logps/chosen": -10.462471961975098, | |
| "logps/rejected": -44.3033561706543, | |
| "loss": 0.6038550138473511, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.44244384765625, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.005623971112072468, | |
| "rewards/margins": 2.9000349044799805, | |
| "rewards/rejected": -2.8944108486175537, | |
| "step": 361, | |
| "train_speed(iter/s)": 0.00542 | |
| }, | |
| { | |
| "epoch": 0.2920753384937344, | |
| "grad_norm": 2.3236849308013916, | |
| "learning_rate": 0.000169617151788212, | |
| "logits/chosen": -0.8378246426582336, | |
| "logits/rejected": -0.8476194739341736, | |
| "logps/chosen": -7.4671311378479, | |
| "logps/rejected": -45.69831466674805, | |
| "loss": 0.549799919128418, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3557121455669403, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2878333032131195, | |
| "rewards/margins": 3.4509360790252686, | |
| "rewards/rejected": -3.163102865219116, | |
| "step": 362, | |
| "train_speed(iter/s)": 0.005419 | |
| }, | |
| { | |
| "epoch": 0.29288217644537456, | |
| "grad_norm": 4.218591213226318, | |
| "learning_rate": 0.0001694252921010654, | |
| "logits/chosen": -0.8441336154937744, | |
| "logits/rejected": -0.854229211807251, | |
| "logps/chosen": -7.4483184814453125, | |
| "logps/rejected": -46.634490966796875, | |
| "loss": 0.5104203224182129, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2786526679992676, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10106715559959412, | |
| "rewards/margins": 3.364898681640625, | |
| "rewards/rejected": -3.263831377029419, | |
| "step": 363, | |
| "train_speed(iter/s)": 0.00542 | |
| }, | |
| { | |
| "epoch": 0.2936890143970147, | |
| "grad_norm": 6.0027055740356445, | |
| "learning_rate": 0.0001692329378023416, | |
| "logits/chosen": -0.8181811571121216, | |
| "logits/rejected": -0.8173055648803711, | |
| "logps/chosen": -11.75820541381836, | |
| "logps/rejected": -28.230079650878906, | |
| "loss": 0.8542529344558716, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41755104064941406, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.016829999163746834, | |
| "rewards/margins": 1.9391112327575684, | |
| "rewards/rejected": -1.9222811460494995, | |
| "step": 364, | |
| "train_speed(iter/s)": 0.00542 | |
| }, | |
| { | |
| "epoch": 0.29449585234865483, | |
| "grad_norm": 2.452047109603882, | |
| "learning_rate": 0.00016904009026244405, | |
| "logits/chosen": -0.8576743006706238, | |
| "logits/rejected": -0.8569716215133667, | |
| "logps/chosen": -8.94229507446289, | |
| "logps/rejected": -36.84193420410156, | |
| "loss": 0.5307234525680542, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27585676312446594, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1474345177412033, | |
| "rewards/margins": 2.3831472396850586, | |
| "rewards/rejected": -2.235712766647339, | |
| "step": 365, | |
| "train_speed(iter/s)": 0.00542 | |
| }, | |
| { | |
| "epoch": 0.295302690300295, | |
| "grad_norm": 4.770409107208252, | |
| "learning_rate": 0.00016884675085529033, | |
| "logits/chosen": -0.8674459457397461, | |
| "logits/rejected": -0.8703688383102417, | |
| "logps/chosen": -10.529121398925781, | |
| "logps/rejected": -38.25895309448242, | |
| "loss": 0.6165487766265869, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3394632339477539, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13632023334503174, | |
| "rewards/margins": 2.6175537109375, | |
| "rewards/rejected": -2.4812331199645996, | |
| "step": 366, | |
| "train_speed(iter/s)": 0.005421 | |
| }, | |
| { | |
| "epoch": 0.29610952825193515, | |
| "grad_norm": 2.726836681365967, | |
| "learning_rate": 0.00016865292095830214, | |
| "logits/chosen": -0.8154149055480957, | |
| "logits/rejected": -0.8210477232933044, | |
| "logps/chosen": -8.451236724853516, | |
| "logps/rejected": -30.605690002441406, | |
| "loss": 0.5677744150161743, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30434367060661316, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3030344247817993, | |
| "rewards/margins": 2.1608378887176514, | |
| "rewards/rejected": -1.8578035831451416, | |
| "step": 367, | |
| "train_speed(iter/s)": 0.005421 | |
| }, | |
| { | |
| "epoch": 0.2969163662035753, | |
| "grad_norm": 4.918789386749268, | |
| "learning_rate": 0.00016845860195239574, | |
| "logits/chosen": -0.8281161189079285, | |
| "logits/rejected": -0.8330156207084656, | |
| "logps/chosen": -11.424484252929688, | |
| "logps/rejected": -32.49198913574219, | |
| "loss": 0.7686675786972046, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5117014050483704, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3326207995414734, | |
| "rewards/margins": 2.3775177001953125, | |
| "rewards/rejected": -2.0448966026306152, | |
| "step": 368, | |
| "train_speed(iter/s)": 0.005421 | |
| }, | |
| { | |
| "epoch": 0.29772320415521547, | |
| "grad_norm": 7.9901652336120605, | |
| "learning_rate": 0.00016826379522197197, | |
| "logits/chosen": -0.7991360425949097, | |
| "logits/rejected": -0.8027262091636658, | |
| "logps/chosen": -8.358216285705566, | |
| "logps/rejected": -31.194568634033203, | |
| "loss": 0.7576655745506287, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.49762627482414246, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10716473311185837, | |
| "rewards/margins": 2.159275531768799, | |
| "rewards/rejected": -2.0521109104156494, | |
| "step": 369, | |
| "train_speed(iter/s)": 0.005422 | |
| }, | |
| { | |
| "epoch": 0.2985300421068556, | |
| "grad_norm": 7.625348091125488, | |
| "learning_rate": 0.0001680685021549063, | |
| "logits/chosen": -0.7968946099281311, | |
| "logits/rejected": -0.8060710430145264, | |
| "logps/chosen": -7.866345405578613, | |
| "logps/rejected": -40.948158264160156, | |
| "loss": 0.9940714240074158, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7132853269577026, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.16774287819862366, | |
| "rewards/margins": 2.4824962615966797, | |
| "rewards/rejected": -2.6502389907836914, | |
| "step": 370, | |
| "train_speed(iter/s)": 0.005423 | |
| }, | |
| { | |
| "epoch": 0.29933688005849574, | |
| "grad_norm": 4.839093208312988, | |
| "learning_rate": 0.0001678727241425391, | |
| "logits/chosen": -0.792543888092041, | |
| "logits/rejected": -0.7907209992408752, | |
| "logps/chosen": -10.626989364624023, | |
| "logps/rejected": -25.664470672607422, | |
| "loss": 0.91594398021698, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5407547950744629, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0037185251712799072, | |
| "rewards/margins": 1.719236969947815, | |
| "rewards/rejected": -1.7155182361602783, | |
| "step": 371, | |
| "train_speed(iter/s)": 0.005423 | |
| }, | |
| { | |
| "epoch": 0.3001437180101359, | |
| "grad_norm": 11.523240089416504, | |
| "learning_rate": 0.00016767646257966572, | |
| "logits/chosen": -0.8143973350524902, | |
| "logits/rejected": -0.8215935230255127, | |
| "logps/chosen": -6.086573123931885, | |
| "logps/rejected": -34.30033493041992, | |
| "loss": 0.6105502247810364, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.36522942781448364, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2981349527835846, | |
| "rewards/margins": 2.788585662841797, | |
| "rewards/rejected": -2.490450859069824, | |
| "step": 372, | |
| "train_speed(iter/s)": 0.005423 | |
| }, | |
| { | |
| "epoch": 0.30095055596177606, | |
| "grad_norm": 5.205559253692627, | |
| "learning_rate": 0.00016747971886452642, | |
| "logits/chosen": -0.7993229031562805, | |
| "logits/rejected": -0.8019697666168213, | |
| "logps/chosen": -14.90966796875, | |
| "logps/rejected": -40.805274963378906, | |
| "loss": 1.5332070589065552, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 1.2682892084121704, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.025209464132785797, | |
| "rewards/margins": 2.6658260822296143, | |
| "rewards/rejected": -2.6406168937683105, | |
| "step": 373, | |
| "train_speed(iter/s)": 0.005423 | |
| }, | |
| { | |
| "epoch": 0.3017573939134162, | |
| "grad_norm": 2.872535228729248, | |
| "learning_rate": 0.00016728249439879655, | |
| "logits/chosen": -0.7731214165687561, | |
| "logits/rejected": -0.7786182165145874, | |
| "logps/chosen": -5.839204788208008, | |
| "logps/rejected": -37.67174530029297, | |
| "loss": 0.507649838924408, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2965702712535858, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22565633058547974, | |
| "rewards/margins": 2.726480007171631, | |
| "rewards/rejected": -2.500823497772217, | |
| "step": 374, | |
| "train_speed(iter/s)": 0.005424 | |
| }, | |
| { | |
| "epoch": 0.3025642318650564, | |
| "grad_norm": 9.740580558776855, | |
| "learning_rate": 0.00016708479058757649, | |
| "logits/chosen": -0.8201895952224731, | |
| "logits/rejected": -0.8329208493232727, | |
| "logps/chosen": -10.150799751281738, | |
| "logps/rejected": -40.12678527832031, | |
| "loss": 0.5580483078956604, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32952913641929626, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.20641882717609406, | |
| "rewards/margins": 2.5419578552246094, | |
| "rewards/rejected": -2.335538625717163, | |
| "step": 375, | |
| "train_speed(iter/s)": 0.005424 | |
| }, | |
| { | |
| "epoch": 0.3033710698166965, | |
| "grad_norm": 4.967090606689453, | |
| "learning_rate": 0.00016688660883938165, | |
| "logits/chosen": -0.7816774845123291, | |
| "logits/rejected": -0.7863184213638306, | |
| "logps/chosen": -11.115227699279785, | |
| "logps/rejected": -41.1477165222168, | |
| "loss": 0.7776178121566772, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5047651529312134, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.12607808411121368, | |
| "rewards/margins": 2.677337884902954, | |
| "rewards/rejected": -2.8034157752990723, | |
| "step": 376, | |
| "train_speed(iter/s)": 0.005424 | |
| }, | |
| { | |
| "epoch": 0.30417790776833664, | |
| "grad_norm": 5.764723777770996, | |
| "learning_rate": 0.00016668795056613242, | |
| "logits/chosen": -0.8348323106765747, | |
| "logits/rejected": -0.836425244808197, | |
| "logps/chosen": -11.849743843078613, | |
| "logps/rejected": -35.644893646240234, | |
| "loss": 0.860490083694458, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.44726479053497314, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.01643115095794201, | |
| "rewards/margins": 2.4391143321990967, | |
| "rewards/rejected": -2.4226832389831543, | |
| "step": 377, | |
| "train_speed(iter/s)": 0.005424 | |
| }, | |
| { | |
| "epoch": 0.3049847457199768, | |
| "grad_norm": 6.4779510498046875, | |
| "learning_rate": 0.0001664888171831442, | |
| "logits/chosen": -0.8333585262298584, | |
| "logits/rejected": -0.8423128128051758, | |
| "logps/chosen": -8.405279159545898, | |
| "logps/rejected": -37.56438446044922, | |
| "loss": 0.6916205883026123, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43494561314582825, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.054853081703186035, | |
| "rewards/margins": 2.354010581970215, | |
| "rewards/rejected": -2.2991573810577393, | |
| "step": 378, | |
| "train_speed(iter/s)": 0.005424 | |
| }, | |
| { | |
| "epoch": 0.30579158367161696, | |
| "grad_norm": 2.1519875526428223, | |
| "learning_rate": 0.00016628921010911714, | |
| "logits/chosen": -0.8162001371383667, | |
| "logits/rejected": -0.8233896493911743, | |
| "logps/chosen": -6.277496814727783, | |
| "logps/rejected": -37.37247848510742, | |
| "loss": 0.3955227732658386, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.22343112528324127, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15012571215629578, | |
| "rewards/margins": 2.704033851623535, | |
| "rewards/rejected": -2.553908109664917, | |
| "step": 379, | |
| "train_speed(iter/s)": 0.005425 | |
| }, | |
| { | |
| "epoch": 0.3065984216232571, | |
| "grad_norm": 5.495427131652832, | |
| "learning_rate": 0.00016608913076612627, | |
| "logits/chosen": -0.7601447105407715, | |
| "logits/rejected": -0.7649034261703491, | |
| "logps/chosen": -11.018935203552246, | |
| "logps/rejected": -31.04195785522461, | |
| "loss": 0.7440771460533142, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3949829936027527, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16132403910160065, | |
| "rewards/margins": 2.152961015701294, | |
| "rewards/rejected": -1.9916372299194336, | |
| "step": 380, | |
| "train_speed(iter/s)": 0.005425 | |
| }, | |
| { | |
| "epoch": 0.3074052595748972, | |
| "grad_norm": 12.617781639099121, | |
| "learning_rate": 0.00016588858057961113, | |
| "logits/chosen": -0.823615550994873, | |
| "logits/rejected": -0.8296138048171997, | |
| "logps/chosen": -11.327326774597168, | |
| "logps/rejected": -38.99674606323242, | |
| "loss": 0.916981041431427, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6145994067192078, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.005291827023029327, | |
| "rewards/margins": 2.653188705444336, | |
| "rewards/rejected": -2.658480644226074, | |
| "step": 381, | |
| "train_speed(iter/s)": 0.005425 | |
| }, | |
| { | |
| "epoch": 0.3082120975265374, | |
| "grad_norm": 10.325765609741211, | |
| "learning_rate": 0.00016568756097836576, | |
| "logits/chosen": -0.7539953589439392, | |
| "logits/rejected": -0.7629266381263733, | |
| "logps/chosen": -12.126445770263672, | |
| "logps/rejected": -36.76786804199219, | |
| "loss": 0.9146925210952759, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5855523347854614, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.018190251663327217, | |
| "rewards/margins": 2.345966339111328, | |
| "rewards/rejected": -2.3277759552001953, | |
| "step": 382, | |
| "train_speed(iter/s)": 0.005425 | |
| }, | |
| { | |
| "epoch": 0.30901893547817755, | |
| "grad_norm": 4.079949378967285, | |
| "learning_rate": 0.00016548607339452853, | |
| "logits/chosen": -0.7926503419876099, | |
| "logits/rejected": -0.8010275363922119, | |
| "logps/chosen": -10.392716407775879, | |
| "logps/rejected": -33.4859733581543, | |
| "loss": 0.6544159054756165, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31039926409721375, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19881543517112732, | |
| "rewards/margins": 2.027736186981201, | |
| "rewards/rejected": -1.828920841217041, | |
| "step": 383, | |
| "train_speed(iter/s)": 0.005425 | |
| }, | |
| { | |
| "epoch": 0.3098257734298177, | |
| "grad_norm": 2.981825828552246, | |
| "learning_rate": 0.0001652841192635718, | |
| "logits/chosen": -0.7877278923988342, | |
| "logits/rejected": -0.7911107540130615, | |
| "logps/chosen": -10.606431007385254, | |
| "logps/rejected": -31.438617706298828, | |
| "loss": 0.7501833438873291, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4839434027671814, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.36393457651138306, | |
| "rewards/margins": 2.2303647994995117, | |
| "rewards/rejected": -1.8664300441741943, | |
| "step": 384, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.31063261138145787, | |
| "grad_norm": 5.048736572265625, | |
| "learning_rate": 0.0001650817000242919, | |
| "logits/chosen": -0.741836428642273, | |
| "logits/rejected": -0.7429819703102112, | |
| "logps/chosen": -8.188630104064941, | |
| "logps/rejected": -21.78225326538086, | |
| "loss": 0.7458047866821289, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3462568521499634, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1975884884595871, | |
| "rewards/margins": 1.2948282957077026, | |
| "rewards/rejected": -1.0972397327423096, | |
| "step": 385, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.31143944933309803, | |
| "grad_norm": 3.7488629817962646, | |
| "learning_rate": 0.00016487881711879868, | |
| "logits/chosen": -0.7345485687255859, | |
| "logits/rejected": -0.7461491227149963, | |
| "logps/chosen": -8.506485939025879, | |
| "logps/rejected": -31.39336395263672, | |
| "loss": 0.6992615461349487, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38303038477897644, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.12145505100488663, | |
| "rewards/margins": 1.6618486642837524, | |
| "rewards/rejected": -1.5403934717178345, | |
| "step": 386, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.31224628728473813, | |
| "grad_norm": 4.740914344787598, | |
| "learning_rate": 0.0001646754719925053, | |
| "logits/chosen": -0.7271203398704529, | |
| "logits/rejected": -0.7348542213439941, | |
| "logps/chosen": -8.581640243530273, | |
| "logps/rejected": -30.84325408935547, | |
| "loss": 0.5986461639404297, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30818265676498413, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2583742141723633, | |
| "rewards/margins": 1.7723979949951172, | |
| "rewards/rejected": -1.514023780822754, | |
| "step": 387, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.3130531252363783, | |
| "grad_norm": 2.877361536026001, | |
| "learning_rate": 0.00016447166609411809, | |
| "logits/chosen": -0.737002432346344, | |
| "logits/rejected": -0.7362369894981384, | |
| "logps/chosen": -9.167498588562012, | |
| "logps/rejected": -21.97631072998047, | |
| "loss": 0.7882663607597351, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3854939937591553, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.27406081557273865, | |
| "rewards/margins": 1.2815303802490234, | |
| "rewards/rejected": -1.007469654083252, | |
| "step": 388, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.31385996318801845, | |
| "grad_norm": 2.516064405441284, | |
| "learning_rate": 0.00016426740087562588, | |
| "logits/chosen": -0.7427570223808289, | |
| "logits/rejected": -0.7460445761680603, | |
| "logps/chosen": -7.309655666351318, | |
| "logps/rejected": -30.33109474182129, | |
| "loss": 0.5361584424972534, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29300200939178467, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18929171562194824, | |
| "rewards/margins": 1.8147234916687012, | |
| "rewards/rejected": -1.625431776046753, | |
| "step": 389, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.3146668011396586, | |
| "grad_norm": 5.825074195861816, | |
| "learning_rate": 0.0001640626777922901, | |
| "logits/chosen": -0.7519196271896362, | |
| "logits/rejected": -0.7524212598800659, | |
| "logps/chosen": -7.206381320953369, | |
| "logps/rejected": -24.535839080810547, | |
| "loss": 0.6842062473297119, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3918344974517822, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23575374484062195, | |
| "rewards/margins": 1.7519906759262085, | |
| "rewards/rejected": -1.5162369012832642, | |
| "step": 390, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.3154736390912988, | |
| "grad_norm": 3.599740505218506, | |
| "learning_rate": 0.000163857498302634, | |
| "logits/chosen": -0.7379420399665833, | |
| "logits/rejected": -0.7385002970695496, | |
| "logps/chosen": -8.897488594055176, | |
| "logps/rejected": -21.334794998168945, | |
| "loss": 0.7518292665481567, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35948920249938965, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0675305724143982, | |
| "rewards/margins": 1.2294992208480835, | |
| "rewards/rejected": -1.161968469619751, | |
| "step": 391, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.31628047704293893, | |
| "grad_norm": 3.701690673828125, | |
| "learning_rate": 0.0001636518638684325, | |
| "logits/chosen": -0.7553545832633972, | |
| "logits/rejected": -0.7599779367446899, | |
| "logps/chosen": -11.763086318969727, | |
| "logps/rejected": -29.765409469604492, | |
| "loss": 0.6486645936965942, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3567640483379364, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10855480283498764, | |
| "rewards/margins": 1.6032474040985107, | |
| "rewards/rejected": -1.4946926832199097, | |
| "step": 392, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.31708731499457904, | |
| "grad_norm": 2.8278613090515137, | |
| "learning_rate": 0.00016344577595470174, | |
| "logits/chosen": -0.7699616551399231, | |
| "logits/rejected": -0.7747686505317688, | |
| "logps/chosen": -8.457822799682617, | |
| "logps/rejected": -25.99679183959961, | |
| "loss": 0.7349235415458679, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37837332487106323, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10739874094724655, | |
| "rewards/margins": 1.572762131690979, | |
| "rewards/rejected": -1.4653635025024414, | |
| "step": 393, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.3178941529462192, | |
| "grad_norm": 3.7045748233795166, | |
| "learning_rate": 0.0001632392360296886, | |
| "logits/chosen": -0.690305233001709, | |
| "logits/rejected": -0.6888067722320557, | |
| "logps/chosen": -9.403566360473633, | |
| "logps/rejected": -22.69052505493164, | |
| "loss": 0.6981708407402039, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42633530497550964, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.4319700002670288, | |
| "rewards/margins": 1.8832911252975464, | |
| "rewards/rejected": -1.4513212442398071, | |
| "step": 394, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.31870099089785936, | |
| "grad_norm": 3.8347578048706055, | |
| "learning_rate": 0.00016303224556486021, | |
| "logits/chosen": -0.7941313982009888, | |
| "logits/rejected": -0.7985343933105469, | |
| "logps/chosen": -8.82894515991211, | |
| "logps/rejected": -35.2305793762207, | |
| "loss": 0.6906291842460632, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4142599105834961, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22435417771339417, | |
| "rewards/margins": 2.410836696624756, | |
| "rewards/rejected": -2.1864821910858154, | |
| "step": 395, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.3195078288494995, | |
| "grad_norm": 2.570457935333252, | |
| "learning_rate": 0.00016282480603489359, | |
| "logits/chosen": -0.7678409218788147, | |
| "logits/rejected": -0.7748376727104187, | |
| "logps/chosen": -7.719938278198242, | |
| "logps/rejected": -37.97621536254883, | |
| "loss": 0.5270894765853882, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29066720604896545, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2296931892633438, | |
| "rewards/margins": 2.5373897552490234, | |
| "rewards/rejected": -2.307696580886841, | |
| "step": 396, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.3203146668011397, | |
| "grad_norm": 3.276946544647217, | |
| "learning_rate": 0.000162616918917665, | |
| "logits/chosen": -0.8192197680473328, | |
| "logits/rejected": -0.8224659562110901, | |
| "logps/chosen": -12.474966049194336, | |
| "logps/rejected": -34.623626708984375, | |
| "loss": 0.6273024678230286, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4210663139820099, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15507780015468597, | |
| "rewards/margins": 2.483549118041992, | |
| "rewards/rejected": -2.3284709453582764, | |
| "step": 397, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.3211215047527798, | |
| "grad_norm": 4.271194934844971, | |
| "learning_rate": 0.00016240858569423956, | |
| "logits/chosen": -0.8221184611320496, | |
| "logits/rejected": -0.8321431875228882, | |
| "logps/chosen": -9.941547393798828, | |
| "logps/rejected": -42.07545471191406, | |
| "loss": 0.8007271885871887, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4452548623085022, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.05637914687395096, | |
| "rewards/margins": 2.7785463333129883, | |
| "rewards/rejected": -2.834925651550293, | |
| "step": 398, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.32192834270441995, | |
| "grad_norm": 11.448945999145508, | |
| "learning_rate": 0.0001621998078488605, | |
| "logits/chosen": -0.8299403190612793, | |
| "logits/rejected": -0.8370727896690369, | |
| "logps/chosen": -14.581025123596191, | |
| "logps/rejected": -46.871543884277344, | |
| "loss": 1.0272753238677979, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7910286784172058, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08015693724155426, | |
| "rewards/margins": 3.2413315773010254, | |
| "rewards/rejected": -3.161174774169922, | |
| "step": 399, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.3227351806560601, | |
| "grad_norm": 10.813321113586426, | |
| "learning_rate": 0.00016199058686893882, | |
| "logits/chosen": -0.85502690076828, | |
| "logits/rejected": -0.8559147715568542, | |
| "logps/chosen": -10.797840118408203, | |
| "logps/rejected": -27.456714630126953, | |
| "loss": 1.2833585739135742, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.8083551526069641, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.05027822405099869, | |
| "rewards/margins": 1.7881048917770386, | |
| "rewards/rejected": -1.8383830785751343, | |
| "step": 400, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.32354201860770027, | |
| "grad_norm": 7.667049884796143, | |
| "learning_rate": 0.00016178092424504246, | |
| "logits/chosen": -0.8004090785980225, | |
| "logits/rejected": -0.8061416149139404, | |
| "logps/chosen": -9.709630966186523, | |
| "logps/rejected": -47.190277099609375, | |
| "loss": 0.6974176168441772, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5138447284698486, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.048886872828006744, | |
| "rewards/margins": 3.236457109451294, | |
| "rewards/rejected": -3.285344123840332, | |
| "step": 401, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.3243488565593404, | |
| "grad_norm": 5.483085632324219, | |
| "learning_rate": 0.00016157082147088593, | |
| "logits/chosen": -0.8190602660179138, | |
| "logits/rejected": -0.824268639087677, | |
| "logps/chosen": -14.70582103729248, | |
| "logps/rejected": -41.711917877197266, | |
| "loss": 1.1310678720474243, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6881631016731262, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.03247120603919029, | |
| "rewards/margins": 2.756627321243286, | |
| "rewards/rejected": -2.724156141281128, | |
| "step": 402, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.3251556945109806, | |
| "grad_norm": 4.824715614318848, | |
| "learning_rate": 0.0001613602800433194, | |
| "logits/chosen": -0.8436318039894104, | |
| "logits/rejected": -0.8526687026023865, | |
| "logps/chosen": -8.126108169555664, | |
| "logps/rejected": -42.07024383544922, | |
| "loss": 0.6571808457374573, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4890969395637512, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.10289221256971359, | |
| "rewards/margins": 2.9235923290252686, | |
| "rewards/rejected": -2.8207004070281982, | |
| "step": 403, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.3259625324626207, | |
| "grad_norm": 6.610788345336914, | |
| "learning_rate": 0.00016114930146231827, | |
| "logits/chosen": -0.8161177635192871, | |
| "logits/rejected": -0.8242086172103882, | |
| "logps/chosen": -12.218559265136719, | |
| "logps/rejected": -44.647254943847656, | |
| "loss": 0.6997122168540955, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4584552049636841, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.26513317227363586, | |
| "rewards/margins": 2.8937909603118896, | |
| "rewards/rejected": -3.158923864364624, | |
| "step": 404, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.32676937041426085, | |
| "grad_norm": 2.9718236923217773, | |
| "learning_rate": 0.0001609378872309723, | |
| "logits/chosen": -0.766316831111908, | |
| "logits/rejected": -0.7643468379974365, | |
| "logps/chosen": -6.773965835571289, | |
| "logps/rejected": -29.697847366333008, | |
| "loss": 0.46833112835884094, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2168104350566864, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19758227467536926, | |
| "rewards/margins": 2.3953795433044434, | |
| "rewards/rejected": -2.1977975368499756, | |
| "step": 405, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.327576208365901, | |
| "grad_norm": 5.874072551727295, | |
| "learning_rate": 0.00016072603885547508, | |
| "logits/chosen": -0.78830885887146, | |
| "logits/rejected": -0.7853043079376221, | |
| "logps/chosen": -11.376614570617676, | |
| "logps/rejected": -30.687149047851562, | |
| "loss": 0.7618173956871033, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3364633023738861, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.12673895061016083, | |
| "rewards/margins": 1.8598191738128662, | |
| "rewards/rejected": -1.986557960510254, | |
| "step": 406, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.32838304631754117, | |
| "grad_norm": 3.214999198913574, | |
| "learning_rate": 0.00016051375784511312, | |
| "logits/chosen": -0.7452774047851562, | |
| "logits/rejected": -0.7576760649681091, | |
| "logps/chosen": -6.296991348266602, | |
| "logps/rejected": -37.21446228027344, | |
| "loss": 0.5500832796096802, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2983091473579407, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.16730837523937225, | |
| "rewards/margins": 2.706336259841919, | |
| "rewards/rejected": -2.539027690887451, | |
| "step": 407, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.32918988426918133, | |
| "grad_norm": 3.2364044189453125, | |
| "learning_rate": 0.00016030104571225522, | |
| "logits/chosen": -0.8141746520996094, | |
| "logits/rejected": -0.8147263526916504, | |
| "logps/chosen": -8.27431583404541, | |
| "logps/rejected": -27.03731918334961, | |
| "loss": 0.6542465686798096, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32871556282043457, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.20524322986602783, | |
| "rewards/margins": 1.7059212923049927, | |
| "rewards/rejected": -1.5006780624389648, | |
| "step": 408, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.32999672222082144, | |
| "grad_norm": 4.386970043182373, | |
| "learning_rate": 0.0001600879039723417, | |
| "logits/chosen": -0.7278757095336914, | |
| "logits/rejected": -0.7296465635299683, | |
| "logps/chosen": -10.145583152770996, | |
| "logps/rejected": -34.609405517578125, | |
| "loss": 0.6105880737304688, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.36851969361305237, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.062060222029685974, | |
| "rewards/margins": 2.2632784843444824, | |
| "rewards/rejected": -2.2012181282043457, | |
| "step": 409, | |
| "train_speed(iter/s)": 0.005428 | |
| }, | |
| { | |
| "epoch": 0.3308035601724616, | |
| "grad_norm": 3.3711960315704346, | |
| "learning_rate": 0.0001598743341438734, | |
| "logits/chosen": -0.69020015001297, | |
| "logits/rejected": -0.6957679986953735, | |
| "logps/chosen": -10.575393676757812, | |
| "logps/rejected": -32.856101989746094, | |
| "loss": 0.6940324306488037, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43308204412460327, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3041924238204956, | |
| "rewards/margins": 2.375181198120117, | |
| "rewards/rejected": -2.070988893508911, | |
| "step": 410, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.33161039812410176, | |
| "grad_norm": 3.1790573596954346, | |
| "learning_rate": 0.00015966033774840127, | |
| "logits/chosen": -0.7445316314697266, | |
| "logits/rejected": -0.748544454574585, | |
| "logps/chosen": -7.364559650421143, | |
| "logps/rejected": -30.644813537597656, | |
| "loss": 0.5010148882865906, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2939934730529785, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2668747305870056, | |
| "rewards/margins": 2.051632881164551, | |
| "rewards/rejected": -1.7847580909729004, | |
| "step": 411, | |
| "train_speed(iter/s)": 0.005429 | |
| }, | |
| { | |
| "epoch": 0.3324172360757419, | |
| "grad_norm": 5.062440395355225, | |
| "learning_rate": 0.00015944591631051504, | |
| "logits/chosen": -0.6655209064483643, | |
| "logits/rejected": -0.6722307801246643, | |
| "logps/chosen": -8.464452743530273, | |
| "logps/rejected": -28.55743408203125, | |
| "loss": 0.7590057849884033, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41250795125961304, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13860762119293213, | |
| "rewards/margins": 1.7520344257354736, | |
| "rewards/rejected": -1.613426923751831, | |
| "step": 412, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.3332240740273821, | |
| "grad_norm": 2.3003089427948, | |
| "learning_rate": 0.00015923107135783275, | |
| "logits/chosen": -0.735182523727417, | |
| "logits/rejected": -0.741850733757019, | |
| "logps/chosen": -4.926098346710205, | |
| "logps/rejected": -27.20798110961914, | |
| "loss": 0.5019189715385437, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.22264572978019714, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19852803647518158, | |
| "rewards/margins": 1.7793362140655518, | |
| "rewards/rejected": -1.580808162689209, | |
| "step": 413, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.33403091197902224, | |
| "grad_norm": 2.761085271835327, | |
| "learning_rate": 0.00015901580442098968, | |
| "logits/chosen": -0.6879050135612488, | |
| "logits/rejected": -0.6989721059799194, | |
| "logps/chosen": -8.289688110351562, | |
| "logps/rejected": -36.11437225341797, | |
| "loss": 0.5515791773796082, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.359782874584198, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.35169073939323425, | |
| "rewards/margins": 2.3315212726593018, | |
| "rewards/rejected": -1.9798306226730347, | |
| "step": 414, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.33483774993066234, | |
| "grad_norm": 2.9564995765686035, | |
| "learning_rate": 0.00015880011703362748, | |
| "logits/chosen": -0.7736977338790894, | |
| "logits/rejected": -0.7791394591331482, | |
| "logps/chosen": -11.907139778137207, | |
| "logps/rejected": -30.767383575439453, | |
| "loss": 0.5806700587272644, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.38372740149497986, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4125119745731354, | |
| "rewards/margins": 2.088625192642212, | |
| "rewards/rejected": -1.6761131286621094, | |
| "step": 415, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.3356445878823025, | |
| "grad_norm": 2.9187235832214355, | |
| "learning_rate": 0.0001585840107323832, | |
| "logits/chosen": -0.7161890864372253, | |
| "logits/rejected": -0.7156458497047424, | |
| "logps/chosen": -8.870182037353516, | |
| "logps/rejected": -30.228370666503906, | |
| "loss": 0.7012996077537537, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3564344346523285, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10954218357801437, | |
| "rewards/margins": 2.018000364303589, | |
| "rewards/rejected": -1.9084582328796387, | |
| "step": 416, | |
| "train_speed(iter/s)": 0.00543 | |
| }, | |
| { | |
| "epoch": 0.33645142583394266, | |
| "grad_norm": 5.864604473114014, | |
| "learning_rate": 0.00015836748705687841, | |
| "logits/chosen": -0.7383227348327637, | |
| "logits/rejected": -0.7456459999084473, | |
| "logps/chosen": -7.744223594665527, | |
| "logps/rejected": -38.64203643798828, | |
| "loss": 0.5262930393218994, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3058444857597351, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17473873496055603, | |
| "rewards/margins": 2.6876578330993652, | |
| "rewards/rejected": -2.5129189491271973, | |
| "step": 417, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3372582637855828, | |
| "grad_norm": 9.024547576904297, | |
| "learning_rate": 0.00015815054754970831, | |
| "logits/chosen": -0.7634251117706299, | |
| "logits/rejected": -0.7683747410774231, | |
| "logps/chosen": -10.462536811828613, | |
| "logps/rejected": -31.69692039489746, | |
| "loss": 0.9514245986938477, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6364089250564575, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21211130917072296, | |
| "rewards/margins": 2.214094877243042, | |
| "rewards/rejected": -2.001983642578125, | |
| "step": 418, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.338065101737223, | |
| "grad_norm": 8.62049388885498, | |
| "learning_rate": 0.00015793319375643052, | |
| "logits/chosen": -0.7581362724304199, | |
| "logits/rejected": -0.7588805556297302, | |
| "logps/chosen": -7.701593399047852, | |
| "logps/rejected": -35.039794921875, | |
| "loss": 0.46434247493743896, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32877326011657715, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22201837599277496, | |
| "rewards/margins": 2.5157957077026367, | |
| "rewards/rejected": -2.2937769889831543, | |
| "step": 419, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3388719396888631, | |
| "grad_norm": 6.575305938720703, | |
| "learning_rate": 0.00015771542722555423, | |
| "logits/chosen": -0.7857352495193481, | |
| "logits/rejected": -0.7996398210525513, | |
| "logps/chosen": -10.29336166381836, | |
| "logps/rejected": -46.0968017578125, | |
| "loss": 0.738344669342041, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45971018075942993, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.021582117304205894, | |
| "rewards/margins": 2.711317777633667, | |
| "rewards/rejected": -2.6897356510162354, | |
| "step": 420, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.33967877764050325, | |
| "grad_norm": 1.8250871896743774, | |
| "learning_rate": 0.00015749724950852909, | |
| "logits/chosen": -0.8029757738113403, | |
| "logits/rejected": -0.803418755531311, | |
| "logps/chosen": -8.469568252563477, | |
| "logps/rejected": -41.49656295776367, | |
| "loss": 0.4241314232349396, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2885726988315582, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.14934808015823364, | |
| "rewards/margins": 3.204773187637329, | |
| "rewards/rejected": -3.0554254055023193, | |
| "step": 421, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3404856155921434, | |
| "grad_norm": 7.909032821655273, | |
| "learning_rate": 0.00015727866215973425, | |
| "logits/chosen": -0.8152115941047668, | |
| "logits/rejected": -0.8257274627685547, | |
| "logps/chosen": -8.088623046875, | |
| "logps/rejected": -48.481143951416016, | |
| "loss": 0.6303491592407227, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3295513391494751, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07966871559619904, | |
| "rewards/margins": 3.391120672225952, | |
| "rewards/rejected": -3.3114516735076904, | |
| "step": 422, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.34129245354378357, | |
| "grad_norm": 5.323256015777588, | |
| "learning_rate": 0.00015705966673646723, | |
| "logits/chosen": -0.8351114392280579, | |
| "logits/rejected": -0.8382234573364258, | |
| "logps/chosen": -8.482909202575684, | |
| "logps/rejected": -37.57075881958008, | |
| "loss": 0.6785515546798706, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.363737553358078, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1108720526099205, | |
| "rewards/margins": 2.615013837814331, | |
| "rewards/rejected": -2.5041418075561523, | |
| "step": 423, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.34209929149542373, | |
| "grad_norm": 27.7071475982666, | |
| "learning_rate": 0.00015684026479893272, | |
| "logits/chosen": -0.8173145651817322, | |
| "logits/rejected": -0.8212793469429016, | |
| "logps/chosen": -15.243718147277832, | |
| "logps/rejected": -35.84337615966797, | |
| "loss": 0.9820355176925659, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5321431756019592, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.15343250334262848, | |
| "rewards/margins": 2.1440441608428955, | |
| "rewards/rejected": -2.2974765300750732, | |
| "step": 424, | |
| "train_speed(iter/s)": 0.005431 | |
| }, | |
| { | |
| "epoch": 0.3429061294470639, | |
| "grad_norm": 2.558488368988037, | |
| "learning_rate": 0.00015662045791023173, | |
| "logits/chosen": -0.7981111407279968, | |
| "logits/rejected": -0.804236888885498, | |
| "logps/chosen": -12.458770751953125, | |
| "logps/rejected": -38.74690246582031, | |
| "loss": 0.5468552708625793, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40575528144836426, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3049697279930115, | |
| "rewards/margins": 2.893904685974121, | |
| "rewards/rejected": -2.588935375213623, | |
| "step": 425, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.343712967398704, | |
| "grad_norm": 11.186711311340332, | |
| "learning_rate": 0.00015640024763635015, | |
| "logits/chosen": -0.8168637156486511, | |
| "logits/rejected": -0.8147194385528564, | |
| "logps/chosen": -18.96175193786621, | |
| "logps/rejected": -30.127038955688477, | |
| "loss": 1.35488760471344, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6938337683677673, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.32947003841400146, | |
| "rewards/margins": 1.8565242290496826, | |
| "rewards/rejected": -2.1859941482543945, | |
| "step": 426, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.34451980535034415, | |
| "grad_norm": 2.7602322101593018, | |
| "learning_rate": 0.00015617963554614782, | |
| "logits/chosen": -0.7925236225128174, | |
| "logits/rejected": -0.8042585253715515, | |
| "logps/chosen": -7.885419845581055, | |
| "logps/rejected": -41.48836135864258, | |
| "loss": 0.5029093027114868, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3265308141708374, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19351695477962494, | |
| "rewards/margins": 3.003077507019043, | |
| "rewards/rejected": -2.809560537338257, | |
| "step": 427, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3453266433019843, | |
| "grad_norm": 2.7690954208374023, | |
| "learning_rate": 0.00015595862321134723, | |
| "logits/chosen": -0.801167368888855, | |
| "logits/rejected": -0.8079819083213806, | |
| "logps/chosen": -11.006603240966797, | |
| "logps/rejected": -47.515464782714844, | |
| "loss": 0.5393511652946472, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.357557088136673, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09760009497404099, | |
| "rewards/margins": 3.3984105587005615, | |
| "rewards/rejected": -3.3008105754852295, | |
| "step": 428, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3461334812536245, | |
| "grad_norm": 3.378408432006836, | |
| "learning_rate": 0.00015573721220652243, | |
| "logits/chosen": -0.7705251574516296, | |
| "logits/rejected": -0.7756682634353638, | |
| "logps/chosen": -7.106504440307617, | |
| "logps/rejected": -38.38644790649414, | |
| "loss": 0.45007073879241943, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2939262390136719, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2970801591873169, | |
| "rewards/margins": 2.9060657024383545, | |
| "rewards/rejected": -2.608985424041748, | |
| "step": 429, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.34694031920526464, | |
| "grad_norm": 11.245018005371094, | |
| "learning_rate": 0.0001555154041090876, | |
| "logits/chosen": -0.7640025019645691, | |
| "logits/rejected": -0.7694700360298157, | |
| "logps/chosen": -7.503448486328125, | |
| "logps/rejected": -29.179779052734375, | |
| "loss": 0.6581162214279175, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3762749135494232, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18421027064323425, | |
| "rewards/margins": 2.1600494384765625, | |
| "rewards/rejected": -1.9758392572402954, | |
| "step": 430, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.34774715715690474, | |
| "grad_norm": 4.24967098236084, | |
| "learning_rate": 0.0001552932004992861, | |
| "logits/chosen": -0.7261820435523987, | |
| "logits/rejected": -0.7354370355606079, | |
| "logps/chosen": -8.89859676361084, | |
| "logps/rejected": -43.472408294677734, | |
| "loss": 0.5466022491455078, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2866482138633728, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21286547183990479, | |
| "rewards/margins": 3.0320310592651367, | |
| "rewards/rejected": -2.8191657066345215, | |
| "step": 431, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3485539951085449, | |
| "grad_norm": 17.65904998779297, | |
| "learning_rate": 0.00015507060296017896, | |
| "logits/chosen": -0.7059640884399414, | |
| "logits/rejected": -0.7113645076751709, | |
| "logps/chosen": -15.478120803833008, | |
| "logps/rejected": -38.02043914794922, | |
| "loss": 0.9082990288734436, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5757866501808167, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15995851159095764, | |
| "rewards/margins": 2.8075268268585205, | |
| "rewards/rejected": -2.6475682258605957, | |
| "step": 432, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.34936083306018506, | |
| "grad_norm": 13.476463317871094, | |
| "learning_rate": 0.00015484761307763383, | |
| "logits/chosen": -0.700376033782959, | |
| "logits/rejected": -0.7011431455612183, | |
| "logps/chosen": -9.81491470336914, | |
| "logps/rejected": -33.46759796142578, | |
| "loss": 0.7563650608062744, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5197194814682007, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14740222692489624, | |
| "rewards/margins": 2.482841730117798, | |
| "rewards/rejected": -2.335439682006836, | |
| "step": 433, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.3501676710118252, | |
| "grad_norm": 2.2564306259155273, | |
| "learning_rate": 0.00015462423244031346, | |
| "logits/chosen": -0.7145711183547974, | |
| "logits/rejected": -0.7142253518104553, | |
| "logps/chosen": -6.049681663513184, | |
| "logps/rejected": -40.261722564697266, | |
| "loss": 0.39624738693237305, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2778511047363281, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3084055185317993, | |
| "rewards/margins": 3.100196361541748, | |
| "rewards/rejected": -2.79179048538208, | |
| "step": 434, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3509745089634654, | |
| "grad_norm": 3.1633989810943604, | |
| "learning_rate": 0.00015440046263966446, | |
| "logits/chosen": -0.734190046787262, | |
| "logits/rejected": -0.7362701296806335, | |
| "logps/chosen": -7.924525737762451, | |
| "logps/rejected": -30.7021484375, | |
| "loss": 0.6030353307723999, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3201526999473572, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07075662910938263, | |
| "rewards/margins": 1.9832499027252197, | |
| "rewards/rejected": -1.9124932289123535, | |
| "step": 435, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.35178134691510554, | |
| "grad_norm": 9.708440780639648, | |
| "learning_rate": 0.00015417630526990615, | |
| "logits/chosen": -0.7230247855186462, | |
| "logits/rejected": -0.7281976342201233, | |
| "logps/chosen": -7.0415544509887695, | |
| "logps/rejected": -37.40678787231445, | |
| "loss": 0.9090821743011475, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6137229204177856, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.017065048217773438, | |
| "rewards/margins": 2.4000210762023926, | |
| "rewards/rejected": -2.417086124420166, | |
| "step": 436, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.35258818486674565, | |
| "grad_norm": 2.7294411659240723, | |
| "learning_rate": 0.00015395176192801882, | |
| "logits/chosen": -0.66111159324646, | |
| "logits/rejected": -0.6679624319076538, | |
| "logps/chosen": -10.94334602355957, | |
| "logps/rejected": -39.744171142578125, | |
| "loss": 0.558108925819397, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3573530912399292, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07710271328687668, | |
| "rewards/margins": 2.2725815773010254, | |
| "rewards/rejected": -2.195478916168213, | |
| "step": 437, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3533950228183858, | |
| "grad_norm": 2.2957513332366943, | |
| "learning_rate": 0.00015372683421373268, | |
| "logits/chosen": -0.7276008129119873, | |
| "logits/rejected": -0.733298659324646, | |
| "logps/chosen": -9.018013954162598, | |
| "logps/rejected": -39.43022155761719, | |
| "loss": 0.5581925511360168, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35958534479141235, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3142196834087372, | |
| "rewards/margins": 2.4971206188201904, | |
| "rewards/rejected": -2.182900905609131, | |
| "step": 438, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.35420186077002597, | |
| "grad_norm": 2.652552604675293, | |
| "learning_rate": 0.0001535015237295164, | |
| "logits/chosen": -0.7248872518539429, | |
| "logits/rejected": -0.728070080280304, | |
| "logps/chosen": -9.407607078552246, | |
| "logps/rejected": -35.77960205078125, | |
| "loss": 0.7365480065345764, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5000982880592346, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21720585227012634, | |
| "rewards/margins": 2.5895490646362305, | |
| "rewards/rejected": -2.372343063354492, | |
| "step": 439, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3550086987216661, | |
| "grad_norm": 16.293540954589844, | |
| "learning_rate": 0.00015327583208056553, | |
| "logits/chosen": -0.7425347566604614, | |
| "logits/rejected": -0.7465611100196838, | |
| "logps/chosen": -6.231223106384277, | |
| "logps/rejected": -33.581016540527344, | |
| "loss": 0.5848970413208008, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3383205533027649, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22708339989185333, | |
| "rewards/margins": 2.6124606132507324, | |
| "rewards/rejected": -2.3853771686553955, | |
| "step": 440, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3558155366733063, | |
| "grad_norm": 7.516906261444092, | |
| "learning_rate": 0.00015304976087479128, | |
| "logits/chosen": -0.7300995588302612, | |
| "logits/rejected": -0.731682538986206, | |
| "logps/chosen": -7.094137191772461, | |
| "logps/rejected": -24.851308822631836, | |
| "loss": 0.6824460625648499, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.28373995423316956, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08390329778194427, | |
| "rewards/margins": 1.636284351348877, | |
| "rewards/rejected": -1.5523810386657715, | |
| "step": 441, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.35662237462494645, | |
| "grad_norm": 5.410120487213135, | |
| "learning_rate": 0.00015282331172280887, | |
| "logits/chosen": -0.7709946036338806, | |
| "logits/rejected": -0.778519868850708, | |
| "logps/chosen": -14.137146949768066, | |
| "logps/rejected": -39.00368881225586, | |
| "loss": 1.1119240522384644, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5970031023025513, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0509246289730072, | |
| "rewards/margins": 2.253941297531128, | |
| "rewards/rejected": -2.304866075515747, | |
| "step": 442, | |
| "train_speed(iter/s)": 0.005432 | |
| }, | |
| { | |
| "epoch": 0.35742921257658655, | |
| "grad_norm": 2.6960244178771973, | |
| "learning_rate": 0.0001525964862379263, | |
| "logits/chosen": -0.7315975427627563, | |
| "logits/rejected": -0.7369835376739502, | |
| "logps/chosen": -5.271239280700684, | |
| "logps/rejected": -27.497392654418945, | |
| "loss": 0.5291019082069397, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2573389708995819, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2271825522184372, | |
| "rewards/margins": 2.134850263595581, | |
| "rewards/rejected": -1.907667636871338, | |
| "step": 443, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3582360505282267, | |
| "grad_norm": 3.0122978687286377, | |
| "learning_rate": 0.0001523692860361325, | |
| "logits/chosen": -0.7649153470993042, | |
| "logits/rejected": -0.7727422118186951, | |
| "logps/chosen": -12.25500774383545, | |
| "logps/rejected": -40.75428771972656, | |
| "loss": 0.712749183177948, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5094113349914551, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25550708174705505, | |
| "rewards/margins": 2.767303466796875, | |
| "rewards/rejected": -2.511796474456787, | |
| "step": 444, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3590428884798669, | |
| "grad_norm": 3.1875035762786865, | |
| "learning_rate": 0.00015214171273608614, | |
| "logits/chosen": -0.7680434584617615, | |
| "logits/rejected": -0.773673951625824, | |
| "logps/chosen": -10.56375503540039, | |
| "logps/rejected": -46.056488037109375, | |
| "loss": 0.5614004731178284, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3534352779388428, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.05404359847307205, | |
| "rewards/margins": 3.072054386138916, | |
| "rewards/rejected": -3.0180106163024902, | |
| "step": 445, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.35984972643150703, | |
| "grad_norm": 2.6271064281463623, | |
| "learning_rate": 0.00015191376795910404, | |
| "logits/chosen": -0.7706547975540161, | |
| "logits/rejected": -0.7753493189811707, | |
| "logps/chosen": -10.181999206542969, | |
| "logps/rejected": -36.871089935302734, | |
| "loss": 0.7368884682655334, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5453473925590515, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20240941643714905, | |
| "rewards/margins": 2.66059947013855, | |
| "rewards/rejected": -2.4581899642944336, | |
| "step": 446, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3606565643831472, | |
| "grad_norm": 2.9951157569885254, | |
| "learning_rate": 0.0001516854533291494, | |
| "logits/chosen": -0.7616828083992004, | |
| "logits/rejected": -0.7694711685180664, | |
| "logps/chosen": -7.686607837677002, | |
| "logps/rejected": -41.72177505493164, | |
| "loss": 0.5836425423622131, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33194291591644287, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.03806695714592934, | |
| "rewards/margins": 2.7966089248657227, | |
| "rewards/rejected": -2.75854229927063, | |
| "step": 447, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3614634023347873, | |
| "grad_norm": 6.78880500793457, | |
| "learning_rate": 0.00015145677047282056, | |
| "logits/chosen": -0.768774151802063, | |
| "logits/rejected": -0.7738460302352905, | |
| "logps/chosen": -7.29971170425415, | |
| "logps/rejected": -23.89675521850586, | |
| "loss": 0.7116811871528625, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.363356351852417, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2802785038948059, | |
| "rewards/margins": 1.6327687501907349, | |
| "rewards/rejected": -1.3524901866912842, | |
| "step": 448, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.36227024028642746, | |
| "grad_norm": 2.428403854370117, | |
| "learning_rate": 0.00015122772101933913, | |
| "logits/chosen": -0.713983416557312, | |
| "logits/rejected": -0.719916582107544, | |
| "logps/chosen": -9.733499526977539, | |
| "logps/rejected": -38.1261100769043, | |
| "loss": 0.5839467644691467, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3204602897167206, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18539123237133026, | |
| "rewards/margins": 2.5533952713012695, | |
| "rewards/rejected": -2.368004083633423, | |
| "step": 449, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3630770782380676, | |
| "grad_norm": 2.1015625, | |
| "learning_rate": 0.00015099830660053848, | |
| "logits/chosen": -0.6917126774787903, | |
| "logits/rejected": -0.704102098941803, | |
| "logps/chosen": -6.558714866638184, | |
| "logps/rejected": -44.186180114746094, | |
| "loss": 0.42745494842529297, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.25199466943740845, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.26587462425231934, | |
| "rewards/margins": 3.109530210494995, | |
| "rewards/rejected": -2.8436553478240967, | |
| "step": 450, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.3638839161897078, | |
| "grad_norm": 7.269819736480713, | |
| "learning_rate": 0.00015076852885085223, | |
| "logits/chosen": -0.685967206954956, | |
| "logits/rejected": -0.6903418898582458, | |
| "logps/chosen": -8.861746788024902, | |
| "logps/rejected": -31.555381774902344, | |
| "loss": 0.6940796375274658, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4090823233127594, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1664535403251648, | |
| "rewards/margins": 2.2505595684051514, | |
| "rewards/rejected": -2.0841057300567627, | |
| "step": 451, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.36469075414134794, | |
| "grad_norm": 7.895684719085693, | |
| "learning_rate": 0.00015053838940730244, | |
| "logits/chosen": -0.7125756740570068, | |
| "logits/rejected": -0.7196484804153442, | |
| "logps/chosen": -7.934318542480469, | |
| "logps/rejected": -32.33711624145508, | |
| "loss": 0.9927008152008057, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5683808326721191, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.047097161412239075, | |
| "rewards/margins": 1.7799056768417358, | |
| "rewards/rejected": -1.7328083515167236, | |
| "step": 452, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3654975920929881, | |
| "grad_norm": 2.145096778869629, | |
| "learning_rate": 0.00015030788990948797, | |
| "logits/chosen": -0.7455975413322449, | |
| "logits/rejected": -0.748679518699646, | |
| "logps/chosen": -8.74243450164795, | |
| "logps/rejected": -32.179813385009766, | |
| "loss": 0.5566769242286682, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35227102041244507, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20155397057533264, | |
| "rewards/margins": 2.3393735885620117, | |
| "rewards/rejected": -2.137819766998291, | |
| "step": 453, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3663044300446282, | |
| "grad_norm": 12.220844268798828, | |
| "learning_rate": 0.00015007703199957297, | |
| "logits/chosen": -0.6872383952140808, | |
| "logits/rejected": -0.6934896111488342, | |
| "logps/chosen": -12.1061429977417, | |
| "logps/rejected": -36.80299377441406, | |
| "loss": 0.761122465133667, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4497636556625366, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06379126012325287, | |
| "rewards/margins": 2.3671936988830566, | |
| "rewards/rejected": -2.3034024238586426, | |
| "step": 454, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.36711126799626836, | |
| "grad_norm": 1.585224986076355, | |
| "learning_rate": 0.00014984581732227492, | |
| "logits/chosen": -0.7161681652069092, | |
| "logits/rejected": -0.7274316549301147, | |
| "logps/chosen": -8.679915428161621, | |
| "logps/rejected": -39.74371337890625, | |
| "loss": 0.45609888434410095, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3443814516067505, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48159369826316833, | |
| "rewards/margins": 3.0060887336730957, | |
| "rewards/rejected": -2.5244951248168945, | |
| "step": 455, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3679181059479085, | |
| "grad_norm": 5.118838310241699, | |
| "learning_rate": 0.00014961424752485308, | |
| "logits/chosen": -0.7437467575073242, | |
| "logits/rejected": -0.754626989364624, | |
| "logps/chosen": -11.635477066040039, | |
| "logps/rejected": -46.820133209228516, | |
| "loss": 0.9505035281181335, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6606087684631348, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.12925539910793304, | |
| "rewards/margins": 2.922895908355713, | |
| "rewards/rejected": -3.0521514415740967, | |
| "step": 456, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.3687249438995487, | |
| "grad_norm": 6.369676113128662, | |
| "learning_rate": 0.00014938232425709672, | |
| "logits/chosen": -0.7123354077339172, | |
| "logits/rejected": -0.7202441692352295, | |
| "logps/chosen": -7.666382312774658, | |
| "logps/rejected": -39.06452178955078, | |
| "loss": 0.5345906019210815, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.288968950510025, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09636388719081879, | |
| "rewards/margins": 2.4988255500793457, | |
| "rewards/rejected": -2.4024617671966553, | |
| "step": 457, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.36953178185118885, | |
| "grad_norm": 4.273453712463379, | |
| "learning_rate": 0.00014915004917131344, | |
| "logits/chosen": -0.7618826627731323, | |
| "logits/rejected": -0.758380115032196, | |
| "logps/chosen": -9.670495986938477, | |
| "logps/rejected": -27.89179039001465, | |
| "loss": 0.6546672582626343, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.41434964537620544, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.03314019367098808, | |
| "rewards/margins": 2.1142916679382324, | |
| "rewards/rejected": -2.081151247024536, | |
| "step": 458, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37033861980282895, | |
| "grad_norm": 1.8925552368164062, | |
| "learning_rate": 0.0001489174239223172, | |
| "logits/chosen": -0.7534856200218201, | |
| "logits/rejected": -0.7552649974822998, | |
| "logps/chosen": -7.762975215911865, | |
| "logps/rejected": -33.306766510009766, | |
| "loss": 0.44340604543685913, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.23383133113384247, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.27828943729400635, | |
| "rewards/margins": 2.5259461402893066, | |
| "rewards/rejected": -2.247657060623169, | |
| "step": 459, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.3711454577544691, | |
| "grad_norm": 3.5424697399139404, | |
| "learning_rate": 0.00014868445016741677, | |
| "logits/chosen": -0.7251965403556824, | |
| "logits/rejected": -0.7256088852882385, | |
| "logps/chosen": -13.685113906860352, | |
| "logps/rejected": -30.76580238342285, | |
| "loss": 0.8778742551803589, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.578425407409668, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.04395178705453873, | |
| "rewards/margins": 2.217789649963379, | |
| "rewards/rejected": -2.173837900161743, | |
| "step": 460, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37195229570610927, | |
| "grad_norm": 4.210732460021973, | |
| "learning_rate": 0.00014845112956640369, | |
| "logits/chosen": -0.7375807166099548, | |
| "logits/rejected": -0.7479276657104492, | |
| "logps/chosen": -10.048831939697266, | |
| "logps/rejected": -41.19210433959961, | |
| "loss": 0.5977764129638672, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3318694531917572, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19474266469478607, | |
| "rewards/margins": 3.0025835037231445, | |
| "rewards/rejected": -2.8078413009643555, | |
| "step": 461, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37275913365774943, | |
| "grad_norm": 4.395127296447754, | |
| "learning_rate": 0.00014821746378154062, | |
| "logits/chosen": -0.6776711940765381, | |
| "logits/rejected": -0.6841428279876709, | |
| "logps/chosen": -6.95946741104126, | |
| "logps/rejected": -36.13311767578125, | |
| "loss": 0.4928424060344696, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.30789151787757874, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32969141006469727, | |
| "rewards/margins": 2.7516045570373535, | |
| "rewards/rejected": -2.4219131469726562, | |
| "step": 462, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.3735659716093896, | |
| "grad_norm": 3.365333318710327, | |
| "learning_rate": 0.00014798345447754948, | |
| "logits/chosen": -0.7575942277908325, | |
| "logits/rejected": -0.7648032903671265, | |
| "logps/chosen": -8.037223815917969, | |
| "logps/rejected": -43.406375885009766, | |
| "loss": 0.5700507164001465, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.37956228852272034, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2864043116569519, | |
| "rewards/margins": 3.18467116355896, | |
| "rewards/rejected": -2.8982667922973633, | |
| "step": 463, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37437280956102975, | |
| "grad_norm": 7.311818599700928, | |
| "learning_rate": 0.0001477491033215994, | |
| "logits/chosen": -0.6993564963340759, | |
| "logits/rejected": -0.7100475430488586, | |
| "logps/chosen": -11.119054794311523, | |
| "logps/rejected": -40.00886917114258, | |
| "loss": 1.3310893774032593, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6867990493774414, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.33331215381622314, | |
| "rewards/margins": 2.3917033672332764, | |
| "rewards/rejected": -2.725015640258789, | |
| "step": 464, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37517964751266986, | |
| "grad_norm": 10.936890602111816, | |
| "learning_rate": 0.00014751441198329523, | |
| "logits/chosen": -0.6920858025550842, | |
| "logits/rejected": -0.6920123100280762, | |
| "logps/chosen": -14.5137939453125, | |
| "logps/rejected": -37.997467041015625, | |
| "loss": 0.9086753726005554, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5238281488418579, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.10487417131662369, | |
| "rewards/margins": 2.618326187133789, | |
| "rewards/rejected": -2.7232000827789307, | |
| "step": 465, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37598648546431, | |
| "grad_norm": 15.677000045776367, | |
| "learning_rate": 0.0001472793821346652, | |
| "logits/chosen": -0.6896384954452515, | |
| "logits/rejected": -0.6940050721168518, | |
| "logps/chosen": -10.987081527709961, | |
| "logps/rejected": -40.3748779296875, | |
| "loss": 0.6646585464477539, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45032551884651184, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.16333404183387756, | |
| "rewards/margins": 2.996572494506836, | |
| "rewards/rejected": -2.8332386016845703, | |
| "step": 466, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.3767933234159502, | |
| "grad_norm": 4.351585865020752, | |
| "learning_rate": 0.00014704401545014925, | |
| "logits/chosen": -0.7135500311851501, | |
| "logits/rejected": -0.7152791023254395, | |
| "logps/chosen": -9.104679107666016, | |
| "logps/rejected": -35.246437072753906, | |
| "loss": 0.7736812829971313, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42992913722991943, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.11151327192783356, | |
| "rewards/margins": 2.5536930561065674, | |
| "rewards/rejected": -2.4421796798706055, | |
| "step": 467, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.37760016136759034, | |
| "grad_norm": 5.113152980804443, | |
| "learning_rate": 0.00014680831360658713, | |
| "logits/chosen": -0.631149172782898, | |
| "logits/rejected": -0.6411234140396118, | |
| "logps/chosen": -9.986248016357422, | |
| "logps/rejected": -47.841514587402344, | |
| "loss": 0.6793885231018066, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4218906760215759, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06469957530498505, | |
| "rewards/margins": 3.1944708824157715, | |
| "rewards/rejected": -3.1297712326049805, | |
| "step": 468, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.3784069993192305, | |
| "grad_norm": 5.426872730255127, | |
| "learning_rate": 0.00014657227828320635, | |
| "logits/chosen": -0.6784893274307251, | |
| "logits/rejected": -0.6818794012069702, | |
| "logps/chosen": -11.335710525512695, | |
| "logps/rejected": -35.59712219238281, | |
| "loss": 0.751977264881134, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4554847776889801, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10514962673187256, | |
| "rewards/margins": 2.4257240295410156, | |
| "rewards/rejected": -2.3205745220184326, | |
| "step": 469, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.3792138372708706, | |
| "grad_norm": 3.7496237754821777, | |
| "learning_rate": 0.0001463359111616103, | |
| "logits/chosen": -0.659194827079773, | |
| "logits/rejected": -0.6669769883155823, | |
| "logps/chosen": -14.53132438659668, | |
| "logps/rejected": -37.95043182373047, | |
| "loss": 0.8416832089424133, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.547598659992218, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08502380549907684, | |
| "rewards/margins": 2.0641098022460938, | |
| "rewards/rejected": -1.9790860414505005, | |
| "step": 470, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.38002067522251076, | |
| "grad_norm": 2.0352225303649902, | |
| "learning_rate": 0.0001460992139257661, | |
| "logits/chosen": -0.6402337551116943, | |
| "logits/rejected": -0.6429924964904785, | |
| "logps/chosen": -5.608386039733887, | |
| "logps/rejected": -33.254302978515625, | |
| "loss": 0.3905201256275177, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2183467447757721, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20369279384613037, | |
| "rewards/margins": 2.4486987590789795, | |
| "rewards/rejected": -2.2450060844421387, | |
| "step": 471, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.3808275131741509, | |
| "grad_norm": 5.74570894241333, | |
| "learning_rate": 0.00014586218826199285, | |
| "logits/chosen": -0.643539547920227, | |
| "logits/rejected": -0.6555419564247131, | |
| "logps/chosen": -10.091498374938965, | |
| "logps/rejected": -36.76713562011719, | |
| "loss": 0.6122481226921082, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4549962282180786, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24730682373046875, | |
| "rewards/margins": 2.464998722076416, | |
| "rewards/rejected": -2.2176918983459473, | |
| "step": 472, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.3816343511257911, | |
| "grad_norm": 2.2472074031829834, | |
| "learning_rate": 0.00014562483585894945, | |
| "logits/chosen": -0.6934607028961182, | |
| "logits/rejected": -0.6990819573402405, | |
| "logps/chosen": -8.899802207946777, | |
| "logps/rejected": -36.28021240234375, | |
| "loss": 0.5312250852584839, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31914129853248596, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.30887866020202637, | |
| "rewards/margins": 2.640252113342285, | |
| "rewards/rejected": -2.3313732147216797, | |
| "step": 473, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.38244118907743124, | |
| "grad_norm": 10.326676368713379, | |
| "learning_rate": 0.0001453871584076226, | |
| "logits/chosen": -0.6442930102348328, | |
| "logits/rejected": -0.6484919786453247, | |
| "logps/chosen": -9.037781715393066, | |
| "logps/rejected": -27.98940658569336, | |
| "loss": 0.7469712495803833, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4642283320426941, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17530076205730438, | |
| "rewards/margins": 1.7467072010040283, | |
| "rewards/rejected": -1.571406364440918, | |
| "step": 474, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.3832480270290714, | |
| "grad_norm": 9.987951278686523, | |
| "learning_rate": 0.00014514915760131483, | |
| "logits/chosen": -0.7020606994628906, | |
| "logits/rejected": -0.702151894569397, | |
| "logps/chosen": -9.714710235595703, | |
| "logps/rejected": -23.569639205932617, | |
| "loss": 0.7522432208061218, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40092915296554565, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1317347288131714, | |
| "rewards/margins": 1.5514979362487793, | |
| "rewards/rejected": -1.4197630882263184, | |
| "step": 475, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.3840548649807115, | |
| "grad_norm": 2.1257741451263428, | |
| "learning_rate": 0.00014491083513563222, | |
| "logits/chosen": -0.6923786401748657, | |
| "logits/rejected": -0.6987132430076599, | |
| "logps/chosen": -7.563580513000488, | |
| "logps/rejected": -29.709890365600586, | |
| "loss": 0.5339487195014954, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31400057673454285, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.370953232049942, | |
| "rewards/margins": 2.0969557762145996, | |
| "rewards/rejected": -1.7260024547576904, | |
| "step": 476, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.38486170293235167, | |
| "grad_norm": 3.4022998809814453, | |
| "learning_rate": 0.00014467219270847265, | |
| "logits/chosen": -0.6793309450149536, | |
| "logits/rejected": -0.6822490692138672, | |
| "logps/chosen": -8.713945388793945, | |
| "logps/rejected": -35.1626091003418, | |
| "loss": 0.5065045356750488, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2830030620098114, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1324760913848877, | |
| "rewards/margins": 2.0448875427246094, | |
| "rewards/rejected": -1.9124114513397217, | |
| "step": 477, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.38566854088399183, | |
| "grad_norm": 3.169051170349121, | |
| "learning_rate": 0.0001444332320200134, | |
| "logits/chosen": -0.7434568405151367, | |
| "logits/rejected": -0.7467195391654968, | |
| "logps/chosen": -8.970917701721191, | |
| "logps/rejected": -25.424684524536133, | |
| "loss": 0.7533260583877563, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3945104777812958, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08574176579713821, | |
| "rewards/margins": 1.5797266960144043, | |
| "rewards/rejected": -1.4939846992492676, | |
| "step": 478, | |
| "train_speed(iter/s)": 0.005435 | |
| }, | |
| { | |
| "epoch": 0.386475378835632, | |
| "grad_norm": 3.456509828567505, | |
| "learning_rate": 0.00014419395477269922, | |
| "logits/chosen": -0.7100328207015991, | |
| "logits/rejected": -0.7100369334220886, | |
| "logps/chosen": -8.946069717407227, | |
| "logps/rejected": -26.77371597290039, | |
| "loss": 0.703390896320343, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3992156982421875, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23448720574378967, | |
| "rewards/margins": 1.9379780292510986, | |
| "rewards/rejected": -1.7034906148910522, | |
| "step": 479, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.38728221678727215, | |
| "grad_norm": 2.8148579597473145, | |
| "learning_rate": 0.00014395436267123016, | |
| "logits/chosen": -0.7651592493057251, | |
| "logits/rejected": -0.7705404758453369, | |
| "logps/chosen": -9.789369583129883, | |
| "logps/rejected": -32.379886627197266, | |
| "loss": 0.6621928811073303, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.42258700728416443, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3690515160560608, | |
| "rewards/margins": 2.27026629447937, | |
| "rewards/rejected": -1.9012147188186646, | |
| "step": 480, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.3880890547389123, | |
| "grad_norm": 2.1083407402038574, | |
| "learning_rate": 0.00014371445742254933, | |
| "logits/chosen": -0.7674591541290283, | |
| "logits/rejected": -0.7766936421394348, | |
| "logps/chosen": -7.339907646179199, | |
| "logps/rejected": -41.22381591796875, | |
| "loss": 0.46437036991119385, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32933878898620605, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4231037497520447, | |
| "rewards/margins": 2.872163772583008, | |
| "rewards/rejected": -2.4490599632263184, | |
| "step": 481, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.3888958926905524, | |
| "grad_norm": 9.479911804199219, | |
| "learning_rate": 0.00014347424073583086, | |
| "logits/chosen": -0.7989487648010254, | |
| "logits/rejected": -0.8022449016571045, | |
| "logps/chosen": -6.2405619621276855, | |
| "logps/rejected": -35.935890197753906, | |
| "loss": 0.4960899353027344, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32181254029273987, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3059425950050354, | |
| "rewards/margins": 2.816394805908203, | |
| "rewards/rejected": -2.5104520320892334, | |
| "step": 482, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.3897027306421926, | |
| "grad_norm": 30.05691909790039, | |
| "learning_rate": 0.00014323371432246773, | |
| "logits/chosen": -0.7825378775596619, | |
| "logits/rejected": -0.7933679819107056, | |
| "logps/chosen": -7.802068710327148, | |
| "logps/rejected": -29.27901840209961, | |
| "loss": 0.8247991800308228, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.445316344499588, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.19992296397686005, | |
| "rewards/margins": 1.4237523078918457, | |
| "rewards/rejected": -1.2238292694091797, | |
| "step": 483, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.39050956859383273, | |
| "grad_norm": 3.872990131378174, | |
| "learning_rate": 0.00014299287989605943, | |
| "logits/chosen": -0.7813780903816223, | |
| "logits/rejected": -0.7811882495880127, | |
| "logps/chosen": -9.697345733642578, | |
| "logps/rejected": -30.960369110107422, | |
| "loss": 0.5493797063827515, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3628386855125427, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.29603177309036255, | |
| "rewards/margins": 2.3790576457977295, | |
| "rewards/rejected": -2.0830256938934326, | |
| "step": 484, | |
| "train_speed(iter/s)": 0.005436 | |
| }, | |
| { | |
| "epoch": 0.3913164065454729, | |
| "grad_norm": 12.008702278137207, | |
| "learning_rate": 0.00014275173917239993, | |
| "logits/chosen": -0.7886897325515747, | |
| "logits/rejected": -0.7941228747367859, | |
| "logps/chosen": -7.900599002838135, | |
| "logps/rejected": -31.16321563720703, | |
| "loss": 0.7939125895500183, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45570316910743713, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10572385787963867, | |
| "rewards/margins": 1.8910467624664307, | |
| "rewards/rejected": -1.785322904586792, | |
| "step": 485, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.39212324449711305, | |
| "grad_norm": 5.970835208892822, | |
| "learning_rate": 0.00014251029386946532, | |
| "logits/chosen": -0.8634493350982666, | |
| "logits/rejected": -0.8646601438522339, | |
| "logps/chosen": -6.923543453216553, | |
| "logps/rejected": -28.410593032836914, | |
| "loss": 0.5631651282310486, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31717023253440857, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24359825253486633, | |
| "rewards/margins": 2.0541610717773438, | |
| "rewards/rejected": -1.8105626106262207, | |
| "step": 486, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.39293008244875316, | |
| "grad_norm": 2.754620313644409, | |
| "learning_rate": 0.00014226854570740168, | |
| "logits/chosen": -0.8398474454879761, | |
| "logits/rejected": -0.8498659133911133, | |
| "logps/chosen": -7.03415584564209, | |
| "logps/rejected": -40.334163665771484, | |
| "loss": 0.4721854329109192, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34017014503479004, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.16663886606693268, | |
| "rewards/margins": 2.977405309677124, | |
| "rewards/rejected": -2.8107664585113525, | |
| "step": 487, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.3937369204003933, | |
| "grad_norm": 2.9349205493927, | |
| "learning_rate": 0.00014202649640851275, | |
| "logits/chosen": -0.8891080617904663, | |
| "logits/rejected": -0.8925038576126099, | |
| "logps/chosen": -5.047273635864258, | |
| "logps/rejected": -34.245174407958984, | |
| "loss": 0.3938831090927124, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.21636192500591278, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2093987911939621, | |
| "rewards/margins": 2.6690750122070312, | |
| "rewards/rejected": -2.4596762657165527, | |
| "step": 488, | |
| "train_speed(iter/s)": 0.005437 | |
| }, | |
| { | |
| "epoch": 0.3945437583520335, | |
| "grad_norm": 6.7003173828125, | |
| "learning_rate": 0.00014178414769724766, | |
| "logits/chosen": -0.8764248490333557, | |
| "logits/rejected": -0.876374363899231, | |
| "logps/chosen": -8.440370559692383, | |
| "logps/rejected": -35.263214111328125, | |
| "loss": 0.5095587968826294, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34542787075042725, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19051702320575714, | |
| "rewards/margins": 2.7904720306396484, | |
| "rewards/rejected": -2.5999550819396973, | |
| "step": 489, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.39535059630367364, | |
| "grad_norm": 3.259153366088867, | |
| "learning_rate": 0.00014154150130018866, | |
| "logits/chosen": -0.9377500414848328, | |
| "logits/rejected": -0.9458149671554565, | |
| "logps/chosen": -11.506027221679688, | |
| "logps/rejected": -35.232669830322266, | |
| "loss": 0.6641853451728821, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46648576855659485, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3142199218273163, | |
| "rewards/margins": 2.9259414672851562, | |
| "rewards/rejected": -2.6117210388183594, | |
| "step": 490, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.3961574342553138, | |
| "grad_norm": 2.46926212310791, | |
| "learning_rate": 0.00014129855894603886, | |
| "logits/chosen": -0.9563973546028137, | |
| "logits/rejected": -0.9663281440734863, | |
| "logps/chosen": -8.163786888122559, | |
| "logps/rejected": -45.545860290527344, | |
| "loss": 0.462195485830307, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34487971663475037, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1903153955936432, | |
| "rewards/margins": 3.344923257827759, | |
| "rewards/rejected": -3.1546080112457275, | |
| "step": 491, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.39696427220695396, | |
| "grad_norm": 11.747800827026367, | |
| "learning_rate": 0.00014105532236560983, | |
| "logits/chosen": -0.9172489047050476, | |
| "logits/rejected": -0.9255672693252563, | |
| "logps/chosen": -8.56010627746582, | |
| "logps/rejected": -44.462188720703125, | |
| "loss": 0.5068323612213135, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3179493546485901, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13865207135677338, | |
| "rewards/margins": 2.8126437664031982, | |
| "rewards/rejected": -2.6739919185638428, | |
| "step": 492, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.39777111015859407, | |
| "grad_norm": 5.142593860626221, | |
| "learning_rate": 0.00014081179329180943, | |
| "logits/chosen": -0.9059480428695679, | |
| "logits/rejected": -0.9175886511802673, | |
| "logps/chosen": -5.26338529586792, | |
| "logps/rejected": -45.20058822631836, | |
| "loss": 0.40461504459381104, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.20817551016807556, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.24090781807899475, | |
| "rewards/margins": 3.5246479511260986, | |
| "rewards/rejected": -3.283740282058716, | |
| "step": 493, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.3985779481102342, | |
| "grad_norm": 13.850090980529785, | |
| "learning_rate": 0.00014056797345962915, | |
| "logits/chosen": -0.97746741771698, | |
| "logits/rejected": -0.9824937582015991, | |
| "logps/chosen": -8.306085586547852, | |
| "logps/rejected": -45.58984375, | |
| "loss": 0.7906121015548706, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5601307153701782, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0417952798306942, | |
| "rewards/margins": 3.4094972610473633, | |
| "rewards/rejected": -3.3677022457122803, | |
| "step": 494, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.3993847860618744, | |
| "grad_norm": 2.4637293815612793, | |
| "learning_rate": 0.0001403238646061322, | |
| "logits/chosen": -0.9754372835159302, | |
| "logits/rejected": -0.9848412275314331, | |
| "logps/chosen": -7.990797996520996, | |
| "logps/rejected": -48.4688720703125, | |
| "loss": 0.4341033101081848, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.308696985244751, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27976250648498535, | |
| "rewards/margins": 3.742406129837036, | |
| "rewards/rejected": -3.462643623352051, | |
| "step": 495, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.40019162401351455, | |
| "grad_norm": 3.6680634021759033, | |
| "learning_rate": 0.00014007946847044065, | |
| "logits/chosen": -0.951252818107605, | |
| "logits/rejected": -0.9680181741714478, | |
| "logps/chosen": -4.847614765167236, | |
| "logps/rejected": -46.7112922668457, | |
| "loss": 0.383756160736084, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.24948665499687195, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17591829597949982, | |
| "rewards/margins": 3.246157646179199, | |
| "rewards/rejected": -3.070239305496216, | |
| "step": 496, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.4009984619651547, | |
| "grad_norm": 3.807244062423706, | |
| "learning_rate": 0.00013983478679372344, | |
| "logits/chosen": -0.9732386469841003, | |
| "logits/rejected": -0.9831098318099976, | |
| "logps/chosen": -7.762671947479248, | |
| "logps/rejected": -52.341617584228516, | |
| "loss": 0.43133464455604553, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2912958860397339, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1585668921470642, | |
| "rewards/margins": 3.8791747093200684, | |
| "rewards/rejected": -3.7206082344055176, | |
| "step": 497, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.4018052999167948, | |
| "grad_norm": 14.390305519104004, | |
| "learning_rate": 0.00013958982131918372, | |
| "logits/chosen": -0.9233254194259644, | |
| "logits/rejected": -0.926517128944397, | |
| "logps/chosen": -11.224777221679688, | |
| "logps/rejected": -33.05560302734375, | |
| "loss": 0.8548044562339783, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4569489359855652, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0009491965174674988, | |
| "rewards/margins": 2.3791630268096924, | |
| "rewards/rejected": -2.378213882446289, | |
| "step": 498, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.40261213786843497, | |
| "grad_norm": 7.265214443206787, | |
| "learning_rate": 0.00013934457379204658, | |
| "logits/chosen": -0.9037230014801025, | |
| "logits/rejected": -0.9072719216346741, | |
| "logps/chosen": -13.305590629577637, | |
| "logps/rejected": -42.6323127746582, | |
| "loss": 0.5567822456359863, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4082874059677124, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3724799156188965, | |
| "rewards/margins": 3.5428996086120605, | |
| "rewards/rejected": -3.1704201698303223, | |
| "step": 499, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.40341897582007513, | |
| "grad_norm": 2.8691728115081787, | |
| "learning_rate": 0.0001390990459595465, | |
| "logits/chosen": -0.9267888069152832, | |
| "logits/rejected": -0.936477780342102, | |
| "logps/chosen": -9.545984268188477, | |
| "logps/rejected": -42.449127197265625, | |
| "loss": 0.7537754774093628, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5160152912139893, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12287023663520813, | |
| "rewards/margins": 3.151482105255127, | |
| "rewards/rejected": -3.0286121368408203, | |
| "step": 500, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4042258137717153, | |
| "grad_norm": 17.34552764892578, | |
| "learning_rate": 0.00013885323957091503, | |
| "logits/chosen": -0.8896504640579224, | |
| "logits/rejected": -0.8915640115737915, | |
| "logps/chosen": -9.813822746276855, | |
| "logps/rejected": -36.02322769165039, | |
| "loss": 1.0269454717636108, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6156859397888184, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.17760202288627625, | |
| "rewards/margins": 2.4105653762817383, | |
| "rewards/rejected": -2.588167667388916, | |
| "step": 501, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.40503265172335545, | |
| "grad_norm": 2.611849069595337, | |
| "learning_rate": 0.00013860715637736818, | |
| "logits/chosen": -0.8846621513366699, | |
| "logits/rejected": -0.8913875222206116, | |
| "logps/chosen": -7.3572540283203125, | |
| "logps/rejected": -43.120914459228516, | |
| "loss": 0.5870882868766785, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.45941975712776184, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24965612590312958, | |
| "rewards/margins": 3.1028006076812744, | |
| "rewards/rejected": -2.8531441688537598, | |
| "step": 502, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.4058394896749956, | |
| "grad_norm": 9.19338607788086, | |
| "learning_rate": 0.00013836079813209405, | |
| "logits/chosen": -0.8596163988113403, | |
| "logits/rejected": -0.8734834790229797, | |
| "logps/chosen": -6.4730024337768555, | |
| "logps/rejected": -48.3375358581543, | |
| "loss": 0.5926974415779114, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40696945786476135, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13774055242538452, | |
| "rewards/margins": 3.3298587799072266, | |
| "rewards/rejected": -3.1921184062957764, | |
| "step": 503, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.4066463276266357, | |
| "grad_norm": 2.5772955417633057, | |
| "learning_rate": 0.00013811416659024035, | |
| "logits/chosen": -0.8637710809707642, | |
| "logits/rejected": -0.869887113571167, | |
| "logps/chosen": -8.725384712219238, | |
| "logps/rejected": -44.57448959350586, | |
| "loss": 0.5925300717353821, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.48120686411857605, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12150951474905014, | |
| "rewards/margins": 3.436396598815918, | |
| "rewards/rejected": -3.314887046813965, | |
| "step": 504, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.4074531655782759, | |
| "grad_norm": 4.892908096313477, | |
| "learning_rate": 0.00013786726350890183, | |
| "logits/chosen": -0.874576210975647, | |
| "logits/rejected": -0.8784814476966858, | |
| "logps/chosen": -9.178255081176758, | |
| "logps/rejected": -38.52834701538086, | |
| "loss": 0.6706528067588806, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.49778318405151367, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21889682114124298, | |
| "rewards/margins": 3.011408805847168, | |
| "rewards/rejected": -2.7925119400024414, | |
| "step": 505, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.40826000352991604, | |
| "grad_norm": 2.44610333442688, | |
| "learning_rate": 0.00013762009064710774, | |
| "logits/chosen": -0.8441749811172485, | |
| "logits/rejected": -0.8464869260787964, | |
| "logps/chosen": -7.5994648933410645, | |
| "logps/rejected": -34.768951416015625, | |
| "loss": 0.5083529353141785, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3053922653198242, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.30249646306037903, | |
| "rewards/margins": 2.588782787322998, | |
| "rewards/rejected": -2.2862861156463623, | |
| "step": 506, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4090668414815562, | |
| "grad_norm": 6.779381275177002, | |
| "learning_rate": 0.00013737264976580943, | |
| "logits/chosen": -0.8816607594490051, | |
| "logits/rejected": -0.8868498206138611, | |
| "logps/chosen": -11.123010635375977, | |
| "logps/rejected": -37.859195709228516, | |
| "loss": 0.8256106376647949, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40417546033859253, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.1513340175151825, | |
| "rewards/margins": 2.473325252532959, | |
| "rewards/rejected": -2.624659299850464, | |
| "step": 507, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.40987367943319636, | |
| "grad_norm": 3.7313573360443115, | |
| "learning_rate": 0.00013712494262786766, | |
| "logits/chosen": -0.8750671148300171, | |
| "logits/rejected": -0.8821631669998169, | |
| "logps/chosen": -10.883421897888184, | |
| "logps/rejected": -42.575679779052734, | |
| "loss": 0.748051643371582, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5597954988479614, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19764858484268188, | |
| "rewards/margins": 3.004587173461914, | |
| "rewards/rejected": -2.806938409805298, | |
| "step": 508, | |
| "train_speed(iter/s)": 0.005438 | |
| }, | |
| { | |
| "epoch": 0.41068051738483646, | |
| "grad_norm": 2.834299087524414, | |
| "learning_rate": 0.0001368769709980401, | |
| "logits/chosen": -0.862756073474884, | |
| "logits/rejected": -0.8707681894302368, | |
| "logps/chosen": -8.581947326660156, | |
| "logps/rejected": -42.503753662109375, | |
| "loss": 0.3937508761882782, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.23043422400951385, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2632564604282379, | |
| "rewards/margins": 2.976945400238037, | |
| "rewards/rejected": -2.713688850402832, | |
| "step": 509, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4114873553364766, | |
| "grad_norm": 2.886272668838501, | |
| "learning_rate": 0.00013662873664296884, | |
| "logits/chosen": -0.819119930267334, | |
| "logits/rejected": -0.826356053352356, | |
| "logps/chosen": -8.14879035949707, | |
| "logps/rejected": -42.62828826904297, | |
| "loss": 0.5604068636894226, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31821465492248535, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3842453360557556, | |
| "rewards/margins": 3.0441181659698486, | |
| "rewards/rejected": -2.6598730087280273, | |
| "step": 510, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4122941932881168, | |
| "grad_norm": 3.3949501514434814, | |
| "learning_rate": 0.00013638024133116763, | |
| "logits/chosen": -0.802520215511322, | |
| "logits/rejected": -0.8098280429840088, | |
| "logps/chosen": -12.40538215637207, | |
| "logps/rejected": -38.84916305541992, | |
| "loss": 0.8826647400856018, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5703054666519165, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.012079771608114243, | |
| "rewards/margins": 2.588003396987915, | |
| "rewards/rejected": -2.575923442840576, | |
| "step": 511, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.41310103123975694, | |
| "grad_norm": 6.568037509918213, | |
| "learning_rate": 0.00013613148683300937, | |
| "logits/chosen": -0.8070806860923767, | |
| "logits/rejected": -0.813240647315979, | |
| "logps/chosen": -9.467267990112305, | |
| "logps/rejected": -39.797325134277344, | |
| "loss": 0.5164275765419006, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.39448225498199463, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28209254145622253, | |
| "rewards/margins": 2.9220352172851562, | |
| "rewards/rejected": -2.6399426460266113, | |
| "step": 512, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.4139078691913971, | |
| "grad_norm": 10.136809349060059, | |
| "learning_rate": 0.0001358824749207136, | |
| "logits/chosen": -0.8575885891914368, | |
| "logits/rejected": -0.8593306541442871, | |
| "logps/chosen": -10.6421480178833, | |
| "logps/rejected": -39.468055725097656, | |
| "loss": 0.7010791301727295, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5033397674560547, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.156565859913826, | |
| "rewards/margins": 2.7266011238098145, | |
| "rewards/rejected": -2.570035219192505, | |
| "step": 513, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.41471470714303726, | |
| "grad_norm": 3.576723098754883, | |
| "learning_rate": 0.00013563320736833365, | |
| "logits/chosen": -0.8105019330978394, | |
| "logits/rejected": -0.8146560788154602, | |
| "logps/chosen": -10.574302673339844, | |
| "logps/rejected": -36.661590576171875, | |
| "loss": 0.665181040763855, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4042365849018097, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13927578926086426, | |
| "rewards/margins": 2.6975083351135254, | |
| "rewards/rejected": -2.558232545852661, | |
| "step": 514, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.41552154509467737, | |
| "grad_norm": 2.363494396209717, | |
| "learning_rate": 0.00013538368595174423, | |
| "logits/chosen": -0.8046780228614807, | |
| "logits/rejected": -0.8101540803909302, | |
| "logps/chosen": -12.763677597045898, | |
| "logps/rejected": -39.75190353393555, | |
| "loss": 0.5567308664321899, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4450889527797699, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.285984069108963, | |
| "rewards/margins": 3.129922389984131, | |
| "rewards/rejected": -2.843937873840332, | |
| "step": 515, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.41632838304631753, | |
| "grad_norm": 2.798708438873291, | |
| "learning_rate": 0.0001351339124486286, | |
| "logits/chosen": -0.823294460773468, | |
| "logits/rejected": -0.8240728974342346, | |
| "logps/chosen": -8.804251670837402, | |
| "logps/rejected": -36.77720260620117, | |
| "loss": 0.5373676419258118, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.35823625326156616, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25987887382507324, | |
| "rewards/margins": 2.7686750888824463, | |
| "rewards/rejected": -2.508796453475952, | |
| "step": 516, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4171352209979577, | |
| "grad_norm": 3.738819122314453, | |
| "learning_rate": 0.00013488388863846598, | |
| "logits/chosen": -0.8327402472496033, | |
| "logits/rejected": -0.8359934091567993, | |
| "logps/chosen": -12.034650802612305, | |
| "logps/rejected": -33.55274200439453, | |
| "loss": 0.7193576097488403, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.506946325302124, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.16285476088523865, | |
| "rewards/margins": 2.3808743953704834, | |
| "rewards/rejected": -2.218019485473633, | |
| "step": 517, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.41794205894959785, | |
| "grad_norm": 2.734147071838379, | |
| "learning_rate": 0.00013463361630251897, | |
| "logits/chosen": -0.8137484788894653, | |
| "logits/rejected": -0.8196120858192444, | |
| "logps/chosen": -16.61955451965332, | |
| "logps/rejected": -33.3659553527832, | |
| "loss": 0.8027633428573608, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5399143099784851, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.31846553087234497, | |
| "rewards/margins": 2.49395751953125, | |
| "rewards/rejected": -2.1754918098449707, | |
| "step": 518, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.418748896901238, | |
| "grad_norm": 1.6672159433364868, | |
| "learning_rate": 0.00013438309722382056, | |
| "logits/chosen": -0.8162409663200378, | |
| "logits/rejected": -0.8220106959342957, | |
| "logps/chosen": -8.6817045211792, | |
| "logps/rejected": -37.332298278808594, | |
| "loss": 0.4413672685623169, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2940937876701355, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28105995059013367, | |
| "rewards/margins": 2.7084476947784424, | |
| "rewards/rejected": -2.4273879528045654, | |
| "step": 519, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4195557348528781, | |
| "grad_norm": 2.7764697074890137, | |
| "learning_rate": 0.00013413233318716188, | |
| "logits/chosen": -0.8464371562004089, | |
| "logits/rejected": -0.8485240936279297, | |
| "logps/chosen": -10.62841796875, | |
| "logps/rejected": -36.70519256591797, | |
| "loss": 0.7128565907478333, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.46534037590026855, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22482553124427795, | |
| "rewards/margins": 2.6670079231262207, | |
| "rewards/rejected": -2.4421825408935547, | |
| "step": 520, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4203625728045183, | |
| "grad_norm": 4.593116760253906, | |
| "learning_rate": 0.00013388132597907904, | |
| "logits/chosen": -0.8110215663909912, | |
| "logits/rejected": -0.8151426315307617, | |
| "logps/chosen": -10.328957557678223, | |
| "logps/rejected": -38.320430755615234, | |
| "loss": 0.6786235570907593, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.339311420917511, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1592826545238495, | |
| "rewards/margins": 2.4331724643707275, | |
| "rewards/rejected": -2.2738895416259766, | |
| "step": 521, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.42116941075615844, | |
| "grad_norm": 4.485230445861816, | |
| "learning_rate": 0.0001336300773878407, | |
| "logits/chosen": -0.8129779696464539, | |
| "logits/rejected": -0.8200620412826538, | |
| "logps/chosen": -7.188672065734863, | |
| "logps/rejected": -38.45001220703125, | |
| "loss": 0.6729139089584351, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4256826639175415, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.16748948395252228, | |
| "rewards/margins": 2.9809718132019043, | |
| "rewards/rejected": -2.8134822845458984, | |
| "step": 522, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4219762487077986, | |
| "grad_norm": 3.1994502544403076, | |
| "learning_rate": 0.00013337858920343512, | |
| "logits/chosen": -0.8458603024482727, | |
| "logits/rejected": -0.852841854095459, | |
| "logps/chosen": -8.571792602539062, | |
| "logps/rejected": -42.51072692871094, | |
| "loss": 0.4996880292892456, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2992246150970459, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23098604381084442, | |
| "rewards/margins": 3.1265108585357666, | |
| "rewards/rejected": -2.895524740219116, | |
| "step": 523, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.42278308665943876, | |
| "grad_norm": 3.704655170440674, | |
| "learning_rate": 0.00013312686321755761, | |
| "logits/chosen": -0.8289926648139954, | |
| "logits/rejected": -0.8301224708557129, | |
| "logps/chosen": -7.220808029174805, | |
| "logps/rejected": -33.644962310791016, | |
| "loss": 0.4415580928325653, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2433617264032364, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19586443901062012, | |
| "rewards/margins": 2.462473154067993, | |
| "rewards/rejected": -2.266608238220215, | |
| "step": 524, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4235899246110789, | |
| "grad_norm": 14.6280517578125, | |
| "learning_rate": 0.0001328749012235976, | |
| "logits/chosen": -0.8482613563537598, | |
| "logits/rejected": -0.858103334903717, | |
| "logps/chosen": -6.205442905426025, | |
| "logps/rejected": -37.40229797363281, | |
| "loss": 0.7436372637748718, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4056238830089569, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.02807258814573288, | |
| "rewards/margins": 2.8922817707061768, | |
| "rewards/rejected": -2.9203548431396484, | |
| "step": 525, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.424396762562719, | |
| "grad_norm": 10.639749526977539, | |
| "learning_rate": 0.000132622705016626, | |
| "logits/chosen": -0.8543103337287903, | |
| "logits/rejected": -0.8550821542739868, | |
| "logps/chosen": -8.963075637817383, | |
| "logps/rejected": -44.753875732421875, | |
| "loss": 0.5276005864143372, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3191993534564972, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.08133304864168167, | |
| "rewards/margins": 2.828303098678589, | |
| "rewards/rejected": -2.9096360206604004, | |
| "step": 526, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4252036005143592, | |
| "grad_norm": 5.606629848480225, | |
| "learning_rate": 0.00013237027639338223, | |
| "logits/chosen": -0.7930728197097778, | |
| "logits/rejected": -0.8049328327178955, | |
| "logps/chosen": -11.980341911315918, | |
| "logps/rejected": -42.134681701660156, | |
| "loss": 0.8973350524902344, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6916304230690002, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2415471076965332, | |
| "rewards/margins": 2.853031635284424, | |
| "rewards/rejected": -2.6114845275878906, | |
| "step": 527, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.42601043846599934, | |
| "grad_norm": 3.3900585174560547, | |
| "learning_rate": 0.0001321176171522617, | |
| "logits/chosen": -0.8453109264373779, | |
| "logits/rejected": -0.8487651348114014, | |
| "logps/chosen": -10.572664260864258, | |
| "logps/rejected": -33.60906982421875, | |
| "loss": 0.5498627424240112, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4081331193447113, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28006234765052795, | |
| "rewards/margins": 2.9145495891571045, | |
| "rewards/rejected": -2.6344871520996094, | |
| "step": 528, | |
| "train_speed(iter/s)": 0.005439 | |
| }, | |
| { | |
| "epoch": 0.4268172764176395, | |
| "grad_norm": 5.930169582366943, | |
| "learning_rate": 0.00013186472909330264, | |
| "logits/chosen": -0.8630443215370178, | |
| "logits/rejected": -0.8701946139335632, | |
| "logps/chosen": -7.021512985229492, | |
| "logps/rejected": -36.796783447265625, | |
| "loss": 0.7053890824317932, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4606189727783203, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2262631058692932, | |
| "rewards/margins": 2.8637092113494873, | |
| "rewards/rejected": -2.637446403503418, | |
| "step": 529, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.42762411436927966, | |
| "grad_norm": 6.3762688636779785, | |
| "learning_rate": 0.00013161161401817353, | |
| "logits/chosen": -0.8374471068382263, | |
| "logits/rejected": -0.8438255786895752, | |
| "logps/chosen": -9.851973533630371, | |
| "logps/rejected": -39.308502197265625, | |
| "loss": 0.5261674523353577, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.33455437421798706, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.15020446479320526, | |
| "rewards/margins": 2.7218151092529297, | |
| "rewards/rejected": -2.571610689163208, | |
| "step": 530, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.4284309523209198, | |
| "grad_norm": 6.240972995758057, | |
| "learning_rate": 0.00013135827373016027, | |
| "logits/chosen": -0.8955954313278198, | |
| "logits/rejected": -0.9030234813690186, | |
| "logps/chosen": -11.273481369018555, | |
| "logps/rejected": -34.91842269897461, | |
| "loss": 0.7530210614204407, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.5049380660057068, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.19476205110549927, | |
| "rewards/margins": 2.6257526874542236, | |
| "rewards/rejected": -2.430990695953369, | |
| "step": 531, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.4292377902725599, | |
| "grad_norm": 3.5795764923095703, | |
| "learning_rate": 0.00013110471003415321, | |
| "logits/chosen": -0.8652918338775635, | |
| "logits/rejected": -0.8691776990890503, | |
| "logps/chosen": -8.708220481872559, | |
| "logps/rejected": -40.791812896728516, | |
| "loss": 0.5590424537658691, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.29747384786605835, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06008954346179962, | |
| "rewards/margins": 2.697359085083008, | |
| "rewards/rejected": -2.6372694969177246, | |
| "step": 532, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.4300446282242001, | |
| "grad_norm": 3.8843157291412354, | |
| "learning_rate": 0.0001308509247366343, | |
| "logits/chosen": -0.7854755520820618, | |
| "logits/rejected": -0.792789101600647, | |
| "logps/chosen": -7.507791519165039, | |
| "logps/rejected": -49.7330322265625, | |
| "loss": 0.4467013478279114, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27506744861602783, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24458295106887817, | |
| "rewards/margins": 3.935803174972534, | |
| "rewards/rejected": -3.691220283508301, | |
| "step": 533, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.43085146617584025, | |
| "grad_norm": 3.57249116897583, | |
| "learning_rate": 0.00013059691964566433, | |
| "logits/chosen": -0.8396457433700562, | |
| "logits/rejected": -0.8505795001983643, | |
| "logps/chosen": -8.021794319152832, | |
| "logps/rejected": -43.013790130615234, | |
| "loss": 0.6681239604949951, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.40499186515808105, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14213377237319946, | |
| "rewards/margins": 3.0652308464050293, | |
| "rewards/rejected": -2.9230968952178955, | |
| "step": 534, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.4316583041274804, | |
| "grad_norm": 5.327953338623047, | |
| "learning_rate": 0.00013034269657086992, | |
| "logits/chosen": -0.8565971255302429, | |
| "logits/rejected": -0.8621482253074646, | |
| "logps/chosen": -7.855462551116943, | |
| "logps/rejected": -44.381805419921875, | |
| "loss": 0.4837571680545807, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.32484912872314453, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.4074184000492096, | |
| "rewards/margins": 3.6497139930725098, | |
| "rewards/rejected": -3.242295265197754, | |
| "step": 535, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.43246514207912057, | |
| "grad_norm": 4.380790710449219, | |
| "learning_rate": 0.00013008825732343073, | |
| "logits/chosen": -0.8305094838142395, | |
| "logits/rejected": -0.8384683132171631, | |
| "logps/chosen": -5.753545761108398, | |
| "logps/rejected": -40.71387481689453, | |
| "loss": 0.48914748430252075, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.27660253643989563, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2127423733472824, | |
| "rewards/margins": 2.9575328826904297, | |
| "rewards/rejected": -2.744790554046631, | |
| "step": 536, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.4332719800307607, | |
| "grad_norm": 2.478238344192505, | |
| "learning_rate": 0.0001298336037160665, | |
| "logits/chosen": -0.8390322327613831, | |
| "logits/rejected": -0.8421530723571777, | |
| "logps/chosen": -9.2628173828125, | |
| "logps/rejected": -33.14223861694336, | |
| "loss": 0.6333991289138794, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.385562539100647, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2185012400150299, | |
| "rewards/margins": 2.4338998794555664, | |
| "rewards/rejected": -2.2153985500335693, | |
| "step": 537, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.43407881798240083, | |
| "grad_norm": 4.371514320373535, | |
| "learning_rate": 0.00012957873756302415, | |
| "logits/chosen": -0.7974674701690674, | |
| "logits/rejected": -0.7956443428993225, | |
| "logps/chosen": -11.487338066101074, | |
| "logps/rejected": -37.02048110961914, | |
| "loss": 0.6238091588020325, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4722408056259155, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2411145120859146, | |
| "rewards/margins": 2.765226125717163, | |
| "rewards/rejected": -2.52411150932312, | |
| "step": 538, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.434885655934041, | |
| "grad_norm": 2.3261210918426514, | |
| "learning_rate": 0.00012932366068006486, | |
| "logits/chosen": -0.8332119584083557, | |
| "logits/rejected": -0.8431892395019531, | |
| "logps/chosen": -5.291442394256592, | |
| "logps/rejected": -40.494781494140625, | |
| "loss": 0.35455459356307983, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2400093972682953, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3891444504261017, | |
| "rewards/margins": 3.3702661991119385, | |
| "rewards/rejected": -2.981121778488159, | |
| "step": 539, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.43569249388568115, | |
| "grad_norm": 3.177072763442993, | |
| "learning_rate": 0.00012906837488445115, | |
| "logits/chosen": -0.8743947744369507, | |
| "logits/rejected": -0.8769956827163696, | |
| "logps/chosen": -9.416547775268555, | |
| "logps/rejected": -38.16511917114258, | |
| "loss": 0.5091468095779419, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.34846216440200806, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2577158510684967, | |
| "rewards/margins": 2.8782832622528076, | |
| "rewards/rejected": -2.620567560195923, | |
| "step": 540, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.4364993318373213, | |
| "grad_norm": 2.1750667095184326, | |
| "learning_rate": 0.00012881288199493378, | |
| "logits/chosen": -0.8983636498451233, | |
| "logits/rejected": -0.9017794132232666, | |
| "logps/chosen": -5.9792609214782715, | |
| "logps/rejected": -39.93588638305664, | |
| "loss": 0.42438769340515137, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2854105830192566, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.38626906275749207, | |
| "rewards/margins": 3.287107467651367, | |
| "rewards/rejected": -2.9008383750915527, | |
| "step": 541, | |
| "train_speed(iter/s)": 0.005441 | |
| }, | |
| { | |
| "epoch": 0.4373061697889615, | |
| "grad_norm": 4.120799541473389, | |
| "learning_rate": 0.00012855718383173915, | |
| "logits/chosen": -0.8792024254798889, | |
| "logits/rejected": -0.8899410367012024, | |
| "logps/chosen": -8.377023696899414, | |
| "logps/rejected": -31.686115264892578, | |
| "loss": 0.6103077530860901, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3152506947517395, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3780965507030487, | |
| "rewards/margins": 2.42580246925354, | |
| "rewards/rejected": -2.047706127166748, | |
| "step": 542, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.4381130077406016, | |
| "grad_norm": 2.2526559829711914, | |
| "learning_rate": 0.0001283012822165559, | |
| "logits/chosen": -0.9368709921836853, | |
| "logits/rejected": -0.9483405947685242, | |
| "logps/chosen": -6.628868103027344, | |
| "logps/rejected": -39.02850341796875, | |
| "loss": 0.38257747888565063, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.24682456254959106, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.35517507791519165, | |
| "rewards/margins": 2.6254923343658447, | |
| "rewards/rejected": -2.270317554473877, | |
| "step": 543, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.43891984569224174, | |
| "grad_norm": 2.8567118644714355, | |
| "learning_rate": 0.00012804517897252227, | |
| "logits/chosen": -0.9481716156005859, | |
| "logits/rejected": -0.9497692584991455, | |
| "logps/chosen": -7.450263977050781, | |
| "logps/rejected": -31.115060806274414, | |
| "loss": 0.47185516357421875, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.3170330822467804, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.31209883093833923, | |
| "rewards/margins": 2.585287570953369, | |
| "rewards/rejected": -2.273188591003418, | |
| "step": 544, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.4397266836438819, | |
| "grad_norm": 3.762911319732666, | |
| "learning_rate": 0.00012778887592421293, | |
| "logits/chosen": -0.9280496835708618, | |
| "logits/rejected": -0.9334405660629272, | |
| "logps/chosen": -8.896903991699219, | |
| "logps/rejected": -45.50485610961914, | |
| "loss": 0.4354952573776245, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.2929496467113495, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3440062999725342, | |
| "rewards/margins": 3.7558441162109375, | |
| "rewards/rejected": -3.4118378162384033, | |
| "step": 545, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.44053352159552206, | |
| "grad_norm": 5.700692176818848, | |
| "learning_rate": 0.000127532374897626, | |
| "logits/chosen": -1.0263915061950684, | |
| "logits/rejected": -1.0273609161376953, | |
| "logps/chosen": -8.307823181152344, | |
| "logps/rejected": -36.91926574707031, | |
| "loss": 0.7563344836235046, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.43058276176452637, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.014373952522873878, | |
| "rewards/margins": 2.57063889503479, | |
| "rewards/rejected": -2.585012912750244, | |
| "step": 546, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.4413403595471622, | |
| "grad_norm": 3.6434919834136963, | |
| "learning_rate": 0.0001272756777201701, | |
| "logits/chosen": -0.9778340458869934, | |
| "logits/rejected": -0.9919235110282898, | |
| "logps/chosen": -6.4957427978515625, | |
| "logps/rejected": -48.30223083496094, | |
| "loss": 0.48351603746414185, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.31254929304122925, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2537922263145447, | |
| "rewards/margins": 3.731672525405884, | |
| "rewards/rejected": -3.4778804779052734, | |
| "step": 547, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.4421471974988023, | |
| "grad_norm": 15.765288352966309, | |
| "learning_rate": 0.00012701878622065136, | |
| "logits/chosen": -1.0241070985794067, | |
| "logits/rejected": -1.036070466041565, | |
| "logps/chosen": -8.980073928833008, | |
| "logps/rejected": -42.19818878173828, | |
| "loss": 0.648382842540741, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.4570547342300415, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3133217394351959, | |
| "rewards/margins": 2.865694999694824, | |
| "rewards/rejected": -2.5523734092712402, | |
| "step": 548, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.4429540354504425, | |
| "grad_norm": 7.8712992668151855, | |
| "learning_rate": 0.00012676170222926023, | |
| "logits/chosen": -1.0750609636306763, | |
| "logits/rejected": -1.08124840259552, | |
| "logps/chosen": -8.864872932434082, | |
| "logps/rejected": -44.60932540893555, | |
| "loss": 1.103929042816162, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.7646006345748901, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1929735392332077, | |
| "rewards/margins": 3.46407413482666, | |
| "rewards/rejected": -3.2711007595062256, | |
| "step": 549, | |
| "train_speed(iter/s)": 0.005442 | |
| }, | |
| { | |
| "epoch": 0.44376087340208265, | |
| "grad_norm": 10.148578643798828, | |
| "learning_rate": 0.00012650442757755859, | |
| "logits/chosen": -1.0684211254119873, | |
| "logits/rejected": -1.0741227865219116, | |
| "logps/chosen": -9.018268585205078, | |
| "logps/rejected": -51.82669448852539, | |
| "loss": 0.7279898524284363, | |
| "memory(GiB)": 46.83, | |
| "nll_loss": 0.6217176914215088, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23028400540351868, | |
| "rewards/margins": 4.1028971672058105, | |
| "rewards/rejected": -3.8726134300231934, | |
| "step": 550, | |
| "train_speed(iter/s)": 0.005442 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1239, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.0254248959313183e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |