Instructions to use cragtmp/pairgt1005-400 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/pairgt1005-400 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/pairgt1005-400") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 300, | |
| "best_metric": 0.51461613, | |
| "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task1_dpo_absgt10_noidk__pari0.5_0602_p2prompt/v3-20250603-112113/checkpoint-300", | |
| "epoch": 1.0075447972335743, | |
| "eval_steps": 300, | |
| "global_step": 400, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002514932411191449, | |
| "grad_norm": 7.572820663452148, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "logits/chosen": -0.5129972100257874, | |
| "logits/rejected": -0.6397510766983032, | |
| "logps/chosen": -8.847090721130371, | |
| "logps/rejected": -18.28310203552246, | |
| "loss": 1.2403231859207153, | |
| "memory(GiB)": 30.59, | |
| "nll_loss": 0.5471758246421814, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.010604 | |
| }, | |
| { | |
| "epoch": 0.005029864822382898, | |
| "grad_norm": 7.455193042755127, | |
| "learning_rate": 6.666666666666667e-06, | |
| "logits/chosen": -0.5209798812866211, | |
| "logits/rejected": -0.6239324808120728, | |
| "logps/chosen": -4.766471862792969, | |
| "logps/rejected": -15.138076782226562, | |
| "loss": 1.065555453300476, | |
| "memory(GiB)": 33.8, | |
| "nll_loss": 0.37240836024284363, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.01094 | |
| }, | |
| { | |
| "epoch": 0.007544797233574348, | |
| "grad_norm": 10.782440185546875, | |
| "learning_rate": 1e-05, | |
| "logits/chosen": -0.4890531897544861, | |
| "logits/rejected": -0.6535542011260986, | |
| "logps/chosen": -4.760848522186279, | |
| "logps/rejected": -17.92791175842285, | |
| "loss": 1.0910710096359253, | |
| "memory(GiB)": 33.8, | |
| "nll_loss": 0.3938094973564148, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.0034015527926385403, | |
| "rewards/margins": -0.008013413287699223, | |
| "rewards/rejected": 0.004611859563738108, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.011055 | |
| }, | |
| { | |
| "epoch": 0.010059729644765796, | |
| "grad_norm": 13.736228942871094, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "logits/chosen": -0.4501972496509552, | |
| "logits/rejected": -0.6398910880088806, | |
| "logps/chosen": -3.6690049171447754, | |
| "logps/rejected": -21.246660232543945, | |
| "loss": 1.0828931331634521, | |
| "memory(GiB)": 37.26, | |
| "nll_loss": 0.39956799149513245, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.006963790860027075, | |
| "rewards/margins": 0.019915670156478882, | |
| "rewards/rejected": -0.012951879762113094, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.011095 | |
| }, | |
| { | |
| "epoch": 0.012574662055957246, | |
| "grad_norm": 8.89594554901123, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "logits/chosen": -0.41603705286979675, | |
| "logits/rejected": -0.5863696336746216, | |
| "logps/chosen": -8.551430702209473, | |
| "logps/rejected": -19.92246437072754, | |
| "loss": 1.1882262229919434, | |
| "memory(GiB)": 37.26, | |
| "nll_loss": 0.5108650922775269, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.014113119803369045, | |
| "rewards/margins": 0.03240397199988365, | |
| "rewards/rejected": -0.018290851265192032, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.011125 | |
| }, | |
| { | |
| "epoch": 0.015089594467148696, | |
| "grad_norm": 5.3424577713012695, | |
| "learning_rate": 2e-05, | |
| "logits/chosen": -0.4721744656562805, | |
| "logits/rejected": -0.5799455642700195, | |
| "logps/chosen": -9.535165786743164, | |
| "logps/rejected": -19.043678283691406, | |
| "loss": 1.188051462173462, | |
| "memory(GiB)": 37.26, | |
| "nll_loss": 0.524101972579956, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.010117664933204651, | |
| "rewards/margins": 0.0616740845143795, | |
| "rewards/rejected": -0.05155642703175545, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.011145 | |
| }, | |
| { | |
| "epoch": 0.017604526878340146, | |
| "grad_norm": 3.5404231548309326, | |
| "learning_rate": 2.3333333333333336e-05, | |
| "logits/chosen": -0.4064752459526062, | |
| "logits/rejected": -0.5387755036354065, | |
| "logps/chosen": -9.426046371459961, | |
| "logps/rejected": -24.705936431884766, | |
| "loss": 1.1507773399353027, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5126925706863403, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0260818712413311, | |
| "rewards/margins": 0.1276150643825531, | |
| "rewards/rejected": -0.1536969393491745, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.011146 | |
| }, | |
| { | |
| "epoch": 0.020119459289531592, | |
| "grad_norm": 4.785594463348389, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "logits/chosen": -0.40693986415863037, | |
| "logits/rejected": -0.5652169585227966, | |
| "logps/chosen": -5.92374849319458, | |
| "logps/rejected": -20.89351463317871, | |
| "loss": 1.02293860912323, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.39562517404556274, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.05045217275619507, | |
| "rewards/margins": 0.1817830502986908, | |
| "rewards/rejected": -0.23223522305488586, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.011156 | |
| }, | |
| { | |
| "epoch": 0.022634391700723042, | |
| "grad_norm": 4.752041816711426, | |
| "learning_rate": 3e-05, | |
| "logits/chosen": -0.3253605365753174, | |
| "logits/rejected": -0.5100574493408203, | |
| "logps/chosen": -5.970067024230957, | |
| "logps/rejected": -27.08715057373047, | |
| "loss": 0.8663768768310547, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.36089974641799927, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04699152708053589, | |
| "rewards/margins": 0.49801987409591675, | |
| "rewards/rejected": -0.45102834701538086, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.011163 | |
| }, | |
| { | |
| "epoch": 0.025149324111914492, | |
| "grad_norm": 5.771737575531006, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "logits/chosen": -0.4344920516014099, | |
| "logits/rejected": -0.5643672347068787, | |
| "logps/chosen": -6.490581035614014, | |
| "logps/rejected": -19.547592163085938, | |
| "loss": 1.0153567790985107, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.429390549659729, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.19264209270477295, | |
| "rewards/margins": 0.43160852789878845, | |
| "rewards/rejected": -0.6242506504058838, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.011177 | |
| }, | |
| { | |
| "epoch": 0.027664256523105942, | |
| "grad_norm": 5.376907825469971, | |
| "learning_rate": 3.6666666666666666e-05, | |
| "logits/chosen": -0.4512503147125244, | |
| "logits/rejected": -0.6003657579421997, | |
| "logps/chosen": -6.500467300415039, | |
| "logps/rejected": -27.486557006835938, | |
| "loss": 0.9551109075546265, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.40139278769493103, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.12439044564962387, | |
| "rewards/margins": 0.5762982368469238, | |
| "rewards/rejected": -0.7006886601448059, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.011187 | |
| }, | |
| { | |
| "epoch": 0.030179188934297392, | |
| "grad_norm": 3.0979809761047363, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.4187595844268799, | |
| "logits/rejected": -0.5968605279922485, | |
| "logps/chosen": -4.248518466949463, | |
| "logps/rejected": -26.590652465820312, | |
| "loss": 0.7605504393577576, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.2799570858478546, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.14420613646507263, | |
| "rewards/margins": 0.6546018123626709, | |
| "rewards/rejected": -0.7988079190254211, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.011196 | |
| }, | |
| { | |
| "epoch": 0.03269412134548884, | |
| "grad_norm": 9.02223014831543, | |
| "learning_rate": 4.3333333333333334e-05, | |
| "logits/chosen": -0.40893471240997314, | |
| "logits/rejected": -0.5400319695472717, | |
| "logps/chosen": -7.627485275268555, | |
| "logps/rejected": -21.307247161865234, | |
| "loss": 1.2244255542755127, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.6750409007072449, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.2602284550666809, | |
| "rewards/margins": 0.49883735179901123, | |
| "rewards/rejected": -0.7590658664703369, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.011204 | |
| }, | |
| { | |
| "epoch": 0.03520905375668029, | |
| "grad_norm": 5.483772277832031, | |
| "learning_rate": 4.666666666666667e-05, | |
| "logits/chosen": -0.5219076871871948, | |
| "logits/rejected": -0.593062698841095, | |
| "logps/chosen": -8.136625289916992, | |
| "logps/rejected": -17.90158462524414, | |
| "loss": 1.2523046731948853, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.6594831347465515, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.14057493209838867, | |
| "rewards/margins": 0.4059276878833771, | |
| "rewards/rejected": -0.5465026497840881, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.011215 | |
| }, | |
| { | |
| "epoch": 0.03772398616787174, | |
| "grad_norm": 5.3392133712768555, | |
| "learning_rate": 5e-05, | |
| "logits/chosen": -0.40230512619018555, | |
| "logits/rejected": -0.587448000907898, | |
| "logps/chosen": -3.3861958980560303, | |
| "logps/rejected": -22.72595977783203, | |
| "loss": 0.8488077521324158, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4007309377193451, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.02581140398979187, | |
| "rewards/margins": 0.6975324153900146, | |
| "rewards/rejected": -0.7233438491821289, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.011221 | |
| }, | |
| { | |
| "epoch": 0.040238918579063185, | |
| "grad_norm": 3.3262414932250977, | |
| "learning_rate": 5.333333333333333e-05, | |
| "logits/chosen": -0.342201292514801, | |
| "logits/rejected": -0.575752854347229, | |
| "logps/chosen": -3.893523693084717, | |
| "logps/rejected": -28.40308952331543, | |
| "loss": 0.8233633637428284, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3312762379646301, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.03883545473217964, | |
| "rewards/margins": 0.5127238035202026, | |
| "rewards/rejected": -0.4738883376121521, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.011223 | |
| }, | |
| { | |
| "epoch": 0.04275385099025464, | |
| "grad_norm": 2.462789297103882, | |
| "learning_rate": 5.666666666666667e-05, | |
| "logits/chosen": -0.49846047163009644, | |
| "logits/rejected": -0.6083415746688843, | |
| "logps/chosen": -1.8747515678405762, | |
| "logps/rejected": -16.662185668945312, | |
| "loss": 0.7689712047576904, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.238669753074646, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.041000571101903915, | |
| "rewards/margins": 0.40174293518066406, | |
| "rewards/rejected": -0.36074236035346985, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.045268783401446085, | |
| "grad_norm": 4.245744228363037, | |
| "learning_rate": 6e-05, | |
| "logits/chosen": -0.4577159881591797, | |
| "logits/rejected": -0.5291006565093994, | |
| "logps/chosen": -8.686376571655273, | |
| "logps/rejected": -17.176931381225586, | |
| "loss": 1.2110098600387573, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5645009875297546, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.049589186906814575, | |
| "rewards/margins": 0.15553997457027435, | |
| "rewards/rejected": -0.20512914657592773, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.04778371581263754, | |
| "grad_norm": 3.633544683456421, | |
| "learning_rate": 6.333333333333333e-05, | |
| "logits/chosen": -0.4796344041824341, | |
| "logits/rejected": -0.5480799674987793, | |
| "logps/chosen": -10.090361595153809, | |
| "logps/rejected": -17.440088272094727, | |
| "loss": 1.1647558212280273, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5513034462928772, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.004148788750171661, | |
| "rewards/margins": 0.22297149896621704, | |
| "rewards/rejected": -0.2271203100681305, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.050298648223828984, | |
| "grad_norm": 3.275191307067871, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.46574562788009644, | |
| "logits/rejected": -0.5685222744941711, | |
| "logps/chosen": -5.4855055809021, | |
| "logps/rejected": -15.27071762084961, | |
| "loss": 1.0493377447128296, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.40973347425460815, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.02530045434832573, | |
| "rewards/margins": 0.1835480034351349, | |
| "rewards/rejected": -0.15824756026268005, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.05281358063502043, | |
| "grad_norm": 2.346269130706787, | |
| "learning_rate": 7e-05, | |
| "logits/chosen": -0.5085228085517883, | |
| "logits/rejected": -0.6115283966064453, | |
| "logps/chosen": -8.632377624511719, | |
| "logps/rejected": -18.418798446655273, | |
| "loss": 1.1822807788848877, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.6134262084960938, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07014060765504837, | |
| "rewards/margins": 0.30156341195106506, | |
| "rewards/rejected": -0.2314227819442749, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.011245 | |
| }, | |
| { | |
| "epoch": 0.055328513046211884, | |
| "grad_norm": 3.8027472496032715, | |
| "learning_rate": 7.333333333333333e-05, | |
| "logits/chosen": -0.4623318314552307, | |
| "logits/rejected": -0.5286604762077332, | |
| "logps/chosen": -4.330241680145264, | |
| "logps/rejected": -15.440506935119629, | |
| "loss": 0.9398723840713501, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.32075199484825134, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.009936274029314518, | |
| "rewards/margins": 0.20203867554664612, | |
| "rewards/rejected": -0.21197494864463806, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.011248 | |
| }, | |
| { | |
| "epoch": 0.05784344545740333, | |
| "grad_norm": 2.3595120906829834, | |
| "learning_rate": 7.666666666666667e-05, | |
| "logits/chosen": -0.49782079458236694, | |
| "logits/rejected": -0.5459281206130981, | |
| "logps/chosen": -5.645054817199707, | |
| "logps/rejected": -15.544858932495117, | |
| "loss": 0.9763747453689575, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3531709313392639, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.011355478316545486, | |
| "rewards/margins": 0.17947493493556976, | |
| "rewards/rejected": -0.16811946034431458, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.011252 | |
| }, | |
| { | |
| "epoch": 0.060358377868594784, | |
| "grad_norm": 2.5567357540130615, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.52140212059021, | |
| "logits/rejected": -0.5767900943756104, | |
| "logps/chosen": -9.158100128173828, | |
| "logps/rejected": -18.047792434692383, | |
| "loss": 1.1764006614685059, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.6046724915504456, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03944522514939308, | |
| "rewards/margins": 0.2968653440475464, | |
| "rewards/rejected": -0.2574201226234436, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 0.06287331027978624, | |
| "grad_norm": 3.3667352199554443, | |
| "learning_rate": 8.333333333333334e-05, | |
| "logits/chosen": -0.4414227604866028, | |
| "logits/rejected": -0.5774338245391846, | |
| "logps/chosen": -5.001893997192383, | |
| "logps/rejected": -18.086332321166992, | |
| "loss": 1.0027401447296143, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.40850552916526794, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.01537637785077095, | |
| "rewards/margins": 0.2611372172832489, | |
| "rewards/rejected": -0.24576085805892944, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.011255 | |
| }, | |
| { | |
| "epoch": 0.06538824269097768, | |
| "grad_norm": 2.4368274211883545, | |
| "learning_rate": 8.666666666666667e-05, | |
| "logits/chosen": -0.33819591999053955, | |
| "logits/rejected": -0.5409271121025085, | |
| "logps/chosen": -11.725374221801758, | |
| "logps/rejected": -26.261959075927734, | |
| "loss": 1.0086052417755127, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5157173275947571, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07034377753734589, | |
| "rewards/margins": 0.5667710900306702, | |
| "rewards/rejected": -0.49642735719680786, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 0.06790317510216913, | |
| "grad_norm": 4.366164207458496, | |
| "learning_rate": 9e-05, | |
| "logits/chosen": -0.3777789771556854, | |
| "logits/rejected": -0.5889321565628052, | |
| "logps/chosen": -5.34947395324707, | |
| "logps/rejected": -27.725887298583984, | |
| "loss": 0.8724238872528076, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.39934495091438293, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.022416604682803154, | |
| "rewards/margins": 0.6145756244659424, | |
| "rewards/rejected": -0.6369922161102295, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 0.07041810751336058, | |
| "grad_norm": 3.8030436038970947, | |
| "learning_rate": 9.333333333333334e-05, | |
| "logits/chosen": -0.43299004435539246, | |
| "logits/rejected": -0.5541425347328186, | |
| "logps/chosen": -8.235193252563477, | |
| "logps/rejected": -26.827539443969727, | |
| "loss": 0.874066174030304, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.45102763175964355, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.07945333421230316, | |
| "rewards/margins": 0.8036540746688843, | |
| "rewards/rejected": -0.8831074237823486, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 0.07293303992455202, | |
| "grad_norm": 3.0242788791656494, | |
| "learning_rate": 9.666666666666667e-05, | |
| "logits/chosen": -0.37702634930610657, | |
| "logits/rejected": -0.5286097526550293, | |
| "logps/chosen": -6.507118225097656, | |
| "logps/rejected": -25.659378051757812, | |
| "loss": 0.9697012901306152, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4811092019081116, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.04141651839017868, | |
| "rewards/margins": 0.5634151101112366, | |
| "rewards/rejected": -0.6048315763473511, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.011253 | |
| }, | |
| { | |
| "epoch": 0.07544797233574348, | |
| "grad_norm": 2.460881233215332, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.371891051530838, | |
| "logits/rejected": -0.45985037088394165, | |
| "logps/chosen": -6.48842716217041, | |
| "logps/rejected": -18.697708129882812, | |
| "loss": 0.9460075497627258, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3780769407749176, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0511014498770237, | |
| "rewards/margins": 0.3350966274738312, | |
| "rewards/rejected": -0.2839951515197754, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.011254 | |
| }, | |
| { | |
| "epoch": 0.07796290474693493, | |
| "grad_norm": 3.6821117401123047, | |
| "learning_rate": 0.00010333333333333334, | |
| "logits/chosen": -0.39938536286354065, | |
| "logits/rejected": -0.49178823828697205, | |
| "logps/chosen": -6.468450546264648, | |
| "logps/rejected": -18.927385330200195, | |
| "loss": 1.019504189491272, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5059184432029724, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0709109753370285, | |
| "rewards/margins": 0.5467783808708191, | |
| "rewards/rejected": -0.4758673906326294, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.011256 | |
| }, | |
| { | |
| "epoch": 0.08047783715812637, | |
| "grad_norm": 2.8029754161834717, | |
| "learning_rate": 0.00010666666666666667, | |
| "logits/chosen": -0.38790467381477356, | |
| "logits/rejected": -0.4925430417060852, | |
| "logps/chosen": -5.981967926025391, | |
| "logps/rejected": -28.314722061157227, | |
| "loss": 0.9189813733100891, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3903328776359558, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08847282826900482, | |
| "rewards/margins": 0.501548171043396, | |
| "rewards/rejected": -0.41307532787323, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.011256 | |
| }, | |
| { | |
| "epoch": 0.08299276956931782, | |
| "grad_norm": 3.7524354457855225, | |
| "learning_rate": 0.00011000000000000002, | |
| "logits/chosen": -0.3702802360057831, | |
| "logits/rejected": -0.4830480217933655, | |
| "logps/chosen": -6.820221424102783, | |
| "logps/rejected": -18.442974090576172, | |
| "loss": 0.9390460252761841, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4203004837036133, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.05472969263792038, | |
| "rewards/margins": 0.4696621000766754, | |
| "rewards/rejected": -0.41493239998817444, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.011257 | |
| }, | |
| { | |
| "epoch": 0.08550770198050928, | |
| "grad_norm": 2.968419075012207, | |
| "learning_rate": 0.00011333333333333334, | |
| "logits/chosen": -0.35177576541900635, | |
| "logits/rejected": -0.45535844564437866, | |
| "logps/chosen": -4.456936836242676, | |
| "logps/rejected": -22.066486358642578, | |
| "loss": 0.8263772130012512, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.35278084874153137, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.009354054927825928, | |
| "rewards/margins": 0.7917211651802063, | |
| "rewards/rejected": -0.8010752201080322, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.011259 | |
| }, | |
| { | |
| "epoch": 0.08802263439170073, | |
| "grad_norm": 2.9763481616973877, | |
| "learning_rate": 0.00011666666666666668, | |
| "logits/chosen": -0.2393473982810974, | |
| "logits/rejected": -0.4172413945198059, | |
| "logps/chosen": -4.113461017608643, | |
| "logps/rejected": -30.265304565429688, | |
| "loss": 0.8524877429008484, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.471011221408844, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05692119151353836, | |
| "rewards/margins": 1.161907434463501, | |
| "rewards/rejected": -1.1049861907958984, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.011258 | |
| }, | |
| { | |
| "epoch": 0.09053756680289217, | |
| "grad_norm": 2.4537270069122314, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.276807963848114, | |
| "logits/rejected": -0.41199547052383423, | |
| "logps/chosen": -7.090043544769287, | |
| "logps/rejected": -29.689010620117188, | |
| "loss": 0.7714070081710815, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3793071210384369, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.036474838852882385, | |
| "rewards/margins": 1.0788801908493042, | |
| "rewards/rejected": -1.0424052476882935, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.011257 | |
| }, | |
| { | |
| "epoch": 0.09305249921408362, | |
| "grad_norm": 3.29215145111084, | |
| "learning_rate": 0.00012333333333333334, | |
| "logits/chosen": -0.3102665841579437, | |
| "logits/rejected": -0.4546661078929901, | |
| "logps/chosen": -5.750801086425781, | |
| "logps/rejected": -31.45724868774414, | |
| "loss": 0.7538890838623047, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4176124334335327, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.1214592307806015, | |
| "rewards/margins": 1.2956981658935547, | |
| "rewards/rejected": -1.4171574115753174, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.011259 | |
| }, | |
| { | |
| "epoch": 0.09556743162527508, | |
| "grad_norm": 3.8826475143432617, | |
| "learning_rate": 0.00012666666666666666, | |
| "logits/chosen": -0.37785372138023376, | |
| "logits/rejected": -0.45433154702186584, | |
| "logps/chosen": -8.914945602416992, | |
| "logps/rejected": -22.28145408630371, | |
| "loss": 0.9718711972236633, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.542230486869812, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.05876921862363815, | |
| "rewards/margins": 0.9656041860580444, | |
| "rewards/rejected": -1.0243734121322632, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.01126 | |
| }, | |
| { | |
| "epoch": 0.09808236403646652, | |
| "grad_norm": 10.463335990905762, | |
| "learning_rate": 0.00013000000000000002, | |
| "logits/chosen": -0.40348339080810547, | |
| "logits/rejected": -0.4396521747112274, | |
| "logps/chosen": -9.546710014343262, | |
| "logps/rejected": -24.998611450195312, | |
| "loss": 1.1912176609039307, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.6404471397399902, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.18508824706077576, | |
| "rewards/margins": 0.8297311663627625, | |
| "rewards/rejected": -1.0148195028305054, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.01126 | |
| }, | |
| { | |
| "epoch": 0.10059729644765797, | |
| "grad_norm": 3.4194676876068115, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.36826181411743164, | |
| "logits/rejected": -0.5072036981582642, | |
| "logps/chosen": -6.227029800415039, | |
| "logps/rejected": -28.42563247680664, | |
| "loss": 0.7728609442710876, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3573758006095886, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.021011125296354294, | |
| "rewards/margins": 1.0436646938323975, | |
| "rewards/rejected": -1.0226534605026245, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.011261 | |
| }, | |
| { | |
| "epoch": 0.10311222885884942, | |
| "grad_norm": 4.902315139770508, | |
| "learning_rate": 0.00013666666666666666, | |
| "logits/chosen": -0.3183041512966156, | |
| "logits/rejected": -0.48007485270500183, | |
| "logps/chosen": -9.719247817993164, | |
| "logps/rejected": -22.464027404785156, | |
| "loss": 1.06601881980896, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5293514728546143, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.04249940067529678, | |
| "rewards/margins": 0.45808011293411255, | |
| "rewards/rejected": -0.4155806601047516, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.01126 | |
| }, | |
| { | |
| "epoch": 0.10562716127004086, | |
| "grad_norm": 5.45733118057251, | |
| "learning_rate": 0.00014, | |
| "logits/chosen": -0.3853970468044281, | |
| "logits/rejected": -0.4931572675704956, | |
| "logps/chosen": -8.472291946411133, | |
| "logps/rejected": -24.512069702148438, | |
| "loss": 0.943773627281189, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4035080075263977, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.07248181104660034, | |
| "rewards/margins": 0.5888606309890747, | |
| "rewards/rejected": -0.661342442035675, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.011261 | |
| }, | |
| { | |
| "epoch": 0.10814209368123232, | |
| "grad_norm": 3.7701737880706787, | |
| "learning_rate": 0.00014333333333333334, | |
| "logits/chosen": -0.24171334505081177, | |
| "logits/rejected": -0.46347737312316895, | |
| "logps/chosen": -3.810516119003296, | |
| "logps/rejected": -28.03646469116211, | |
| "loss": 0.7043237090110779, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.33659031987190247, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10358152538537979, | |
| "rewards/margins": 1.084468960762024, | |
| "rewards/rejected": -0.9808874726295471, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.01126 | |
| }, | |
| { | |
| "epoch": 0.11065702609242377, | |
| "grad_norm": 5.19516658782959, | |
| "learning_rate": 0.00014666666666666666, | |
| "logits/chosen": -0.3297630548477173, | |
| "logits/rejected": -0.4781489074230194, | |
| "logps/chosen": -8.038228988647461, | |
| "logps/rejected": -33.8675651550293, | |
| "loss": 0.8617865443229675, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5089200139045715, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.21755161881446838, | |
| "rewards/margins": 1.4295934438705444, | |
| "rewards/rejected": -1.6471449136734009, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.01126 | |
| }, | |
| { | |
| "epoch": 0.11317195850361522, | |
| "grad_norm": 4.779160499572754, | |
| "learning_rate": 0.00015000000000000001, | |
| "logits/chosen": -0.49006256461143494, | |
| "logits/rejected": -0.5443361401557922, | |
| "logps/chosen": -9.670989990234375, | |
| "logps/rejected": -27.758705139160156, | |
| "loss": 0.9880771636962891, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5687355995178223, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.21813175082206726, | |
| "rewards/margins": 1.2758864164352417, | |
| "rewards/rejected": -1.4940180778503418, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.011261 | |
| }, | |
| { | |
| "epoch": 0.11568689091480666, | |
| "grad_norm": 4.207818031311035, | |
| "learning_rate": 0.00015333333333333334, | |
| "logits/chosen": -0.3747759461402893, | |
| "logits/rejected": -0.5024475455284119, | |
| "logps/chosen": -6.3994646072387695, | |
| "logps/rejected": -32.430179595947266, | |
| "loss": 0.9543445706367493, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5410714745521545, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.1253054440021515, | |
| "rewards/margins": 1.216636300086975, | |
| "rewards/rejected": -1.3419415950775146, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.011262 | |
| }, | |
| { | |
| "epoch": 0.11820182332599811, | |
| "grad_norm": 2.187269926071167, | |
| "learning_rate": 0.00015666666666666666, | |
| "logits/chosen": -0.34373798966407776, | |
| "logits/rejected": -0.5492506623268127, | |
| "logps/chosen": -5.171298027038574, | |
| "logps/rejected": -34.377967834472656, | |
| "loss": 0.5840844511985779, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.2608174979686737, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04855790734291077, | |
| "rewards/margins": 1.4605152606964111, | |
| "rewards/rejected": -1.4119572639465332, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.011263 | |
| }, | |
| { | |
| "epoch": 0.12071675573718957, | |
| "grad_norm": 2.492182970046997, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.3911299705505371, | |
| "logits/rejected": -0.5427611470222473, | |
| "logps/chosen": -5.3708953857421875, | |
| "logps/rejected": -30.956531524658203, | |
| "loss": 0.7430465221405029, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3517543077468872, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.04663639888167381, | |
| "rewards/margins": 1.1671051979064941, | |
| "rewards/rejected": -1.2137415409088135, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.011264 | |
| }, | |
| { | |
| "epoch": 0.12323168814838101, | |
| "grad_norm": 2.454068422317505, | |
| "learning_rate": 0.00016333333333333334, | |
| "logits/chosen": -0.30930572748184204, | |
| "logits/rejected": -0.5388137698173523, | |
| "logps/chosen": -4.821499824523926, | |
| "logps/rejected": -33.31132125854492, | |
| "loss": 0.6669176816940308, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.34143078327178955, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.09115171432495117, | |
| "rewards/margins": 1.3478808403015137, | |
| "rewards/rejected": -1.2567291259765625, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.011264 | |
| }, | |
| { | |
| "epoch": 0.12574662055957248, | |
| "grad_norm": 2.7763614654541016, | |
| "learning_rate": 0.0001666666666666667, | |
| "logits/chosen": -0.22302384674549103, | |
| "logits/rejected": -0.476222962141037, | |
| "logps/chosen": -6.5321455001831055, | |
| "logps/rejected": -33.70460891723633, | |
| "loss": 0.8022267818450928, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3984905481338501, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.011320816352963448, | |
| "rewards/margins": 1.2645773887634277, | |
| "rewards/rejected": -1.2532566785812378, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.011263 | |
| }, | |
| { | |
| "epoch": 0.12826155297076391, | |
| "grad_norm": 3.5810701847076416, | |
| "learning_rate": 0.00017, | |
| "logits/chosen": -0.2979552447795868, | |
| "logits/rejected": -0.4668833017349243, | |
| "logps/chosen": -7.627035140991211, | |
| "logps/rejected": -35.17571258544922, | |
| "loss": 0.8107961416244507, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4284512996673584, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.06179499253630638, | |
| "rewards/margins": 1.205071210861206, | |
| "rewards/rejected": -1.2668663263320923, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.011221 | |
| }, | |
| { | |
| "epoch": 0.13077648538195535, | |
| "grad_norm": 2.9454948902130127, | |
| "learning_rate": 0.00017333333333333334, | |
| "logits/chosen": -0.2851395010948181, | |
| "logits/rejected": -0.4914030134677887, | |
| "logps/chosen": -6.73934268951416, | |
| "logps/rejected": -44.49215316772461, | |
| "loss": 0.7192223072052002, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3857932686805725, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.06120564043521881, | |
| "rewards/margins": 2.360339403152466, | |
| "rewards/rejected": -2.4215452671051025, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.011221 | |
| }, | |
| { | |
| "epoch": 0.13329141779314682, | |
| "grad_norm": 2.907097339630127, | |
| "learning_rate": 0.00017666666666666666, | |
| "logits/chosen": -0.29824766516685486, | |
| "logits/rejected": -0.5210357904434204, | |
| "logps/chosen": -8.840283393859863, | |
| "logps/rejected": -34.15322494506836, | |
| "loss": 0.9132320284843445, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5277525782585144, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.013686132617294788, | |
| "rewards/margins": 1.6544121503829956, | |
| "rewards/rejected": -1.6680983304977417, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.011222 | |
| }, | |
| { | |
| "epoch": 0.13580635020433826, | |
| "grad_norm": 3.2579548358917236, | |
| "learning_rate": 0.00018, | |
| "logits/chosen": -0.3622821867465973, | |
| "logits/rejected": -0.49751946330070496, | |
| "logps/chosen": -9.77501106262207, | |
| "logps/rejected": -34.95624542236328, | |
| "loss": 0.8283704519271851, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.478503942489624, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04811567813158035, | |
| "rewards/margins": 1.6710915565490723, | |
| "rewards/rejected": -1.6229758262634277, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.011222 | |
| }, | |
| { | |
| "epoch": 0.1383212826155297, | |
| "grad_norm": 6.844382286071777, | |
| "learning_rate": 0.00018333333333333334, | |
| "logits/chosen": -0.34049201011657715, | |
| "logits/rejected": -0.5361011028289795, | |
| "logps/chosen": -4.566088676452637, | |
| "logps/rejected": -41.054141998291016, | |
| "loss": 0.7934082746505737, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4864325225353241, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.022840898483991623, | |
| "rewards/margins": 2.574941873550415, | |
| "rewards/rejected": -2.597783088684082, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.011224 | |
| }, | |
| { | |
| "epoch": 0.14083621502672117, | |
| "grad_norm": 5.409123420715332, | |
| "learning_rate": 0.0001866666666666667, | |
| "logits/chosen": -0.3723406195640564, | |
| "logits/rejected": -0.4861374497413635, | |
| "logps/chosen": -11.017836570739746, | |
| "logps/rejected": -34.19987487792969, | |
| "loss": 1.1561821699142456, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.7329697608947754, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.1480638086795807, | |
| "rewards/margins": 2.0217599868774414, | |
| "rewards/rejected": -2.16982364654541, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.011225 | |
| }, | |
| { | |
| "epoch": 0.1433511474379126, | |
| "grad_norm": 7.563216686248779, | |
| "learning_rate": 0.00019, | |
| "logits/chosen": -0.32556983828544617, | |
| "logits/rejected": -0.5365452170372009, | |
| "logps/chosen": -5.449405193328857, | |
| "logps/rejected": -46.6372184753418, | |
| "loss": 0.8106161952018738, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5291056632995605, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.11195089668035507, | |
| "rewards/margins": 2.898953676223755, | |
| "rewards/rejected": -3.010904312133789, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.011226 | |
| }, | |
| { | |
| "epoch": 0.14586607984910405, | |
| "grad_norm": 9.61186408996582, | |
| "learning_rate": 0.00019333333333333333, | |
| "logits/chosen": -0.4079486131668091, | |
| "logits/rejected": -0.5931285619735718, | |
| "logps/chosen": -3.3833391666412354, | |
| "logps/rejected": -41.95534896850586, | |
| "loss": 0.559334397315979, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.30327463150024414, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04168446362018585, | |
| "rewards/margins": 2.6080174446105957, | |
| "rewards/rejected": -2.566333055496216, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.011229 | |
| }, | |
| { | |
| "epoch": 0.14838101226029551, | |
| "grad_norm": 3.3261170387268066, | |
| "learning_rate": 0.00019666666666666666, | |
| "logits/chosen": -0.4187636971473694, | |
| "logits/rejected": -0.4730520248413086, | |
| "logps/chosen": -8.343189239501953, | |
| "logps/rejected": -25.519798278808594, | |
| "loss": 1.058987021446228, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5353435277938843, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0768323540687561, | |
| "rewards/margins": 1.170108437538147, | |
| "rewards/rejected": -1.2469407320022583, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.15089594467148695, | |
| "grad_norm": 3.7475709915161133, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.31574761867523193, | |
| "logits/rejected": -0.4878937005996704, | |
| "logps/chosen": -6.4234299659729, | |
| "logps/rejected": -30.35470199584961, | |
| "loss": 0.7999802827835083, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3874775171279907, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.019132789224386215, | |
| "rewards/margins": 1.3630902767181396, | |
| "rewards/rejected": -1.3439574241638184, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.1534108770826784, | |
| "grad_norm": 2.8922085762023926, | |
| "learning_rate": 0.0001999996142159566, | |
| "logits/chosen": -0.35342201590538025, | |
| "logits/rejected": -0.4222828149795532, | |
| "logps/chosen": -7.674136638641357, | |
| "logps/rejected": -26.560787200927734, | |
| "loss": 0.7506588101387024, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3475904166698456, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.04072082042694092, | |
| "rewards/margins": 1.29744291305542, | |
| "rewards/rejected": -1.2567219734191895, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.15592580949386986, | |
| "grad_norm": 2.781667947769165, | |
| "learning_rate": 0.0001999984568668029, | |
| "logits/chosen": -0.33968424797058105, | |
| "logits/rejected": -0.45871520042419434, | |
| "logps/chosen": -3.5645596981048584, | |
| "logps/rejected": -33.30908203125, | |
| "loss": 0.6515002250671387, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.28380468487739563, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10595045238733292, | |
| "rewards/margins": 1.6635351181030273, | |
| "rewards/rejected": -1.5575847625732422, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.1584407419050613, | |
| "grad_norm": 3.0299599170684814, | |
| "learning_rate": 0.00019999652796146876, | |
| "logits/chosen": -0.3050180971622467, | |
| "logits/rejected": -0.4909503161907196, | |
| "logps/chosen": -7.468794822692871, | |
| "logps/rejected": -40.68026351928711, | |
| "loss": 0.7424418330192566, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.41286778450012207, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.06561660766601562, | |
| "rewards/margins": 1.9888997077941895, | |
| "rewards/rejected": -1.9232829809188843, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.16095567431625274, | |
| "grad_norm": 2.0761804580688477, | |
| "learning_rate": 0.0001999938275148369, | |
| "logits/chosen": -0.33227968215942383, | |
| "logits/rejected": -0.45812830328941345, | |
| "logps/chosen": -4.157924652099609, | |
| "logps/rejected": -40.23651123046875, | |
| "loss": 0.40325966477394104, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.19691286981105804, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.10368794947862625, | |
| "rewards/margins": 2.3141493797302246, | |
| "rewards/rejected": -2.417837619781494, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.1634706067274442, | |
| "grad_norm": 3.9792428016662598, | |
| "learning_rate": 0.00019999035554774314, | |
| "logits/chosen": -0.3644486367702484, | |
| "logits/rejected": -0.5156970024108887, | |
| "logps/chosen": -5.496757984161377, | |
| "logps/rejected": -43.13388442993164, | |
| "loss": 0.759586751461029, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5011360049247742, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.13431251049041748, | |
| "rewards/margins": 2.4990766048431396, | |
| "rewards/rejected": -2.6333892345428467, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.16598553913863565, | |
| "grad_norm": 3.7544219493865967, | |
| "learning_rate": 0.00019998611208697607, | |
| "logits/chosen": -0.3731898367404938, | |
| "logits/rejected": -0.5181675553321838, | |
| "logps/chosen": -4.577354431152344, | |
| "logps/rejected": -36.74962615966797, | |
| "loss": 0.7680931091308594, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4070277214050293, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.09029161185026169, | |
| "rewards/margins": 1.9024454355239868, | |
| "rewards/rejected": -1.992737054824829, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.16850047154982709, | |
| "grad_norm": 2.9526925086975098, | |
| "learning_rate": 0.00019998109716527686, | |
| "logits/chosen": -0.247542604804039, | |
| "logits/rejected": -0.45712605118751526, | |
| "logps/chosen": -3.374553918838501, | |
| "logps/rejected": -43.25963592529297, | |
| "loss": 0.49172505736351013, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.22025981545448303, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.04232815280556679, | |
| "rewards/margins": 2.575462579727173, | |
| "rewards/rejected": -2.5331344604492188, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.17101540396101855, | |
| "grad_norm": 5.039420127868652, | |
| "learning_rate": 0.00019997531082133904, | |
| "logits/chosen": -0.3098013997077942, | |
| "logits/rejected": -0.42491626739501953, | |
| "logps/chosen": -7.849802494049072, | |
| "logps/rejected": -31.89962387084961, | |
| "loss": 1.0089820623397827, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5222876071929932, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.09253531694412231, | |
| "rewards/margins": 1.4570719003677368, | |
| "rewards/rejected": -1.549607276916504, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.17353033637221, | |
| "grad_norm": 2.4941506385803223, | |
| "learning_rate": 0.00019996875309980826, | |
| "logits/chosen": -0.33015602827072144, | |
| "logits/rejected": -0.4958527684211731, | |
| "logps/chosen": -4.380959510803223, | |
| "logps/rejected": -36.05854415893555, | |
| "loss": 0.6548417806625366, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.38906389474868774, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07272060960531235, | |
| "rewards/margins": 2.0416646003723145, | |
| "rewards/rejected": -1.9689440727233887, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.17604526878340146, | |
| "grad_norm": 3.3756778240203857, | |
| "learning_rate": 0.0001999614240512817, | |
| "logits/chosen": -0.2773034870624542, | |
| "logits/rejected": -0.48985666036605835, | |
| "logps/chosen": -7.3368024826049805, | |
| "logps/rejected": -28.274978637695312, | |
| "loss": 0.7877169251441956, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4065099060535431, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1428125947713852, | |
| "rewards/margins": 1.3781116008758545, | |
| "rewards/rejected": -1.2352991104125977, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.1785602011945929, | |
| "grad_norm": 3.289449453353882, | |
| "learning_rate": 0.00019995332373230808, | |
| "logits/chosen": -0.2643814980983734, | |
| "logits/rejected": -0.441372275352478, | |
| "logps/chosen": -4.96966552734375, | |
| "logps/rejected": -32.28032684326172, | |
| "loss": 0.6629552841186523, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.2761652171611786, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.028238017112016678, | |
| "rewards/margins": 1.3064823150634766, | |
| "rewards/rejected": -1.2782442569732666, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.18107513360578434, | |
| "grad_norm": 2.8338823318481445, | |
| "learning_rate": 0.00019994445220538677, | |
| "logits/chosen": -0.2861837148666382, | |
| "logits/rejected": -0.39666813611984253, | |
| "logps/chosen": -6.460289001464844, | |
| "logps/rejected": -33.8844108581543, | |
| "loss": 0.7865106463432312, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4185709059238434, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.03227805718779564, | |
| "rewards/margins": 1.8171049356460571, | |
| "rewards/rejected": -1.849382996559143, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.1835900660169758, | |
| "grad_norm": 4.286563396453857, | |
| "learning_rate": 0.0001999348095389677, | |
| "logits/chosen": -0.2642534673213959, | |
| "logits/rejected": -0.4921380281448364, | |
| "logps/chosen": -6.74280309677124, | |
| "logps/rejected": -48.935733795166016, | |
| "loss": 0.6765459775924683, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4257548451423645, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.023126238957047462, | |
| "rewards/margins": 2.3492531776428223, | |
| "rewards/rejected": -2.3723795413970947, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.18610499842816725, | |
| "grad_norm": 6.242228984832764, | |
| "learning_rate": 0.0001999243958074506, | |
| "logits/chosen": -0.24496644735336304, | |
| "logits/rejected": -0.4604867100715637, | |
| "logps/chosen": -14.664331436157227, | |
| "logps/rejected": -44.660789489746094, | |
| "loss": 1.2609174251556396, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.827994704246521, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.4426795244216919, | |
| "rewards/margins": 1.524437427520752, | |
| "rewards/rejected": -1.9671170711517334, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.18861993083935868, | |
| "grad_norm": 2.4951188564300537, | |
| "learning_rate": 0.00019991321109118448, | |
| "logits/chosen": -0.40645161271095276, | |
| "logits/rejected": -0.4706539511680603, | |
| "logps/chosen": -6.498587131500244, | |
| "logps/rejected": -31.508909225463867, | |
| "loss": 0.6895300149917603, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3541663587093353, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.004417119547724724, | |
| "rewards/margins": 1.655824899673462, | |
| "rewards/rejected": -1.6514074802398682, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.19113486325055015, | |
| "grad_norm": 2.4047465324401855, | |
| "learning_rate": 0.00019990125547646704, | |
| "logits/chosen": -0.33654719591140747, | |
| "logits/rejected": -0.49985551834106445, | |
| "logps/chosen": -3.1749448776245117, | |
| "logps/rejected": -31.598142623901367, | |
| "loss": 0.6832078695297241, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.28699803352355957, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.018617400899529457, | |
| "rewards/margins": 1.5892831087112427, | |
| "rewards/rejected": -1.570665717124939, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.1936497956617416, | |
| "grad_norm": 2.1775262355804443, | |
| "learning_rate": 0.00019988852905554404, | |
| "logits/chosen": -0.2977695167064667, | |
| "logits/rejected": -0.4677082896232605, | |
| "logps/chosen": -5.7894110679626465, | |
| "logps/rejected": -33.92140579223633, | |
| "loss": 0.6954871416091919, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.35726743936538696, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11432527005672455, | |
| "rewards/margins": 1.4882932901382446, | |
| "rewards/rejected": -1.3739678859710693, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.19616472807293303, | |
| "grad_norm": 2.386960983276367, | |
| "learning_rate": 0.0001998750319266084, | |
| "logits/chosen": -0.34930819272994995, | |
| "logits/rejected": -0.4996439814567566, | |
| "logps/chosen": -5.451239585876465, | |
| "logps/rejected": -30.024625778198242, | |
| "loss": 0.8510737419128418, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.38498157262802124, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.08021941781044006, | |
| "rewards/margins": 1.2762808799743652, | |
| "rewards/rejected": -1.1960614919662476, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.1986796604841245, | |
| "grad_norm": 2.540059804916382, | |
| "learning_rate": 0.00019986076419379974, | |
| "logits/chosen": -0.2711866497993469, | |
| "logits/rejected": -0.46172043681144714, | |
| "logps/chosen": -7.032684803009033, | |
| "logps/rejected": -37.4212760925293, | |
| "loss": 0.8995335698127747, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5719486474990845, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1289057433605194, | |
| "rewards/margins": 1.6372534036636353, | |
| "rewards/rejected": -1.508347749710083, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.20119459289531594, | |
| "grad_norm": 2.888524293899536, | |
| "learning_rate": 0.00019984572596720324, | |
| "logits/chosen": -0.4125524163246155, | |
| "logits/rejected": -0.550200343132019, | |
| "logps/chosen": -4.954836845397949, | |
| "logps/rejected": -31.84545135498047, | |
| "loss": 0.7266713976860046, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4038025140762329, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.018991030752658844, | |
| "rewards/margins": 1.6552242040634155, | |
| "rewards/rejected": -1.6742154359817505, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.20370952530650738, | |
| "grad_norm": 2.54023814201355, | |
| "learning_rate": 0.00019982991736284915, | |
| "logits/chosen": -0.36888328194618225, | |
| "logits/rejected": -0.48596253991127014, | |
| "logps/chosen": -6.946263313293457, | |
| "logps/rejected": -37.912750244140625, | |
| "loss": 0.6610869765281677, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3929502069950104, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.005873316898941994, | |
| "rewards/margins": 2.2654542922973633, | |
| "rewards/rejected": -2.2595808506011963, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.20622445771769884, | |
| "grad_norm": 5.155144214630127, | |
| "learning_rate": 0.00019981333850271158, | |
| "logits/chosen": -0.37043288350105286, | |
| "logits/rejected": -0.5056601166725159, | |
| "logps/chosen": -7.0625691413879395, | |
| "logps/rejected": -45.226646423339844, | |
| "loss": 0.6925163269042969, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.4076215326786041, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.03391120955348015, | |
| "rewards/margins": 3.1254899501800537, | |
| "rewards/rejected": -3.1594011783599854, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.20873939012889028, | |
| "grad_norm": 4.161493301391602, | |
| "learning_rate": 0.0001997959895147077, | |
| "logits/chosen": -0.3119804859161377, | |
| "logits/rejected": -0.519420862197876, | |
| "logps/chosen": -5.138388156890869, | |
| "logps/rejected": -51.65058517456055, | |
| "loss": 0.6154710054397583, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3612300753593445, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08062062412500381, | |
| "rewards/margins": 3.3395729064941406, | |
| "rewards/rejected": -3.2589523792266846, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.21125432254008172, | |
| "grad_norm": 3.640066146850586, | |
| "learning_rate": 0.0001997778705326968, | |
| "logits/chosen": -0.3015586733818054, | |
| "logits/rejected": -0.561132550239563, | |
| "logps/chosen": -2.76611328125, | |
| "logps/rejected": -47.526405334472656, | |
| "loss": 0.5920863151550293, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3293038606643677, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07201344519853592, | |
| "rewards/margins": 2.9245572090148926, | |
| "rewards/rejected": -2.852543592453003, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.2137692549512732, | |
| "grad_norm": 9.056829452514648, | |
| "learning_rate": 0.00019975898169647915, | |
| "logits/chosen": -0.3201826810836792, | |
| "logits/rejected": -0.49801909923553467, | |
| "logps/chosen": -8.43231201171875, | |
| "logps/rejected": -44.97834014892578, | |
| "loss": 0.7947379350662231, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.45788073539733887, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.03715405985713005, | |
| "rewards/margins": 2.6956162452697754, | |
| "rewards/rejected": -2.7327704429626465, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.21628418736246463, | |
| "grad_norm": 3.5543746948242188, | |
| "learning_rate": 0.000199739323151795, | |
| "logits/chosen": -0.2616378962993622, | |
| "logits/rejected": -0.5049853920936584, | |
| "logps/chosen": -5.9475860595703125, | |
| "logps/rejected": -39.59865951538086, | |
| "loss": 0.7357087135314941, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3480994701385498, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.013387706130743027, | |
| "rewards/margins": 2.0890746116638184, | |
| "rewards/rejected": -2.1024622917175293, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.21879911977365607, | |
| "grad_norm": 2.5816776752471924, | |
| "learning_rate": 0.00019971889505032334, | |
| "logits/chosen": -0.3568105101585388, | |
| "logits/rejected": -0.5804364681243896, | |
| "logps/chosen": -3.9897284507751465, | |
| "logps/rejected": -40.31490707397461, | |
| "loss": 0.6060020923614502, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3237951099872589, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.0022782403975725174, | |
| "rewards/margins": 2.383437156677246, | |
| "rewards/rejected": -2.3857154846191406, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.22131405218484754, | |
| "grad_norm": 3.132185935974121, | |
| "learning_rate": 0.00019969769754968098, | |
| "logits/chosen": -0.28933870792388916, | |
| "logits/rejected": -0.5249110460281372, | |
| "logps/chosen": -5.762962818145752, | |
| "logps/rejected": -34.77198791503906, | |
| "loss": 0.6889637112617493, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3635081648826599, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13572651147842407, | |
| "rewards/margins": 1.7912075519561768, | |
| "rewards/rejected": -1.655480980873108, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.22382898459603898, | |
| "grad_norm": 2.8023223876953125, | |
| "learning_rate": 0.00019967573081342103, | |
| "logits/chosen": -0.3481064736843109, | |
| "logits/rejected": -0.5555439591407776, | |
| "logps/chosen": -5.762640476226807, | |
| "logps/rejected": -35.07036209106445, | |
| "loss": 0.6983572244644165, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.3852231502532959, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04139009863138199, | |
| "rewards/margins": 2.027146816253662, | |
| "rewards/rejected": -1.985756754875183, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.22634391700723044, | |
| "grad_norm": 8.448691368103027, | |
| "learning_rate": 0.00019965299501103177, | |
| "logits/chosen": -0.28187096118927, | |
| "logits/rejected": -0.5138179063796997, | |
| "logps/chosen": -11.35129165649414, | |
| "logps/rejected": -54.19221496582031, | |
| "loss": 0.9737562537193298, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.6502060890197754, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.1801879107952118, | |
| "rewards/margins": 3.0160610675811768, | |
| "rewards/rejected": -3.196249008178711, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.22885884941842188, | |
| "grad_norm": 4.455811977386475, | |
| "learning_rate": 0.00019962949031793542, | |
| "logits/chosen": -0.388353168964386, | |
| "logits/rejected": -0.5416743755340576, | |
| "logps/chosen": -7.5033183097839355, | |
| "logps/rejected": -38.96351623535156, | |
| "loss": 0.8328152298927307, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5262293219566345, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.18585588037967682, | |
| "rewards/margins": 2.3831686973571777, | |
| "rewards/rejected": -2.5690245628356934, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.23137378182961332, | |
| "grad_norm": 5.176366806030273, | |
| "learning_rate": 0.00019960521691548674, | |
| "logits/chosen": -0.30729976296424866, | |
| "logits/rejected": -0.5507268905639648, | |
| "logps/chosen": -6.70347785949707, | |
| "logps/rejected": -47.423580169677734, | |
| "loss": 0.7757164835929871, | |
| "memory(GiB)": 40.75, | |
| "nll_loss": 0.5047218203544617, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.212627112865448, | |
| "rewards/margins": 2.656092643737793, | |
| "rewards/rejected": -2.8687198162078857, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.2338887142408048, | |
| "grad_norm": 2.7338004112243652, | |
| "learning_rate": 0.0001995801749909715, | |
| "logits/chosen": -0.310178279876709, | |
| "logits/rejected": -0.5231863856315613, | |
| "logps/chosen": -6.638127326965332, | |
| "logps/rejected": -34.64179992675781, | |
| "loss": 0.6857970952987671, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.341688871383667, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.04894203692674637, | |
| "rewards/margins": 1.8471993207931519, | |
| "rewards/rejected": -1.7982572317123413, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.23640364665199623, | |
| "grad_norm": 2.074855327606201, | |
| "learning_rate": 0.00019955436473760525, | |
| "logits/chosen": -0.2659550607204437, | |
| "logits/rejected": -0.5499891042709351, | |
| "logps/chosen": -4.5521063804626465, | |
| "logps/rejected": -44.503509521484375, | |
| "loss": 0.668745219707489, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3918987512588501, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1607407182455063, | |
| "rewards/margins": 2.3078651428222656, | |
| "rewards/rejected": -2.1471242904663086, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.23891857906318767, | |
| "grad_norm": 2.6431190967559814, | |
| "learning_rate": 0.0001995277863545316, | |
| "logits/chosen": -0.38493573665618896, | |
| "logits/rejected": -0.5655022859573364, | |
| "logps/chosen": -3.839203119277954, | |
| "logps/rejected": -27.24703025817871, | |
| "loss": 0.5949357151985168, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.2755538821220398, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.11298017203807831, | |
| "rewards/margins": 1.4701435565948486, | |
| "rewards/rejected": -1.357163429260254, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.24143351147437914, | |
| "grad_norm": 2.935624837875366, | |
| "learning_rate": 0.00019950044004682092, | |
| "logits/chosen": -0.357890248298645, | |
| "logits/rejected": -0.5321043729782104, | |
| "logps/chosen": -9.981462478637695, | |
| "logps/rejected": -34.8548583984375, | |
| "loss": 0.9003065228462219, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5299741625785828, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.04542495310306549, | |
| "rewards/margins": 1.7066924571990967, | |
| "rewards/rejected": -1.6612673997879028, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.011243 | |
| }, | |
| { | |
| "epoch": 0.24394844388557058, | |
| "grad_norm": 2.2122833728790283, | |
| "learning_rate": 0.0001994723260254686, | |
| "logits/chosen": -0.2592640519142151, | |
| "logits/rejected": -0.4961639940738678, | |
| "logps/chosen": -4.603950500488281, | |
| "logps/rejected": -41.2968864440918, | |
| "loss": 0.5464479923248291, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3016549050807953, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1378301978111267, | |
| "rewards/margins": 2.3867669105529785, | |
| "rewards/rejected": -2.248936653137207, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.24646337629676202, | |
| "grad_norm": 3.110325574874878, | |
| "learning_rate": 0.0001994434445073934, | |
| "logits/chosen": -0.25290989875793457, | |
| "logits/rejected": -0.5424689650535583, | |
| "logps/chosen": -3.2259504795074463, | |
| "logps/rejected": -50.58758544921875, | |
| "loss": 0.48420143127441406, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.24583308398723602, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.06779447197914124, | |
| "rewards/margins": 2.959743022918701, | |
| "rewards/rejected": -2.891948699951172, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.24897830870795348, | |
| "grad_norm": 5.068027019500732, | |
| "learning_rate": 0.00019941379571543596, | |
| "logits/chosen": -0.2531135678291321, | |
| "logits/rejected": -0.4778846800327301, | |
| "logps/chosen": -4.735211372375488, | |
| "logps/rejected": -50.30940246582031, | |
| "loss": 0.6116160750389099, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.39248543977737427, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.009140911512076855, | |
| "rewards/margins": 3.1750411987304688, | |
| "rewards/rejected": -3.1841821670532227, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.25149324111914495, | |
| "grad_norm": 5.654895305633545, | |
| "learning_rate": 0.00019938337987835688, | |
| "logits/chosen": -0.29766467213630676, | |
| "logits/rejected": -0.39502421021461487, | |
| "logps/chosen": -9.370654106140137, | |
| "logps/rejected": -37.111106872558594, | |
| "loss": 0.9719223976135254, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5046005249023438, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.21612250804901123, | |
| "rewards/margins": 2.0566141605377197, | |
| "rewards/rejected": -2.2727365493774414, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.011244 | |
| }, | |
| { | |
| "epoch": 0.2540081735303364, | |
| "grad_norm": 2.3178176879882812, | |
| "learning_rate": 0.00019935219723083502, | |
| "logits/chosen": -0.3190368115901947, | |
| "logits/rejected": -0.4808640480041504, | |
| "logps/chosen": -4.635265350341797, | |
| "logps/rejected": -46.21360397338867, | |
| "loss": 0.5798269510269165, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3243585228919983, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07786446064710617, | |
| "rewards/margins": 3.2863645553588867, | |
| "rewards/rejected": -3.2085001468658447, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.011225 | |
| }, | |
| { | |
| "epoch": 0.25652310594152783, | |
| "grad_norm": 1.5522849559783936, | |
| "learning_rate": 0.0001993202480134658, | |
| "logits/chosen": -0.3053315281867981, | |
| "logits/rejected": -0.5489925742149353, | |
| "logps/chosen": -2.3068742752075195, | |
| "logps/rejected": -59.077171325683594, | |
| "loss": 0.29376542568206787, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.15781843662261963, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14335167407989502, | |
| "rewards/margins": 4.1030802726745605, | |
| "rewards/rejected": -3.959728240966797, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.011225 | |
| }, | |
| { | |
| "epoch": 0.25903803835271927, | |
| "grad_norm": 3.088001012802124, | |
| "learning_rate": 0.0001992875324727591, | |
| "logits/chosen": -0.29225340485572815, | |
| "logits/rejected": -0.4629225730895996, | |
| "logps/chosen": -7.737708568572998, | |
| "logps/rejected": -56.16609573364258, | |
| "loss": 0.657672107219696, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4136083722114563, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.15128585696220398, | |
| "rewards/margins": 3.662168025970459, | |
| "rewards/rejected": -3.8134536743164062, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.011226 | |
| }, | |
| { | |
| "epoch": 0.2615529707639107, | |
| "grad_norm": 16.196247100830078, | |
| "learning_rate": 0.00019925405086113768, | |
| "logits/chosen": -0.24154868721961975, | |
| "logits/rejected": -0.42765212059020996, | |
| "logps/chosen": -7.00141716003418, | |
| "logps/rejected": -44.41450500488281, | |
| "loss": 0.9225707054138184, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5817552804946899, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.18904252350330353, | |
| "rewards/margins": 2.805342674255371, | |
| "rewards/rejected": -2.994385004043579, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 0.26406790317510215, | |
| "grad_norm": 4.839797496795654, | |
| "learning_rate": 0.0001992198034369349, | |
| "logits/chosen": -0.21534261107444763, | |
| "logits/rejected": -0.4093911051750183, | |
| "logps/chosen": -6.268553733825684, | |
| "logps/rejected": -44.56496047973633, | |
| "loss": 0.7437994480133057, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4600142240524292, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.12164817750453949, | |
| "rewards/margins": 2.817305088043213, | |
| "rewards/rejected": -2.695657253265381, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.011227 | |
| }, | |
| { | |
| "epoch": 0.26658283558629364, | |
| "grad_norm": 6.186526298522949, | |
| "learning_rate": 0.000199184790464393, | |
| "logits/chosen": -0.28391483426094055, | |
| "logits/rejected": -0.47835806012153625, | |
| "logps/chosen": -4.414430618286133, | |
| "logps/rejected": -35.84981155395508, | |
| "loss": 0.7718313336372375, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.451696515083313, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.061221636831760406, | |
| "rewards/margins": 2.390685558319092, | |
| "rewards/rejected": -2.3294641971588135, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 0.2690977679974851, | |
| "grad_norm": 4.50436544418335, | |
| "learning_rate": 0.00019914901221366086, | |
| "logits/chosen": -0.23250971734523773, | |
| "logits/rejected": -0.4437968134880066, | |
| "logps/chosen": -6.316987037658691, | |
| "logps/rejected": -49.236106872558594, | |
| "loss": 0.7839150428771973, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.46380385756492615, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.052675511687994, | |
| "rewards/margins": 3.1932520866394043, | |
| "rewards/rejected": -3.245927572250366, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.011229 | |
| }, | |
| { | |
| "epoch": 0.2716127004086765, | |
| "grad_norm": 3.6184003353118896, | |
| "learning_rate": 0.0001991124689607921, | |
| "logits/chosen": -0.19258703291416168, | |
| "logits/rejected": -0.43321287631988525, | |
| "logps/chosen": -7.002651691436768, | |
| "logps/rejected": -41.406925201416016, | |
| "loss": 0.8718461990356445, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5701597929000854, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0768214762210846, | |
| "rewards/margins": 2.482198715209961, | |
| "rewards/rejected": -2.559020519256592, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.27412763281986796, | |
| "grad_norm": 10.216064453125, | |
| "learning_rate": 0.00019907516098774275, | |
| "logits/chosen": -0.3110716640949249, | |
| "logits/rejected": -0.4275364577770233, | |
| "logps/chosen": -5.352696418762207, | |
| "logps/rejected": -44.723453521728516, | |
| "loss": 0.8070493340492249, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5113809704780579, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.021823018789291382, | |
| "rewards/margins": 3.496793508529663, | |
| "rewards/rejected": -3.474970579147339, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.2766425652310594, | |
| "grad_norm": 4.2641143798828125, | |
| "learning_rate": 0.00019903708858236925, | |
| "logits/chosen": -0.17137043178081512, | |
| "logits/rejected": -0.3559553623199463, | |
| "logps/chosen": -8.645333290100098, | |
| "logps/rejected": -56.14238357543945, | |
| "loss": 0.8187519311904907, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4967080354690552, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.22593286633491516, | |
| "rewards/margins": 3.5679526329040527, | |
| "rewards/rejected": -3.7938857078552246, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.27915749764225084, | |
| "grad_norm": 5.008543014526367, | |
| "learning_rate": 0.00019899825203842613, | |
| "logits/chosen": -0.22317875921726227, | |
| "logits/rejected": -0.4507110118865967, | |
| "logps/chosen": -4.583744525909424, | |
| "logps/rejected": -52.95720672607422, | |
| "loss": 0.6659380793571472, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.42531025409698486, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08066091686487198, | |
| "rewards/margins": 3.507352828979492, | |
| "rewards/rejected": -3.426692247390747, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.28167243005344234, | |
| "grad_norm": 3.2912778854370117, | |
| "learning_rate": 0.00019895865165556377, | |
| "logits/chosen": -0.20796722173690796, | |
| "logits/rejected": -0.4548439085483551, | |
| "logps/chosen": -6.193486213684082, | |
| "logps/rejected": -50.00212860107422, | |
| "loss": 0.724488377571106, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.36660081148147583, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.09731753170490265, | |
| "rewards/margins": 2.9351813793182373, | |
| "rewards/rejected": -3.032498598098755, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.2841873624646338, | |
| "grad_norm": 2.3630876541137695, | |
| "learning_rate": 0.00019891828773932604, | |
| "logits/chosen": -0.29762569069862366, | |
| "logits/rejected": -0.496326208114624, | |
| "logps/chosen": -5.607400417327881, | |
| "logps/rejected": -45.21501922607422, | |
| "loss": 0.5872230529785156, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.36216530203819275, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2503179609775543, | |
| "rewards/margins": 3.1686577796936035, | |
| "rewards/rejected": -2.918339729309082, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.2867022948758252, | |
| "grad_norm": 2.2401249408721924, | |
| "learning_rate": 0.0001988771606011481, | |
| "logits/chosen": -0.2846427857875824, | |
| "logits/rejected": -0.46442368626594543, | |
| "logps/chosen": -7.414566993713379, | |
| "logps/rejected": -38.23175048828125, | |
| "loss": 0.8090199828147888, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5426386594772339, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.0931171178817749, | |
| "rewards/margins": 2.2654707431793213, | |
| "rewards/rejected": -2.172353744506836, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.28921722728701665, | |
| "grad_norm": 2.3249471187591553, | |
| "learning_rate": 0.0001988352705583538, | |
| "logits/chosen": -0.36136990785598755, | |
| "logits/rejected": -0.49599409103393555, | |
| "logps/chosen": -6.019715785980225, | |
| "logps/rejected": -31.482872009277344, | |
| "loss": 0.716136634349823, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.38180771470069885, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07284583151340485, | |
| "rewards/margins": 1.6758012771606445, | |
| "rewards/rejected": -1.6029551029205322, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.2917321596982081, | |
| "grad_norm": 2.0250649452209473, | |
| "learning_rate": 0.0001987926179341533, | |
| "logits/chosen": -0.3277466893196106, | |
| "logits/rejected": -0.49884647130966187, | |
| "logps/chosen": -6.582662105560303, | |
| "logps/rejected": -34.93992614746094, | |
| "loss": 0.6409764289855957, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3818390965461731, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.219668447971344, | |
| "rewards/margins": 2.2215864658355713, | |
| "rewards/rejected": -2.001918315887451, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.29424709210939953, | |
| "grad_norm": 3.080130100250244, | |
| "learning_rate": 0.00019874920305764068, | |
| "logits/chosen": -0.3647570312023163, | |
| "logits/rejected": -0.5425549149513245, | |
| "logps/chosen": -4.569772720336914, | |
| "logps/rejected": -29.92070198059082, | |
| "loss": 0.733748197555542, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3840240240097046, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.09753906726837158, | |
| "rewards/margins": 1.5259737968444824, | |
| "rewards/rejected": -1.4284348487854004, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.29676202452059103, | |
| "grad_norm": 3.2526772022247314, | |
| "learning_rate": 0.00019870502626379127, | |
| "logits/chosen": -0.39825165271759033, | |
| "logits/rejected": -0.5752891898155212, | |
| "logps/chosen": -6.833606243133545, | |
| "logps/rejected": -35.04240798950195, | |
| "loss": 0.7230013012886047, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4058716297149658, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.1110297441482544, | |
| "rewards/margins": 1.915820837020874, | |
| "rewards/rejected": -2.026850461959839, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.29927695693178247, | |
| "grad_norm": 2.977874994277954, | |
| "learning_rate": 0.00019866008789345917, | |
| "logits/chosen": -0.4147549271583557, | |
| "logits/rejected": -0.5979161262512207, | |
| "logps/chosen": -5.960415363311768, | |
| "logps/rejected": -40.34906768798828, | |
| "loss": 0.6719368696212769, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.38052472472190857, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.015904245898127556, | |
| "rewards/margins": 2.2843177318573, | |
| "rewards/rejected": -2.2684133052825928, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.3017918893429739, | |
| "grad_norm": 3.058821439743042, | |
| "learning_rate": 0.00019861438829337438, | |
| "logits/chosen": -0.3485436737537384, | |
| "logits/rejected": -0.5699384808540344, | |
| "logps/chosen": -8.048928260803223, | |
| "logps/rejected": -55.26435852050781, | |
| "loss": 0.8104152083396912, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5313911437988281, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08313308656215668, | |
| "rewards/margins": 3.3404150009155273, | |
| "rewards/rejected": -3.257282257080078, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.30430682175416535, | |
| "grad_norm": 2.809389591217041, | |
| "learning_rate": 0.00019856792781614054, | |
| "logits/chosen": -0.40515586733818054, | |
| "logits/rejected": -0.6652223467826843, | |
| "logps/chosen": -2.280519962310791, | |
| "logps/rejected": -50.222084045410156, | |
| "loss": 0.45217883586883545, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.26132771372795105, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1198212057352066, | |
| "rewards/margins": 3.28947114944458, | |
| "rewards/rejected": -3.169650077819824, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.3068217541653568, | |
| "grad_norm": 3.070807456970215, | |
| "learning_rate": 0.00019852070682023176, | |
| "logits/chosen": -0.4808189272880554, | |
| "logits/rejected": -0.6974934339523315, | |
| "logps/chosen": -7.208076477050781, | |
| "logps/rejected": -52.298465728759766, | |
| "loss": 0.5899146795272827, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.42121508717536926, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16679850220680237, | |
| "rewards/margins": 3.6304702758789062, | |
| "rewards/rejected": -3.4636716842651367, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.3093366865765483, | |
| "grad_norm": 2.8824384212493896, | |
| "learning_rate": 0.00019847272566999026, | |
| "logits/chosen": -0.49758437275886536, | |
| "logits/rejected": -0.6554095149040222, | |
| "logps/chosen": -10.397936820983887, | |
| "logps/rejected": -42.242393493652344, | |
| "loss": 0.8943163156509399, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5859109163284302, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0896286740899086, | |
| "rewards/margins": 2.782667875289917, | |
| "rewards/rejected": -2.6930387020111084, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.3118516189877397, | |
| "grad_norm": 2.103641986846924, | |
| "learning_rate": 0.0001984239847356233, | |
| "logits/chosen": -0.5333049297332764, | |
| "logits/rejected": -0.6946154832839966, | |
| "logps/chosen": -4.652249336242676, | |
| "logps/rejected": -53.446041107177734, | |
| "loss": 0.5551345944404602, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3173026144504547, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0959150567650795, | |
| "rewards/margins": 4.159012794494629, | |
| "rewards/rejected": -4.063097953796387, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.31436655139893116, | |
| "grad_norm": 2.719147205352783, | |
| "learning_rate": 0.00019837448439320027, | |
| "logits/chosen": -0.5486172437667847, | |
| "logits/rejected": -0.7822794318199158, | |
| "logps/chosen": -3.360109567642212, | |
| "logps/rejected": -77.09004211425781, | |
| "loss": 0.4081324338912964, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.27365225553512573, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09313642978668213, | |
| "rewards/margins": 6.103594779968262, | |
| "rewards/rejected": -6.010458469390869, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.3168814838101226, | |
| "grad_norm": 3.821580410003662, | |
| "learning_rate": 0.0001983242250246501, | |
| "logits/chosen": -0.49823230504989624, | |
| "logits/rejected": -0.746193528175354, | |
| "logps/chosen": -8.326932907104492, | |
| "logps/rejected": -85.3308334350586, | |
| "loss": 0.6026039719581604, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.48026546835899353, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.15297873318195343, | |
| "rewards/margins": 6.628488063812256, | |
| "rewards/rejected": -6.781466484069824, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.31939641622131404, | |
| "grad_norm": 2.334726333618164, | |
| "learning_rate": 0.00019827320701775806, | |
| "logits/chosen": -0.4417359530925751, | |
| "logits/rejected": -0.6943372488021851, | |
| "logps/chosen": -5.183182716369629, | |
| "logps/rejected": -74.23169708251953, | |
| "loss": 0.5311453938484192, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.31170862913131714, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06631641089916229, | |
| "rewards/margins": 5.296952724456787, | |
| "rewards/rejected": -5.2306365966796875, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.3219113486325055, | |
| "grad_norm": 3.0242960453033447, | |
| "learning_rate": 0.0001982214307661627, | |
| "logits/chosen": -0.39977923035621643, | |
| "logits/rejected": -0.6834134459495544, | |
| "logps/chosen": -4.503589153289795, | |
| "logps/rejected": -70.66866302490234, | |
| "loss": 0.5889554619789124, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3487299084663391, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18435406684875488, | |
| "rewards/margins": 5.4617156982421875, | |
| "rewards/rejected": -5.277361869812012, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.324426281043697, | |
| "grad_norm": 2.191619396209717, | |
| "learning_rate": 0.00019816889666935317, | |
| "logits/chosen": -0.3248615860939026, | |
| "logits/rejected": -0.6416115164756775, | |
| "logps/chosen": -6.371191024780273, | |
| "logps/rejected": -76.59197998046875, | |
| "loss": 0.4878350794315338, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.33031994104385376, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13981086015701294, | |
| "rewards/margins": 5.163226127624512, | |
| "rewards/rejected": -5.0234150886535645, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.3269412134548884, | |
| "grad_norm": 3.211867570877075, | |
| "learning_rate": 0.00019811560513266572, | |
| "logits/chosen": -0.3845720887184143, | |
| "logits/rejected": -0.6389954090118408, | |
| "logps/chosen": -5.841503620147705, | |
| "logps/rejected": -71.1533203125, | |
| "loss": 0.586833655834198, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3950338065624237, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09367645531892776, | |
| "rewards/margins": 5.478381156921387, | |
| "rewards/rejected": -5.384705066680908, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.32945614586607985, | |
| "grad_norm": 9.350093841552734, | |
| "learning_rate": 0.00019806155656728084, | |
| "logits/chosen": -0.2960500419139862, | |
| "logits/rejected": -0.6573159098625183, | |
| "logps/chosen": -9.058235168457031, | |
| "logps/rejected": -103.11417388916016, | |
| "loss": 0.9421167373657227, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.7972053289413452, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.26350751519203186, | |
| "rewards/margins": 7.675902366638184, | |
| "rewards/rejected": -7.939410209655762, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.3319710782772713, | |
| "grad_norm": 5.248542308807373, | |
| "learning_rate": 0.00019800675139022006, | |
| "logits/chosen": -0.47517600655555725, | |
| "logits/rejected": -0.6538941264152527, | |
| "logps/chosen": -9.417102813720703, | |
| "logps/rejected": -74.27867126464844, | |
| "loss": 0.6414040327072144, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3988567888736725, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.300504595041275, | |
| "rewards/margins": 5.568276405334473, | |
| "rewards/rejected": -5.868781089782715, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.33448601068846273, | |
| "grad_norm": 3.997988224029541, | |
| "learning_rate": 0.00019795119002434262, | |
| "logits/chosen": -0.47632429003715515, | |
| "logits/rejected": -0.6377424001693726, | |
| "logps/chosen": -6.212442874908447, | |
| "logps/rejected": -72.35940551757812, | |
| "loss": 0.6233670711517334, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.36861366033554077, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04314713925123215, | |
| "rewards/margins": 5.591425895690918, | |
| "rewards/rejected": -5.548279285430908, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.33700094309965417, | |
| "grad_norm": 2.701449394226074, | |
| "learning_rate": 0.00019789487289834228, | |
| "logits/chosen": -0.35887065529823303, | |
| "logits/rejected": -0.5933378338813782, | |
| "logps/chosen": -3.4826135635375977, | |
| "logps/rejected": -62.30265808105469, | |
| "loss": 0.4813486635684967, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.28860440850257874, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1144554391503334, | |
| "rewards/margins": 4.846682548522949, | |
| "rewards/rejected": -4.732227325439453, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.33951587551084567, | |
| "grad_norm": 1.554006814956665, | |
| "learning_rate": 0.000197837800446744, | |
| "logits/chosen": -0.26935291290283203, | |
| "logits/rejected": -0.6075947284698486, | |
| "logps/chosen": -5.505460262298584, | |
| "logps/rejected": -90.5344467163086, | |
| "loss": 0.36852002143859863, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.22335653007030487, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.009416868910193443, | |
| "rewards/margins": 6.831361770629883, | |
| "rewards/rejected": -6.840778350830078, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.3420308079220371, | |
| "grad_norm": 2.480741024017334, | |
| "learning_rate": 0.00019777997310990063, | |
| "logits/chosen": -0.3000340461730957, | |
| "logits/rejected": -0.6057184338569641, | |
| "logps/chosen": -3.0569756031036377, | |
| "logps/rejected": -74.86396789550781, | |
| "loss": 0.4303661286830902, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.29833856225013733, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10127638280391693, | |
| "rewards/margins": 5.511883735656738, | |
| "rewards/rejected": -5.410606861114502, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.34454574033322855, | |
| "grad_norm": 4.56061315536499, | |
| "learning_rate": 0.00019772139133398942, | |
| "logits/chosen": -0.3569238781929016, | |
| "logits/rejected": -0.5552278161048889, | |
| "logps/chosen": -6.037662506103516, | |
| "logps/rejected": -72.8807373046875, | |
| "loss": 0.5785601139068604, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3691541850566864, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.07385054975748062, | |
| "rewards/margins": 5.239901542663574, | |
| "rewards/rejected": -5.313753128051758, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.34706067274442, | |
| "grad_norm": 3.128384828567505, | |
| "learning_rate": 0.00019766205557100868, | |
| "logits/chosen": -0.45258647203445435, | |
| "logits/rejected": -0.6256503462791443, | |
| "logps/chosen": -6.615728855133057, | |
| "logps/rejected": -54.988853454589844, | |
| "loss": 0.6647377014160156, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4122207760810852, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1877025067806244, | |
| "rewards/margins": 4.346957206726074, | |
| "rewards/rejected": -4.159254550933838, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.3495756051556114, | |
| "grad_norm": 3.3702149391174316, | |
| "learning_rate": 0.00019760196627877422, | |
| "logits/chosen": -0.22564947605133057, | |
| "logits/rejected": -0.6019137501716614, | |
| "logps/chosen": -2.935713052749634, | |
| "logps/rejected": -91.22589111328125, | |
| "loss": 0.4306371212005615, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.2682075500488281, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.09053624421358109, | |
| "rewards/margins": 6.857407569885254, | |
| "rewards/rejected": -6.766871452331543, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.3520905375668029, | |
| "grad_norm": 17.25383949279785, | |
| "learning_rate": 0.0001975411239209158, | |
| "logits/chosen": -0.4722020626068115, | |
| "logits/rejected": -0.5809731483459473, | |
| "logps/chosen": -11.125019073486328, | |
| "logps/rejected": -47.38395690917969, | |
| "loss": 1.216600775718689, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.792304515838623, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.23399552702903748, | |
| "rewards/margins": 3.3990795612335205, | |
| "rewards/rejected": -3.63307523727417, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.35460546997799436, | |
| "grad_norm": 3.727832794189453, | |
| "learning_rate": 0.0001974795289668737, | |
| "logits/chosen": -0.35420382022857666, | |
| "logits/rejected": -0.718546986579895, | |
| "logps/chosen": -7.968466758728027, | |
| "logps/rejected": -91.39598846435547, | |
| "loss": 0.7644503712654114, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.6175839900970459, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.3464764654636383, | |
| "rewards/margins": 6.540220737457275, | |
| "rewards/rejected": -6.886697292327881, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.3571204023891858, | |
| "grad_norm": 13.208379745483398, | |
| "learning_rate": 0.00019741718189189485, | |
| "logits/chosen": -0.41622060537338257, | |
| "logits/rejected": -0.6492832899093628, | |
| "logps/chosen": -6.71783447265625, | |
| "logps/rejected": -69.75479888916016, | |
| "loss": 0.8267927169799805, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5884179472923279, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.1379324495792389, | |
| "rewards/margins": 4.956573963165283, | |
| "rewards/rejected": -5.094506740570068, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.35963533480037724, | |
| "grad_norm": 4.856459617614746, | |
| "learning_rate": 0.00019735408317702948, | |
| "logits/chosen": -0.4186263382434845, | |
| "logits/rejected": -0.6451130509376526, | |
| "logps/chosen": -4.069480895996094, | |
| "logps/rejected": -62.28482437133789, | |
| "loss": 0.4998188018798828, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3359423875808716, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.012309092096984386, | |
| "rewards/margins": 4.688631057739258, | |
| "rewards/rejected": -4.676321983337402, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.3621502672115687, | |
| "grad_norm": 4.043496608734131, | |
| "learning_rate": 0.0001972902333091271, | |
| "logits/chosen": -0.3931187391281128, | |
| "logits/rejected": -0.5637274384498596, | |
| "logps/chosen": -8.15110969543457, | |
| "logps/rejected": -48.92616271972656, | |
| "loss": 0.7109068632125854, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4194295108318329, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.008020445704460144, | |
| "rewards/margins": 3.4844448566436768, | |
| "rewards/rejected": -3.476424217224121, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.3646651996227601, | |
| "grad_norm": 3.2291014194488525, | |
| "learning_rate": 0.00019722563278083287, | |
| "logits/chosen": -0.3712625503540039, | |
| "logits/rejected": -0.6469380855560303, | |
| "logps/chosen": -2.269747734069824, | |
| "logps/rejected": -41.929664611816406, | |
| "loss": 0.4003128111362457, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.182529017329216, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18503372371196747, | |
| "rewards/margins": 2.92374849319458, | |
| "rewards/rejected": -2.7387146949768066, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.3671801320339516, | |
| "grad_norm": 4.1039204597473145, | |
| "learning_rate": 0.00019716028209058387, | |
| "logits/chosen": -0.44887417554855347, | |
| "logits/rejected": -0.6388370990753174, | |
| "logps/chosen": -5.760115623474121, | |
| "logps/rejected": -43.50143051147461, | |
| "loss": 0.7498366236686707, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.48517200350761414, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.02230704203248024, | |
| "rewards/margins": 2.708374500274658, | |
| "rewards/rejected": -2.7306814193725586, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.36969506444514305, | |
| "grad_norm": 3.1436734199523926, | |
| "learning_rate": 0.0001970941817426052, | |
| "logits/chosen": -0.31916379928588867, | |
| "logits/rejected": -0.577805757522583, | |
| "logps/chosen": -3.4299936294555664, | |
| "logps/rejected": -47.918155670166016, | |
| "loss": 0.4161657989025116, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.21494346857070923, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14184261858463287, | |
| "rewards/margins": 2.971557855606079, | |
| "rewards/rejected": -2.8297150135040283, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.3722099968563345, | |
| "grad_norm": 2.7959487438201904, | |
| "learning_rate": 0.00019702733224690605, | |
| "logits/chosen": -0.43002602458000183, | |
| "logits/rejected": -0.6337836980819702, | |
| "logps/chosen": -8.148699760437012, | |
| "logps/rejected": -42.15251922607422, | |
| "loss": 0.7381757497787476, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4981796443462372, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.013383438810706139, | |
| "rewards/margins": 2.8139827251434326, | |
| "rewards/rejected": -2.8273658752441406, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.37472492926752593, | |
| "grad_norm": 1.9313372373580933, | |
| "learning_rate": 0.00019695973411927578, | |
| "logits/chosen": -0.500542402267456, | |
| "logits/rejected": -0.7104104161262512, | |
| "logps/chosen": -2.929166316986084, | |
| "logps/rejected": -54.1365966796875, | |
| "loss": 0.42066073417663574, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.22536346316337585, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.06520625203847885, | |
| "rewards/margins": 3.698242664337158, | |
| "rewards/rejected": -3.6330366134643555, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.37723986167871737, | |
| "grad_norm": 1.9907225370407104, | |
| "learning_rate": 0.00019689138788127995, | |
| "logits/chosen": -0.49561041593551636, | |
| "logits/rejected": -0.6665260195732117, | |
| "logps/chosen": -5.222489356994629, | |
| "logps/rejected": -42.92105484008789, | |
| "loss": 0.6262026429176331, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.385796457529068, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09229743480682373, | |
| "rewards/margins": 3.072531223297119, | |
| "rewards/rejected": -2.980233669281006, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.3797547940899088, | |
| "grad_norm": 3.5840723514556885, | |
| "learning_rate": 0.00019682229406025635, | |
| "logits/chosen": -0.4681642949581146, | |
| "logits/rejected": -0.6473852396011353, | |
| "logps/chosen": -8.059581756591797, | |
| "logps/rejected": -54.22500228881836, | |
| "loss": 0.6054436564445496, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.38610902428627014, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.097575843334198, | |
| "rewards/margins": 3.8078057765960693, | |
| "rewards/rejected": -3.7102296352386475, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 0.3822697265011003, | |
| "grad_norm": 4.087256908416748, | |
| "learning_rate": 0.00019675245318931083, | |
| "logits/chosen": -0.5369412899017334, | |
| "logits/rejected": -0.749391496181488, | |
| "logps/chosen": -9.42272663116455, | |
| "logps/rejected": -59.544307708740234, | |
| "loss": 0.6138618588447571, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.4435786008834839, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.10584679991006851, | |
| "rewards/margins": 4.319212436676025, | |
| "rewards/rejected": -4.425059795379639, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.011228 | |
| }, | |
| { | |
| "epoch": 0.38478465891229174, | |
| "grad_norm": 7.815120697021484, | |
| "learning_rate": 0.0001966818658073133, | |
| "logits/chosen": -0.6010515689849854, | |
| "logits/rejected": -0.7820409536361694, | |
| "logps/chosen": -7.579458713531494, | |
| "logps/rejected": -62.63882064819336, | |
| "loss": 0.709304928779602, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5141942501068115, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.13567981123924255, | |
| "rewards/margins": 4.736479759216309, | |
| "rewards/rejected": -4.872159481048584, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.011229 | |
| }, | |
| { | |
| "epoch": 0.3872995913234832, | |
| "grad_norm": 7.4138031005859375, | |
| "learning_rate": 0.0001966105324588934, | |
| "logits/chosen": -0.5685268640518188, | |
| "logits/rejected": -0.7353744506835938, | |
| "logps/chosen": -11.372655868530273, | |
| "logps/rejected": -61.317073822021484, | |
| "loss": 0.8202418684959412, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.583480715751648, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.05895308405160904, | |
| "rewards/margins": 4.791215419769287, | |
| "rewards/rejected": -4.73226261138916, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.011229 | |
| }, | |
| { | |
| "epoch": 0.3898145237346746, | |
| "grad_norm": 2.7024075984954834, | |
| "learning_rate": 0.00019653845369443657, | |
| "logits/chosen": -0.4999295175075531, | |
| "logits/rejected": -0.7417422533035278, | |
| "logps/chosen": -6.620236873626709, | |
| "logps/rejected": -70.78112030029297, | |
| "loss": 0.6438719034194946, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.5055179595947266, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.060695331543684006, | |
| "rewards/margins": 5.345253944396973, | |
| "rewards/rejected": -5.284558296203613, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.011229 | |
| }, | |
| { | |
| "epoch": 0.39232945614586606, | |
| "grad_norm": 4.160597801208496, | |
| "learning_rate": 0.00019646563007007952, | |
| "logits/chosen": -0.5322343707084656, | |
| "logits/rejected": -0.7421768307685852, | |
| "logps/chosen": -6.158726215362549, | |
| "logps/rejected": -47.234554290771484, | |
| "loss": 0.6948550343513489, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.41276055574417114, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.09865140169858932, | |
| "rewards/margins": 2.9533112049102783, | |
| "rewards/rejected": -3.0519626140594482, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.3948443885570575, | |
| "grad_norm": 4.034154891967773, | |
| "learning_rate": 0.00019639206214770608, | |
| "logits/chosen": -0.5310461521148682, | |
| "logits/rejected": -0.7443493008613586, | |
| "logps/chosen": -3.5962212085723877, | |
| "logps/rejected": -53.00592803955078, | |
| "loss": 0.48415228724479675, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.2999834716320038, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.020860865712165833, | |
| "rewards/margins": 3.5892655849456787, | |
| "rewards/rejected": -3.5684046745300293, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.397359320968249, | |
| "grad_norm": 9.343074798583984, | |
| "learning_rate": 0.00019631775049494285, | |
| "logits/chosen": -0.44315972924232483, | |
| "logits/rejected": -0.7157086730003357, | |
| "logps/chosen": -4.082563400268555, | |
| "logps/rejected": -64.51760864257812, | |
| "loss": 0.5230289697647095, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.2998603284358978, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.021998610347509384, | |
| "rewards/margins": 3.9378349781036377, | |
| "rewards/rejected": -3.959833860397339, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.39987425337944044, | |
| "grad_norm": 2.403951644897461, | |
| "learning_rate": 0.00019624269568515486, | |
| "logits/chosen": -0.4427807629108429, | |
| "logits/rejected": -0.674246072769165, | |
| "logps/chosen": -5.679157257080078, | |
| "logps/rejected": -46.368919372558594, | |
| "loss": 0.5779350996017456, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.39234140515327454, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11242523044347763, | |
| "rewards/margins": 2.7115559577941895, | |
| "rewards/rejected": -2.599130630493164, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.4023891857906319, | |
| "grad_norm": 3.0051136016845703, | |
| "learning_rate": 0.00019616689829744105, | |
| "logits/chosen": -0.595456600189209, | |
| "logits/rejected": -0.7742252945899963, | |
| "logps/chosen": -6.239538669586182, | |
| "logps/rejected": -36.2790641784668, | |
| "loss": 0.6849649548530579, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.43636244535446167, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12961390614509583, | |
| "rewards/margins": 2.334453821182251, | |
| "rewards/rejected": -2.2048397064208984, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.01123 | |
| }, | |
| { | |
| "epoch": 0.4049041182018233, | |
| "grad_norm": 4.199156761169434, | |
| "learning_rate": 0.0001960903589166299, | |
| "logits/chosen": -0.6130431890487671, | |
| "logits/rejected": -0.6931115388870239, | |
| "logps/chosen": -8.752334594726562, | |
| "logps/rejected": -42.808692932128906, | |
| "loss": 0.6933425664901733, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.39625656604766846, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2133105993270874, | |
| "rewards/margins": 3.1959619522094727, | |
| "rewards/rejected": -2.9826512336730957, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.40741905061301475, | |
| "grad_norm": 4.59311056137085, | |
| "learning_rate": 0.00019601307813327482, | |
| "logits/chosen": -0.5155867338180542, | |
| "logits/rejected": -0.6933278441429138, | |
| "logps/chosen": -3.984743595123291, | |
| "logps/rejected": -44.87555694580078, | |
| "loss": 0.6113356351852417, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3314781188964844, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04041612148284912, | |
| "rewards/margins": 2.863827705383301, | |
| "rewards/rejected": -2.8234119415283203, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.40993398302420625, | |
| "grad_norm": 2.7300822734832764, | |
| "learning_rate": 0.00019593505654364965, | |
| "logits/chosen": -0.4362912178039551, | |
| "logits/rejected": -0.6915664076805115, | |
| "logps/chosen": -3.529961585998535, | |
| "logps/rejected": -61.31735610961914, | |
| "loss": 0.4943440556526184, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3457809090614319, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.07190480828285217, | |
| "rewards/margins": 4.230862617492676, | |
| "rewards/rejected": -4.158957481384277, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.4124489154353977, | |
| "grad_norm": 1.3495978116989136, | |
| "learning_rate": 0.00019585629474974415, | |
| "logits/chosen": -0.3829024136066437, | |
| "logits/rejected": -0.7348803877830505, | |
| "logps/chosen": -0.20720741152763367, | |
| "logps/rejected": -75.26912689208984, | |
| "loss": 0.09561214596033096, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.0268473532050848, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.11308196187019348, | |
| "rewards/margins": 5.472672462463379, | |
| "rewards/rejected": -5.359590530395508, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.41496384784658913, | |
| "grad_norm": 2.3953280448913574, | |
| "learning_rate": 0.0001957767933592591, | |
| "logits/chosen": -0.49378660321235657, | |
| "logits/rejected": -0.6871320009231567, | |
| "logps/chosen": -5.856287002563477, | |
| "logps/rejected": -55.68489456176758, | |
| "loss": 0.5843676924705505, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.3655776381492615, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0030907923355698586, | |
| "rewards/margins": 4.014834403991699, | |
| "rewards/rejected": -4.017925262451172, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.41747878025778057, | |
| "grad_norm": 5.787476062774658, | |
| "learning_rate": 0.00019569655298560195, | |
| "logits/chosen": -0.4845959544181824, | |
| "logits/rejected": -0.725760281085968, | |
| "logps/chosen": -3.9740681648254395, | |
| "logps/rejected": -63.2627067565918, | |
| "loss": 0.4704618752002716, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.34831976890563965, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09146178513765335, | |
| "rewards/margins": 4.952096939086914, | |
| "rewards/rejected": -4.860634803771973, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.419993712668972, | |
| "grad_norm": 2.719466209411621, | |
| "learning_rate": 0.0001956155742478817, | |
| "logits/chosen": -0.4632588326931, | |
| "logits/rejected": -0.7149248123168945, | |
| "logps/chosen": -2.24023175239563, | |
| "logps/rejected": -70.20541381835938, | |
| "loss": 0.28046005964279175, | |
| "memory(GiB)": 42.51, | |
| "nll_loss": 0.18644680082798004, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19088204205036163, | |
| "rewards/margins": 5.480358123779297, | |
| "rewards/rejected": -5.289475917816162, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.42250864508016345, | |
| "grad_norm": 3.770395517349243, | |
| "learning_rate": 0.00019553385777090458, | |
| "logits/chosen": -0.43829765915870667, | |
| "logits/rejected": -0.7132550477981567, | |
| "logps/chosen": -9.330952644348145, | |
| "logps/rejected": -72.52558135986328, | |
| "loss": 0.5571638941764832, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.46076467633247375, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10896007716655731, | |
| "rewards/margins": 5.002399444580078, | |
| "rewards/rejected": -4.893439292907715, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.42502357749135494, | |
| "grad_norm": 13.122285842895508, | |
| "learning_rate": 0.00019545140418516873, | |
| "logits/chosen": -0.628214418888092, | |
| "logits/rejected": -0.7334375977516174, | |
| "logps/chosen": -7.368585586547852, | |
| "logps/rejected": -48.79350662231445, | |
| "loss": 0.7424007654190063, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.5702238082885742, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07907923310995102, | |
| "rewards/margins": 3.957150459289551, | |
| "rewards/rejected": -3.8780713081359863, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.4275385099025464, | |
| "grad_norm": 2.2032506465911865, | |
| "learning_rate": 0.0001953682141268598, | |
| "logits/chosen": -0.4527589678764343, | |
| "logits/rejected": -0.6895320415496826, | |
| "logps/chosen": -3.53696870803833, | |
| "logps/rejected": -64.63774871826172, | |
| "loss": 0.35415133833885193, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.22634199261665344, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.032016728073358536, | |
| "rewards/margins": 4.734713077545166, | |
| "rewards/rejected": -4.702696800231934, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.4300534423137378, | |
| "grad_norm": 2.4580419063568115, | |
| "learning_rate": 0.00019528428823784567, | |
| "logits/chosen": -0.37069255113601685, | |
| "logits/rejected": -0.7563280463218689, | |
| "logps/chosen": -2.2511513233184814, | |
| "logps/rejected": -86.21305847167969, | |
| "loss": 0.22136372327804565, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.18806159496307373, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.13967791199684143, | |
| "rewards/margins": 6.765411853790283, | |
| "rewards/rejected": -6.625734329223633, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.43256837472492926, | |
| "grad_norm": 2.1516947746276855, | |
| "learning_rate": 0.0001951996271656717, | |
| "logits/chosen": -0.5217421650886536, | |
| "logits/rejected": -0.7590201497077942, | |
| "logps/chosen": -4.64290714263916, | |
| "logps/rejected": -64.5576171875, | |
| "loss": 0.4696881175041199, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3352178931236267, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.0438573844730854, | |
| "rewards/margins": 4.907254695892334, | |
| "rewards/rejected": -4.863397598266602, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.4350833071361207, | |
| "grad_norm": 3.411616563796997, | |
| "learning_rate": 0.00019511423156355577, | |
| "logits/chosen": -0.4631859362125397, | |
| "logits/rejected": -0.7260483503341675, | |
| "logps/chosen": -5.667875289916992, | |
| "logps/rejected": -75.57254028320312, | |
| "loss": 0.35108137130737305, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.30264440178871155, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.08381501585245132, | |
| "rewards/margins": 5.755500793457031, | |
| "rewards/rejected": -5.671685695648193, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.43759823954731214, | |
| "grad_norm": 4.192603588104248, | |
| "learning_rate": 0.00019502810209038303, | |
| "logits/chosen": -0.5316020250320435, | |
| "logits/rejected": -0.6840960383415222, | |
| "logps/chosen": -10.37562084197998, | |
| "logps/rejected": -67.83643341064453, | |
| "loss": 1.085424542427063, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.7863109111785889, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.0769924521446228, | |
| "rewards/margins": 4.868200778961182, | |
| "rewards/rejected": -4.945193767547607, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.44011317195850364, | |
| "grad_norm": 4.43406343460083, | |
| "learning_rate": 0.00019494123941070108, | |
| "logits/chosen": -0.6808348894119263, | |
| "logits/rejected": -0.7925645112991333, | |
| "logps/chosen": -7.7486252784729, | |
| "logps/rejected": -48.33315658569336, | |
| "loss": 0.9540278911590576, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.7564924955368042, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.1413968950510025, | |
| "rewards/margins": 3.6723074913024902, | |
| "rewards/rejected": -3.813704013824463, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.4426281043696951, | |
| "grad_norm": 6.438490867614746, | |
| "learning_rate": 0.00019485364419471454, | |
| "logits/chosen": -0.6449403762817383, | |
| "logits/rejected": -0.7584658861160278, | |
| "logps/chosen": -6.1986799240112305, | |
| "logps/rejected": -49.09370422363281, | |
| "loss": 0.6880564093589783, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.38199642300605774, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.20061062276363373, | |
| "rewards/margins": 3.613797426223755, | |
| "rewards/rejected": -3.814408302307129, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.4451430367808865, | |
| "grad_norm": 2.3246142864227295, | |
| "learning_rate": 0.00019476531711828027, | |
| "logits/chosen": -0.524186372756958, | |
| "logits/rejected": -0.6847387552261353, | |
| "logps/chosen": -6.170748710632324, | |
| "logps/rejected": -58.475975036621094, | |
| "loss": 0.4086158275604248, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.2584584057331085, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.07990145683288574, | |
| "rewards/margins": 4.2991790771484375, | |
| "rewards/rejected": -4.219277381896973, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.44765796919207795, | |
| "grad_norm": 4.515077590942383, | |
| "learning_rate": 0.00019467625886290167, | |
| "logits/chosen": -0.5108579993247986, | |
| "logits/rejected": -0.6950021386146545, | |
| "logps/chosen": -14.55732250213623, | |
| "logps/rejected": -50.92564392089844, | |
| "loss": 0.9052462577819824, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.6600362062454224, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.2508185803890228, | |
| "rewards/margins": 3.1151885986328125, | |
| "rewards/rejected": -3.366007089614868, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.4501729016032694, | |
| "grad_norm": 4.742927074432373, | |
| "learning_rate": 0.0001945864701157239, | |
| "logits/chosen": -0.5691394805908203, | |
| "logits/rejected": -0.6816927790641785, | |
| "logps/chosen": -4.945348262786865, | |
| "logps/rejected": -41.207801818847656, | |
| "loss": 0.6003872752189636, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3502579927444458, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07804224640130997, | |
| "rewards/margins": 2.8702170848846436, | |
| "rewards/rejected": -2.792174816131592, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.4526878340144609, | |
| "grad_norm": 2.001896619796753, | |
| "learning_rate": 0.00019449595156952827, | |
| "logits/chosen": -0.5839424133300781, | |
| "logits/rejected": -0.7141891717910767, | |
| "logps/chosen": -7.824261665344238, | |
| "logps/rejected": -42.13900375366211, | |
| "loss": 0.5872877240180969, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3686111569404602, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15194831788539886, | |
| "rewards/margins": 2.942096710205078, | |
| "rewards/rejected": -2.7901487350463867, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.4552027664256523, | |
| "grad_norm": 2.7639639377593994, | |
| "learning_rate": 0.00019440470392272696, | |
| "logits/chosen": -0.5639482736587524, | |
| "logits/rejected": -0.682327151298523, | |
| "logps/chosen": -4.094886302947998, | |
| "logps/rejected": -37.27549362182617, | |
| "loss": 0.5251520872116089, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3160794675350189, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.16162550449371338, | |
| "rewards/margins": 2.7334065437316895, | |
| "rewards/rejected": -2.5717809200286865, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.45771769883684377, | |
| "grad_norm": 3.3179478645324707, | |
| "learning_rate": 0.00019431272787935773, | |
| "logits/chosen": -0.4620465636253357, | |
| "logits/rejected": -0.7069180011749268, | |
| "logps/chosen": -10.247895240783691, | |
| "logps/rejected": -44.85274887084961, | |
| "loss": 0.895711362361908, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.6755833625793457, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.08936743438243866, | |
| "rewards/margins": 2.546542167663574, | |
| "rewards/rejected": -2.457174777984619, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.4602326312480352, | |
| "grad_norm": 1.921773910522461, | |
| "learning_rate": 0.00019422002414907837, | |
| "logits/chosen": -0.5177928805351257, | |
| "logits/rejected": -0.6913548707962036, | |
| "logps/chosen": -5.233502388000488, | |
| "logps/rejected": -40.59012985229492, | |
| "loss": 0.5152122974395752, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.34400492906570435, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14941944181919098, | |
| "rewards/margins": 2.640808582305908, | |
| "rewards/rejected": -2.491389513015747, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.46274756365922665, | |
| "grad_norm": 4.714654922485352, | |
| "learning_rate": 0.00019412659344716124, | |
| "logits/chosen": -0.5423455834388733, | |
| "logits/rejected": -0.6348575949668884, | |
| "logps/chosen": -10.46619987487793, | |
| "logps/rejected": -40.417510986328125, | |
| "loss": 0.974522054195404, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.6639810800552368, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.15414148569107056, | |
| "rewards/margins": 2.581968307495117, | |
| "rewards/rejected": -2.736109972000122, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.4652624960704181, | |
| "grad_norm": 1.0332216024398804, | |
| "learning_rate": 0.00019403243649448787, | |
| "logits/chosen": -0.4484131336212158, | |
| "logits/rejected": -0.7438564896583557, | |
| "logps/chosen": -2.097586154937744, | |
| "logps/rejected": -52.63762664794922, | |
| "loss": 0.2517527937889099, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.15005721151828766, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.27270805835723877, | |
| "rewards/margins": 3.6738533973693848, | |
| "rewards/rejected": -3.4011456966400146, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.4677774284816096, | |
| "grad_norm": 6.869028091430664, | |
| "learning_rate": 0.00019393755401754322, | |
| "logits/chosen": -0.495494544506073, | |
| "logits/rejected": -0.7087106108665466, | |
| "logps/chosen": -5.248052597045898, | |
| "logps/rejected": -53.633941650390625, | |
| "loss": 0.7538958787918091, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.489072322845459, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.09345913678407669, | |
| "rewards/margins": 3.6751837730407715, | |
| "rewards/rejected": -3.7686429023742676, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.470292360892801, | |
| "grad_norm": 8.480405807495117, | |
| "learning_rate": 0.00019384194674841026, | |
| "logits/chosen": -0.5885705947875977, | |
| "logits/rejected": -0.771264910697937, | |
| "logps/chosen": -8.139009475708008, | |
| "logps/rejected": -56.5067253112793, | |
| "loss": 0.9823139905929565, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.8092753291130066, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.3364828824996948, | |
| "rewards/margins": 4.044948577880859, | |
| "rewards/rejected": -4.381431579589844, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.47280729330399246, | |
| "grad_norm": 5.539621829986572, | |
| "learning_rate": 0.0001937456154247641, | |
| "logits/chosen": -0.5992149114608765, | |
| "logits/rejected": -0.7545720934867859, | |
| "logps/chosen": -5.675577640533447, | |
| "logps/rejected": -53.787532806396484, | |
| "loss": 0.4309059977531433, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3199475407600403, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.08290509879589081, | |
| "rewards/margins": 3.8106563091278076, | |
| "rewards/rejected": -3.893561601638794, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.4753222257151839, | |
| "grad_norm": 7.750495910644531, | |
| "learning_rate": 0.00019364856078986652, | |
| "logits/chosen": -0.5513782501220703, | |
| "logits/rejected": -0.6628525853157043, | |
| "logps/chosen": -13.800762176513672, | |
| "logps/rejected": -49.375457763671875, | |
| "loss": 1.059139370918274, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.7687480449676514, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.11855825036764145, | |
| "rewards/margins": 3.4539475440979004, | |
| "rewards/rejected": -3.5725057125091553, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.47783715812637534, | |
| "grad_norm": 2.178455352783203, | |
| "learning_rate": 0.0001935507835925601, | |
| "logits/chosen": -0.5001492500305176, | |
| "logits/rejected": -0.683919370174408, | |
| "logps/chosen": -5.1807756423950195, | |
| "logps/rejected": -48.025428771972656, | |
| "loss": 0.4980285167694092, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3027910590171814, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.057751405984163284, | |
| "rewards/margins": 3.4277446269989014, | |
| "rewards/rejected": -3.3699934482574463, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.4803520905375668, | |
| "grad_norm": 2.17415714263916, | |
| "learning_rate": 0.00019345228458726252, | |
| "logits/chosen": -0.4294896423816681, | |
| "logits/rejected": -0.624671459197998, | |
| "logps/chosen": -6.253881454467773, | |
| "logps/rejected": -50.155250549316406, | |
| "loss": 0.5238272547721863, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3330422341823578, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.024177849292755127, | |
| "rewards/margins": 2.913661003112793, | |
| "rewards/rejected": -2.8894832134246826, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.4828670229487583, | |
| "grad_norm": 5.977149486541748, | |
| "learning_rate": 0.00019335306453396064, | |
| "logits/chosen": -0.33437275886535645, | |
| "logits/rejected": -0.5742294788360596, | |
| "logps/chosen": -4.437854290008545, | |
| "logps/rejected": -45.52449035644531, | |
| "loss": 0.5229467153549194, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.2966506779193878, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.040689948946237564, | |
| "rewards/margins": 2.79740571975708, | |
| "rewards/rejected": -2.7567155361175537, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.4853819553599497, | |
| "grad_norm": 4.404195308685303, | |
| "learning_rate": 0.00019325312419820473, | |
| "logits/chosen": -0.40588510036468506, | |
| "logits/rejected": -0.6035714149475098, | |
| "logps/chosen": -4.6151909828186035, | |
| "logps/rejected": -44.15699005126953, | |
| "loss": 0.5418132543563843, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.315884530544281, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.029081931337714195, | |
| "rewards/margins": 2.7166473865509033, | |
| "rewards/rejected": -2.687565565109253, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.01124 | |
| }, | |
| { | |
| "epoch": 0.48789688777114115, | |
| "grad_norm": 2.59771466255188, | |
| "learning_rate": 0.00019315246435110256, | |
| "logits/chosen": -0.4158392548561096, | |
| "logits/rejected": -0.6061286330223083, | |
| "logps/chosen": -6.033608436584473, | |
| "logps/rejected": -42.764007568359375, | |
| "loss": 0.5932649970054626, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.43631434440612793, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22790978848934174, | |
| "rewards/margins": 2.7686610221862793, | |
| "rewards/rejected": -2.5407509803771973, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.4904118201823326, | |
| "grad_norm": 2.5979843139648438, | |
| "learning_rate": 0.00019305108576931336, | |
| "logits/chosen": -0.4368806779384613, | |
| "logits/rejected": -0.6110289692878723, | |
| "logps/chosen": -6.914710998535156, | |
| "logps/rejected": -49.386474609375, | |
| "loss": 0.6119182705879211, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.38600677251815796, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.016620682552456856, | |
| "rewards/margins": 3.258530616760254, | |
| "rewards/rejected": -3.241909980773926, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.49292675259352403, | |
| "grad_norm": 1.838233232498169, | |
| "learning_rate": 0.0001929489892350419, | |
| "logits/chosen": -0.4425433874130249, | |
| "logits/rejected": -0.643796443939209, | |
| "logps/chosen": -3.6048429012298584, | |
| "logps/rejected": -54.97930908203125, | |
| "loss": 0.386331170797348, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.28649255633354187, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.14747180044651031, | |
| "rewards/margins": 4.032291889190674, | |
| "rewards/rejected": -3.884819984436035, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.49544168500471547, | |
| "grad_norm": 2.9112889766693115, | |
| "learning_rate": 0.00019284617553603242, | |
| "logits/chosen": -0.48377659916877747, | |
| "logits/rejected": -0.605985164642334, | |
| "logps/chosen": -4.890591144561768, | |
| "logps/rejected": -54.24449920654297, | |
| "loss": 0.5024012327194214, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.34084275364875793, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23494963347911835, | |
| "rewards/margins": 3.875343084335327, | |
| "rewards/rejected": -3.6403934955596924, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.49795661741590697, | |
| "grad_norm": 3.7803006172180176, | |
| "learning_rate": 0.0001927426454655627, | |
| "logits/chosen": -0.3935869038105011, | |
| "logits/rejected": -0.5888193845748901, | |
| "logps/chosen": -7.011892318725586, | |
| "logps/rejected": -54.100929260253906, | |
| "loss": 0.5712710618972778, | |
| "memory(GiB)": 44.28, | |
| "nll_loss": 0.3695356249809265, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.02423219382762909, | |
| "rewards/margins": 3.535330057144165, | |
| "rewards/rejected": -3.5110979080200195, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.5004715498270984, | |
| "grad_norm": 5.7016282081604, | |
| "learning_rate": 0.0001926383998224377, | |
| "logits/chosen": -0.3959541618824005, | |
| "logits/rejected": -0.6700530648231506, | |
| "logps/chosen": -2.51404070854187, | |
| "logps/rejected": -55.97195816040039, | |
| "loss": 0.3349680006504059, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.20782868564128876, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11337391287088394, | |
| "rewards/margins": 3.802442789077759, | |
| "rewards/rejected": -3.6890690326690674, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.011241 | |
| }, | |
| { | |
| "epoch": 0.5029864822382899, | |
| "grad_norm": 1.2177132368087769, | |
| "learning_rate": 0.0001925334394109835, | |
| "logits/chosen": -0.39053067564964294, | |
| "logits/rejected": -0.6353622674942017, | |
| "logps/chosen": -4.960577964782715, | |
| "logps/rejected": -55.41823196411133, | |
| "loss": 0.4196793735027313, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.2920268774032593, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.06429460644721985, | |
| "rewards/margins": 3.601248025894165, | |
| "rewards/rejected": -3.5369529724121094, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.011242 | |
| }, | |
| { | |
| "epoch": 0.5055014146494813, | |
| "grad_norm": 7.681524753570557, | |
| "learning_rate": 0.00019242776504104118, | |
| "logits/chosen": -0.3979511260986328, | |
| "logits/rejected": -0.5972259044647217, | |
| "logps/chosen": -6.038961887359619, | |
| "logps/rejected": -54.249908447265625, | |
| "loss": 0.6535472869873047, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.41866153478622437, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.054757650941610336, | |
| "rewards/margins": 3.7828688621520996, | |
| "rewards/rejected": -3.7281110286712646, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.011231 | |
| }, | |
| { | |
| "epoch": 0.5080163470606728, | |
| "grad_norm": 2.600893497467041, | |
| "learning_rate": 0.00019232137752796044, | |
| "logits/chosen": -0.4759564995765686, | |
| "logits/rejected": -0.6580658555030823, | |
| "logps/chosen": -4.586948394775391, | |
| "logps/rejected": -51.12422180175781, | |
| "loss": 0.6128251552581787, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.46890994906425476, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11943411082029343, | |
| "rewards/margins": 3.681659460067749, | |
| "rewards/rejected": -3.562225580215454, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.5105312794718642, | |
| "grad_norm": 2.17677640914917, | |
| "learning_rate": 0.00019221427769259333, | |
| "logits/chosen": -0.39213788509368896, | |
| "logits/rejected": -0.6274294853210449, | |
| "logps/chosen": -4.02351713180542, | |
| "logps/rejected": -54.13360595703125, | |
| "loss": 0.4597245752811432, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.31017711758613586, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19347746670246124, | |
| "rewards/margins": 3.6046862602233887, | |
| "rewards/rejected": -3.4112088680267334, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.5130462118830557, | |
| "grad_norm": 3.405174732208252, | |
| "learning_rate": 0.00019210646636128807, | |
| "logits/chosen": -0.4578840434551239, | |
| "logits/rejected": -0.6036797165870667, | |
| "logps/chosen": -4.427443027496338, | |
| "logps/rejected": -44.289703369140625, | |
| "loss": 0.4890953004360199, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.2529718279838562, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10575352609157562, | |
| "rewards/margins": 3.2759764194488525, | |
| "rewards/rejected": -3.170222759246826, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.515561144294247, | |
| "grad_norm": 1.9355807304382324, | |
| "learning_rate": 0.00019199794436588243, | |
| "logits/chosen": -0.3543737232685089, | |
| "logits/rejected": -0.6088857650756836, | |
| "logps/chosen": -6.951679229736328, | |
| "logps/rejected": -68.91035461425781, | |
| "loss": 0.39467012882232666, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.27390897274017334, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13660939037799835, | |
| "rewards/margins": 4.888247013092041, | |
| "rewards/rejected": -4.751636981964111, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.5180760767054385, | |
| "grad_norm": 12.973567962646484, | |
| "learning_rate": 0.00019188871254369752, | |
| "logits/chosen": -0.4342585802078247, | |
| "logits/rejected": -0.5918402671813965, | |
| "logps/chosen": -5.572432518005371, | |
| "logps/rejected": -47.04520034790039, | |
| "loss": 0.8162675499916077, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.5575422048568726, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.07569149881601334, | |
| "rewards/margins": 2.895029067993164, | |
| "rewards/rejected": -2.9707207679748535, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.011232 | |
| }, | |
| { | |
| "epoch": 0.52059100911663, | |
| "grad_norm": 3.5247535705566406, | |
| "learning_rate": 0.00019177877173753128, | |
| "logits/chosen": -0.48035189509391785, | |
| "logits/rejected": -0.6423895359039307, | |
| "logps/chosen": -6.628141403198242, | |
| "logps/rejected": -52.741973876953125, | |
| "loss": 0.6659956574440002, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.4173967242240906, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.11046299338340759, | |
| "rewards/margins": 3.8508124351501465, | |
| "rewards/rejected": -3.961275577545166, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5231059415278214, | |
| "grad_norm": 9.15176773071289, | |
| "learning_rate": 0.00019166812279565178, | |
| "logits/chosen": -0.4394856095314026, | |
| "logits/rejected": -0.5828301906585693, | |
| "logps/chosen": -6.419562816619873, | |
| "logps/rejected": -65.78706359863281, | |
| "loss": 0.7201980948448181, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.5739071369171143, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.05124050751328468, | |
| "rewards/margins": 5.137848377227783, | |
| "rewards/rejected": -5.086607933044434, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5256208739390129, | |
| "grad_norm": 1.9403810501098633, | |
| "learning_rate": 0.000191556766571791, | |
| "logits/chosen": -0.36848342418670654, | |
| "logits/rejected": -0.6423362493515015, | |
| "logps/chosen": -4.248262882232666, | |
| "logps/rejected": -82.75714111328125, | |
| "loss": 0.3508817255496979, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.274202436208725, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.14326420426368713, | |
| "rewards/margins": 6.368471622467041, | |
| "rewards/rejected": -6.225207328796387, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5281358063502043, | |
| "grad_norm": 2.350217342376709, | |
| "learning_rate": 0.000191444703925138, | |
| "logits/chosen": -0.36294057965278625, | |
| "logits/rejected": -0.681117057800293, | |
| "logps/chosen": -3.7879486083984375, | |
| "logps/rejected": -73.4488525390625, | |
| "loss": 0.4432718753814697, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3073051869869232, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17865654826164246, | |
| "rewards/margins": 5.326575756072998, | |
| "rewards/rejected": -5.14792013168335, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5306507387613958, | |
| "grad_norm": 9.633001327514648, | |
| "learning_rate": 0.00019133193572033242, | |
| "logits/chosen": -0.35440313816070557, | |
| "logits/rejected": -0.647504448890686, | |
| "logps/chosen": -5.407248020172119, | |
| "logps/rejected": -69.90013122558594, | |
| "loss": 0.4669504165649414, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.26951655745506287, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.040601931512355804, | |
| "rewards/margins": 5.3051629066467285, | |
| "rewards/rejected": -5.345764636993408, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5331656711725873, | |
| "grad_norm": 2.539501428604126, | |
| "learning_rate": 0.00019121846282745778, | |
| "logits/chosen": -0.4186283349990845, | |
| "logits/rejected": -0.5546895265579224, | |
| "logps/chosen": -5.969156742095947, | |
| "logps/rejected": -55.70306396484375, | |
| "loss": 0.5105364918708801, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.33588486909866333, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.05188417807221413, | |
| "rewards/margins": 4.2251996994018555, | |
| "rewards/rejected": -4.173315525054932, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5356806035837787, | |
| "grad_norm": 2.609890937805176, | |
| "learning_rate": 0.00019110428612203464, | |
| "logits/chosen": -0.40281373262405396, | |
| "logits/rejected": -0.6546099185943604, | |
| "logps/chosen": -6.447667121887207, | |
| "logps/rejected": -89.42594909667969, | |
| "loss": 0.43404707312583923, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.29497838020324707, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.05883106589317322, | |
| "rewards/margins": 6.6620965003967285, | |
| "rewards/rejected": -6.603265285491943, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.011233 | |
| }, | |
| { | |
| "epoch": 0.5381955359949702, | |
| "grad_norm": 9.001029968261719, | |
| "learning_rate": 0.00019098940648501405, | |
| "logits/chosen": -0.4067293107509613, | |
| "logits/rejected": -0.6849221587181091, | |
| "logps/chosen": -3.5787479877471924, | |
| "logps/rejected": -69.67017364501953, | |
| "loss": 0.4548971951007843, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.29569321870803833, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.01640375703573227, | |
| "rewards/margins": 5.399847507476807, | |
| "rewards/rejected": -5.416250705718994, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.5407104684061615, | |
| "grad_norm": 3.073113203048706, | |
| "learning_rate": 0.0001908738248027706, | |
| "logits/chosen": -0.38208895921707153, | |
| "logits/rejected": -0.6967729926109314, | |
| "logps/chosen": -4.078890323638916, | |
| "logps/rejected": -85.77256774902344, | |
| "loss": 0.37352272868156433, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.27824363112449646, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.0630294606089592, | |
| "rewards/margins": 6.849693298339844, | |
| "rewards/rejected": -6.78666353225708, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.543225400817353, | |
| "grad_norm": 4.24471378326416, | |
| "learning_rate": 0.00019075754196709572, | |
| "logits/chosen": -0.4263435900211334, | |
| "logits/rejected": -0.7725025415420532, | |
| "logps/chosen": -2.7350358963012695, | |
| "logps/rejected": -105.30278015136719, | |
| "loss": 0.3268907964229584, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.2297362983226776, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09944246709346771, | |
| "rewards/margins": 8.845938682556152, | |
| "rewards/rejected": -8.746496200561523, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.5457403332285444, | |
| "grad_norm": 7.5312819480896, | |
| "learning_rate": 0.00019064055887519062, | |
| "logits/chosen": -0.48908063769340515, | |
| "logits/rejected": -0.6851401329040527, | |
| "logps/chosen": -8.316049575805664, | |
| "logps/rejected": -87.41441345214844, | |
| "loss": 0.7208706140518188, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.5370450615882874, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.054982058703899384, | |
| "rewards/margins": 7.039226055145264, | |
| "rewards/rejected": -7.094207763671875, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.5482552656397359, | |
| "grad_norm": 5.015770435333252, | |
| "learning_rate": 0.00019052287642965952, | |
| "logits/chosen": -0.4340421259403229, | |
| "logits/rejected": -0.6953417062759399, | |
| "logps/chosen": -6.858056545257568, | |
| "logps/rejected": -93.66557312011719, | |
| "loss": 0.5943813323974609, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.40210384130477905, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.02029874362051487, | |
| "rewards/margins": 7.397557258605957, | |
| "rewards/rejected": -7.417856693267822, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.5507701980509274, | |
| "grad_norm": 25.73984718322754, | |
| "learning_rate": 0.00019040449553850257, | |
| "logits/chosen": -0.4239513576030731, | |
| "logits/rejected": -0.6732109785079956, | |
| "logps/chosen": -8.325424194335938, | |
| "logps/rejected": -87.74398040771484, | |
| "loss": 0.8946905732154846, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.648015558719635, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.2404731959104538, | |
| "rewards/margins": 6.910739898681641, | |
| "rewards/rejected": -7.151212215423584, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.5532851304621188, | |
| "grad_norm": 2.769166946411133, | |
| "learning_rate": 0.000190285417115109, | |
| "logits/chosen": -0.49040669202804565, | |
| "logits/rejected": -0.7523952126502991, | |
| "logps/chosen": -7.0566301345825195, | |
| "logps/rejected": -82.0855941772461, | |
| "loss": 0.5741197466850281, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.4936599135398865, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.05626031011343002, | |
| "rewards/margins": 6.2684006690979, | |
| "rewards/rejected": -6.2121405601501465, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.011234 | |
| }, | |
| { | |
| "epoch": 0.5558000628733103, | |
| "grad_norm": 4.775945663452148, | |
| "learning_rate": 0.00019016564207824992, | |
| "logits/chosen": -0.5227105021476746, | |
| "logits/rejected": -0.6636734008789062, | |
| "logps/chosen": -4.836442947387695, | |
| "logps/rejected": -49.289161682128906, | |
| "loss": 0.5425068736076355, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.35901886224746704, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.08150728791952133, | |
| "rewards/margins": 3.6998212337493896, | |
| "rewards/rejected": -3.618313789367676, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.5583149952845017, | |
| "grad_norm": 4.910019874572754, | |
| "learning_rate": 0.00019004517135207127, | |
| "logits/chosen": -0.3941330313682556, | |
| "logits/rejected": -0.660327136516571, | |
| "logps/chosen": -4.9822516441345215, | |
| "logps/rejected": -77.26637268066406, | |
| "loss": 0.5757743120193481, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.39564475417137146, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17502854764461517, | |
| "rewards/margins": 5.9140496253967285, | |
| "rewards/rejected": -5.739021301269531, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.5608299276956932, | |
| "grad_norm": 6.759812355041504, | |
| "learning_rate": 0.00018992400586608676, | |
| "logits/chosen": -0.4000013470649719, | |
| "logits/rejected": -0.7170141935348511, | |
| "logps/chosen": -2.594712972640991, | |
| "logps/rejected": -67.61477661132812, | |
| "loss": 0.4701526165008545, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.26969754695892334, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.03438286855816841, | |
| "rewards/margins": 4.8134918212890625, | |
| "rewards/rejected": -4.847874641418457, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.5633448601068847, | |
| "grad_norm": 2.779904842376709, | |
| "learning_rate": 0.00018980214655517057, | |
| "logits/chosen": -0.3656763732433319, | |
| "logits/rejected": -0.6763076186180115, | |
| "logps/chosen": -2.6532158851623535, | |
| "logps/rejected": -62.15465545654297, | |
| "loss": 0.3870552182197571, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.2073136270046234, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13753379881381989, | |
| "rewards/margins": 4.43159818649292, | |
| "rewards/rejected": -4.294064521789551, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.565859792518076, | |
| "grad_norm": 4.610898971557617, | |
| "learning_rate": 0.00018967959435955026, | |
| "logits/chosen": -0.41923901438713074, | |
| "logits/rejected": -0.7322454452514648, | |
| "logps/chosen": -4.079246997833252, | |
| "logps/rejected": -85.366943359375, | |
| "loss": 0.5197367668151855, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3901809751987457, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0011233258992433548, | |
| "rewards/margins": 6.633144378662109, | |
| "rewards/rejected": -6.634267807006836, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.011235 | |
| }, | |
| { | |
| "epoch": 0.5683747249292675, | |
| "grad_norm": 1.7400152683258057, | |
| "learning_rate": 0.0001895563502247995, | |
| "logits/chosen": -0.4450499713420868, | |
| "logits/rejected": -0.6796970367431641, | |
| "logps/chosen": -3.0244576930999756, | |
| "logps/rejected": -73.87388610839844, | |
| "loss": 0.3383142650127411, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.21261034905910492, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.16421900689601898, | |
| "rewards/margins": 5.867359161376953, | |
| "rewards/rejected": -5.703140735626221, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5708896573404589, | |
| "grad_norm": 2.3019213676452637, | |
| "learning_rate": 0.00018943241510183063, | |
| "logits/chosen": -0.458271324634552, | |
| "logits/rejected": -0.6559279561042786, | |
| "logps/chosen": -6.137403964996338, | |
| "logps/rejected": -69.26449584960938, | |
| "loss": 0.43954962491989136, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3364819884300232, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18200799822807312, | |
| "rewards/margins": 5.23583459854126, | |
| "rewards/rejected": -5.053826332092285, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5734045897516504, | |
| "grad_norm": 4.305068492889404, | |
| "learning_rate": 0.00018930778994688757, | |
| "logits/chosen": -0.4849119186401367, | |
| "logits/rejected": -0.6896030902862549, | |
| "logps/chosen": -6.080837726593018, | |
| "logps/rejected": -76.35552978515625, | |
| "loss": 0.6719568967819214, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.47549009323120117, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.02206701785326004, | |
| "rewards/margins": 5.978794097900391, | |
| "rewards/rejected": -5.956727027893066, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5759195221628419, | |
| "grad_norm": 2.6933469772338867, | |
| "learning_rate": 0.00018918247572153823, | |
| "logits/chosen": -0.461727499961853, | |
| "logits/rejected": -0.6680722236633301, | |
| "logps/chosen": -4.37862491607666, | |
| "logps/rejected": -86.59188842773438, | |
| "loss": 0.42717570066452026, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3303125500679016, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08164448291063309, | |
| "rewards/margins": 7.104611873626709, | |
| "rewards/rejected": -7.022968292236328, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5784344545740333, | |
| "grad_norm": 8.504460334777832, | |
| "learning_rate": 0.0001890564733926672, | |
| "logits/chosen": -0.34246841073036194, | |
| "logits/rejected": -0.5939763188362122, | |
| "logps/chosen": -11.11518383026123, | |
| "logps/rejected": -101.42696380615234, | |
| "loss": 0.7018269300460815, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.4599987864494324, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.15412060916423798, | |
| "rewards/margins": 7.550798416137695, | |
| "rewards/rejected": -7.704918384552002, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5809493869852248, | |
| "grad_norm": 3.522885322570801, | |
| "learning_rate": 0.00018892978393246818, | |
| "logits/chosen": -0.5426961183547974, | |
| "logits/rejected": -0.6135550737380981, | |
| "logps/chosen": -10.763383865356445, | |
| "logps/rejected": -72.09516143798828, | |
| "loss": 0.5679591298103333, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.39400285482406616, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07710488885641098, | |
| "rewards/margins": 5.834630012512207, | |
| "rewards/rejected": -5.757525444030762, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5834643193964162, | |
| "grad_norm": 2.6743204593658447, | |
| "learning_rate": 0.00018880240831843666, | |
| "logits/chosen": -0.42806094884872437, | |
| "logits/rejected": -0.6858870983123779, | |
| "logps/chosen": -7.369032859802246, | |
| "logps/rejected": -94.46809387207031, | |
| "loss": 0.49837395548820496, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3631903827190399, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1583317369222641, | |
| "rewards/margins": 7.130619525909424, | |
| "rewards/rejected": -6.972287654876709, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5859792518076077, | |
| "grad_norm": 2.545430898666382, | |
| "learning_rate": 0.00018867434753336223, | |
| "logits/chosen": -0.5526742935180664, | |
| "logits/rejected": -0.6764613389968872, | |
| "logps/chosen": -6.2565155029296875, | |
| "logps/rejected": -53.53122329711914, | |
| "loss": 0.6385827660560608, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.47814565896987915, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18877720832824707, | |
| "rewards/margins": 4.254955768585205, | |
| "rewards/rejected": -4.066178321838379, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5884941842187991, | |
| "grad_norm": 5.874550819396973, | |
| "learning_rate": 0.000188545602565321, | |
| "logits/chosen": -0.5431405901908875, | |
| "logits/rejected": -0.6591349840164185, | |
| "logps/chosen": -7.041271686553955, | |
| "logps/rejected": -51.830989837646484, | |
| "loss": 0.511455774307251, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3468693494796753, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17714644968509674, | |
| "rewards/margins": 3.9428811073303223, | |
| "rewards/rejected": -3.7657346725463867, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5910091166299906, | |
| "grad_norm": 11.230829238891602, | |
| "learning_rate": 0.0001884161744076681, | |
| "logits/chosen": -0.4081313908100128, | |
| "logits/rejected": -0.6242074370384216, | |
| "logps/chosen": -5.126794815063477, | |
| "logps/rejected": -49.272377014160156, | |
| "loss": 0.6269602179527283, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.440512478351593, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.023164164274930954, | |
| "rewards/margins": 3.228619337081909, | |
| "rewards/rejected": -3.2054548263549805, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.011236 | |
| }, | |
| { | |
| "epoch": 0.5935240490411821, | |
| "grad_norm": 2.906224489212036, | |
| "learning_rate": 0.00018828606405902986, | |
| "logits/chosen": -0.4151853919029236, | |
| "logits/rejected": -0.6895049810409546, | |
| "logps/chosen": -3.3425395488739014, | |
| "logps/rejected": -60.14630126953125, | |
| "loss": 0.40797102451324463, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3100608289241791, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.0746859535574913, | |
| "rewards/margins": 4.381271839141846, | |
| "rewards/rejected": -4.306585788726807, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.5960389814523734, | |
| "grad_norm": 5.449255466461182, | |
| "learning_rate": 0.00018815527252329624, | |
| "logits/chosen": -0.5026019811630249, | |
| "logits/rejected": -0.6662022471427917, | |
| "logps/chosen": -6.956883430480957, | |
| "logps/rejected": -59.189815521240234, | |
| "loss": 0.6439992785453796, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.448159396648407, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.038928791880607605, | |
| "rewards/margins": 4.4153032302856445, | |
| "rewards/rejected": -4.376374244689941, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.5985539138635649, | |
| "grad_norm": 1.9680973291397095, | |
| "learning_rate": 0.00018802380080961296, | |
| "logits/chosen": -0.4111896753311157, | |
| "logits/rejected": -0.6969754695892334, | |
| "logps/chosen": -2.109022617340088, | |
| "logps/rejected": -70.76811981201172, | |
| "loss": 0.30665695667266846, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.19306617975234985, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1144958883523941, | |
| "rewards/margins": 5.321486473083496, | |
| "rewards/rejected": -5.206991195678711, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.6010688462747563, | |
| "grad_norm": 2.106550931930542, | |
| "learning_rate": 0.00018789164993237382, | |
| "logits/chosen": -0.5053385496139526, | |
| "logits/rejected": -0.6760715842247009, | |
| "logps/chosen": -3.813554048538208, | |
| "logps/rejected": -71.93482971191406, | |
| "loss": 0.3176461160182953, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.18995390832424164, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16428788006305695, | |
| "rewards/margins": 5.706036567687988, | |
| "rewards/rejected": -5.541748523712158, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.6035837786859478, | |
| "grad_norm": 17.008098602294922, | |
| "learning_rate": 0.0001877588209112128, | |
| "logits/chosen": -0.4033944010734558, | |
| "logits/rejected": -0.6984363794326782, | |
| "logps/chosen": -5.072837829589844, | |
| "logps/rejected": -76.01246643066406, | |
| "loss": 0.8396996259689331, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.458006352186203, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.022617299109697342, | |
| "rewards/margins": 5.918478965759277, | |
| "rewards/rejected": -5.941096305847168, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.6060987110971393, | |
| "grad_norm": 1.8717386722564697, | |
| "learning_rate": 0.00018762531477099626, | |
| "logits/chosen": -0.3073655366897583, | |
| "logits/rejected": -0.6664487719535828, | |
| "logps/chosen": -5.499012470245361, | |
| "logps/rejected": -105.34025573730469, | |
| "loss": 0.46345487236976624, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.321692556142807, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.015820708125829697, | |
| "rewards/margins": 8.114753723144531, | |
| "rewards/rejected": -8.098933219909668, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.011237 | |
| }, | |
| { | |
| "epoch": 0.6086136435083307, | |
| "grad_norm": 12.112175941467285, | |
| "learning_rate": 0.00018749113254181498, | |
| "logits/chosen": -0.5718834400177002, | |
| "logits/rejected": -0.7824399471282959, | |
| "logps/chosen": -3.723027229309082, | |
| "logps/rejected": -83.3447265625, | |
| "loss": 0.4468189775943756, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3446814715862274, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.03424655646085739, | |
| "rewards/margins": 7.22880744934082, | |
| "rewards/rejected": -7.263053894042969, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6111285759195222, | |
| "grad_norm": 3.188166618347168, | |
| "learning_rate": 0.0001873562752589762, | |
| "logits/chosen": -0.47086432576179504, | |
| "logits/rejected": -0.6838089823722839, | |
| "logps/chosen": -8.102127075195312, | |
| "logps/rejected": -79.43113708496094, | |
| "loss": 0.47154104709625244, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3822014331817627, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09235017001628876, | |
| "rewards/margins": 6.291683197021484, | |
| "rewards/rejected": -6.1993327140808105, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6136435083307136, | |
| "grad_norm": 4.067774772644043, | |
| "learning_rate": 0.00018722074396299566, | |
| "logits/chosen": -0.46753576397895813, | |
| "logits/rejected": -0.7191226482391357, | |
| "logps/chosen": -9.372048377990723, | |
| "logps/rejected": -93.54489135742188, | |
| "loss": 0.4576195180416107, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.31360840797424316, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07592315226793289, | |
| "rewards/margins": 7.556896209716797, | |
| "rewards/rejected": -7.480972766876221, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6161584407419051, | |
| "grad_norm": 2.5217037200927734, | |
| "learning_rate": 0.00018708453969958958, | |
| "logits/chosen": -0.5039016008377075, | |
| "logits/rejected": -0.6719211935997009, | |
| "logps/chosen": -6.228890419006348, | |
| "logps/rejected": -58.18281936645508, | |
| "loss": 0.7915486097335815, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.5135347247123718, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.017953312024474144, | |
| "rewards/margins": 4.20432186126709, | |
| "rewards/rejected": -4.222275733947754, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6186733731530966, | |
| "grad_norm": 1.6694215536117554, | |
| "learning_rate": 0.00018694766351966667, | |
| "logits/chosen": -0.4057798981666565, | |
| "logits/rejected": -0.6351858973503113, | |
| "logps/chosen": -6.20676326751709, | |
| "logps/rejected": -72.40664672851562, | |
| "loss": 0.4737001359462738, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.35722869634628296, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26643669605255127, | |
| "rewards/margins": 5.429479598999023, | |
| "rewards/rejected": -5.163043022155762, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.621188305564288, | |
| "grad_norm": 4.144296169281006, | |
| "learning_rate": 0.00018681011647931974, | |
| "logits/chosen": -0.34827110171318054, | |
| "logits/rejected": -0.6173001527786255, | |
| "logps/chosen": -6.582627773284912, | |
| "logps/rejected": -78.4413070678711, | |
| "loss": 0.6141136288642883, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.5033036470413208, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.004567645490169525, | |
| "rewards/margins": 5.899599552154541, | |
| "rewards/rejected": -5.895031929016113, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6237032379754794, | |
| "grad_norm": 13.872243881225586, | |
| "learning_rate": 0.00018667189963981793, | |
| "logits/chosen": -0.387536883354187, | |
| "logits/rejected": -0.6405035257339478, | |
| "logps/chosen": -3.9526758193969727, | |
| "logps/rejected": -55.78480529785156, | |
| "loss": 0.5534759163856506, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.38310396671295166, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1983298808336258, | |
| "rewards/margins": 3.9616622924804688, | |
| "rewards/rejected": -3.7633323669433594, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6262181703866708, | |
| "grad_norm": 4.9104180335998535, | |
| "learning_rate": 0.00018653301406759825, | |
| "logits/chosen": -0.43706703186035156, | |
| "logits/rejected": -0.7033647298812866, | |
| "logps/chosen": -4.780174732208252, | |
| "logps/rejected": -63.24848937988281, | |
| "loss": 0.4667983949184418, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.3596409559249878, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.10462813079357147, | |
| "rewards/margins": 4.852310657501221, | |
| "rewards/rejected": -4.747682094573975, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.011238 | |
| }, | |
| { | |
| "epoch": 0.6287331027978623, | |
| "grad_norm": 2.1640334129333496, | |
| "learning_rate": 0.00018639346083425748, | |
| "logits/chosen": -0.46963977813720703, | |
| "logits/rejected": -0.6406612396240234, | |
| "logps/chosen": -7.166382789611816, | |
| "logps/rejected": -57.39030838012695, | |
| "loss": 0.6180220246315002, | |
| "memory(GiB)": 46.04, | |
| "nll_loss": 0.49737781286239624, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22726891934871674, | |
| "rewards/margins": 4.274770736694336, | |
| "rewards/rejected": -4.047501564025879, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.011239 | |
| }, | |
| { | |
| "epoch": 0.6312480352090537, | |
| "grad_norm": 1.6145262718200684, | |
| "learning_rate": 0.00018625324101654377, | |
| "logits/chosen": -0.30196619033813477, | |
| "logits/rejected": -0.6030948162078857, | |
| "logps/chosen": -4.5810980796813965, | |
| "logps/rejected": -69.94066619873047, | |
| "loss": 0.44845062494277954, | |
| "memory(GiB)": 33.43, | |
| "nll_loss": 0.3242243528366089, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13189926743507385, | |
| "rewards/margins": 5.211311340332031, | |
| "rewards/rejected": -5.07941198348999, | |
| "step": 251, | |
| "train_speed(iter/s)": 2.643562 | |
| }, | |
| { | |
| "epoch": 0.6337629676202452, | |
| "grad_norm": 2.0983619689941406, | |
| "learning_rate": 0.00018611235569634854, | |
| "logits/chosen": -0.33113306760787964, | |
| "logits/rejected": -0.5730663537979126, | |
| "logps/chosen": -5.2111029624938965, | |
| "logps/rejected": -66.04705047607422, | |
| "loss": 0.39135444164276123, | |
| "memory(GiB)": 33.43, | |
| "nll_loss": 0.282539963722229, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20458640158176422, | |
| "rewards/margins": 5.00150203704834, | |
| "rewards/rejected": -4.7969160079956055, | |
| "step": 252, | |
| "train_speed(iter/s)": 1.370537 | |
| }, | |
| { | |
| "epoch": 0.6362779000314367, | |
| "grad_norm": 2.1315553188323975, | |
| "learning_rate": 0.00018597080596069793, | |
| "logits/chosen": -0.45159927010536194, | |
| "logits/rejected": -0.6239475011825562, | |
| "logps/chosen": -8.911016464233398, | |
| "logps/rejected": -51.39215850830078, | |
| "loss": 0.6090635061264038, | |
| "memory(GiB)": 33.43, | |
| "nll_loss": 0.46375155448913574, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.16291305422782898, | |
| "rewards/margins": 3.745710611343384, | |
| "rewards/rejected": -3.5827975273132324, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.928331 | |
| }, | |
| { | |
| "epoch": 0.6387928324426281, | |
| "grad_norm": 1.5824214220046997, | |
| "learning_rate": 0.00018582859290174452, | |
| "logits/chosen": -0.4049888849258423, | |
| "logits/rejected": -0.5815865993499756, | |
| "logps/chosen": -4.045827388763428, | |
| "logps/rejected": -46.12110137939453, | |
| "loss": 0.4411042332649231, | |
| "memory(GiB)": 34.43, | |
| "nll_loss": 0.27207979559898376, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.25326088070869446, | |
| "rewards/margins": 3.262639045715332, | |
| "rewards/rejected": -3.009377956390381, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.701344 | |
| }, | |
| { | |
| "epoch": 0.6413077648538196, | |
| "grad_norm": 9.893558502197266, | |
| "learning_rate": 0.00018568571761675893, | |
| "logits/chosen": -0.4062230885028839, | |
| "logits/rejected": -0.5557867288589478, | |
| "logps/chosen": -5.695141792297363, | |
| "logps/rejected": -50.45267105102539, | |
| "loss": 0.6555861234664917, | |
| "memory(GiB)": 34.43, | |
| "nll_loss": 0.4070875644683838, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.018757404759526253, | |
| "rewards/margins": 3.3658759593963623, | |
| "rewards/rejected": -3.347118854522705, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.56489 | |
| }, | |
| { | |
| "epoch": 0.643822697265011, | |
| "grad_norm": 2.4083399772644043, | |
| "learning_rate": 0.00018554218120812123, | |
| "logits/chosen": -0.33443182706832886, | |
| "logits/rejected": -0.5299184322357178, | |
| "logps/chosen": -10.211224555969238, | |
| "logps/rejected": -49.86205291748047, | |
| "loss": 0.7328925132751465, | |
| "memory(GiB)": 34.43, | |
| "nll_loss": 0.535182774066925, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15930601954460144, | |
| "rewards/margins": 3.196995735168457, | |
| "rewards/rejected": -3.037689685821533, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.473313 | |
| }, | |
| { | |
| "epoch": 0.6463376296762025, | |
| "grad_norm": 3.05432391166687, | |
| "learning_rate": 0.00018539798478331253, | |
| "logits/chosen": -0.36439672112464905, | |
| "logits/rejected": -0.5713220834732056, | |
| "logps/chosen": -5.492653846740723, | |
| "logps/rejected": -63.25914001464844, | |
| "loss": 0.4198300540447235, | |
| "memory(GiB)": 34.43, | |
| "nll_loss": 0.3039914071559906, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1935369074344635, | |
| "rewards/margins": 4.819316387176514, | |
| "rewards/rejected": -4.62578010559082, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.40816 | |
| }, | |
| { | |
| "epoch": 0.648852562087394, | |
| "grad_norm": 4.973176956176758, | |
| "learning_rate": 0.00018525312945490648, | |
| "logits/chosen": -0.4139503240585327, | |
| "logits/rejected": -0.49163496494293213, | |
| "logps/chosen": -7.645513534545898, | |
| "logps/rejected": -42.70791244506836, | |
| "loss": 0.7363718748092651, | |
| "memory(GiB)": 34.43, | |
| "nll_loss": 0.4982314109802246, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08269016444683075, | |
| "rewards/margins": 3.138368606567383, | |
| "rewards/rejected": -3.055678606033325, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.359112 | |
| }, | |
| { | |
| "epoch": 0.6513674944985853, | |
| "grad_norm": 1.6409480571746826, | |
| "learning_rate": 0.0001851076163405605, | |
| "logits/chosen": -0.3667711913585663, | |
| "logits/rejected": -0.5486889481544495, | |
| "logps/chosen": -5.454978942871094, | |
| "logps/rejected": -57.34523010253906, | |
| "loss": 0.5182607769966125, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.3399607241153717, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.06281061470508575, | |
| "rewards/margins": 4.247139930725098, | |
| "rewards/rejected": -4.184329032897949, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.320666 | |
| }, | |
| { | |
| "epoch": 0.6538824269097768, | |
| "grad_norm": 2.9779512882232666, | |
| "learning_rate": 0.0001849614465630074, | |
| "logits/chosen": -0.43861109018325806, | |
| "logits/rejected": -0.6130017042160034, | |
| "logps/chosen": -4.781963348388672, | |
| "logps/rejected": -56.94814682006836, | |
| "loss": 0.49893221259117126, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.33870410919189453, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12630243599414825, | |
| "rewards/margins": 4.560263633728027, | |
| "rewards/rejected": -4.433961391448975, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.290134 | |
| }, | |
| { | |
| "epoch": 0.6563973593209682, | |
| "grad_norm": 2.126897096633911, | |
| "learning_rate": 0.00018481462125004647, | |
| "logits/chosen": -0.395521879196167, | |
| "logits/rejected": -0.6116307973861694, | |
| "logps/chosen": -7.144432544708252, | |
| "logps/rejected": -73.966552734375, | |
| "loss": 0.5626826882362366, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.3062968850135803, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.0832599550485611, | |
| "rewards/margins": 5.646542549133301, | |
| "rewards/rejected": -5.72980260848999, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.264936 | |
| }, | |
| { | |
| "epoch": 0.6589122917321597, | |
| "grad_norm": 5.1192545890808105, | |
| "learning_rate": 0.00018466714153453503, | |
| "logits/chosen": -0.2840866148471832, | |
| "logits/rejected": -0.6146043539047241, | |
| "logps/chosen": -3.4402737617492676, | |
| "logps/rejected": -87.25662231445312, | |
| "loss": 0.4280086159706116, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.30285900831222534, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11021072417497635, | |
| "rewards/margins": 6.3835039138793945, | |
| "rewards/rejected": -6.273293495178223, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.243811 | |
| }, | |
| { | |
| "epoch": 0.6614272241433512, | |
| "grad_norm": 3.2079365253448486, | |
| "learning_rate": 0.0001845190085543795, | |
| "logits/chosen": -0.449633926153183, | |
| "logits/rejected": -0.6547152996063232, | |
| "logps/chosen": -10.382014274597168, | |
| "logps/rejected": -83.1773681640625, | |
| "loss": 0.5558671951293945, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.43276214599609375, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.21494942903518677, | |
| "rewards/margins": 6.166694641113281, | |
| "rewards/rejected": -6.381643772125244, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.226046 | |
| }, | |
| { | |
| "epoch": 0.6639421565545426, | |
| "grad_norm": 2.844895601272583, | |
| "learning_rate": 0.00018437022345252664, | |
| "logits/chosen": -0.442143052816391, | |
| "logits/rejected": -0.6931208372116089, | |
| "logps/chosen": -3.599593162536621, | |
| "logps/rejected": -87.85449981689453, | |
| "loss": 0.37555554509162903, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.27443069219589233, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.02881481871008873, | |
| "rewards/margins": 7.2416534423828125, | |
| "rewards/rejected": -7.212838649749756, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.210855 | |
| }, | |
| { | |
| "epoch": 0.6664570889657341, | |
| "grad_norm": 2.5585174560546875, | |
| "learning_rate": 0.0001842207873769548, | |
| "logits/chosen": -0.42873817682266235, | |
| "logits/rejected": -0.6308642029762268, | |
| "logps/chosen": -5.981243133544922, | |
| "logps/rejected": -70.72628784179688, | |
| "loss": 0.6464019417762756, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.46387210488319397, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.002297995612025261, | |
| "rewards/margins": 5.15910530090332, | |
| "rewards/rejected": -5.161403179168701, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.197608 | |
| }, | |
| { | |
| "epoch": 0.6689720213769255, | |
| "grad_norm": 6.840214729309082, | |
| "learning_rate": 0.00018407070148066513, | |
| "logits/chosen": -0.34393343329429626, | |
| "logits/rejected": -0.5655381679534912, | |
| "logps/chosen": -6.317379474639893, | |
| "logps/rejected": -80.00755310058594, | |
| "loss": 0.6975788474082947, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.5568116307258606, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.04052425175905228, | |
| "rewards/margins": 6.243714332580566, | |
| "rewards/rejected": -6.284238338470459, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.185936 | |
| }, | |
| { | |
| "epoch": 0.671486953788117, | |
| "grad_norm": 1.300536870956421, | |
| "learning_rate": 0.00018391996692167242, | |
| "logits/chosen": -0.44441860914230347, | |
| "logits/rejected": -0.6562116742134094, | |
| "logps/chosen": -3.928229570388794, | |
| "logps/rejected": -69.29019165039062, | |
| "loss": 0.3208352327346802, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.218485489487648, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3024291396141052, | |
| "rewards/margins": 5.891707420349121, | |
| "rewards/rejected": -5.589277744293213, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.175708 | |
| }, | |
| { | |
| "epoch": 0.6740018861993083, | |
| "grad_norm": 2.1066205501556396, | |
| "learning_rate": 0.00018376858486299647, | |
| "logits/chosen": -0.3569512367248535, | |
| "logits/rejected": -0.6223514080047607, | |
| "logps/chosen": -5.05648136138916, | |
| "logps/rejected": -77.00200653076172, | |
| "loss": 0.447488397359848, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.2895119786262512, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.07016298919916153, | |
| "rewards/margins": 5.940699100494385, | |
| "rewards/rejected": -5.870535850524902, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.166588 | |
| }, | |
| { | |
| "epoch": 0.6765168186104998, | |
| "grad_norm": 6.73745584487915, | |
| "learning_rate": 0.00018361655647265295, | |
| "logits/chosen": -0.432262122631073, | |
| "logits/rejected": -0.6704272031784058, | |
| "logps/chosen": -4.047597885131836, | |
| "logps/rejected": -66.35338592529297, | |
| "loss": 0.4859369993209839, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.3608669936656952, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07137257605791092, | |
| "rewards/margins": 5.09867000579834, | |
| "rewards/rejected": -5.027297019958496, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.158465 | |
| }, | |
| { | |
| "epoch": 0.6790317510216913, | |
| "grad_norm": 4.508405685424805, | |
| "learning_rate": 0.00018346388292364435, | |
| "logits/chosen": -0.36208435893058777, | |
| "logits/rejected": -0.6471053957939148, | |
| "logps/chosen": -2.5504043102264404, | |
| "logps/rejected": -72.08878326416016, | |
| "loss": 0.26533976197242737, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.15827052295207977, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1948476880788803, | |
| "rewards/margins": 5.411668300628662, | |
| "rewards/rejected": -5.216820240020752, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.151104 | |
| }, | |
| { | |
| "epoch": 0.6815466834328827, | |
| "grad_norm": 2.18328595161438, | |
| "learning_rate": 0.00018331056539395112, | |
| "logits/chosen": -0.49844443798065186, | |
| "logits/rejected": -0.651973307132721, | |
| "logps/chosen": -4.165656566619873, | |
| "logps/rejected": -53.685787200927734, | |
| "loss": 0.5224581360816956, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.3570694625377655, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08425498008728027, | |
| "rewards/margins": 4.271368980407715, | |
| "rewards/rejected": -4.1871137619018555, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.1445 | |
| }, | |
| { | |
| "epoch": 0.6840616158440742, | |
| "grad_norm": 1.904048204421997, | |
| "learning_rate": 0.00018315660506652232, | |
| "logits/chosen": -0.4680135250091553, | |
| "logits/rejected": -0.6710811853408813, | |
| "logps/chosen": -4.441302299499512, | |
| "logps/rejected": -72.74127197265625, | |
| "loss": 0.34467679262161255, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.23408779501914978, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18954063951969147, | |
| "rewards/margins": 6.041881561279297, | |
| "rewards/rejected": -5.852341175079346, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.138445 | |
| }, | |
| { | |
| "epoch": 0.6865765482552656, | |
| "grad_norm": 2.8482308387756348, | |
| "learning_rate": 0.00018300200312926674, | |
| "logits/chosen": -0.4003257751464844, | |
| "logits/rejected": -0.6571944355964661, | |
| "logps/chosen": -4.5086669921875, | |
| "logps/rejected": -66.03219604492188, | |
| "loss": 0.6187813878059387, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.41691598296165466, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07326355576515198, | |
| "rewards/margins": 4.743034362792969, | |
| "rewards/rejected": -4.669771194458008, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.132932 | |
| }, | |
| { | |
| "epoch": 0.6890914806664571, | |
| "grad_norm": 7.494622707366943, | |
| "learning_rate": 0.00018284676077504362, | |
| "logits/chosen": -0.40674543380737305, | |
| "logits/rejected": -0.5925787687301636, | |
| "logps/chosen": -9.069441795349121, | |
| "logps/rejected": -53.76180648803711, | |
| "loss": 0.8244871497154236, | |
| "memory(GiB)": 35.19, | |
| "nll_loss": 0.5905988216400146, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.0009557940065860748, | |
| "rewards/margins": 3.9635586738586426, | |
| "rewards/rejected": -3.96451473236084, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.127852 | |
| }, | |
| { | |
| "epoch": 0.6916064130776486, | |
| "grad_norm": 12.676557540893555, | |
| "learning_rate": 0.00018269087920165332, | |
| "logits/chosen": -0.3970157504081726, | |
| "logits/rejected": -0.6446709632873535, | |
| "logps/chosen": -7.009572982788086, | |
| "logps/rejected": -75.48789978027344, | |
| "loss": 0.5546004772186279, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.40932291746139526, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.11061696708202362, | |
| "rewards/margins": 5.533331871032715, | |
| "rewards/rejected": -5.422715187072754, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.12316 | |
| }, | |
| { | |
| "epoch": 0.69412134548884, | |
| "grad_norm": 3.2866766452789307, | |
| "learning_rate": 0.00018253435961182845, | |
| "logits/chosen": -0.5122930407524109, | |
| "logits/rejected": -0.7138373255729675, | |
| "logps/chosen": -5.048257827758789, | |
| "logps/rejected": -90.43961334228516, | |
| "loss": 0.4567756950855255, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.3689834177494049, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.17359167337417603, | |
| "rewards/margins": 7.448518753051758, | |
| "rewards/rejected": -7.274927139282227, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.11888 | |
| }, | |
| { | |
| "epoch": 0.6966362779000315, | |
| "grad_norm": 1.6649048328399658, | |
| "learning_rate": 0.00018237720321322409, | |
| "logits/chosen": -0.4259472191333771, | |
| "logits/rejected": -0.6217616200447083, | |
| "logps/chosen": -5.190006256103516, | |
| "logps/rejected": -60.61420440673828, | |
| "loss": 0.48118671774864197, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.34742891788482666, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3943961560726166, | |
| "rewards/margins": 4.985601902008057, | |
| "rewards/rejected": -4.591205596923828, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.114903 | |
| }, | |
| { | |
| "epoch": 0.6991512103112228, | |
| "grad_norm": 1.641586184501648, | |
| "learning_rate": 0.00018221941121840892, | |
| "logits/chosen": -0.5152907967567444, | |
| "logits/rejected": -0.7797664403915405, | |
| "logps/chosen": -3.807891845703125, | |
| "logps/rejected": -89.89514923095703, | |
| "loss": 0.4311053454875946, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.3506782352924347, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.16795168817043304, | |
| "rewards/margins": 7.562755584716797, | |
| "rewards/rejected": -7.394804000854492, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.111233 | |
| }, | |
| { | |
| "epoch": 0.7016661427224143, | |
| "grad_norm": 2.954766273498535, | |
| "learning_rate": 0.00018206098484485563, | |
| "logits/chosen": -0.47647833824157715, | |
| "logits/rejected": -0.7569775581359863, | |
| "logps/chosen": -3.6604084968566895, | |
| "logps/rejected": -93.30502319335938, | |
| "loss": 0.33102554082870483, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.23846475780010223, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.057397253811359406, | |
| "rewards/margins": 7.980731964111328, | |
| "rewards/rejected": -7.92333459854126, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.107796 | |
| }, | |
| { | |
| "epoch": 0.7041810751336058, | |
| "grad_norm": 1.0509345531463623, | |
| "learning_rate": 0.00018190192531493152, | |
| "logits/chosen": -0.4389861226081848, | |
| "logits/rejected": -0.7513998746871948, | |
| "logps/chosen": -3.3642971515655518, | |
| "logps/rejected": -104.84876251220703, | |
| "loss": 0.2865274250507355, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.1890382468700409, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1356939822435379, | |
| "rewards/margins": 8.732723236083984, | |
| "rewards/rejected": -8.597027778625488, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.104576 | |
| }, | |
| { | |
| "epoch": 0.7066960075447972, | |
| "grad_norm": 2.062405824661255, | |
| "learning_rate": 0.00018174223385588917, | |
| "logits/chosen": -0.4419255256652832, | |
| "logits/rejected": -0.789115309715271, | |
| "logps/chosen": -6.24101448059082, | |
| "logps/rejected": -107.06963348388672, | |
| "loss": 0.38868069648742676, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.27302783727645874, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04043314605951309, | |
| "rewards/margins": 8.512565612792969, | |
| "rewards/rejected": -8.472132682800293, | |
| "step": 281, | |
| "train_speed(iter/s)": 0.101563 | |
| }, | |
| { | |
| "epoch": 0.7092109399559887, | |
| "grad_norm": 1.5434448719024658, | |
| "learning_rate": 0.00018158191169985696, | |
| "logits/chosen": -0.5877774953842163, | |
| "logits/rejected": -0.7937146425247192, | |
| "logps/chosen": -3.5352978706359863, | |
| "logps/rejected": -82.489990234375, | |
| "loss": 0.28792405128479004, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.21994276344776154, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.152220219373703, | |
| "rewards/margins": 7.123733043670654, | |
| "rewards/rejected": -6.971513271331787, | |
| "step": 282, | |
| "train_speed(iter/s)": 0.098762 | |
| }, | |
| { | |
| "epoch": 0.7117258723671801, | |
| "grad_norm": 1.7215518951416016, | |
| "learning_rate": 0.00018142096008382942, | |
| "logits/chosen": -0.5603517889976501, | |
| "logits/rejected": -0.8750638961791992, | |
| "logps/chosen": -3.4122605323791504, | |
| "logps/rejected": -98.63863372802734, | |
| "loss": 0.4363364279270172, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.33546215295791626, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1424112468957901, | |
| "rewards/margins": 8.030111312866211, | |
| "rewards/rejected": -7.887700080871582, | |
| "step": 283, | |
| "train_speed(iter/s)": 0.096121 | |
| }, | |
| { | |
| "epoch": 0.7142408047783716, | |
| "grad_norm": 6.417537212371826, | |
| "learning_rate": 0.00018125938024965793, | |
| "logits/chosen": -0.543463408946991, | |
| "logits/rejected": -0.7929783463478088, | |
| "logps/chosen": -5.197461128234863, | |
| "logps/rejected": -97.00271606445312, | |
| "loss": 0.6537326574325562, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.46845054626464844, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07486869394779205, | |
| "rewards/margins": 8.32656478881836, | |
| "rewards/rejected": -8.251694679260254, | |
| "step": 284, | |
| "train_speed(iter/s)": 0.093639 | |
| }, | |
| { | |
| "epoch": 0.716755737189563, | |
| "grad_norm": 2.125540018081665, | |
| "learning_rate": 0.0001810971734440408, | |
| "logits/chosen": -0.6539860367774963, | |
| "logits/rejected": -0.853480875492096, | |
| "logps/chosen": -5.839959621429443, | |
| "logps/rejected": -91.55633544921875, | |
| "loss": 0.4674933850765228, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.3285233974456787, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0453268326818943, | |
| "rewards/margins": 7.891117572784424, | |
| "rewards/rejected": -7.845790863037109, | |
| "step": 285, | |
| "train_speed(iter/s)": 0.091303 | |
| }, | |
| { | |
| "epoch": 0.7192706696007545, | |
| "grad_norm": 2.496291160583496, | |
| "learning_rate": 0.0001809343409185141, | |
| "logits/chosen": -0.533951997756958, | |
| "logits/rejected": -0.8393864631652832, | |
| "logps/chosen": -5.252377510070801, | |
| "logps/rejected": -108.10926055908203, | |
| "loss": 0.4806031584739685, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.35059598088264465, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.26575902104377747, | |
| "rewards/margins": 9.291682243347168, | |
| "rewards/rejected": -9.025922775268555, | |
| "step": 286, | |
| "train_speed(iter/s)": 0.089086 | |
| }, | |
| { | |
| "epoch": 0.721785602011946, | |
| "grad_norm": 12.633203506469727, | |
| "learning_rate": 0.00018077088392944157, | |
| "logits/chosen": -0.5087528228759766, | |
| "logits/rejected": -0.7988476753234863, | |
| "logps/chosen": -4.803990840911865, | |
| "logps/rejected": -134.75717163085938, | |
| "loss": 0.5371387600898743, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.4104423522949219, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09430995583534241, | |
| "rewards/margins": 11.716846466064453, | |
| "rewards/rejected": -11.622535705566406, | |
| "step": 287, | |
| "train_speed(iter/s)": 0.086965 | |
| }, | |
| { | |
| "epoch": 0.7243005344231374, | |
| "grad_norm": 6.384928226470947, | |
| "learning_rate": 0.00018060680373800517, | |
| "logits/chosen": -0.634199857711792, | |
| "logits/rejected": -0.8538622260093689, | |
| "logps/chosen": -7.401331901550293, | |
| "logps/rejected": -99.94730377197266, | |
| "loss": 0.9957684874534607, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.7036086916923523, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.18307247757911682, | |
| "rewards/margins": 8.665613174438477, | |
| "rewards/rejected": -8.848685264587402, | |
| "step": 288, | |
| "train_speed(iter/s)": 0.084995 | |
| }, | |
| { | |
| "epoch": 0.7268154668343288, | |
| "grad_norm": 1.3055838346481323, | |
| "learning_rate": 0.00018044210161019536, | |
| "logits/chosen": -0.6348901391029358, | |
| "logits/rejected": -0.8540142774581909, | |
| "logps/chosen": -3.750216484069824, | |
| "logps/rejected": -116.36519622802734, | |
| "loss": 0.43587327003479004, | |
| "memory(GiB)": 38.68, | |
| "nll_loss": 0.3083232641220093, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.27759620547294617, | |
| "rewards/margins": 10.4413480758667, | |
| "rewards/rejected": -10.163751602172852, | |
| "step": 289, | |
| "train_speed(iter/s)": 0.083116 | |
| }, | |
| { | |
| "epoch": 0.7293303992455202, | |
| "grad_norm": 6.336847305297852, | |
| "learning_rate": 0.0001802767788168011, | |
| "logits/chosen": -0.49168598651885986, | |
| "logits/rejected": -0.7385163307189941, | |
| "logps/chosen": -5.862331867218018, | |
| "logps/rejected": -90.92340850830078, | |
| "loss": 0.5076504349708557, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.40712910890579224, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.007690219208598137, | |
| "rewards/margins": 7.30800724029541, | |
| "rewards/rejected": -7.31569766998291, | |
| "step": 290, | |
| "train_speed(iter/s)": 0.081314 | |
| }, | |
| { | |
| "epoch": 0.7318453316567117, | |
| "grad_norm": 1.5834612846374512, | |
| "learning_rate": 0.0001801108366334004, | |
| "logits/chosen": -0.49157392978668213, | |
| "logits/rejected": -0.8517095446586609, | |
| "logps/chosen": -2.9823904037475586, | |
| "logps/rejected": -128.86550903320312, | |
| "loss": 0.28464004397392273, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.19038352370262146, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11139468103647232, | |
| "rewards/margins": 11.453866004943848, | |
| "rewards/rejected": -11.3424711227417, | |
| "step": 291, | |
| "train_speed(iter/s)": 0.079608 | |
| }, | |
| { | |
| "epoch": 0.7343602640679032, | |
| "grad_norm": 2.694648265838623, | |
| "learning_rate": 0.00017994427634035015, | |
| "logits/chosen": -0.4209265410900116, | |
| "logits/rejected": -0.7504950761795044, | |
| "logps/chosen": -6.3449931144714355, | |
| "logps/rejected": -102.324951171875, | |
| "loss": 0.48612844944000244, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.439787358045578, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.05951198935508728, | |
| "rewards/margins": 8.676319122314453, | |
| "rewards/rejected": -8.735831260681152, | |
| "step": 292, | |
| "train_speed(iter/s)": 0.077977 | |
| }, | |
| { | |
| "epoch": 0.7368751964790946, | |
| "grad_norm": 12.563709259033203, | |
| "learning_rate": 0.00017977709922277634, | |
| "logits/chosen": -0.546952486038208, | |
| "logits/rejected": -0.8098918199539185, | |
| "logps/chosen": -3.903282880783081, | |
| "logps/rejected": -106.09379577636719, | |
| "loss": 0.4184201657772064, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.2776867151260376, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11045068502426147, | |
| "rewards/margins": 9.161507606506348, | |
| "rewards/rejected": -9.051055908203125, | |
| "step": 293, | |
| "train_speed(iter/s)": 0.076428 | |
| }, | |
| { | |
| "epoch": 0.7393901288902861, | |
| "grad_norm": 10.21599292755127, | |
| "learning_rate": 0.00017960930657056438, | |
| "logits/chosen": -0.4862319827079773, | |
| "logits/rejected": -0.8446335196495056, | |
| "logps/chosen": -4.003853797912598, | |
| "logps/rejected": -124.26484680175781, | |
| "loss": 0.5325912833213806, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.4379286766052246, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.017376184463500977, | |
| "rewards/margins": 10.38001823425293, | |
| "rewards/rejected": -10.397393226623535, | |
| "step": 294, | |
| "train_speed(iter/s)": 0.074951 | |
| }, | |
| { | |
| "epoch": 0.7419050613014775, | |
| "grad_norm": 2.1142091751098633, | |
| "learning_rate": 0.00017944089967834875, | |
| "logits/chosen": -0.6149781942367554, | |
| "logits/rejected": -0.8646234273910522, | |
| "logps/chosen": -4.966188907623291, | |
| "logps/rejected": -105.03376007080078, | |
| "loss": 0.3664693236351013, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.29172563552856445, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12611237168312073, | |
| "rewards/margins": 8.863950729370117, | |
| "rewards/rejected": -8.737838745117188, | |
| "step": 295, | |
| "train_speed(iter/s)": 0.073543 | |
| }, | |
| { | |
| "epoch": 0.744419993712669, | |
| "grad_norm": 2.3182928562164307, | |
| "learning_rate": 0.00017927187984550334, | |
| "logits/chosen": -0.4714081883430481, | |
| "logits/rejected": -0.8076429963111877, | |
| "logps/chosen": -5.210522174835205, | |
| "logps/rejected": -94.38253784179688, | |
| "loss": 0.40223944187164307, | |
| "memory(GiB)": 42.19, | |
| "nll_loss": 0.3296588659286499, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.05410341918468475, | |
| "rewards/margins": 7.804743766784668, | |
| "rewards/rejected": -7.750640392303467, | |
| "step": 296, | |
| "train_speed(iter/s)": 0.072191 | |
| }, | |
| { | |
| "epoch": 0.7469349261238605, | |
| "grad_norm": 1.6627568006515503, | |
| "learning_rate": 0.00017910224837613118, | |
| "logits/chosen": -0.5375725030899048, | |
| "logits/rejected": -0.7311803698539734, | |
| "logps/chosen": -5.645050048828125, | |
| "logps/rejected": -86.46006774902344, | |
| "loss": 0.4087020456790924, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.2872757613658905, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12224967032670975, | |
| "rewards/margins": 6.998920440673828, | |
| "rewards/rejected": -6.876670837402344, | |
| "step": 297, | |
| "train_speed(iter/s)": 0.070893 | |
| }, | |
| { | |
| "epoch": 0.7494498585350519, | |
| "grad_norm": 7.537210941314697, | |
| "learning_rate": 0.0001789320065790546, | |
| "logits/chosen": -0.5413732528686523, | |
| "logits/rejected": -0.7798230051994324, | |
| "logps/chosen": -5.977290630340576, | |
| "logps/rejected": -84.39535522460938, | |
| "loss": 0.49224522709846497, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.3515035808086395, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.29318666458129883, | |
| "rewards/margins": 6.832826614379883, | |
| "rewards/rejected": -6.539640426635742, | |
| "step": 298, | |
| "train_speed(iter/s)": 0.06965 | |
| }, | |
| { | |
| "epoch": 0.7519647909462434, | |
| "grad_norm": 13.154047012329102, | |
| "learning_rate": 0.00017876115576780498, | |
| "logits/chosen": -0.56256502866745, | |
| "logits/rejected": -0.7628785371780396, | |
| "logps/chosen": -8.302791595458984, | |
| "logps/rejected": -71.12387084960938, | |
| "loss": 0.7186374068260193, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.5491286516189575, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.04678814485669136, | |
| "rewards/margins": 5.721759796142578, | |
| "rewards/rejected": -5.768548488616943, | |
| "step": 299, | |
| "train_speed(iter/s)": 0.068463 | |
| }, | |
| { | |
| "epoch": 0.7544797233574347, | |
| "grad_norm": 2.1101605892181396, | |
| "learning_rate": 0.0001785896972606126, | |
| "logits/chosen": -0.6424190998077393, | |
| "logits/rejected": -0.8492656946182251, | |
| "logps/chosen": -6.954460144042969, | |
| "logps/rejected": -72.85733795166016, | |
| "loss": 0.5062767267227173, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.4268747568130493, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.18685287237167358, | |
| "rewards/margins": 6.121685028076172, | |
| "rewards/rejected": -5.934832572937012, | |
| "step": 300, | |
| "train_speed(iter/s)": 0.067324 | |
| }, | |
| { | |
| "epoch": 0.7544797233574347, | |
| "eval_logits/chosen": -0.6104318499565125, | |
| "eval_logits/rejected": -0.8290396332740784, | |
| "eval_logps/chosen": -5.665504455566406, | |
| "eval_logps/rejected": -75.69713592529297, | |
| "eval_loss": 0.5146161317825317, | |
| "eval_nll_loss": 0.36346134543418884, | |
| "eval_rewards/accuracies": 0.953125, | |
| "eval_rewards/chosen": 0.1080789864063263, | |
| "eval_rewards/margins": 6.1169891357421875, | |
| "eval_rewards/rejected": -6.008910179138184, | |
| "eval_runtime": 138.6744, | |
| "eval_samples_per_second": 0.923, | |
| "eval_steps_per_second": 0.462, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.7569946557686262, | |
| "grad_norm": 2.742777109146118, | |
| "learning_rate": 0.00017841763238039663, | |
| "logits/chosen": -0.5258588194847107, | |
| "logits/rejected": -0.8002297878265381, | |
| "logps/chosen": -9.598472595214844, | |
| "logps/rejected": -73.01333618164062, | |
| "loss": 0.6272799968719482, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.45022809505462646, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14143598079681396, | |
| "rewards/margins": 5.63870096206665, | |
| "rewards/rejected": -5.497264862060547, | |
| "step": 301, | |
| "train_speed(iter/s)": 0.064032 | |
| }, | |
| { | |
| "epoch": 0.7595095881798176, | |
| "grad_norm": 4.982257843017578, | |
| "learning_rate": 0.00017824496245475477, | |
| "logits/chosen": -0.5467951893806458, | |
| "logits/rejected": -0.8088864088058472, | |
| "logps/chosen": -5.489375114440918, | |
| "logps/rejected": -68.20091247558594, | |
| "loss": 0.6761376261711121, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.46992918848991394, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.03441940248012543, | |
| "rewards/margins": 5.287006378173828, | |
| "rewards/rejected": -5.252586841583252, | |
| "step": 302, | |
| "train_speed(iter/s)": 0.063055 | |
| }, | |
| { | |
| "epoch": 0.7620245205910091, | |
| "grad_norm": 2.363013982772827, | |
| "learning_rate": 0.00017807168881595303, | |
| "logits/chosen": -0.486921101808548, | |
| "logits/rejected": -0.7870367765426636, | |
| "logps/chosen": -3.2118942737579346, | |
| "logps/rejected": -80.78832244873047, | |
| "loss": 0.3174203336238861, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.22700631618499756, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.0014025792479515076, | |
| "rewards/margins": 6.200619697570801, | |
| "rewards/rejected": -6.199216842651367, | |
| "step": 303, | |
| "train_speed(iter/s)": 0.062112 | |
| }, | |
| { | |
| "epoch": 0.7645394530022006, | |
| "grad_norm": 2.5794389247894287, | |
| "learning_rate": 0.00017789781280091557, | |
| "logits/chosen": -0.5253547430038452, | |
| "logits/rejected": -0.7778689861297607, | |
| "logps/chosen": -2.740814685821533, | |
| "logps/rejected": -63.18760299682617, | |
| "loss": 0.43329575657844543, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.25420501828193665, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11472588777542114, | |
| "rewards/margins": 4.892645359039307, | |
| "rewards/rejected": -4.777919292449951, | |
| "step": 304, | |
| "train_speed(iter/s)": 0.061202 | |
| }, | |
| { | |
| "epoch": 0.767054385413392, | |
| "grad_norm": 3.204162836074829, | |
| "learning_rate": 0.0001777233357512142, | |
| "logits/chosen": -0.48726359009742737, | |
| "logits/rejected": -0.7712681293487549, | |
| "logps/chosen": -4.6791911125183105, | |
| "logps/rejected": -73.8591079711914, | |
| "loss": 0.49168315529823303, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.3878230154514313, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12156429141759872, | |
| "rewards/margins": 5.675488471984863, | |
| "rewards/rejected": -5.553924083709717, | |
| "step": 305, | |
| "train_speed(iter/s)": 0.060326 | |
| }, | |
| { | |
| "epoch": 0.7695693178245835, | |
| "grad_norm": 2.685102939605713, | |
| "learning_rate": 0.00017754825901305813, | |
| "logits/chosen": -0.49732205271720886, | |
| "logits/rejected": -0.6546094417572021, | |
| "logps/chosen": -9.81102180480957, | |
| "logps/rejected": -60.67332077026367, | |
| "loss": 0.6829510927200317, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.5321569442749023, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23814226686954498, | |
| "rewards/margins": 4.872373104095459, | |
| "rewards/rejected": -4.634230613708496, | |
| "step": 306, | |
| "train_speed(iter/s)": 0.059474 | |
| }, | |
| { | |
| "epoch": 0.7720842502357749, | |
| "grad_norm": 2.191077947616577, | |
| "learning_rate": 0.00017737258393728364, | |
| "logits/chosen": -0.3749886453151703, | |
| "logits/rejected": -0.7177920341491699, | |
| "logps/chosen": -3.679948329925537, | |
| "logps/rejected": -76.73285675048828, | |
| "loss": 0.44855624437332153, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.31453874707221985, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.11833418905735016, | |
| "rewards/margins": 5.410902976989746, | |
| "rewards/rejected": -5.292569160461426, | |
| "step": 307, | |
| "train_speed(iter/s)": 0.058652 | |
| }, | |
| { | |
| "epoch": 0.7745991826469664, | |
| "grad_norm": 5.087850570678711, | |
| "learning_rate": 0.00017719631187934352, | |
| "logits/chosen": -0.4312075078487396, | |
| "logits/rejected": -0.7199861407279968, | |
| "logps/chosen": -5.141556739807129, | |
| "logps/rejected": -84.90442657470703, | |
| "loss": 0.49092957377433777, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.3564959764480591, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.06924839317798615, | |
| "rewards/margins": 6.585083961486816, | |
| "rewards/rejected": -6.515835762023926, | |
| "step": 308, | |
| "train_speed(iter/s)": 0.057859 | |
| }, | |
| { | |
| "epoch": 0.7771141150581579, | |
| "grad_norm": 1.931964635848999, | |
| "learning_rate": 0.00017701944419929672, | |
| "logits/chosen": -0.5209879279136658, | |
| "logits/rejected": -0.7744486331939697, | |
| "logps/chosen": -4.660381317138672, | |
| "logps/rejected": -75.40290069580078, | |
| "loss": 0.380489319562912, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.2925787568092346, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.07492721825838089, | |
| "rewards/margins": 5.759749412536621, | |
| "rewards/rejected": -5.684822082519531, | |
| "step": 309, | |
| "train_speed(iter/s)": 0.057092 | |
| }, | |
| { | |
| "epoch": 0.7796290474693492, | |
| "grad_norm": 1.4231215715408325, | |
| "learning_rate": 0.00017684198226179784, | |
| "logits/chosen": -0.5286337733268738, | |
| "logits/rejected": -0.7741042375564575, | |
| "logps/chosen": -5.322835922241211, | |
| "logps/rejected": -94.39818572998047, | |
| "loss": 0.32215720415115356, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.23559962213039398, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.03720661997795105, | |
| "rewards/margins": 7.8387603759765625, | |
| "rewards/rejected": -7.8015546798706055, | |
| "step": 310, | |
| "train_speed(iter/s)": 0.056351 | |
| }, | |
| { | |
| "epoch": 0.7821439798805407, | |
| "grad_norm": 3.5972278118133545, | |
| "learning_rate": 0.00017666392743608656, | |
| "logits/chosen": -0.587047815322876, | |
| "logits/rejected": -0.6886476874351501, | |
| "logps/chosen": -11.391901969909668, | |
| "logps/rejected": -63.259220123291016, | |
| "loss": 0.631456732749939, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.4477965831756592, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2087097316980362, | |
| "rewards/margins": 5.190671920776367, | |
| "rewards/rejected": -4.981962203979492, | |
| "step": 311, | |
| "train_speed(iter/s)": 0.055631 | |
| }, | |
| { | |
| "epoch": 0.7846589122917321, | |
| "grad_norm": 6.570708751678467, | |
| "learning_rate": 0.00017648528109597705, | |
| "logits/chosen": -0.5264805555343628, | |
| "logits/rejected": -0.6204366683959961, | |
| "logps/chosen": -5.628443241119385, | |
| "logps/rejected": -55.631587982177734, | |
| "loss": 0.44488024711608887, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.29311853647232056, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15758532285690308, | |
| "rewards/margins": 4.487579345703125, | |
| "rewards/rejected": -4.329994201660156, | |
| "step": 312, | |
| "train_speed(iter/s)": 0.054937 | |
| }, | |
| { | |
| "epoch": 0.7871738447029236, | |
| "grad_norm": 2.2891812324523926, | |
| "learning_rate": 0.00017630604461984746, | |
| "logits/chosen": -0.49812430143356323, | |
| "logits/rejected": -0.7942063808441162, | |
| "logps/chosen": -4.372743606567383, | |
| "logps/rejected": -94.14138793945312, | |
| "loss": 0.36223098635673523, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.30161458253860474, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10362353175878525, | |
| "rewards/margins": 7.83615255355835, | |
| "rewards/rejected": -7.7325286865234375, | |
| "step": 313, | |
| "train_speed(iter/s)": 0.054263 | |
| }, | |
| { | |
| "epoch": 0.789688777114115, | |
| "grad_norm": 4.033056259155273, | |
| "learning_rate": 0.00017612621939062928, | |
| "logits/chosen": -0.5049434304237366, | |
| "logits/rejected": -0.7435040473937988, | |
| "logps/chosen": -3.835451364517212, | |
| "logps/rejected": -84.56083679199219, | |
| "loss": 0.43754124641418457, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.2978503704071045, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17277862131595612, | |
| "rewards/margins": 6.71329402923584, | |
| "rewards/rejected": -6.540514945983887, | |
| "step": 314, | |
| "train_speed(iter/s)": 0.053607 | |
| }, | |
| { | |
| "epoch": 0.7922037095253065, | |
| "grad_norm": 4.677379608154297, | |
| "learning_rate": 0.00017594580679579656, | |
| "logits/chosen": -0.4425162076950073, | |
| "logits/rejected": -0.7090457677841187, | |
| "logps/chosen": -4.391209602355957, | |
| "logps/rejected": -78.58367919921875, | |
| "loss": 0.5179426670074463, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.3796064257621765, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.003046363592147827, | |
| "rewards/margins": 6.267105579376221, | |
| "rewards/rejected": -6.264059066772461, | |
| "step": 315, | |
| "train_speed(iter/s)": 0.052969 | |
| }, | |
| { | |
| "epoch": 0.794718641936498, | |
| "grad_norm": 2.2975409030914307, | |
| "learning_rate": 0.00017576480822735532, | |
| "logits/chosen": -0.552763819694519, | |
| "logits/rejected": -0.7386415004730225, | |
| "logps/chosen": -6.633852005004883, | |
| "logps/rejected": -75.99591827392578, | |
| "loss": 0.5104320049285889, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.4509289562702179, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.13848751783370972, | |
| "rewards/margins": 6.377573013305664, | |
| "rewards/rejected": -6.239084720611572, | |
| "step": 316, | |
| "train_speed(iter/s)": 0.052355 | |
| }, | |
| { | |
| "epoch": 0.7972335743476894, | |
| "grad_norm": 1.692866325378418, | |
| "learning_rate": 0.00017558322508183275, | |
| "logits/chosen": -0.5113404393196106, | |
| "logits/rejected": -0.7546023726463318, | |
| "logps/chosen": -8.723966598510742, | |
| "logps/rejected": -68.92810821533203, | |
| "loss": 0.3866414725780487, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.2663732171058655, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12023188173770905, | |
| "rewards/margins": 5.404682159423828, | |
| "rewards/rejected": -5.284450054168701, | |
| "step": 317, | |
| "train_speed(iter/s)": 0.051754 | |
| }, | |
| { | |
| "epoch": 0.7997485067588809, | |
| "grad_norm": 1.7934551239013672, | |
| "learning_rate": 0.00017540105876026648, | |
| "logits/chosen": -0.5510843396186829, | |
| "logits/rejected": -0.7684234976768494, | |
| "logps/chosen": -4.503855228424072, | |
| "logps/rejected": -73.94355010986328, | |
| "loss": 0.49109137058258057, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.33945515751838684, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.08985169976949692, | |
| "rewards/margins": 6.044112682342529, | |
| "rewards/rejected": -5.9542622566223145, | |
| "step": 318, | |
| "train_speed(iter/s)": 0.051176 | |
| }, | |
| { | |
| "epoch": 0.8022634391700723, | |
| "grad_norm": 2.696263074874878, | |
| "learning_rate": 0.00017521831066819363, | |
| "logits/chosen": -0.6849238872528076, | |
| "logits/rejected": -0.7512338757514954, | |
| "logps/chosen": -7.439488410949707, | |
| "logps/rejected": -54.92814636230469, | |
| "loss": 0.5880566835403442, | |
| "memory(GiB)": 45.72, | |
| "nll_loss": 0.32204046845436096, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.08035062998533249, | |
| "rewards/margins": 4.1917901039123535, | |
| "rewards/rejected": -4.2721405029296875, | |
| "step": 319, | |
| "train_speed(iter/s)": 0.050611 | |
| }, | |
| { | |
| "epoch": 0.8047783715812638, | |
| "grad_norm": 8.225646018981934, | |
| "learning_rate": 0.00017503498221564025, | |
| "logits/chosen": -0.5244278311729431, | |
| "logits/rejected": -0.8192154169082642, | |
| "logps/chosen": -5.370640754699707, | |
| "logps/rejected": -69.76851654052734, | |
| "loss": 0.5900783538818359, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.43174654245376587, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.15494805574417114, | |
| "rewards/margins": 4.877842903137207, | |
| "rewards/rejected": -4.722894668579102, | |
| "step": 320, | |
| "train_speed(iter/s)": 0.050058 | |
| }, | |
| { | |
| "epoch": 0.8072933039924552, | |
| "grad_norm": 3.1263160705566406, | |
| "learning_rate": 0.00017485107481711012, | |
| "logits/chosen": -0.6532421112060547, | |
| "logits/rejected": -0.8408050537109375, | |
| "logps/chosen": -5.802052974700928, | |
| "logps/rejected": -69.45040893554688, | |
| "loss": 0.4921962022781372, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3598018288612366, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.016502581536769867, | |
| "rewards/margins": 5.566046714782715, | |
| "rewards/rejected": -5.582549571990967, | |
| "step": 321, | |
| "train_speed(iter/s)": 0.049526 | |
| }, | |
| { | |
| "epoch": 0.8098082364036466, | |
| "grad_norm": 1.3748646974563599, | |
| "learning_rate": 0.00017466658989157406, | |
| "logits/chosen": -0.5933704376220703, | |
| "logits/rejected": -0.8203169107437134, | |
| "logps/chosen": -4.698756694793701, | |
| "logps/rejected": -86.18940734863281, | |
| "loss": 0.39138850569725037, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3173418641090393, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.07632508128881454, | |
| "rewards/margins": 7.136272430419922, | |
| "rewards/rejected": -7.0599470138549805, | |
| "step": 322, | |
| "train_speed(iter/s)": 0.049007 | |
| }, | |
| { | |
| "epoch": 0.8123231688148381, | |
| "grad_norm": 1.2321858406066895, | |
| "learning_rate": 0.00017448152886245888, | |
| "logits/chosen": -0.6055665016174316, | |
| "logits/rejected": -0.835323691368103, | |
| "logps/chosen": -4.2663726806640625, | |
| "logps/rejected": -92.81077575683594, | |
| "loss": 0.31942421197891235, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.23250146210193634, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.29466480016708374, | |
| "rewards/margins": 7.823517799377441, | |
| "rewards/rejected": -7.528852939605713, | |
| "step": 323, | |
| "train_speed(iter/s)": 0.048501 | |
| }, | |
| { | |
| "epoch": 0.8148381012260295, | |
| "grad_norm": 9.860624313354492, | |
| "learning_rate": 0.00017429589315763638, | |
| "logits/chosen": -0.5517026782035828, | |
| "logits/rejected": -0.9087996482849121, | |
| "logps/chosen": -5.479660987854004, | |
| "logps/rejected": -96.31484985351562, | |
| "loss": 0.9468085169792175, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.8088601231575012, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.13317811489105225, | |
| "rewards/margins": 7.745667457580566, | |
| "rewards/rejected": -7.87884521484375, | |
| "step": 324, | |
| "train_speed(iter/s)": 0.048008 | |
| }, | |
| { | |
| "epoch": 0.817353033637221, | |
| "grad_norm": 1.578026294708252, | |
| "learning_rate": 0.00017410968420941244, | |
| "logits/chosen": -0.4647430181503296, | |
| "logits/rejected": -0.863081157207489, | |
| "logps/chosen": -5.37056827545166, | |
| "logps/rejected": -94.24394226074219, | |
| "loss": 0.4825628399848938, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4036305248737335, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21735483407974243, | |
| "rewards/margins": 7.361626148223877, | |
| "rewards/rejected": -7.144271373748779, | |
| "step": 325, | |
| "train_speed(iter/s)": 0.047523 | |
| }, | |
| { | |
| "epoch": 0.8198679660484125, | |
| "grad_norm": 5.969099044799805, | |
| "learning_rate": 0.00017392290345451592, | |
| "logits/chosen": -0.5345301628112793, | |
| "logits/rejected": -0.820349395275116, | |
| "logps/chosen": -6.029956817626953, | |
| "logps/rejected": -104.83753204345703, | |
| "loss": 0.5511329174041748, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4094994068145752, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2000085562467575, | |
| "rewards/margins": 8.80609130859375, | |
| "rewards/rejected": -8.606082916259766, | |
| "step": 326, | |
| "train_speed(iter/s)": 0.047054 | |
| }, | |
| { | |
| "epoch": 0.8223828984596039, | |
| "grad_norm": 7.578153133392334, | |
| "learning_rate": 0.0001737355523340875, | |
| "logits/chosen": -0.7083917856216431, | |
| "logits/rejected": -0.9140143990516663, | |
| "logps/chosen": -5.282914161682129, | |
| "logps/rejected": -89.25215148925781, | |
| "loss": 0.6085916757583618, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4778170585632324, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.04538874328136444, | |
| "rewards/margins": 7.695877552032471, | |
| "rewards/rejected": -7.650489807128906, | |
| "step": 327, | |
| "train_speed(iter/s)": 0.046602 | |
| }, | |
| { | |
| "epoch": 0.8248978308707954, | |
| "grad_norm": 7.923031330108643, | |
| "learning_rate": 0.0001735476322936686, | |
| "logits/chosen": -0.48410487174987793, | |
| "logits/rejected": -0.8404121398925781, | |
| "logps/chosen": -5.619724273681641, | |
| "logps/rejected": -111.05279541015625, | |
| "loss": 0.5005356073379517, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.415988028049469, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.04838261753320694, | |
| "rewards/margins": 9.071845054626465, | |
| "rewards/rejected": -9.023462295532227, | |
| "step": 328, | |
| "train_speed(iter/s)": 0.046157 | |
| }, | |
| { | |
| "epoch": 0.8274127632819868, | |
| "grad_norm": 1.6029303073883057, | |
| "learning_rate": 0.00017335914478319028, | |
| "logits/chosen": -0.5107839107513428, | |
| "logits/rejected": -0.811547577381134, | |
| "logps/chosen": -5.087898254394531, | |
| "logps/rejected": -90.02484130859375, | |
| "loss": 0.4403790235519409, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3421851396560669, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1459052413702011, | |
| "rewards/margins": 7.192948341369629, | |
| "rewards/rejected": -7.047042369842529, | |
| "step": 329, | |
| "train_speed(iter/s)": 0.045725 | |
| }, | |
| { | |
| "epoch": 0.8299276956931783, | |
| "grad_norm": 1.4880335330963135, | |
| "learning_rate": 0.00017317009125696208, | |
| "logits/chosen": -0.5659950375556946, | |
| "logits/rejected": -0.8397157192230225, | |
| "logps/chosen": -4.4726243019104, | |
| "logps/rejected": -92.63803100585938, | |
| "loss": 0.2614552974700928, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.21865251660346985, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20230340957641602, | |
| "rewards/margins": 7.986957550048828, | |
| "rewards/rejected": -7.784653663635254, | |
| "step": 330, | |
| "train_speed(iter/s)": 0.045303 | |
| }, | |
| { | |
| "epoch": 0.8324426281043696, | |
| "grad_norm": 4.477383136749268, | |
| "learning_rate": 0.00017298047317366061, | |
| "logits/chosen": -0.5597605109214783, | |
| "logits/rejected": -0.8359659910202026, | |
| "logps/chosen": -3.7963671684265137, | |
| "logps/rejected": -79.54478454589844, | |
| "loss": 0.386127769947052, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.30003517866134644, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13904371857643127, | |
| "rewards/margins": 6.464727401733398, | |
| "rewards/rejected": -6.32568359375, | |
| "step": 331, | |
| "train_speed(iter/s)": 0.044893 | |
| }, | |
| { | |
| "epoch": 0.8349575605155611, | |
| "grad_norm": 1.3735220432281494, | |
| "learning_rate": 0.00017279029199631857, | |
| "logits/chosen": -0.4946771264076233, | |
| "logits/rejected": -0.8467792272567749, | |
| "logps/chosen": -2.6571059226989746, | |
| "logps/rejected": -94.11196899414062, | |
| "loss": 0.2998129427433014, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.22292877733707428, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12367352843284607, | |
| "rewards/margins": 8.038744926452637, | |
| "rewards/rejected": -7.915071487426758, | |
| "step": 332, | |
| "train_speed(iter/s)": 0.044491 | |
| }, | |
| { | |
| "epoch": 0.8374724929267526, | |
| "grad_norm": 2.6437320709228516, | |
| "learning_rate": 0.0001725995491923131, | |
| "logits/chosen": -0.552052915096283, | |
| "logits/rejected": -0.754858136177063, | |
| "logps/chosen": -11.185404777526855, | |
| "logps/rejected": -86.47320556640625, | |
| "loss": 0.8312444090843201, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.6818321943283081, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.01666903868317604, | |
| "rewards/margins": 6.93008279800415, | |
| "rewards/rejected": -6.946751594543457, | |
| "step": 333, | |
| "train_speed(iter/s)": 0.044095 | |
| }, | |
| { | |
| "epoch": 0.839987425337944, | |
| "grad_norm": 8.506746292114258, | |
| "learning_rate": 0.0001724082462333549, | |
| "logits/chosen": -0.5991488099098206, | |
| "logits/rejected": -0.8054255843162537, | |
| "logps/chosen": -5.842095375061035, | |
| "logps/rejected": -69.10340118408203, | |
| "loss": 0.6470210552215576, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4332461953163147, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.05430920422077179, | |
| "rewards/margins": 5.4711198806762695, | |
| "rewards/rejected": -5.5254292488098145, | |
| "step": 334, | |
| "train_speed(iter/s)": 0.043713 | |
| }, | |
| { | |
| "epoch": 0.8425023577491355, | |
| "grad_norm": 4.649921894073486, | |
| "learning_rate": 0.00017221638459547655, | |
| "logits/chosen": -0.6327688694000244, | |
| "logits/rejected": -0.8601678609848022, | |
| "logps/chosen": -10.89456558227539, | |
| "logps/rejected": -83.64013671875, | |
| "loss": 0.9836386442184448, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.8277321457862854, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.3010229766368866, | |
| "rewards/margins": 6.816217422485352, | |
| "rewards/rejected": -7.1172404289245605, | |
| "step": 335, | |
| "train_speed(iter/s)": 0.043343 | |
| }, | |
| { | |
| "epoch": 0.8450172901603269, | |
| "grad_norm": 3.5049939155578613, | |
| "learning_rate": 0.00017202396575902116, | |
| "logits/chosen": -0.5969817042350769, | |
| "logits/rejected": -0.7890011072158813, | |
| "logps/chosen": -8.715362548828125, | |
| "logps/rejected": -87.10135650634766, | |
| "loss": 0.6040844321250916, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.48410138487815857, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.02549554966390133, | |
| "rewards/margins": 6.946871280670166, | |
| "rewards/rejected": -6.9213762283325195, | |
| "step": 336, | |
| "train_speed(iter/s)": 0.042976 | |
| }, | |
| { | |
| "epoch": 0.8475322225715184, | |
| "grad_norm": 2.5609958171844482, | |
| "learning_rate": 0.00017183099120863116, | |
| "logits/chosen": -0.5624786615371704, | |
| "logits/rejected": -0.8555223941802979, | |
| "logps/chosen": -2.920971393585205, | |
| "logps/rejected": -87.21141815185547, | |
| "loss": 0.25303125381469727, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.17635448276996613, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1297520101070404, | |
| "rewards/margins": 7.165301322937012, | |
| "rewards/rejected": -7.035548210144043, | |
| "step": 337, | |
| "train_speed(iter/s)": 0.04262 | |
| }, | |
| { | |
| "epoch": 0.8500471549827099, | |
| "grad_norm": 2.219430923461914, | |
| "learning_rate": 0.0001716374624332365, | |
| "logits/chosen": -0.4873535931110382, | |
| "logits/rejected": -0.865464985370636, | |
| "logps/chosen": -4.004513740539551, | |
| "logps/rejected": -99.60807800292969, | |
| "loss": 0.3732931613922119, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.32243484258651733, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09392180293798447, | |
| "rewards/margins": 7.731295108795166, | |
| "rewards/rejected": -7.637372970581055, | |
| "step": 338, | |
| "train_speed(iter/s)": 0.042269 | |
| }, | |
| { | |
| "epoch": 0.8525620873939013, | |
| "grad_norm": 1.4633954763412476, | |
| "learning_rate": 0.0001714433809260435, | |
| "logits/chosen": -0.5742372274398804, | |
| "logits/rejected": -0.7338902950286865, | |
| "logps/chosen": -13.275593757629395, | |
| "logps/rejected": -84.15313720703125, | |
| "loss": 0.6252297759056091, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.5572872757911682, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1977962702512741, | |
| "rewards/margins": 6.996209621429443, | |
| "rewards/rejected": -6.798413276672363, | |
| "step": 339, | |
| "train_speed(iter/s)": 0.041927 | |
| }, | |
| { | |
| "epoch": 0.8550770198050928, | |
| "grad_norm": 3.0565924644470215, | |
| "learning_rate": 0.0001712487481845231, | |
| "logits/chosen": -0.3683091104030609, | |
| "logits/rejected": -0.7499415874481201, | |
| "logps/chosen": -6.7348151206970215, | |
| "logps/rejected": -91.9858169555664, | |
| "loss": 0.37550103664398193, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2465668022632599, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.00661234837025404, | |
| "rewards/margins": 7.401021957397461, | |
| "rewards/rejected": -7.40763521194458, | |
| "step": 340, | |
| "train_speed(iter/s)": 0.041588 | |
| }, | |
| { | |
| "epoch": 0.8575919522162841, | |
| "grad_norm": 1.3918770551681519, | |
| "learning_rate": 0.00017105356571039945, | |
| "logits/chosen": -0.49031901359558105, | |
| "logits/rejected": -0.8110065460205078, | |
| "logps/chosen": -7.980224132537842, | |
| "logps/rejected": -82.05560302734375, | |
| "loss": 0.458918035030365, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3925769627094269, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.05228738859295845, | |
| "rewards/margins": 6.4176025390625, | |
| "rewards/rejected": -6.365314960479736, | |
| "step": 341, | |
| "train_speed(iter/s)": 0.04126 | |
| }, | |
| { | |
| "epoch": 0.8601068846274756, | |
| "grad_norm": 2.4676175117492676, | |
| "learning_rate": 0.00017085783500963824, | |
| "logits/chosen": -0.4095371961593628, | |
| "logits/rejected": -0.7287023067474365, | |
| "logps/chosen": -3.0237834453582764, | |
| "logps/rejected": -64.21556091308594, | |
| "loss": 0.30038806796073914, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.17780858278274536, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22278741002082825, | |
| "rewards/margins": 4.871509075164795, | |
| "rewards/rejected": -4.648721218109131, | |
| "step": 342, | |
| "train_speed(iter/s)": 0.040936 | |
| }, | |
| { | |
| "epoch": 0.8626218170386671, | |
| "grad_norm": 2.6251206398010254, | |
| "learning_rate": 0.00017066155759243507, | |
| "logits/chosen": -0.559488832950592, | |
| "logits/rejected": -0.7672823667526245, | |
| "logps/chosen": -4.220951557159424, | |
| "logps/rejected": -62.22422790527344, | |
| "loss": 0.30714038014411926, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.201259046792984, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.024884473532438278, | |
| "rewards/margins": 4.834282398223877, | |
| "rewards/rejected": -4.809398174285889, | |
| "step": 343, | |
| "train_speed(iter/s)": 0.040623 | |
| }, | |
| { | |
| "epoch": 0.8651367494498585, | |
| "grad_norm": 1.955743670463562, | |
| "learning_rate": 0.00017046473497320385, | |
| "logits/chosen": -0.5384873151779175, | |
| "logits/rejected": -0.7534351944923401, | |
| "logps/chosen": -4.600622653961182, | |
| "logps/rejected": -62.08992004394531, | |
| "loss": 0.4026404619216919, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.30260390043258667, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.04929278418421745, | |
| "rewards/margins": 4.71509313583374, | |
| "rewards/rejected": -4.665800094604492, | |
| "step": 344, | |
| "train_speed(iter/s)": 0.040318 | |
| }, | |
| { | |
| "epoch": 0.86765168186105, | |
| "grad_norm": 1.3359214067459106, | |
| "learning_rate": 0.0001702673686705651, | |
| "logits/chosen": -0.5102373361587524, | |
| "logits/rejected": -0.7203519940376282, | |
| "logps/chosen": -3.7551567554473877, | |
| "logps/rejected": -58.683082580566406, | |
| "loss": 0.26333218812942505, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.1936265230178833, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.08393731713294983, | |
| "rewards/margins": 4.568361282348633, | |
| "rewards/rejected": -4.484423637390137, | |
| "step": 345, | |
| "train_speed(iter/s)": 0.040019 | |
| }, | |
| { | |
| "epoch": 0.8701666142722414, | |
| "grad_norm": 1.2940682172775269, | |
| "learning_rate": 0.00017006946020733425, | |
| "logits/chosen": -0.423111230134964, | |
| "logits/rejected": -0.6618233919143677, | |
| "logps/chosen": -3.599187135696411, | |
| "logps/rejected": -57.84706115722656, | |
| "loss": 0.23464316129684448, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.1839112639427185, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3290537893772125, | |
| "rewards/margins": 4.494791507720947, | |
| "rewards/rejected": -4.165737152099609, | |
| "step": 346, | |
| "train_speed(iter/s)": 0.039723 | |
| }, | |
| { | |
| "epoch": 0.8726815466834329, | |
| "grad_norm": 4.882867336273193, | |
| "learning_rate": 0.00016987101111050982, | |
| "logits/chosen": -0.487949937582016, | |
| "logits/rejected": -0.680131733417511, | |
| "logps/chosen": -7.074028015136719, | |
| "logps/rejected": -57.329803466796875, | |
| "loss": 0.5204004645347595, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4155931770801544, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21489042043685913, | |
| "rewards/margins": 4.179245471954346, | |
| "rewards/rejected": -3.9643547534942627, | |
| "step": 347, | |
| "train_speed(iter/s)": 0.039433 | |
| }, | |
| { | |
| "epoch": 0.8751964790946243, | |
| "grad_norm": 5.844240665435791, | |
| "learning_rate": 0.00016967202291126173, | |
| "logits/chosen": -0.371315062046051, | |
| "logits/rejected": -0.7444156408309937, | |
| "logps/chosen": -5.045580863952637, | |
| "logps/rejected": -67.66508483886719, | |
| "loss": 0.6576581001281738, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.48166701197624207, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07985140383243561, | |
| "rewards/margins": 4.563851833343506, | |
| "rewards/rejected": -4.484000205993652, | |
| "step": 348, | |
| "train_speed(iter/s)": 0.039147 | |
| }, | |
| { | |
| "epoch": 0.8777114115058158, | |
| "grad_norm": 7.42000675201416, | |
| "learning_rate": 0.00016947249714491938, | |
| "logits/chosen": -0.36127984523773193, | |
| "logits/rejected": -0.7726977467536926, | |
| "logps/chosen": -4.132587432861328, | |
| "logps/rejected": -69.11751556396484, | |
| "loss": 0.4309765100479126, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3314419388771057, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12238576263189316, | |
| "rewards/margins": 4.787508010864258, | |
| "rewards/rejected": -4.6651225090026855, | |
| "step": 349, | |
| "train_speed(iter/s)": 0.038867 | |
| }, | |
| { | |
| "epoch": 0.8802263439170073, | |
| "grad_norm": 8.671714782714844, | |
| "learning_rate": 0.00016927243535095997, | |
| "logits/chosen": -0.584995448589325, | |
| "logits/rejected": -0.7704389691352844, | |
| "logps/chosen": -5.863958358764648, | |
| "logps/rejected": -54.833553314208984, | |
| "loss": 0.6147282123565674, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.5134801864624023, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10420051962137222, | |
| "rewards/margins": 4.378936767578125, | |
| "rewards/rejected": -4.274736404418945, | |
| "step": 350, | |
| "train_speed(iter/s)": 0.038598 | |
| }, | |
| { | |
| "epoch": 0.8827412763281987, | |
| "grad_norm": 1.384485125541687, | |
| "learning_rate": 0.0001690718390729964, | |
| "logits/chosen": -0.49590209126472473, | |
| "logits/rejected": -0.7934409379959106, | |
| "logps/chosen": -3.4274821281433105, | |
| "logps/rejected": -75.05296325683594, | |
| "loss": 0.28905826807022095, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2423771321773529, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10859310626983643, | |
| "rewards/margins": 5.8243184089660645, | |
| "rewards/rejected": -5.715725898742676, | |
| "step": 351, | |
| "train_speed(iter/s)": 0.038264 | |
| }, | |
| { | |
| "epoch": 0.8852562087393901, | |
| "grad_norm": 2.392730474472046, | |
| "learning_rate": 0.00016887070985876555, | |
| "logits/chosen": -0.6525416970252991, | |
| "logits/rejected": -0.8886513710021973, | |
| "logps/chosen": -3.8878211975097656, | |
| "logps/rejected": -70.61896514892578, | |
| "loss": 0.3180730640888214, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.24728332459926605, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.021800898015499115, | |
| "rewards/margins": 5.6876444816589355, | |
| "rewards/rejected": -5.709445476531982, | |
| "step": 352, | |
| "train_speed(iter/s)": 0.038006 | |
| }, | |
| { | |
| "epoch": 0.8877711411505815, | |
| "grad_norm": 1.8687230348587036, | |
| "learning_rate": 0.00016866904926011623, | |
| "logits/chosen": -0.5100048780441284, | |
| "logits/rejected": -0.8430832028388977, | |
| "logps/chosen": -7.690830230712891, | |
| "logps/rejected": -79.55768585205078, | |
| "loss": 0.5146079063415527, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.480059415102005, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.15592242777347565, | |
| "rewards/margins": 6.150962829589844, | |
| "rewards/rejected": -5.995040416717529, | |
| "step": 353, | |
| "train_speed(iter/s)": 0.03775 | |
| }, | |
| { | |
| "epoch": 0.890286073561773, | |
| "grad_norm": 2.0833466053009033, | |
| "learning_rate": 0.00016846685883299732, | |
| "logits/chosen": -0.6130125522613525, | |
| "logits/rejected": -0.8856174945831299, | |
| "logps/chosen": -2.691479206085205, | |
| "logps/rejected": -68.62126922607422, | |
| "loss": 0.29438382387161255, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.21310341358184814, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21031589806079865, | |
| "rewards/margins": 5.494964599609375, | |
| "rewards/rejected": -5.284648418426514, | |
| "step": 354, | |
| "train_speed(iter/s)": 0.037501 | |
| }, | |
| { | |
| "epoch": 0.8928010059729645, | |
| "grad_norm": 5.909437656402588, | |
| "learning_rate": 0.0001682641401374456, | |
| "logits/chosen": -0.5725633502006531, | |
| "logits/rejected": -0.8215086460113525, | |
| "logps/chosen": -7.275115966796875, | |
| "logps/rejected": -68.49534606933594, | |
| "loss": 0.683579683303833, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.408993124961853, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.1348603069782257, | |
| "rewards/margins": 5.070530891418457, | |
| "rewards/rejected": -5.205390930175781, | |
| "step": 355, | |
| "train_speed(iter/s)": 0.037256 | |
| }, | |
| { | |
| "epoch": 0.8953159383841559, | |
| "grad_norm": 12.008193016052246, | |
| "learning_rate": 0.00016806089473757384, | |
| "logits/chosen": -0.48063433170318604, | |
| "logits/rejected": -0.8200632929801941, | |
| "logps/chosen": -5.245819091796875, | |
| "logps/rejected": -75.48336791992188, | |
| "loss": 0.5572218894958496, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4593680500984192, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.042567022144794464, | |
| "rewards/margins": 5.983489036560059, | |
| "rewards/rejected": -5.940921783447266, | |
| "step": 356, | |
| "train_speed(iter/s)": 0.037015 | |
| }, | |
| { | |
| "epoch": 0.8978308707953474, | |
| "grad_norm": 2.3024280071258545, | |
| "learning_rate": 0.00016785712420155864, | |
| "logits/chosen": -0.5618032813072205, | |
| "logits/rejected": -0.7750505208969116, | |
| "logps/chosen": -5.727665424346924, | |
| "logps/rejected": -66.33029174804688, | |
| "loss": 0.49546992778778076, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3907400071620941, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2677232623100281, | |
| "rewards/margins": 5.57326078414917, | |
| "rewards/rejected": -5.305538177490234, | |
| "step": 357, | |
| "train_speed(iter/s)": 0.036778 | |
| }, | |
| { | |
| "epoch": 0.9003458032065388, | |
| "grad_norm": 1.5032073259353638, | |
| "learning_rate": 0.00016765283010162845, | |
| "logits/chosen": -0.6311084628105164, | |
| "logits/rejected": -0.884809136390686, | |
| "logps/chosen": -6.822357177734375, | |
| "logps/rejected": -86.34951782226562, | |
| "loss": 0.3546079099178314, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.32874923944473267, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21881002187728882, | |
| "rewards/margins": 7.21632719039917, | |
| "rewards/rejected": -6.997516632080078, | |
| "step": 358, | |
| "train_speed(iter/s)": 0.036547 | |
| }, | |
| { | |
| "epoch": 0.9028607356177303, | |
| "grad_norm": 12.216839790344238, | |
| "learning_rate": 0.0001674480140140514, | |
| "logits/chosen": -0.563357949256897, | |
| "logits/rejected": -0.8381999731063843, | |
| "logps/chosen": -5.951011657714844, | |
| "logps/rejected": -73.21198272705078, | |
| "loss": 0.6865818500518799, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4365982413291931, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.010548931546509266, | |
| "rewards/margins": 5.462331771850586, | |
| "rewards/rejected": -5.472881317138672, | |
| "step": 359, | |
| "train_speed(iter/s)": 0.036319 | |
| }, | |
| { | |
| "epoch": 0.9053756680289218, | |
| "grad_norm": 2.2943708896636963, | |
| "learning_rate": 0.000167242677519123, | |
| "logits/chosen": -0.5497739315032959, | |
| "logits/rejected": -0.7586756348609924, | |
| "logps/chosen": -6.904477596282959, | |
| "logps/rejected": -63.757484436035156, | |
| "loss": 0.524222195148468, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4234248697757721, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.012442603707313538, | |
| "rewards/margins": 4.878024578094482, | |
| "rewards/rejected": -4.865581512451172, | |
| "step": 360, | |
| "train_speed(iter/s)": 0.036096 | |
| }, | |
| { | |
| "epoch": 0.9078906004401132, | |
| "grad_norm": 1.8752505779266357, | |
| "learning_rate": 0.00016703682220115416, | |
| "logits/chosen": -0.49279505014419556, | |
| "logits/rejected": -0.6874585747718811, | |
| "logps/chosen": -6.828492641448975, | |
| "logps/rejected": -56.00688552856445, | |
| "loss": 0.5722380876541138, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4202978312969208, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.16803106665611267, | |
| "rewards/margins": 4.519139289855957, | |
| "rewards/rejected": -4.351108074188232, | |
| "step": 361, | |
| "train_speed(iter/s)": 0.035876 | |
| }, | |
| { | |
| "epoch": 0.9104055328513047, | |
| "grad_norm": 13.851007461547852, | |
| "learning_rate": 0.00016683044964845874, | |
| "logits/chosen": -0.3259517550468445, | |
| "logits/rejected": -0.7759101986885071, | |
| "logps/chosen": -2.291940689086914, | |
| "logps/rejected": -82.96823120117188, | |
| "loss": 0.3387893736362457, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.23984995484352112, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13379287719726562, | |
| "rewards/margins": 6.447347640991211, | |
| "rewards/rejected": -6.313554763793945, | |
| "step": 362, | |
| "train_speed(iter/s)": 0.035659 | |
| }, | |
| { | |
| "epoch": 0.912920465262496, | |
| "grad_norm": 3.0961484909057617, | |
| "learning_rate": 0.00016662356145334158, | |
| "logits/chosen": -0.4107140004634857, | |
| "logits/rejected": -0.7844898104667664, | |
| "logps/chosen": -6.643762111663818, | |
| "logps/rejected": -85.53607940673828, | |
| "loss": 0.7083590030670166, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.5615524053573608, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14561021327972412, | |
| "rewards/margins": 6.219028472900391, | |
| "rewards/rejected": -6.0734171867370605, | |
| "step": 363, | |
| "train_speed(iter/s)": 0.035445 | |
| }, | |
| { | |
| "epoch": 0.9154353976736875, | |
| "grad_norm": 3.2900326251983643, | |
| "learning_rate": 0.0001664161592120859, | |
| "logits/chosen": -0.48369789123535156, | |
| "logits/rejected": -0.8355358839035034, | |
| "logps/chosen": -4.989360332489014, | |
| "logps/rejected": -76.567138671875, | |
| "loss": 0.44374826550483704, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3595760762691498, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.027300171554088593, | |
| "rewards/margins": 6.1481733322143555, | |
| "rewards/rejected": -6.12087345123291, | |
| "step": 364, | |
| "train_speed(iter/s)": 0.035237 | |
| }, | |
| { | |
| "epoch": 0.9179503300848789, | |
| "grad_norm": 2.7764828205108643, | |
| "learning_rate": 0.00016620824452494128, | |
| "logits/chosen": -0.3900059163570404, | |
| "logits/rejected": -0.7216352224349976, | |
| "logps/chosen": -2.781705617904663, | |
| "logps/rejected": -72.1066665649414, | |
| "loss": 0.32665613293647766, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.22233696281909943, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2311152219772339, | |
| "rewards/margins": 5.6492919921875, | |
| "rewards/rejected": -5.418176651000977, | |
| "step": 365, | |
| "train_speed(iter/s)": 0.035032 | |
| }, | |
| { | |
| "epoch": 0.9204652624960704, | |
| "grad_norm": 3.265141010284424, | |
| "learning_rate": 0.00016599981899611104, | |
| "logits/chosen": -0.4622117280960083, | |
| "logits/rejected": -0.7529523372650146, | |
| "logps/chosen": -7.999266624450684, | |
| "logps/rejected": -65.14107513427734, | |
| "loss": 0.578423261642456, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.44822537899017334, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.09772372990846634, | |
| "rewards/margins": 4.932915210723877, | |
| "rewards/rejected": -5.030638694763184, | |
| "step": 366, | |
| "train_speed(iter/s)": 0.034831 | |
| }, | |
| { | |
| "epoch": 0.9229801949072619, | |
| "grad_norm": 7.041696071624756, | |
| "learning_rate": 0.00016579088423374004, | |
| "logits/chosen": -0.5291659235954285, | |
| "logits/rejected": -0.7164372205734253, | |
| "logps/chosen": -8.906322479248047, | |
| "logps/rejected": -56.788475036621094, | |
| "loss": 0.7593228816986084, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.5370157957077026, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.056440941989421844, | |
| "rewards/margins": 4.266091346740723, | |
| "rewards/rejected": -4.3225321769714355, | |
| "step": 367, | |
| "train_speed(iter/s)": 0.034633 | |
| }, | |
| { | |
| "epoch": 0.9254951273184533, | |
| "grad_norm": 5.255563735961914, | |
| "learning_rate": 0.00016558144184990227, | |
| "logits/chosen": -0.37939125299453735, | |
| "logits/rejected": -0.6499576568603516, | |
| "logps/chosen": -9.906354904174805, | |
| "logps/rejected": -63.14579772949219, | |
| "loss": 1.1975581645965576, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.7969497442245483, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.17077556252479553, | |
| "rewards/margins": 4.492245197296143, | |
| "rewards/rejected": -4.663021087646484, | |
| "step": 368, | |
| "train_speed(iter/s)": 0.034438 | |
| }, | |
| { | |
| "epoch": 0.9280100597296448, | |
| "grad_norm": 3.5527825355529785, | |
| "learning_rate": 0.0001653714934605883, | |
| "logits/chosen": -0.39540186524391174, | |
| "logits/rejected": -0.6938212513923645, | |
| "logps/chosen": -4.2778849601745605, | |
| "logps/rejected": -69.90755462646484, | |
| "loss": 0.43115851283073425, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.30130866169929504, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0013723522424697876, | |
| "rewards/margins": 5.105025291442871, | |
| "rewards/rejected": -5.1036529541015625, | |
| "step": 369, | |
| "train_speed(iter/s)": 0.034247 | |
| }, | |
| { | |
| "epoch": 0.9305249921408362, | |
| "grad_norm": 1.7090513706207275, | |
| "learning_rate": 0.0001651610406856929, | |
| "logits/chosen": -0.3463304936885834, | |
| "logits/rejected": -0.579744815826416, | |
| "logps/chosen": -5.828442573547363, | |
| "logps/rejected": -69.42247772216797, | |
| "loss": 0.40808120369911194, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.30207115411758423, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17322836816310883, | |
| "rewards/margins": 5.431868553161621, | |
| "rewards/rejected": -5.258640289306641, | |
| "step": 370, | |
| "train_speed(iter/s)": 0.034058 | |
| }, | |
| { | |
| "epoch": 0.9330399245520277, | |
| "grad_norm": 2.4113481044769287, | |
| "learning_rate": 0.00016495008514900254, | |
| "logits/chosen": -0.33101192116737366, | |
| "logits/rejected": -0.6629313826560974, | |
| "logps/chosen": -3.4581689834594727, | |
| "logps/rejected": -70.76332092285156, | |
| "loss": 0.3193123936653137, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2055172175168991, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.16898323595523834, | |
| "rewards/margins": 5.381399154663086, | |
| "rewards/rejected": -5.2124152183532715, | |
| "step": 371, | |
| "train_speed(iter/s)": 0.033871 | |
| }, | |
| { | |
| "epoch": 0.9355548569632192, | |
| "grad_norm": 1.4116032123565674, | |
| "learning_rate": 0.00016473862847818277, | |
| "logits/chosen": -0.3042815625667572, | |
| "logits/rejected": -0.6890904903411865, | |
| "logps/chosen": -2.9157466888427734, | |
| "logps/rejected": -70.07747650146484, | |
| "loss": 0.35020875930786133, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2551298141479492, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.16930048167705536, | |
| "rewards/margins": 5.438758850097656, | |
| "rewards/rejected": -5.269458293914795, | |
| "step": 372, | |
| "train_speed(iter/s)": 0.033688 | |
| }, | |
| { | |
| "epoch": 0.9380697893744105, | |
| "grad_norm": 3.803670883178711, | |
| "learning_rate": 0.0001645266723047658, | |
| "logits/chosen": -0.43881455063819885, | |
| "logits/rejected": -0.7362341284751892, | |
| "logps/chosen": -3.6323812007904053, | |
| "logps/rejected": -70.09701538085938, | |
| "loss": 0.39496979117393494, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3047463893890381, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.07599923759698868, | |
| "rewards/margins": 5.4243903160095215, | |
| "rewards/rejected": -5.348391532897949, | |
| "step": 373, | |
| "train_speed(iter/s)": 0.03351 | |
| }, | |
| { | |
| "epoch": 0.940584721785602, | |
| "grad_norm": 2.404557466506958, | |
| "learning_rate": 0.0001643142182641379, | |
| "logits/chosen": -0.34889113903045654, | |
| "logits/rejected": -0.6839251518249512, | |
| "logps/chosen": -4.086870193481445, | |
| "logps/rejected": -61.729209899902344, | |
| "loss": 0.3285399377346039, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.24733781814575195, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1459178924560547, | |
| "rewards/margins": 4.617620944976807, | |
| "rewards/rejected": -4.47170352935791, | |
| "step": 374, | |
| "train_speed(iter/s)": 0.033332 | |
| }, | |
| { | |
| "epoch": 0.9430996541967934, | |
| "grad_norm": 1.1544145345687866, | |
| "learning_rate": 0.0001641012679955265, | |
| "logits/chosen": -0.24821627140045166, | |
| "logits/rejected": -0.6281561255455017, | |
| "logps/chosen": -4.0372772216796875, | |
| "logps/rejected": -79.80203247070312, | |
| "loss": 0.2588978707790375, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.21967677772045135, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12974770367145538, | |
| "rewards/margins": 5.533021926879883, | |
| "rewards/rejected": -5.403275012969971, | |
| "step": 375, | |
| "train_speed(iter/s)": 0.033157 | |
| }, | |
| { | |
| "epoch": 0.9456145866079849, | |
| "grad_norm": 0.9758641123771667, | |
| "learning_rate": 0.00016388782314198804, | |
| "logits/chosen": -0.3430945873260498, | |
| "logits/rejected": -0.5772558450698853, | |
| "logps/chosen": -4.472623825073242, | |
| "logps/rejected": -63.992557525634766, | |
| "loss": 0.3319728672504425, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.27475422620773315, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24630330502986908, | |
| "rewards/margins": 5.2393107414245605, | |
| "rewards/rejected": -4.993007183074951, | |
| "step": 376, | |
| "train_speed(iter/s)": 0.032986 | |
| }, | |
| { | |
| "epoch": 0.9481295190191764, | |
| "grad_norm": 2.5297164916992188, | |
| "learning_rate": 0.00016367388535039483, | |
| "logits/chosen": -0.4488414525985718, | |
| "logits/rejected": -0.5838022232055664, | |
| "logps/chosen": -7.7367448806762695, | |
| "logps/rejected": -54.747467041015625, | |
| "loss": 0.8268335461616516, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.5897634029388428, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0750073790550232, | |
| "rewards/margins": 4.319672107696533, | |
| "rewards/rejected": -4.244664669036865, | |
| "step": 377, | |
| "train_speed(iter/s)": 0.032818 | |
| }, | |
| { | |
| "epoch": 0.9506444514303678, | |
| "grad_norm": 1.5900825262069702, | |
| "learning_rate": 0.00016345945627142263, | |
| "logits/chosen": -0.3362869322299957, | |
| "logits/rejected": -0.6326735019683838, | |
| "logps/chosen": -4.714737415313721, | |
| "logps/rejected": -64.11145782470703, | |
| "loss": 0.3902578055858612, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.33638864755630493, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2739555835723877, | |
| "rewards/margins": 5.219550132751465, | |
| "rewards/rejected": -4.945594787597656, | |
| "step": 378, | |
| "train_speed(iter/s)": 0.032653 | |
| }, | |
| { | |
| "epoch": 0.9531593838415593, | |
| "grad_norm": 4.194026470184326, | |
| "learning_rate": 0.00016324453755953773, | |
| "logits/chosen": -0.16701598465442657, | |
| "logits/rejected": -0.524956464767456, | |
| "logps/chosen": -7.983905792236328, | |
| "logps/rejected": -79.0844955444336, | |
| "loss": 0.5492078065872192, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4571991264820099, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.04178844019770622, | |
| "rewards/margins": 5.678005218505859, | |
| "rewards/rejected": -5.636216640472412, | |
| "step": 379, | |
| "train_speed(iter/s)": 0.032486 | |
| }, | |
| { | |
| "epoch": 0.9556743162527507, | |
| "grad_norm": 3.1762311458587646, | |
| "learning_rate": 0.00016302913087298438, | |
| "logits/chosen": -0.23892173171043396, | |
| "logits/rejected": -0.5944012403488159, | |
| "logps/chosen": -2.855877161026001, | |
| "logps/rejected": -71.64038848876953, | |
| "loss": 0.2882783114910126, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.20760102570056915, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15581874549388885, | |
| "rewards/margins": 5.530270099639893, | |
| "rewards/rejected": -5.374452114105225, | |
| "step": 380, | |
| "train_speed(iter/s)": 0.032324 | |
| }, | |
| { | |
| "epoch": 0.9581892486639422, | |
| "grad_norm": 1.3025074005126953, | |
| "learning_rate": 0.0001628132378737718, | |
| "logits/chosen": -0.255632609128952, | |
| "logits/rejected": -0.5729305744171143, | |
| "logps/chosen": -7.531216144561768, | |
| "logps/rejected": -76.65748596191406, | |
| "loss": 0.35401973128318787, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.28915196657180786, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.17935439944267273, | |
| "rewards/margins": 5.804968357086182, | |
| "rewards/rejected": -5.625614166259766, | |
| "step": 381, | |
| "train_speed(iter/s)": 0.032164 | |
| }, | |
| { | |
| "epoch": 0.9607041810751336, | |
| "grad_norm": 1.362042784690857, | |
| "learning_rate": 0.00016259686022766147, | |
| "logits/chosen": -0.3349270224571228, | |
| "logits/rejected": -0.5813159346580505, | |
| "logps/chosen": -5.685837268829346, | |
| "logps/rejected": -82.27192687988281, | |
| "loss": 0.3539260923862457, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2879295349121094, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15435966849327087, | |
| "rewards/margins": 6.62058162689209, | |
| "rewards/rejected": -6.466221809387207, | |
| "step": 382, | |
| "train_speed(iter/s)": 0.032007 | |
| }, | |
| { | |
| "epoch": 0.963219113486325, | |
| "grad_norm": 2.0811262130737305, | |
| "learning_rate": 0.00016237999960415426, | |
| "logits/chosen": -0.41777318716049194, | |
| "logits/rejected": -0.6865772008895874, | |
| "logps/chosen": -4.136772155761719, | |
| "logps/rejected": -66.67522430419922, | |
| "loss": 0.37008586525917053, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.23609820008277893, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.061387136578559875, | |
| "rewards/margins": 5.56961727142334, | |
| "rewards/rejected": -5.508229732513428, | |
| "step": 383, | |
| "train_speed(iter/s)": 0.031855 | |
| }, | |
| { | |
| "epoch": 0.9657340458975165, | |
| "grad_norm": 2.0822818279266357, | |
| "learning_rate": 0.00016216265767647755, | |
| "logits/chosen": -0.34635311365127563, | |
| "logits/rejected": -0.6642223596572876, | |
| "logps/chosen": -7.652328014373779, | |
| "logps/rejected": -82.85174560546875, | |
| "loss": 0.4690261483192444, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.37369227409362793, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1277095228433609, | |
| "rewards/margins": 6.65843391418457, | |
| "rewards/rejected": -6.530723571777344, | |
| "step": 384, | |
| "train_speed(iter/s)": 0.031703 | |
| }, | |
| { | |
| "epoch": 0.9682489783087079, | |
| "grad_norm": 2.0401089191436768, | |
| "learning_rate": 0.0001619448361215723, | |
| "logits/chosen": -0.44850289821624756, | |
| "logits/rejected": -0.7342371940612793, | |
| "logps/chosen": -3.3725736141204834, | |
| "logps/rejected": -70.59913635253906, | |
| "loss": 0.3117908835411072, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.24734090268611908, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2703946530818939, | |
| "rewards/margins": 5.976531982421875, | |
| "rewards/rejected": -5.706137657165527, | |
| "step": 385, | |
| "train_speed(iter/s)": 0.031555 | |
| }, | |
| { | |
| "epoch": 0.9707639107198994, | |
| "grad_norm": 3.712329387664795, | |
| "learning_rate": 0.0001617265366200801, | |
| "logits/chosen": -0.5690063834190369, | |
| "logits/rejected": -0.7474982738494873, | |
| "logps/chosen": -7.040001392364502, | |
| "logps/rejected": -58.06250762939453, | |
| "loss": 0.7071576118469238, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.5602840781211853, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24300126731395721, | |
| "rewards/margins": 4.731121063232422, | |
| "rewards/rejected": -4.488119602203369, | |
| "step": 386, | |
| "train_speed(iter/s)": 0.031409 | |
| }, | |
| { | |
| "epoch": 0.9732788431310908, | |
| "grad_norm": 4.140589714050293, | |
| "learning_rate": 0.0001615077608563302, | |
| "logits/chosen": -0.4431472420692444, | |
| "logits/rejected": -0.6148325800895691, | |
| "logps/chosen": -6.866641521453857, | |
| "logps/rejected": -60.58491516113281, | |
| "loss": 0.716019868850708, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.53892582654953, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04589424282312393, | |
| "rewards/margins": 4.8714165687561035, | |
| "rewards/rejected": -4.825522422790527, | |
| "step": 387, | |
| "train_speed(iter/s)": 0.031265 | |
| }, | |
| { | |
| "epoch": 0.9757937755422823, | |
| "grad_norm": 1.4952077865600586, | |
| "learning_rate": 0.00016128851051832663, | |
| "logits/chosen": -0.3862327039241791, | |
| "logits/rejected": -0.6277360320091248, | |
| "logps/chosen": -4.6577043533325195, | |
| "logps/rejected": -65.08265686035156, | |
| "loss": 0.39572662115097046, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.32492324709892273, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1440601646900177, | |
| "rewards/margins": 4.995415687561035, | |
| "rewards/rejected": -4.85135555267334, | |
| "step": 388, | |
| "train_speed(iter/s)": 0.031122 | |
| }, | |
| { | |
| "epoch": 0.9783087079534738, | |
| "grad_norm": 6.760348320007324, | |
| "learning_rate": 0.000161068787297735, | |
| "logits/chosen": -0.36251139640808105, | |
| "logits/rejected": -0.6239615082740784, | |
| "logps/chosen": -7.945605754852295, | |
| "logps/rejected": -73.32543182373047, | |
| "loss": 0.7213991284370422, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.4911874234676361, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.02407783269882202, | |
| "rewards/margins": 5.578208923339844, | |
| "rewards/rejected": -5.602287292480469, | |
| "step": 389, | |
| "train_speed(iter/s)": 0.030981 | |
| }, | |
| { | |
| "epoch": 0.9808236403646652, | |
| "grad_norm": 1.4369536638259888, | |
| "learning_rate": 0.00016084859288986955, | |
| "logits/chosen": -0.4005224108695984, | |
| "logits/rejected": -0.7330536246299744, | |
| "logps/chosen": -2.2685210704803467, | |
| "logps/rejected": -75.97575378417969, | |
| "loss": 0.22442395985126495, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.15800324082374573, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1866656392812729, | |
| "rewards/margins": 6.141209602355957, | |
| "rewards/rejected": -5.9545440673828125, | |
| "step": 390, | |
| "train_speed(iter/s)": 0.030843 | |
| }, | |
| { | |
| "epoch": 0.9833385727758567, | |
| "grad_norm": 2.5951297283172607, | |
| "learning_rate": 0.0001606279289936801, | |
| "logits/chosen": -0.3820829689502716, | |
| "logits/rejected": -0.6506544351577759, | |
| "logps/chosen": -5.631180763244629, | |
| "logps/rejected": -72.71686553955078, | |
| "loss": 0.4367509186267853, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.30333346128463745, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2744603753089905, | |
| "rewards/margins": 5.615926742553711, | |
| "rewards/rejected": -5.341466426849365, | |
| "step": 391, | |
| "train_speed(iter/s)": 0.030705 | |
| }, | |
| { | |
| "epoch": 0.9858535051870481, | |
| "grad_norm": 1.5032093524932861, | |
| "learning_rate": 0.00016040679731173883, | |
| "logits/chosen": -0.4364391565322876, | |
| "logits/rejected": -0.8331149220466614, | |
| "logps/chosen": -4.418792247772217, | |
| "logps/rejected": -87.72761535644531, | |
| "loss": 0.33695462346076965, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2598365545272827, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15108640491962433, | |
| "rewards/margins": 7.023785591125488, | |
| "rewards/rejected": -6.872698783874512, | |
| "step": 392, | |
| "train_speed(iter/s)": 0.03057 | |
| }, | |
| { | |
| "epoch": 0.9883684375982396, | |
| "grad_norm": 1.427937388420105, | |
| "learning_rate": 0.0001601851995502272, | |
| "logits/chosen": -0.43706899881362915, | |
| "logits/rejected": -0.6605555415153503, | |
| "logps/chosen": -6.906405925750732, | |
| "logps/rejected": -74.19134521484375, | |
| "loss": 0.44790229201316833, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.36099445819854736, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21629741787910461, | |
| "rewards/margins": 6.02875280380249, | |
| "rewards/rejected": -5.812455177307129, | |
| "step": 393, | |
| "train_speed(iter/s)": 0.030436 | |
| }, | |
| { | |
| "epoch": 0.9908833700094309, | |
| "grad_norm": 1.9399830102920532, | |
| "learning_rate": 0.00015996313741892287, | |
| "logits/chosen": -0.26576218008995056, | |
| "logits/rejected": -0.6935127377510071, | |
| "logps/chosen": -3.865288257598877, | |
| "logps/rejected": -82.85759735107422, | |
| "loss": 0.4476841688156128, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.32863834500312805, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09060452878475189, | |
| "rewards/margins": 6.340301990509033, | |
| "rewards/rejected": -6.249697685241699, | |
| "step": 394, | |
| "train_speed(iter/s)": 0.030303 | |
| }, | |
| { | |
| "epoch": 0.9933983024206224, | |
| "grad_norm": 1.766074299812317, | |
| "learning_rate": 0.00015974061263118633, | |
| "logits/chosen": -0.45828965306282043, | |
| "logits/rejected": -0.7260013222694397, | |
| "logps/chosen": -5.735683917999268, | |
| "logps/rejected": -84.8984375, | |
| "loss": 0.4351236820220947, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.34114885330200195, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15323616564273834, | |
| "rewards/margins": 6.745055198669434, | |
| "rewards/rejected": -6.591818809509277, | |
| "step": 395, | |
| "train_speed(iter/s)": 0.030174 | |
| }, | |
| { | |
| "epoch": 0.9959132348318139, | |
| "grad_norm": 1.4137344360351562, | |
| "learning_rate": 0.00015951762690394786, | |
| "logits/chosen": -0.36978721618652344, | |
| "logits/rejected": -0.6695666313171387, | |
| "logps/chosen": -6.405080318450928, | |
| "logps/rejected": -82.90550231933594, | |
| "loss": 0.3862062990665436, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.30257418751716614, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23101738095283508, | |
| "rewards/margins": 6.621737480163574, | |
| "rewards/rejected": -6.390720367431641, | |
| "step": 396, | |
| "train_speed(iter/s)": 0.030046 | |
| }, | |
| { | |
| "epoch": 0.9984281672430053, | |
| "grad_norm": 4.094442844390869, | |
| "learning_rate": 0.00015929418195769417, | |
| "logits/chosen": -0.48969727754592896, | |
| "logits/rejected": -0.6828620433807373, | |
| "logps/chosen": -6.582212448120117, | |
| "logps/rejected": -70.81021881103516, | |
| "loss": 0.4160895049571991, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.31492117047309875, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13509458303451538, | |
| "rewards/margins": 5.814253330230713, | |
| "rewards/rejected": -5.679159164428711, | |
| "step": 397, | |
| "train_speed(iter/s)": 0.02992 | |
| }, | |
| { | |
| "epoch": 1.0025149324111915, | |
| "grad_norm": 1.9179918766021729, | |
| "learning_rate": 0.0001590702795164551, | |
| "logits/chosen": -0.35988548398017883, | |
| "logits/rejected": -0.6789807081222534, | |
| "logps/chosen": -4.162905693054199, | |
| "logps/rejected": -76.96558380126953, | |
| "loss": 0.7711372971534729, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.3491760492324829, | |
| "rewards/accuracies": 0.9807692170143127, | |
| "rewards/chosen": 0.2266516387462616, | |
| "rewards/margins": 6.186110496520996, | |
| "rewards/rejected": -5.959458351135254, | |
| "step": 398, | |
| "train_speed(iter/s)": 0.029672 | |
| }, | |
| { | |
| "epoch": 1.005029864822383, | |
| "grad_norm": 4.1499152183532715, | |
| "learning_rate": 0.00015884592130779054, | |
| "logits/chosen": -0.39633291959762573, | |
| "logits/rejected": -0.7770199775695801, | |
| "logps/chosen": -3.2545783519744873, | |
| "logps/rejected": -85.13819122314453, | |
| "loss": 0.3328564167022705, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.2181829959154129, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2071080356836319, | |
| "rewards/margins": 6.915965557098389, | |
| "rewards/rejected": -6.708857536315918, | |
| "step": 399, | |
| "train_speed(iter/s)": 0.029551 | |
| }, | |
| { | |
| "epoch": 1.0075447972335743, | |
| "grad_norm": 1.9317526817321777, | |
| "learning_rate": 0.00015862110906277675, | |
| "logits/chosen": -0.3625487983226776, | |
| "logits/rejected": -0.7721232175827026, | |
| "logps/chosen": -2.4324581623077393, | |
| "logps/rejected": -94.80921173095703, | |
| "loss": 0.1829817295074463, | |
| "memory(GiB)": 46.31, | |
| "nll_loss": 0.13283208012580872, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.14578577876091003, | |
| "rewards/margins": 7.785459041595459, | |
| "rewards/rejected": -7.639672756195068, | |
| "step": 400, | |
| "train_speed(iter/s)": 0.029431 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1191, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.1869819546986086e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |