Instructions to use cragtmp/3gt6-650 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/3gt6-650 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/3gt6-650") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 600, | |
| "best_metric": 0.26477173, | |
| "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task3_dpo_no_task2_gt60.5+task3gt5/v0-20250609-005919/checkpoint-600", | |
| "epoch": 1.685491723466407, | |
| "eval_steps": 300, | |
| "global_step": 650, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002596559558584875, | |
| "grad_norm": 4.769598007202148, | |
| "learning_rate": 5.128205128205128e-06, | |
| "logits/chosen": -0.5944205522537231, | |
| "logits/rejected": -0.5917393565177917, | |
| "logps/chosen": -11.821638107299805, | |
| "logps/rejected": -10.731678009033203, | |
| "loss": 1.193467140197754, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.50031977891922, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.004987 | |
| }, | |
| { | |
| "epoch": 0.00519311911716975, | |
| "grad_norm": 7.638933181762695, | |
| "learning_rate": 1.0256410256410256e-05, | |
| "logits/chosen": -0.6539207696914673, | |
| "logits/rejected": -0.6607442498207092, | |
| "logps/chosen": -9.628549575805664, | |
| "logps/rejected": -15.572840690612793, | |
| "loss": 1.1913397312164307, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4981924891471863, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005274 | |
| }, | |
| { | |
| "epoch": 0.007789678675754625, | |
| "grad_norm": 8.172294616699219, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "logits/chosen": -0.6215255260467529, | |
| "logits/rejected": -0.6243188381195068, | |
| "logps/chosen": -10.225044250488281, | |
| "logps/rejected": -12.433060646057129, | |
| "loss": 1.3010810613632202, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6032217741012573, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.002520320238545537, | |
| "rewards/margins": -0.00917358510196209, | |
| "rewards/rejected": 0.006653264630585909, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005242 | |
| }, | |
| { | |
| "epoch": 0.0103862382343395, | |
| "grad_norm": 7.314579010009766, | |
| "learning_rate": 2.0512820512820512e-05, | |
| "logits/chosen": -0.6062605381011963, | |
| "logits/rejected": -0.6072395443916321, | |
| "logps/chosen": -9.956047058105469, | |
| "logps/rejected": -11.640246391296387, | |
| "loss": 1.2542610168457031, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5589770674705505, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.007420660927891731, | |
| "rewards/margins": -0.004003261215984821, | |
| "rewards/rejected": 0.011423922143876553, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005268 | |
| }, | |
| { | |
| "epoch": 0.012982797792924375, | |
| "grad_norm": 3.7953975200653076, | |
| "learning_rate": 2.564102564102564e-05, | |
| "logits/chosen": -0.5976298451423645, | |
| "logits/rejected": -0.5966740846633911, | |
| "logps/chosen": -13.070164680480957, | |
| "logps/rejected": -9.661067008972168, | |
| "loss": 1.215171456336975, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5106430649757385, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": 0.00016488437540829182, | |
| "rewards/margins": -0.020555444061756134, | |
| "rewards/rejected": 0.02072032354772091, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.00529 | |
| }, | |
| { | |
| "epoch": 0.01557935735150925, | |
| "grad_norm": 7.202587604522705, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "logits/chosen": -0.6029255390167236, | |
| "logits/rejected": -0.6082680225372314, | |
| "logps/chosen": -6.68419075012207, | |
| "logps/rejected": -14.836040496826172, | |
| "loss": 1.1022435426712036, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4213921129703522, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.05949082225561142, | |
| "rewards/margins": 0.03669985011219978, | |
| "rewards/rejected": 0.02279096469283104, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.00532 | |
| }, | |
| { | |
| "epoch": 0.018175916910094125, | |
| "grad_norm": 4.17504358291626, | |
| "learning_rate": 3.58974358974359e-05, | |
| "logits/chosen": -0.5737150311470032, | |
| "logits/rejected": -0.5751169919967651, | |
| "logps/chosen": -10.05550479888916, | |
| "logps/rejected": -10.229061126708984, | |
| "loss": 1.1968086957931519, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.451814740896225, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": 0.018731240183115005, | |
| "rewards/margins": -0.06073049083352089, | |
| "rewards/rejected": 0.0794617310166359, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005319 | |
| }, | |
| { | |
| "epoch": 0.020772476468679, | |
| "grad_norm": 4.966729164123535, | |
| "learning_rate": 4.1025641025641023e-05, | |
| "logits/chosen": -0.6149957180023193, | |
| "logits/rejected": -0.619285523891449, | |
| "logps/chosen": -10.129886627197266, | |
| "logps/rejected": -14.14559268951416, | |
| "loss": 1.1496262550354004, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.45597678422927856, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.048677604645490646, | |
| "rewards/margins": 0.07307372987270355, | |
| "rewards/rejected": -0.1217513307929039, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005322 | |
| }, | |
| { | |
| "epoch": 0.023369036027263874, | |
| "grad_norm": 4.258759021759033, | |
| "learning_rate": 4.615384615384616e-05, | |
| "logits/chosen": -0.6464206576347351, | |
| "logits/rejected": -0.649814248085022, | |
| "logps/chosen": -6.2765960693359375, | |
| "logps/rejected": -14.259992599487305, | |
| "loss": 0.9683928489685059, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27603328227996826, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.028385277837514877, | |
| "rewards/margins": 0.1275366246700287, | |
| "rewards/rejected": -0.15592190623283386, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005346 | |
| }, | |
| { | |
| "epoch": 0.02596559558584875, | |
| "grad_norm": 3.5765655040740967, | |
| "learning_rate": 5.128205128205128e-05, | |
| "logits/chosen": -0.5905835628509521, | |
| "logits/rejected": -0.5969584584236145, | |
| "logps/chosen": -14.795049667358398, | |
| "logps/rejected": -15.656811714172363, | |
| "loss": 1.238275408744812, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5923190116882324, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.012541369535028934, | |
| "rewards/margins": 0.1883796602487564, | |
| "rewards/rejected": -0.20092105865478516, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005347 | |
| }, | |
| { | |
| "epoch": 0.028562155144433627, | |
| "grad_norm": 5.3241682052612305, | |
| "learning_rate": 5.6410256410256414e-05, | |
| "logits/chosen": -0.5469571948051453, | |
| "logits/rejected": -0.5478999614715576, | |
| "logps/chosen": -11.43381118774414, | |
| "logps/rejected": -13.521588325500488, | |
| "loss": 1.2181414365768433, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4799095690250397, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.11080781370401382, | |
| "rewards/margins": -0.000970199704170227, | |
| "rewards/rejected": -0.109837606549263, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.0311587147030185, | |
| "grad_norm": 3.739349126815796, | |
| "learning_rate": 6.153846153846155e-05, | |
| "logits/chosen": -0.5663439631462097, | |
| "logits/rejected": -0.5685043931007385, | |
| "logps/chosen": -9.113786697387695, | |
| "logps/rejected": -12.898387908935547, | |
| "loss": 1.1865863800048828, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5080631971359253, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.07351399958133698, | |
| "rewards/margins": 0.09553620219230652, | |
| "rewards/rejected": -0.022022202610969543, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.03375527426160337, | |
| "grad_norm": 2.732536792755127, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.6258959770202637, | |
| "logits/rejected": -0.628243088722229, | |
| "logps/chosen": -11.908061027526855, | |
| "logps/rejected": -14.742002487182617, | |
| "loss": 1.0720946788787842, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44474831223487854, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0872192531824112, | |
| "rewards/margins": 0.16859112679958344, | |
| "rewards/rejected": -0.08137187361717224, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.03635183382018825, | |
| "grad_norm": 2.286402702331543, | |
| "learning_rate": 7.17948717948718e-05, | |
| "logits/chosen": -0.5518996119499207, | |
| "logits/rejected": -0.5536460280418396, | |
| "logps/chosen": -7.985256195068359, | |
| "logps/rejected": -9.997514724731445, | |
| "loss": 1.0465917587280273, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.37517642974853516, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.09782104939222336, | |
| "rewards/margins": 0.08964069932699203, | |
| "rewards/rejected": 0.008180351927876472, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.03894839337877313, | |
| "grad_norm": 2.8793153762817383, | |
| "learning_rate": 7.692307692307693e-05, | |
| "logits/chosen": -0.5976672172546387, | |
| "logits/rejected": -0.5990516543388367, | |
| "logps/chosen": -11.681562423706055, | |
| "logps/rejected": -15.269111633300781, | |
| "loss": 1.0413833856582642, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44159939885139465, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.18112002313137054, | |
| "rewards/margins": 0.246211975812912, | |
| "rewards/rejected": -0.06509192287921906, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005369 | |
| }, | |
| { | |
| "epoch": 0.041544952937358, | |
| "grad_norm": 3.362415313720703, | |
| "learning_rate": 8.205128205128205e-05, | |
| "logits/chosen": -0.6091838479042053, | |
| "logits/rejected": -0.6097983717918396, | |
| "logps/chosen": -6.9782915115356445, | |
| "logps/rejected": -9.985608100891113, | |
| "loss": 1.0336495637893677, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3420756161212921, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.05590391904115677, | |
| "rewards/margins": 0.03598181903362274, | |
| "rewards/rejected": 0.019922103732824326, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.005368 | |
| }, | |
| { | |
| "epoch": 0.04414151249594288, | |
| "grad_norm": 2.314833641052246, | |
| "learning_rate": 8.717948717948718e-05, | |
| "logits/chosen": -0.6001038551330566, | |
| "logits/rejected": -0.6009984612464905, | |
| "logps/chosen": -8.711943626403809, | |
| "logps/rejected": -8.347241401672363, | |
| "loss": 1.0018643140792847, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3586280345916748, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.17141370475292206, | |
| "rewards/margins": 0.15122823417186737, | |
| "rewards/rejected": 0.020185478031635284, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.04673807205452775, | |
| "grad_norm": 2.6080470085144043, | |
| "learning_rate": 9.230769230769232e-05, | |
| "logits/chosen": -0.6079075932502747, | |
| "logits/rejected": -0.6091002225875854, | |
| "logps/chosen": -9.866250991821289, | |
| "logps/rejected": -9.885502815246582, | |
| "loss": 1.0599387884140015, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3953135013580322, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1653863787651062, | |
| "rewards/margins": 0.13114988803863525, | |
| "rewards/rejected": 0.03423647955060005, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.04933463161311263, | |
| "grad_norm": 2.5750620365142822, | |
| "learning_rate": 9.743589743589744e-05, | |
| "logits/chosen": -0.5754107236862183, | |
| "logits/rejected": -0.5755229592323303, | |
| "logps/chosen": -9.663117408752441, | |
| "logps/rejected": -14.233282089233398, | |
| "loss": 0.9537867307662964, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35284289717674255, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.12623246014118195, | |
| "rewards/margins": 0.24378177523612976, | |
| "rewards/rejected": -0.11754930019378662, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.00537 | |
| }, | |
| { | |
| "epoch": 0.0519311911716975, | |
| "grad_norm": 4.289522171020508, | |
| "learning_rate": 0.00010256410256410256, | |
| "logits/chosen": -0.5981144905090332, | |
| "logits/rejected": -0.6002673506736755, | |
| "logps/chosen": -8.273541450500488, | |
| "logps/rejected": -12.811166763305664, | |
| "loss": 1.422603964805603, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.8183298707008362, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.21172407269477844, | |
| "rewards/margins": 0.2575765550136566, | |
| "rewards/rejected": -0.04585248976945877, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.054527750730282376, | |
| "grad_norm": 2.396873712539673, | |
| "learning_rate": 0.0001076923076923077, | |
| "logits/chosen": -0.5655781030654907, | |
| "logits/rejected": -0.5672769546508789, | |
| "logps/chosen": -7.642134189605713, | |
| "logps/rejected": -16.37198257446289, | |
| "loss": 0.8944156765937805, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.28976452350616455, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2191261202096939, | |
| "rewards/margins": 0.2641218602657318, | |
| "rewards/rejected": -0.04499572888016701, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.057124310288867254, | |
| "grad_norm": 3.0281121730804443, | |
| "learning_rate": 0.00011282051282051283, | |
| "logits/chosen": -0.5596702694892883, | |
| "logits/rejected": -0.5609368681907654, | |
| "logps/chosen": -7.446313381195068, | |
| "logps/rejected": -12.651912689208984, | |
| "loss": 0.9526722431182861, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33721715211868286, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15709233283996582, | |
| "rewards/margins": 0.2245473712682724, | |
| "rewards/rejected": -0.06745504587888718, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.059720869847452125, | |
| "grad_norm": 2.6955020427703857, | |
| "learning_rate": 0.00011794871794871796, | |
| "logits/chosen": -0.5400959849357605, | |
| "logits/rejected": -0.5422949194908142, | |
| "logps/chosen": -6.002541542053223, | |
| "logps/rejected": -12.28770637512207, | |
| "loss": 0.9044801592826843, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2814594805240631, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11246027797460556, | |
| "rewards/margins": 0.21622154116630554, | |
| "rewards/rejected": -0.10376127809286118, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.062317429406037, | |
| "grad_norm": 3.1954290866851807, | |
| "learning_rate": 0.0001230769230769231, | |
| "logits/chosen": -0.5763551592826843, | |
| "logits/rejected": -0.5829795598983765, | |
| "logps/chosen": -8.22636890411377, | |
| "logps/rejected": -12.94092845916748, | |
| "loss": 0.9596253037452698, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3679075837135315, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.17844173312187195, | |
| "rewards/margins": 0.2646990418434143, | |
| "rewards/rejected": -0.08625732362270355, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.06491398896462187, | |
| "grad_norm": 3.440917730331421, | |
| "learning_rate": 0.00012820512820512823, | |
| "logits/chosen": -0.5423401594161987, | |
| "logits/rejected": -0.5454680919647217, | |
| "logps/chosen": -6.751742362976074, | |
| "logps/rejected": -14.677633285522461, | |
| "loss": 0.8222842216491699, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2530384063720703, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20278047025203705, | |
| "rewards/margins": 0.37300848960876465, | |
| "rewards/rejected": -0.1702280342578888, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.06751054852320675, | |
| "grad_norm": 7.046718120574951, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.531994640827179, | |
| "logits/rejected": -0.5324733257293701, | |
| "logps/chosen": -7.691443920135498, | |
| "logps/rejected": -12.912195205688477, | |
| "loss": 0.8851491212844849, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2668984532356262, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.03996456041932106, | |
| "rewards/margins": 0.30043962597846985, | |
| "rewards/rejected": -0.2604750692844391, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.07010710808179163, | |
| "grad_norm": 3.7837774753570557, | |
| "learning_rate": 0.00013846153846153847, | |
| "logits/chosen": -0.5356835722923279, | |
| "logits/rejected": -0.535167932510376, | |
| "logps/chosen": -7.836236476898193, | |
| "logps/rejected": -12.5257568359375, | |
| "loss": 0.9785585999488831, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39958691596984863, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.11726226657629013, | |
| "rewards/margins": 0.30467987060546875, | |
| "rewards/rejected": -0.18741759657859802, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 0.0727036676403765, | |
| "grad_norm": 2.986128568649292, | |
| "learning_rate": 0.0001435897435897436, | |
| "logits/chosen": -0.5374022126197815, | |
| "logits/rejected": -0.5330510139465332, | |
| "logps/chosen": -10.774028778076172, | |
| "logps/rejected": -10.21718692779541, | |
| "loss": 1.0210673809051514, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44256913661956787, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.08123424649238586, | |
| "rewards/margins": 0.32150229811668396, | |
| "rewards/rejected": -0.2402680516242981, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.07530022719896137, | |
| "grad_norm": 8.227151870727539, | |
| "learning_rate": 0.00014871794871794872, | |
| "logits/chosen": -0.555951714515686, | |
| "logits/rejected": -0.5587239265441895, | |
| "logps/chosen": -7.656264781951904, | |
| "logps/rejected": -16.2135066986084, | |
| "loss": 1.024498701095581, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.467337429523468, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1679726243019104, | |
| "rewards/margins": 0.43920189142227173, | |
| "rewards/rejected": -0.2712292969226837, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.07789678675754626, | |
| "grad_norm": 3.866678476333618, | |
| "learning_rate": 0.00015384615384615385, | |
| "logits/chosen": -0.5329037308692932, | |
| "logits/rejected": -0.5308660864830017, | |
| "logps/chosen": -13.327455520629883, | |
| "logps/rejected": -12.309192657470703, | |
| "loss": 1.1753352880477905, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5743139386177063, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10232796519994736, | |
| "rewards/margins": 0.27346518635749817, | |
| "rewards/rejected": -0.1711372286081314, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.00537 | |
| }, | |
| { | |
| "epoch": 0.08049334631613113, | |
| "grad_norm": 2.7835240364074707, | |
| "learning_rate": 0.00015897435897435896, | |
| "logits/chosen": -0.5286478996276855, | |
| "logits/rejected": -0.5297562479972839, | |
| "logps/chosen": -8.105016708374023, | |
| "logps/rejected": -18.577655792236328, | |
| "loss": 0.8083048462867737, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3598409593105316, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3429361879825592, | |
| "rewards/margins": 0.6762320399284363, | |
| "rewards/rejected": -0.3332958221435547, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005368 | |
| }, | |
| { | |
| "epoch": 0.083089905874716, | |
| "grad_norm": 2.621320962905884, | |
| "learning_rate": 0.0001641025641025641, | |
| "logits/chosen": -0.5535257458686829, | |
| "logits/rejected": -0.5577558279037476, | |
| "logps/chosen": -7.381773948669434, | |
| "logps/rejected": -20.8293514251709, | |
| "loss": 0.7857053279876709, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3121376037597656, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11771110445261002, | |
| "rewards/margins": 0.6395547389984131, | |
| "rewards/rejected": -0.5218436121940613, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005373 | |
| }, | |
| { | |
| "epoch": 0.08568646543330087, | |
| "grad_norm": 5.273679256439209, | |
| "learning_rate": 0.00016923076923076923, | |
| "logits/chosen": -0.5348193645477295, | |
| "logits/rejected": -0.5335426330566406, | |
| "logps/chosen": -16.012008666992188, | |
| "logps/rejected": -16.090946197509766, | |
| "loss": 1.150058388710022, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5311561822891235, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09080329537391663, | |
| "rewards/margins": 0.3698381185531616, | |
| "rewards/rejected": -0.46064135432243347, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005375 | |
| }, | |
| { | |
| "epoch": 0.08828302499188576, | |
| "grad_norm": 3.7380588054656982, | |
| "learning_rate": 0.00017435897435897436, | |
| "logits/chosen": -0.526316225528717, | |
| "logits/rejected": -0.5241590738296509, | |
| "logps/chosen": -13.188718795776367, | |
| "logps/rejected": -18.877933502197266, | |
| "loss": 0.8901183009147644, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4010193347930908, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.13551224768161774, | |
| "rewards/margins": 0.7849555015563965, | |
| "rewards/rejected": -0.6494433283805847, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005376 | |
| }, | |
| { | |
| "epoch": 0.09087958455047063, | |
| "grad_norm": 3.2903590202331543, | |
| "learning_rate": 0.0001794871794871795, | |
| "logits/chosen": -0.5694751739501953, | |
| "logits/rejected": -0.5714199542999268, | |
| "logps/chosen": -13.836735725402832, | |
| "logps/rejected": -17.397571563720703, | |
| "loss": 0.9489783644676208, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4817684292793274, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.17933052778244019, | |
| "rewards/margins": 0.7199034690856934, | |
| "rewards/rejected": -0.5405729413032532, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005374 | |
| }, | |
| { | |
| "epoch": 0.0934761441090555, | |
| "grad_norm": 7.443658351898193, | |
| "learning_rate": 0.00018461538461538463, | |
| "logits/chosen": -0.5579850077629089, | |
| "logits/rejected": -0.5598161220550537, | |
| "logps/chosen": -9.724953651428223, | |
| "logps/rejected": -19.001192092895508, | |
| "loss": 1.025741696357727, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4933169484138489, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09439410269260406, | |
| "rewards/margins": 0.531223714351654, | |
| "rewards/rejected": -0.4368295967578888, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.09607270366764038, | |
| "grad_norm": 4.221776962280273, | |
| "learning_rate": 0.00018974358974358974, | |
| "logits/chosen": -0.5673465728759766, | |
| "logits/rejected": -0.568681001663208, | |
| "logps/chosen": -7.996758937835693, | |
| "logps/rejected": -16.828737258911133, | |
| "loss": 0.768932044506073, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3632465600967407, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.20153376460075378, | |
| "rewards/margins": 0.8081123232841492, | |
| "rewards/rejected": -0.6065785884857178, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.09866926322622525, | |
| "grad_norm": 4.438755989074707, | |
| "learning_rate": 0.00019487179487179487, | |
| "logits/chosen": -0.5432108640670776, | |
| "logits/rejected": -0.5440645217895508, | |
| "logps/chosen": -11.19113826751709, | |
| "logps/rejected": -16.801233291625977, | |
| "loss": 0.9643179178237915, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5330875515937805, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.212477445602417, | |
| "rewards/margins": 0.7622401714324951, | |
| "rewards/rejected": -0.5497627258300781, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.10126582278481013, | |
| "grad_norm": 3.844766855239868, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.5104550719261169, | |
| "logits/rejected": -0.5119606852531433, | |
| "logps/chosen": -11.040297508239746, | |
| "logps/rejected": -18.91219711303711, | |
| "loss": 0.9704711437225342, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5230136513710022, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14157143235206604, | |
| "rewards/margins": 0.7000695466995239, | |
| "rewards/rejected": -0.5584981441497803, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.103862382343395, | |
| "grad_norm": 5.2911272048950195, | |
| "learning_rate": 0.00019999907650547008, | |
| "logits/chosen": -0.563255250453949, | |
| "logits/rejected": -0.5627263784408569, | |
| "logps/chosen": -8.962218284606934, | |
| "logps/rejected": -20.214658737182617, | |
| "loss": 0.9730861783027649, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4494069516658783, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03735905885696411, | |
| "rewards/margins": 0.7039426565170288, | |
| "rewards/rejected": -0.6665836572647095, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.10645894190197988, | |
| "grad_norm": 3.2932822704315186, | |
| "learning_rate": 0.0001999963060389371, | |
| "logits/chosen": -0.49407708644866943, | |
| "logits/rejected": -0.4951040744781494, | |
| "logps/chosen": -4.336781978607178, | |
| "logps/rejected": -23.352622985839844, | |
| "loss": 0.5769761800765991, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21373578906059265, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2602457106113434, | |
| "rewards/margins": 1.0540037155151367, | |
| "rewards/rejected": -0.7937580347061157, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.10905550146056475, | |
| "grad_norm": 3.550082206726074, | |
| "learning_rate": 0.00019999168865157137, | |
| "logits/chosen": -0.5316025018692017, | |
| "logits/rejected": -0.5340486764907837, | |
| "logps/chosen": -8.441543579101562, | |
| "logps/rejected": -18.124588012695312, | |
| "loss": 0.9663518071174622, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.47912853956222534, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.14834752678871155, | |
| "rewards/margins": 0.7632903456687927, | |
| "rewards/rejected": -0.6149427890777588, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.11165206101914962, | |
| "grad_norm": 3.8798763751983643, | |
| "learning_rate": 0.0001999852244286554, | |
| "logits/chosen": -0.5125827193260193, | |
| "logits/rejected": -0.5118388533592224, | |
| "logps/chosen": -8.259347915649414, | |
| "logps/rejected": -18.246912002563477, | |
| "loss": 0.8706857562065125, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3688449263572693, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1189112439751625, | |
| "rewards/margins": 0.5402826070785522, | |
| "rewards/rejected": -0.4213714003562927, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.11424862057773451, | |
| "grad_norm": 5.702610015869141, | |
| "learning_rate": 0.0001999769134895828, | |
| "logits/chosen": -0.5676945447921753, | |
| "logits/rejected": -0.5712423324584961, | |
| "logps/chosen": -7.507511138916016, | |
| "logps/rejected": -17.306344985961914, | |
| "loss": 0.9447178840637207, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5068771839141846, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1572760045528412, | |
| "rewards/margins": 0.8183934688568115, | |
| "rewards/rejected": -0.6611174941062927, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.11684518013631938, | |
| "grad_norm": 5.846091270446777, | |
| "learning_rate": 0.0001999667559878556, | |
| "logits/chosen": -0.5530126094818115, | |
| "logits/rejected": -0.5544271469116211, | |
| "logps/chosen": -9.34422779083252, | |
| "logps/rejected": -21.99274444580078, | |
| "loss": 1.0033745765686035, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5510709285736084, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.06781984120607376, | |
| "rewards/margins": 0.8660807609558105, | |
| "rewards/rejected": -0.7982609868049622, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.11944173969490425, | |
| "grad_norm": 3.4377248287200928, | |
| "learning_rate": 0.00019995475211108185, | |
| "logits/chosen": -0.5516988039016724, | |
| "logits/rejected": -0.5513719916343689, | |
| "logps/chosen": -9.321004867553711, | |
| "logps/rejected": -18.94799041748047, | |
| "loss": 0.838591992855072, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44976377487182617, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15304125845432281, | |
| "rewards/margins": 0.9354310631752014, | |
| "rewards/rejected": -0.782389760017395, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.12203829925348912, | |
| "grad_norm": 3.021584987640381, | |
| "learning_rate": 0.00019994090208097176, | |
| "logits/chosen": -0.5453197956085205, | |
| "logits/rejected": -0.5457130670547485, | |
| "logps/chosen": -7.513545036315918, | |
| "logps/rejected": -19.929990768432617, | |
| "loss": 0.7878033518791199, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2906043827533722, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.04635176807641983, | |
| "rewards/margins": 0.8055768609046936, | |
| "rewards/rejected": -0.759225070476532, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.124634858812074, | |
| "grad_norm": 2.4632484912872314, | |
| "learning_rate": 0.00019992520615333393, | |
| "logits/chosen": -0.5288453102111816, | |
| "logits/rejected": -0.5294773578643799, | |
| "logps/chosen": -4.316083908081055, | |
| "logps/rejected": -16.75088119506836, | |
| "loss": 0.6369743347167969, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19174346327781677, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1844159960746765, | |
| "rewards/margins": 0.7728991508483887, | |
| "rewards/rejected": -0.5884830951690674, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.12723141837065888, | |
| "grad_norm": 2.225041627883911, | |
| "learning_rate": 0.00019990766461807039, | |
| "logits/chosen": -0.5786827802658081, | |
| "logits/rejected": -0.5775803923606873, | |
| "logps/chosen": -7.1691179275512695, | |
| "logps/rejected": -19.747949600219727, | |
| "loss": 0.611931562423706, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26027703285217285, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32533061504364014, | |
| "rewards/margins": 1.0796949863433838, | |
| "rewards/rejected": -0.7543643712997437, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.12982797792924375, | |
| "grad_norm": 3.631110429763794, | |
| "learning_rate": 0.00019988827779917137, | |
| "logits/chosen": -0.5347975492477417, | |
| "logits/rejected": -0.5404946804046631, | |
| "logps/chosen": -8.115504264831543, | |
| "logps/rejected": -22.913742065429688, | |
| "loss": 0.8714032769203186, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4530017375946045, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22861376404762268, | |
| "rewards/margins": 0.9870915412902832, | |
| "rewards/rejected": -0.7584777474403381, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.13242453748782862, | |
| "grad_norm": 4.098914623260498, | |
| "learning_rate": 0.0001998670460547093, | |
| "logits/chosen": -0.5628920197486877, | |
| "logits/rejected": -0.5603100657463074, | |
| "logps/chosen": -12.636977195739746, | |
| "logps/rejected": -17.273649215698242, | |
| "loss": 1.033919095993042, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4824763834476471, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.011750273406505585, | |
| "rewards/margins": 0.7105109095573425, | |
| "rewards/rejected": -0.6987606287002563, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 0.1350210970464135, | |
| "grad_norm": 2.982447385787964, | |
| "learning_rate": 0.00019984396977683222, | |
| "logits/chosen": -0.5565685629844666, | |
| "logits/rejected": -0.5531243085861206, | |
| "logps/chosen": -9.393210411071777, | |
| "logps/rejected": -17.276996612548828, | |
| "loss": 0.7912466526031494, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44081103801727295, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22525233030319214, | |
| "rewards/margins": 1.060104250907898, | |
| "rewards/rejected": -0.8348519206047058, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.1376176566049984, | |
| "grad_norm": 5.296391010284424, | |
| "learning_rate": 0.0001998190493917564, | |
| "logits/chosen": -0.5625238418579102, | |
| "logits/rejected": -0.5669078826904297, | |
| "logps/chosen": -9.36229133605957, | |
| "logps/rejected": -21.19735336303711, | |
| "loss": 0.9399389028549194, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5554667115211487, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.25273460149765015, | |
| "rewards/margins": 1.137141227722168, | |
| "rewards/rejected": -0.8844066858291626, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.14021421616358326, | |
| "grad_norm": 5.798766136169434, | |
| "learning_rate": 0.00019979228535975865, | |
| "logits/chosen": -0.5416492223739624, | |
| "logits/rejected": -0.5440787076950073, | |
| "logps/chosen": -9.865373611450195, | |
| "logps/rejected": -29.639345169067383, | |
| "loss": 0.7824708223342896, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4418797492980957, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05873842537403107, | |
| "rewards/margins": 1.351473093032837, | |
| "rewards/rejected": -1.2927345037460327, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.14281077572216813, | |
| "grad_norm": 2.68666934967041, | |
| "learning_rate": 0.00019976367817516773, | |
| "logits/chosen": -0.5077602863311768, | |
| "logits/rejected": -0.5117127299308777, | |
| "logps/chosen": -6.119892120361328, | |
| "logps/rejected": -24.990623474121094, | |
| "loss": 0.7171817421913147, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3807484805583954, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23153242468833923, | |
| "rewards/margins": 1.3034626245498657, | |
| "rewards/rejected": -1.0719302892684937, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.145407335280753, | |
| "grad_norm": 12.753750801086426, | |
| "learning_rate": 0.00019973322836635518, | |
| "logits/chosen": -0.5142076015472412, | |
| "logits/rejected": -0.5133773684501648, | |
| "logps/chosen": -10.577905654907227, | |
| "logps/rejected": -17.775619506835938, | |
| "loss": 1.0084953308105469, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5207356214523315, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.055092498660087585, | |
| "rewards/margins": 0.8445413708686829, | |
| "rewards/rejected": -0.7894489169120789, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.14800389483933787, | |
| "grad_norm": 4.176927089691162, | |
| "learning_rate": 0.00019970093649572564, | |
| "logits/chosen": -0.4988924562931061, | |
| "logits/rejected": -0.5031363368034363, | |
| "logps/chosen": -5.868337631225586, | |
| "logps/rejected": -32.978477478027344, | |
| "loss": 0.5518871545791626, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23210853338241577, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1517554670572281, | |
| "rewards/margins": 1.8292872905731201, | |
| "rewards/rejected": -1.6775319576263428, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.15060045439792275, | |
| "grad_norm": 5.881600856781006, | |
| "learning_rate": 0.00019966680315970648, | |
| "logits/chosen": -0.5035607218742371, | |
| "logits/rejected": -0.5062836408615112, | |
| "logps/chosen": -12.07951831817627, | |
| "logps/rejected": -29.57831573486328, | |
| "loss": 1.039928674697876, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4533731937408447, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.19116882979869843, | |
| "rewards/margins": 1.3504120111465454, | |
| "rewards/rejected": -1.5415807962417603, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.15319701395650762, | |
| "grad_norm": 5.895066738128662, | |
| "learning_rate": 0.0001996308289887366, | |
| "logits/chosen": -0.504879355430603, | |
| "logits/rejected": -0.5091466903686523, | |
| "logps/chosen": -8.11007022857666, | |
| "logps/rejected": -27.097564697265625, | |
| "loss": 0.9131656289100647, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.47925126552581787, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.04523879289627075, | |
| "rewards/margins": 1.2242006063461304, | |
| "rewards/rejected": -1.178961992263794, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.15579357351509251, | |
| "grad_norm": 2.7233798503875732, | |
| "learning_rate": 0.00019959301464725506, | |
| "logits/chosen": -0.5388925671577454, | |
| "logits/rejected": -0.5401982665061951, | |
| "logps/chosen": -5.20983362197876, | |
| "logps/rejected": -22.794513702392578, | |
| "loss": 0.6133744716644287, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2746528089046478, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06251248717308044, | |
| "rewards/margins": 1.3268343210220337, | |
| "rewards/rejected": -1.2643219232559204, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.15839013307367739, | |
| "grad_norm": 5.102992057800293, | |
| "learning_rate": 0.00019955336083368858, | |
| "logits/chosen": -0.5972931385040283, | |
| "logits/rejected": -0.601641058921814, | |
| "logps/chosen": -8.611083984375, | |
| "logps/rejected": -22.611942291259766, | |
| "loss": 1.1286181211471558, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6720573902130127, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.05290444567799568, | |
| "rewards/margins": 0.9988237619400024, | |
| "rewards/rejected": -0.9459192752838135, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.16098669263226226, | |
| "grad_norm": 6.744442462921143, | |
| "learning_rate": 0.00019951186828043877, | |
| "logits/chosen": -0.5748434662818909, | |
| "logits/rejected": -0.5786728858947754, | |
| "logps/chosen": -7.9780778884887695, | |
| "logps/rejected": -19.627988815307617, | |
| "loss": 1.0838773250579834, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5846377611160278, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.011326288804411888, | |
| "rewards/margins": 0.7546138167381287, | |
| "rewards/rejected": -0.7659401297569275, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.16358325219084713, | |
| "grad_norm": 3.6435351371765137, | |
| "learning_rate": 0.00019946853775386857, | |
| "logits/chosen": -0.6392778158187866, | |
| "logits/rejected": -0.6405251622200012, | |
| "logps/chosen": -7.981713771820068, | |
| "logps/rejected": -18.500165939331055, | |
| "loss": 0.8841695189476013, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4594660997390747, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1688350886106491, | |
| "rewards/margins": 0.8609640598297119, | |
| "rewards/rejected": -0.6921288967132568, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.166179811749432, | |
| "grad_norm": 2.4889438152313232, | |
| "learning_rate": 0.00019942337005428803, | |
| "logits/chosen": -0.614960253238678, | |
| "logits/rejected": -0.6170456409454346, | |
| "logps/chosen": -6.154093265533447, | |
| "logps/rejected": -14.32476806640625, | |
| "loss": 0.8417397737503052, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.42383700609207153, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22809524834156036, | |
| "rewards/margins": 0.7583045959472656, | |
| "rewards/rejected": -0.5302093625068665, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.16877637130801687, | |
| "grad_norm": 3.13456654548645, | |
| "learning_rate": 0.00019937636601593964, | |
| "logits/chosen": -0.6562027335166931, | |
| "logits/rejected": -0.657011091709137, | |
| "logps/chosen": -11.849466323852539, | |
| "logps/rejected": -21.00613021850586, | |
| "loss": 0.8801897168159485, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.417907178401947, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.217839315533638, | |
| "rewards/margins": 0.9292322397232056, | |
| "rewards/rejected": -0.711392879486084, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.17137293086660174, | |
| "grad_norm": 2.492602586746216, | |
| "learning_rate": 0.00019932752650698285, | |
| "logits/chosen": -0.6384371519088745, | |
| "logits/rejected": -0.639873743057251, | |
| "logps/chosen": -7.750038146972656, | |
| "logps/rejected": -19.651975631713867, | |
| "loss": 0.7662312984466553, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34055230021476746, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.30775657296180725, | |
| "rewards/margins": 1.0670785903930664, | |
| "rewards/rejected": -0.7593219876289368, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.17396949042518664, | |
| "grad_norm": 3.4701662063598633, | |
| "learning_rate": 0.00019927685242947805, | |
| "logits/chosen": -0.6081066131591797, | |
| "logits/rejected": -0.60552579164505, | |
| "logps/chosen": -8.996465682983398, | |
| "logps/rejected": -16.082275390625, | |
| "loss": 0.8045691251754761, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3208611011505127, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.17242535948753357, | |
| "rewards/margins": 0.7575393915176392, | |
| "rewards/rejected": -0.5851140022277832, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.1765660499837715, | |
| "grad_norm": 2.7060115337371826, | |
| "learning_rate": 0.00019922434471936987, | |
| "logits/chosen": -0.6539565324783325, | |
| "logits/rejected": -0.6539203524589539, | |
| "logps/chosen": -11.010636329650879, | |
| "logps/rejected": -20.040176391601562, | |
| "loss": 0.8421358466148376, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4449455142021179, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2390671670436859, | |
| "rewards/margins": 0.9861317873001099, | |
| "rewards/rejected": -0.7470647096633911, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.17916260954235638, | |
| "grad_norm": 3.1315884590148926, | |
| "learning_rate": 0.00019917000434647, | |
| "logits/chosen": -0.6536306738853455, | |
| "logits/rejected": -0.6518079042434692, | |
| "logps/chosen": -8.555349349975586, | |
| "logps/rejected": -16.54492950439453, | |
| "loss": 0.8154255151748657, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3061010241508484, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10620275139808655, | |
| "rewards/margins": 0.7189066410064697, | |
| "rewards/rejected": -0.6127039194107056, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.18175916910094125, | |
| "grad_norm": 4.3252716064453125, | |
| "learning_rate": 0.0001991138323144392, | |
| "logits/chosen": -0.6485374569892883, | |
| "logits/rejected": -0.6516393423080444, | |
| "logps/chosen": -8.738260269165039, | |
| "logps/rejected": -25.283050537109375, | |
| "loss": 0.7622725963592529, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4182221591472626, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32638847827911377, | |
| "rewards/margins": 1.3203245401382446, | |
| "rewards/rejected": -0.9939361810684204, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.18435572865952612, | |
| "grad_norm": 2.5611085891723633, | |
| "learning_rate": 0.0001990558296607687, | |
| "logits/chosen": -0.6623813509941101, | |
| "logits/rejected": -0.6669056415557861, | |
| "logps/chosen": -6.732373237609863, | |
| "logps/rejected": -28.474903106689453, | |
| "loss": 0.6175573468208313, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30857983231544495, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.274377703666687, | |
| "rewards/margins": 1.688110589981079, | |
| "rewards/rejected": -1.4137327671051025, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.186952288218111, | |
| "grad_norm": 4.000219821929932, | |
| "learning_rate": 0.00019899599745676122, | |
| "logits/chosen": -0.6445091366767883, | |
| "logits/rejected": -0.6437230706214905, | |
| "logps/chosen": -9.047367095947266, | |
| "logps/rejected": -24.770275115966797, | |
| "loss": 0.6452784538269043, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3213377594947815, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2230340838432312, | |
| "rewards/margins": 1.4539806842803955, | |
| "rewards/rejected": -1.230946660041809, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.18954884777669587, | |
| "grad_norm": 6.319863319396973, | |
| "learning_rate": 0.00019893433680751103, | |
| "logits/chosen": -0.6865643262863159, | |
| "logits/rejected": -0.6869932413101196, | |
| "logps/chosen": -7.858439922332764, | |
| "logps/rejected": -23.94890785217285, | |
| "loss": 0.686578631401062, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3744764029979706, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1327737271785736, | |
| "rewards/margins": 1.4861775636672974, | |
| "rewards/rejected": -1.3534038066864014, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.19214540733528077, | |
| "grad_norm": 6.422192573547363, | |
| "learning_rate": 0.00019887084885188353, | |
| "logits/chosen": -0.6767789125442505, | |
| "logits/rejected": -0.6818562746047974, | |
| "logps/chosen": -10.235507011413574, | |
| "logps/rejected": -27.55042266845703, | |
| "loss": 1.0105760097503662, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.45665743947029114, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.17956775426864624, | |
| "rewards/margins": 1.3902134895324707, | |
| "rewards/rejected": -1.5697813034057617, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.19474196689386564, | |
| "grad_norm": 5.481616973876953, | |
| "learning_rate": 0.00019880553476249436, | |
| "logits/chosen": -0.7030400037765503, | |
| "logits/rejected": -0.7033373713493347, | |
| "logps/chosen": -10.782912254333496, | |
| "logps/rejected": -32.654239654541016, | |
| "loss": 0.9248250722885132, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4116487205028534, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.2691394090652466, | |
| "rewards/margins": 1.6453478336334229, | |
| "rewards/rejected": -1.914487361907959, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 0.1973385264524505, | |
| "grad_norm": 4.9708380699157715, | |
| "learning_rate": 0.00019873839574568756, | |
| "logits/chosen": -0.7089657783508301, | |
| "logits/rejected": -0.7070764303207397, | |
| "logps/chosen": -15.426520347595215, | |
| "logps/rejected": -19.238183975219727, | |
| "loss": 0.9280877113342285, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4586380124092102, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.10893960297107697, | |
| "rewards/margins": 1.0797489881515503, | |
| "rewards/rejected": -0.9708094000816345, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 0.19993508601103538, | |
| "grad_norm": 6.939232349395752, | |
| "learning_rate": 0.00019866943304151343, | |
| "logits/chosen": -0.7235709428787231, | |
| "logits/rejected": -0.7286774516105652, | |
| "logps/chosen": -8.378010749816895, | |
| "logps/rejected": -22.562332153320312, | |
| "loss": 0.7349967956542969, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4009379744529724, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21920469403266907, | |
| "rewards/margins": 1.1362016201019287, | |
| "rewards/rejected": -0.916996955871582, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 0.20253164556962025, | |
| "grad_norm": 7.251801013946533, | |
| "learning_rate": 0.00019859864792370563, | |
| "logits/chosen": -0.7075158357620239, | |
| "logits/rejected": -0.7119045257568359, | |
| "logps/chosen": -6.7388834953308105, | |
| "logps/rejected": -26.275516510009766, | |
| "loss": 0.6517897844314575, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.36059334874153137, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1867286115884781, | |
| "rewards/margins": 1.5948593616485596, | |
| "rewards/rejected": -1.4081308841705322, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 0.20512820512820512, | |
| "grad_norm": 2.740595579147339, | |
| "learning_rate": 0.00019852604169965748, | |
| "logits/chosen": -0.7263121604919434, | |
| "logits/rejected": -0.7323212027549744, | |
| "logps/chosen": -8.532756805419922, | |
| "logps/rejected": -26.737321853637695, | |
| "loss": 0.7062958478927612, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3304542601108551, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.15770669281482697, | |
| "rewards/margins": 1.20403254032135, | |
| "rewards/rejected": -1.0463258028030396, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 0.20772476468679, | |
| "grad_norm": 8.650463104248047, | |
| "learning_rate": 0.00019845161571039802, | |
| "logits/chosen": -0.665086567401886, | |
| "logits/rejected": -0.6679493188858032, | |
| "logps/chosen": -6.538414001464844, | |
| "logps/rejected": -23.43639373779297, | |
| "loss": 0.6757080554962158, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3169613480567932, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1747138351202011, | |
| "rewards/margins": 1.2467294931411743, | |
| "rewards/rejected": -1.072015643119812, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.2103213242453749, | |
| "grad_norm": 2.5581393241882324, | |
| "learning_rate": 0.00019837537133056716, | |
| "logits/chosen": -0.7091171145439148, | |
| "logits/rejected": -0.7068539261817932, | |
| "logps/chosen": -7.670237064361572, | |
| "logps/rejected": -22.62818717956543, | |
| "loss": 0.6010414958000183, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2785060405731201, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23199363052845, | |
| "rewards/margins": 1.2859355211257935, | |
| "rewards/rejected": -1.0539417266845703, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 0.21291788380395976, | |
| "grad_norm": 5.669743537902832, | |
| "learning_rate": 0.0001982973099683902, | |
| "logits/chosen": -0.6808027029037476, | |
| "logits/rejected": -0.6830285787582397, | |
| "logps/chosen": -9.610679626464844, | |
| "logps/rejected": -27.96251678466797, | |
| "loss": 0.6995903849601746, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4465019702911377, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23076733946800232, | |
| "rewards/margins": 1.6701395511627197, | |
| "rewards/rejected": -1.4393723011016846, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.21551444336254463, | |
| "grad_norm": 3.1134045124053955, | |
| "learning_rate": 0.00019821743306565196, | |
| "logits/chosen": -0.6749523878097534, | |
| "logits/rejected": -0.6780697107315063, | |
| "logps/chosen": -7.1323065757751465, | |
| "logps/rejected": -20.9448299407959, | |
| "loss": 0.8713948726654053, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39334219694137573, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03965923935174942, | |
| "rewards/margins": 1.1248116493225098, | |
| "rewards/rejected": -1.0851523876190186, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.2181110029211295, | |
| "grad_norm": 4.337428569793701, | |
| "learning_rate": 0.00019813574209767012, | |
| "logits/chosen": -0.7203540205955505, | |
| "logits/rejected": -0.7236320972442627, | |
| "logps/chosen": -5.232553482055664, | |
| "logps/rejected": -20.862529754638672, | |
| "loss": 0.766181230545044, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35961851477622986, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.18721464276313782, | |
| "rewards/margins": 1.240044116973877, | |
| "rewards/rejected": -1.052829384803772, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.22070756247971438, | |
| "grad_norm": 3.9627957344055176, | |
| "learning_rate": 0.00019805223857326793, | |
| "logits/chosen": -0.6975981593132019, | |
| "logits/rejected": -0.69466632604599, | |
| "logps/chosen": -10.297499656677246, | |
| "logps/rejected": -18.96347999572754, | |
| "loss": 0.791930615901947, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.43207138776779175, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.31037044525146484, | |
| "rewards/margins": 1.2147060632705688, | |
| "rewards/rejected": -0.904335618019104, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.22330412203829925, | |
| "grad_norm": 5.315914630889893, | |
| "learning_rate": 0.00019796692403474634, | |
| "logits/chosen": -0.7207286953926086, | |
| "logits/rejected": -0.7248555421829224, | |
| "logps/chosen": -7.064785480499268, | |
| "logps/rejected": -26.38395881652832, | |
| "loss": 0.6355230212211609, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31730470061302185, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.19611045718193054, | |
| "rewards/margins": 1.5834972858428955, | |
| "rewards/rejected": -1.3873869180679321, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.22590068159688412, | |
| "grad_norm": 3.8507533073425293, | |
| "learning_rate": 0.0001978798000578555, | |
| "logits/chosen": -0.6815958619117737, | |
| "logits/rejected": -0.6819433569908142, | |
| "logps/chosen": -10.517496109008789, | |
| "logps/rejected": -21.736141204833984, | |
| "loss": 0.7764264941215515, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3441038131713867, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.11584789305925369, | |
| "rewards/margins": 1.0969102382659912, | |
| "rewards/rejected": -0.9810622930526733, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.22849724115546902, | |
| "grad_norm": 2.613917350769043, | |
| "learning_rate": 0.0001977908682517658, | |
| "logits/chosen": -0.7139868140220642, | |
| "logits/rejected": -0.7127493023872375, | |
| "logps/chosen": -7.027731418609619, | |
| "logps/rejected": -21.87887954711914, | |
| "loss": 0.5793716907501221, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24400269985198975, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.159662663936615, | |
| "rewards/margins": 1.3076614141464233, | |
| "rewards/rejected": -1.1479988098144531, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.2310938007140539, | |
| "grad_norm": 2.5475218296051025, | |
| "learning_rate": 0.00019770013025903794, | |
| "logits/chosen": -0.7572659254074097, | |
| "logits/rejected": -0.7608864307403564, | |
| "logps/chosen": -7.705483436584473, | |
| "logps/rejected": -23.772804260253906, | |
| "loss": 0.7914519906044006, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4494747221469879, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.029678428545594215, | |
| "rewards/margins": 1.3612412214279175, | |
| "rewards/rejected": -1.3315627574920654, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.23369036027263876, | |
| "grad_norm": 2.815131902694702, | |
| "learning_rate": 0.00019760758775559274, | |
| "logits/chosen": -0.7308779954910278, | |
| "logits/rejected": -0.7346111536026001, | |
| "logps/chosen": -6.071584224700928, | |
| "logps/rejected": -31.994752883911133, | |
| "loss": 0.45671066641807556, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21047784388065338, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14397624135017395, | |
| "rewards/margins": 1.9211211204528809, | |
| "rewards/rejected": -1.7771449089050293, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005366 | |
| }, | |
| { | |
| "epoch": 0.23628691983122363, | |
| "grad_norm": 2.638777494430542, | |
| "learning_rate": 0.00019751324245068005, | |
| "logits/chosen": -0.7884888648986816, | |
| "logits/rejected": -0.7910454273223877, | |
| "logps/chosen": -7.571388244628906, | |
| "logps/rejected": -31.14786720275879, | |
| "loss": 0.47864896059036255, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.28661027550697327, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23762081563472748, | |
| "rewards/margins": 2.1247057914733887, | |
| "rewards/rejected": -1.887085199356079, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.2388834793898085, | |
| "grad_norm": 2.7935073375701904, | |
| "learning_rate": 0.0001974170960868474, | |
| "logits/chosen": -0.7978686094284058, | |
| "logits/rejected": -0.7982107996940613, | |
| "logps/chosen": -9.373262405395508, | |
| "logps/rejected": -31.14629364013672, | |
| "loss": 0.7341030240058899, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.45608797669410706, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1958312690258026, | |
| "rewards/margins": 2.0244781970977783, | |
| "rewards/rejected": -1.8286471366882324, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005366 | |
| }, | |
| { | |
| "epoch": 0.24148003894839337, | |
| "grad_norm": 9.233238220214844, | |
| "learning_rate": 0.00019731915043990757, | |
| "logits/chosen": -0.8195321559906006, | |
| "logits/rejected": -0.8183485269546509, | |
| "logps/chosen": -9.839788436889648, | |
| "logps/rejected": -29.437850952148438, | |
| "loss": 0.6806643009185791, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4058592915534973, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22106225788593292, | |
| "rewards/margins": 1.8086858987808228, | |
| "rewards/rejected": -1.5876235961914062, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.24407659850697824, | |
| "grad_norm": 16.396970748901367, | |
| "learning_rate": 0.00019721940731890598, | |
| "logits/chosen": -0.8492038249969482, | |
| "logits/rejected": -0.854621946811676, | |
| "logps/chosen": -10.201713562011719, | |
| "logps/rejected": -26.62791633605957, | |
| "loss": 0.8960828185081482, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5508711338043213, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06682707369327545, | |
| "rewards/margins": 1.7468764781951904, | |
| "rewards/rejected": -1.6800494194030762, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.24667315806556314, | |
| "grad_norm": 4.18104887008667, | |
| "learning_rate": 0.00019711786856608713, | |
| "logits/chosen": -0.8644828796386719, | |
| "logits/rejected": -0.8670830726623535, | |
| "logps/chosen": -8.474161148071289, | |
| "logps/rejected": -27.058048248291016, | |
| "loss": 0.9486290216445923, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6114800572395325, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1142926812171936, | |
| "rewards/margins": 1.905853509902954, | |
| "rewards/rejected": -1.7915611267089844, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.249269717624148, | |
| "grad_norm": 4.6679511070251465, | |
| "learning_rate": 0.00019701453605686068, | |
| "logits/chosen": -0.807258129119873, | |
| "logits/rejected": -0.8097864985466003, | |
| "logps/chosen": -12.544672966003418, | |
| "logps/rejected": -33.301963806152344, | |
| "loss": 0.7105246186256409, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4519771933555603, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13032159209251404, | |
| "rewards/margins": 2.0599286556243896, | |
| "rewards/rejected": -1.9296070337295532, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.25186627718273286, | |
| "grad_norm": 9.922234535217285, | |
| "learning_rate": 0.0001969094116997668, | |
| "logits/chosen": -0.82038813829422, | |
| "logits/rejected": -0.8280550837516785, | |
| "logps/chosen": -6.2751688957214355, | |
| "logps/rejected": -35.381473541259766, | |
| "loss": 0.6427486538887024, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.40357428789138794, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10702433437108994, | |
| "rewards/margins": 2.1959128379821777, | |
| "rewards/rejected": -2.088888168334961, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.25446283674131775, | |
| "grad_norm": 2.88350248336792, | |
| "learning_rate": 0.00019680249743644082, | |
| "logits/chosen": -0.8155514001846313, | |
| "logits/rejected": -0.8185899257659912, | |
| "logps/chosen": -8.072955131530762, | |
| "logps/rejected": -31.97516632080078, | |
| "loss": 0.4997653067111969, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.29022216796875, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18802499771118164, | |
| "rewards/margins": 2.076292037963867, | |
| "rewards/rejected": -1.8882670402526855, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.25705939629990265, | |
| "grad_norm": 6.562138080596924, | |
| "learning_rate": 0.00019669379524157754, | |
| "logits/chosen": -0.7990139722824097, | |
| "logits/rejected": -0.7997216582298279, | |
| "logps/chosen": -10.97663688659668, | |
| "logps/rejected": -38.73711395263672, | |
| "loss": 1.0108985900878906, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6511343121528625, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.15600137412548065, | |
| "rewards/margins": 2.344217538833618, | |
| "rewards/rejected": -2.5002188682556152, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.2596559558584875, | |
| "grad_norm": 3.38523530960083, | |
| "learning_rate": 0.00019658330712289454, | |
| "logits/chosen": -0.7976465225219727, | |
| "logits/rejected": -0.8036509156227112, | |
| "logps/chosen": -5.74189567565918, | |
| "logps/rejected": -38.44095993041992, | |
| "loss": 0.44277071952819824, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23434144258499146, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.08411058783531189, | |
| "rewards/margins": 2.847978115081787, | |
| "rewards/rejected": -2.7638673782348633, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.2622525154170724, | |
| "grad_norm": 4.052488327026367, | |
| "learning_rate": 0.00019647103512109536, | |
| "logits/chosen": -0.7472208738327026, | |
| "logits/rejected": -0.7484402656555176, | |
| "logps/chosen": -8.85651683807373, | |
| "logps/rejected": -31.95272445678711, | |
| "loss": 0.7574372291564941, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4765327274799347, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.06969474256038666, | |
| "rewards/margins": 2.256247043609619, | |
| "rewards/rejected": -2.1865522861480713, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.26484907497565724, | |
| "grad_norm": 9.65314769744873, | |
| "learning_rate": 0.0001963569813098315, | |
| "logits/chosen": -0.7638405561447144, | |
| "logits/rejected": -0.7673444747924805, | |
| "logps/chosen": -9.536478042602539, | |
| "logps/rejected": -24.767440795898438, | |
| "loss": 0.9202646017074585, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5910370945930481, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0962737649679184, | |
| "rewards/margins": 1.5450704097747803, | |
| "rewards/rejected": -1.4487966299057007, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.26744563453424214, | |
| "grad_norm": 9.249479293823242, | |
| "learning_rate": 0.00019624114779566448, | |
| "logits/chosen": -0.7637047171592712, | |
| "logits/rejected": -0.7682798504829407, | |
| "logps/chosen": -9.765649795532227, | |
| "logps/rejected": -26.720335006713867, | |
| "loss": 0.7715259790420532, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.40688371658325195, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.025217050686478615, | |
| "rewards/margins": 1.340709924697876, | |
| "rewards/rejected": -1.36592698097229, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.270042194092827, | |
| "grad_norm": 18.381378173828125, | |
| "learning_rate": 0.00019612353671802656, | |
| "logits/chosen": -0.7441118955612183, | |
| "logits/rejected": -0.7465165853500366, | |
| "logps/chosen": -10.135462760925293, | |
| "logps/rejected": -24.317302703857422, | |
| "loss": 1.0861011743545532, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6500208377838135, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0288698673248291, | |
| "rewards/margins": 1.2047085762023926, | |
| "rewards/rejected": -1.2335785627365112, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.2726387536514119, | |
| "grad_norm": 3.6603286266326904, | |
| "learning_rate": 0.0001960041502491815, | |
| "logits/chosen": -0.7493617534637451, | |
| "logits/rejected": -0.7547396421432495, | |
| "logps/chosen": -9.255151748657227, | |
| "logps/rejected": -26.553424835205078, | |
| "loss": 0.7831539511680603, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4715706706047058, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23407554626464844, | |
| "rewards/margins": 1.5187476873397827, | |
| "rewards/rejected": -1.2846721410751343, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.2752353132099968, | |
| "grad_norm": 3.8713457584381104, | |
| "learning_rate": 0.00019588299059418432, | |
| "logits/chosen": -0.7057076692581177, | |
| "logits/rejected": -0.7100006341934204, | |
| "logps/chosen": -7.245676517486572, | |
| "logps/rejected": -30.364728927612305, | |
| "loss": 0.47607186436653137, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2242860198020935, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.16006791591644287, | |
| "rewards/margins": 1.8761022090911865, | |
| "rewards/rejected": -1.7160344123840332, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.2778318727685816, | |
| "grad_norm": 4.534320831298828, | |
| "learning_rate": 0.0001957600599908406, | |
| "logits/chosen": -0.7508159875869751, | |
| "logits/rejected": -0.7570351958274841, | |
| "logps/chosen": -7.806947708129883, | |
| "logps/rejected": -35.8264274597168, | |
| "loss": 0.7150964140892029, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3946303129196167, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08480332791805267, | |
| "rewards/margins": 2.440999984741211, | |
| "rewards/rejected": -2.356196880340576, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.2804284323271665, | |
| "grad_norm": 4.433022975921631, | |
| "learning_rate": 0.00019563536070966512, | |
| "logits/chosen": -0.7469314932823181, | |
| "logits/rejected": -0.7510149478912354, | |
| "logps/chosen": -6.266570568084717, | |
| "logps/rejected": -27.143407821655273, | |
| "loss": 0.7763616442680359, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3898002505302429, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2665005028247833, | |
| "rewards/margins": 1.8339991569519043, | |
| "rewards/rejected": -1.5674986839294434, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.28302499188575136, | |
| "grad_norm": 3.777085065841675, | |
| "learning_rate": 0.00019550889505383996, | |
| "logits/chosen": -0.7664754986763, | |
| "logits/rejected": -0.7695226669311523, | |
| "logps/chosen": -8.639087677001953, | |
| "logps/rejected": -32.59357833862305, | |
| "loss": 0.6963664889335632, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3630713224411011, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09401198476552963, | |
| "rewards/margins": 2.053591728210449, | |
| "rewards/rejected": -1.9595798254013062, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.28562155144433626, | |
| "grad_norm": 3.1223268508911133, | |
| "learning_rate": 0.00019538066535917196, | |
| "logits/chosen": -0.7881599068641663, | |
| "logits/rejected": -0.7903666496276855, | |
| "logps/chosen": -10.761030197143555, | |
| "logps/rejected": -24.686668395996094, | |
| "loss": 0.812722384929657, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4688267707824707, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07528804242610931, | |
| "rewards/margins": 1.5661133527755737, | |
| "rewards/rejected": -1.4908254146575928, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.2882181110029211, | |
| "grad_norm": 3.300981283187866, | |
| "learning_rate": 0.00019525067399404957, | |
| "logits/chosen": -0.7968149185180664, | |
| "logits/rejected": -0.7997515797615051, | |
| "logps/chosen": -6.535473346710205, | |
| "logps/rejected": -19.67113494873047, | |
| "loss": 0.577447772026062, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27950558066368103, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3308606743812561, | |
| "rewards/margins": 1.4230268001556396, | |
| "rewards/rejected": -1.0921661853790283, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.290814670561506, | |
| "grad_norm": 4.260409832000732, | |
| "learning_rate": 0.00019511892335939904, | |
| "logits/chosen": -0.7704994678497314, | |
| "logits/rejected": -0.773585855960846, | |
| "logps/chosen": -7.999111175537109, | |
| "logps/rejected": -23.012435913085938, | |
| "loss": 0.8953735828399658, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.38217711448669434, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.008818171918392181, | |
| "rewards/margins": 1.0762327909469604, | |
| "rewards/rejected": -1.0850509405136108, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.2934112301200909, | |
| "grad_norm": 2.6586623191833496, | |
| "learning_rate": 0.0001949854158886402, | |
| "logits/chosen": -0.8259446024894714, | |
| "logits/rejected": -0.8321948647499084, | |
| "logps/chosen": -5.621776580810547, | |
| "logps/rejected": -21.676912307739258, | |
| "loss": 0.5901638269424438, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2607543170452118, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.231726735830307, | |
| "rewards/margins": 1.2758175134658813, | |
| "rewards/rejected": -1.0440906286239624, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.29600778967867575, | |
| "grad_norm": 2.47329044342041, | |
| "learning_rate": 0.00019485015404764142, | |
| "logits/chosen": -0.8323794007301331, | |
| "logits/rejected": -0.8363099098205566, | |
| "logps/chosen": -7.094597339630127, | |
| "logps/rejected": -23.47966766357422, | |
| "loss": 0.5581099987030029, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2674333155155182, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24452531337738037, | |
| "rewards/margins": 1.409566879272461, | |
| "rewards/rejected": -1.1650415658950806, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.29860434923726065, | |
| "grad_norm": 2.6978213787078857, | |
| "learning_rate": 0.00019471314033467412, | |
| "logits/chosen": -0.8472287654876709, | |
| "logits/rejected": -0.8518344163894653, | |
| "logps/chosen": -6.279523849487305, | |
| "logps/rejected": -26.379831314086914, | |
| "loss": 0.6252153515815735, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3001650869846344, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2660066485404968, | |
| "rewards/margins": 1.4429866075515747, | |
| "rewards/rejected": -1.1769800186157227, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.3012009087958455, | |
| "grad_norm": 3.7869536876678467, | |
| "learning_rate": 0.00019457437728036657, | |
| "logits/chosen": -0.9077713489532471, | |
| "logits/rejected": -0.9146382212638855, | |
| "logps/chosen": -7.037418842315674, | |
| "logps/rejected": -28.10509490966797, | |
| "loss": 0.6573376059532166, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39039283990859985, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2199217826128006, | |
| "rewards/margins": 1.892009973526001, | |
| "rewards/rejected": -1.6720881462097168, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.3037974683544304, | |
| "grad_norm": 7.053493022918701, | |
| "learning_rate": 0.00019443386744765723, | |
| "logits/chosen": -0.9531128406524658, | |
| "logits/rejected": -0.960386335849762, | |
| "logps/chosen": -6.833982467651367, | |
| "logps/rejected": -32.22799301147461, | |
| "loss": 0.5475011467933655, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30003488063812256, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2115585058927536, | |
| "rewards/margins": 1.97544527053833, | |
| "rewards/rejected": -1.7638866901397705, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.30639402791301523, | |
| "grad_norm": 10.012398719787598, | |
| "learning_rate": 0.00019429161343174732, | |
| "logits/chosen": -0.9923131465911865, | |
| "logits/rejected": -0.9990757703781128, | |
| "logps/chosen": -6.25333309173584, | |
| "logps/rejected": -37.52185821533203, | |
| "loss": 0.47200581431388855, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2796837091445923, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15778988599777222, | |
| "rewards/margins": 2.6613681316375732, | |
| "rewards/rejected": -2.5035781860351562, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.30899058747160013, | |
| "grad_norm": 6.096463203430176, | |
| "learning_rate": 0.00019414761786005293, | |
| "logits/chosen": -1.0189846754074097, | |
| "logits/rejected": -1.0254305601119995, | |
| "logps/chosen": -10.205361366271973, | |
| "logps/rejected": -36.81409454345703, | |
| "loss": 0.8465672731399536, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.41437357664108276, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.21620658040046692, | |
| "rewards/margins": 2.7219061851501465, | |
| "rewards/rejected": -2.505699634552002, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.31158714703018503, | |
| "grad_norm": 5.313393592834473, | |
| "learning_rate": 0.00019400188339215656, | |
| "logits/chosen": -1.046160340309143, | |
| "logits/rejected": -1.0573420524597168, | |
| "logps/chosen": -7.700190544128418, | |
| "logps/rejected": -47.04288101196289, | |
| "loss": 0.6054658889770508, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3044295608997345, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0029486743733286858, | |
| "rewards/margins": 3.3137736320495605, | |
| "rewards/rejected": -3.3108251094818115, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.3141837065887699, | |
| "grad_norm": 4.291571140289307, | |
| "learning_rate": 0.00019385441271975787, | |
| "logits/chosen": -0.9954756498336792, | |
| "logits/rejected": -1.0022181272506714, | |
| "logps/chosen": -8.529633522033691, | |
| "logps/rejected": -45.85521697998047, | |
| "loss": 0.5717029571533203, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26478123664855957, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10705923289060593, | |
| "rewards/margins": 3.2083029747009277, | |
| "rewards/rejected": -3.101243734359741, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.31678026614735477, | |
| "grad_norm": 4.251352310180664, | |
| "learning_rate": 0.00019370520856662403, | |
| "logits/chosen": -0.9976125359535217, | |
| "logits/rejected": -1.0026432275772095, | |
| "logps/chosen": -8.120194435119629, | |
| "logps/rejected": -29.240516662597656, | |
| "loss": 0.5614541172981262, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.28819626569747925, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.25042724609375, | |
| "rewards/margins": 2.2021260261535645, | |
| "rewards/rejected": -1.9516987800598145, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.3193768257059396, | |
| "grad_norm": 3.4627809524536133, | |
| "learning_rate": 0.00019355427368853944, | |
| "logits/chosen": -0.9717710614204407, | |
| "logits/rejected": -0.9764275550842285, | |
| "logps/chosen": -6.992214679718018, | |
| "logps/rejected": -39.05671691894531, | |
| "loss": 0.4260398745536804, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22311873733997345, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1755235493183136, | |
| "rewards/margins": 2.8104753494262695, | |
| "rewards/rejected": -2.6349518299102783, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.3219733852645245, | |
| "grad_norm": 5.5872344970703125, | |
| "learning_rate": 0.0001934016108732548, | |
| "logits/chosen": -0.9085801243782043, | |
| "logits/rejected": -0.9201411008834839, | |
| "logps/chosen": -6.697179794311523, | |
| "logps/rejected": -39.4910774230957, | |
| "loss": 0.5134581327438354, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22149759531021118, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.12765586376190186, | |
| "rewards/margins": 2.5553700923919678, | |
| "rewards/rejected": -2.4277141094207764, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.32456994482310936, | |
| "grad_norm": 4.304178237915039, | |
| "learning_rate": 0.00019324722294043558, | |
| "logits/chosen": -0.9116522073745728, | |
| "logits/rejected": -0.9168075323104858, | |
| "logps/chosen": -11.646254539489746, | |
| "logps/rejected": -32.823944091796875, | |
| "loss": 0.9349632859230042, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6308795213699341, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.16005653142929077, | |
| "rewards/margins": 1.716849684715271, | |
| "rewards/rejected": -1.8769065141677856, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.32716650438169426, | |
| "grad_norm": 8.176533699035645, | |
| "learning_rate": 0.00019309111274161005, | |
| "logits/chosen": -0.9096921682357788, | |
| "logits/rejected": -0.9123918414115906, | |
| "logps/chosen": -7.077070236206055, | |
| "logps/rejected": -30.848291397094727, | |
| "loss": 0.7031348943710327, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4654442369937897, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14152386784553528, | |
| "rewards/margins": 1.975406527519226, | |
| "rewards/rejected": -1.8338826894760132, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.32976306394027916, | |
| "grad_norm": 2.428119659423828, | |
| "learning_rate": 0.00019293328316011643, | |
| "logits/chosen": -0.8453407287597656, | |
| "logits/rejected": -0.8446547985076904, | |
| "logps/chosen": -5.936784744262695, | |
| "logps/rejected": -24.515966415405273, | |
| "loss": 0.5038060545921326, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2542741894721985, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.29046115279197693, | |
| "rewards/margins": 1.757112741470337, | |
| "rewards/rejected": -1.4666515588760376, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.332359623498864, | |
| "grad_norm": 6.065800666809082, | |
| "learning_rate": 0.00019277373711104988, | |
| "logits/chosen": -0.79842609167099, | |
| "logits/rejected": -0.8017737865447998, | |
| "logps/chosen": -11.66524887084961, | |
| "logps/rejected": -29.264678955078125, | |
| "loss": 0.9522978067398071, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6585720777511597, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.18028652667999268, | |
| "rewards/margins": 1.8596545457839966, | |
| "rewards/rejected": -1.679368257522583, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.3349561830574489, | |
| "grad_norm": 1.9705984592437744, | |
| "learning_rate": 0.00019261247754120845, | |
| "logits/chosen": -0.8193144202232361, | |
| "logits/rejected": -0.8230156302452087, | |
| "logps/chosen": -6.537097454071045, | |
| "logps/rejected": -34.18002700805664, | |
| "loss": 0.45630478858947754, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26018983125686646, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31401899456977844, | |
| "rewards/margins": 2.220799446105957, | |
| "rewards/rejected": -1.906780481338501, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.33755274261603374, | |
| "grad_norm": 8.319106101989746, | |
| "learning_rate": 0.00019244950742903878, | |
| "logits/chosen": -0.8408774137496948, | |
| "logits/rejected": -0.8418459892272949, | |
| "logps/chosen": -11.665637969970703, | |
| "logps/rejected": -31.675600051879883, | |
| "loss": 0.8428304195404053, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5734348297119141, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2836587727069855, | |
| "rewards/margins": 2.027439832687378, | |
| "rewards/rejected": -1.7437809705734253, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.34014930217461864, | |
| "grad_norm": 41.45463943481445, | |
| "learning_rate": 0.00019228482978458098, | |
| "logits/chosen": -0.838470995426178, | |
| "logits/rejected": -0.8445388078689575, | |
| "logps/chosen": -9.106077194213867, | |
| "logps/rejected": -35.46880340576172, | |
| "loss": 0.5834946036338806, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3602459132671356, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.17075614631175995, | |
| "rewards/margins": 2.3818886280059814, | |
| "rewards/rejected": -2.211132526397705, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.3427458617332035, | |
| "grad_norm": 3.643427848815918, | |
| "learning_rate": 0.00019211844764941316, | |
| "logits/chosen": -0.8022149801254272, | |
| "logits/rejected": -0.8042948842048645, | |
| "logps/chosen": -6.459863662719727, | |
| "logps/rejected": -25.415029525756836, | |
| "loss": 0.6114150285720825, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.275367796421051, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.15174095332622528, | |
| "rewards/margins": 1.8365050554275513, | |
| "rewards/rejected": -1.68476402759552, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.3453424212917884, | |
| "grad_norm": 5.966490268707275, | |
| "learning_rate": 0.0001919503640965951, | |
| "logits/chosen": -0.8290812969207764, | |
| "logits/rejected": -0.8256518840789795, | |
| "logps/chosen": -11.998124122619629, | |
| "logps/rejected": -33.305782318115234, | |
| "loss": 0.8110654950141907, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4670514762401581, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.07125922292470932, | |
| "rewards/margins": 2.1010446548461914, | |
| "rewards/rejected": -2.1723036766052246, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.3479389808503733, | |
| "grad_norm": 7.3433074951171875, | |
| "learning_rate": 0.00019178058223061172, | |
| "logits/chosen": -0.8187044262886047, | |
| "logits/rejected": -0.8188722133636475, | |
| "logps/chosen": -10.026674270629883, | |
| "logps/rejected": -34.666481018066406, | |
| "loss": 0.714328944683075, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3863736093044281, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.03853297978639603, | |
| "rewards/margins": 2.199920415878296, | |
| "rewards/rejected": -2.2384533882141113, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.3505355404089581, | |
| "grad_norm": 3.3124072551727295, | |
| "learning_rate": 0.0001916091051873154, | |
| "logits/chosen": -0.8322088122367859, | |
| "logits/rejected": -0.8396530151367188, | |
| "logps/chosen": -7.216854095458984, | |
| "logps/rejected": -37.36469650268555, | |
| "loss": 0.6344051361083984, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33177444338798523, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.11395619809627533, | |
| "rewards/margins": 2.6887590885162354, | |
| "rewards/rejected": -2.574802875518799, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.353132099967543, | |
| "grad_norm": 5.023634910583496, | |
| "learning_rate": 0.00019143593613386845, | |
| "logits/chosen": -0.8675904870033264, | |
| "logits/rejected": -0.8706792593002319, | |
| "logps/chosen": -11.020098686218262, | |
| "logps/rejected": -27.420391082763672, | |
| "loss": 0.9489123821258545, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5339450836181641, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.009774968028068542, | |
| "rewards/margins": 1.8276335000991821, | |
| "rewards/rejected": -1.837408423423767, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.35572865952612787, | |
| "grad_norm": 7.146136283874512, | |
| "learning_rate": 0.00019126107826868434, | |
| "logits/chosen": -0.8088135123252869, | |
| "logits/rejected": -0.8119392395019531, | |
| "logps/chosen": -6.920078277587891, | |
| "logps/rejected": -27.85674285888672, | |
| "loss": 0.5413922071456909, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3426899015903473, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3540826737880707, | |
| "rewards/margins": 2.053499698638916, | |
| "rewards/rejected": -1.6994171142578125, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.35832521908471276, | |
| "grad_norm": 3.10225772857666, | |
| "learning_rate": 0.00019108453482136864, | |
| "logits/chosen": -0.797788679599762, | |
| "logits/rejected": -0.801692008972168, | |
| "logps/chosen": -7.574698448181152, | |
| "logps/rejected": -27.11581039428711, | |
| "loss": 0.5337320566177368, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2580120861530304, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1669113039970398, | |
| "rewards/margins": 1.648089051246643, | |
| "rewards/rejected": -1.4811776876449585, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.3609217786432976, | |
| "grad_norm": 4.059778213500977, | |
| "learning_rate": 0.00019090630905265962, | |
| "logits/chosen": -0.7970037460327148, | |
| "logits/rejected": -0.8018133640289307, | |
| "logps/chosen": -6.6308183670043945, | |
| "logps/rejected": -31.498334884643555, | |
| "loss": 0.526771068572998, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2799426317214966, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1864967793226242, | |
| "rewards/margins": 1.9347224235534668, | |
| "rewards/rejected": -1.7482255697250366, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.3635183382018825, | |
| "grad_norm": 3.430341958999634, | |
| "learning_rate": 0.00019072640425436764, | |
| "logits/chosen": -0.7270718216896057, | |
| "logits/rejected": -0.7312384843826294, | |
| "logps/chosen": -8.781835556030273, | |
| "logps/rejected": -27.820384979248047, | |
| "loss": 0.9166272878646851, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6030000448226929, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1951862871646881, | |
| "rewards/margins": 1.9607356786727905, | |
| "rewards/rejected": -1.7655493021011353, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.3661148977604674, | |
| "grad_norm": 7.683961391448975, | |
| "learning_rate": 0.00019054482374931467, | |
| "logits/chosen": -0.7383142709732056, | |
| "logits/rejected": -0.7448272705078125, | |
| "logps/chosen": -8.916434288024902, | |
| "logps/rejected": -25.045127868652344, | |
| "loss": 0.7173936367034912, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.37474605441093445, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10682700574398041, | |
| "rewards/margins": 1.3628969192504883, | |
| "rewards/rejected": -1.2560698986053467, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.36871145731905225, | |
| "grad_norm": 1.7709827423095703, | |
| "learning_rate": 0.0001903615708912728, | |
| "logits/chosen": -0.7578890919685364, | |
| "logits/rejected": -0.7647184729576111, | |
| "logps/chosen": -7.2641496658325195, | |
| "logps/rejected": -36.448509216308594, | |
| "loss": 0.4749196469783783, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3057454228401184, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32155346870422363, | |
| "rewards/margins": 2.4896819591522217, | |
| "rewards/rejected": -2.168128728866577, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.37130801687763715, | |
| "grad_norm": 3.9916441440582275, | |
| "learning_rate": 0.00019017664906490218, | |
| "logits/chosen": -0.725705087184906, | |
| "logits/rejected": -0.7305294275283813, | |
| "logps/chosen": -7.681970119476318, | |
| "logps/rejected": -25.85850715637207, | |
| "loss": 0.720486581325531, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.41218873858451843, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3683932423591614, | |
| "rewards/margins": 1.7790489196777344, | |
| "rewards/rejected": -1.4106559753417969, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.373904576436222, | |
| "grad_norm": 3.9804799556732178, | |
| "learning_rate": 0.00018999006168568883, | |
| "logits/chosen": -0.7427334785461426, | |
| "logits/rejected": -0.7495901584625244, | |
| "logps/chosen": -9.262022018432617, | |
| "logps/rejected": -25.315187454223633, | |
| "loss": 0.6805542707443237, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2929586172103882, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05294320732355118, | |
| "rewards/margins": 1.5572216510772705, | |
| "rewards/rejected": -1.5042784214019775, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.3765011359948069, | |
| "grad_norm": 2.4131383895874023, | |
| "learning_rate": 0.00018980181219988116, | |
| "logits/chosen": -0.7519474029541016, | |
| "logits/rejected": -0.7524614930152893, | |
| "logps/chosen": -7.246754169464111, | |
| "logps/rejected": -24.415956497192383, | |
| "loss": 0.6144455075263977, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33591488003730774, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.36078375577926636, | |
| "rewards/margins": 1.827178716659546, | |
| "rewards/rejected": -1.4663947820663452, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.37909769555339173, | |
| "grad_norm": 3.9731338024139404, | |
| "learning_rate": 0.00018961190408442658, | |
| "logits/chosen": -0.7098850011825562, | |
| "logits/rejected": -0.7081133127212524, | |
| "logps/chosen": -11.87010669708252, | |
| "logps/rejected": -28.748165130615234, | |
| "loss": 0.7033959627151489, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.38679245114326477, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13101431727409363, | |
| "rewards/margins": 1.9088966846466064, | |
| "rewards/rejected": -1.7778825759887695, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.38169425511197663, | |
| "grad_norm": 5.180086135864258, | |
| "learning_rate": 0.00018942034084690724, | |
| "logits/chosen": -0.7729518413543701, | |
| "logits/rejected": -0.7725076675415039, | |
| "logps/chosen": -10.054743766784668, | |
| "logps/rejected": -27.725801467895508, | |
| "loss": 0.7672705054283142, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32955068349838257, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.007290400564670563, | |
| "rewards/margins": 1.9963154792785645, | |
| "rewards/rejected": -2.003605842590332, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.38429081467056153, | |
| "grad_norm": 3.313408374786377, | |
| "learning_rate": 0.00018922712602547517, | |
| "logits/chosen": -0.7976462244987488, | |
| "logits/rejected": -0.7998054623603821, | |
| "logps/chosen": -9.814254760742188, | |
| "logps/rejected": -36.34145736694336, | |
| "loss": 0.648523211479187, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.38048407435417175, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21935109794139862, | |
| "rewards/margins": 2.4820148944854736, | |
| "rewards/rejected": -2.2626638412475586, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.3868873742291464, | |
| "grad_norm": 4.517300128936768, | |
| "learning_rate": 0.00018903226318878698, | |
| "logits/chosen": -0.8082268238067627, | |
| "logits/rejected": -0.8085505962371826, | |
| "logps/chosen": -7.290218830108643, | |
| "logps/rejected": -28.533199310302734, | |
| "loss": 0.49404019117355347, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3020762801170349, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1652073860168457, | |
| "rewards/margins": 1.9900455474853516, | |
| "rewards/rejected": -1.8248380422592163, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.3894839337877313, | |
| "grad_norm": 23.563270568847656, | |
| "learning_rate": 0.00018883575593593791, | |
| "logits/chosen": -0.7831783294677734, | |
| "logits/rejected": -0.7918115854263306, | |
| "logps/chosen": -5.868438243865967, | |
| "logps/rejected": -36.0763053894043, | |
| "loss": 0.833998441696167, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5523523688316345, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07082141935825348, | |
| "rewards/margins": 2.5503041744232178, | |
| "rewards/rejected": -2.479482889175415, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.3920804933463161, | |
| "grad_norm": 2.2661221027374268, | |
| "learning_rate": 0.00018863760789639548, | |
| "logits/chosen": -0.8205257058143616, | |
| "logits/rejected": -0.8205671310424805, | |
| "logps/chosen": -8.58309268951416, | |
| "logps/rejected": -31.51813507080078, | |
| "loss": 0.5230035781860352, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34633222222328186, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2879600524902344, | |
| "rewards/margins": 2.3763887882232666, | |
| "rewards/rejected": -2.0884287357330322, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.394677052904901, | |
| "grad_norm": 3.6260762214660645, | |
| "learning_rate": 0.00018843782272993224, | |
| "logits/chosen": -0.7732735872268677, | |
| "logits/rejected": -0.7779878973960876, | |
| "logps/chosen": -7.900063514709473, | |
| "logps/rejected": -36.353912353515625, | |
| "loss": 1.1941097974777222, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.7860652208328247, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.1569097638130188, | |
| "rewards/margins": 2.229072093963623, | |
| "rewards/rejected": -2.385981798171997, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.39727361246348586, | |
| "grad_norm": 3.8922035694122314, | |
| "learning_rate": 0.00018823640412655844, | |
| "logits/chosen": -0.7862505316734314, | |
| "logits/rejected": -0.7926680445671082, | |
| "logps/chosen": -7.828291893005371, | |
| "logps/rejected": -39.66058349609375, | |
| "loss": 0.6880181431770325, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5066484808921814, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14748194813728333, | |
| "rewards/margins": 3.0227272510528564, | |
| "rewards/rejected": -2.8752455711364746, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.39987017202207076, | |
| "grad_norm": 7.4526047706604, | |
| "learning_rate": 0.00018803335580645358, | |
| "logits/chosen": -0.7698212265968323, | |
| "logits/rejected": -0.7689813375473022, | |
| "logps/chosen": -13.24219036102295, | |
| "logps/rejected": -25.66214942932129, | |
| "loss": 0.9967556595802307, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6198260188102722, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.07408954948186874, | |
| "rewards/margins": 1.6275382041931152, | |
| "rewards/rejected": -1.5534486770629883, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.40246673158065566, | |
| "grad_norm": 4.633146286010742, | |
| "learning_rate": 0.0001878286815198979, | |
| "logits/chosen": -0.7589452266693115, | |
| "logits/rejected": -0.7617721557617188, | |
| "logps/chosen": -7.7529802322387695, | |
| "logps/rejected": -27.287784576416016, | |
| "loss": 0.6172698140144348, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3214649558067322, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12731438875198364, | |
| "rewards/margins": 1.5837674140930176, | |
| "rewards/rejected": -1.4564530849456787, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.4050632911392405, | |
| "grad_norm": 3.162893772125244, | |
| "learning_rate": 0.0001876223850472032, | |
| "logits/chosen": -0.7637428045272827, | |
| "logits/rejected": -0.7626054286956787, | |
| "logps/chosen": -8.649560928344727, | |
| "logps/rejected": -27.37163543701172, | |
| "loss": 0.616457462310791, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3673415780067444, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23885931074619293, | |
| "rewards/margins": 1.9427287578582764, | |
| "rewards/rejected": -1.7038694620132446, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.4076598506978254, | |
| "grad_norm": 2.893603563308716, | |
| "learning_rate": 0.0001874144701986426, | |
| "logits/chosen": -0.7310610413551331, | |
| "logits/rejected": -0.7361200451850891, | |
| "logps/chosen": -6.76317024230957, | |
| "logps/rejected": -33.79893112182617, | |
| "loss": 0.4578598737716675, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24759513139724731, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.255088746547699, | |
| "rewards/margins": 2.5995802879333496, | |
| "rewards/rejected": -2.344491720199585, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.41025641025641024, | |
| "grad_norm": 2.6806418895721436, | |
| "learning_rate": 0.00018720494081438078, | |
| "logits/chosen": -0.7193287014961243, | |
| "logits/rejected": -0.7268579006195068, | |
| "logps/chosen": -6.555389404296875, | |
| "logps/rejected": -33.83311462402344, | |
| "loss": 0.5056754350662231, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2390821874141693, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.20247599482536316, | |
| "rewards/margins": 2.335620403289795, | |
| "rewards/rejected": -2.1331448554992676, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.41285296981499514, | |
| "grad_norm": 6.877208232879639, | |
| "learning_rate": 0.0001869938007644024, | |
| "logits/chosen": -0.774702787399292, | |
| "logits/rejected": -0.7733670473098755, | |
| "logps/chosen": -12.015567779541016, | |
| "logps/rejected": -39.611549377441406, | |
| "loss": 0.8152862191200256, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35584431886672974, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.06409724056720734, | |
| "rewards/margins": 2.519212007522583, | |
| "rewards/rejected": -2.5833089351654053, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.41544952937358, | |
| "grad_norm": 4.4329938888549805, | |
| "learning_rate": 0.00018678105394844113, | |
| "logits/chosen": -0.705638587474823, | |
| "logits/rejected": -0.7075241208076477, | |
| "logps/chosen": -8.828238487243652, | |
| "logps/rejected": -34.07341766357422, | |
| "loss": 0.7131232023239136, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.38522323966026306, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08116397261619568, | |
| "rewards/margins": 2.2081894874572754, | |
| "rewards/rejected": -2.1270253658294678, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.4180460889321649, | |
| "grad_norm": 3.8587117195129395, | |
| "learning_rate": 0.00018656670429590744, | |
| "logits/chosen": -0.7865703105926514, | |
| "logits/rejected": -0.7856872081756592, | |
| "logps/chosen": -7.486833572387695, | |
| "logps/rejected": -26.6343936920166, | |
| "loss": 0.6464986801147461, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.320234477519989, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1649102419614792, | |
| "rewards/margins": 1.9207243919372559, | |
| "rewards/rejected": -1.7558141946792603, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.4206426484907498, | |
| "grad_norm": 5.098015308380127, | |
| "learning_rate": 0.00018635075576581587, | |
| "logits/chosen": -0.815811276435852, | |
| "logits/rejected": -0.8179509043693542, | |
| "logps/chosen": -8.045232772827148, | |
| "logps/rejected": -26.606388092041016, | |
| "loss": 0.6883640289306641, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3271428346633911, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.21010762453079224, | |
| "rewards/margins": 1.64859139919281, | |
| "rewards/rejected": -1.438483715057373, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.4232392080493346, | |
| "grad_norm": 5.79577112197876, | |
| "learning_rate": 0.0001861332123467122, | |
| "logits/chosen": -0.7825253009796143, | |
| "logits/rejected": -0.7867128252983093, | |
| "logps/chosen": -7.512404441833496, | |
| "logps/rejected": -33.15559387207031, | |
| "loss": 0.4946397542953491, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26739412546157837, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2013475000858307, | |
| "rewards/margins": 2.0465731620788574, | |
| "rewards/rejected": -1.84522545337677, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.4258357676079195, | |
| "grad_norm": 3.521145820617676, | |
| "learning_rate": 0.0001859140780565996, | |
| "logits/chosen": -0.7922295331954956, | |
| "logits/rejected": -0.7915840148925781, | |
| "logps/chosen": -8.717174530029297, | |
| "logps/rejected": -24.929059982299805, | |
| "loss": 0.6819888949394226, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4021107256412506, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1168108582496643, | |
| "rewards/margins": 1.8219399452209473, | |
| "rewards/rejected": -1.7051292657852173, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.42843232716650437, | |
| "grad_norm": 17.069190979003906, | |
| "learning_rate": 0.0001856933569428644, | |
| "logits/chosen": -0.7880842089653015, | |
| "logits/rejected": -0.7944654822349548, | |
| "logps/chosen": -10.384450912475586, | |
| "logps/rejected": -25.57999610900879, | |
| "loss": 1.0119094848632812, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6152634024620056, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.14946657419204712, | |
| "rewards/margins": 1.2663317918777466, | |
| "rewards/rejected": -1.1168652772903442, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.43102888672508927, | |
| "grad_norm": 3.2614221572875977, | |
| "learning_rate": 0.0001854710530822014, | |
| "logits/chosen": -0.7307618856430054, | |
| "logits/rejected": -0.7359931468963623, | |
| "logps/chosen": -6.218672752380371, | |
| "logps/rejected": -25.049577713012695, | |
| "loss": 0.6519892811775208, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.363025426864624, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21699494123458862, | |
| "rewards/margins": 1.6366937160491943, | |
| "rewards/rejected": -1.4196988344192505, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.4336254462836741, | |
| "grad_norm": 3.8368124961853027, | |
| "learning_rate": 0.00018524717058053866, | |
| "logits/chosen": -0.741214394569397, | |
| "logits/rejected": -0.7512940764427185, | |
| "logps/chosen": -6.5773725509643555, | |
| "logps/rejected": -29.348596572875977, | |
| "loss": 0.8446623682975769, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5003358721733093, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.029447460547089577, | |
| "rewards/margins": 1.5836502313613892, | |
| "rewards/rejected": -1.554202914237976, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.436222005842259, | |
| "grad_norm": 1.9537255764007568, | |
| "learning_rate": 0.00018502171357296144, | |
| "logits/chosen": -0.7404088377952576, | |
| "logits/rejected": -0.7386180758476257, | |
| "logps/chosen": -8.013400077819824, | |
| "logps/rejected": -28.649869918823242, | |
| "loss": 0.5149758458137512, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32292458415031433, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2221800982952118, | |
| "rewards/margins": 1.952845811843872, | |
| "rewards/rejected": -1.730665683746338, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.4388185654008439, | |
| "grad_norm": 3.6709702014923096, | |
| "learning_rate": 0.000184794686223636, | |
| "logits/chosen": -0.7925949096679688, | |
| "logits/rejected": -0.7922758460044861, | |
| "logps/chosen": -8.695777893066406, | |
| "logps/rejected": -24.725303649902344, | |
| "loss": 0.5783385634422302, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30575335025787354, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.208786278963089, | |
| "rewards/margins": 1.6382977962493896, | |
| "rewards/rejected": -1.429511308670044, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.44141512495942875, | |
| "grad_norm": 6.263500690460205, | |
| "learning_rate": 0.00018456609272573266, | |
| "logits/chosen": -0.7436801791191101, | |
| "logits/rejected": -0.7518426179885864, | |
| "logps/chosen": -5.066699981689453, | |
| "logps/rejected": -31.86433982849121, | |
| "loss": 0.5026156306266785, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3272435665130615, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1566862165927887, | |
| "rewards/margins": 2.2096331119537354, | |
| "rewards/rejected": -2.0529470443725586, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.44401168451801365, | |
| "grad_norm": 2.6846933364868164, | |
| "learning_rate": 0.00018433593730134831, | |
| "logits/chosen": -0.8177323937416077, | |
| "logits/rejected": -0.8159899711608887, | |
| "logps/chosen": -10.043192863464355, | |
| "logps/rejected": -36.874168395996094, | |
| "loss": 0.5169069766998291, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.280762255191803, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.15715357661247253, | |
| "rewards/margins": 2.441157341003418, | |
| "rewards/rejected": -2.284003973007202, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.4466082440765985, | |
| "grad_norm": 3.354492664337158, | |
| "learning_rate": 0.0001841042242014285, | |
| "logits/chosen": -0.7943728566169739, | |
| "logits/rejected": -0.8022831082344055, | |
| "logps/chosen": -4.931389808654785, | |
| "logps/rejected": -46.30964279174805, | |
| "loss": 0.3581126630306244, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17072941362857819, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2874028980731964, | |
| "rewards/margins": 3.4458858966827393, | |
| "rewards/rejected": -3.1584832668304443, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.4492048036351834, | |
| "grad_norm": 2.2436320781707764, | |
| "learning_rate": 0.00018387095770568877, | |
| "logits/chosen": -0.8137360215187073, | |
| "logits/rejected": -0.8178499937057495, | |
| "logps/chosen": -8.257625579833984, | |
| "logps/rejected": -41.017391204833984, | |
| "loss": 0.5087756514549255, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34518077969551086, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.40273773670196533, | |
| "rewards/margins": 3.349743127822876, | |
| "rewards/rejected": -2.9470055103302, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.45180136319376824, | |
| "grad_norm": 3.1421475410461426, | |
| "learning_rate": 0.00018363614212253584, | |
| "logits/chosen": -0.8107144236564636, | |
| "logits/rejected": -0.8169907331466675, | |
| "logps/chosen": -6.6368021965026855, | |
| "logps/rejected": -47.06969451904297, | |
| "loss": 0.4038211703300476, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22018837928771973, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21348311007022858, | |
| "rewards/margins": 3.67350697517395, | |
| "rewards/rejected": -3.4600236415863037, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.45439792275235313, | |
| "grad_norm": 4.707547664642334, | |
| "learning_rate": 0.0001833997817889878, | |
| "logits/chosen": -0.7821629047393799, | |
| "logits/rejected": -0.7885245084762573, | |
| "logps/chosen": -6.257838249206543, | |
| "logps/rejected": -47.79384231567383, | |
| "loss": 0.43321770429611206, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3060261607170105, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2357151210308075, | |
| "rewards/margins": 3.7243151664733887, | |
| "rewards/rejected": -3.4885997772216797, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.45699448231093803, | |
| "grad_norm": 6.834311008453369, | |
| "learning_rate": 0.00018316188107059419, | |
| "logits/chosen": -0.8164551854133606, | |
| "logits/rejected": -0.8227632641792297, | |
| "logps/chosen": -8.357691764831543, | |
| "logps/rejected": -53.20665740966797, | |
| "loss": 0.5088233351707458, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34228751063346863, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1479293704032898, | |
| "rewards/margins": 4.200577735900879, | |
| "rewards/rejected": -4.052648544311523, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.4595910418695229, | |
| "grad_norm": 1.9933769702911377, | |
| "learning_rate": 0.00018292244436135516, | |
| "logits/chosen": -0.8226829767227173, | |
| "logits/rejected": -0.8278478384017944, | |
| "logps/chosen": -8.886636734008789, | |
| "logps/rejected": -43.808494567871094, | |
| "loss": 0.4773145914077759, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2843259274959564, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21271556615829468, | |
| "rewards/margins": 3.3535256385803223, | |
| "rewards/rejected": -3.140810489654541, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.4621876014281078, | |
| "grad_norm": 2.1277883052825928, | |
| "learning_rate": 0.00018268147608364066, | |
| "logits/chosen": -0.8168373107910156, | |
| "logits/rejected": -0.8192884922027588, | |
| "logps/chosen": -10.113336563110352, | |
| "logps/rejected": -44.43722152709961, | |
| "loss": 0.47269877791404724, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33138713240623474, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.20839698612689972, | |
| "rewards/margins": 3.481367349624634, | |
| "rewards/rejected": -3.272970199584961, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.4647841609866926, | |
| "grad_norm": 3.652038335800171, | |
| "learning_rate": 0.00018243898068810835, | |
| "logits/chosen": -0.8304356932640076, | |
| "logits/rejected": -0.8354857563972473, | |
| "logps/chosen": -7.381147384643555, | |
| "logps/rejected": -37.62067794799805, | |
| "loss": 0.598408579826355, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.41189002990722656, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.20993797481060028, | |
| "rewards/margins": 2.9361226558685303, | |
| "rewards/rejected": -2.726184844970703, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.4673807205452775, | |
| "grad_norm": 5.588886737823486, | |
| "learning_rate": 0.00018219496265362164, | |
| "logits/chosen": -0.7966144680976868, | |
| "logits/rejected": -0.7976107597351074, | |
| "logps/chosen": -5.64756441116333, | |
| "logps/rejected": -41.18315124511719, | |
| "loss": 0.4210509657859802, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3009505271911621, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2384023666381836, | |
| "rewards/margins": 3.277693033218384, | |
| "rewards/rejected": -3.0392909049987793, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.46997728010386236, | |
| "grad_norm": 3.0966458320617676, | |
| "learning_rate": 0.00018194942648716697, | |
| "logits/chosen": -0.8336725234985352, | |
| "logits/rejected": -0.8417295813560486, | |
| "logps/chosen": -6.757675647735596, | |
| "logps/rejected": -42.556461334228516, | |
| "loss": 0.46501806378364563, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27556124329566956, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1294286698102951, | |
| "rewards/margins": 3.264049530029297, | |
| "rewards/rejected": -3.1346213817596436, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.47257383966244726, | |
| "grad_norm": 1.5267800092697144, | |
| "learning_rate": 0.00018170237672377043, | |
| "logits/chosen": -0.8151792883872986, | |
| "logits/rejected": -0.8204985857009888, | |
| "logps/chosen": -6.037264347076416, | |
| "logps/rejected": -40.91991424560547, | |
| "loss": 0.30481547117233276, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22177544236183167, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.28671082854270935, | |
| "rewards/margins": 3.2523105144500732, | |
| "rewards/rejected": -2.965599775314331, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.47517039922103216, | |
| "grad_norm": 5.700167655944824, | |
| "learning_rate": 0.0001814538179264142, | |
| "logits/chosen": -0.8828625082969666, | |
| "logits/rejected": -0.8847114443778992, | |
| "logps/chosen": -11.471461296081543, | |
| "logps/rejected": -36.56057357788086, | |
| "loss": 0.9585452675819397, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6207931041717529, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.10233151167631149, | |
| "rewards/margins": 2.520526885986328, | |
| "rewards/rejected": -2.4181957244873047, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.477766958779617, | |
| "grad_norm": 4.820940971374512, | |
| "learning_rate": 0.00018120375468595198, | |
| "logits/chosen": -0.8398681282997131, | |
| "logits/rejected": -0.843747615814209, | |
| "logps/chosen": -9.928145408630371, | |
| "logps/rejected": -35.531009674072266, | |
| "loss": 0.7689952254295349, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5200174450874329, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15448038280010223, | |
| "rewards/margins": 2.677025318145752, | |
| "rewards/rejected": -2.522545099258423, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.4803635183382019, | |
| "grad_norm": 2.308289051055908, | |
| "learning_rate": 0.00018095219162102453, | |
| "logits/chosen": -0.8587791919708252, | |
| "logits/rejected": -0.8568933606147766, | |
| "logps/chosen": -6.138177394866943, | |
| "logps/rejected": -36.87736129760742, | |
| "loss": 0.5506963133811951, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35889768600463867, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09419973194599152, | |
| "rewards/margins": 2.7206168174743652, | |
| "rewards/rejected": -2.6264166831970215, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.48296007789678674, | |
| "grad_norm": 3.0462734699249268, | |
| "learning_rate": 0.00018069913337797412, | |
| "logits/chosen": -0.82170170545578, | |
| "logits/rejected": -0.8261471390724182, | |
| "logps/chosen": -9.066842079162598, | |
| "logps/rejected": -47.4820671081543, | |
| "loss": 0.6803156137466431, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.46885693073272705, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.17911966145038605, | |
| "rewards/margins": 3.736632823944092, | |
| "rewards/rejected": -3.5575132369995117, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.48555663745537164, | |
| "grad_norm": 12.903093338012695, | |
| "learning_rate": 0.0001804445846307588, | |
| "logits/chosen": -0.8383846879005432, | |
| "logits/rejected": -0.8428988456726074, | |
| "logps/chosen": -13.801538467407227, | |
| "logps/rejected": -41.331783294677734, | |
| "loss": 1.4305500984191895, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 1.0338698625564575, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.2808900773525238, | |
| "rewards/margins": 2.8232994079589844, | |
| "rewards/rejected": -3.104188919067383, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.4881531970139565, | |
| "grad_norm": 1.0728437900543213, | |
| "learning_rate": 0.0001801885500808661, | |
| "logits/chosen": -0.7999005317687988, | |
| "logits/rejected": -0.8075475096702576, | |
| "logps/chosen": -6.161966323852539, | |
| "logps/rejected": -52.183937072753906, | |
| "loss": 0.32457199692726135, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26306816935539246, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30446696281433105, | |
| "rewards/margins": 4.325974464416504, | |
| "rewards/rejected": -4.0215067863464355, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.4907497565725414, | |
| "grad_norm": 2.3573195934295654, | |
| "learning_rate": 0.00017993103445722614, | |
| "logits/chosen": -0.8147333860397339, | |
| "logits/rejected": -0.8255075216293335, | |
| "logps/chosen": -5.808372497558594, | |
| "logps/rejected": -48.91783142089844, | |
| "loss": 0.39948803186416626, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22272005677223206, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18873995542526245, | |
| "rewards/margins": 3.7226080894470215, | |
| "rewards/rejected": -3.533867835998535, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.4933463161311263, | |
| "grad_norm": 2.2260046005249023, | |
| "learning_rate": 0.00017967204251612433, | |
| "logits/chosen": -0.7621344923973083, | |
| "logits/rejected": -0.7712112069129944, | |
| "logps/chosen": -5.210122108459473, | |
| "logps/rejected": -57.8108024597168, | |
| "loss": 0.4442843496799469, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2754063904285431, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19802872836589813, | |
| "rewards/margins": 4.561690807342529, | |
| "rewards/rejected": -4.363662242889404, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.4959428756897111, | |
| "grad_norm": 5.498357772827148, | |
| "learning_rate": 0.00017941157904111346, | |
| "logits/chosen": -0.7840267419815063, | |
| "logits/rejected": -0.7963895797729492, | |
| "logps/chosen": -6.320296764373779, | |
| "logps/rejected": -63.66170120239258, | |
| "loss": 0.4151027798652649, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2456730306148529, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1802489459514618, | |
| "rewards/margins": 5.30258846282959, | |
| "rewards/rejected": -5.122340202331543, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.498539435248296, | |
| "grad_norm": 2.877337694168091, | |
| "learning_rate": 0.00017914964884292544, | |
| "logits/chosen": -0.8350490927696228, | |
| "logits/rejected": -0.8606675863265991, | |
| "logps/chosen": -8.253477096557617, | |
| "logps/rejected": -83.04051971435547, | |
| "loss": 0.4113784730434418, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2746655344963074, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2550317049026489, | |
| "rewards/margins": 6.853097438812256, | |
| "rewards/rejected": -6.598065376281738, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.5011359948068809, | |
| "grad_norm": 9.82312297821045, | |
| "learning_rate": 0.00017888625675938235, | |
| "logits/chosen": -0.8031945824623108, | |
| "logits/rejected": -0.814129650592804, | |
| "logps/chosen": -7.723809719085693, | |
| "logps/rejected": -71.692626953125, | |
| "loss": 0.5333746671676636, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2982180714607239, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.03098137304186821, | |
| "rewards/margins": 5.821050643920898, | |
| "rewards/rejected": -5.85203218460083, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.5037325543654657, | |
| "grad_norm": 1.5864787101745605, | |
| "learning_rate": 0.00017862140765530717, | |
| "logits/chosen": -0.7884975671768188, | |
| "logits/rejected": -0.8070309162139893, | |
| "logps/chosen": -6.657387733459473, | |
| "logps/rejected": -88.2061538696289, | |
| "loss": 0.3408563733100891, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23068124055862427, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25283610820770264, | |
| "rewards/margins": 7.557528972625732, | |
| "rewards/rejected": -7.304693222045898, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.5063291139240507, | |
| "grad_norm": 2.8981215953826904, | |
| "learning_rate": 0.0001783551064224339, | |
| "logits/chosen": -0.8138140439987183, | |
| "logits/rejected": -0.8286132216453552, | |
| "logps/chosen": -5.021820545196533, | |
| "logps/rejected": -76.1704330444336, | |
| "loss": 0.43742382526397705, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2779857814311981, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.15874776244163513, | |
| "rewards/margins": 6.478954792022705, | |
| "rewards/rejected": -6.320207118988037, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.5089256734826355, | |
| "grad_norm": 3.9564876556396484, | |
| "learning_rate": 0.00017808735797931715, | |
| "logits/chosen": -0.8671743869781494, | |
| "logits/rejected": -0.8750807046890259, | |
| "logps/chosen": -7.3802947998046875, | |
| "logps/rejected": -63.22589874267578, | |
| "loss": 0.5510232448577881, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3880046606063843, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3043110966682434, | |
| "rewards/margins": 5.6318769454956055, | |
| "rewards/rejected": -5.327565670013428, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.5115222330412204, | |
| "grad_norm": 7.476530075073242, | |
| "learning_rate": 0.0001778181672712414, | |
| "logits/chosen": -0.8401522636413574, | |
| "logits/rejected": -0.8446535468101501, | |
| "logps/chosen": -10.472354888916016, | |
| "logps/rejected": -55.56855010986328, | |
| "loss": 0.5609198212623596, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4021284878253937, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.33400610089302063, | |
| "rewards/margins": 4.6901750564575195, | |
| "rewards/rejected": -4.356168746948242, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.5141187925998053, | |
| "grad_norm": 1.5591124296188354, | |
| "learning_rate": 0.00017754753927012954, | |
| "logits/chosen": -0.881521463394165, | |
| "logits/rejected": -0.8908553123474121, | |
| "logps/chosen": -7.769586086273193, | |
| "logps/rejected": -70.43656158447266, | |
| "loss": 0.40073180198669434, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2971632182598114, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.23546172678470612, | |
| "rewards/margins": 6.18820858001709, | |
| "rewards/rejected": -5.952746868133545, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.5167153521583902, | |
| "grad_norm": 3.914903163909912, | |
| "learning_rate": 0.00017727547897445118, | |
| "logits/chosen": -0.8886235952377319, | |
| "logits/rejected": -0.8989691138267517, | |
| "logps/chosen": -4.683451175689697, | |
| "logps/rejected": -60.072357177734375, | |
| "loss": 0.3925155997276306, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2971319854259491, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33483725786209106, | |
| "rewards/margins": 5.336654186248779, | |
| "rewards/rejected": -5.001816749572754, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.519311911716975, | |
| "grad_norm": 10.00102424621582, | |
| "learning_rate": 0.00017700199140913017, | |
| "logits/chosen": -0.9024062752723694, | |
| "logits/rejected": -0.8995949029922485, | |
| "logps/chosen": -13.132458686828613, | |
| "logps/rejected": -58.003902435302734, | |
| "loss": 0.9102693200111389, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6192734241485596, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.10886114090681076, | |
| "rewards/margins": 4.763448238372803, | |
| "rewards/rejected": -4.872309684753418, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.5219084712755598, | |
| "grad_norm": 12.833686828613281, | |
| "learning_rate": 0.000176727081625452, | |
| "logits/chosen": -0.8882104158401489, | |
| "logits/rejected": -0.9030141830444336, | |
| "logps/chosen": -7.329769134521484, | |
| "logps/rejected": -84.83427429199219, | |
| "loss": 0.6302378177642822, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4732781648635864, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08130178600549698, | |
| "rewards/margins": 7.068781852722168, | |
| "rewards/rejected": -6.987480640411377, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5245050308341448, | |
| "grad_norm": 27.52665138244629, | |
| "learning_rate": 0.00017645075470097024, | |
| "logits/chosen": -0.9375100135803223, | |
| "logits/rejected": -0.9529730677604675, | |
| "logps/chosen": -6.13963508605957, | |
| "logps/rejected": -66.99122619628906, | |
| "loss": 0.5372448563575745, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.37428009510040283, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11455152183771133, | |
| "rewards/margins": 5.315877914428711, | |
| "rewards/rejected": -5.2013258934021, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5271015903927296, | |
| "grad_norm": 2.7620508670806885, | |
| "learning_rate": 0.00017617301573941296, | |
| "logits/chosen": -0.8983043432235718, | |
| "logits/rejected": -0.8981289863586426, | |
| "logps/chosen": -11.069366455078125, | |
| "logps/rejected": -39.12937927246094, | |
| "loss": 0.6441234350204468, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4368978440761566, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21257682144641876, | |
| "rewards/margins": 3.110691785812378, | |
| "rewards/rejected": -2.8981149196624756, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5296981499513145, | |
| "grad_norm": 12.48902702331543, | |
| "learning_rate": 0.0001758938698705884, | |
| "logits/chosen": -0.8725972771644592, | |
| "logits/rejected": -0.8844687342643738, | |
| "logps/chosen": -8.939924240112305, | |
| "logps/rejected": -76.01535034179688, | |
| "loss": 0.7113180756568909, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39448532462120056, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13535423576831818, | |
| "rewards/margins": 6.58955192565918, | |
| "rewards/rejected": -6.454197883605957, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5322947095098994, | |
| "grad_norm": 5.789051055908203, | |
| "learning_rate": 0.0001756133222502902, | |
| "logits/chosen": -0.835827648639679, | |
| "logits/rejected": -0.848646342754364, | |
| "logps/chosen": -10.195419311523438, | |
| "logps/rejected": -72.34866333007812, | |
| "loss": 0.46852654218673706, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31231871247291565, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.03889274597167969, | |
| "rewards/margins": 5.886906147003174, | |
| "rewards/rejected": -5.925798416137695, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5348912690684843, | |
| "grad_norm": 11.01954174041748, | |
| "learning_rate": 0.00017533137806020226, | |
| "logits/chosen": -0.8194984197616577, | |
| "logits/rejected": -0.8232303261756897, | |
| "logps/chosen": -8.20671272277832, | |
| "logps/rejected": -57.72869873046875, | |
| "loss": 0.5476050972938538, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3084986209869385, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.09075944125652313, | |
| "rewards/margins": 4.59151554107666, | |
| "rewards/rejected": -4.50075626373291, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5374878286270691, | |
| "grad_norm": 4.141697406768799, | |
| "learning_rate": 0.0001750480425078029, | |
| "logits/chosen": -0.7913045287132263, | |
| "logits/rejected": -0.7959045171737671, | |
| "logps/chosen": -8.45845890045166, | |
| "logps/rejected": -47.05601501464844, | |
| "loss": 0.44736987352371216, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.28352388739585876, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23959283530712128, | |
| "rewards/margins": 3.8303611278533936, | |
| "rewards/rejected": -3.5907678604125977, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.540084388185654, | |
| "grad_norm": 3.359447717666626, | |
| "learning_rate": 0.00017476332082626877, | |
| "logits/chosen": -0.7912741899490356, | |
| "logits/rejected": -0.796455979347229, | |
| "logps/chosen": -5.394259452819824, | |
| "logps/rejected": -45.25196075439453, | |
| "loss": 0.36434927582740784, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24980391561985016, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2328459620475769, | |
| "rewards/margins": 3.577873945236206, | |
| "rewards/rejected": -3.3450279235839844, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.5426809477442389, | |
| "grad_norm": 3.0909605026245117, | |
| "learning_rate": 0.0001744772182743782, | |
| "logits/chosen": -0.7767283916473389, | |
| "logits/rejected": -0.7861429452896118, | |
| "logps/chosen": -6.036921501159668, | |
| "logps/rejected": -43.4775390625, | |
| "loss": 0.42594030499458313, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2773384153842926, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3111240863800049, | |
| "rewards/margins": 3.5763254165649414, | |
| "rewards/rejected": -3.2652013301849365, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.5452775073028238, | |
| "grad_norm": 2.5949363708496094, | |
| "learning_rate": 0.000174189740136414, | |
| "logits/chosen": -0.7519343495368958, | |
| "logits/rejected": -0.758810818195343, | |
| "logps/chosen": -6.644616603851318, | |
| "logps/rejected": -38.87832260131836, | |
| "loss": 0.4237949848175049, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26098260283470154, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27363157272338867, | |
| "rewards/margins": 3.0662317276000977, | |
| "rewards/rejected": -2.792600393295288, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.5478740668614086, | |
| "grad_norm": 1.992567777633667, | |
| "learning_rate": 0.00017390089172206592, | |
| "logits/chosen": -0.7961949706077576, | |
| "logits/rejected": -0.7975110411643982, | |
| "logps/chosen": -5.077378749847412, | |
| "logps/rejected": -37.03203201293945, | |
| "loss": 0.37955719232559204, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23032808303833008, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16159504652023315, | |
| "rewards/margins": 2.815537929534912, | |
| "rewards/rejected": -2.653942584991455, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.5504706264199936, | |
| "grad_norm": 1.784830093383789, | |
| "learning_rate": 0.0001736106783663326, | |
| "logits/chosen": -0.7778050899505615, | |
| "logits/rejected": -0.7829293012619019, | |
| "logps/chosen": -6.269719123840332, | |
| "logps/rejected": -39.09969711303711, | |
| "loss": 0.6080423593521118, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3602517247200012, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16860854625701904, | |
| "rewards/margins": 2.596688747406006, | |
| "rewards/rejected": -2.4280805587768555, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.5530671859785784, | |
| "grad_norm": 3.7514870166778564, | |
| "learning_rate": 0.000173319105429423, | |
| "logits/chosen": -0.7780061364173889, | |
| "logits/rejected": -0.7814825773239136, | |
| "logps/chosen": -9.701554298400879, | |
| "logps/rejected": -42.14776611328125, | |
| "loss": 0.5809894800186157, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4458245038986206, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22117674350738525, | |
| "rewards/margins": 3.311382532119751, | |
| "rewards/rejected": -3.090205669403076, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.5556637455371632, | |
| "grad_norm": 1.574320912361145, | |
| "learning_rate": 0.00017302617829665723, | |
| "logits/chosen": -0.7605854272842407, | |
| "logits/rejected": -0.7681394219398499, | |
| "logps/chosen": -7.890401840209961, | |
| "logps/rejected": -43.07416534423828, | |
| "loss": 0.46951717138290405, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3557964861392975, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2927654981613159, | |
| "rewards/margins": 3.377017021179199, | |
| "rewards/rejected": -3.084251880645752, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5582603050957481, | |
| "grad_norm": 3.259098529815674, | |
| "learning_rate": 0.00017273190237836756, | |
| "logits/chosen": -0.8040423393249512, | |
| "logits/rejected": -0.812609076499939, | |
| "logps/chosen": -8.544995307922363, | |
| "logps/rejected": -43.30592346191406, | |
| "loss": 0.39441177248954773, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3016667366027832, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24430298805236816, | |
| "rewards/margins": 3.4823904037475586, | |
| "rewards/rejected": -3.2380871772766113, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.560856864654333, | |
| "grad_norm": 10.052566528320312, | |
| "learning_rate": 0.0001724362831097979, | |
| "logits/chosen": -0.8765899538993835, | |
| "logits/rejected": -0.8773387670516968, | |
| "logps/chosen": -9.490972518920898, | |
| "logps/rejected": -41.05526351928711, | |
| "loss": 0.8065330982208252, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5094266533851624, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13303275406360626, | |
| "rewards/margins": 3.132627010345459, | |
| "rewards/rejected": -2.999594211578369, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5634534242129179, | |
| "grad_norm": 2.0193867683410645, | |
| "learning_rate": 0.00017213932595100384, | |
| "logits/chosen": -0.839668869972229, | |
| "logits/rejected": -0.8433064222335815, | |
| "logps/chosen": -8.96350383758545, | |
| "logps/rejected": -43.15342330932617, | |
| "loss": 0.5949581861495972, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4349959194660187, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.156009703874588, | |
| "rewards/margins": 3.079315662384033, | |
| "rewards/rejected": -2.9233059883117676, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5660499837715027, | |
| "grad_norm": 7.255380153656006, | |
| "learning_rate": 0.00017184103638675157, | |
| "logits/chosen": -0.8508449792861938, | |
| "logits/rejected": -0.8561905026435852, | |
| "logps/chosen": -13.53388786315918, | |
| "logps/rejected": -47.0406608581543, | |
| "loss": 0.739139974117279, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4106239676475525, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.030060507357120514, | |
| "rewards/margins": 3.0796077251434326, | |
| "rewards/rejected": -3.109668254852295, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5686465433300877, | |
| "grad_norm": 2.1521670818328857, | |
| "learning_rate": 0.0001715414199264168, | |
| "logits/chosen": -0.8377723693847656, | |
| "logits/rejected": -0.8416836857795715, | |
| "logps/chosen": -11.449177742004395, | |
| "logps/rejected": -51.93082046508789, | |
| "loss": 0.5678492784500122, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4639051854610443, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.4290061891078949, | |
| "rewards/margins": 4.352783203125, | |
| "rewards/rejected": -3.923776865005493, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5712431028886725, | |
| "grad_norm": 5.820508003234863, | |
| "learning_rate": 0.00017124048210388266, | |
| "logits/chosen": -0.8189604878425598, | |
| "logits/rejected": -0.8287642002105713, | |
| "logps/chosen": -7.280913352966309, | |
| "logps/rejected": -58.91409683227539, | |
| "loss": 0.3058544397354126, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19983381032943726, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12054422497749329, | |
| "rewards/margins": 4.547727108001709, | |
| "rewards/rejected": -4.427183628082275, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.5738396624472574, | |
| "grad_norm": 1.530921220779419, | |
| "learning_rate": 0.0001709382284774379, | |
| "logits/chosen": -0.8419314622879028, | |
| "logits/rejected": -0.8482197523117065, | |
| "logps/chosen": -10.496171951293945, | |
| "logps/rejected": -49.721099853515625, | |
| "loss": 0.4132998585700989, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3439655900001526, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18015247583389282, | |
| "rewards/margins": 3.97615122795105, | |
| "rewards/rejected": -3.7959985733032227, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5764362220058422, | |
| "grad_norm": 1.9025592803955078, | |
| "learning_rate": 0.00017063466462967388, | |
| "logits/chosen": -0.8564705848693848, | |
| "logits/rejected": -0.8616027235984802, | |
| "logps/chosen": -7.931392669677734, | |
| "logps/rejected": -49.22194290161133, | |
| "loss": 0.610306978225708, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4569806456565857, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22110262513160706, | |
| "rewards/margins": 4.034682750701904, | |
| "rewards/rejected": -3.81358003616333, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5790327815644272, | |
| "grad_norm": 3.6240224838256836, | |
| "learning_rate": 0.00017032979616738169, | |
| "logits/chosen": -0.8264967203140259, | |
| "logits/rejected": -0.8325719833374023, | |
| "logps/chosen": -6.653590202331543, | |
| "logps/rejected": -59.540992736816406, | |
| "loss": 0.49167004227638245, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.402230829000473, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1619190275669098, | |
| "rewards/margins": 4.9636969566345215, | |
| "rewards/rejected": -4.8017778396606445, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.581629341123012, | |
| "grad_norm": 26.20123291015625, | |
| "learning_rate": 0.00017002362872144843, | |
| "logits/chosen": -0.84416663646698, | |
| "logits/rejected": -0.8446400761604309, | |
| "logps/chosen": -7.779309272766113, | |
| "logps/rejected": -48.635101318359375, | |
| "loss": 0.4477548599243164, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31716760993003845, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12198957055807114, | |
| "rewards/margins": 3.744682788848877, | |
| "rewards/rejected": -3.622692823410034, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5842259006815969, | |
| "grad_norm": 3.45158052444458, | |
| "learning_rate": 0.0001697161679467534, | |
| "logits/chosen": -0.8399550914764404, | |
| "logits/rejected": -0.8448391556739807, | |
| "logps/chosen": -8.095958709716797, | |
| "logps/rejected": -57.113128662109375, | |
| "loss": 0.4480040967464447, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3591548800468445, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.097431480884552, | |
| "rewards/margins": 4.470404624938965, | |
| "rewards/rejected": -4.372973442077637, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5868224602401818, | |
| "grad_norm": 9.01218318939209, | |
| "learning_rate": 0.0001694074195220634, | |
| "logits/chosen": -0.8154175281524658, | |
| "logits/rejected": -0.8212026357650757, | |
| "logps/chosen": -9.016716957092285, | |
| "logps/rejected": -48.810791015625, | |
| "loss": 0.6711245179176331, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4295364022254944, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1990734040737152, | |
| "rewards/margins": 3.8862059116363525, | |
| "rewards/rejected": -3.6871328353881836, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5894190197987667, | |
| "grad_norm": 5.020142078399658, | |
| "learning_rate": 0.00016909738914992813, | |
| "logits/chosen": -0.7923344969749451, | |
| "logits/rejected": -0.7923219203948975, | |
| "logps/chosen": -10.089529037475586, | |
| "logps/rejected": -45.86975860595703, | |
| "loss": 0.6674864888191223, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.47657352685928345, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.04541245102882385, | |
| "rewards/margins": 3.1376214027404785, | |
| "rewards/rejected": -3.0922091007232666, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5920155793573515, | |
| "grad_norm": 3.975611925125122, | |
| "learning_rate": 0.00016878608255657457, | |
| "logits/chosen": -0.7756553292274475, | |
| "logits/rejected": -0.7805052399635315, | |
| "logps/chosen": -6.576499938964844, | |
| "logps/rejected": -48.288204193115234, | |
| "loss": 0.36480942368507385, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24316585063934326, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21090297400951385, | |
| "rewards/margins": 3.6886119842529297, | |
| "rewards/rejected": -3.4777092933654785, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.5946121389159363, | |
| "grad_norm": 3.324848175048828, | |
| "learning_rate": 0.00016847350549180148, | |
| "logits/chosen": -0.7683195471763611, | |
| "logits/rejected": -0.7729092836380005, | |
| "logps/chosen": -5.581432819366455, | |
| "logps/rejected": -42.25553894042969, | |
| "loss": 0.5814209580421448, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33762359619140625, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08220689743757248, | |
| "rewards/margins": 3.051085948944092, | |
| "rewards/rejected": -2.968878984451294, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.5972086984745213, | |
| "grad_norm": 1.8596134185791016, | |
| "learning_rate": 0.00016815966372887305, | |
| "logits/chosen": -0.7532698512077332, | |
| "logits/rejected": -0.7569671273231506, | |
| "logps/chosen": -6.81831169128418, | |
| "logps/rejected": -32.88819885253906, | |
| "loss": 0.4662015438079834, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31704533100128174, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3468167185783386, | |
| "rewards/margins": 2.541092872619629, | |
| "rewards/rejected": -2.1942760944366455, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.5998052580331061, | |
| "grad_norm": 9.191289901733398, | |
| "learning_rate": 0.00016784456306441234, | |
| "logits/chosen": -0.7527615427970886, | |
| "logits/rejected": -0.7603521347045898, | |
| "logps/chosen": -8.545462608337402, | |
| "logps/rejected": -34.113487243652344, | |
| "loss": 0.6046890020370483, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35081756114959717, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.12367656826972961, | |
| "rewards/margins": 2.2450129985809326, | |
| "rewards/rejected": -2.1213364601135254, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.602401817591691, | |
| "grad_norm": 2.0885210037231445, | |
| "learning_rate": 0.0001675282093182941, | |
| "logits/chosen": -0.7435917854309082, | |
| "logits/rejected": -0.7469019889831543, | |
| "logps/chosen": -9.624258041381836, | |
| "logps/rejected": -38.40724563598633, | |
| "loss": 0.6471220850944519, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44592684507369995, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2652357518672943, | |
| "rewards/margins": 2.823615312576294, | |
| "rewards/rejected": -2.558379650115967, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.6049983771502759, | |
| "grad_norm": 4.651163101196289, | |
| "learning_rate": 0.0001672106083335374, | |
| "logits/chosen": -0.7706339955329895, | |
| "logits/rejected": -0.7752231955528259, | |
| "logps/chosen": -9.609830856323242, | |
| "logps/rejected": -36.36707305908203, | |
| "loss": 0.7082432508468628, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4555765986442566, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22910386323928833, | |
| "rewards/margins": 2.703925609588623, | |
| "rewards/rejected": -2.4748215675354004, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.6075949367088608, | |
| "grad_norm": 12.39693832397461, | |
| "learning_rate": 0.00016689176597619774, | |
| "logits/chosen": -0.7196263074874878, | |
| "logits/rejected": -0.7302131652832031, | |
| "logps/chosen": -7.361204624176025, | |
| "logps/rejected": -40.15000534057617, | |
| "loss": 0.7524147033691406, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5045353770256042, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14129626750946045, | |
| "rewards/margins": 2.2885243892669678, | |
| "rewards/rejected": -2.1472277641296387, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.6101914962674456, | |
| "grad_norm": 6.736759185791016, | |
| "learning_rate": 0.00016657168813525853, | |
| "logits/chosen": -0.7526311278343201, | |
| "logits/rejected": -0.752763032913208, | |
| "logps/chosen": -7.331406116485596, | |
| "logps/rejected": -32.31086730957031, | |
| "loss": 0.754887580871582, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.48174968361854553, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0755733847618103, | |
| "rewards/margins": 2.1878206729888916, | |
| "rewards/rejected": -2.1122474670410156, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6127880558260305, | |
| "grad_norm": 2.6155624389648438, | |
| "learning_rate": 0.0001662503807225225, | |
| "logits/chosen": -0.7355427742004395, | |
| "logits/rejected": -0.7384796738624573, | |
| "logps/chosen": -8.030364036560059, | |
| "logps/rejected": -31.442228317260742, | |
| "loss": 0.5243774652481079, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3355557322502136, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19963966310024261, | |
| "rewards/margins": 2.296480655670166, | |
| "rewards/rejected": -2.096841335296631, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.6153846153846154, | |
| "grad_norm": 18.65455436706543, | |
| "learning_rate": 0.0001659278496725024, | |
| "logits/chosen": -0.7295012474060059, | |
| "logits/rejected": -0.7436960935592651, | |
| "logps/chosen": -2.705686569213867, | |
| "logps/rejected": -41.4896354675293, | |
| "loss": 0.34673982858657837, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17969390749931335, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24503067135810852, | |
| "rewards/margins": 3.1294853687286377, | |
| "rewards/rejected": -2.8844549655914307, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.6179811749432003, | |
| "grad_norm": 7.085238456726074, | |
| "learning_rate": 0.00016560410094231144, | |
| "logits/chosen": -0.7452048063278198, | |
| "logits/rejected": -0.7516958713531494, | |
| "logps/chosen": -7.530111789703369, | |
| "logps/rejected": -34.36936569213867, | |
| "loss": 0.6021293997764587, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3124768137931824, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21694707870483398, | |
| "rewards/margins": 2.285515785217285, | |
| "rewards/rejected": -2.068568706512451, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6205777345017851, | |
| "grad_norm": 4.304277420043945, | |
| "learning_rate": 0.00016527914051155327, | |
| "logits/chosen": -0.7648165822029114, | |
| "logits/rejected": -0.7681047320365906, | |
| "logps/chosen": -10.339492797851562, | |
| "logps/rejected": -35.120906829833984, | |
| "loss": 0.6538665890693665, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35871338844299316, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.31186383962631226, | |
| "rewards/margins": 2.426875591278076, | |
| "rewards/rejected": -2.11501145362854, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6231742940603701, | |
| "grad_norm": 2.158324718475342, | |
| "learning_rate": 0.00016495297438221145, | |
| "logits/chosen": -0.8034281730651855, | |
| "logits/rejected": -0.807834267616272, | |
| "logps/chosen": -5.897243976593018, | |
| "logps/rejected": -28.772375106811523, | |
| "loss": 0.49097374081611633, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2912865877151489, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.41394859552383423, | |
| "rewards/margins": 2.25996994972229, | |
| "rewards/rejected": -1.8460214138031006, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6257708536189549, | |
| "grad_norm": 3.6357457637786865, | |
| "learning_rate": 0.00016462560857853875, | |
| "logits/chosen": -0.7996818423271179, | |
| "logits/rejected": -0.8091530203819275, | |
| "logps/chosen": -7.473721981048584, | |
| "logps/rejected": -54.37172317504883, | |
| "loss": 0.38115888833999634, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21902790665626526, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.033102504909038544, | |
| "rewards/margins": 3.986940383911133, | |
| "rewards/rejected": -3.9538376331329346, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6283674131775397, | |
| "grad_norm": 2.7460196018218994, | |
| "learning_rate": 0.00016429704914694573, | |
| "logits/chosen": -0.7820178866386414, | |
| "logits/rejected": -0.7842017412185669, | |
| "logps/chosen": -5.335976600646973, | |
| "logps/rejected": -42.033546447753906, | |
| "loss": 0.3013039231300354, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18570105731487274, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1724267154932022, | |
| "rewards/margins": 3.339083194732666, | |
| "rewards/rejected": -3.166656494140625, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6309639727361246, | |
| "grad_norm": 5.302358627319336, | |
| "learning_rate": 0.00016396730215588915, | |
| "logits/chosen": -0.8216249942779541, | |
| "logits/rejected": -0.8270251750946045, | |
| "logps/chosen": -6.513396263122559, | |
| "logps/rejected": -36.97430419921875, | |
| "loss": 0.5384330749511719, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2902465760707855, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3697386085987091, | |
| "rewards/margins": 3.0714187622070312, | |
| "rewards/rejected": -2.7016794681549072, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.6335605322947095, | |
| "grad_norm": 3.1649816036224365, | |
| "learning_rate": 0.00016363637369575985, | |
| "logits/chosen": -0.8752993941307068, | |
| "logits/rejected": -0.8820919990539551, | |
| "logps/chosen": -7.153526306152344, | |
| "logps/rejected": -39.54959487915039, | |
| "loss": 0.46389204263687134, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27045994997024536, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20367804169654846, | |
| "rewards/margins": 2.886066436767578, | |
| "rewards/rejected": -2.6823883056640625, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6361570918532944, | |
| "grad_norm": 1.2264916896820068, | |
| "learning_rate": 0.00016330426987877029, | |
| "logits/chosen": -0.8916351199150085, | |
| "logits/rejected": -0.903096616268158, | |
| "logps/chosen": -7.63686990737915, | |
| "logps/rejected": -45.377986907958984, | |
| "loss": 0.4263359308242798, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33412155508995056, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44734618067741394, | |
| "rewards/margins": 3.656412124633789, | |
| "rewards/rejected": -3.2090659141540527, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6387536514118792, | |
| "grad_norm": 2.662604570388794, | |
| "learning_rate": 0.00016297099683884163, | |
| "logits/chosen": -0.9035799503326416, | |
| "logits/rejected": -0.9036927223205566, | |
| "logps/chosen": -7.97056770324707, | |
| "logps/rejected": -39.277339935302734, | |
| "loss": 0.4779468774795532, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3122636079788208, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11914081126451492, | |
| "rewards/margins": 3.0797340869903564, | |
| "rewards/rejected": -2.9605932235717773, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.6413502109704642, | |
| "grad_norm": 1.7811486721038818, | |
| "learning_rate": 0.0001626365607314905, | |
| "logits/chosen": -0.9211519956588745, | |
| "logits/rejected": -0.9266526699066162, | |
| "logps/chosen": -12.947280883789062, | |
| "logps/rejected": -44.871585845947266, | |
| "loss": 0.4722021222114563, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.37982484698295593, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2566950023174286, | |
| "rewards/margins": 3.416555881500244, | |
| "rewards/rejected": -3.1598610877990723, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.643946770529049, | |
| "grad_norm": 12.365011215209961, | |
| "learning_rate": 0.00016230096773371514, | |
| "logits/chosen": -0.9951969385147095, | |
| "logits/rejected": -0.9942623376846313, | |
| "logps/chosen": -8.581663131713867, | |
| "logps/rejected": -43.716217041015625, | |
| "loss": 0.518119215965271, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.38296759128570557, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09159248322248459, | |
| "rewards/margins": 3.335644006729126, | |
| "rewards/rejected": -3.244051456451416, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6465433300876339, | |
| "grad_norm": 11.83633041381836, | |
| "learning_rate": 0.00016196422404388157, | |
| "logits/chosen": -0.9826600551605225, | |
| "logits/rejected": -0.9850393533706665, | |
| "logps/chosen": -9.135320663452148, | |
| "logps/rejected": -46.018798828125, | |
| "loss": 0.5105503797531128, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39638927578926086, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.10775209963321686, | |
| "rewards/margins": 3.4860193729400635, | |
| "rewards/rejected": -3.378267526626587, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6491398896462187, | |
| "grad_norm": 4.603750228881836, | |
| "learning_rate": 0.0001616263358816089, | |
| "logits/chosen": -1.0238407850265503, | |
| "logits/rejected": -1.0272432565689087, | |
| "logps/chosen": -5.940099716186523, | |
| "logps/rejected": -52.49337387084961, | |
| "loss": 0.36938077211380005, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2231290638446808, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.25854048132896423, | |
| "rewards/margins": 4.265020847320557, | |
| "rewards/rejected": -4.0064802169799805, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.005361 | |
| }, | |
| { | |
| "epoch": 0.6517364492048037, | |
| "grad_norm": 52.063899993896484, | |
| "learning_rate": 0.00016128730948765447, | |
| "logits/chosen": -1.0816775560379028, | |
| "logits/rejected": -1.089053750038147, | |
| "logps/chosen": -5.90020227432251, | |
| "logps/rejected": -48.5638542175293, | |
| "loss": 0.43552514910697937, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3044917583465576, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.26977428793907166, | |
| "rewards/margins": 3.8167455196380615, | |
| "rewards/rejected": -3.546971321105957, | |
| "step": 251, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6543330087633885, | |
| "grad_norm": 4.294113636016846, | |
| "learning_rate": 0.0001609471511237987, | |
| "logits/chosen": -1.014509677886963, | |
| "logits/rejected": -1.0186957120895386, | |
| "logps/chosen": -7.97694730758667, | |
| "logps/rejected": -56.545310974121094, | |
| "loss": 0.36489278078079224, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2762773334980011, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.022740613669157028, | |
| "rewards/margins": 4.397303581237793, | |
| "rewards/rejected": -4.4200439453125, | |
| "step": 252, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6569295683219734, | |
| "grad_norm": 3.516819477081299, | |
| "learning_rate": 0.00016060586707272942, | |
| "logits/chosen": -1.0790157318115234, | |
| "logits/rejected": -1.0865930318832397, | |
| "logps/chosen": -8.454242706298828, | |
| "logps/rejected": -54.464717864990234, | |
| "loss": 0.3686315417289734, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27849066257476807, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.13144642114639282, | |
| "rewards/margins": 4.120382308959961, | |
| "rewards/rejected": -3.988936424255371, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6595261278805583, | |
| "grad_norm": 10.735478401184082, | |
| "learning_rate": 0.00016026346363792567, | |
| "logits/chosen": -1.0199754238128662, | |
| "logits/rejected": -1.024275779724121, | |
| "logps/chosen": -10.477851867675781, | |
| "logps/rejected": -48.380496978759766, | |
| "loss": 0.6012676358222961, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.42399072647094727, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.174387127161026, | |
| "rewards/margins": 3.8456358909606934, | |
| "rewards/rejected": -3.671248435974121, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6621226874391432, | |
| "grad_norm": 4.77883243560791, | |
| "learning_rate": 0.0001599199471435414, | |
| "logits/chosen": -1.0578190088272095, | |
| "logits/rejected": -1.0658252239227295, | |
| "logps/chosen": -9.42254638671875, | |
| "logps/rejected": -52.36109924316406, | |
| "loss": 0.4474544823169708, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3092021942138672, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1929168850183487, | |
| "rewards/margins": 4.269603729248047, | |
| "rewards/rejected": -4.076685905456543, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.664719246997728, | |
| "grad_norm": 9.897768020629883, | |
| "learning_rate": 0.00015957532393428872, | |
| "logits/chosen": -1.0346934795379639, | |
| "logits/rejected": -1.0372470617294312, | |
| "logps/chosen": -9.071995735168457, | |
| "logps/rejected": -49.584144592285156, | |
| "loss": 0.617793083190918, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.49921637773513794, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.16571339964866638, | |
| "rewards/margins": 3.9660375118255615, | |
| "rewards/rejected": -3.800323963165283, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6673158065563128, | |
| "grad_norm": 1.2311677932739258, | |
| "learning_rate": 0.00015922960037532055, | |
| "logits/chosen": -1.108057975769043, | |
| "logits/rejected": -1.1105315685272217, | |
| "logps/chosen": -6.960026741027832, | |
| "logps/rejected": -53.92729568481445, | |
| "loss": 0.3580763638019562, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32845476269721985, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.28917384147644043, | |
| "rewards/margins": 4.447230339050293, | |
| "rewards/rejected": -4.15805721282959, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6699123661148978, | |
| "grad_norm": 45.17562484741211, | |
| "learning_rate": 0.0001588827828521133, | |
| "logits/chosen": -1.050451397895813, | |
| "logits/rejected": -1.0607093572616577, | |
| "logps/chosen": -8.958418846130371, | |
| "logps/rejected": -57.699886322021484, | |
| "loss": 0.7421323657035828, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4822649359703064, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22899343073368073, | |
| "rewards/margins": 4.515078544616699, | |
| "rewards/rejected": -4.286085605621338, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6725089256734826, | |
| "grad_norm": 1.422256588935852, | |
| "learning_rate": 0.00015853487777034862, | |
| "logits/chosen": -1.0635780096054077, | |
| "logits/rejected": -1.0673224925994873, | |
| "logps/chosen": -8.635517120361328, | |
| "logps/rejected": -58.0097541809082, | |
| "loss": 0.3220076858997345, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30796006321907043, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3498881161212921, | |
| "rewards/margins": 4.858260154724121, | |
| "rewards/rejected": -4.5083723068237305, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6751054852320675, | |
| "grad_norm": 2.5571460723876953, | |
| "learning_rate": 0.0001581858915557953, | |
| "logits/chosen": -1.0401530265808105, | |
| "logits/rejected": -1.056994915008545, | |
| "logps/chosen": -7.485888481140137, | |
| "logps/rejected": -66.18753814697266, | |
| "loss": 0.34027281403541565, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24791380763053894, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1610621213912964, | |
| "rewards/margins": 5.100013732910156, | |
| "rewards/rejected": -4.938951015472412, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6777020447906524, | |
| "grad_norm": 2.7434134483337402, | |
| "learning_rate": 0.00015783583065419055, | |
| "logits/chosen": -1.0726388692855835, | |
| "logits/rejected": -1.0658763647079468, | |
| "logps/chosen": -9.934000968933105, | |
| "logps/rejected": -43.6441764831543, | |
| "loss": 0.48066970705986023, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3425687551498413, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2836655080318451, | |
| "rewards/margins": 3.740111827850342, | |
| "rewards/rejected": -3.456446647644043, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6802986043492373, | |
| "grad_norm": 11.48259162902832, | |
| "learning_rate": 0.00015748470153112093, | |
| "logits/chosen": -1.02780020236969, | |
| "logits/rejected": -1.0415828227996826, | |
| "logps/chosen": -5.212684631347656, | |
| "logps/rejected": -61.468292236328125, | |
| "loss": 0.4467061758041382, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2766522765159607, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.25993314385414124, | |
| "rewards/margins": 5.092804908752441, | |
| "rewards/rejected": -4.832871437072754, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.6828951639078221, | |
| "grad_norm": 8.564838409423828, | |
| "learning_rate": 0.00015713251067190297, | |
| "logits/chosen": -1.0391637086868286, | |
| "logits/rejected": -1.0465219020843506, | |
| "logps/chosen": -10.817865371704102, | |
| "logps/rejected": -51.074317932128906, | |
| "loss": 0.5829335451126099, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32782095670700073, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.04439431428909302, | |
| "rewards/margins": 3.851675510406494, | |
| "rewards/rejected": -3.8960695266723633, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.685491723466407, | |
| "grad_norm": 4.39657735824585, | |
| "learning_rate": 0.00015677926458146325, | |
| "logits/chosen": -1.0428134202957153, | |
| "logits/rejected": -1.0442464351654053, | |
| "logps/chosen": -9.461180686950684, | |
| "logps/rejected": -50.168216705322266, | |
| "loss": 0.527190625667572, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39044150710105896, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2586324214935303, | |
| "rewards/margins": 4.324131488800049, | |
| "rewards/rejected": -4.065499305725098, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6880882830249919, | |
| "grad_norm": 33.24240493774414, | |
| "learning_rate": 0.00015642496978421843, | |
| "logits/chosen": -0.9720567464828491, | |
| "logits/rejected": -0.9765857458114624, | |
| "logps/chosen": -6.901163578033447, | |
| "logps/rejected": -53.93683624267578, | |
| "loss": 0.42922741174697876, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3468468487262726, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45161283016204834, | |
| "rewards/margins": 4.4618635177612305, | |
| "rewards/rejected": -4.010250568389893, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.6906848425835768, | |
| "grad_norm": 5.137800693511963, | |
| "learning_rate": 0.00015606963282395467, | |
| "logits/chosen": -1.0221166610717773, | |
| "logits/rejected": -1.030777931213379, | |
| "logps/chosen": -6.099124908447266, | |
| "logps/rejected": -51.621883392333984, | |
| "loss": 0.44425708055496216, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34302324056625366, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26895275712013245, | |
| "rewards/margins": 4.289248943328857, | |
| "rewards/rejected": -4.020296096801758, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.6932814021421616, | |
| "grad_norm": 1.4863890409469604, | |
| "learning_rate": 0.00015571326026370675, | |
| "logits/chosen": -1.0046309232711792, | |
| "logits/rejected": -1.0050278902053833, | |
| "logps/chosen": -7.830292701721191, | |
| "logps/rejected": -52.04121017456055, | |
| "loss": 0.30963078141212463, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23877012729644775, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.16400472819805145, | |
| "rewards/margins": 4.016274452209473, | |
| "rewards/rejected": -3.8522696495056152, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.6958779617007466, | |
| "grad_norm": 1.783074140548706, | |
| "learning_rate": 0.00015535585868563687, | |
| "logits/chosen": -0.9659662842750549, | |
| "logits/rejected": -0.9642824530601501, | |
| "logps/chosen": -7.803462505340576, | |
| "logps/rejected": -40.019229888916016, | |
| "loss": 0.45223909616470337, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2870696485042572, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3678834140300751, | |
| "rewards/margins": 3.325589895248413, | |
| "rewards/rejected": -2.9577064514160156, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.6984745212593314, | |
| "grad_norm": 2.9299373626708984, | |
| "learning_rate": 0.00015499743469091305, | |
| "logits/chosen": -0.9901977181434631, | |
| "logits/rejected": -0.9931589365005493, | |
| "logps/chosen": -9.296809196472168, | |
| "logps/rejected": -42.269630432128906, | |
| "loss": 0.45571860671043396, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2836253046989441, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3169897794723511, | |
| "rewards/margins": 3.4090187549591064, | |
| "rewards/rejected": -3.092029094696045, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.7010710808179162, | |
| "grad_norm": 2.768286943435669, | |
| "learning_rate": 0.00015463799489958728, | |
| "logits/chosen": -0.9836040139198303, | |
| "logits/rejected": -0.9821513295173645, | |
| "logps/chosen": -8.032227516174316, | |
| "logps/rejected": -46.852630615234375, | |
| "loss": 0.3594820201396942, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.301334023475647, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21750850975513458, | |
| "rewards/margins": 3.9014554023742676, | |
| "rewards/rejected": -3.6839470863342285, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.7036676403765011, | |
| "grad_norm": 11.645221710205078, | |
| "learning_rate": 0.0001542775459504732, | |
| "logits/chosen": -0.977642297744751, | |
| "logits/rejected": -0.983423113822937, | |
| "logps/chosen": -7.453811168670654, | |
| "logps/rejected": -41.04922866821289, | |
| "loss": 0.7860956788063049, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5319768786430359, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1531173586845398, | |
| "rewards/margins": 3.1887106895446777, | |
| "rewards/rejected": -3.035593271255493, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.706264199935086, | |
| "grad_norm": 2.451678514480591, | |
| "learning_rate": 0.00015391609450102344, | |
| "logits/chosen": -1.023182988166809, | |
| "logits/rejected": -1.0244897603988647, | |
| "logps/chosen": -7.354053497314453, | |
| "logps/rejected": -44.0927619934082, | |
| "loss": 0.39909517765045166, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3177676796913147, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3391517996788025, | |
| "rewards/margins": 3.611537218093872, | |
| "rewards/rejected": -3.272385597229004, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7088607594936709, | |
| "grad_norm": 1.9267401695251465, | |
| "learning_rate": 0.00015355364722720674, | |
| "logits/chosen": -0.9752072691917419, | |
| "logits/rejected": -0.9693701863288879, | |
| "logps/chosen": -11.397211074829102, | |
| "logps/rejected": -48.029632568359375, | |
| "loss": 0.39653921127319336, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3201441764831543, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3673996925354004, | |
| "rewards/margins": 3.925154209136963, | |
| "rewards/rejected": -3.5577547550201416, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7114573190522557, | |
| "grad_norm": 8.30762767791748, | |
| "learning_rate": 0.0001531902108233846, | |
| "logits/chosen": -1.005213737487793, | |
| "logits/rejected": -1.0123414993286133, | |
| "logps/chosen": -10.145181655883789, | |
| "logps/rejected": -43.201988220214844, | |
| "loss": 0.9267427921295166, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5765597224235535, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0955648422241211, | |
| "rewards/margins": 3.0650508403778076, | |
| "rewards/rejected": -2.9694862365722656, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7140538786108407, | |
| "grad_norm": 1.9015525579452515, | |
| "learning_rate": 0.00015282579200218762, | |
| "logits/chosen": -0.9652273654937744, | |
| "logits/rejected": -0.9685376882553101, | |
| "logps/chosen": -5.937908172607422, | |
| "logps/rejected": -48.166961669921875, | |
| "loss": 0.3091265857219696, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19744150340557098, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10177955776453018, | |
| "rewards/margins": 3.805178642272949, | |
| "rewards/rejected": -3.7033989429473877, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7166504381694255, | |
| "grad_norm": 6.060371398925781, | |
| "learning_rate": 0.00015246039749439158, | |
| "logits/chosen": -0.9658158421516418, | |
| "logits/rejected": -0.9731608033180237, | |
| "logps/chosen": -7.255200386047363, | |
| "logps/rejected": -50.502464294433594, | |
| "loss": 0.6045569777488708, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3833393156528473, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.06260780245065689, | |
| "rewards/margins": 3.6017262935638428, | |
| "rewards/rejected": -3.6643340587615967, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7192469977280104, | |
| "grad_norm": 3.960418462753296, | |
| "learning_rate": 0.00015209403404879303, | |
| "logits/chosen": -0.8965452909469604, | |
| "logits/rejected": -0.9077386260032654, | |
| "logps/chosen": -7.974431991577148, | |
| "logps/rejected": -51.04905700683594, | |
| "loss": 0.5292239785194397, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44278621673583984, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2756114602088928, | |
| "rewards/margins": 3.676894187927246, | |
| "rewards/rejected": -3.401282548904419, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7218435572865952, | |
| "grad_norm": 7.708714008331299, | |
| "learning_rate": 0.00015172670843208475, | |
| "logits/chosen": -0.9474626779556274, | |
| "logits/rejected": -0.9558745622634888, | |
| "logps/chosen": -6.619680404663086, | |
| "logps/rejected": -55.76416778564453, | |
| "loss": 0.33095428347587585, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2111760675907135, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.31980329751968384, | |
| "rewards/margins": 4.286462783813477, | |
| "rewards/rejected": -3.9666595458984375, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7244401168451802, | |
| "grad_norm": 3.547145128250122, | |
| "learning_rate": 0.00015135842742873077, | |
| "logits/chosen": -0.9616857767105103, | |
| "logits/rejected": -0.9554501175880432, | |
| "logps/chosen": -13.64553451538086, | |
| "logps/rejected": -47.13714599609375, | |
| "loss": 0.5570240020751953, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34419986605644226, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.17980074882507324, | |
| "rewards/margins": 3.7363922595977783, | |
| "rewards/rejected": -3.556591510772705, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.727036676403765, | |
| "grad_norm": 2.789520740509033, | |
| "learning_rate": 0.00015098919784084082, | |
| "logits/chosen": -0.9526619911193848, | |
| "logits/rejected": -0.9585291743278503, | |
| "logps/chosen": -5.527890682220459, | |
| "logps/rejected": -48.09929656982422, | |
| "loss": 0.3063603341579437, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19290734827518463, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27611908316612244, | |
| "rewards/margins": 3.8319613933563232, | |
| "rewards/rejected": -3.5558416843414307, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7296332359623499, | |
| "grad_norm": 2.256161689758301, | |
| "learning_rate": 0.00015061902648804502, | |
| "logits/chosen": -0.913105309009552, | |
| "logits/rejected": -0.9261531829833984, | |
| "logps/chosen": -4.366436004638672, | |
| "logps/rejected": -42.916358947753906, | |
| "loss": 0.3409702777862549, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2262687385082245, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35636499524116516, | |
| "rewards/margins": 3.0527658462524414, | |
| "rewards/rejected": -2.6964004039764404, | |
| "step": 281, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7322297955209348, | |
| "grad_norm": 3.5901756286621094, | |
| "learning_rate": 0.0001502479202073678, | |
| "logits/chosen": -0.8968573808670044, | |
| "logits/rejected": -0.9044336676597595, | |
| "logps/chosen": -10.585033416748047, | |
| "logps/rejected": -49.008888244628906, | |
| "loss": 0.4977288842201233, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3260158896446228, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15746770799160004, | |
| "rewards/margins": 3.4977617263793945, | |
| "rewards/rejected": -3.3402938842773438, | |
| "step": 282, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7348263550795197, | |
| "grad_norm": 4.433828830718994, | |
| "learning_rate": 0.00014987588585310154, | |
| "logits/chosen": -0.9033176898956299, | |
| "logits/rejected": -0.9071294069290161, | |
| "logps/chosen": -10.011114120483398, | |
| "logps/rejected": -41.05360794067383, | |
| "loss": 0.5514770150184631, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.37259769439697266, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07280327379703522, | |
| "rewards/margins": 3.06974720954895, | |
| "rewards/rejected": -2.996943950653076, | |
| "step": 283, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7374229146381045, | |
| "grad_norm": 4.148340225219727, | |
| "learning_rate": 0.00014950293029668003, | |
| "logits/chosen": -0.8784151077270508, | |
| "logits/rejected": -0.8862117528915405, | |
| "logps/chosen": -6.820345401763916, | |
| "logps/rejected": -54.827003479003906, | |
| "loss": 0.3150921165943146, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24718376994132996, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.15254774689674377, | |
| "rewards/margins": 4.318949222564697, | |
| "rewards/rejected": -4.1664018630981445, | |
| "step": 284, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7400194741966893, | |
| "grad_norm": 1.0749166011810303, | |
| "learning_rate": 0.00014912906042655164, | |
| "logits/chosen": -0.8836584091186523, | |
| "logits/rejected": -0.8885093927383423, | |
| "logps/chosen": -6.686123847961426, | |
| "logps/rejected": -51.037071228027344, | |
| "loss": 0.2929588854312897, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25999218225479126, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.24088695645332336, | |
| "rewards/margins": 4.235246658325195, | |
| "rewards/rejected": -3.9943599700927734, | |
| "step": 285, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7426160337552743, | |
| "grad_norm": 3.1975772380828857, | |
| "learning_rate": 0.00014875428314805195, | |
| "logits/chosen": -0.8791793584823608, | |
| "logits/rejected": -0.8838009834289551, | |
| "logps/chosen": -4.482460975646973, | |
| "logps/rejected": -42.07259750366211, | |
| "loss": 0.45191437005996704, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2820110023021698, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17223408818244934, | |
| "rewards/margins": 3.3569703102111816, | |
| "rewards/rejected": -3.1847360134124756, | |
| "step": 286, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7452125933138591, | |
| "grad_norm": 4.853325366973877, | |
| "learning_rate": 0.0001483786053832763, | |
| "logits/chosen": -0.8666754961013794, | |
| "logits/rejected": -0.8730036020278931, | |
| "logps/chosen": -10.173751831054688, | |
| "logps/rejected": -42.610389709472656, | |
| "loss": 0.481548547744751, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32319656014442444, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1995163857936859, | |
| "rewards/margins": 3.381746292114258, | |
| "rewards/rejected": -3.182229518890381, | |
| "step": 287, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.747809152872444, | |
| "grad_norm": 5.358548164367676, | |
| "learning_rate": 0.00014800203407095195, | |
| "logits/chosen": -0.8995557427406311, | |
| "logits/rejected": -0.9070794582366943, | |
| "logps/chosen": -4.7012481689453125, | |
| "logps/rejected": -49.54352569580078, | |
| "loss": 0.3500158190727234, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2837740182876587, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3831089735031128, | |
| "rewards/margins": 4.144287586212158, | |
| "rewards/rejected": -3.761178493499756, | |
| "step": 288, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.7504057124310289, | |
| "grad_norm": 2.933692693710327, | |
| "learning_rate": 0.0001476245761663097, | |
| "logits/chosen": -0.8843749165534973, | |
| "logits/rejected": -0.8904112577438354, | |
| "logps/chosen": -8.129939079284668, | |
| "logps/rejected": -47.64159393310547, | |
| "loss": 0.3809664249420166, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30353543162345886, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43099674582481384, | |
| "rewards/margins": 3.9384264945983887, | |
| "rewards/rejected": -3.507429599761963, | |
| "step": 289, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.7530022719896138, | |
| "grad_norm": 5.533115863800049, | |
| "learning_rate": 0.00014724623864095595, | |
| "logits/chosen": -0.8974816799163818, | |
| "logits/rejected": -0.8943885564804077, | |
| "logps/chosen": -12.756951332092285, | |
| "logps/rejected": -45.041236877441406, | |
| "loss": 0.5215253829956055, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4008585512638092, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.28772494196891785, | |
| "rewards/margins": 3.7097461223602295, | |
| "rewards/rejected": -3.4220211505889893, | |
| "step": 290, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7555988315481986, | |
| "grad_norm": 2.6864752769470215, | |
| "learning_rate": 0.00014686702848274328, | |
| "logits/chosen": -0.9088398218154907, | |
| "logits/rejected": -0.9072700142860413, | |
| "logps/chosen": -7.4077606201171875, | |
| "logps/rejected": -46.239906311035156, | |
| "loss": 0.32609468698501587, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2327779084444046, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.20570842921733856, | |
| "rewards/margins": 3.893001079559326, | |
| "rewards/rejected": -3.6872925758361816, | |
| "step": 291, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.7581953911067835, | |
| "grad_norm": 9.521873474121094, | |
| "learning_rate": 0.0001464869526956418, | |
| "logits/chosen": -0.8602750301361084, | |
| "logits/rejected": -0.8622329235076904, | |
| "logps/chosen": -8.320989608764648, | |
| "logps/rejected": -44.78575134277344, | |
| "loss": 0.5608953237533569, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.36838674545288086, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0709700807929039, | |
| "rewards/margins": 3.4943435192108154, | |
| "rewards/rejected": -3.4233739376068115, | |
| "step": 292, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7607919506653684, | |
| "grad_norm": 5.926126480102539, | |
| "learning_rate": 0.00014610601829960978, | |
| "logits/chosen": -0.892938494682312, | |
| "logits/rejected": -0.8982577323913574, | |
| "logps/chosen": -6.005653381347656, | |
| "logps/rejected": -44.90076446533203, | |
| "loss": 0.43931251764297485, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2638612389564514, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12249821424484253, | |
| "rewards/margins": 3.140292167663574, | |
| "rewards/rejected": -3.017793893814087, | |
| "step": 293, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7633885102239533, | |
| "grad_norm": 2.9120235443115234, | |
| "learning_rate": 0.00014572423233046386, | |
| "logits/chosen": -0.8966829776763916, | |
| "logits/rejected": -0.9077416062355042, | |
| "logps/chosen": -8.57165241241455, | |
| "logps/rejected": -55.184844970703125, | |
| "loss": 0.45368537306785583, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.36300209164619446, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1118740364909172, | |
| "rewards/margins": 4.270344257354736, | |
| "rewards/rejected": -4.158470153808594, | |
| "step": 294, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7659850697825381, | |
| "grad_norm": 5.669841289520264, | |
| "learning_rate": 0.00014534160183974907, | |
| "logits/chosen": -0.8818827271461487, | |
| "logits/rejected": -0.8899796009063721, | |
| "logps/chosen": -5.550753593444824, | |
| "logps/rejected": -44.52480697631836, | |
| "loss": 0.5001478791236877, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3267979621887207, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22049690783023834, | |
| "rewards/margins": 3.405883312225342, | |
| "rewards/rejected": -3.1853861808776855, | |
| "step": 295, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.7685816293411231, | |
| "grad_norm": 1.747400164604187, | |
| "learning_rate": 0.00014495813389460874, | |
| "logits/chosen": -0.9121143817901611, | |
| "logits/rejected": -0.9087746739387512, | |
| "logps/chosen": -9.585158348083496, | |
| "logps/rejected": -50.017791748046875, | |
| "loss": 0.4021596610546112, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3450128436088562, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.37154024839401245, | |
| "rewards/margins": 4.141083240509033, | |
| "rewards/rejected": -3.769543170928955, | |
| "step": 296, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7711781888997079, | |
| "grad_norm": 11.861947059631348, | |
| "learning_rate": 0.00014457383557765386, | |
| "logits/chosen": -0.8657410144805908, | |
| "logits/rejected": -0.8725622892379761, | |
| "logps/chosen": -8.42186450958252, | |
| "logps/rejected": -46.08644104003906, | |
| "loss": 0.559907078742981, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4467519223690033, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.40526360273361206, | |
| "rewards/margins": 3.708038568496704, | |
| "rewards/rejected": -3.3027749061584473, | |
| "step": 297, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.7737747484582927, | |
| "grad_norm": 3.2839434146881104, | |
| "learning_rate": 0.00014418871398683226, | |
| "logits/chosen": -0.8851770758628845, | |
| "logits/rejected": -0.8929255604743958, | |
| "logps/chosen": -6.95133113861084, | |
| "logps/rejected": -44.50846862792969, | |
| "loss": 0.3745541274547577, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2655733525753021, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.381335973739624, | |
| "rewards/margins": 3.8720412254333496, | |
| "rewards/rejected": -3.4907052516937256, | |
| "step": 298, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7763713080168776, | |
| "grad_norm": 2.888361930847168, | |
| "learning_rate": 0.00014380277623529764, | |
| "logits/chosen": -0.853575587272644, | |
| "logits/rejected": -0.8686288595199585, | |
| "logps/chosen": -3.8131489753723145, | |
| "logps/rejected": -52.961769104003906, | |
| "loss": 0.22544604539871216, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15638428926467896, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.19273503124713898, | |
| "rewards/margins": 4.502290725708008, | |
| "rewards/rejected": -4.309555530548096, | |
| "step": 299, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7789678675754625, | |
| "grad_norm": 7.9267778396606445, | |
| "learning_rate": 0.00014341602945127806, | |
| "logits/chosen": -0.8887860774993896, | |
| "logits/rejected": -0.8979215621948242, | |
| "logps/chosen": -5.356024265289307, | |
| "logps/rejected": -51.7165412902832, | |
| "loss": 0.3821192979812622, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2632734477519989, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13820704817771912, | |
| "rewards/margins": 3.850296974182129, | |
| "rewards/rejected": -3.712090492248535, | |
| "step": 300, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.7789678675754625, | |
| "eval_logits/chosen": -0.867992103099823, | |
| "eval_logits/rejected": -0.874204695224762, | |
| "eval_logps/chosen": -9.79829216003418, | |
| "eval_logps/rejected": -51.43035125732422, | |
| "eval_loss": 0.535804033279419, | |
| "eval_nll_loss": 0.41711926460266113, | |
| "eval_rewards/accuracies": 0.9677419066429138, | |
| "eval_rewards/chosen": 0.2565970718860626, | |
| "eval_rewards/margins": 4.159191608428955, | |
| "eval_rewards/rejected": -3.9025943279266357, | |
| "eval_runtime": 291.9135, | |
| "eval_samples_per_second": 0.425, | |
| "eval_steps_per_second": 0.425, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.7815644271340474, | |
| "grad_norm": 1.242323637008667, | |
| "learning_rate": 0.00014302848077794427, | |
| "logits/chosen": -0.8723223209381104, | |
| "logits/rejected": -0.8770792484283447, | |
| "logps/chosen": -6.223211288452148, | |
| "logps/rejected": -52.06251907348633, | |
| "loss": 0.3036009967327118, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22717300057411194, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3022981882095337, | |
| "rewards/margins": 4.106766700744629, | |
| "rewards/rejected": -3.8044683933258057, | |
| "step": 301, | |
| "train_speed(iter/s)": 0.00533 | |
| }, | |
| { | |
| "epoch": 0.7841609866926322, | |
| "grad_norm": 2.6004726886749268, | |
| "learning_rate": 0.00014264013737327788, | |
| "logits/chosen": -0.916274905204773, | |
| "logits/rejected": -0.9221408367156982, | |
| "logps/chosen": -8.104936599731445, | |
| "logps/rejected": -52.68116760253906, | |
| "loss": 0.3741414248943329, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26373815536499023, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1614115685224533, | |
| "rewards/margins": 4.1823883056640625, | |
| "rewards/rejected": -4.020977020263672, | |
| "step": 302, | |
| "train_speed(iter/s)": 0.00533 | |
| }, | |
| { | |
| "epoch": 0.7867575462512172, | |
| "grad_norm": 18.030475616455078, | |
| "learning_rate": 0.0001422510064099391, | |
| "logits/chosen": -0.9025695323944092, | |
| "logits/rejected": -0.9134030342102051, | |
| "logps/chosen": -5.3788228034973145, | |
| "logps/rejected": -56.01725769042969, | |
| "loss": 0.4833014905452728, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35686278343200684, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4239948093891144, | |
| "rewards/margins": 4.954083442687988, | |
| "rewards/rejected": -4.530088901519775, | |
| "step": 303, | |
| "train_speed(iter/s)": 0.005331 | |
| }, | |
| { | |
| "epoch": 0.789354105809802, | |
| "grad_norm": 1.25996732711792, | |
| "learning_rate": 0.00014186109507513425, | |
| "logits/chosen": -0.9152663946151733, | |
| "logits/rejected": -0.9181231260299683, | |
| "logps/chosen": -8.745201110839844, | |
| "logps/rejected": -53.348297119140625, | |
| "loss": 0.3430268168449402, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2737351357936859, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.327117383480072, | |
| "rewards/margins": 4.604560852050781, | |
| "rewards/rejected": -4.2774434089660645, | |
| "step": 304, | |
| "train_speed(iter/s)": 0.005332 | |
| }, | |
| { | |
| "epoch": 0.7919506653683869, | |
| "grad_norm": 2.2379977703094482, | |
| "learning_rate": 0.00014147041057048303, | |
| "logits/chosen": -0.9164860248565674, | |
| "logits/rejected": -0.922378659248352, | |
| "logps/chosen": -7.221551895141602, | |
| "logps/rejected": -63.282691955566406, | |
| "loss": 0.3236457407474518, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2571154534816742, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33233726024627686, | |
| "rewards/margins": 5.439297676086426, | |
| "rewards/rejected": -5.106960296630859, | |
| "step": 305, | |
| "train_speed(iter/s)": 0.005332 | |
| }, | |
| { | |
| "epoch": 0.7945472249269717, | |
| "grad_norm": 2.401186227798462, | |
| "learning_rate": 0.00014107896011188547, | |
| "logits/chosen": -0.9090971946716309, | |
| "logits/rejected": -0.9093695878982544, | |
| "logps/chosen": -12.469802856445312, | |
| "logps/rejected": -52.85637664794922, | |
| "loss": 0.429090291261673, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34026211500167847, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.262347936630249, | |
| "rewards/margins": 4.283257007598877, | |
| "rewards/rejected": -4.020909309387207, | |
| "step": 306, | |
| "train_speed(iter/s)": 0.005332 | |
| }, | |
| { | |
| "epoch": 0.7971437844855567, | |
| "grad_norm": 11.393203735351562, | |
| "learning_rate": 0.0001406867509293887, | |
| "logits/chosen": -0.87870854139328, | |
| "logits/rejected": -0.890485405921936, | |
| "logps/chosen": -10.30262279510498, | |
| "logps/rejected": -65.79576110839844, | |
| "loss": 0.3643527030944824, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32104456424713135, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3608924150466919, | |
| "rewards/margins": 5.524012088775635, | |
| "rewards/rejected": -5.163119792938232, | |
| "step": 307, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.7997403440441415, | |
| "grad_norm": 2.554598331451416, | |
| "learning_rate": 0.0001402937902670535, | |
| "logits/chosen": -0.9264713525772095, | |
| "logits/rejected": -0.9285149574279785, | |
| "logps/chosen": -10.006579399108887, | |
| "logps/rejected": -52.04652404785156, | |
| "loss": 0.860185444355011, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6048625111579895, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.22397533059120178, | |
| "rewards/margins": 4.25376033782959, | |
| "rewards/rejected": -4.02978515625, | |
| "step": 308, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8023369036027264, | |
| "grad_norm": 1.8770607709884644, | |
| "learning_rate": 0.00013990008538282027, | |
| "logits/chosen": -0.8972032070159912, | |
| "logits/rejected": -0.8980765342712402, | |
| "logps/chosen": -14.556074142456055, | |
| "logps/rejected": -53.385929107666016, | |
| "loss": 0.510574460029602, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.45061612129211426, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3644930422306061, | |
| "rewards/margins": 4.575682640075684, | |
| "rewards/rejected": -4.2111897468566895, | |
| "step": 309, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8049334631613113, | |
| "grad_norm": 12.22037124633789, | |
| "learning_rate": 0.00013950564354837513, | |
| "logits/chosen": -0.9380626678466797, | |
| "logits/rejected": -0.9469397664070129, | |
| "logps/chosen": -10.450864791870117, | |
| "logps/rejected": -60.86605453491211, | |
| "loss": 0.47496286034584045, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.32565683126449585, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27174729108810425, | |
| "rewards/margins": 5.215041160583496, | |
| "rewards/rejected": -4.943294048309326, | |
| "step": 310, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8075300227198962, | |
| "grad_norm": 1.5406510829925537, | |
| "learning_rate": 0.0001391104720490156, | |
| "logits/chosen": -0.8875188231468201, | |
| "logits/rejected": -0.889438807964325, | |
| "logps/chosen": -9.368861198425293, | |
| "logps/rejected": -60.18291473388672, | |
| "loss": 0.4254617393016815, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33097419142723083, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2585148215293884, | |
| "rewards/margins": 5.071025371551514, | |
| "rewards/rejected": -4.8125104904174805, | |
| "step": 311, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.810126582278481, | |
| "grad_norm": 1.0935144424438477, | |
| "learning_rate": 0.0001387145781835161, | |
| "logits/chosen": -0.8894232511520386, | |
| "logits/rejected": -0.8968610763549805, | |
| "logps/chosen": -6.686229228973389, | |
| "logps/rejected": -62.9738655090332, | |
| "loss": 0.32542869448661804, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31048065423965454, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4036734998226166, | |
| "rewards/margins": 5.581910610198975, | |
| "rewards/rejected": -5.178236961364746, | |
| "step": 312, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8127231418370658, | |
| "grad_norm": 3.8420419692993164, | |
| "learning_rate": 0.00013831796926399293, | |
| "logits/chosen": -0.8379157185554504, | |
| "logits/rejected": -0.8429592251777649, | |
| "logps/chosen": -11.607048034667969, | |
| "logps/rejected": -59.3102912902832, | |
| "loss": 0.5591235160827637, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.522581934928894, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2473653256893158, | |
| "rewards/margins": 4.927768707275391, | |
| "rewards/rejected": -4.680403232574463, | |
| "step": 313, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8153197013956508, | |
| "grad_norm": 1.6165937185287476, | |
| "learning_rate": 0.0001379206526157695, | |
| "logits/chosen": -0.837811291217804, | |
| "logits/rejected": -0.8444165587425232, | |
| "logps/chosen": -6.190374851226807, | |
| "logps/rejected": -51.07488250732422, | |
| "loss": 0.33069220185279846, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22484685480594635, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3744960129261017, | |
| "rewards/margins": 4.471968173980713, | |
| "rewards/rejected": -4.097471714019775, | |
| "step": 314, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8179162609542356, | |
| "grad_norm": 1.3219656944274902, | |
| "learning_rate": 0.00013752263557724088, | |
| "logits/chosen": -0.8476938009262085, | |
| "logits/rejected": -0.854124903678894, | |
| "logps/chosen": -4.460864543914795, | |
| "logps/rejected": -59.64604949951172, | |
| "loss": 0.24126547574996948, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18051305413246155, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3259335160255432, | |
| "rewards/margins": 4.853468894958496, | |
| "rewards/rejected": -4.527535915374756, | |
| "step": 315, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8205128205128205, | |
| "grad_norm": 1.3838900327682495, | |
| "learning_rate": 0.00013712392549973813, | |
| "logits/chosen": -0.8475697636604309, | |
| "logits/rejected": -0.8508798480033875, | |
| "logps/chosen": -8.591952323913574, | |
| "logps/rejected": -54.92388153076172, | |
| "loss": 0.33699649572372437, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26192301511764526, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.45825159549713135, | |
| "rewards/margins": 4.5010480880737305, | |
| "rewards/rejected": -4.042796611785889, | |
| "step": 316, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8231093800714054, | |
| "grad_norm": 1.5406709909439087, | |
| "learning_rate": 0.00013672452974739278, | |
| "logits/chosen": -0.8334726095199585, | |
| "logits/rejected": -0.8387458324432373, | |
| "logps/chosen": -6.5857672691345215, | |
| "logps/rejected": -57.37644577026367, | |
| "loss": 0.3329037129878998, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24443216621875763, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26296567916870117, | |
| "rewards/margins": 4.921113014221191, | |
| "rewards/rejected": -4.658147811889648, | |
| "step": 317, | |
| "train_speed(iter/s)": 0.005333 | |
| }, | |
| { | |
| "epoch": 0.8257059396299903, | |
| "grad_norm": 1.1263025999069214, | |
| "learning_rate": 0.00013632445569700076, | |
| "logits/chosen": -0.8738721013069153, | |
| "logits/rejected": -0.8832994699478149, | |
| "logps/chosen": -4.713293552398682, | |
| "logps/rejected": -61.70130157470703, | |
| "loss": 0.24098971486091614, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19781509041786194, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3292510509490967, | |
| "rewards/margins": 5.506122589111328, | |
| "rewards/rejected": -5.176871299743652, | |
| "step": 318, | |
| "train_speed(iter/s)": 0.005334 | |
| }, | |
| { | |
| "epoch": 0.8283024991885751, | |
| "grad_norm": 1.8800857067108154, | |
| "learning_rate": 0.00013592371073788595, | |
| "logits/chosen": -0.8317723274230957, | |
| "logits/rejected": -0.8364999890327454, | |
| "logps/chosen": -9.805098533630371, | |
| "logps/rejected": -52.64741516113281, | |
| "loss": 0.5319538712501526, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.422235369682312, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20960083603858948, | |
| "rewards/margins": 4.515375137329102, | |
| "rewards/rejected": -4.305774211883545, | |
| "step": 319, | |
| "train_speed(iter/s)": 0.005334 | |
| }, | |
| { | |
| "epoch": 0.83089905874716, | |
| "grad_norm": 1.1608284711837769, | |
| "learning_rate": 0.0001355223022717639, | |
| "logits/chosen": -0.8772802948951721, | |
| "logits/rejected": -0.8848594427108765, | |
| "logps/chosen": -5.158228397369385, | |
| "logps/rejected": -62.835357666015625, | |
| "loss": 0.24610216915607452, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2129330337047577, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.20435252785682678, | |
| "rewards/margins": 5.209543228149414, | |
| "rewards/rejected": -5.005191326141357, | |
| "step": 320, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8334956183057449, | |
| "grad_norm": 1.036731243133545, | |
| "learning_rate": 0.00013512023771260507, | |
| "logits/chosen": -0.877793550491333, | |
| "logits/rejected": -0.8856680989265442, | |
| "logps/chosen": -6.130776882171631, | |
| "logps/rejected": -65.56432342529297, | |
| "loss": 0.2860373854637146, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26745346188545227, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4021628201007843, | |
| "rewards/margins": 5.478217124938965, | |
| "rewards/rejected": -5.076053619384766, | |
| "step": 321, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8360921778643298, | |
| "grad_norm": 1.8117263317108154, | |
| "learning_rate": 0.0001347175244864979, | |
| "logits/chosen": -0.8334808349609375, | |
| "logits/rejected": -0.8376457095146179, | |
| "logps/chosen": -11.004887580871582, | |
| "logps/rejected": -66.70048522949219, | |
| "loss": 0.4500907361507416, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.42771589756011963, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.33971378207206726, | |
| "rewards/margins": 5.777808666229248, | |
| "rewards/rejected": -5.4380950927734375, | |
| "step": 322, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8386887374229146, | |
| "grad_norm": 1.4639251232147217, | |
| "learning_rate": 0.00013431417003151162, | |
| "logits/chosen": -0.8392638564109802, | |
| "logits/rejected": -0.8471822142601013, | |
| "logps/chosen": -5.59528112411499, | |
| "logps/rejected": -63.85756301879883, | |
| "loss": 0.24815644323825836, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22107534110546112, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43189477920532227, | |
| "rewards/margins": 5.589203834533691, | |
| "rewards/rejected": -5.157309055328369, | |
| "step": 323, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8412852969814996, | |
| "grad_norm": 3.701712131500244, | |
| "learning_rate": 0.00013391018179755886, | |
| "logits/chosen": -0.862777590751648, | |
| "logits/rejected": -0.863462507724762, | |
| "logps/chosen": -9.423402786254883, | |
| "logps/rejected": -57.09379577636719, | |
| "loss": 0.5075635313987732, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4723358750343323, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.17091917991638184, | |
| "rewards/margins": 4.957292079925537, | |
| "rewards/rejected": -4.786372661590576, | |
| "step": 324, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8438818565400844, | |
| "grad_norm": 3.2106587886810303, | |
| "learning_rate": 0.0001335055672462581, | |
| "logits/chosen": -0.8590080738067627, | |
| "logits/rejected": -0.8611211776733398, | |
| "logps/chosen": -9.565107345581055, | |
| "logps/rejected": -56.25175476074219, | |
| "loss": 0.7309077382087708, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5393710732460022, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.37465783953666687, | |
| "rewards/margins": 5.114628791809082, | |
| "rewards/rejected": -4.739970684051514, | |
| "step": 325, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8464784160986693, | |
| "grad_norm": 1.718408465385437, | |
| "learning_rate": 0.00013310033385079587, | |
| "logits/chosen": -0.8548775911331177, | |
| "logits/rejected": -0.8569875955581665, | |
| "logps/chosen": -6.972779273986816, | |
| "logps/rejected": -53.69463348388672, | |
| "loss": 0.30815446376800537, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2685162425041199, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3408139646053314, | |
| "rewards/margins": 4.932272911071777, | |
| "rewards/rejected": -4.591458797454834, | |
| "step": 326, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8490749756572541, | |
| "grad_norm": 30.29808235168457, | |
| "learning_rate": 0.00013269448909578865, | |
| "logits/chosen": -0.8808773756027222, | |
| "logits/rejected": -0.8881189227104187, | |
| "logps/chosen": -7.769625663757324, | |
| "logps/rejected": -64.69181823730469, | |
| "loss": 0.4174491763114929, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.29413902759552, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1492745727300644, | |
| "rewards/margins": 5.491776466369629, | |
| "rewards/rejected": -5.342501640319824, | |
| "step": 327, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.851671535215839, | |
| "grad_norm": 1.610142469406128, | |
| "learning_rate": 0.00013228804047714463, | |
| "logits/chosen": -0.8723031878471375, | |
| "logits/rejected": -0.8802396059036255, | |
| "logps/chosen": -6.0019707679748535, | |
| "logps/rejected": -67.33113861083984, | |
| "loss": 0.2763366401195526, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25310149788856506, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25009822845458984, | |
| "rewards/margins": 5.477874755859375, | |
| "rewards/rejected": -5.227776050567627, | |
| "step": 328, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8542680947744239, | |
| "grad_norm": 18.318506240844727, | |
| "learning_rate": 0.00013188099550192535, | |
| "logits/chosen": -0.8295834064483643, | |
| "logits/rejected": -0.838620662689209, | |
| "logps/chosen": -5.431742191314697, | |
| "logps/rejected": -62.13144302368164, | |
| "loss": 0.6254780292510986, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3839109241962433, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09875370562076569, | |
| "rewards/margins": 5.322996139526367, | |
| "rewards/rejected": -5.224242210388184, | |
| "step": 329, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8568646543330087, | |
| "grad_norm": 1.2672317028045654, | |
| "learning_rate": 0.000131473361688207, | |
| "logits/chosen": -0.8911533355712891, | |
| "logits/rejected": -0.8940534591674805, | |
| "logps/chosen": -5.854481220245361, | |
| "logps/rejected": -50.02248001098633, | |
| "loss": 0.34439149498939514, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.268149733543396, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32187986373901367, | |
| "rewards/margins": 4.458532810211182, | |
| "rewards/rejected": -4.136653423309326, | |
| "step": 330, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8594612138915937, | |
| "grad_norm": 1.345903754234314, | |
| "learning_rate": 0.00013106514656494148, | |
| "logits/chosen": -0.8426346182823181, | |
| "logits/rejected": -0.8419499397277832, | |
| "logps/chosen": -12.040822982788086, | |
| "logps/rejected": -51.06175231933594, | |
| "loss": 0.4810463786125183, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.42825689911842346, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2871994376182556, | |
| "rewards/margins": 4.3635358810424805, | |
| "rewards/rejected": -4.076336860656738, | |
| "step": 331, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8620577734501785, | |
| "grad_norm": 7.434391975402832, | |
| "learning_rate": 0.00013065635767181747, | |
| "logits/chosen": -0.8796988129615784, | |
| "logits/rejected": -0.8907098174095154, | |
| "logps/chosen": -4.122412204742432, | |
| "logps/rejected": -64.0143051147461, | |
| "loss": 0.30808770656585693, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21978120505809784, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24143238365650177, | |
| "rewards/margins": 5.337109088897705, | |
| "rewards/rejected": -5.095676422119141, | |
| "step": 332, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8646543330087634, | |
| "grad_norm": 42.690364837646484, | |
| "learning_rate": 0.0001302470025591211, | |
| "logits/chosen": -0.8691973686218262, | |
| "logits/rejected": -0.8755657076835632, | |
| "logps/chosen": -6.238379001617432, | |
| "logps/rejected": -57.67242431640625, | |
| "loss": 0.5189653635025024, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.360885351896286, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26926398277282715, | |
| "rewards/margins": 4.828179836273193, | |
| "rewards/rejected": -4.558915615081787, | |
| "step": 333, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8672508925673482, | |
| "grad_norm": 8.9744873046875, | |
| "learning_rate": 0.00012983708878759655, | |
| "logits/chosen": -0.9184461832046509, | |
| "logits/rejected": -0.9249346256256104, | |
| "logps/chosen": -9.006379127502441, | |
| "logps/rejected": -58.630638122558594, | |
| "loss": 0.5170425772666931, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4528915584087372, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3499585688114166, | |
| "rewards/margins": 4.760928153991699, | |
| "rewards/rejected": -4.4109697341918945, | |
| "step": 334, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8698474521259332, | |
| "grad_norm": 16.40105628967285, | |
| "learning_rate": 0.00012942662392830632, | |
| "logits/chosen": -0.8680149912834167, | |
| "logits/rejected": -0.8773718476295471, | |
| "logps/chosen": -4.468932151794434, | |
| "logps/rejected": -64.07333374023438, | |
| "loss": 0.29751056432724, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20176543295383453, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.29612603783607483, | |
| "rewards/margins": 5.261467456817627, | |
| "rewards/rejected": -4.965341567993164, | |
| "step": 335, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.872444011684518, | |
| "grad_norm": 13.411872863769531, | |
| "learning_rate": 0.0001290156155624914, | |
| "logits/chosen": -0.8806618452072144, | |
| "logits/rejected": -0.8878685832023621, | |
| "logps/chosen": -9.750197410583496, | |
| "logps/rejected": -64.2704849243164, | |
| "loss": 0.44853177666664124, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30135855078697205, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.0591825433075428, | |
| "rewards/margins": 5.037668228149414, | |
| "rewards/rejected": -4.978486061096191, | |
| "step": 336, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8750405712431029, | |
| "grad_norm": 1.5141712427139282, | |
| "learning_rate": 0.0001286040712814314, | |
| "logits/chosen": -0.9008548855781555, | |
| "logits/rejected": -0.9143273830413818, | |
| "logps/chosen": -4.234499931335449, | |
| "logps/rejected": -74.0651626586914, | |
| "loss": 0.2379544973373413, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2000884711742401, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4334224462509155, | |
| "rewards/margins": 6.484922409057617, | |
| "rewards/rejected": -6.051499366760254, | |
| "step": 337, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8776371308016878, | |
| "grad_norm": 0.8521820306777954, | |
| "learning_rate": 0.0001281919986863042, | |
| "logits/chosen": -0.8969717025756836, | |
| "logits/rejected": -0.9046814441680908, | |
| "logps/chosen": -7.235101699829102, | |
| "logps/rejected": -77.14093017578125, | |
| "loss": 0.273301899433136, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2426755428314209, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.320049524307251, | |
| "rewards/margins": 6.36985445022583, | |
| "rewards/rejected": -6.049805641174316, | |
| "step": 338, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8802336903602727, | |
| "grad_norm": 2.2374491691589355, | |
| "learning_rate": 0.00012777940538804544, | |
| "logits/chosen": -0.8919708132743835, | |
| "logits/rejected": -0.8931483626365662, | |
| "logps/chosen": -6.93287992477417, | |
| "logps/rejected": -61.636375427246094, | |
| "loss": 0.3472403883934021, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2957107722759247, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3734300136566162, | |
| "rewards/margins": 5.471829891204834, | |
| "rewards/rejected": -5.098400115966797, | |
| "step": 339, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8828302499188575, | |
| "grad_norm": 25.410560607910156, | |
| "learning_rate": 0.0001273662990072083, | |
| "logits/chosen": -0.8870843648910522, | |
| "logits/rejected": -0.8924081325531006, | |
| "logps/chosen": -7.52494478225708, | |
| "logps/rejected": -61.48851013183594, | |
| "loss": 0.7680293321609497, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5508996844291687, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.006981657352298498, | |
| "rewards/margins": 5.215488433837891, | |
| "rewards/rejected": -5.222470283508301, | |
| "step": 340, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8854268094774423, | |
| "grad_norm": 3.612856864929199, | |
| "learning_rate": 0.0001269526871738224, | |
| "logits/chosen": -0.9017181992530823, | |
| "logits/rejected": -0.906170666217804, | |
| "logps/chosen": -7.857571125030518, | |
| "logps/rejected": -63.468265533447266, | |
| "loss": 0.38538140058517456, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2516745924949646, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.179386705160141, | |
| "rewards/margins": 5.408325672149658, | |
| "rewards/rejected": -5.228938579559326, | |
| "step": 341, | |
| "train_speed(iter/s)": 0.005335 | |
| }, | |
| { | |
| "epoch": 0.8880233690360273, | |
| "grad_norm": 9.315306663513184, | |
| "learning_rate": 0.00012653857752725303, | |
| "logits/chosen": -0.88401198387146, | |
| "logits/rejected": -0.891493022441864, | |
| "logps/chosen": -7.122734546661377, | |
| "logps/rejected": -57.48167419433594, | |
| "loss": 0.5956651568412781, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4049210548400879, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09174284338951111, | |
| "rewards/margins": 4.561285972595215, | |
| "rewards/rejected": -4.469542503356934, | |
| "step": 342, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.8906199285946121, | |
| "grad_norm": 0.7824282050132751, | |
| "learning_rate": 0.00012612397771606014, | |
| "logits/chosen": -0.9107692837715149, | |
| "logits/rejected": -0.9192830324172974, | |
| "logps/chosen": -5.18141508102417, | |
| "logps/rejected": -63.883949279785156, | |
| "loss": 0.2276170253753662, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2009223848581314, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2666219174861908, | |
| "rewards/margins": 5.457507610321045, | |
| "rewards/rejected": -5.190885543823242, | |
| "step": 343, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.893216488153197, | |
| "grad_norm": 1.105103850364685, | |
| "learning_rate": 0.0001257088953978568, | |
| "logits/chosen": -0.8562593460083008, | |
| "logits/rejected": -0.8662354350090027, | |
| "logps/chosen": -7.01981258392334, | |
| "logps/rejected": -60.08414077758789, | |
| "loss": 0.2912936210632324, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23564513027668, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41656795144081116, | |
| "rewards/margins": 5.034234046936035, | |
| "rewards/rejected": -4.617666244506836, | |
| "step": 344, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.8958130477117819, | |
| "grad_norm": 3.4230287075042725, | |
| "learning_rate": 0.00012529333823916807, | |
| "logits/chosen": -0.8783853650093079, | |
| "logits/rejected": -0.8884921073913574, | |
| "logps/chosen": -4.188514232635498, | |
| "logps/rejected": -66.61878967285156, | |
| "loss": 0.4436146914958954, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2946454584598541, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18403561413288116, | |
| "rewards/margins": 5.612396240234375, | |
| "rewards/rejected": -5.428360939025879, | |
| "step": 345, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.8984096072703668, | |
| "grad_norm": 2.5396299362182617, | |
| "learning_rate": 0.00012487731391528918, | |
| "logits/chosen": -0.9642701745033264, | |
| "logits/rejected": -0.9674146175384521, | |
| "logps/chosen": -5.993198871612549, | |
| "logps/rejected": -60.531856536865234, | |
| "loss": 0.25893262028694153, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19595590233802795, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.26401805877685547, | |
| "rewards/margins": 5.092806339263916, | |
| "rewards/rejected": -4.828787803649902, | |
| "step": 346, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9010061668289516, | |
| "grad_norm": 2.3769822120666504, | |
| "learning_rate": 0.00012446083011014388, | |
| "logits/chosen": -0.9396705627441406, | |
| "logits/rejected": -0.9417209029197693, | |
| "logps/chosen": -7.586000919342041, | |
| "logps/rejected": -61.09663391113281, | |
| "loss": 0.36653196811676025, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26543620228767395, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2201276272535324, | |
| "rewards/margins": 5.081995010375977, | |
| "rewards/rejected": -4.8618669509887695, | |
| "step": 347, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9036027263875365, | |
| "grad_norm": 3.2100534439086914, | |
| "learning_rate": 0.00012404389451614253, | |
| "logits/chosen": -0.9353513121604919, | |
| "logits/rejected": -0.9401172995567322, | |
| "logps/chosen": -6.526828765869141, | |
| "logps/rejected": -56.59849548339844, | |
| "loss": 0.4251266419887543, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35948801040649414, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3049776554107666, | |
| "rewards/margins": 4.886538028717041, | |
| "rewards/rejected": -4.581560134887695, | |
| "step": 348, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9061992859461214, | |
| "grad_norm": 22.74829864501953, | |
| "learning_rate": 0.00012362651483403985, | |
| "logits/chosen": -0.9125022888183594, | |
| "logits/rejected": -0.9109125733375549, | |
| "logps/chosen": -8.987406730651855, | |
| "logps/rejected": -49.98797607421875, | |
| "loss": 0.5128880739212036, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.43219777941703796, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.27204346656799316, | |
| "rewards/margins": 4.296665191650391, | |
| "rewards/rejected": -4.024621486663818, | |
| "step": 349, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9087958455047063, | |
| "grad_norm": 2.0788931846618652, | |
| "learning_rate": 0.00012320869877279297, | |
| "logits/chosen": -0.9203197956085205, | |
| "logits/rejected": -0.9223061800003052, | |
| "logps/chosen": -10.433500289916992, | |
| "logps/rejected": -62.36846160888672, | |
| "loss": 0.4062730073928833, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35132896900177, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24331118166446686, | |
| "rewards/margins": 5.01633882522583, | |
| "rewards/rejected": -4.773027420043945, | |
| "step": 350, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9113924050632911, | |
| "grad_norm": 1.2080000638961792, | |
| "learning_rate": 0.0001227904540494188, | |
| "logits/chosen": -0.9349120855331421, | |
| "logits/rejected": -0.9338538646697998, | |
| "logps/chosen": -8.405929565429688, | |
| "logps/rejected": -57.93353271484375, | |
| "loss": 0.366677850484848, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31156450510025024, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25386035442352295, | |
| "rewards/margins": 5.119736671447754, | |
| "rewards/rejected": -4.865876197814941, | |
| "step": 351, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.9139889646218761, | |
| "grad_norm": 5.341267108917236, | |
| "learning_rate": 0.00012237178838885168, | |
| "logits/chosen": -0.9456449747085571, | |
| "logits/rejected": -0.9499503970146179, | |
| "logps/chosen": -6.785584926605225, | |
| "logps/rejected": -63.56637954711914, | |
| "loss": 0.3164372742176056, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21375565230846405, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3775550425052643, | |
| "rewards/margins": 5.603601455688477, | |
| "rewards/rejected": -5.226045608520508, | |
| "step": 352, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.9165855241804609, | |
| "grad_norm": 20.04754066467285, | |
| "learning_rate": 0.00012195270952380051, | |
| "logits/chosen": -0.9753867387771606, | |
| "logits/rejected": -0.9728374481201172, | |
| "logps/chosen": -8.288665771484375, | |
| "logps/rejected": -50.586734771728516, | |
| "loss": 0.45580485463142395, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.38007235527038574, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4403877258300781, | |
| "rewards/margins": 4.540890216827393, | |
| "rewards/rejected": -4.100502967834473, | |
| "step": 353, | |
| "train_speed(iter/s)": 0.005336 | |
| }, | |
| { | |
| "epoch": 0.9191820837390458, | |
| "grad_norm": 1.5026851892471313, | |
| "learning_rate": 0.0001215332251946061, | |
| "logits/chosen": -0.9055343866348267, | |
| "logits/rejected": -0.9097537398338318, | |
| "logps/chosen": -8.293628692626953, | |
| "logps/rejected": -65.0361099243164, | |
| "loss": 0.3375437557697296, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2872999310493469, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3178735375404358, | |
| "rewards/margins": 5.573904991149902, | |
| "rewards/rejected": -5.2560319900512695, | |
| "step": 354, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9217786432976306, | |
| "grad_norm": 9.46897029876709, | |
| "learning_rate": 0.0001211133431490981, | |
| "logits/chosen": -0.9408826231956482, | |
| "logits/rejected": -0.9440443515777588, | |
| "logps/chosen": -7.679222583770752, | |
| "logps/rejected": -58.07322311401367, | |
| "loss": 0.4588177502155304, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3633183538913727, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.35548433661460876, | |
| "rewards/margins": 5.1678056716918945, | |
| "rewards/rejected": -4.812321186065674, | |
| "step": 355, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9243752028562155, | |
| "grad_norm": 2.6942434310913086, | |
| "learning_rate": 0.00012069307114245196, | |
| "logits/chosen": -0.9773699045181274, | |
| "logits/rejected": -0.9839785099029541, | |
| "logps/chosen": -6.199317932128906, | |
| "logps/rejected": -51.811275482177734, | |
| "loss": 0.33174929022789, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20409320294857025, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2277924120426178, | |
| "rewards/margins": 3.9625682830810547, | |
| "rewards/rejected": -3.734776020050049, | |
| "step": 356, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9269717624148004, | |
| "grad_norm": 1.542070746421814, | |
| "learning_rate": 0.00012027241693704567, | |
| "logits/chosen": -0.9564674496650696, | |
| "logits/rejected": -0.958985447883606, | |
| "logps/chosen": -4.848186016082764, | |
| "logps/rejected": -64.11177062988281, | |
| "loss": 0.2734638750553131, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22212821245193481, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2529650330543518, | |
| "rewards/margins": 5.414011478424072, | |
| "rewards/rejected": -5.161045074462891, | |
| "step": 357, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9295683219733852, | |
| "grad_norm": 1.618640422821045, | |
| "learning_rate": 0.00011985138830231637, | |
| "logits/chosen": -0.952854573726654, | |
| "logits/rejected": -0.9557262063026428, | |
| "logps/chosen": -7.695744514465332, | |
| "logps/rejected": -64.7623062133789, | |
| "loss": 0.27667006850242615, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2487485110759735, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18947187066078186, | |
| "rewards/margins": 5.626814365386963, | |
| "rewards/rejected": -5.437342166900635, | |
| "step": 358, | |
| "train_speed(iter/s)": 0.005337 | |
| }, | |
| { | |
| "epoch": 0.9321648815319702, | |
| "grad_norm": 9.904494285583496, | |
| "learning_rate": 0.00011942999301461693, | |
| "logits/chosen": -0.9912068247795105, | |
| "logits/rejected": -1.0118963718414307, | |
| "logps/chosen": -6.654687881469727, | |
| "logps/rejected": -68.99776458740234, | |
| "loss": 0.3964228332042694, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27639806270599365, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.22217164933681488, | |
| "rewards/margins": 5.643857479095459, | |
| "rewards/rejected": -5.421686172485352, | |
| "step": 359, | |
| "train_speed(iter/s)": 0.005338 | |
| }, | |
| { | |
| "epoch": 0.934761441090555, | |
| "grad_norm": 2.499595880508423, | |
| "learning_rate": 0.00011900823885707215, | |
| "logits/chosen": -0.9873682260513306, | |
| "logits/rejected": -0.9983680248260498, | |
| "logps/chosen": -7.571791172027588, | |
| "logps/rejected": -69.42076110839844, | |
| "loss": 0.6393591165542603, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4515572786331177, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.013363976031541824, | |
| "rewards/margins": 5.555707931518555, | |
| "rewards/rejected": -5.542343616485596, | |
| "step": 360, | |
| "train_speed(iter/s)": 0.005338 | |
| }, | |
| { | |
| "epoch": 0.9373580006491399, | |
| "grad_norm": 5.06946325302124, | |
| "learning_rate": 0.00011858613361943518, | |
| "logits/chosen": -0.9797115325927734, | |
| "logits/rejected": -0.9833052754402161, | |
| "logps/chosen": -7.266734600067139, | |
| "logps/rejected": -66.09844207763672, | |
| "loss": 0.27793920040130615, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2126695215702057, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08487731218338013, | |
| "rewards/margins": 5.504128456115723, | |
| "rewards/rejected": -5.419251441955566, | |
| "step": 361, | |
| "train_speed(iter/s)": 0.005338 | |
| }, | |
| { | |
| "epoch": 0.9399545602077247, | |
| "grad_norm": 1.6952695846557617, | |
| "learning_rate": 0.00011816368509794364, | |
| "logits/chosen": -0.9289021492004395, | |
| "logits/rejected": -0.933040201663971, | |
| "logps/chosen": -8.65612506866455, | |
| "logps/rejected": -65.69309997558594, | |
| "loss": 0.3674156665802002, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3314497768878937, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4269205629825592, | |
| "rewards/margins": 5.734676837921143, | |
| "rewards/rejected": -5.307756423950195, | |
| "step": 362, | |
| "train_speed(iter/s)": 0.005338 | |
| }, | |
| { | |
| "epoch": 0.9425511197663097, | |
| "grad_norm": 1.0782965421676636, | |
| "learning_rate": 0.00011774090109517551, | |
| "logits/chosen": -0.946650505065918, | |
| "logits/rejected": -0.9464154243469238, | |
| "logps/chosen": -5.612125396728516, | |
| "logps/rejected": -56.009986877441406, | |
| "loss": 0.30003514885902405, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2715224027633667, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2884294390678406, | |
| "rewards/margins": 5.06643009185791, | |
| "rewards/rejected": -4.778000354766846, | |
| "step": 363, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 0.9451476793248945, | |
| "grad_norm": 7.0804009437561035, | |
| "learning_rate": 0.00011731778941990496, | |
| "logits/chosen": -0.9121062755584717, | |
| "logits/rejected": -0.9164551496505737, | |
| "logps/chosen": -9.16533088684082, | |
| "logps/rejected": -54.61601257324219, | |
| "loss": 0.5863555073738098, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.43649864196777344, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.23763269186019897, | |
| "rewards/margins": 4.418910026550293, | |
| "rewards/rejected": -4.181277275085449, | |
| "step": 364, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 0.9477442388834794, | |
| "grad_norm": 1.0685062408447266, | |
| "learning_rate": 0.00011689435788695844, | |
| "logits/chosen": -0.9457142353057861, | |
| "logits/rejected": -0.946734607219696, | |
| "logps/chosen": -7.535189151763916, | |
| "logps/rejected": -57.889957427978516, | |
| "loss": 0.3278339207172394, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3113463819026947, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2534429132938385, | |
| "rewards/margins": 5.122234344482422, | |
| "rewards/rejected": -4.868791103363037, | |
| "step": 365, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 0.9503407984420643, | |
| "grad_norm": 18.325923919677734, | |
| "learning_rate": 0.00011647061431707, | |
| "logits/chosen": -0.9664883017539978, | |
| "logits/rejected": -0.9706634283065796, | |
| "logps/chosen": -8.00462818145752, | |
| "logps/rejected": -58.485496520996094, | |
| "loss": 0.5252708792686462, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.40657514333724976, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.16244688630104065, | |
| "rewards/margins": 4.640269756317139, | |
| "rewards/rejected": -4.477822303771973, | |
| "step": 366, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 0.9529373580006492, | |
| "grad_norm": 1.7476553916931152, | |
| "learning_rate": 0.00011604656653673707, | |
| "logits/chosen": -0.9371016025543213, | |
| "logits/rejected": -0.9420011639595032, | |
| "logps/chosen": -8.489301681518555, | |
| "logps/rejected": -60.067012786865234, | |
| "loss": 0.2864355146884918, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2481742799282074, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3987981975078583, | |
| "rewards/margins": 5.001021862030029, | |
| "rewards/rejected": -4.602223873138428, | |
| "step": 367, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 0.955533917559234, | |
| "grad_norm": 0.7240554094314575, | |
| "learning_rate": 0.0001156222223780757, | |
| "logits/chosen": -0.9764981865882874, | |
| "logits/rejected": -0.9823321104049683, | |
| "logps/chosen": -3.561066150665283, | |
| "logps/rejected": -64.69168853759766, | |
| "loss": 0.15193597972393036, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13965152204036713, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31303656101226807, | |
| "rewards/margins": 5.628165245056152, | |
| "rewards/rejected": -5.315129280090332, | |
| "step": 368, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 0.9581304771178188, | |
| "grad_norm": 0.8999217748641968, | |
| "learning_rate": 0.00011519758967867606, | |
| "logits/chosen": -0.9562562704086304, | |
| "logits/rejected": -0.9621536731719971, | |
| "logps/chosen": -4.751138210296631, | |
| "logps/rejected": -66.24119567871094, | |
| "loss": 0.19877935945987701, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17447549104690552, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2585357129573822, | |
| "rewards/margins": 5.8691558837890625, | |
| "rewards/rejected": -5.610620498657227, | |
| "step": 369, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 0.9607270366764038, | |
| "grad_norm": 7.604972839355469, | |
| "learning_rate": 0.00011477267628145776, | |
| "logits/chosen": -0.9861749410629272, | |
| "logits/rejected": -0.9912722706794739, | |
| "logps/chosen": -7.531174182891846, | |
| "logps/rejected": -59.80250549316406, | |
| "loss": 0.43909671902656555, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.34136056900024414, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14466743171215057, | |
| "rewards/margins": 4.875586986541748, | |
| "rewards/rejected": -4.730918884277344, | |
| "step": 370, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 0.9633235962349886, | |
| "grad_norm": 1.2200195789337158, | |
| "learning_rate": 0.00011434749003452467, | |
| "logits/chosen": -1.0024657249450684, | |
| "logits/rejected": -1.0117108821868896, | |
| "logps/chosen": -4.926345348358154, | |
| "logps/rejected": -64.41602325439453, | |
| "loss": 0.24037624895572662, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19864444434642792, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3361244201660156, | |
| "rewards/margins": 5.382260322570801, | |
| "rewards/rejected": -5.046136379241943, | |
| "step": 371, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 0.9659201557935735, | |
| "grad_norm": 1.4470072984695435, | |
| "learning_rate": 0.00011392203879102025, | |
| "logits/chosen": -0.9764466881752014, | |
| "logits/rejected": -0.984937846660614, | |
| "logps/chosen": -4.395660400390625, | |
| "logps/rejected": -72.33343505859375, | |
| "loss": 0.21519267559051514, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16430063545703888, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4711214303970337, | |
| "rewards/margins": 6.096909046173096, | |
| "rewards/rejected": -5.625787734985352, | |
| "step": 372, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 0.9685167153521584, | |
| "grad_norm": 3.041203737258911, | |
| "learning_rate": 0.00011349633040898247, | |
| "logits/chosen": -1.0063599348068237, | |
| "logits/rejected": -1.015335202217102, | |
| "logps/chosen": -5.668739318847656, | |
| "logps/rejected": -67.33605194091797, | |
| "loss": 0.2572421133518219, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1989455670118332, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4027881622314453, | |
| "rewards/margins": 5.818880558013916, | |
| "rewards/rejected": -5.416092872619629, | |
| "step": 373, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 0.9711132749107433, | |
| "grad_norm": 6.189421653747559, | |
| "learning_rate": 0.00011307037275119853, | |
| "logits/chosen": -1.072676181793213, | |
| "logits/rejected": -1.0726059675216675, | |
| "logps/chosen": -11.18874454498291, | |
| "logps/rejected": -57.087642669677734, | |
| "loss": 0.6298056840896606, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4115663468837738, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14192688465118408, | |
| "rewards/margins": 4.86482572555542, | |
| "rewards/rejected": -4.722898483276367, | |
| "step": 374, | |
| "train_speed(iter/s)": 0.005342 | |
| }, | |
| { | |
| "epoch": 0.9737098344693281, | |
| "grad_norm": 7.813536167144775, | |
| "learning_rate": 0.00011264417368505981, | |
| "logits/chosen": -0.9870294332504272, | |
| "logits/rejected": -0.9871564507484436, | |
| "logps/chosen": -7.496246337890625, | |
| "logps/rejected": -55.7673454284668, | |
| "loss": 0.5474833846092224, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4691420793533325, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2661711573600769, | |
| "rewards/margins": 4.8272881507873535, | |
| "rewards/rejected": -4.561116695404053, | |
| "step": 375, | |
| "train_speed(iter/s)": 0.005342 | |
| }, | |
| { | |
| "epoch": 0.976306394027913, | |
| "grad_norm": 1.4118865728378296, | |
| "learning_rate": 0.00011221774108241645, | |
| "logits/chosen": -1.0178087949752808, | |
| "logits/rejected": -1.0260872840881348, | |
| "logps/chosen": -4.35853910446167, | |
| "logps/rejected": -63.377872467041016, | |
| "loss": 0.2507343292236328, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17132747173309326, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22918272018432617, | |
| "rewards/margins": 5.319854736328125, | |
| "rewards/rejected": -5.090672016143799, | |
| "step": 376, | |
| "train_speed(iter/s)": 0.005342 | |
| }, | |
| { | |
| "epoch": 0.9789029535864979, | |
| "grad_norm": 1.3914563655853271, | |
| "learning_rate": 0.0001117910828194319, | |
| "logits/chosen": -1.004896640777588, | |
| "logits/rejected": -1.000983715057373, | |
| "logps/chosen": -7.156683444976807, | |
| "logps/rejected": -54.51406478881836, | |
| "loss": 0.30924680829048157, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25739455223083496, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24743176996707916, | |
| "rewards/margins": 4.668411731719971, | |
| "rewards/rejected": -4.4209794998168945, | |
| "step": 377, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9814995131450828, | |
| "grad_norm": 2.6997230052948, | |
| "learning_rate": 0.00011136420677643762, | |
| "logits/chosen": -1.02091646194458, | |
| "logits/rejected": -1.0249969959259033, | |
| "logps/chosen": -5.773136615753174, | |
| "logps/rejected": -64.33428955078125, | |
| "loss": 0.4387259781360626, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31376269459724426, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2982335686683655, | |
| "rewards/margins": 5.575780391693115, | |
| "rewards/rejected": -5.2775468826293945, | |
| "step": 378, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9840960727036676, | |
| "grad_norm": 2.8990633487701416, | |
| "learning_rate": 0.00011093712083778746, | |
| "logits/chosen": -1.0018008947372437, | |
| "logits/rejected": -1.0064812898635864, | |
| "logps/chosen": -6.614377021789551, | |
| "logps/rejected": -67.86730194091797, | |
| "loss": 0.309373140335083, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2491704821586609, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.311954140663147, | |
| "rewards/margins": 5.89847469329834, | |
| "rewards/rejected": -5.586519718170166, | |
| "step": 379, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9866926322622526, | |
| "grad_norm": 1.8598626852035522, | |
| "learning_rate": 0.00011050983289171195, | |
| "logits/chosen": -1.0007565021514893, | |
| "logits/rejected": -1.0053094625473022, | |
| "logps/chosen": -4.953035354614258, | |
| "logps/rejected": -60.55445861816406, | |
| "loss": 0.22382761538028717, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1699100136756897, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2609115540981293, | |
| "rewards/margins": 5.4445085525512695, | |
| "rewards/rejected": -5.183596134185791, | |
| "step": 380, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9892891918208374, | |
| "grad_norm": 2.610196828842163, | |
| "learning_rate": 0.00011008235083017271, | |
| "logits/chosen": -1.0573437213897705, | |
| "logits/rejected": -1.059203028678894, | |
| "logps/chosen": -5.614582538604736, | |
| "logps/rejected": -67.13617706298828, | |
| "loss": 0.32841193675994873, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21658550202846527, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1962202787399292, | |
| "rewards/margins": 5.73972225189209, | |
| "rewards/rejected": -5.543501853942871, | |
| "step": 381, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9918857513794223, | |
| "grad_norm": 2.123706102371216, | |
| "learning_rate": 0.00010965468254871669, | |
| "logits/chosen": -1.0279793739318848, | |
| "logits/rejected": -1.027879238128662, | |
| "logps/chosen": -7.853454113006592, | |
| "logps/rejected": -57.6713752746582, | |
| "loss": 0.3230496346950531, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2656661570072174, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1339038908481598, | |
| "rewards/margins": 4.969094276428223, | |
| "rewards/rejected": -4.835190296173096, | |
| "step": 382, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9944823109380071, | |
| "grad_norm": 1.48650062084198, | |
| "learning_rate": 0.00010922683594633021, | |
| "logits/chosen": -1.0191617012023926, | |
| "logits/rejected": -1.0311510562896729, | |
| "logps/chosen": -5.478486061096191, | |
| "logps/rejected": -63.874629974365234, | |
| "loss": 0.2811015844345093, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2152327299118042, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2903039753437042, | |
| "rewards/margins": 5.215958118438721, | |
| "rewards/rejected": -4.92565393447876, | |
| "step": 383, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.997078870496592, | |
| "grad_norm": 6.09173059463501, | |
| "learning_rate": 0.00010879881892529324, | |
| "logits/chosen": -1.013049602508545, | |
| "logits/rejected": -1.0167346000671387, | |
| "logps/chosen": -6.224278450012207, | |
| "logps/rejected": -59.02324295043945, | |
| "loss": 0.29393669962882996, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21503983438014984, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43577679991722107, | |
| "rewards/margins": 4.863895416259766, | |
| "rewards/rejected": -4.428118705749512, | |
| "step": 384, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 0.9996754300551769, | |
| "grad_norm": 3.398437976837158, | |
| "learning_rate": 0.00010837063939103332, | |
| "logits/chosen": -1.006939172744751, | |
| "logits/rejected": -1.0076408386230469, | |
| "logps/chosen": -7.99960470199585, | |
| "logps/rejected": -55.3328971862793, | |
| "loss": 0.586876392364502, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4625084102153778, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.061562374234199524, | |
| "rewards/margins": 4.382445812225342, | |
| "rewards/rejected": -4.320883750915527, | |
| "step": 385, | |
| "train_speed(iter/s)": 0.005343 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 3.398437976837158, | |
| "learning_rate": 0.0001079423052519796, | |
| "logits/chosen": -1.0445483922958374, | |
| "logits/rejected": -1.067384958267212, | |
| "logps/chosen": -0.5868608355522156, | |
| "logps/rejected": -66.0391616821289, | |
| "loss": 0.007936220616102219, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.04896550625562668, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.21240469813346863, | |
| "rewards/margins": 5.356934070587158, | |
| "rewards/rejected": -5.144529819488525, | |
| "step": 386, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0025965595585848, | |
| "grad_norm": 19.228408813476562, | |
| "learning_rate": 0.00010751382441941678, | |
| "logits/chosen": -0.9817072749137878, | |
| "logits/rejected": -0.9876554012298584, | |
| "logps/chosen": -10.516595840454102, | |
| "logps/rejected": -58.05045700073242, | |
| "loss": 0.6290792226791382, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4879079759120941, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.6398650407791138, | |
| "rewards/margins": 4.8145246505737305, | |
| "rewards/rejected": -4.174659729003906, | |
| "step": 387, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0051931191171697, | |
| "grad_norm": 20.29606819152832, | |
| "learning_rate": 0.00010708520480733894, | |
| "logits/chosen": -0.9528878331184387, | |
| "logits/rejected": -0.9571166038513184, | |
| "logps/chosen": -5.756232738494873, | |
| "logps/rejected": -55.34486389160156, | |
| "loss": 0.36920851469039917, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3217727243900299, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43254968523979187, | |
| "rewards/margins": 4.792313575744629, | |
| "rewards/rejected": -4.3597636222839355, | |
| "step": 388, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0077896786757545, | |
| "grad_norm": 1.2253527641296387, | |
| "learning_rate": 0.00010665645433230344, | |
| "logits/chosen": -0.963991105556488, | |
| "logits/rejected": -0.9693760275840759, | |
| "logps/chosen": -4.665340900421143, | |
| "logps/rejected": -49.67149353027344, | |
| "loss": 0.2663205564022064, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2073584645986557, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5366206765174866, | |
| "rewards/margins": 4.278485298156738, | |
| "rewards/rejected": -3.7418649196624756, | |
| "step": 389, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 1.0103862382343396, | |
| "grad_norm": 1.7141112089157104, | |
| "learning_rate": 0.00010622758091328469, | |
| "logits/chosen": -0.9876523613929749, | |
| "logits/rejected": -0.9932205677032471, | |
| "logps/chosen": -5.421288967132568, | |
| "logps/rejected": -53.175601959228516, | |
| "loss": 0.2864997982978821, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22578980028629303, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.650011420249939, | |
| "rewards/margins": 4.690655708312988, | |
| "rewards/rejected": -4.04064416885376, | |
| "step": 390, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0129827977929244, | |
| "grad_norm": 0.9784797430038452, | |
| "learning_rate": 0.00010579859247152772, | |
| "logits/chosen": -0.9702428579330444, | |
| "logits/rejected": -0.9770087599754333, | |
| "logps/chosen": -3.717294692993164, | |
| "logps/rejected": -54.88421630859375, | |
| "loss": 0.18811215460300446, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15398232638835907, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5122168660163879, | |
| "rewards/margins": 4.824542999267578, | |
| "rewards/rejected": -4.312326431274414, | |
| "step": 391, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 1.0155793573515093, | |
| "grad_norm": 1.4829105138778687, | |
| "learning_rate": 0.00010536949693040224, | |
| "logits/chosen": -0.9901302456855774, | |
| "logits/rejected": -0.9919001460075378, | |
| "logps/chosen": -4.703402519226074, | |
| "logps/rejected": -46.348514556884766, | |
| "loss": 0.23413625359535217, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1849011927843094, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5978916883468628, | |
| "rewards/margins": 4.413217544555664, | |
| "rewards/rejected": -3.8153257369995117, | |
| "step": 392, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 1.0181759169100941, | |
| "grad_norm": 0.8022202253341675, | |
| "learning_rate": 0.00010494030221525581, | |
| "logits/chosen": -1.0340824127197266, | |
| "logits/rejected": -1.040837049484253, | |
| "logps/chosen": -6.395625114440918, | |
| "logps/rejected": -58.842002868652344, | |
| "loss": 0.23915542662143707, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2224937230348587, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.25003036856651306, | |
| "rewards/margins": 4.86290168762207, | |
| "rewards/rejected": -4.612870693206787, | |
| "step": 393, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 1.020772476468679, | |
| "grad_norm": 2.875991106033325, | |
| "learning_rate": 0.00010451101625326798, | |
| "logits/chosen": -1.0399117469787598, | |
| "logits/rejected": -1.0477368831634521, | |
| "logps/chosen": -5.4347615242004395, | |
| "logps/rejected": -62.94850158691406, | |
| "loss": 0.2218306064605713, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18997295200824738, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5420814752578735, | |
| "rewards/margins": 5.414422988891602, | |
| "rewards/rejected": -4.872342109680176, | |
| "step": 394, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0233690360272638, | |
| "grad_norm": 2.076349973678589, | |
| "learning_rate": 0.00010408164697330347, | |
| "logits/chosen": -1.0666667222976685, | |
| "logits/rejected": -1.072896122932434, | |
| "logps/chosen": -4.46807336807251, | |
| "logps/rejected": -63.26573944091797, | |
| "loss": 0.25682011246681213, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2303263247013092, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3944869935512543, | |
| "rewards/margins": 5.512956619262695, | |
| "rewards/rejected": -5.118469715118408, | |
| "step": 395, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0259655955858487, | |
| "grad_norm": 0.7809150815010071, | |
| "learning_rate": 0.0001036522023057659, | |
| "logits/chosen": -1.0214073657989502, | |
| "logits/rejected": -1.0335733890533447, | |
| "logps/chosen": -6.993215560913086, | |
| "logps/rejected": -76.31700134277344, | |
| "loss": 0.2290063351392746, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21447491645812988, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6252080202102661, | |
| "rewards/margins": 6.392251014709473, | |
| "rewards/rejected": -5.767043113708496, | |
| "step": 396, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0285621551444337, | |
| "grad_norm": 0.9348388910293579, | |
| "learning_rate": 0.00010322269018245128, | |
| "logits/chosen": -1.0821815729141235, | |
| "logits/rejected": -1.09281587600708, | |
| "logps/chosen": -5.995283126831055, | |
| "logps/rejected": -68.71944427490234, | |
| "loss": 0.2534785866737366, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23875081539154053, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.42260050773620605, | |
| "rewards/margins": 6.026902198791504, | |
| "rewards/rejected": -5.604302406311035, | |
| "step": 397, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0311587147030186, | |
| "grad_norm": 2.3803582191467285, | |
| "learning_rate": 0.00010279311853640156, | |
| "logits/chosen": -1.0678625106811523, | |
| "logits/rejected": -1.0740766525268555, | |
| "logps/chosen": -4.724799633026123, | |
| "logps/rejected": -59.92235565185547, | |
| "loss": 0.26597142219543457, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21491315960884094, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3383842706680298, | |
| "rewards/margins": 5.239107131958008, | |
| "rewards/rejected": -4.900722503662109, | |
| "step": 398, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0337552742616034, | |
| "grad_norm": 0.9540591835975647, | |
| "learning_rate": 0.00010236349530175806, | |
| "logits/chosen": -1.101372480392456, | |
| "logits/rejected": -1.1012152433395386, | |
| "logps/chosen": -8.496014595031738, | |
| "logps/rejected": -63.654239654541016, | |
| "loss": 0.2421647608280182, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.229741632938385, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5306934118270874, | |
| "rewards/margins": 5.865250587463379, | |
| "rewards/rejected": -5.33455753326416, | |
| "step": 399, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.0363518338201883, | |
| "grad_norm": 38.899085998535156, | |
| "learning_rate": 0.0001019338284136149, | |
| "logits/chosen": -1.141862154006958, | |
| "logits/rejected": -1.1475955247879028, | |
| "logps/chosen": -7.130688667297363, | |
| "logps/rejected": -71.88350677490234, | |
| "loss": 0.2930022180080414, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2670814096927643, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2902993857860565, | |
| "rewards/margins": 5.992380142211914, | |
| "rewards/rejected": -5.702080726623535, | |
| "step": 400, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 1.038948393378773, | |
| "grad_norm": 2.7088816165924072, | |
| "learning_rate": 0.0001015041258078725, | |
| "logits/chosen": -1.1285897493362427, | |
| "logits/rejected": -1.1310758590698242, | |
| "logps/chosen": -5.603566646575928, | |
| "logps/rejected": -61.33863067626953, | |
| "loss": 0.3561743497848511, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2987910509109497, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5551941990852356, | |
| "rewards/margins": 5.580060005187988, | |
| "rewards/rejected": -5.024865627288818, | |
| "step": 401, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.041544952937358, | |
| "grad_norm": 0.8148896098136902, | |
| "learning_rate": 0.00010107439542109096, | |
| "logits/chosen": -1.121638298034668, | |
| "logits/rejected": -1.1334351301193237, | |
| "logps/chosen": -3.9921107292175293, | |
| "logps/rejected": -73.31179809570312, | |
| "loss": 0.18677955865859985, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1822265237569809, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5457329750061035, | |
| "rewards/margins": 6.892066955566406, | |
| "rewards/rejected": -6.346334457397461, | |
| "step": 402, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.0441415124959428, | |
| "grad_norm": 1.029624104499817, | |
| "learning_rate": 0.00010064464519034358, | |
| "logits/chosen": -1.1337131261825562, | |
| "logits/rejected": -1.1473417282104492, | |
| "logps/chosen": -4.090713024139404, | |
| "logps/rejected": -77.2343978881836, | |
| "loss": 0.21103273332118988, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18134111166000366, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.30427786707878113, | |
| "rewards/margins": 6.670842170715332, | |
| "rewards/rejected": -6.366564750671387, | |
| "step": 403, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.0467380720545278, | |
| "grad_norm": 1.2710298299789429, | |
| "learning_rate": 0.00010021488305307002, | |
| "logits/chosen": -1.1442415714263916, | |
| "logits/rejected": -1.1480284929275513, | |
| "logps/chosen": -4.857927322387695, | |
| "logps/rejected": -64.70890045166016, | |
| "loss": 0.24422866106033325, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21266308426856995, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46621280908584595, | |
| "rewards/margins": 5.662542343139648, | |
| "rewards/rejected": -5.1963300704956055, | |
| "step": 404, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0493346316131127, | |
| "grad_norm": 0.7117511034011841, | |
| "learning_rate": 9.978511694692999e-05, | |
| "logits/chosen": -1.1403015851974487, | |
| "logits/rejected": -1.1483004093170166, | |
| "logps/chosen": -6.501082897186279, | |
| "logps/rejected": -68.161865234375, | |
| "loss": 0.2804066836833954, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22950297594070435, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.26065731048583984, | |
| "rewards/margins": 5.946385383605957, | |
| "rewards/rejected": -5.685728073120117, | |
| "step": 405, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0519311911716975, | |
| "grad_norm": 1.8634769916534424, | |
| "learning_rate": 9.935535480965648e-05, | |
| "logits/chosen": -1.174145221710205, | |
| "logits/rejected": -1.1830925941467285, | |
| "logps/chosen": -5.915862083435059, | |
| "logps/rejected": -81.09744262695312, | |
| "loss": 0.18793915212154388, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18054337799549103, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49257692694664, | |
| "rewards/margins": 6.884129047393799, | |
| "rewards/rejected": -6.391551971435547, | |
| "step": 406, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0545277507302824, | |
| "grad_norm": 2.999732732772827, | |
| "learning_rate": 9.892560457890906e-05, | |
| "logits/chosen": -1.1771910190582275, | |
| "logits/rejected": -1.182723045349121, | |
| "logps/chosen": -4.092665672302246, | |
| "logps/rejected": -75.03519439697266, | |
| "loss": 0.2703268527984619, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.217498779296875, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5273224115371704, | |
| "rewards/margins": 6.906276226043701, | |
| "rewards/rejected": -6.378953456878662, | |
| "step": 407, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0571243102888672, | |
| "grad_norm": 1.1191706657409668, | |
| "learning_rate": 9.849587419212751e-05, | |
| "logits/chosen": -1.1794843673706055, | |
| "logits/rejected": -1.1921828985214233, | |
| "logps/chosen": -2.9631309509277344, | |
| "logps/rejected": -65.27130126953125, | |
| "loss": 0.15160685777664185, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12793675065040588, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5282881855964661, | |
| "rewards/margins": 6.006821155548096, | |
| "rewards/rejected": -5.478532791137695, | |
| "step": 408, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.059720869847452, | |
| "grad_norm": 1.0475082397460938, | |
| "learning_rate": 9.806617158638515e-05, | |
| "logits/chosen": -1.2007383108139038, | |
| "logits/rejected": -1.2024704217910767, | |
| "logps/chosen": -7.0153350830078125, | |
| "logps/rejected": -73.69622039794922, | |
| "loss": 0.22654809057712555, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21019339561462402, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3381541073322296, | |
| "rewards/margins": 6.361845970153809, | |
| "rewards/rejected": -6.023691654205322, | |
| "step": 409, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.062317429406037, | |
| "grad_norm": 0.9155303835868835, | |
| "learning_rate": 9.763650469824196e-05, | |
| "logits/chosen": -1.1522904634475708, | |
| "logits/rejected": -1.1580644845962524, | |
| "logps/chosen": -7.180323600769043, | |
| "logps/rejected": -70.96688842773438, | |
| "loss": 0.23980437219142914, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23318149149417877, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4015149474143982, | |
| "rewards/margins": 6.299011707305908, | |
| "rewards/rejected": -5.897497177124023, | |
| "step": 410, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.064913988964622, | |
| "grad_norm": 10.754075050354004, | |
| "learning_rate": 9.720688146359843e-05, | |
| "logits/chosen": -1.189253568649292, | |
| "logits/rejected": -1.1925952434539795, | |
| "logps/chosen": -9.017038345336914, | |
| "logps/rejected": -68.37117767333984, | |
| "loss": 0.346275269985199, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2631103992462158, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2936975359916687, | |
| "rewards/margins": 6.014129161834717, | |
| "rewards/rejected": -5.720431327819824, | |
| "step": 411, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0675105485232068, | |
| "grad_norm": 5.042325019836426, | |
| "learning_rate": 9.677730981754876e-05, | |
| "logits/chosen": -1.2106777429580688, | |
| "logits/rejected": -1.2027477025985718, | |
| "logps/chosen": -10.420255661010742, | |
| "logps/rejected": -61.35327911376953, | |
| "loss": 0.35904085636138916, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3351891040802002, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5399136543273926, | |
| "rewards/margins": 5.419702529907227, | |
| "rewards/rejected": -4.879788875579834, | |
| "step": 412, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0701071080817917, | |
| "grad_norm": 1.102660894393921, | |
| "learning_rate": 9.63477976942341e-05, | |
| "logits/chosen": -1.2155516147613525, | |
| "logits/rejected": -1.2208374738693237, | |
| "logps/chosen": -4.927253723144531, | |
| "logps/rejected": -68.66384887695312, | |
| "loss": 0.2387477606534958, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20795047283172607, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48150452971458435, | |
| "rewards/margins": 6.018568992614746, | |
| "rewards/rejected": -5.537064552307129, | |
| "step": 413, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0727036676403765, | |
| "grad_norm": 2.5885398387908936, | |
| "learning_rate": 9.591835302669657e-05, | |
| "logits/chosen": -1.2256488800048828, | |
| "logits/rejected": -1.2182636260986328, | |
| "logps/chosen": -7.875158309936523, | |
| "logps/rejected": -61.765113830566406, | |
| "loss": 0.28974008560180664, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25022780895233154, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4521024823188782, | |
| "rewards/margins": 5.778402328491211, | |
| "rewards/rejected": -5.326300144195557, | |
| "step": 414, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0753002271989613, | |
| "grad_norm": 2.834430456161499, | |
| "learning_rate": 9.548898374673204e-05, | |
| "logits/chosen": -1.2157726287841797, | |
| "logits/rejected": -1.220966100692749, | |
| "logps/chosen": -3.8334553241729736, | |
| "logps/rejected": -61.09181213378906, | |
| "loss": 0.41990533471107483, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3681584596633911, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19060057401657104, | |
| "rewards/margins": 5.299651622772217, | |
| "rewards/rejected": -5.109050750732422, | |
| "step": 415, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0778967867575462, | |
| "grad_norm": 1.1838082075119019, | |
| "learning_rate": 9.505969778474417e-05, | |
| "logits/chosen": -1.2442048788070679, | |
| "logits/rejected": -1.2560878992080688, | |
| "logps/chosen": -6.319258689880371, | |
| "logps/rejected": -69.6029052734375, | |
| "loss": 0.3231492340564728, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30189916491508484, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43841037154197693, | |
| "rewards/margins": 6.017553329467773, | |
| "rewards/rejected": -5.5791425704956055, | |
| "step": 416, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.080493346316131, | |
| "grad_norm": 1.357805609703064, | |
| "learning_rate": 9.463050306959781e-05, | |
| "logits/chosen": -1.2448838949203491, | |
| "logits/rejected": -1.2514715194702148, | |
| "logps/chosen": -4.3993000984191895, | |
| "logps/rejected": -73.56219482421875, | |
| "loss": 0.1892472356557846, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16478529572486877, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.26193705201148987, | |
| "rewards/margins": 6.293513298034668, | |
| "rewards/rejected": -6.031576156616211, | |
| "step": 417, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.083089905874716, | |
| "grad_norm": 0.948700487613678, | |
| "learning_rate": 9.42014075284723e-05, | |
| "logits/chosen": -1.2140638828277588, | |
| "logits/rejected": -1.2203437089920044, | |
| "logps/chosen": -5.3918375968933105, | |
| "logps/rejected": -79.55841064453125, | |
| "loss": 0.1978967785835266, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18335530161857605, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5024500489234924, | |
| "rewards/margins": 6.943933963775635, | |
| "rewards/rejected": -6.441484451293945, | |
| "step": 418, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.085686465433301, | |
| "grad_norm": 0.8673838376998901, | |
| "learning_rate": 9.377241908671532e-05, | |
| "logits/chosen": -1.2066748142242432, | |
| "logits/rejected": -1.2199989557266235, | |
| "logps/chosen": -2.639554738998413, | |
| "logps/rejected": -72.2052001953125, | |
| "loss": 0.1263066977262497, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.09473444521427155, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.511016845703125, | |
| "rewards/margins": 6.307302474975586, | |
| "rewards/rejected": -5.796286106109619, | |
| "step": 419, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.0882830249918858, | |
| "grad_norm": 6.662075996398926, | |
| "learning_rate": 9.334354566769658e-05, | |
| "logits/chosen": -1.2155200242996216, | |
| "logits/rejected": -1.2136273384094238, | |
| "logps/chosen": -5.998470306396484, | |
| "logps/rejected": -68.34226989746094, | |
| "loss": 0.24206891655921936, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17550605535507202, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3885684013366699, | |
| "rewards/margins": 6.167290210723877, | |
| "rewards/rejected": -5.778721809387207, | |
| "step": 420, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.0908795845504706, | |
| "grad_norm": 3.4863972663879395, | |
| "learning_rate": 9.291479519266108e-05, | |
| "logits/chosen": -1.1982496976852417, | |
| "logits/rejected": -1.2094392776489258, | |
| "logps/chosen": -4.311284065246582, | |
| "logps/rejected": -67.43600463867188, | |
| "loss": 0.24855858087539673, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19574138522148132, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.373134583234787, | |
| "rewards/margins": 5.80324125289917, | |
| "rewards/rejected": -5.430107116699219, | |
| "step": 421, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0934761441090555, | |
| "grad_norm": 3.9711451530456543, | |
| "learning_rate": 9.248617558058327e-05, | |
| "logits/chosen": -1.1784768104553223, | |
| "logits/rejected": -1.190112590789795, | |
| "logps/chosen": -5.879142761230469, | |
| "logps/rejected": -73.49214935302734, | |
| "loss": 0.22467440366744995, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2147173136472702, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48001062870025635, | |
| "rewards/margins": 6.742798805236816, | |
| "rewards/rejected": -6.26278829574585, | |
| "step": 422, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.0960727036676403, | |
| "grad_norm": 1.5909618139266968, | |
| "learning_rate": 9.205769474802044e-05, | |
| "logits/chosen": -1.225572943687439, | |
| "logits/rejected": -1.237328052520752, | |
| "logps/chosen": -3.7763729095458984, | |
| "logps/rejected": -71.20807647705078, | |
| "loss": 0.17804725468158722, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1526719480752945, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4742431342601776, | |
| "rewards/margins": 6.401832103729248, | |
| "rewards/rejected": -5.92758846282959, | |
| "step": 423, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.0986692632262252, | |
| "grad_norm": 0.8102360963821411, | |
| "learning_rate": 9.16293606089667e-05, | |
| "logits/chosen": -1.240356683731079, | |
| "logits/rejected": -1.2470406293869019, | |
| "logps/chosen": -4.268908500671387, | |
| "logps/rejected": -65.2350845336914, | |
| "loss": 0.19071687757968903, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17185813188552856, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41862109303474426, | |
| "rewards/margins": 5.682591438293457, | |
| "rewards/rejected": -5.263970375061035, | |
| "step": 424, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.1012658227848102, | |
| "grad_norm": 0.9778416156768799, | |
| "learning_rate": 9.120118107470679e-05, | |
| "logits/chosen": -1.2163119316101074, | |
| "logits/rejected": -1.2221122980117798, | |
| "logps/chosen": -4.372983455657959, | |
| "logps/rejected": -78.68803405761719, | |
| "loss": 0.20959261059761047, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19133754074573517, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.60094153881073, | |
| "rewards/margins": 7.121860504150391, | |
| "rewards/rejected": -6.520918846130371, | |
| "step": 425, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.103862382343395, | |
| "grad_norm": 0.983422040939331, | |
| "learning_rate": 9.077316405366981e-05, | |
| "logits/chosen": -1.2027230262756348, | |
| "logits/rejected": -1.2142469882965088, | |
| "logps/chosen": -5.299243927001953, | |
| "logps/rejected": -76.34408569335938, | |
| "loss": 0.22110909223556519, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20182488858699799, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34696075320243835, | |
| "rewards/margins": 6.32121467590332, | |
| "rewards/rejected": -5.9742536544799805, | |
| "step": 426, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.10645894190198, | |
| "grad_norm": 2.735224723815918, | |
| "learning_rate": 9.034531745128334e-05, | |
| "logits/chosen": -1.226122498512268, | |
| "logits/rejected": -1.2391126155853271, | |
| "logps/chosen": -3.4195706844329834, | |
| "logps/rejected": -81.26631927490234, | |
| "loss": 0.18169909715652466, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14818009734153748, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37102988362312317, | |
| "rewards/margins": 7.223745346069336, | |
| "rewards/rejected": -6.852715492248535, | |
| "step": 427, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1090555014605648, | |
| "grad_norm": 0.81003338098526, | |
| "learning_rate": 8.991764916982731e-05, | |
| "logits/chosen": -1.2129402160644531, | |
| "logits/rejected": -1.2193183898925781, | |
| "logps/chosen": -6.524440765380859, | |
| "logps/rejected": -79.71651458740234, | |
| "loss": 0.18506552278995514, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17972829937934875, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5361291170120239, | |
| "rewards/margins": 7.205081939697266, | |
| "rewards/rejected": -6.668951988220215, | |
| "step": 428, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1116520610191496, | |
| "grad_norm": 1.204606056213379, | |
| "learning_rate": 8.949016710828808e-05, | |
| "logits/chosen": -1.2344969511032104, | |
| "logits/rejected": -1.2368295192718506, | |
| "logps/chosen": -6.601044178009033, | |
| "logps/rejected": -65.16004943847656, | |
| "loss": 0.29616430401802063, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26787662506103516, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.29541534185409546, | |
| "rewards/margins": 5.769859313964844, | |
| "rewards/rejected": -5.4744439125061035, | |
| "step": 429, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1142486205777344, | |
| "grad_norm": 1.5188134908676147, | |
| "learning_rate": 8.906287916221259e-05, | |
| "logits/chosen": -1.2113444805145264, | |
| "logits/rejected": -1.2227927446365356, | |
| "logps/chosen": -6.77754545211792, | |
| "logps/rejected": -77.72196960449219, | |
| "loss": 0.2043219655752182, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19175611436367035, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.29821890592575073, | |
| "rewards/margins": 6.7826690673828125, | |
| "rewards/rejected": -6.484450340270996, | |
| "step": 430, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1168451801363193, | |
| "grad_norm": 56.287654876708984, | |
| "learning_rate": 8.863579322356242e-05, | |
| "logits/chosen": -1.2380510568618774, | |
| "logits/rejected": -1.2490745782852173, | |
| "logps/chosen": -4.15383768081665, | |
| "logps/rejected": -79.29361724853516, | |
| "loss": 0.2723255157470703, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2262512445449829, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.42212826013565063, | |
| "rewards/margins": 6.8273210525512695, | |
| "rewards/rejected": -6.405192852020264, | |
| "step": 431, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.1194417396949043, | |
| "grad_norm": 0.6230031251907349, | |
| "learning_rate": 8.820891718056814e-05, | |
| "logits/chosen": -1.1983201503753662, | |
| "logits/rejected": -1.2093560695648193, | |
| "logps/chosen": -2.4044957160949707, | |
| "logps/rejected": -79.75895690917969, | |
| "loss": 0.13464465737342834, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11272096633911133, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4173327684402466, | |
| "rewards/margins": 7.142539978027344, | |
| "rewards/rejected": -6.7252068519592285, | |
| "step": 432, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1220382992534892, | |
| "grad_norm": 4.727012634277344, | |
| "learning_rate": 8.77822589175836e-05, | |
| "logits/chosen": -1.200883388519287, | |
| "logits/rejected": -1.2039451599121094, | |
| "logps/chosen": -6.484433174133301, | |
| "logps/rejected": -62.913082122802734, | |
| "loss": 0.3451792001724243, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25801709294319153, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5044211149215698, | |
| "rewards/margins": 5.68193244934082, | |
| "rewards/rejected": -5.1775102615356445, | |
| "step": 433, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.124634858812074, | |
| "grad_norm": 0.9477587342262268, | |
| "learning_rate": 8.73558263149402e-05, | |
| "logits/chosen": -1.2326602935791016, | |
| "logits/rejected": -1.2371294498443604, | |
| "logps/chosen": -3.9643776416778564, | |
| "logps/rejected": -64.6446304321289, | |
| "loss": 0.17973466217517853, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16231758892536163, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5142005681991577, | |
| "rewards/margins": 5.624721050262451, | |
| "rewards/rejected": -5.110519886016846, | |
| "step": 434, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1272314183706589, | |
| "grad_norm": 1.0718938112258911, | |
| "learning_rate": 8.692962724880148e-05, | |
| "logits/chosen": -1.1947612762451172, | |
| "logits/rejected": -1.1951274871826172, | |
| "logps/chosen": -11.542988777160645, | |
| "logps/rejected": -57.942604064941406, | |
| "loss": 0.4030612111091614, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3767915964126587, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.47994565963745117, | |
| "rewards/margins": 5.252399444580078, | |
| "rewards/rejected": -4.772454261779785, | |
| "step": 435, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1298279779292437, | |
| "grad_norm": 1.3139375448226929, | |
| "learning_rate": 8.650366959101757e-05, | |
| "logits/chosen": -1.2127829790115356, | |
| "logits/rejected": -1.2069275379180908, | |
| "logps/chosen": -7.090031623840332, | |
| "logps/rejected": -60.13610076904297, | |
| "loss": 0.2780110538005829, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25617653131484985, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38807040452957153, | |
| "rewards/margins": 5.502678871154785, | |
| "rewards/rejected": -5.1146087646484375, | |
| "step": 436, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1324245374878286, | |
| "grad_norm": 2.8402469158172607, | |
| "learning_rate": 8.607796120897977e-05, | |
| "logits/chosen": -1.1895822286605835, | |
| "logits/rejected": -1.2009150981903076, | |
| "logps/chosen": -5.18463134765625, | |
| "logps/rejected": -76.09211730957031, | |
| "loss": 0.2019975334405899, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1788557916879654, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44426459074020386, | |
| "rewards/margins": 6.382430553436279, | |
| "rewards/rejected": -5.938166618347168, | |
| "step": 437, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1350210970464134, | |
| "grad_norm": 0.8108645677566528, | |
| "learning_rate": 8.565250996547538e-05, | |
| "logits/chosen": -1.1975806951522827, | |
| "logits/rejected": -1.2050762176513672, | |
| "logps/chosen": -5.465963363647461, | |
| "logps/rejected": -73.16693878173828, | |
| "loss": 0.21301648020744324, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1857440173625946, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45735448598861694, | |
| "rewards/margins": 6.357089042663574, | |
| "rewards/rejected": -5.8997344970703125, | |
| "step": 438, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1376176566049985, | |
| "grad_norm": 1.0116618871688843, | |
| "learning_rate": 8.522732371854228e-05, | |
| "logits/chosen": -1.2085466384887695, | |
| "logits/rejected": -1.211836814880371, | |
| "logps/chosen": -5.572229385375977, | |
| "logps/rejected": -65.51385498046875, | |
| "loss": 0.21719352900981903, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18132297694683075, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5146795511245728, | |
| "rewards/margins": 5.9277167320251465, | |
| "rewards/rejected": -5.413036346435547, | |
| "step": 439, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1402142161635833, | |
| "grad_norm": 0.6072871088981628, | |
| "learning_rate": 8.480241032132393e-05, | |
| "logits/chosen": -1.2081148624420166, | |
| "logits/rejected": -1.2092756032943726, | |
| "logps/chosen": -4.102461814880371, | |
| "logps/rejected": -69.6110610961914, | |
| "loss": 0.17899087071418762, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1723383665084839, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5367128849029541, | |
| "rewards/margins": 6.382415294647217, | |
| "rewards/rejected": -5.845702648162842, | |
| "step": 440, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1428107757221682, | |
| "grad_norm": 1.1503797769546509, | |
| "learning_rate": 8.437777762192434e-05, | |
| "logits/chosen": -1.1785545349121094, | |
| "logits/rejected": -1.1898421049118042, | |
| "logps/chosen": -5.658975601196289, | |
| "logps/rejected": -66.4476089477539, | |
| "loss": 0.2457386553287506, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22795403003692627, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5527963638305664, | |
| "rewards/margins": 6.060329437255859, | |
| "rewards/rejected": -5.507533073425293, | |
| "step": 441, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.145407335280753, | |
| "grad_norm": 1.063011884689331, | |
| "learning_rate": 8.395343346326295e-05, | |
| "logits/chosen": -1.2125415802001953, | |
| "logits/rejected": -1.2166345119476318, | |
| "logps/chosen": -11.403976440429688, | |
| "logps/rejected": -65.69091033935547, | |
| "loss": 0.3279325067996979, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.31457963585853577, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48648983240127563, | |
| "rewards/margins": 5.955573558807373, | |
| "rewards/rejected": -5.469082832336426, | |
| "step": 442, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1480038948393378, | |
| "grad_norm": 15.399893760681152, | |
| "learning_rate": 8.352938568292999e-05, | |
| "logits/chosen": -1.212915062904358, | |
| "logits/rejected": -1.2257941961288452, | |
| "logps/chosen": -5.4974541664123535, | |
| "logps/rejected": -74.6421890258789, | |
| "loss": 0.43098506331443787, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3471585512161255, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2913598418235779, | |
| "rewards/margins": 6.395876407623291, | |
| "rewards/rejected": -6.10451602935791, | |
| "step": 443, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.1506004543979227, | |
| "grad_norm": 0.8971589803695679, | |
| "learning_rate": 8.310564211304158e-05, | |
| "logits/chosen": -1.2243199348449707, | |
| "logits/rejected": -1.233266830444336, | |
| "logps/chosen": -4.356855869293213, | |
| "logps/rejected": -82.03324127197266, | |
| "loss": 0.16546428203582764, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15822210907936096, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4632646441459656, | |
| "rewards/margins": 7.142735481262207, | |
| "rewards/rejected": -6.679471015930176, | |
| "step": 444, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.1531970139565075, | |
| "grad_norm": 0.9893987774848938, | |
| "learning_rate": 8.268221058009506e-05, | |
| "logits/chosen": -1.1960678100585938, | |
| "logits/rejected": -1.1931755542755127, | |
| "logps/chosen": -5.763791084289551, | |
| "logps/rejected": -67.48243713378906, | |
| "loss": 0.22159884870052338, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20868626236915588, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44276654720306396, | |
| "rewards/margins": 6.342441558837891, | |
| "rewards/rejected": -5.899675369262695, | |
| "step": 445, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.1557935735150926, | |
| "grad_norm": 0.9730236530303955, | |
| "learning_rate": 8.225909890482456e-05, | |
| "logits/chosen": -1.2410675287246704, | |
| "logits/rejected": -1.2531105279922485, | |
| "logps/chosen": -3.777689218521118, | |
| "logps/rejected": -73.96142578125, | |
| "loss": 0.17882992327213287, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15262357890605927, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.30238115787506104, | |
| "rewards/margins": 6.5273051261901855, | |
| "rewards/rejected": -6.224924087524414, | |
| "step": 446, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.1583901330736774, | |
| "grad_norm": 0.9676756262779236, | |
| "learning_rate": 8.183631490205637e-05, | |
| "logits/chosen": -1.2334588766098022, | |
| "logits/rejected": -1.23115074634552, | |
| "logps/chosen": -5.909482002258301, | |
| "logps/rejected": -71.83121490478516, | |
| "loss": 0.21972762048244476, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20232652127742767, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3557296097278595, | |
| "rewards/margins": 6.261346340179443, | |
| "rewards/rejected": -5.905617713928223, | |
| "step": 447, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.1609866926322623, | |
| "grad_norm": 3.615070104598999, | |
| "learning_rate": 8.141386638056481e-05, | |
| "logits/chosen": -1.1984878778457642, | |
| "logits/rejected": -1.2202084064483643, | |
| "logps/chosen": -7.201460838317871, | |
| "logps/rejected": -83.67745208740234, | |
| "loss": 0.3116104006767273, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25579264760017395, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5771140456199646, | |
| "rewards/margins": 7.238218784332275, | |
| "rewards/rejected": -6.661106109619141, | |
| "step": 448, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.1635832521908471, | |
| "grad_norm": 5.897024631500244, | |
| "learning_rate": 8.099176114292788e-05, | |
| "logits/chosen": -1.2283486127853394, | |
| "logits/rejected": -1.2268238067626953, | |
| "logps/chosen": -4.299000263214111, | |
| "logps/rejected": -63.7210578918457, | |
| "loss": 0.3152792155742645, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.25136417150497437, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.5095170140266418, | |
| "rewards/margins": 6.158134937286377, | |
| "rewards/rejected": -5.648618221282959, | |
| "step": 449, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.166179811749432, | |
| "grad_norm": 0.8267269730567932, | |
| "learning_rate": 8.05700069853831e-05, | |
| "logits/chosen": -1.2181183099746704, | |
| "logits/rejected": -1.232823371887207, | |
| "logps/chosen": -2.3422133922576904, | |
| "logps/rejected": -81.08943176269531, | |
| "loss": 0.1261310577392578, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11953935027122498, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5450170040130615, | |
| "rewards/margins": 7.200981140136719, | |
| "rewards/rejected": -6.655963897705078, | |
| "step": 450, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.1687763713080168, | |
| "grad_norm": 0.7152145504951477, | |
| "learning_rate": 8.014861169768363e-05, | |
| "logits/chosen": -1.2072569131851196, | |
| "logits/rejected": -1.2154910564422607, | |
| "logps/chosen": -5.663619041442871, | |
| "logps/rejected": -83.33345031738281, | |
| "loss": 0.19898222386837006, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18870678544044495, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6240676045417786, | |
| "rewards/margins": 7.413023948669434, | |
| "rewards/rejected": -6.788956165313721, | |
| "step": 451, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1713729308666017, | |
| "grad_norm": 1.1054271459579468, | |
| "learning_rate": 7.972758306295435e-05, | |
| "logits/chosen": -1.2423603534698486, | |
| "logits/rejected": -1.238939642906189, | |
| "logps/chosen": -9.10930347442627, | |
| "logps/rejected": -68.92269897460938, | |
| "loss": 0.2644210159778595, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23959574103355408, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6885038018226624, | |
| "rewards/margins": 6.226180076599121, | |
| "rewards/rejected": -5.537675857543945, | |
| "step": 452, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1739694904251867, | |
| "grad_norm": 0.8297804594039917, | |
| "learning_rate": 7.930692885754806e-05, | |
| "logits/chosen": -1.2389461994171143, | |
| "logits/rejected": -1.2466444969177246, | |
| "logps/chosen": -4.285374641418457, | |
| "logps/rejected": -81.12661743164062, | |
| "loss": 0.20591987669467926, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18140685558319092, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5226142406463623, | |
| "rewards/margins": 7.35651159286499, | |
| "rewards/rejected": -6.833897590637207, | |
| "step": 453, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1765660499837716, | |
| "grad_norm": 1.7889838218688965, | |
| "learning_rate": 7.888665685090193e-05, | |
| "logits/chosen": -1.2282047271728516, | |
| "logits/rejected": -1.240710973739624, | |
| "logps/chosen": -3.9668195247650146, | |
| "logps/rejected": -83.85064697265625, | |
| "loss": 0.3006521463394165, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2842242121696472, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5261533856391907, | |
| "rewards/margins": 7.802785873413086, | |
| "rewards/rejected": -7.276631832122803, | |
| "step": 454, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1791626095423564, | |
| "grad_norm": 0.6768118143081665, | |
| "learning_rate": 7.846677480539392e-05, | |
| "logits/chosen": -1.2407575845718384, | |
| "logits/rejected": -1.2590632438659668, | |
| "logps/chosen": -3.9896676540374756, | |
| "logps/rejected": -88.54475402832031, | |
| "loss": 0.14948198199272156, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14015856385231018, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5012010335922241, | |
| "rewards/margins": 7.759642601013184, | |
| "rewards/rejected": -7.25844144821167, | |
| "step": 455, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1817591691009413, | |
| "grad_norm": 1.0748811960220337, | |
| "learning_rate": 7.804729047619948e-05, | |
| "logits/chosen": -1.2838971614837646, | |
| "logits/rejected": -1.2972068786621094, | |
| "logps/chosen": -4.9451680183410645, | |
| "logps/rejected": -75.96924591064453, | |
| "loss": 0.19334405660629272, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17472317814826965, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.43368232250213623, | |
| "rewards/margins": 6.9603376388549805, | |
| "rewards/rejected": -6.526655197143555, | |
| "step": 456, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.184355728659526, | |
| "grad_norm": 27.02585792541504, | |
| "learning_rate": 7.762821161114833e-05, | |
| "logits/chosen": -1.2738770246505737, | |
| "logits/rejected": -1.2871417999267578, | |
| "logps/chosen": -6.898077964782715, | |
| "logps/rejected": -70.33586883544922, | |
| "loss": 0.3962981700897217, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.30386969447135925, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.49996471405029297, | |
| "rewards/margins": 6.2457451820373535, | |
| "rewards/rejected": -5.745780944824219, | |
| "step": 457, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.186952288218111, | |
| "grad_norm": 0.9774232506752014, | |
| "learning_rate": 7.720954595058118e-05, | |
| "logits/chosen": -1.270230770111084, | |
| "logits/rejected": -1.283980131149292, | |
| "logps/chosen": -3.3140833377838135, | |
| "logps/rejected": -72.56609344482422, | |
| "loss": 0.1822766661643982, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13324937224388123, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31882578134536743, | |
| "rewards/margins": 6.227068901062012, | |
| "rewards/rejected": -5.908243179321289, | |
| "step": 458, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1895488477766958, | |
| "grad_norm": 0.9652191400527954, | |
| "learning_rate": 7.679130122720704e-05, | |
| "logits/chosen": -1.3034790754318237, | |
| "logits/rejected": -1.314261555671692, | |
| "logps/chosen": -7.06810998916626, | |
| "logps/rejected": -81.12928771972656, | |
| "loss": 0.2216591238975525, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20493057370185852, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4113575220108032, | |
| "rewards/margins": 6.991024971008301, | |
| "rewards/rejected": -6.579666614532471, | |
| "step": 459, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1921454073352808, | |
| "grad_norm": 4.3938422203063965, | |
| "learning_rate": 7.637348516596016e-05, | |
| "logits/chosen": -1.288078784942627, | |
| "logits/rejected": -1.289923071861267, | |
| "logps/chosen": -6.353469371795654, | |
| "logps/rejected": -73.09895324707031, | |
| "loss": 0.275894433259964, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2141137421131134, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43534383177757263, | |
| "rewards/margins": 6.68284797668457, | |
| "rewards/rejected": -6.247504234313965, | |
| "step": 460, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1947419668938657, | |
| "grad_norm": 0.9771380424499512, | |
| "learning_rate": 7.59561054838575e-05, | |
| "logits/chosen": -1.3042765855789185, | |
| "logits/rejected": -1.317743182182312, | |
| "logps/chosen": -3.9304447174072266, | |
| "logps/rejected": -83.80009460449219, | |
| "loss": 0.1489650011062622, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1390589475631714, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3365148901939392, | |
| "rewards/margins": 7.487484931945801, | |
| "rewards/rejected": -7.150969505310059, | |
| "step": 461, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1973385264524505, | |
| "grad_norm": 0.7796929478645325, | |
| "learning_rate": 7.553916988985613e-05, | |
| "logits/chosen": -1.3301423788070679, | |
| "logits/rejected": -1.3388516902923584, | |
| "logps/chosen": -3.854522943496704, | |
| "logps/rejected": -77.66817474365234, | |
| "loss": 0.16134774684906006, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1557087004184723, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46156132221221924, | |
| "rewards/margins": 7.119222164154053, | |
| "rewards/rejected": -6.657661437988281, | |
| "step": 462, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.1999350860110354, | |
| "grad_norm": 0.8544324636459351, | |
| "learning_rate": 7.512268608471083e-05, | |
| "logits/chosen": -1.3370078802108765, | |
| "logits/rejected": -1.3487505912780762, | |
| "logps/chosen": -4.693976879119873, | |
| "logps/rejected": -82.53611755371094, | |
| "loss": 0.1619998812675476, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15308500826358795, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5657608509063721, | |
| "rewards/margins": 7.620563507080078, | |
| "rewards/rejected": -7.054802417755127, | |
| "step": 463, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.2025316455696202, | |
| "grad_norm": 1.2491400241851807, | |
| "learning_rate": 7.470666176083192e-05, | |
| "logits/chosen": -1.3235511779785156, | |
| "logits/rejected": -1.3217864036560059, | |
| "logps/chosen": -5.475301265716553, | |
| "logps/rejected": -66.96241760253906, | |
| "loss": 0.22019821405410767, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2117622047662735, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5525124669075012, | |
| "rewards/margins": 6.302184104919434, | |
| "rewards/rejected": -5.749671936035156, | |
| "step": 464, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.205128205128205, | |
| "grad_norm": 4.391453266143799, | |
| "learning_rate": 7.429110460214319e-05, | |
| "logits/chosen": -1.324596881866455, | |
| "logits/rejected": -1.3249270915985107, | |
| "logps/chosen": -5.006054401397705, | |
| "logps/rejected": -79.24930572509766, | |
| "loss": 0.19958798587322235, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17760564386844635, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.529591977596283, | |
| "rewards/margins": 7.06871223449707, | |
| "rewards/rejected": -6.539119243621826, | |
| "step": 465, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.20772476468679, | |
| "grad_norm": 1.2282588481903076, | |
| "learning_rate": 7.387602228393987e-05, | |
| "logits/chosen": -1.3140517473220825, | |
| "logits/rejected": -1.3105956315994263, | |
| "logps/chosen": -7.42270565032959, | |
| "logps/rejected": -66.26721954345703, | |
| "loss": 0.294545441865921, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2685684859752655, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6955150961875916, | |
| "rewards/margins": 6.379220008850098, | |
| "rewards/rejected": -5.683704853057861, | |
| "step": 466, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.210321324245375, | |
| "grad_norm": 0.9563242197036743, | |
| "learning_rate": 7.346142247274694e-05, | |
| "logits/chosen": -1.3215587139129639, | |
| "logits/rejected": -1.3361427783966064, | |
| "logps/chosen": -3.699913263320923, | |
| "logps/rejected": -88.9631118774414, | |
| "loss": 0.21111004054546356, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18570095300674438, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40791285037994385, | |
| "rewards/margins": 8.11806583404541, | |
| "rewards/rejected": -7.710152626037598, | |
| "step": 467, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.2129178838039598, | |
| "grad_norm": 1.081046462059021, | |
| "learning_rate": 7.304731282617762e-05, | |
| "logits/chosen": -1.3312351703643799, | |
| "logits/rejected": -1.3387830257415771, | |
| "logps/chosen": -5.243213653564453, | |
| "logps/rejected": -84.92706298828125, | |
| "loss": 0.2157626897096634, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21122369170188904, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4976283013820648, | |
| "rewards/margins": 8.005891799926758, | |
| "rewards/rejected": -7.508264064788818, | |
| "step": 468, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.2155144433625447, | |
| "grad_norm": 1.0331863164901733, | |
| "learning_rate": 7.263370099279172e-05, | |
| "logits/chosen": -1.3447762727737427, | |
| "logits/rejected": -1.3390498161315918, | |
| "logps/chosen": -6.393280982971191, | |
| "logps/rejected": -68.75172424316406, | |
| "loss": 0.2636359632015228, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.246793732047081, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6458650827407837, | |
| "rewards/margins": 6.282301425933838, | |
| "rewards/rejected": -5.636436939239502, | |
| "step": 469, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.2181110029211295, | |
| "grad_norm": 0.8750536441802979, | |
| "learning_rate": 7.22205946119546e-05, | |
| "logits/chosen": -1.3133454322814941, | |
| "logits/rejected": -1.3110582828521729, | |
| "logps/chosen": -5.820354461669922, | |
| "logps/rejected": -71.29835510253906, | |
| "loss": 0.20814698934555054, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1895810067653656, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5639092922210693, | |
| "rewards/margins": 6.466952323913574, | |
| "rewards/rejected": -5.903042793273926, | |
| "step": 470, | |
| "train_speed(iter/s)": 0.00535 | |
| }, | |
| { | |
| "epoch": 1.2207075624797143, | |
| "grad_norm": 1.3065314292907715, | |
| "learning_rate": 7.180800131369584e-05, | |
| "logits/chosen": -1.3447749614715576, | |
| "logits/rejected": -1.3477418422698975, | |
| "logps/chosen": -6.139316558837891, | |
| "logps/rejected": -62.90933609008789, | |
| "loss": 0.26562365889549255, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21039319038391113, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.537449836730957, | |
| "rewards/margins": 5.653042793273926, | |
| "rewards/rejected": -5.115592956542969, | |
| "step": 471, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2233041220382992, | |
| "grad_norm": 1.267687439918518, | |
| "learning_rate": 7.13959287185686e-05, | |
| "logits/chosen": -1.3199489116668701, | |
| "logits/rejected": -1.3398852348327637, | |
| "logps/chosen": -2.706737995147705, | |
| "logps/rejected": -79.95001983642578, | |
| "loss": 0.12426899373531342, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11003828048706055, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.47334274649620056, | |
| "rewards/margins": 7.157402992248535, | |
| "rewards/rejected": -6.684060096740723, | |
| "step": 472, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.225900681596884, | |
| "grad_norm": 7.132215976715088, | |
| "learning_rate": 7.098438443750865e-05, | |
| "logits/chosen": -1.3689088821411133, | |
| "logits/rejected": -1.3883635997772217, | |
| "logps/chosen": -8.076455116271973, | |
| "logps/rejected": -82.17918395996094, | |
| "loss": 0.42827925086021423, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3502614498138428, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4545542001724243, | |
| "rewards/margins": 7.125252723693848, | |
| "rewards/rejected": -6.6706976890563965, | |
| "step": 473, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.228497241155469, | |
| "grad_norm": 0.8221337795257568, | |
| "learning_rate": 7.057337607169371e-05, | |
| "logits/chosen": -1.3182464838027954, | |
| "logits/rejected": -1.3349087238311768, | |
| "logps/chosen": -4.247696876525879, | |
| "logps/rejected": -82.20696258544922, | |
| "loss": 0.16310645639896393, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14582528173923492, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3645007908344269, | |
| "rewards/margins": 7.333131313323975, | |
| "rewards/rejected": -6.968629837036133, | |
| "step": 474, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.231093800714054, | |
| "grad_norm": 0.9309591054916382, | |
| "learning_rate": 7.016291121240346e-05, | |
| "logits/chosen": -1.3715977668762207, | |
| "logits/rejected": -1.3699740171432495, | |
| "logps/chosen": -5.316465377807617, | |
| "logps/rejected": -68.14669799804688, | |
| "loss": 0.2627433240413666, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21229830384254456, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5413371920585632, | |
| "rewards/margins": 6.536716461181641, | |
| "rewards/rejected": -5.995378494262695, | |
| "step": 475, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2336903602726388, | |
| "grad_norm": 8.09181022644043, | |
| "learning_rate": 6.975299744087891e-05, | |
| "logits/chosen": -1.3668107986450195, | |
| "logits/rejected": -1.371617078781128, | |
| "logps/chosen": -9.833568572998047, | |
| "logps/rejected": -82.02591705322266, | |
| "loss": 0.8664286136627197, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5704513192176819, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.256930947303772, | |
| "rewards/margins": 7.255249977111816, | |
| "rewards/rejected": -6.998319149017334, | |
| "step": 476, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2362869198312236, | |
| "grad_norm": 2.064409017562866, | |
| "learning_rate": 6.934364232818254e-05, | |
| "logits/chosen": -1.3650354146957397, | |
| "logits/rejected": -1.3771873712539673, | |
| "logps/chosen": -4.302821636199951, | |
| "logps/rejected": -75.79000854492188, | |
| "loss": 0.16696852445602417, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1503523886203766, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4869020879268646, | |
| "rewards/margins": 6.73642110824585, | |
| "rewards/rejected": -6.249518871307373, | |
| "step": 477, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2388834793898085, | |
| "grad_norm": 0.798882782459259, | |
| "learning_rate": 6.893485343505857e-05, | |
| "logits/chosen": -1.3637698888778687, | |
| "logits/rejected": -1.3578245639801025, | |
| "logps/chosen": -5.138448715209961, | |
| "logps/rejected": -66.73672485351562, | |
| "loss": 0.21367499232292175, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1953822672367096, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3032958507537842, | |
| "rewards/margins": 6.190895080566406, | |
| "rewards/rejected": -5.887599945068359, | |
| "step": 478, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2414800389483933, | |
| "grad_norm": 1.1406197547912598, | |
| "learning_rate": 6.852663831179302e-05, | |
| "logits/chosen": -1.352840781211853, | |
| "logits/rejected": -1.35397207736969, | |
| "logps/chosen": -4.986490249633789, | |
| "logps/rejected": -73.43693542480469, | |
| "loss": 0.205072820186615, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19722062349319458, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5596895217895508, | |
| "rewards/margins": 6.6583757400512695, | |
| "rewards/rejected": -6.0986857414245605, | |
| "step": 479, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2440765985069782, | |
| "grad_norm": 0.766574501991272, | |
| "learning_rate": 6.811900449807465e-05, | |
| "logits/chosen": -1.3501691818237305, | |
| "logits/rejected": -1.3594365119934082, | |
| "logps/chosen": -6.533414363861084, | |
| "logps/rejected": -66.47720336914062, | |
| "loss": 0.23299582302570343, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22283174097537994, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7748389840126038, | |
| "rewards/margins": 6.291479587554932, | |
| "rewards/rejected": -5.516641139984131, | |
| "step": 480, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2466731580655632, | |
| "grad_norm": 0.9920905828475952, | |
| "learning_rate": 6.77119595228554e-05, | |
| "logits/chosen": -1.3646950721740723, | |
| "logits/rejected": -1.3720245361328125, | |
| "logps/chosen": -6.916625022888184, | |
| "logps/rejected": -73.02135467529297, | |
| "loss": 0.23078814148902893, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21652816236019135, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4459760785102844, | |
| "rewards/margins": 6.14084005355835, | |
| "rewards/rejected": -5.694863796234131, | |
| "step": 481, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.249269717624148, | |
| "grad_norm": 1.0885769128799438, | |
| "learning_rate": 6.730551090421137e-05, | |
| "logits/chosen": -1.3644369840621948, | |
| "logits/rejected": -1.3590939044952393, | |
| "logps/chosen": -7.648492813110352, | |
| "logps/rejected": -63.562782287597656, | |
| "loss": 0.24852637946605682, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21991106867790222, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6735080480575562, | |
| "rewards/margins": 5.918203353881836, | |
| "rewards/rejected": -5.244695663452148, | |
| "step": 482, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.251866277182733, | |
| "grad_norm": 0.7712500691413879, | |
| "learning_rate": 6.689966614920413e-05, | |
| "logits/chosen": -1.3166533708572388, | |
| "logits/rejected": -1.3218377828598022, | |
| "logps/chosen": -4.022350788116455, | |
| "logps/rejected": -71.528076171875, | |
| "loss": 0.13269458711147308, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11788547039031982, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5740154981613159, | |
| "rewards/margins": 6.363125324249268, | |
| "rewards/rejected": -5.789109230041504, | |
| "step": 483, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2544628367413178, | |
| "grad_norm": 0.8549020886421204, | |
| "learning_rate": 6.649443275374193e-05, | |
| "logits/chosen": -1.3651435375213623, | |
| "logits/rejected": -1.3780406713485718, | |
| "logps/chosen": -4.872490406036377, | |
| "logps/rejected": -68.51624298095703, | |
| "loss": 0.1938597708940506, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18332600593566895, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5763934254646301, | |
| "rewards/margins": 5.976587295532227, | |
| "rewards/rejected": -5.400193691253662, | |
| "step": 484, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2570593962999026, | |
| "grad_norm": 0.9369620084762573, | |
| "learning_rate": 6.608981820244115e-05, | |
| "logits/chosen": -1.3296164274215698, | |
| "logits/rejected": -1.3332488536834717, | |
| "logps/chosen": -4.46505069732666, | |
| "logps/rejected": -64.79832458496094, | |
| "loss": 0.17813126742839813, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1691313236951828, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5418381690979004, | |
| "rewards/margins": 5.926529407501221, | |
| "rewards/rejected": -5.38469123840332, | |
| "step": 485, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2596559558584874, | |
| "grad_norm": 0.844835102558136, | |
| "learning_rate": 6.568582996848843e-05, | |
| "logits/chosen": -1.3325531482696533, | |
| "logits/rejected": -1.3392637968063354, | |
| "logps/chosen": -4.008181571960449, | |
| "logps/rejected": -71.48811340332031, | |
| "loss": 0.17114686965942383, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15825404226779938, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5624055862426758, | |
| "rewards/margins": 6.441608905792236, | |
| "rewards/rejected": -5.8792033195495605, | |
| "step": 486, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2622525154170723, | |
| "grad_norm": 1.130921721458435, | |
| "learning_rate": 6.528247551350213e-05, | |
| "logits/chosen": -1.3767224550247192, | |
| "logits/rejected": -1.3819544315338135, | |
| "logps/chosen": -3.62576961517334, | |
| "logps/rejected": -68.78441619873047, | |
| "loss": 0.21932178735733032, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19097000360488892, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4108361601829529, | |
| "rewards/margins": 6.289252758026123, | |
| "rewards/rejected": -5.878417015075684, | |
| "step": 487, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2648490749756571, | |
| "grad_norm": 1.452879786491394, | |
| "learning_rate": 6.487976228739494e-05, | |
| "logits/chosen": -1.3391304016113281, | |
| "logits/rejected": -1.356032371520996, | |
| "logps/chosen": -4.974707126617432, | |
| "logps/rejected": -70.37326049804688, | |
| "loss": 0.21740569174289703, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20510534942150116, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5399238467216492, | |
| "rewards/margins": 6.117460250854492, | |
| "rewards/rejected": -5.577536106109619, | |
| "step": 488, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2674456345342422, | |
| "grad_norm": 0.7685065865516663, | |
| "learning_rate": 6.447769772823614e-05, | |
| "logits/chosen": -1.319055199623108, | |
| "logits/rejected": -1.3363419771194458, | |
| "logps/chosen": -6.615801811218262, | |
| "logps/rejected": -83.4671630859375, | |
| "loss": 0.21475572884082794, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18952563405036926, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4121897220611572, | |
| "rewards/margins": 7.273510932922363, | |
| "rewards/rejected": -6.861320972442627, | |
| "step": 489, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.270042194092827, | |
| "grad_norm": 1.0484442710876465, | |
| "learning_rate": 6.407628926211409e-05, | |
| "logits/chosen": -1.33793044090271, | |
| "logits/rejected": -1.3429871797561646, | |
| "logps/chosen": -7.6060333251953125, | |
| "logps/rejected": -65.28913879394531, | |
| "loss": 0.2497866153717041, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24507665634155273, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.8890218734741211, | |
| "rewards/margins": 6.331787109375, | |
| "rewards/rejected": -5.442765235900879, | |
| "step": 490, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2726387536514119, | |
| "grad_norm": 0.9693198204040527, | |
| "learning_rate": 6.367554430299924e-05, | |
| "logits/chosen": -1.3228676319122314, | |
| "logits/rejected": -1.3340733051300049, | |
| "logps/chosen": -4.008767604827881, | |
| "logps/rejected": -71.55172729492188, | |
| "loss": 0.18880397081375122, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1601686179637909, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4935658276081085, | |
| "rewards/margins": 6.400652885437012, | |
| "rewards/rejected": -5.907087326049805, | |
| "step": 491, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2752353132099967, | |
| "grad_norm": 1.0116583108901978, | |
| "learning_rate": 6.327547025260723e-05, | |
| "logits/chosen": -1.3240255117416382, | |
| "logits/rejected": -1.3320386409759521, | |
| "logps/chosen": -4.213266849517822, | |
| "logps/rejected": -72.59737396240234, | |
| "loss": 0.1900216042995453, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1726846843957901, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48582398891448975, | |
| "rewards/margins": 6.556468963623047, | |
| "rewards/rejected": -6.070645332336426, | |
| "step": 492, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.2778318727685816, | |
| "grad_norm": 1.002138614654541, | |
| "learning_rate": 6.287607450026189e-05, | |
| "logits/chosen": -1.3404346704483032, | |
| "logits/rejected": -1.34886634349823, | |
| "logps/chosen": -4.731965065002441, | |
| "logps/rejected": -74.24478149414062, | |
| "loss": 0.1853921115398407, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1709199845790863, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44357895851135254, | |
| "rewards/margins": 6.4645490646362305, | |
| "rewards/rejected": -6.020970344543457, | |
| "step": 493, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2804284323271666, | |
| "grad_norm": 0.8741234540939331, | |
| "learning_rate": 6.247736442275917e-05, | |
| "logits/chosen": -1.287043571472168, | |
| "logits/rejected": -1.2934644222259521, | |
| "logps/chosen": -4.63891077041626, | |
| "logps/rejected": -74.50043487548828, | |
| "loss": 0.19321085512638092, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1751416027545929, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.582757830619812, | |
| "rewards/margins": 6.900094509124756, | |
| "rewards/rejected": -6.3173370361328125, | |
| "step": 494, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2830249918857515, | |
| "grad_norm": 0.6828720569610596, | |
| "learning_rate": 6.20793473842305e-05, | |
| "logits/chosen": -1.2890350818634033, | |
| "logits/rejected": -1.2999300956726074, | |
| "logps/chosen": -4.856447219848633, | |
| "logps/rejected": -72.6617431640625, | |
| "loss": 0.18545033037662506, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16962683200836182, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5169156193733215, | |
| "rewards/margins": 6.635002136230469, | |
| "rewards/rejected": -6.118086338043213, | |
| "step": 495, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2856215514443363, | |
| "grad_norm": 1.0596202611923218, | |
| "learning_rate": 6.168203073600705e-05, | |
| "logits/chosen": -1.303747534751892, | |
| "logits/rejected": -1.3145846128463745, | |
| "logps/chosen": -5.57688045501709, | |
| "logps/rejected": -77.08624267578125, | |
| "loss": 0.19950714707374573, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1948622763156891, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5272884368896484, | |
| "rewards/margins": 6.925128936767578, | |
| "rewards/rejected": -6.3978400230407715, | |
| "step": 496, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2882181110029212, | |
| "grad_norm": 1.029574990272522, | |
| "learning_rate": 6.128542181648394e-05, | |
| "logits/chosen": -1.3281769752502441, | |
| "logits/rejected": -1.3378801345825195, | |
| "logps/chosen": -5.10857629776001, | |
| "logps/rejected": -78.54777526855469, | |
| "loss": 0.2200167030096054, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21050511300563812, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39650988578796387, | |
| "rewards/margins": 7.069237232208252, | |
| "rewards/rejected": -6.672727108001709, | |
| "step": 497, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.290814670561506, | |
| "grad_norm": 2.646754741668701, | |
| "learning_rate": 6.0889527950984416e-05, | |
| "logits/chosen": -1.303905963897705, | |
| "logits/rejected": -1.295387625694275, | |
| "logps/chosen": -6.794533729553223, | |
| "logps/rejected": -66.7017822265625, | |
| "loss": 0.412862628698349, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35357925295829773, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.3687395453453064, | |
| "rewards/margins": 6.016590118408203, | |
| "rewards/rejected": -5.647850036621094, | |
| "step": 498, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2934112301200908, | |
| "grad_norm": 0.8122525811195374, | |
| "learning_rate": 6.049435645162487e-05, | |
| "logits/chosen": -1.3104355335235596, | |
| "logits/rejected": -1.3152062892913818, | |
| "logps/chosen": -5.562468528747559, | |
| "logps/rejected": -74.46591186523438, | |
| "loss": 0.21052336692810059, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20442822575569153, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6305204033851624, | |
| "rewards/margins": 7.020031452178955, | |
| "rewards/rejected": -6.3895111083984375, | |
| "step": 499, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2960077896786757, | |
| "grad_norm": 0.7511181831359863, | |
| "learning_rate": 6.0099914617179764e-05, | |
| "logits/chosen": -1.2803047895431519, | |
| "logits/rejected": -1.2894065380096436, | |
| "logps/chosen": -4.588591575622559, | |
| "logps/rejected": -85.19679260253906, | |
| "loss": 0.17056904733181, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1638702154159546, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4681891202926636, | |
| "rewards/margins": 7.461175918579102, | |
| "rewards/rejected": -6.992986679077148, | |
| "step": 500, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.2986043492372605, | |
| "grad_norm": 0.708882749080658, | |
| "learning_rate": 5.970620973294649e-05, | |
| "logits/chosen": -1.2864353656768799, | |
| "logits/rejected": -1.2991129159927368, | |
| "logps/chosen": -2.7639682292938232, | |
| "logps/rejected": -77.82109832763672, | |
| "loss": 0.13476227223873138, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.129118874669075, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4478917717933655, | |
| "rewards/margins": 6.971372604370117, | |
| "rewards/rejected": -6.5234808921813965, | |
| "step": 501, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3012009087958454, | |
| "grad_norm": 2.3029229640960693, | |
| "learning_rate": 5.931324907061131e-05, | |
| "logits/chosen": -1.2641024589538574, | |
| "logits/rejected": -1.2685556411743164, | |
| "logps/chosen": -5.792514324188232, | |
| "logps/rejected": -76.38786315917969, | |
| "loss": 0.4058936536312103, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.36178189516067505, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32265374064445496, | |
| "rewards/margins": 6.516972064971924, | |
| "rewards/rejected": -6.1943182945251465, | |
| "step": 502, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3037974683544304, | |
| "grad_norm": 0.9166151285171509, | |
| "learning_rate": 5.892103988811457e-05, | |
| "logits/chosen": -1.2319368124008179, | |
| "logits/rejected": -1.2350472211837769, | |
| "logps/chosen": -6.415447235107422, | |
| "logps/rejected": -75.25454711914062, | |
| "loss": 0.2667836844921112, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23221434652805328, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6779787540435791, | |
| "rewards/margins": 6.834658145904541, | |
| "rewards/rejected": -6.156679153442383, | |
| "step": 503, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3063940279130153, | |
| "grad_norm": 6.748708248138428, | |
| "learning_rate": 5.8529589429517003e-05, | |
| "logits/chosen": -1.2778469324111938, | |
| "logits/rejected": -1.2807527780532837, | |
| "logps/chosen": -6.256143569946289, | |
| "logps/rejected": -72.61140441894531, | |
| "loss": 0.24257849156856537, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2350560873746872, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6175004243850708, | |
| "rewards/margins": 6.710084438323975, | |
| "rewards/rejected": -6.092584609985352, | |
| "step": 504, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3089905874716001, | |
| "grad_norm": 0.8000685572624207, | |
| "learning_rate": 5.8138904924865766e-05, | |
| "logits/chosen": -1.2935757637023926, | |
| "logits/rejected": -1.3018581867218018, | |
| "logps/chosen": -4.087766647338867, | |
| "logps/rejected": -79.02437591552734, | |
| "loss": 0.2187802791595459, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19569718837738037, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4645954966545105, | |
| "rewards/margins": 7.049061298370361, | |
| "rewards/rejected": -6.584465980529785, | |
| "step": 505, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.311587147030185, | |
| "grad_norm": 1.0485024452209473, | |
| "learning_rate": 5.774899359006092e-05, | |
| "logits/chosen": -1.2387014627456665, | |
| "logits/rejected": -1.2328811883926392, | |
| "logps/chosen": -5.889930248260498, | |
| "logps/rejected": -71.13211059570312, | |
| "loss": 0.20536896586418152, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18820105493068695, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4390983283519745, | |
| "rewards/margins": 6.4834065437316895, | |
| "rewards/rejected": -6.044308185577393, | |
| "step": 506, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3141837065887698, | |
| "grad_norm": 1.3112807273864746, | |
| "learning_rate": 5.7359862626722106e-05, | |
| "logits/chosen": -1.221153736114502, | |
| "logits/rejected": -1.2322664260864258, | |
| "logps/chosen": -8.636886596679688, | |
| "logps/rejected": -80.09297180175781, | |
| "loss": 0.276731938123703, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26180499792099, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34714198112487793, | |
| "rewards/margins": 6.943133354187012, | |
| "rewards/rejected": -6.595992088317871, | |
| "step": 507, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3167802661473549, | |
| "grad_norm": 4.199530601501465, | |
| "learning_rate": 5.6971519222055745e-05, | |
| "logits/chosen": -1.2388005256652832, | |
| "logits/rejected": -1.2482101917266846, | |
| "logps/chosen": -3.7984771728515625, | |
| "logps/rejected": -67.59223937988281, | |
| "loss": 0.2313919961452484, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15446686744689941, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.46181103587150574, | |
| "rewards/margins": 6.2272748947143555, | |
| "rewards/rejected": -5.765463829040527, | |
| "step": 508, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3193768257059397, | |
| "grad_norm": 0.5734891891479492, | |
| "learning_rate": 5.658397054872197e-05, | |
| "logits/chosen": -1.2510944604873657, | |
| "logits/rejected": -1.2634743452072144, | |
| "logps/chosen": -2.7403945922851562, | |
| "logps/rejected": -83.09203338623047, | |
| "loss": 0.10001116245985031, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.09578342735767365, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4184391498565674, | |
| "rewards/margins": 7.603847980499268, | |
| "rewards/rejected": -7.185409069061279, | |
| "step": 509, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3219733852645246, | |
| "grad_norm": 2.557685136795044, | |
| "learning_rate": 5.6197223764702376e-05, | |
| "logits/chosen": -1.2410025596618652, | |
| "logits/rejected": -1.2566806077957153, | |
| "logps/chosen": -5.59817361831665, | |
| "logps/rejected": -81.26180267333984, | |
| "loss": 0.2501680254936218, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22971931099891663, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1663077175617218, | |
| "rewards/margins": 6.9138503074646, | |
| "rewards/rejected": -6.747541904449463, | |
| "step": 510, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3245699448231094, | |
| "grad_norm": 0.7034062743186951, | |
| "learning_rate": 5.581128601316774e-05, | |
| "logits/chosen": -1.271955132484436, | |
| "logits/rejected": -1.2791032791137695, | |
| "logps/chosen": -5.076821804046631, | |
| "logps/rejected": -72.70384216308594, | |
| "loss": 0.21184766292572021, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18928952515125275, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5331236124038696, | |
| "rewards/margins": 6.811183929443359, | |
| "rewards/rejected": -6.278060436248779, | |
| "step": 511, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.3271665043816943, | |
| "grad_norm": 0.8642941117286682, | |
| "learning_rate": 5.542616442234618e-05, | |
| "logits/chosen": -1.1959160566329956, | |
| "logits/rejected": -1.1944928169250488, | |
| "logps/chosen": -4.370607376098633, | |
| "logps/rejected": -59.13761520385742, | |
| "loss": 0.210297629237175, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1646156907081604, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49285203218460083, | |
| "rewards/margins": 5.4679365158081055, | |
| "rewards/rejected": -4.9750847816467285, | |
| "step": 512, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.329763063940279, | |
| "grad_norm": 0.9332461953163147, | |
| "learning_rate": 5.50418661053913e-05, | |
| "logits/chosen": -1.2382476329803467, | |
| "logits/rejected": -1.242477536201477, | |
| "logps/chosen": -6.872227191925049, | |
| "logps/rejected": -74.04458618164062, | |
| "loss": 0.2718394994735718, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2601723074913025, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.39546260237693787, | |
| "rewards/margins": 6.640940189361572, | |
| "rewards/rejected": -6.245477199554443, | |
| "step": 513, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.332359623498864, | |
| "grad_norm": 23.864660263061523, | |
| "learning_rate": 5.4658398160250935e-05, | |
| "logits/chosen": -1.2790114879608154, | |
| "logits/rejected": -1.2800090312957764, | |
| "logps/chosen": -5.093778610229492, | |
| "logps/rejected": -66.47357177734375, | |
| "loss": 0.3131547272205353, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24423646926879883, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.4665161073207855, | |
| "rewards/margins": 5.967519283294678, | |
| "rewards/rejected": -5.501004219055176, | |
| "step": 514, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3349561830574488, | |
| "grad_norm": 1.120458960533142, | |
| "learning_rate": 5.4275767669536146e-05, | |
| "logits/chosen": -1.2243143320083618, | |
| "logits/rejected": -1.23822021484375, | |
| "logps/chosen": -5.449795722961426, | |
| "logps/rejected": -68.27152252197266, | |
| "loss": 0.2214929461479187, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20409227907657623, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.484249085187912, | |
| "rewards/margins": 6.0561323165893555, | |
| "rewards/rejected": -5.571883201599121, | |
| "step": 515, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3375527426160336, | |
| "grad_norm": 0.6455298066139221, | |
| "learning_rate": 5.3893981700390217e-05, | |
| "logits/chosen": -1.2467719316482544, | |
| "logits/rejected": -1.248091459274292, | |
| "logps/chosen": -5.1662678718566895, | |
| "logps/rejected": -69.29208374023438, | |
| "loss": 0.16640540957450867, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1609758585691452, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7331331968307495, | |
| "rewards/margins": 6.481633186340332, | |
| "rewards/rejected": -5.748499870300293, | |
| "step": 516, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3401493021746187, | |
| "grad_norm": 1.8854632377624512, | |
| "learning_rate": 5.35130473043582e-05, | |
| "logits/chosen": -1.2681548595428467, | |
| "logits/rejected": -1.2783433198928833, | |
| "logps/chosen": -4.961431503295898, | |
| "logps/rejected": -66.57093811035156, | |
| "loss": 0.21522153913974762, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17638429999351501, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.37839043140411377, | |
| "rewards/margins": 5.8021626472473145, | |
| "rewards/rejected": -5.423771858215332, | |
| "step": 517, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3427458617332035, | |
| "grad_norm": 2.53611159324646, | |
| "learning_rate": 5.313297151725679e-05, | |
| "logits/chosen": -1.2609970569610596, | |
| "logits/rejected": -1.2676525115966797, | |
| "logps/chosen": -3.5458755493164062, | |
| "logps/rejected": -64.48684692382812, | |
| "loss": 0.17321892082691193, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1277797669172287, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5875951051712036, | |
| "rewards/margins": 5.845522403717041, | |
| "rewards/rejected": -5.2579264640808105, | |
| "step": 518, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3453424212917884, | |
| "grad_norm": 0.7559269666671753, | |
| "learning_rate": 5.275376135904408e-05, | |
| "logits/chosen": -1.2371904850006104, | |
| "logits/rejected": -1.251573085784912, | |
| "logps/chosen": -3.288680076599121, | |
| "logps/rejected": -72.45018005371094, | |
| "loss": 0.14326097071170807, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12870629131793976, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5437870025634766, | |
| "rewards/margins": 6.532266616821289, | |
| "rewards/rejected": -5.988478660583496, | |
| "step": 519, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3479389808503732, | |
| "grad_norm": 0.9264482855796814, | |
| "learning_rate": 5.237542383369025e-05, | |
| "logits/chosen": -1.2770700454711914, | |
| "logits/rejected": -1.2863562107086182, | |
| "logps/chosen": -6.186993598937988, | |
| "logps/rejected": -72.9734115600586, | |
| "loss": 0.21653519570827484, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2064797580242157, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5985318422317505, | |
| "rewards/margins": 6.420475482940674, | |
| "rewards/rejected": -5.821944236755371, | |
| "step": 520, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.350535540408958, | |
| "grad_norm": 0.927513062953949, | |
| "learning_rate": 5.199796592904812e-05, | |
| "logits/chosen": -1.3056390285491943, | |
| "logits/rejected": -1.3078558444976807, | |
| "logps/chosen": -6.011695861816406, | |
| "logps/rejected": -61.83517837524414, | |
| "loss": 0.2499130517244339, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22844329476356506, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6435909271240234, | |
| "rewards/margins": 5.511775016784668, | |
| "rewards/rejected": -4.868184566497803, | |
| "step": 521, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3531320999675431, | |
| "grad_norm": 0.8462246060371399, | |
| "learning_rate": 5.16213946167237e-05, | |
| "logits/chosen": -1.2712773084640503, | |
| "logits/rejected": -1.2814041376113892, | |
| "logps/chosen": -4.3128533363342285, | |
| "logps/rejected": -75.32404327392578, | |
| "loss": 0.18354232609272003, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14595916867256165, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44975709915161133, | |
| "rewards/margins": 6.685505390167236, | |
| "rewards/rejected": -6.235748291015625, | |
| "step": 522, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.355728659526128, | |
| "grad_norm": 0.7453184127807617, | |
| "learning_rate": 5.1245716851948036e-05, | |
| "logits/chosen": -1.282777190208435, | |
| "logits/rejected": -1.2888199090957642, | |
| "logps/chosen": -4.018249988555908, | |
| "logps/rejected": -71.82275390625, | |
| "loss": 0.17397840321063995, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17042097449302673, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5543403625488281, | |
| "rewards/margins": 6.740978717803955, | |
| "rewards/rejected": -6.186638355255127, | |
| "step": 523, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3583252190847128, | |
| "grad_norm": 0.7847375273704529, | |
| "learning_rate": 5.087093957344841e-05, | |
| "logits/chosen": -1.263948678970337, | |
| "logits/rejected": -1.285239577293396, | |
| "logps/chosen": -2.6982815265655518, | |
| "logps/rejected": -83.65795135498047, | |
| "loss": 0.13130351901054382, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11251454055309296, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.41817164421081543, | |
| "rewards/margins": 7.289690017700195, | |
| "rewards/rejected": -6.871518135070801, | |
| "step": 524, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.3609217786432977, | |
| "grad_norm": 7.355116844177246, | |
| "learning_rate": 5.049706970332e-05, | |
| "logits/chosen": -1.3026247024536133, | |
| "logits/rejected": -1.3189667463302612, | |
| "logps/chosen": -4.715170383453369, | |
| "logps/rejected": -71.38179016113281, | |
| "loss": 0.1960161328315735, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16761450469493866, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4897134304046631, | |
| "rewards/margins": 6.54774284362793, | |
| "rewards/rejected": -6.058030128479004, | |
| "step": 525, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3635183382018825, | |
| "grad_norm": 0.5812721848487854, | |
| "learning_rate": 5.012411414689851e-05, | |
| "logits/chosen": -1.2992465496063232, | |
| "logits/rejected": -1.32021164894104, | |
| "logps/chosen": -2.617116928100586, | |
| "logps/rejected": -77.7351303100586, | |
| "loss": 0.13271179795265198, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11518695950508118, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45856040716171265, | |
| "rewards/margins": 6.7828898429870605, | |
| "rewards/rejected": -6.324328899383545, | |
| "step": 526, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3661148977604674, | |
| "grad_norm": 1.8369522094726562, | |
| "learning_rate": 4.9752079792632246e-05, | |
| "logits/chosen": -1.318105936050415, | |
| "logits/rejected": -1.327620029449463, | |
| "logps/chosen": -4.5236616134643555, | |
| "logps/rejected": -76.44921112060547, | |
| "loss": 0.18702739477157593, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15841788053512573, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5277929306030273, | |
| "rewards/margins": 6.9209723472595215, | |
| "rewards/rejected": -6.393178939819336, | |
| "step": 527, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3687114573190522, | |
| "grad_norm": 0.8088624477386475, | |
| "learning_rate": 4.938097351195499e-05, | |
| "logits/chosen": -1.3427401781082153, | |
| "logits/rejected": -1.3583595752716064, | |
| "logps/chosen": -4.807055473327637, | |
| "logps/rejected": -86.13604736328125, | |
| "loss": 0.16440600156784058, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14281649887561798, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.42351657152175903, | |
| "rewards/margins": 7.823343753814697, | |
| "rewards/rejected": -7.399827003479004, | |
| "step": 528, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.371308016877637, | |
| "grad_norm": 0.6622845530509949, | |
| "learning_rate": 4.901080215915922e-05, | |
| "logits/chosen": -1.2923277616500854, | |
| "logits/rejected": -1.307023525238037, | |
| "logps/chosen": -5.0182881355285645, | |
| "logps/rejected": -82.5390853881836, | |
| "loss": 0.21107839047908783, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20138172805309296, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5142525434494019, | |
| "rewards/margins": 7.308236122131348, | |
| "rewards/rejected": -6.7939839363098145, | |
| "step": 529, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3739045764362219, | |
| "grad_norm": 1.2780404090881348, | |
| "learning_rate": 4.864157257126928e-05, | |
| "logits/chosen": -1.3358229398727417, | |
| "logits/rejected": -1.3411754369735718, | |
| "logps/chosen": -6.996187210083008, | |
| "logps/rejected": -75.58708953857422, | |
| "loss": 0.2538679838180542, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24866743385791779, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5523662567138672, | |
| "rewards/margins": 6.849069595336914, | |
| "rewards/rejected": -6.296703815460205, | |
| "step": 530, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.376501135994807, | |
| "grad_norm": 1.143084168434143, | |
| "learning_rate": 4.827329156791522e-05, | |
| "logits/chosen": -1.3413739204406738, | |
| "logits/rejected": -1.3325977325439453, | |
| "logps/chosen": -6.320285797119141, | |
| "logps/rejected": -55.596866607666016, | |
| "loss": 0.2689521014690399, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2311260998249054, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7088637948036194, | |
| "rewards/margins": 5.551700592041016, | |
| "rewards/rejected": -4.842836856842041, | |
| "step": 531, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3790976955533918, | |
| "grad_norm": 0.9891291856765747, | |
| "learning_rate": 4.790596595120699e-05, | |
| "logits/chosen": -1.353549838066101, | |
| "logits/rejected": -1.3516517877578735, | |
| "logps/chosen": -5.421792984008789, | |
| "logps/rejected": -74.89588165283203, | |
| "loss": 0.19859538972377777, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19306476414203644, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5956583619117737, | |
| "rewards/margins": 6.918511390686035, | |
| "rewards/rejected": -6.322854042053223, | |
| "step": 532, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3816942551119766, | |
| "grad_norm": 0.7545592784881592, | |
| "learning_rate": 4.753960250560843e-05, | |
| "logits/chosen": -1.3177759647369385, | |
| "logits/rejected": -1.3262300491333008, | |
| "logps/chosen": -4.168139934539795, | |
| "logps/rejected": -80.60372924804688, | |
| "loss": 0.15544827282428741, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13690081238746643, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5192233324050903, | |
| "rewards/margins": 7.489371299743652, | |
| "rewards/rejected": -6.970148086547852, | |
| "step": 533, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3842908146705615, | |
| "grad_norm": 0.9258074164390564, | |
| "learning_rate": 4.7174207997812434e-05, | |
| "logits/chosen": -1.3286628723144531, | |
| "logits/rejected": -1.3313071727752686, | |
| "logps/chosen": -5.146695613861084, | |
| "logps/rejected": -74.13917541503906, | |
| "loss": 0.18875287473201752, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18020354211330414, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6697993874549866, | |
| "rewards/margins": 7.111582279205322, | |
| "rewards/rejected": -6.441783428192139, | |
| "step": 534, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3868873742291463, | |
| "grad_norm": 0.7437857389450073, | |
| "learning_rate": 4.680978917661544e-05, | |
| "logits/chosen": -1.3763070106506348, | |
| "logits/rejected": -1.3904519081115723, | |
| "logps/chosen": -3.5649471282958984, | |
| "logps/rejected": -98.40135955810547, | |
| "loss": 0.15277497470378876, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14997752010822296, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4047650396823883, | |
| "rewards/margins": 8.529120445251465, | |
| "rewards/rejected": -8.12435531616211, | |
| "step": 535, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3894839337877314, | |
| "grad_norm": 0.7930772304534912, | |
| "learning_rate": 4.644635277279326e-05, | |
| "logits/chosen": -1.2950698137283325, | |
| "logits/rejected": -1.301226019859314, | |
| "logps/chosen": -3.2517616748809814, | |
| "logps/rejected": -73.68115997314453, | |
| "loss": 0.13988333940505981, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1251326948404312, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5784369707107544, | |
| "rewards/margins": 6.892407417297363, | |
| "rewards/rejected": -6.313970565795898, | |
| "step": 536, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3920804933463162, | |
| "grad_norm": 3.1857376098632812, | |
| "learning_rate": 4.608390549897661e-05, | |
| "logits/chosen": -1.312851071357727, | |
| "logits/rejected": -1.31553316116333, | |
| "logps/chosen": -4.813056945800781, | |
| "logps/rejected": -72.02601623535156, | |
| "loss": 0.17908523976802826, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1712900847196579, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5639367699623108, | |
| "rewards/margins": 6.651814937591553, | |
| "rewards/rejected": -6.087879180908203, | |
| "step": 537, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.394677052904901, | |
| "grad_norm": 0.6969592571258545, | |
| "learning_rate": 4.572245404952682e-05, | |
| "logits/chosen": -1.3196005821228027, | |
| "logits/rejected": -1.3400623798370361, | |
| "logps/chosen": -2.851443290710449, | |
| "logps/rejected": -84.36784362792969, | |
| "loss": 0.14703302085399628, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13512712717056274, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4452558755874634, | |
| "rewards/margins": 7.475783824920654, | |
| "rewards/rejected": -7.030528545379639, | |
| "step": 538, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.397273612463486, | |
| "grad_norm": 1.1035842895507812, | |
| "learning_rate": 4.536200510041271e-05, | |
| "logits/chosen": -1.3497779369354248, | |
| "logits/rejected": -1.3533220291137695, | |
| "logps/chosen": -6.113505840301514, | |
| "logps/rejected": -82.510986328125, | |
| "loss": 0.1953519731760025, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17564868927001953, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2876747250556946, | |
| "rewards/margins": 7.36361837387085, | |
| "rewards/rejected": -7.075943470001221, | |
| "step": 539, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.3998701720220708, | |
| "grad_norm": 1.0004595518112183, | |
| "learning_rate": 4.5002565309087e-05, | |
| "logits/chosen": -1.320373296737671, | |
| "logits/rejected": -1.3390169143676758, | |
| "logps/chosen": -3.581512689590454, | |
| "logps/rejected": -83.01679992675781, | |
| "loss": 0.1440872699022293, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13884009420871735, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5866944789886475, | |
| "rewards/margins": 7.652634143829346, | |
| "rewards/rejected": -7.065939903259277, | |
| "step": 540, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4024667315806556, | |
| "grad_norm": 0.9309626221656799, | |
| "learning_rate": 4.464414131436317e-05, | |
| "logits/chosen": -1.3228111267089844, | |
| "logits/rejected": -1.3259844779968262, | |
| "logps/chosen": -5.710712432861328, | |
| "logps/rejected": -86.91190338134766, | |
| "loss": 0.18705937266349792, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17348426580429077, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5686015486717224, | |
| "rewards/margins": 8.052790641784668, | |
| "rewards/rejected": -7.484189033508301, | |
| "step": 541, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4050632911392404, | |
| "grad_norm": 2.3234517574310303, | |
| "learning_rate": 4.428673973629328e-05, | |
| "logits/chosen": -1.2998096942901611, | |
| "logits/rejected": -1.30985689163208, | |
| "logps/chosen": -7.139487266540527, | |
| "logps/rejected": -82.738037109375, | |
| "loss": 0.25522780418395996, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22490915656089783, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5230386257171631, | |
| "rewards/margins": 7.560036659240723, | |
| "rewards/rejected": -7.036998748779297, | |
| "step": 542, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4076598506978253, | |
| "grad_norm": 0.7589312195777893, | |
| "learning_rate": 4.393036717604536e-05, | |
| "logits/chosen": -1.3219821453094482, | |
| "logits/rejected": -1.3300949335098267, | |
| "logps/chosen": -3.9188337326049805, | |
| "logps/rejected": -79.20855712890625, | |
| "loss": 0.15153641998767853, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14401042461395264, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4560588300228119, | |
| "rewards/margins": 7.192531108856201, | |
| "rewards/rejected": -6.736471652984619, | |
| "step": 543, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4102564102564101, | |
| "grad_norm": 0.7089377045631409, | |
| "learning_rate": 4.357503021578157e-05, | |
| "logits/chosen": -1.3246771097183228, | |
| "logits/rejected": -1.331357479095459, | |
| "logps/chosen": -5.504782199859619, | |
| "logps/rejected": -79.88471221923828, | |
| "loss": 0.5075070858001709, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.371629536151886, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43268999457359314, | |
| "rewards/margins": 7.278794288635254, | |
| "rewards/rejected": -6.846104145050049, | |
| "step": 544, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4128529698149952, | |
| "grad_norm": 6.009806156158447, | |
| "learning_rate": 4.3220735418536774e-05, | |
| "logits/chosen": -1.3304033279418945, | |
| "logits/rejected": -1.3362674713134766, | |
| "logps/chosen": -4.7876715660095215, | |
| "logps/rejected": -77.58482360839844, | |
| "loss": 0.21589714288711548, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17250403761863708, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.43926605582237244, | |
| "rewards/margins": 7.207821369171143, | |
| "rewards/rejected": -6.7685546875, | |
| "step": 545, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.41544952937358, | |
| "grad_norm": 0.8883028626441956, | |
| "learning_rate": 4.2867489328097066e-05, | |
| "logits/chosen": -1.286049723625183, | |
| "logits/rejected": -1.3016682863235474, | |
| "logps/chosen": -4.48312520980835, | |
| "logps/rejected": -80.04753112792969, | |
| "loss": 0.18265032768249512, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16458269953727722, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3826461732387543, | |
| "rewards/margins": 7.131008148193359, | |
| "rewards/rejected": -6.748361587524414, | |
| "step": 546, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4180460889321649, | |
| "grad_norm": 0.8117271661758423, | |
| "learning_rate": 4.251529846887906e-05, | |
| "logits/chosen": -1.3500478267669678, | |
| "logits/rejected": -1.3516051769256592, | |
| "logps/chosen": -5.849126815795898, | |
| "logps/rejected": -75.34406280517578, | |
| "loss": 0.21577468514442444, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21225160360336304, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.787651538848877, | |
| "rewards/margins": 7.277240753173828, | |
| "rewards/rejected": -6.489588737487793, | |
| "step": 547, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4206426484907497, | |
| "grad_norm": 0.7191773056983948, | |
| "learning_rate": 4.216416934580947e-05, | |
| "logits/chosen": -1.3170534372329712, | |
| "logits/rejected": -1.3186712265014648, | |
| "logps/chosen": -5.588179111480713, | |
| "logps/rejected": -73.8975830078125, | |
| "loss": 0.19539664685726166, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19075627624988556, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46979498863220215, | |
| "rewards/margins": 6.78049373626709, | |
| "rewards/rejected": -6.310698986053467, | |
| "step": 548, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4232392080493346, | |
| "grad_norm": 0.6664804816246033, | |
| "learning_rate": 4.181410844420474e-05, | |
| "logits/chosen": -1.304147481918335, | |
| "logits/rejected": -1.3245407342910767, | |
| "logps/chosen": -3.386530876159668, | |
| "logps/rejected": -84.88090515136719, | |
| "loss": 0.14330296218395233, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13968124985694885, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6671038269996643, | |
| "rewards/margins": 8.031911849975586, | |
| "rewards/rejected": -7.364808082580566, | |
| "step": 549, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4258357676079196, | |
| "grad_norm": 0.7066012024879456, | |
| "learning_rate": 4.146512222965143e-05, | |
| "logits/chosen": -1.3411874771118164, | |
| "logits/rejected": -1.3574979305267334, | |
| "logps/chosen": -2.9142534732818604, | |
| "logps/rejected": -88.72208404541016, | |
| "loss": 0.1130063459277153, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.10818038135766983, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4542260766029358, | |
| "rewards/margins": 8.142085075378418, | |
| "rewards/rejected": -7.687858581542969, | |
| "step": 550, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.4284323271665045, | |
| "grad_norm": 0.7845104932785034, | |
| "learning_rate": 4.111721714788671e-05, | |
| "logits/chosen": -1.3469820022583008, | |
| "logits/rejected": -1.3495479822158813, | |
| "logps/chosen": -4.226562976837158, | |
| "logps/rejected": -70.08132934570312, | |
| "loss": 0.18562032282352448, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16532127559185028, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6004529595375061, | |
| "rewards/margins": 6.635247230529785, | |
| "rewards/rejected": -6.034794330596924, | |
| "step": 551, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4310288867250893, | |
| "grad_norm": 0.9597321152687073, | |
| "learning_rate": 4.0770399624679456e-05, | |
| "logits/chosen": -1.3411657810211182, | |
| "logits/rejected": -1.353317379951477, | |
| "logps/chosen": -5.72759485244751, | |
| "logps/rejected": -84.97734069824219, | |
| "loss": 0.22993287444114685, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21702148020267487, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5299229025840759, | |
| "rewards/margins": 7.509583473205566, | |
| "rewards/rejected": -6.979660511016846, | |
| "step": 552, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4336254462836742, | |
| "grad_norm": 2.079641580581665, | |
| "learning_rate": 4.042467606571134e-05, | |
| "logits/chosen": -1.3426014184951782, | |
| "logits/rejected": -1.3533074855804443, | |
| "logps/chosen": -7.159404754638672, | |
| "logps/rejected": -73.98983764648438, | |
| "loss": 0.5649017691612244, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4176748991012573, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.36085012555122375, | |
| "rewards/margins": 6.391058444976807, | |
| "rewards/rejected": -6.030208110809326, | |
| "step": 553, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.436222005842259, | |
| "grad_norm": 0.7903665900230408, | |
| "learning_rate": 4.0080052856458626e-05, | |
| "logits/chosen": -1.3065292835235596, | |
| "logits/rejected": -1.326464056968689, | |
| "logps/chosen": -3.64105224609375, | |
| "logps/rejected": -86.52337646484375, | |
| "loss": 0.13767823576927185, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1341703087091446, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3208577036857605, | |
| "rewards/margins": 7.719215393066406, | |
| "rewards/rejected": -7.39835786819458, | |
| "step": 554, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4388185654008439, | |
| "grad_norm": 5.593478679656982, | |
| "learning_rate": 3.973653636207437e-05, | |
| "logits/chosen": -1.3405157327651978, | |
| "logits/rejected": -1.3490185737609863, | |
| "logps/chosen": -5.513555526733398, | |
| "logps/rejected": -79.61082458496094, | |
| "loss": 0.4690606892108917, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2211458384990692, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24729761481285095, | |
| "rewards/margins": 7.00010871887207, | |
| "rewards/rejected": -6.752811431884766, | |
| "step": 555, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4414151249594287, | |
| "grad_norm": 0.7707073092460632, | |
| "learning_rate": 3.9394132927270613e-05, | |
| "logits/chosen": -1.3235504627227783, | |
| "logits/rejected": -1.3401741981506348, | |
| "logps/chosen": -4.119601249694824, | |
| "logps/rejected": -86.29273986816406, | |
| "loss": 0.16342757642269135, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1537020206451416, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.46904829144477844, | |
| "rewards/margins": 7.555969715118408, | |
| "rewards/rejected": -7.086921215057373, | |
| "step": 556, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4440116845180135, | |
| "grad_norm": 1.0258326530456543, | |
| "learning_rate": 3.9052848876201284e-05, | |
| "logits/chosen": -1.2859511375427246, | |
| "logits/rejected": -1.2992178201675415, | |
| "logps/chosen": -4.974706172943115, | |
| "logps/rejected": -72.67876434326172, | |
| "loss": 0.20728819072246552, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19392336905002594, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6317263841629028, | |
| "rewards/margins": 6.647282123565674, | |
| "rewards/rejected": -6.0155558586120605, | |
| "step": 557, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4466082440765984, | |
| "grad_norm": 0.8165487051010132, | |
| "learning_rate": 3.871269051234555e-05, | |
| "logits/chosen": -1.3127992153167725, | |
| "logits/rejected": -1.329878330230713, | |
| "logps/chosen": -3.2941739559173584, | |
| "logps/rejected": -87.43807220458984, | |
| "loss": 0.17191743850708008, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16360032558441162, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5402951240539551, | |
| "rewards/margins": 7.842915058135986, | |
| "rewards/rejected": -7.3026204109191895, | |
| "step": 558, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4492048036351834, | |
| "grad_norm": 0.7644895315170288, | |
| "learning_rate": 3.837366411839114e-05, | |
| "logits/chosen": -1.322697639465332, | |
| "logits/rejected": -1.3291290998458862, | |
| "logps/chosen": -3.767364025115967, | |
| "logps/rejected": -79.43592071533203, | |
| "loss": 0.13489316403865814, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12984776496887207, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.47781094908714294, | |
| "rewards/margins": 7.167353630065918, | |
| "rewards/rejected": -6.6895432472229, | |
| "step": 559, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4518013631937683, | |
| "grad_norm": 0.6488920450210571, | |
| "learning_rate": 3.8035775956118415e-05, | |
| "logits/chosen": -1.3089568614959717, | |
| "logits/rejected": -1.333059549331665, | |
| "logps/chosen": -3.604278087615967, | |
| "logps/rejected": -75.26642608642578, | |
| "loss": 0.12487327307462692, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11769910156726837, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5058732032775879, | |
| "rewards/margins": 6.758044242858887, | |
| "rewards/rejected": -6.252170562744141, | |
| "step": 560, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.4543979227523531, | |
| "grad_norm": 0.7780476212501526, | |
| "learning_rate": 3.7699032266284865e-05, | |
| "logits/chosen": -1.3105119466781616, | |
| "logits/rejected": -1.3256127834320068, | |
| "logps/chosen": -4.206973075866699, | |
| "logps/rejected": -81.01417541503906, | |
| "loss": 0.1642312854528427, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1462475061416626, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.469632625579834, | |
| "rewards/margins": 7.197355270385742, | |
| "rewards/rejected": -6.72772216796875, | |
| "step": 561, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.456994482310938, | |
| "grad_norm": 1.534871220588684, | |
| "learning_rate": 3.7363439268509535e-05, | |
| "logits/chosen": -1.324033498764038, | |
| "logits/rejected": -1.3254599571228027, | |
| "logps/chosen": -6.707502365112305, | |
| "logps/rejected": -66.20709991455078, | |
| "loss": 0.34620898962020874, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3185166120529175, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.49867385625839233, | |
| "rewards/margins": 6.206461429595947, | |
| "rewards/rejected": -5.707787036895752, | |
| "step": 562, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4595910418695228, | |
| "grad_norm": 0.9614840745925903, | |
| "learning_rate": 3.702900316115836e-05, | |
| "logits/chosen": -1.312652587890625, | |
| "logits/rejected": -1.3183560371398926, | |
| "logps/chosen": -6.137225151062012, | |
| "logps/rejected": -76.21929931640625, | |
| "loss": 0.24062488973140717, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20657041668891907, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38741621375083923, | |
| "rewards/margins": 6.601250648498535, | |
| "rewards/rejected": -6.213834285736084, | |
| "step": 563, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4621876014281079, | |
| "grad_norm": 1.2924113273620605, | |
| "learning_rate": 3.669573012122973e-05, | |
| "logits/chosen": -1.2920567989349365, | |
| "logits/rejected": -1.29514741897583, | |
| "logps/chosen": -6.05202054977417, | |
| "logps/rejected": -62.32487106323242, | |
| "loss": 0.3004983067512512, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27208033204078674, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6880547404289246, | |
| "rewards/margins": 5.9696760177612305, | |
| "rewards/rejected": -5.281620979309082, | |
| "step": 564, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4647841609866927, | |
| "grad_norm": 1.697675347328186, | |
| "learning_rate": 3.6363626304240184e-05, | |
| "logits/chosen": -1.3259660005569458, | |
| "logits/rejected": -1.3245418071746826, | |
| "logps/chosen": -4.952503681182861, | |
| "logps/rejected": -66.86807250976562, | |
| "loss": 0.20483994483947754, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17799176275730133, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.64216148853302, | |
| "rewards/margins": 6.409905433654785, | |
| "rewards/rejected": -5.767744064331055, | |
| "step": 565, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4673807205452776, | |
| "grad_norm": 0.9418896436691284, | |
| "learning_rate": 3.60326978441109e-05, | |
| "logits/chosen": -1.2750047445297241, | |
| "logits/rejected": -1.2927812337875366, | |
| "logps/chosen": -5.463886260986328, | |
| "logps/rejected": -86.8280258178711, | |
| "loss": 0.19925126433372498, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18372556567192078, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38306546211242676, | |
| "rewards/margins": 7.263001441955566, | |
| "rewards/rejected": -6.879936218261719, | |
| "step": 566, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4699772801038624, | |
| "grad_norm": 1.4005364179611206, | |
| "learning_rate": 3.5702950853054284e-05, | |
| "logits/chosen": -1.2621244192123413, | |
| "logits/rejected": -1.2756032943725586, | |
| "logps/chosen": -4.0591864585876465, | |
| "logps/rejected": -76.57896423339844, | |
| "loss": 0.16474060714244843, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15141594409942627, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3780522644519806, | |
| "rewards/margins": 6.907110691070557, | |
| "rewards/rejected": -6.529058933258057, | |
| "step": 567, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4725738396624473, | |
| "grad_norm": 0.6262617111206055, | |
| "learning_rate": 3.5374391421461274e-05, | |
| "logits/chosen": -1.3366174697875977, | |
| "logits/rejected": -1.3425589799880981, | |
| "logps/chosen": -5.0637078285217285, | |
| "logps/rejected": -75.93576049804688, | |
| "loss": 0.14967593550682068, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13986575603485107, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45764419436454773, | |
| "rewards/margins": 6.864101409912109, | |
| "rewards/rejected": -6.406457901000977, | |
| "step": 568, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.475170399221032, | |
| "grad_norm": 1.0724283456802368, | |
| "learning_rate": 3.5047025617788576e-05, | |
| "logits/chosen": -1.318103551864624, | |
| "logits/rejected": -1.3257315158843994, | |
| "logps/chosen": -4.4997782707214355, | |
| "logps/rejected": -69.55330657958984, | |
| "loss": 0.21760107576847076, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20659759640693665, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36253267526626587, | |
| "rewards/margins": 6.121118545532227, | |
| "rewards/rejected": -5.758585453033447, | |
| "step": 569, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.477766958779617, | |
| "grad_norm": 0.8618238568305969, | |
| "learning_rate": 3.472085948844674e-05, | |
| "logits/chosen": -1.3077456951141357, | |
| "logits/rejected": -1.3146158456802368, | |
| "logps/chosen": -4.7398481369018555, | |
| "logps/rejected": -75.23126220703125, | |
| "loss": 0.2030331939458847, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19906149804592133, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6159305572509766, | |
| "rewards/margins": 6.953237533569336, | |
| "rewards/rejected": -6.337306499481201, | |
| "step": 570, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4803635183382018, | |
| "grad_norm": 2.220825433731079, | |
| "learning_rate": 3.439589905768857e-05, | |
| "logits/chosen": -1.3038007020950317, | |
| "logits/rejected": -1.314782977104187, | |
| "logps/chosen": -4.8768205642700195, | |
| "logps/rejected": -78.61490631103516, | |
| "loss": 0.2124282568693161, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20312494039535522, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.42080211639404297, | |
| "rewards/margins": 6.928518295288086, | |
| "rewards/rejected": -6.507716178894043, | |
| "step": 571, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4829600778967866, | |
| "grad_norm": 0.9802061915397644, | |
| "learning_rate": 3.407215032749763e-05, | |
| "logits/chosen": -1.2862904071807861, | |
| "logits/rejected": -1.2907946109771729, | |
| "logps/chosen": -6.141645431518555, | |
| "logps/rejected": -61.32841110229492, | |
| "loss": 0.2664101719856262, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.23925836384296417, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6145697832107544, | |
| "rewards/margins": 5.361448764801025, | |
| "rewards/rejected": -4.7468791007995605, | |
| "step": 572, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4855566374553717, | |
| "grad_norm": 0.7380911111831665, | |
| "learning_rate": 3.374961927747751e-05, | |
| "logits/chosen": -1.2636692523956299, | |
| "logits/rejected": -1.259122610092163, | |
| "logps/chosen": -5.851538181304932, | |
| "logps/rejected": -62.0422477722168, | |
| "loss": 0.2571408450603485, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.24986571073532104, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6978765726089478, | |
| "rewards/margins": 5.906915664672852, | |
| "rewards/rejected": -5.209038734436035, | |
| "step": 573, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4881531970139565, | |
| "grad_norm": 1.2015725374221802, | |
| "learning_rate": 3.342831186474149e-05, | |
| "logits/chosen": -1.2451616525650024, | |
| "logits/rejected": -1.2526040077209473, | |
| "logps/chosen": -6.031259536743164, | |
| "logps/rejected": -66.83104705810547, | |
| "loss": 0.23752854764461517, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20862002670764923, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3990924656391144, | |
| "rewards/margins": 5.784240245819092, | |
| "rewards/rejected": -5.385148525238037, | |
| "step": 574, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4907497565725414, | |
| "grad_norm": 26.948949813842773, | |
| "learning_rate": 3.31082340238023e-05, | |
| "logits/chosen": -1.2702953815460205, | |
| "logits/rejected": -1.2942155599594116, | |
| "logps/chosen": -5.758556365966797, | |
| "logps/rejected": -79.33439636230469, | |
| "loss": 0.7174453735351562, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5235574245452881, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16809692978858948, | |
| "rewards/margins": 6.522285461425781, | |
| "rewards/rejected": -6.354187965393066, | |
| "step": 575, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4933463161311262, | |
| "grad_norm": 0.7220916748046875, | |
| "learning_rate": 3.2789391666462596e-05, | |
| "logits/chosen": -1.2505327463150024, | |
| "logits/rejected": -1.2620594501495361, | |
| "logps/chosen": -3.8762307167053223, | |
| "logps/rejected": -84.97810363769531, | |
| "loss": 0.15173956751823425, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1497780978679657, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4926835298538208, | |
| "rewards/margins": 7.460906028747559, | |
| "rewards/rejected": -6.968222618103027, | |
| "step": 576, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.495942875689711, | |
| "grad_norm": 1.8231993913650513, | |
| "learning_rate": 3.247179068170593e-05, | |
| "logits/chosen": -1.263367772102356, | |
| "logits/rejected": -1.272806167602539, | |
| "logps/chosen": -3.779219388961792, | |
| "logps/rejected": -70.675048828125, | |
| "loss": 0.18493540585041046, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15074032545089722, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5790086984634399, | |
| "rewards/margins": 6.532997131347656, | |
| "rewards/rejected": -5.953989028930664, | |
| "step": 577, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.4985394352482961, | |
| "grad_norm": 1.029189109802246, | |
| "learning_rate": 3.215543693558769e-05, | |
| "logits/chosen": -1.2609919309616089, | |
| "logits/rejected": -1.2647769451141357, | |
| "logps/chosen": -5.3333539962768555, | |
| "logps/rejected": -65.2447509765625, | |
| "loss": 0.23766495287418365, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19680431485176086, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5142011642456055, | |
| "rewards/margins": 6.050221920013428, | |
| "rewards/rejected": -5.536020755767822, | |
| "step": 578, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.501135994806881, | |
| "grad_norm": 1.0110372304916382, | |
| "learning_rate": 3.184033627112694e-05, | |
| "logits/chosen": -1.233156681060791, | |
| "logits/rejected": -1.2387574911117554, | |
| "logps/chosen": -7.914291858673096, | |
| "logps/rejected": -66.5923080444336, | |
| "loss": 0.26373106241226196, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.233109250664711, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7227498888969421, | |
| "rewards/margins": 6.343271255493164, | |
| "rewards/rejected": -5.620521545410156, | |
| "step": 579, | |
| "train_speed(iter/s)": 0.005351 | |
| }, | |
| { | |
| "epoch": 1.5037325543654658, | |
| "grad_norm": 0.8185076117515564, | |
| "learning_rate": 3.1526494508198525e-05, | |
| "logits/chosen": -1.2909034490585327, | |
| "logits/rejected": -1.3032139539718628, | |
| "logps/chosen": -5.271670818328857, | |
| "logps/rejected": -70.27622985839844, | |
| "loss": 0.22915054857730865, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2062722146511078, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4416859745979309, | |
| "rewards/margins": 6.420576095581055, | |
| "rewards/rejected": -5.978890419006348, | |
| "step": 580, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5063291139240507, | |
| "grad_norm": 0.7780730128288269, | |
| "learning_rate": 3.121391744342546e-05, | |
| "logits/chosen": -1.27274489402771, | |
| "logits/rejected": -1.2946935892105103, | |
| "logps/chosen": -2.167703628540039, | |
| "logps/rejected": -82.38484191894531, | |
| "loss": 0.1313847005367279, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.124984011054039, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4470738470554352, | |
| "rewards/margins": 7.279787063598633, | |
| "rewards/rejected": -6.832714557647705, | |
| "step": 581, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5089256734826355, | |
| "grad_norm": 0.7834947109222412, | |
| "learning_rate": 3.0902610850071924e-05, | |
| "logits/chosen": -1.2649881839752197, | |
| "logits/rejected": -1.270396113395691, | |
| "logps/chosen": -4.809529781341553, | |
| "logps/rejected": -75.95304107666016, | |
| "loss": 0.21607160568237305, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19319041073322296, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6121608018875122, | |
| "rewards/margins": 7.184690475463867, | |
| "rewards/rejected": -6.572530269622803, | |
| "step": 582, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5115222330412204, | |
| "grad_norm": 1.0974911451339722, | |
| "learning_rate": 3.059258047793661e-05, | |
| "logits/chosen": -1.2686303853988647, | |
| "logits/rejected": -1.266996145248413, | |
| "logps/chosen": -6.2699503898620605, | |
| "logps/rejected": -75.85345458984375, | |
| "loss": 0.20134985446929932, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19503507018089294, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5324012041091919, | |
| "rewards/margins": 6.867381572723389, | |
| "rewards/rejected": -6.334980487823486, | |
| "step": 583, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5141187925998052, | |
| "grad_norm": 0.8552331924438477, | |
| "learning_rate": 3.028383205324664e-05, | |
| "logits/chosen": -1.2964813709259033, | |
| "logits/rejected": -1.2977771759033203, | |
| "logps/chosen": -4.300373077392578, | |
| "logps/rejected": -71.34073638916016, | |
| "loss": 0.1761379987001419, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16346776485443115, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5423522591590881, | |
| "rewards/margins": 6.4881744384765625, | |
| "rewards/rejected": -5.945821762084961, | |
| "step": 584, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.51671535215839, | |
| "grad_norm": 2.7961208820343018, | |
| "learning_rate": 2.9976371278551596e-05, | |
| "logits/chosen": -1.26725172996521, | |
| "logits/rejected": -1.2702522277832031, | |
| "logps/chosen": -6.598125457763672, | |
| "logps/rejected": -75.9102783203125, | |
| "loss": 0.21579381823539734, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2034890353679657, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5635837912559509, | |
| "rewards/margins": 6.742549419403076, | |
| "rewards/rejected": -6.178965091705322, | |
| "step": 585, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5193119117169749, | |
| "grad_norm": 0.7595794796943665, | |
| "learning_rate": 2.9670203832618338e-05, | |
| "logits/chosen": -1.3211987018585205, | |
| "logits/rejected": -1.3264515399932861, | |
| "logps/chosen": -5.026176452636719, | |
| "logps/rejected": -73.40199279785156, | |
| "loss": 0.2131197303533554, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20605915784835815, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5510646104812622, | |
| "rewards/margins": 6.663293361663818, | |
| "rewards/rejected": -6.112229347229004, | |
| "step": 586, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5219084712755597, | |
| "grad_norm": 0.5875643491744995, | |
| "learning_rate": 2.9365335370326142e-05, | |
| "logits/chosen": -1.2664649486541748, | |
| "logits/rejected": -1.2790292501449585, | |
| "logps/chosen": -4.272137641906738, | |
| "logps/rejected": -78.49589538574219, | |
| "loss": 0.16073563694953918, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14196071028709412, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5238849520683289, | |
| "rewards/margins": 7.083423614501953, | |
| "rewards/rejected": -6.559538841247559, | |
| "step": 587, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5245050308341448, | |
| "grad_norm": 0.5453342795372009, | |
| "learning_rate": 2.906177152256214e-05, | |
| "logits/chosen": -1.2802778482437134, | |
| "logits/rejected": -1.287778615951538, | |
| "logps/chosen": -3.453296661376953, | |
| "logps/rejected": -80.28994750976562, | |
| "loss": 0.11858940124511719, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.114979088306427, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3646010160446167, | |
| "rewards/margins": 7.368077278137207, | |
| "rewards/rejected": -7.003476619720459, | |
| "step": 588, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5271015903927296, | |
| "grad_norm": 0.8347062468528748, | |
| "learning_rate": 2.875951789611734e-05, | |
| "logits/chosen": -1.2904810905456543, | |
| "logits/rejected": -1.2961167097091675, | |
| "logps/chosen": -7.039205551147461, | |
| "logps/rejected": -79.34686279296875, | |
| "loss": 0.20924313366413116, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18833908438682556, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5033472180366516, | |
| "rewards/margins": 7.3004374504089355, | |
| "rewards/rejected": -6.797090530395508, | |
| "step": 589, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5296981499513145, | |
| "grad_norm": 0.6540753841400146, | |
| "learning_rate": 2.8458580073583264e-05, | |
| "logits/chosen": -1.266171932220459, | |
| "logits/rejected": -1.2721834182739258, | |
| "logps/chosen": -4.1306471824646, | |
| "logps/rejected": -74.91023254394531, | |
| "loss": 0.1655585914850235, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1580181121826172, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.32985809445381165, | |
| "rewards/margins": 6.546298980712891, | |
| "rewards/rejected": -6.216440677642822, | |
| "step": 590, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5322947095098995, | |
| "grad_norm": 0.6838015913963318, | |
| "learning_rate": 2.8158963613248433e-05, | |
| "logits/chosen": -1.303230881690979, | |
| "logits/rejected": -1.3014085292816162, | |
| "logps/chosen": -5.523627281188965, | |
| "logps/rejected": -60.67312240600586, | |
| "loss": 0.19359934329986572, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15228185057640076, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5309136509895325, | |
| "rewards/margins": 5.451134204864502, | |
| "rewards/rejected": -4.920220851898193, | |
| "step": 591, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5348912690684844, | |
| "grad_norm": 1.0530349016189575, | |
| "learning_rate": 2.786067404899617e-05, | |
| "logits/chosen": -1.2414886951446533, | |
| "logits/rejected": -1.2445082664489746, | |
| "logps/chosen": -5.888449192047119, | |
| "logps/rejected": -71.38929748535156, | |
| "loss": 0.22650176286697388, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20438861846923828, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49599599838256836, | |
| "rewards/margins": 6.550296306610107, | |
| "rewards/rejected": -6.054300785064697, | |
| "step": 592, | |
| "train_speed(iter/s)": 0.005352 | |
| }, | |
| { | |
| "epoch": 1.5374878286270692, | |
| "grad_norm": 0.9590216875076294, | |
| "learning_rate": 2.756371689020214e-05, | |
| "logits/chosen": -1.284089207649231, | |
| "logits/rejected": -1.291182041168213, | |
| "logps/chosen": -5.660233497619629, | |
| "logps/rejected": -78.09732055664062, | |
| "loss": 0.21897563338279724, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20564842224121094, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6212056279182434, | |
| "rewards/margins": 7.130356311798096, | |
| "rewards/rejected": -6.509150981903076, | |
| "step": 593, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.540084388185654, | |
| "grad_norm": 0.8171280026435852, | |
| "learning_rate": 2.726809762163247e-05, | |
| "logits/chosen": -1.2626338005065918, | |
| "logits/rejected": -1.2816903591156006, | |
| "logps/chosen": -3.3798415660858154, | |
| "logps/rejected": -79.01041412353516, | |
| "loss": 0.1683107167482376, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1568489968776703, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6359814405441284, | |
| "rewards/margins": 7.243876934051514, | |
| "rewards/rejected": -6.607895374298096, | |
| "step": 594, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.542680947744239, | |
| "grad_norm": 0.7614494562149048, | |
| "learning_rate": 2.697382170334275e-05, | |
| "logits/chosen": -1.2870750427246094, | |
| "logits/rejected": -1.2988437414169312, | |
| "logps/chosen": -3.8276844024658203, | |
| "logps/rejected": -80.0929946899414, | |
| "loss": 0.15257692337036133, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14827337861061096, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.44497260451316833, | |
| "rewards/margins": 7.25712776184082, | |
| "rewards/rejected": -6.812155246734619, | |
| "step": 595, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.5452775073028238, | |
| "grad_norm": 0.7709101438522339, | |
| "learning_rate": 2.668089457057704e-05, | |
| "logits/chosen": -1.3179664611816406, | |
| "logits/rejected": -1.3277684450149536, | |
| "logps/chosen": -3.917905807495117, | |
| "logps/rejected": -73.78385162353516, | |
| "loss": 0.20244568586349487, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1898242086172104, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.408854603767395, | |
| "rewards/margins": 6.5159125328063965, | |
| "rewards/rejected": -6.107057571411133, | |
| "step": 596, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.5478740668614086, | |
| "grad_norm": 1.1506835222244263, | |
| "learning_rate": 2.638932163366742e-05, | |
| "logits/chosen": -1.2968817949295044, | |
| "logits/rejected": -1.307157278060913, | |
| "logps/chosen": -3.7310962677001953, | |
| "logps/rejected": -79.50012969970703, | |
| "loss": 0.1415027379989624, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12706293165683746, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38727837800979614, | |
| "rewards/margins": 7.095935344696045, | |
| "rewards/rejected": -6.708656311035156, | |
| "step": 597, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 1.5504706264199934, | |
| "grad_norm": 1.2147072553634644, | |
| "learning_rate": 2.6099108277934103e-05, | |
| "logits/chosen": -1.3259124755859375, | |
| "logits/rejected": -1.3342318534851074, | |
| "logps/chosen": -5.113812446594238, | |
| "logps/rejected": -72.30021667480469, | |
| "loss": 0.23814579844474792, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1989901065826416, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3370703458786011, | |
| "rewards/margins": 6.340109825134277, | |
| "rewards/rejected": -6.003039836883545, | |
| "step": 598, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 1.5530671859785783, | |
| "grad_norm": 0.6469516754150391, | |
| "learning_rate": 2.5810259863586018e-05, | |
| "logits/chosen": -1.3008332252502441, | |
| "logits/rejected": -1.3114441633224487, | |
| "logps/chosen": -3.1887383460998535, | |
| "logps/rejected": -89.48507690429688, | |
| "loss": 0.10776513069868088, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1028357744216919, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.410270631313324, | |
| "rewards/margins": 7.939424514770508, | |
| "rewards/rejected": -7.529153823852539, | |
| "step": 599, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 1.5556637455371631, | |
| "grad_norm": 0.5676211714744568, | |
| "learning_rate": 2.5522781725621813e-05, | |
| "logits/chosen": -1.3371210098266602, | |
| "logits/rejected": -1.3387823104858398, | |
| "logps/chosen": -3.7307708263397217, | |
| "logps/rejected": -80.85253143310547, | |
| "loss": 0.13133268058300018, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12862281501293182, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5126275420188904, | |
| "rewards/margins": 7.358179092407227, | |
| "rewards/rejected": -6.845551013946533, | |
| "step": 600, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 1.5556637455371631, | |
| "eval_logits/chosen": -1.304226040840149, | |
| "eval_logits/rejected": -1.3143255710601807, | |
| "eval_logps/chosen": -7.2022528648376465, | |
| "eval_logps/rejected": -78.7955551147461, | |
| "eval_loss": 0.2647717297077179, | |
| "eval_nll_loss": 0.2476370930671692, | |
| "eval_rewards/accuracies": 1.0, | |
| "eval_rewards/chosen": 0.5162011384963989, | |
| "eval_rewards/margins": 7.155314922332764, | |
| "eval_rewards/rejected": -6.639112949371338, | |
| "eval_runtime": 291.2848, | |
| "eval_samples_per_second": 0.426, | |
| "eval_steps_per_second": 0.426, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.558260305095748, | |
| "grad_norm": 0.5284009575843811, | |
| "learning_rate": 2.523667917373125e-05, | |
| "logits/chosen": -1.2985765933990479, | |
| "logits/rejected": -1.3168220520019531, | |
| "logps/chosen": -2.943354368209839, | |
| "logps/rejected": -91.36310577392578, | |
| "loss": 0.09971652179956436, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.0945102795958519, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5126221776008606, | |
| "rewards/margins": 8.36147403717041, | |
| "rewards/rejected": -7.848851203918457, | |
| "step": 601, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.560856864654333, | |
| "grad_norm": 0.5907682776451111, | |
| "learning_rate": 2.4951957492197097e-05, | |
| "logits/chosen": -1.2848440408706665, | |
| "logits/rejected": -1.2836586236953735, | |
| "logps/chosen": -3.989741563796997, | |
| "logps/rejected": -70.67216491699219, | |
| "loss": 0.14021284878253937, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13644501566886902, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7150586843490601, | |
| "rewards/margins": 6.884438514709473, | |
| "rewards/rejected": -6.169380187988281, | |
| "step": 602, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5634534242129179, | |
| "grad_norm": 0.6943731904029846, | |
| "learning_rate": 2.4668621939797743e-05, | |
| "logits/chosen": -1.3670181035995483, | |
| "logits/rejected": -1.380336880683899, | |
| "logps/chosen": -4.377835273742676, | |
| "logps/rejected": -79.83389282226562, | |
| "loss": 0.16850493848323822, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1525357961654663, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3955461382865906, | |
| "rewards/margins": 7.191918849945068, | |
| "rewards/rejected": -6.79637336730957, | |
| "step": 603, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5660499837715027, | |
| "grad_norm": 0.7594765424728394, | |
| "learning_rate": 2.438667774970981e-05, | |
| "logits/chosen": -1.3331427574157715, | |
| "logits/rejected": -1.3355261087417603, | |
| "logps/chosen": -3.4951040744781494, | |
| "logps/rejected": -73.5210189819336, | |
| "loss": 0.15708421170711517, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14821352064609528, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6260663270950317, | |
| "rewards/margins": 6.858430862426758, | |
| "rewards/rejected": -6.232364654541016, | |
| "step": 604, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5686465433300878, | |
| "grad_norm": 0.7032631039619446, | |
| "learning_rate": 2.410613012941161e-05, | |
| "logits/chosen": -1.3653652667999268, | |
| "logits/rejected": -1.3712530136108398, | |
| "logps/chosen": -4.2118754386901855, | |
| "logps/rejected": -76.30243682861328, | |
| "loss": 0.1958620846271515, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1903282105922699, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6078907251358032, | |
| "rewards/margins": 7.107419490814209, | |
| "rewards/rejected": -6.499528884887695, | |
| "step": 605, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5712431028886726, | |
| "grad_norm": 0.849923849105835, | |
| "learning_rate": 2.382698426058708e-05, | |
| "logits/chosen": -1.335965871810913, | |
| "logits/rejected": -1.3330975770950317, | |
| "logps/chosen": -6.150424003601074, | |
| "logps/rejected": -76.69558715820312, | |
| "loss": 0.20354051887989044, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19987499713897705, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6220974922180176, | |
| "rewards/margins": 7.106598377227783, | |
| "rewards/rejected": -6.484500885009766, | |
| "step": 606, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5738396624472575, | |
| "grad_norm": 0.6774344444274902, | |
| "learning_rate": 2.3549245299029777e-05, | |
| "logits/chosen": -1.349198341369629, | |
| "logits/rejected": -1.3615375757217407, | |
| "logps/chosen": -3.236879348754883, | |
| "logps/rejected": -86.70790100097656, | |
| "loss": 0.104849673807621, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.10025446116924286, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6544709205627441, | |
| "rewards/margins": 7.710179805755615, | |
| "rewards/rejected": -7.055708885192871, | |
| "step": 607, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5764362220058423, | |
| "grad_norm": 0.9244331121444702, | |
| "learning_rate": 2.3272918374547993e-05, | |
| "logits/chosen": -1.353797197341919, | |
| "logits/rejected": -1.3594809770584106, | |
| "logps/chosen": -5.656945705413818, | |
| "logps/rejected": -75.61239624023438, | |
| "loss": 0.1939372569322586, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.172727569937706, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4641644358634949, | |
| "rewards/margins": 6.93808650970459, | |
| "rewards/rejected": -6.473921775817871, | |
| "step": 608, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.5790327815644272, | |
| "grad_norm": 0.7308290600776672, | |
| "learning_rate": 2.2998008590869836e-05, | |
| "logits/chosen": -1.3354146480560303, | |
| "logits/rejected": -1.3375046253204346, | |
| "logps/chosen": -5.986130714416504, | |
| "logps/rejected": -75.91438293457031, | |
| "loss": 0.19244912266731262, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1849290430545807, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5376923680305481, | |
| "rewards/margins": 6.803253173828125, | |
| "rewards/rejected": -6.265561103820801, | |
| "step": 609, | |
| "train_speed(iter/s)": 0.005339 | |
| }, | |
| { | |
| "epoch": 1.581629341123012, | |
| "grad_norm": 0.8735436797142029, | |
| "learning_rate": 2.2724521025548828e-05, | |
| "logits/chosen": -1.3188555240631104, | |
| "logits/rejected": -1.3274950981140137, | |
| "logps/chosen": -4.066837310791016, | |
| "logps/rejected": -85.56442260742188, | |
| "loss": 0.17418046295642853, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.16407504677772522, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4197569489479065, | |
| "rewards/margins": 7.919032096862793, | |
| "rewards/rejected": -7.499274253845215, | |
| "step": 610, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 1.5842259006815969, | |
| "grad_norm": 2.2200708389282227, | |
| "learning_rate": 2.245246072987045e-05, | |
| "logits/chosen": -1.2984387874603271, | |
| "logits/rejected": -1.3079633712768555, | |
| "logps/chosen": -6.325509071350098, | |
| "logps/rejected": -74.75194549560547, | |
| "loss": 0.26426559686660767, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22844800353050232, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2353907823562622, | |
| "rewards/margins": 6.702395439147949, | |
| "rewards/rejected": -6.467005252838135, | |
| "step": 611, | |
| "train_speed(iter/s)": 0.00534 | |
| }, | |
| { | |
| "epoch": 1.5868224602401817, | |
| "grad_norm": 0.7086100578308105, | |
| "learning_rate": 2.2181832728758632e-05, | |
| "logits/chosen": -1.3292683362960815, | |
| "logits/rejected": -1.342342495918274, | |
| "logps/chosen": -7.971512794494629, | |
| "logps/rejected": -74.80581665039062, | |
| "loss": 0.2390933483839035, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2257128208875656, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5516778826713562, | |
| "rewards/margins": 6.869455337524414, | |
| "rewards/rejected": -6.317777633666992, | |
| "step": 612, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.5894190197987665, | |
| "grad_norm": 6.074515342712402, | |
| "learning_rate": 2.191264202068286e-05, | |
| "logits/chosen": -1.330883264541626, | |
| "logits/rejected": -1.3335540294647217, | |
| "logps/chosen": -4.599937438964844, | |
| "logps/rejected": -75.81354522705078, | |
| "loss": 0.20728431642055511, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19485875964164734, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49222689867019653, | |
| "rewards/margins": 7.163850784301758, | |
| "rewards/rejected": -6.671623706817627, | |
| "step": 613, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.5920155793573514, | |
| "grad_norm": 0.7445679306983948, | |
| "learning_rate": 2.1644893577566116e-05, | |
| "logits/chosen": -1.3524935245513916, | |
| "logits/rejected": -1.3670296669006348, | |
| "logps/chosen": -4.401839733123779, | |
| "logps/rejected": -75.92784881591797, | |
| "loss": 0.17038778960704803, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1660994589328766, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6142419576644897, | |
| "rewards/margins": 6.9780192375183105, | |
| "rewards/rejected": -6.363776683807373, | |
| "step": 614, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.5946121389159362, | |
| "grad_norm": 0.6692366600036621, | |
| "learning_rate": 2.1378592344692862e-05, | |
| "logits/chosen": -1.3450599908828735, | |
| "logits/rejected": -1.3609131574630737, | |
| "logps/chosen": -2.963831901550293, | |
| "logps/rejected": -85.60203552246094, | |
| "loss": 0.11893543601036072, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.10431487113237381, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.49938374757766724, | |
| "rewards/margins": 7.664846897125244, | |
| "rewards/rejected": -7.165462017059326, | |
| "step": 615, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.5972086984745213, | |
| "grad_norm": 1.2328548431396484, | |
| "learning_rate": 2.1113743240617668e-05, | |
| "logits/chosen": -1.343220829963684, | |
| "logits/rejected": -1.3497005701065063, | |
| "logps/chosen": -4.603923797607422, | |
| "logps/rejected": -75.76362609863281, | |
| "loss": 0.18495653569698334, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15200993418693542, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6504652500152588, | |
| "rewards/margins": 6.986648082733154, | |
| "rewards/rejected": -6.336182594299316, | |
| "step": 616, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.5998052580331061, | |
| "grad_norm": 0.7638961672782898, | |
| "learning_rate": 2.0850351157074598e-05, | |
| "logits/chosen": -1.3338675498962402, | |
| "logits/rejected": -1.3393734693527222, | |
| "logps/chosen": -5.415805339813232, | |
| "logps/rejected": -76.63778686523438, | |
| "loss": 0.19142858684062958, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.17946861684322357, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5905900597572327, | |
| "rewards/margins": 7.105247974395752, | |
| "rewards/rejected": -6.514657974243164, | |
| "step": 617, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.602401817591691, | |
| "grad_norm": 0.7070993185043335, | |
| "learning_rate": 2.0588420958886578e-05, | |
| "logits/chosen": -1.3037599325180054, | |
| "logits/rejected": -1.3092586994171143, | |
| "logps/chosen": -3.857360363006592, | |
| "logps/rejected": -74.8001708984375, | |
| "loss": 0.16437619924545288, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13853932917118073, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.31387850642204285, | |
| "rewards/margins": 6.748230934143066, | |
| "rewards/rejected": -6.434351921081543, | |
| "step": 618, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.604998377150276, | |
| "grad_norm": 0.942775309085846, | |
| "learning_rate": 2.0327957483875694e-05, | |
| "logits/chosen": -1.3658478260040283, | |
| "logits/rejected": -1.3638713359832764, | |
| "logps/chosen": -5.2065839767456055, | |
| "logps/rejected": -75.38078308105469, | |
| "loss": 0.19663846492767334, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15267634391784668, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4773911237716675, | |
| "rewards/margins": 6.9232282638549805, | |
| "rewards/rejected": -6.445837497711182, | |
| "step": 619, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6075949367088609, | |
| "grad_norm": 0.7806491255760193, | |
| "learning_rate": 2.0068965542773876e-05, | |
| "logits/chosen": -1.324061632156372, | |
| "logits/rejected": -1.3434507846832275, | |
| "logps/chosen": -2.706183671951294, | |
| "logps/rejected": -81.15982055664062, | |
| "loss": 0.14189621806144714, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12525126338005066, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5728058815002441, | |
| "rewards/margins": 7.6588029861450195, | |
| "rewards/rejected": -7.085996150970459, | |
| "step": 620, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6101914962674457, | |
| "grad_norm": 0.7165568470954895, | |
| "learning_rate": 1.981144991913392e-05, | |
| "logits/chosen": -1.347527027130127, | |
| "logits/rejected": -1.3617969751358032, | |
| "logps/chosen": -3.1274702548980713, | |
| "logps/rejected": -89.35918426513672, | |
| "loss": 0.13759316504001617, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12061534821987152, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5373324751853943, | |
| "rewards/margins": 8.121000289916992, | |
| "rewards/rejected": -7.583667755126953, | |
| "step": 621, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6127880558260306, | |
| "grad_norm": 0.7025841474533081, | |
| "learning_rate": 1.9555415369241225e-05, | |
| "logits/chosen": -1.3251571655273438, | |
| "logits/rejected": -1.3403229713439941, | |
| "logps/chosen": -2.860119104385376, | |
| "logps/rejected": -89.72604370117188, | |
| "loss": 0.12598752975463867, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12241947650909424, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.48666584491729736, | |
| "rewards/margins": 8.185951232910156, | |
| "rewards/rejected": -7.69928503036499, | |
| "step": 622, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6153846153846154, | |
| "grad_norm": 0.7084252834320068, | |
| "learning_rate": 1.9300866622025893e-05, | |
| "logits/chosen": -1.371070384979248, | |
| "logits/rejected": -1.383573293685913, | |
| "logps/chosen": -5.293520927429199, | |
| "logps/rejected": -87.0187759399414, | |
| "loss": 0.15480637550354004, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1465662270784378, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3128480911254883, | |
| "rewards/margins": 7.824625492095947, | |
| "rewards/rejected": -7.511777877807617, | |
| "step": 623, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6179811749432003, | |
| "grad_norm": 0.7480162978172302, | |
| "learning_rate": 1.9047808378975486e-05, | |
| "logits/chosen": -1.3239214420318604, | |
| "logits/rejected": -1.3253374099731445, | |
| "logps/chosen": -6.071501731872559, | |
| "logps/rejected": -89.98245239257812, | |
| "loss": 0.18201348185539246, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1786748617887497, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5310088396072388, | |
| "rewards/margins": 8.276474952697754, | |
| "rewards/rejected": -7.745467185974121, | |
| "step": 624, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.620577734501785, | |
| "grad_norm": 0.7341568470001221, | |
| "learning_rate": 1.8796245314048044e-05, | |
| "logits/chosen": -1.350547432899475, | |
| "logits/rejected": -1.3660997152328491, | |
| "logps/chosen": -2.5804781913757324, | |
| "logps/rejected": -85.6153793334961, | |
| "loss": 0.12906776368618011, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1090274304151535, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5288074612617493, | |
| "rewards/margins": 7.744842052459717, | |
| "rewards/rejected": -7.216034412384033, | |
| "step": 625, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.62317429406037, | |
| "grad_norm": 0.6811425089836121, | |
| "learning_rate": 1.8546182073585828e-05, | |
| "logits/chosen": -1.3307138681411743, | |
| "logits/rejected": -1.3467280864715576, | |
| "logps/chosen": -4.399513244628906, | |
| "logps/rejected": -95.36567687988281, | |
| "loss": 0.17138627171516418, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1693284511566162, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36113083362579346, | |
| "rewards/margins": 8.433231353759766, | |
| "rewards/rejected": -8.072100639343262, | |
| "step": 626, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6257708536189548, | |
| "grad_norm": 0.8490860462188721, | |
| "learning_rate": 1.829762327622958e-05, | |
| "logits/chosen": -1.328543782234192, | |
| "logits/rejected": -1.346970558166504, | |
| "logps/chosen": -4.569067001342773, | |
| "logps/rejected": -94.38148498535156, | |
| "loss": 0.15949155390262604, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15811914205551147, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4599432945251465, | |
| "rewards/margins": 8.337040901184082, | |
| "rewards/rejected": -7.8770976066589355, | |
| "step": 627, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6283674131775396, | |
| "grad_norm": 0.8323735594749451, | |
| "learning_rate": 1.8050573512833068e-05, | |
| "logits/chosen": -1.3728554248809814, | |
| "logits/rejected": -1.388077735900879, | |
| "logps/chosen": -3.635087490081787, | |
| "logps/rejected": -84.30162811279297, | |
| "loss": 0.16639482975006104, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1421230286359787, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4008945822715759, | |
| "rewards/margins": 7.5037126541137695, | |
| "rewards/rejected": -7.102817535400391, | |
| "step": 628, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6309639727361245, | |
| "grad_norm": 0.7016049027442932, | |
| "learning_rate": 1.7805037346378384e-05, | |
| "logits/chosen": -1.3624804019927979, | |
| "logits/rejected": -1.3788541555404663, | |
| "logps/chosen": -4.170276165008545, | |
| "logps/rejected": -90.93599700927734, | |
| "loss": 0.15539219975471497, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14993149042129517, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5223506689071655, | |
| "rewards/margins": 8.19238567352295, | |
| "rewards/rejected": -7.670035362243652, | |
| "step": 629, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6335605322947095, | |
| "grad_norm": 5.010850429534912, | |
| "learning_rate": 1.7561019311891692e-05, | |
| "logits/chosen": -1.3748408555984497, | |
| "logits/rejected": -1.3848907947540283, | |
| "logps/chosen": -5.912624835968018, | |
| "logps/rejected": -90.88970184326172, | |
| "loss": 0.2722803056240082, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.22955626249313354, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.46179163455963135, | |
| "rewards/margins": 8.070945739746094, | |
| "rewards/rejected": -7.60915470123291, | |
| "step": 630, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6361570918532944, | |
| "grad_norm": 0.763546347618103, | |
| "learning_rate": 1.7318523916359375e-05, | |
| "logits/chosen": -1.324263572692871, | |
| "logits/rejected": -1.3297150135040283, | |
| "logps/chosen": -3.0377016067504883, | |
| "logps/rejected": -80.36509704589844, | |
| "loss": 0.13964565098285675, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.11970542371273041, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6791478395462036, | |
| "rewards/margins": 7.430585861206055, | |
| "rewards/rejected": -6.751438140869141, | |
| "step": 631, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6387536514118792, | |
| "grad_norm": 0.7758535742759705, | |
| "learning_rate": 1.707755563864484e-05, | |
| "logits/chosen": -1.3663057088851929, | |
| "logits/rejected": -1.3660892248153687, | |
| "logps/chosen": -7.182569980621338, | |
| "logps/rejected": -77.53275299072266, | |
| "loss": 0.20710787177085876, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.18503035604953766, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5746399164199829, | |
| "rewards/margins": 7.321009635925293, | |
| "rewards/rejected": -6.746369361877441, | |
| "step": 632, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6413502109704643, | |
| "grad_norm": 18.8266544342041, | |
| "learning_rate": 1.6838118929405854e-05, | |
| "logits/chosen": -1.3572516441345215, | |
| "logits/rejected": -1.3695107698440552, | |
| "logps/chosen": -4.2153215408325195, | |
| "logps/rejected": -70.64273834228516, | |
| "loss": 0.2971822917461395, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.28246480226516724, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.355130672454834, | |
| "rewards/margins": 6.3078107833862305, | |
| "rewards/rejected": -5.952679634094238, | |
| "step": 633, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6439467705290491, | |
| "grad_norm": 0.8900645971298218, | |
| "learning_rate": 1.660021821101222e-05, | |
| "logits/chosen": -1.3750463724136353, | |
| "logits/rejected": -1.3676670789718628, | |
| "logps/chosen": -8.479406356811523, | |
| "logps/rejected": -74.21772003173828, | |
| "loss": 0.2598121166229248, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2488086223602295, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.7162144184112549, | |
| "rewards/margins": 7.078793048858643, | |
| "rewards/rejected": -6.36257791519165, | |
| "step": 634, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.646543330087634, | |
| "grad_norm": 1.081635594367981, | |
| "learning_rate": 1.636385787746416e-05, | |
| "logits/chosen": -1.3343584537506104, | |
| "logits/rejected": -1.3506702184677124, | |
| "logps/chosen": -4.287896633148193, | |
| "logps/rejected": -82.9725112915039, | |
| "loss": 0.17199589312076569, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14536339044570923, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6349250078201294, | |
| "rewards/margins": 7.4133148193359375, | |
| "rewards/rejected": -6.778390407562256, | |
| "step": 635, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6491398896462188, | |
| "grad_norm": 5.774163722991943, | |
| "learning_rate": 1.6129042294311226e-05, | |
| "logits/chosen": -1.343154788017273, | |
| "logits/rejected": -1.3550117015838623, | |
| "logps/chosen": -4.13479471206665, | |
| "logps/rejected": -68.96117401123047, | |
| "loss": 0.5674282908439636, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.40918517112731934, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.3416549861431122, | |
| "rewards/margins": 6.578398704528809, | |
| "rewards/rejected": -6.236744403839111, | |
| "step": 636, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6517364492048037, | |
| "grad_norm": 0.8650281429290771, | |
| "learning_rate": 1.5895775798571522e-05, | |
| "logits/chosen": -1.3902291059494019, | |
| "logits/rejected": -1.3937687873840332, | |
| "logps/chosen": -5.421413421630859, | |
| "logps/rejected": -78.23155212402344, | |
| "loss": 0.1860850304365158, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1803363710641861, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.4473956525325775, | |
| "rewards/margins": 7.034005641937256, | |
| "rewards/rejected": -6.586610317230225, | |
| "step": 637, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6543330087633885, | |
| "grad_norm": 0.75139319896698, | |
| "learning_rate": 1.5664062698651705e-05, | |
| "logits/chosen": -1.3419991731643677, | |
| "logits/rejected": -1.3535465002059937, | |
| "logps/chosen": -3.7635464668273926, | |
| "logps/rejected": -94.62512969970703, | |
| "loss": 0.1265435814857483, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12444484233856201, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.40557020902633667, | |
| "rewards/margins": 8.491599082946777, | |
| "rewards/rejected": -8.086028099060059, | |
| "step": 638, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6569295683219734, | |
| "grad_norm": 1.0433430671691895, | |
| "learning_rate": 1.5433907274267355e-05, | |
| "logits/chosen": -1.328079104423523, | |
| "logits/rejected": -1.3367297649383545, | |
| "logps/chosen": -5.806182861328125, | |
| "logps/rejected": -84.19864654541016, | |
| "loss": 0.2376406192779541, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.235676571726799, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.45906656980514526, | |
| "rewards/margins": 7.460108757019043, | |
| "rewards/rejected": -7.001041889190674, | |
| "step": 639, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6595261278805582, | |
| "grad_norm": 0.6470867991447449, | |
| "learning_rate": 1.5205313776364027e-05, | |
| "logits/chosen": -1.3525469303131104, | |
| "logits/rejected": -1.3603522777557373, | |
| "logps/chosen": -3.8683226108551025, | |
| "logps/rejected": -82.79778289794922, | |
| "loss": 0.15905708074569702, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.15342724323272705, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5418492555618286, | |
| "rewards/margins": 7.654129505157471, | |
| "rewards/rejected": -7.11228084564209, | |
| "step": 640, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.662122687439143, | |
| "grad_norm": 0.8814226388931274, | |
| "learning_rate": 1.4978286427038601e-05, | |
| "logits/chosen": -1.2953623533248901, | |
| "logits/rejected": -1.3175257444381714, | |
| "logps/chosen": -3.588663101196289, | |
| "logps/rejected": -83.4087905883789, | |
| "loss": 0.17859791219234467, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14969876408576965, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3954733610153198, | |
| "rewards/margins": 7.318519115447998, | |
| "rewards/rejected": -6.923046112060547, | |
| "step": 641, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6647192469977279, | |
| "grad_norm": 0.9600425362586975, | |
| "learning_rate": 1.4752829419461356e-05, | |
| "logits/chosen": -1.3675446510314941, | |
| "logits/rejected": -1.3715183734893799, | |
| "logps/chosen": -5.777808666229248, | |
| "logps/rejected": -72.55799102783203, | |
| "loss": 0.21355006098747253, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.20122846961021423, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6262421607971191, | |
| "rewards/margins": 6.9362077713012695, | |
| "rewards/rejected": -6.309965133666992, | |
| "step": 642, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6673158065563127, | |
| "grad_norm": 0.7960318326950073, | |
| "learning_rate": 1.4528946917798603e-05, | |
| "logits/chosen": -1.3032656908035278, | |
| "logits/rejected": -1.308361291885376, | |
| "logps/chosen": -4.921981334686279, | |
| "logps/rejected": -72.86154174804688, | |
| "loss": 0.18860392272472382, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1692950427532196, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5242667198181152, | |
| "rewards/margins": 6.5315327644348145, | |
| "rewards/rejected": -6.007266044616699, | |
| "step": 643, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6699123661148978, | |
| "grad_norm": 0.7154169678688049, | |
| "learning_rate": 1.4306643057135637e-05, | |
| "logits/chosen": -1.3495804071426392, | |
| "logits/rejected": -1.3487272262573242, | |
| "logps/chosen": -4.284914016723633, | |
| "logps/rejected": -82.88322448730469, | |
| "loss": 0.1530197262763977, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13098730146884918, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6068970561027527, | |
| "rewards/margins": 7.615091323852539, | |
| "rewards/rejected": -7.008193492889404, | |
| "step": 644, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6725089256734826, | |
| "grad_norm": 0.9531897306442261, | |
| "learning_rate": 1.4085921943400415e-05, | |
| "logits/chosen": -1.3348288536071777, | |
| "logits/rejected": -1.3515242338180542, | |
| "logps/chosen": -5.095047950744629, | |
| "logps/rejected": -75.7342758178711, | |
| "loss": 0.24714748561382294, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21035797894001007, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.38048332929611206, | |
| "rewards/margins": 6.424774169921875, | |
| "rewards/rejected": -6.044290542602539, | |
| "step": 645, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6751054852320675, | |
| "grad_norm": 16.722322463989258, | |
| "learning_rate": 1.3866787653287805e-05, | |
| "logits/chosen": -1.3415000438690186, | |
| "logits/rejected": -1.359058141708374, | |
| "logps/chosen": -3.7091660499572754, | |
| "logps/rejected": -87.80061340332031, | |
| "loss": 0.1800370067358017, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14961153268814087, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.5320316553115845, | |
| "rewards/margins": 7.5755228996276855, | |
| "rewards/rejected": -7.043491363525391, | |
| "step": 646, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6777020447906525, | |
| "grad_norm": 0.6856510043144226, | |
| "learning_rate": 1.3649244234184156e-05, | |
| "logits/chosen": -1.3474607467651367, | |
| "logits/rejected": -1.353614091873169, | |
| "logps/chosen": -3.7221789360046387, | |
| "logps/rejected": -81.68478393554688, | |
| "loss": 0.1335882842540741, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.13118202984333038, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6159143447875977, | |
| "rewards/margins": 7.432640075683594, | |
| "rewards/rejected": -6.816725730895996, | |
| "step": 647, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6802986043492374, | |
| "grad_norm": 0.6763714551925659, | |
| "learning_rate": 1.3433295704092585e-05, | |
| "logits/chosen": -1.3173692226409912, | |
| "logits/rejected": -1.3308582305908203, | |
| "logps/chosen": -4.244126796722412, | |
| "logps/rejected": -91.7069320678711, | |
| "loss": 0.15246841311454773, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.14819884300231934, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.5995199084281921, | |
| "rewards/margins": 8.185004234313965, | |
| "rewards/rejected": -7.585484027862549, | |
| "step": 648, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.6828951639078222, | |
| "grad_norm": 0.7699263691902161, | |
| "learning_rate": 1.3218946051558867e-05, | |
| "logits/chosen": -1.355929970741272, | |
| "logits/rejected": -1.3632704019546509, | |
| "logps/chosen": -3.4825494289398193, | |
| "logps/rejected": -76.4013442993164, | |
| "loss": 0.15149284899234772, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.12583358585834503, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.6053353548049927, | |
| "rewards/margins": 7.040757179260254, | |
| "rewards/rejected": -6.435421943664551, | |
| "step": 649, | |
| "train_speed(iter/s)": 0.005341 | |
| }, | |
| { | |
| "epoch": 1.685491723466407, | |
| "grad_norm": 1.0006968975067139, | |
| "learning_rate": 1.3006199235597627e-05, | |
| "logits/chosen": -1.3747293949127197, | |
| "logits/rejected": -1.378046989440918, | |
| "logps/chosen": -4.248571395874023, | |
| "logps/rejected": -78.72927856445312, | |
| "loss": 0.21873235702514648, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.1984972208738327, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.36940085887908936, | |
| "rewards/margins": 7.074660778045654, | |
| "rewards/rejected": -6.705259799957275, | |
| "step": 650, | |
| "train_speed(iter/s)": 0.005341 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 770, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.628166896246587e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |