Instructions to use cragtmp/3add2gt6-100 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/3add2gt6-100 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/3add2gt6-100") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.1708580276576432, | |
| "eval_steps": 300, | |
| "global_step": 100, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0017085802765764322, | |
| "grad_norm": 9.203307151794434, | |
| "learning_rate": 3.3898305084745763e-06, | |
| "logits/chosen": -0.6409764885902405, | |
| "logits/rejected": -0.6413162350654602, | |
| "logps/chosen": -8.591513633728027, | |
| "logps/rejected": -9.922354698181152, | |
| "loss": 1.2514135837554932, | |
| "memory(GiB)": 45.3, | |
| "nll_loss": 0.5582665801048279, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.005423 | |
| }, | |
| { | |
| "epoch": 0.0034171605531528645, | |
| "grad_norm": 4.572653293609619, | |
| "learning_rate": 6.779661016949153e-06, | |
| "logits/chosen": -0.6253237724304199, | |
| "logits/rejected": -0.6232100129127502, | |
| "logps/chosen": -9.215431213378906, | |
| "logps/rejected": -6.302733898162842, | |
| "loss": 1.1804862022399902, | |
| "memory(GiB)": 45.3, | |
| "nll_loss": 0.4873391091823578, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005426 | |
| }, | |
| { | |
| "epoch": 0.005125740829729297, | |
| "grad_norm": 10.135663986206055, | |
| "learning_rate": 1.016949152542373e-05, | |
| "logits/chosen": -0.5830379724502563, | |
| "logits/rejected": -0.5847949981689453, | |
| "logps/chosen": -6.387916088104248, | |
| "logps/rejected": -12.526434898376465, | |
| "loss": 1.1388403177261353, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.44991743564605713, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0018886500038206577, | |
| "rewards/margins": 0.008566470816731453, | |
| "rewards/rejected": -0.006677820347249508, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005372 | |
| }, | |
| { | |
| "epoch": 0.006834321106305729, | |
| "grad_norm": 8.09815788269043, | |
| "learning_rate": 1.3559322033898305e-05, | |
| "logits/chosen": -0.5831664800643921, | |
| "logits/rejected": -0.5881690382957458, | |
| "logps/chosen": -9.77461051940918, | |
| "logps/rejected": -15.103912353515625, | |
| "loss": 1.2644962072372437, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5699671506881714, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.0013185496209189296, | |
| "rewards/margins": -0.0025646828580647707, | |
| "rewards/rejected": 0.0012461334699764848, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005433 | |
| }, | |
| { | |
| "epoch": 0.008542901382882162, | |
| "grad_norm": 10.546202659606934, | |
| "learning_rate": 1.694915254237288e-05, | |
| "logits/chosen": -0.6210501194000244, | |
| "logits/rejected": -0.6261105537414551, | |
| "logps/chosen": -9.743502616882324, | |
| "logps/rejected": -13.954730987548828, | |
| "loss": 1.2041635513305664, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5165743231773376, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.014782106503844261, | |
| "rewards/margins": 0.011779396794736385, | |
| "rewards/rejected": 0.0030027113389223814, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.005434 | |
| }, | |
| { | |
| "epoch": 0.010251481659458593, | |
| "grad_norm": 5.953731060028076, | |
| "learning_rate": 2.033898305084746e-05, | |
| "logits/chosen": -0.6194843649864197, | |
| "logits/rejected": -0.6225060224533081, | |
| "logps/chosen": -8.993276596069336, | |
| "logps/rejected": -11.800742149353027, | |
| "loss": 1.2383989095687866, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5413038730621338, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.02151685394346714, | |
| "rewards/margins": -0.004275719169527292, | |
| "rewards/rejected": 0.025792576372623444, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.005421 | |
| }, | |
| { | |
| "epoch": 0.011960061936035027, | |
| "grad_norm": 3.4447383880615234, | |
| "learning_rate": 2.3728813559322036e-05, | |
| "logits/chosen": -0.5979399681091309, | |
| "logits/rejected": -0.597865104675293, | |
| "logps/chosen": -11.88587760925293, | |
| "logps/rejected": -12.513296127319336, | |
| "loss": 1.1787316799163818, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4771195948123932, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.001614744309335947, | |
| "rewards/margins": -0.006370083428919315, | |
| "rewards/rejected": 0.007984823547303677, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005421 | |
| }, | |
| { | |
| "epoch": 0.013668642212611458, | |
| "grad_norm": 4.3422627449035645, | |
| "learning_rate": 2.711864406779661e-05, | |
| "logits/chosen": -0.5695681571960449, | |
| "logits/rejected": -0.5736703276634216, | |
| "logps/chosen": -8.691235542297363, | |
| "logps/rejected": -17.510940551757812, | |
| "loss": 1.085353970527649, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4569101631641388, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.061018284410238266, | |
| "rewards/margins": 0.16366331279277802, | |
| "rewards/rejected": -0.10264502465724945, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005421 | |
| }, | |
| { | |
| "epoch": 0.015377222489187891, | |
| "grad_norm": 6.347766399383545, | |
| "learning_rate": 3.050847457627119e-05, | |
| "logits/chosen": -0.6150330305099487, | |
| "logits/rejected": -0.6163787841796875, | |
| "logps/chosen": -14.26973819732666, | |
| "logps/rejected": -12.656587600708008, | |
| "loss": 1.3125040531158447, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.6051884293556213, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.06490564346313477, | |
| "rewards/margins": 0.03234899416565895, | |
| "rewards/rejected": -0.09725463390350342, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005427 | |
| }, | |
| { | |
| "epoch": 0.017085802765764324, | |
| "grad_norm": 3.609342575073242, | |
| "learning_rate": 3.389830508474576e-05, | |
| "logits/chosen": -0.5823943018913269, | |
| "logits/rejected": -0.5893073678016663, | |
| "logps/chosen": -12.539135932922363, | |
| "logps/rejected": -19.231651306152344, | |
| "loss": 1.154615044593811, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5292682647705078, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0102485166862607, | |
| "rewards/margins": 0.24539220333099365, | |
| "rewards/rejected": -0.2556407153606415, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.00544 | |
| }, | |
| { | |
| "epoch": 0.018794383042340754, | |
| "grad_norm": 4.803543567657471, | |
| "learning_rate": 3.728813559322034e-05, | |
| "logits/chosen": -0.6298958659172058, | |
| "logits/rejected": -0.6301961541175842, | |
| "logps/chosen": -10.286799430847168, | |
| "logps/rejected": -11.364641189575195, | |
| "loss": 1.143830418586731, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.43475160002708435, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.06166127696633339, | |
| "rewards/margins": 0.1280723363161087, | |
| "rewards/rejected": -0.189733624458313, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005459 | |
| }, | |
| { | |
| "epoch": 0.020502963318917187, | |
| "grad_norm": 6.843598365783691, | |
| "learning_rate": 4.067796610169492e-05, | |
| "logits/chosen": -0.6147834062576294, | |
| "logits/rejected": -0.6201154589653015, | |
| "logps/chosen": -11.104015350341797, | |
| "logps/rejected": -14.71792221069336, | |
| "loss": 1.2689580917358398, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4583723843097687, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.1446399688720703, | |
| "rewards/margins": -0.06440749764442444, | |
| "rewards/rejected": -0.08023246377706528, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.005454 | |
| }, | |
| { | |
| "epoch": 0.02221154359549362, | |
| "grad_norm": 4.361201286315918, | |
| "learning_rate": 4.4067796610169495e-05, | |
| "logits/chosen": -0.6593450307846069, | |
| "logits/rejected": -0.6623726487159729, | |
| "logps/chosen": -8.788830757141113, | |
| "logps/rejected": -12.09660530090332, | |
| "loss": 1.091460108757019, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.38157719373703003, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.03397805988788605, | |
| "rewards/margins": 0.08494514226913452, | |
| "rewards/rejected": -0.11892320215702057, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.005465 | |
| }, | |
| { | |
| "epoch": 0.023920123872070053, | |
| "grad_norm": 4.36707067489624, | |
| "learning_rate": 4.745762711864407e-05, | |
| "logits/chosen": -0.6003404259681702, | |
| "logits/rejected": -0.6018444895744324, | |
| "logps/chosen": -9.472915649414062, | |
| "logps/rejected": -12.008777618408203, | |
| "loss": 1.2156641483306885, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.42055219411849976, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.07689498364925385, | |
| "rewards/margins": -0.1264859437942505, | |
| "rewards/rejected": 0.049590952694416046, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.00548 | |
| }, | |
| { | |
| "epoch": 0.025628704148646483, | |
| "grad_norm": 3.2864296436309814, | |
| "learning_rate": 5.0847457627118643e-05, | |
| "logits/chosen": -0.6285042762756348, | |
| "logits/rejected": -0.6272621154785156, | |
| "logps/chosen": -14.201019287109375, | |
| "logps/rejected": -10.998590469360352, | |
| "loss": 1.2311502695083618, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5152750015258789, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.06618006527423859, | |
| "rewards/margins": 0.029741406440734863, | |
| "rewards/rejected": 0.036438651382923126, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005474 | |
| }, | |
| { | |
| "epoch": 0.027337284425222916, | |
| "grad_norm": 2.4144492149353027, | |
| "learning_rate": 5.423728813559322e-05, | |
| "logits/chosen": -0.6098039746284485, | |
| "logits/rejected": -0.6130300760269165, | |
| "logps/chosen": -3.4820291996002197, | |
| "logps/rejected": -16.196063995361328, | |
| "loss": 0.8393359780311584, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.214947909116745, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0826798751950264, | |
| "rewards/margins": 0.17492221295833588, | |
| "rewards/rejected": -0.09224233776330948, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.005477 | |
| }, | |
| { | |
| "epoch": 0.02904586470179935, | |
| "grad_norm": 2.3232851028442383, | |
| "learning_rate": 5.76271186440678e-05, | |
| "logits/chosen": -0.5909145474433899, | |
| "logits/rejected": -0.593756377696991, | |
| "logps/chosen": -7.929438591003418, | |
| "logps/rejected": -14.363272666931152, | |
| "loss": 0.9911059737205505, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.34508591890335083, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10390710830688477, | |
| "rewards/margins": 0.13225752115249634, | |
| "rewards/rejected": -0.028350409120321274, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005482 | |
| }, | |
| { | |
| "epoch": 0.030754444978375782, | |
| "grad_norm": 2.344477891921997, | |
| "learning_rate": 6.101694915254238e-05, | |
| "logits/chosen": -0.5697246789932251, | |
| "logits/rejected": -0.5692474246025085, | |
| "logps/chosen": -6.287097930908203, | |
| "logps/rejected": -10.676097869873047, | |
| "loss": 0.9974570274353027, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3142527639865875, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.09520465135574341, | |
| "rewards/margins": 0.04853628948330879, | |
| "rewards/rejected": 0.046668365597724915, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.03246302525495221, | |
| "grad_norm": 2.361417531967163, | |
| "learning_rate": 6.440677966101695e-05, | |
| "logits/chosen": -0.5909584164619446, | |
| "logits/rejected": -0.596694827079773, | |
| "logps/chosen": -4.706894874572754, | |
| "logps/rejected": -12.18591022491455, | |
| "loss": 0.8993738889694214, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.2403678447008133, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.1180216372013092, | |
| "rewards/margins": 0.09891890734434128, | |
| "rewards/rejected": 0.01910274103283882, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.03417160553152865, | |
| "grad_norm": 2.1051840782165527, | |
| "learning_rate": 6.779661016949152e-05, | |
| "logits/chosen": -0.5925375819206238, | |
| "logits/rejected": -0.5939764380455017, | |
| "logps/chosen": -7.690135478973389, | |
| "logps/rejected": -11.360199928283691, | |
| "loss": 0.9811086058616638, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.27671271562576294, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.15354080498218536, | |
| "rewards/margins": 0.02018781006336212, | |
| "rewards/rejected": 0.13335299491882324, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005507 | |
| }, | |
| { | |
| "epoch": 0.03588018580810508, | |
| "grad_norm": 2.453577995300293, | |
| "learning_rate": 7.11864406779661e-05, | |
| "logits/chosen": -0.589929461479187, | |
| "logits/rejected": -0.5913950800895691, | |
| "logps/chosen": -6.006174564361572, | |
| "logps/rejected": -12.356660842895508, | |
| "loss": 0.8762722015380859, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.26102662086486816, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.15477147698402405, | |
| "rewards/margins": 0.20186343789100647, | |
| "rewards/rejected": -0.047091953456401825, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.03758876608468151, | |
| "grad_norm": 2.334592819213867, | |
| "learning_rate": 7.457627118644068e-05, | |
| "logits/chosen": -0.6286447048187256, | |
| "logits/rejected": -0.6310911178588867, | |
| "logps/chosen": -9.828102111816406, | |
| "logps/rejected": -16.171802520751953, | |
| "loss": 0.9827708601951599, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.40016523003578186, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.22255462408065796, | |
| "rewards/margins": 0.2890108525753021, | |
| "rewards/rejected": -0.06645623594522476, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.039297346361257944, | |
| "grad_norm": 2.763946533203125, | |
| "learning_rate": 7.796610169491526e-05, | |
| "logits/chosen": -0.6423724889755249, | |
| "logits/rejected": -0.6475900411605835, | |
| "logps/chosen": -7.048077583312988, | |
| "logps/rejected": -17.518115997314453, | |
| "loss": 1.029776692390442, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4258265495300293, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.13568007946014404, | |
| "rewards/margins": 0.24192118644714355, | |
| "rewards/rejected": -0.10624107718467712, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.041005926637834374, | |
| "grad_norm": 5.438773155212402, | |
| "learning_rate": 8.135593220338983e-05, | |
| "logits/chosen": -0.611075758934021, | |
| "logits/rejected": -0.6109172701835632, | |
| "logps/chosen": -8.579011917114258, | |
| "logps/rejected": -12.74751091003418, | |
| "loss": 1.2176915407180786, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5213994979858398, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.010570855811238289, | |
| "rewards/margins": 0.06740333139896393, | |
| "rewards/rejected": -0.07797417044639587, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.0427145069144108, | |
| "grad_norm": 3.8305866718292236, | |
| "learning_rate": 8.474576271186441e-05, | |
| "logits/chosen": -0.6644467711448669, | |
| "logits/rejected": -0.6674079298973083, | |
| "logps/chosen": -6.975298881530762, | |
| "logps/rejected": -15.503819465637207, | |
| "loss": 0.922063410282135, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3326256275177002, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.06792093813419342, | |
| "rewards/margins": 0.324211061000824, | |
| "rewards/rejected": -0.25629013776779175, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.04442308719098724, | |
| "grad_norm": 4.446774959564209, | |
| "learning_rate": 8.813559322033899e-05, | |
| "logits/chosen": -0.6409133076667786, | |
| "logits/rejected": -0.6452510356903076, | |
| "logps/chosen": -5.22960090637207, | |
| "logps/rejected": -16.918365478515625, | |
| "loss": 0.7774365544319153, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.2448062300682068, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2400483787059784, | |
| "rewards/margins": 0.39764925837516785, | |
| "rewards/rejected": -0.15760089457035065, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.04613166746756367, | |
| "grad_norm": 2.5869643688201904, | |
| "learning_rate": 9.152542372881357e-05, | |
| "logits/chosen": -0.6091906428337097, | |
| "logits/rejected": -0.6120930910110474, | |
| "logps/chosen": -7.03964376449585, | |
| "logps/rejected": -18.091930389404297, | |
| "loss": 0.8498358726501465, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3106813132762909, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1571023166179657, | |
| "rewards/margins": 0.4190843403339386, | |
| "rewards/rejected": -0.2619820237159729, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.047840247744140106, | |
| "grad_norm": 3.0630600452423096, | |
| "learning_rate": 9.491525423728815e-05, | |
| "logits/chosen": -0.6014366745948792, | |
| "logits/rejected": -0.6016579270362854, | |
| "logps/chosen": -9.281977653503418, | |
| "logps/rejected": -13.255182266235352, | |
| "loss": 0.9999822974205017, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3916056454181671, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0838853195309639, | |
| "rewards/margins": 0.22357328236103058, | |
| "rewards/rejected": -0.13968798518180847, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.005488 | |
| }, | |
| { | |
| "epoch": 0.049548828020716536, | |
| "grad_norm": 4.956308364868164, | |
| "learning_rate": 9.830508474576272e-05, | |
| "logits/chosen": -0.6361557841300964, | |
| "logits/rejected": -0.6375819444656372, | |
| "logps/chosen": -5.407459735870361, | |
| "logps/rejected": -12.960749626159668, | |
| "loss": 0.9380594491958618, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.39800193905830383, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.14713114500045776, | |
| "rewards/margins": 0.4169777035713196, | |
| "rewards/rejected": -0.2698465585708618, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.051257408297292965, | |
| "grad_norm": 6.679542541503906, | |
| "learning_rate": 0.00010169491525423729, | |
| "logits/chosen": -0.6229231357574463, | |
| "logits/rejected": -0.6250395178794861, | |
| "logps/chosen": -11.77493667602539, | |
| "logps/rejected": -18.192317962646484, | |
| "loss": 0.7899165749549866, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.2795858085155487, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09651458263397217, | |
| "rewards/margins": 0.49087047576904297, | |
| "rewards/rejected": -0.3943559229373932, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.0529659885738694, | |
| "grad_norm": 4.011873245239258, | |
| "learning_rate": 0.00010508474576271188, | |
| "logits/chosen": -0.6524882912635803, | |
| "logits/rejected": -0.6541539430618286, | |
| "logps/chosen": -7.8713202476501465, | |
| "logps/rejected": -11.641451835632324, | |
| "loss": 0.9657379984855652, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.40233710408210754, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11578395962715149, | |
| "rewards/margins": 0.36746829748153687, | |
| "rewards/rejected": -0.25168436765670776, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005488 | |
| }, | |
| { | |
| "epoch": 0.05467456885044583, | |
| "grad_norm": 4.144499778747559, | |
| "learning_rate": 0.00010847457627118644, | |
| "logits/chosen": -0.6458109617233276, | |
| "logits/rejected": -0.6519441604614258, | |
| "logps/chosen": -8.17459487915039, | |
| "logps/rejected": -19.17450714111328, | |
| "loss": 0.9243566989898682, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3649522066116333, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.17762523889541626, | |
| "rewards/margins": 0.41990581154823303, | |
| "rewards/rejected": -0.24228057265281677, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.05638314912702227, | |
| "grad_norm": 2.5846283435821533, | |
| "learning_rate": 0.00011186440677966102, | |
| "logits/chosen": -0.6422857046127319, | |
| "logits/rejected": -0.64764004945755, | |
| "logps/chosen": -7.8391828536987305, | |
| "logps/rejected": -16.905941009521484, | |
| "loss": 0.8121039867401123, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3524104952812195, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.21112650632858276, | |
| "rewards/margins": 0.6391255259513855, | |
| "rewards/rejected": -0.42799898982048035, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.0580917294035987, | |
| "grad_norm": 2.831099271774292, | |
| "learning_rate": 0.0001152542372881356, | |
| "logits/chosen": -0.6351624727249146, | |
| "logits/rejected": -0.6340872645378113, | |
| "logps/chosen": -8.873239517211914, | |
| "logps/rejected": -14.13478946685791, | |
| "loss": 0.9939954280853271, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5031149983406067, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.15203362703323364, | |
| "rewards/margins": 0.5661364793777466, | |
| "rewards/rejected": -0.41410285234451294, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.05980030968017513, | |
| "grad_norm": 6.754673004150391, | |
| "learning_rate": 0.00011864406779661017, | |
| "logits/chosen": -0.6350009441375732, | |
| "logits/rejected": -0.6345161199569702, | |
| "logps/chosen": -9.049372673034668, | |
| "logps/rejected": -13.872842788696289, | |
| "loss": 0.9677298069000244, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4823642373085022, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.18822304904460907, | |
| "rewards/margins": 0.5690968632698059, | |
| "rewards/rejected": -0.38087382912635803, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.061508889956751564, | |
| "grad_norm": 5.09066915512085, | |
| "learning_rate": 0.00012203389830508477, | |
| "logits/chosen": -0.5940477252006531, | |
| "logits/rejected": -0.5995637774467468, | |
| "logps/chosen": -6.552436351776123, | |
| "logps/rejected": -22.02668571472168, | |
| "loss": 1.0198695659637451, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5385282635688782, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.09731997549533844, | |
| "rewards/margins": 0.7183221578598022, | |
| "rewards/rejected": -0.621002197265625, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.063217470233328, | |
| "grad_norm": 6.366957664489746, | |
| "learning_rate": 0.00012542372881355933, | |
| "logits/chosen": -0.5671308040618896, | |
| "logits/rejected": -0.5699396133422852, | |
| "logps/chosen": -8.690061569213867, | |
| "logps/rejected": -18.227741241455078, | |
| "loss": 0.9119342565536499, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4206831753253937, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.008592324331402779, | |
| "rewards/margins": 0.7837947010993958, | |
| "rewards/rejected": -0.7752023935317993, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.06492605050990442, | |
| "grad_norm": 8.224360466003418, | |
| "learning_rate": 0.0001288135593220339, | |
| "logits/chosen": -0.6006415486335754, | |
| "logits/rejected": -0.6039485931396484, | |
| "logps/chosen": -7.98246955871582, | |
| "logps/rejected": -19.214567184448242, | |
| "loss": 1.020494818687439, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.47989213466644287, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.017101695761084557, | |
| "rewards/margins": 0.7686665654182434, | |
| "rewards/rejected": -0.7857682704925537, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.06663463078648085, | |
| "grad_norm": 5.284773349761963, | |
| "learning_rate": 0.00013220338983050849, | |
| "logits/chosen": -0.5746678709983826, | |
| "logits/rejected": -0.5742544531822205, | |
| "logps/chosen": -10.300456047058105, | |
| "logps/rejected": -14.731122970581055, | |
| "loss": 1.1951102018356323, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.6024460196495056, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.005457160994410515, | |
| "rewards/margins": 0.43640822172164917, | |
| "rewards/rejected": -0.44186532497406006, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005499 | |
| }, | |
| { | |
| "epoch": 0.0683432110630573, | |
| "grad_norm": 4.581506252288818, | |
| "learning_rate": 0.00013559322033898305, | |
| "logits/chosen": -0.5436846613883972, | |
| "logits/rejected": -0.5412294268608093, | |
| "logps/chosen": -11.306229591369629, | |
| "logps/rejected": -15.808780670166016, | |
| "loss": 0.9979494214057922, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4069577753543854, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.10538371652364731, | |
| "rewards/margins": 0.4707936942577362, | |
| "rewards/rejected": -0.5761774778366089, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.005496 | |
| }, | |
| { | |
| "epoch": 0.07005179133963373, | |
| "grad_norm": 4.280210018157959, | |
| "learning_rate": 0.00013898305084745764, | |
| "logits/chosen": -0.5919702649116516, | |
| "logits/rejected": -0.5944460034370422, | |
| "logps/chosen": -4.601211071014404, | |
| "logps/rejected": -18.39055061340332, | |
| "loss": 0.7289348244667053, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.2620496451854706, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1577654778957367, | |
| "rewards/margins": 0.7140093445777893, | |
| "rewards/rejected": -0.5562438368797302, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.07176037161621016, | |
| "grad_norm": 2.8965229988098145, | |
| "learning_rate": 0.0001423728813559322, | |
| "logits/chosen": -0.5226963758468628, | |
| "logits/rejected": -0.5210604667663574, | |
| "logps/chosen": -8.042407035827637, | |
| "logps/rejected": -13.117356300354004, | |
| "loss": 0.8382841944694519, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3229953646659851, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.15337654948234558, | |
| "rewards/margins": 0.5258168578147888, | |
| "rewards/rejected": -0.3724403381347656, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.07346895189278659, | |
| "grad_norm": 4.7869791984558105, | |
| "learning_rate": 0.00014576271186440677, | |
| "logits/chosen": -0.5595600605010986, | |
| "logits/rejected": -0.5619646310806274, | |
| "logps/chosen": -5.741379261016846, | |
| "logps/rejected": -14.867729187011719, | |
| "loss": 0.9325981140136719, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.34299078583717346, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.06792251765727997, | |
| "rewards/margins": 0.3079211115837097, | |
| "rewards/rejected": -0.23999860882759094, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.07517753216936301, | |
| "grad_norm": 3.8402724266052246, | |
| "learning_rate": 0.00014915254237288136, | |
| "logits/chosen": -0.5551996231079102, | |
| "logits/rejected": -0.5583171248435974, | |
| "logps/chosen": -7.729850769042969, | |
| "logps/rejected": -14.535001754760742, | |
| "loss": 0.985005795955658, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.37224525213241577, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0475621297955513, | |
| "rewards/margins": 0.2842516601085663, | |
| "rewards/rejected": -0.23668958246707916, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.07688611244593946, | |
| "grad_norm": 3.136073112487793, | |
| "learning_rate": 0.00015254237288135592, | |
| "logits/chosen": -0.5538796186447144, | |
| "logits/rejected": -0.5563740730285645, | |
| "logps/chosen": -8.61514663696289, | |
| "logps/rejected": -20.434301376342773, | |
| "loss": 0.8447250723838806, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3852572441101074, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.17051486670970917, | |
| "rewards/margins": 0.695674479007721, | |
| "rewards/rejected": -0.5251596570014954, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.07859469272251589, | |
| "grad_norm": 2.950076103210449, | |
| "learning_rate": 0.00015593220338983051, | |
| "logits/chosen": -0.588573694229126, | |
| "logits/rejected": -0.5898380875587463, | |
| "logps/chosen": -8.49618911743164, | |
| "logps/rejected": -16.47633171081543, | |
| "loss": 0.8776077032089233, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.3434315621852875, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1189945787191391, | |
| "rewards/margins": 0.5393712520599365, | |
| "rewards/rejected": -0.42037665843963623, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.005498 | |
| }, | |
| { | |
| "epoch": 0.08030327299909232, | |
| "grad_norm": 2.918926954269409, | |
| "learning_rate": 0.00015932203389830508, | |
| "logits/chosen": -0.5735058188438416, | |
| "logits/rejected": -0.5742441415786743, | |
| "logps/chosen": -10.007829666137695, | |
| "logps/rejected": -15.225828170776367, | |
| "loss": 0.9683640003204346, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4518345892429352, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.29521822929382324, | |
| "rewards/margins": 0.5080306529998779, | |
| "rewards/rejected": -0.2128123939037323, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005501 | |
| }, | |
| { | |
| "epoch": 0.08201185327566875, | |
| "grad_norm": 2.885613441467285, | |
| "learning_rate": 0.00016271186440677967, | |
| "logits/chosen": -0.5690568089485168, | |
| "logits/rejected": -0.570725679397583, | |
| "logps/chosen": -6.9214887619018555, | |
| "logps/rejected": -17.073692321777344, | |
| "loss": 0.8013411164283752, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.2747730612754822, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1803244799375534, | |
| "rewards/margins": 0.5454539060592651, | |
| "rewards/rejected": -0.36512941122055054, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005502 | |
| }, | |
| { | |
| "epoch": 0.08372043355224518, | |
| "grad_norm": 2.8386495113372803, | |
| "learning_rate": 0.00016610169491525423, | |
| "logits/chosen": -0.5691187381744385, | |
| "logits/rejected": -0.5723721981048584, | |
| "logps/chosen": -6.647555828094482, | |
| "logps/rejected": -18.68927764892578, | |
| "loss": 0.731940746307373, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.31857162714004517, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.15964265167713165, | |
| "rewards/margins": 0.8172457218170166, | |
| "rewards/rejected": -0.6576029062271118, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005503 | |
| }, | |
| { | |
| "epoch": 0.0854290138288216, | |
| "grad_norm": 6.678228855133057, | |
| "learning_rate": 0.00016949152542372882, | |
| "logits/chosen": -0.569486141204834, | |
| "logits/rejected": -0.5724078416824341, | |
| "logps/chosen": -7.978659629821777, | |
| "logps/rejected": -18.0915584564209, | |
| "loss": 0.8816509246826172, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.41086509823799133, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16925573348999023, | |
| "rewards/margins": 0.6901466846466064, | |
| "rewards/rejected": -0.520891010761261, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.0055 | |
| }, | |
| { | |
| "epoch": 0.08713759410539805, | |
| "grad_norm": 3.4269354343414307, | |
| "learning_rate": 0.00017288135593220342, | |
| "logits/chosen": -0.6229482889175415, | |
| "logits/rejected": -0.624045193195343, | |
| "logps/chosen": -8.981767654418945, | |
| "logps/rejected": -18.87827491760254, | |
| "loss": 0.902818500995636, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4753139615058899, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12949834764003754, | |
| "rewards/margins": 0.91382896900177, | |
| "rewards/rejected": -0.7843306064605713, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.005488 | |
| }, | |
| { | |
| "epoch": 0.08884617438197448, | |
| "grad_norm": 3.730417013168335, | |
| "learning_rate": 0.00017627118644067798, | |
| "logits/chosen": -0.5907954573631287, | |
| "logits/rejected": -0.5928065776824951, | |
| "logps/chosen": -8.826777458190918, | |
| "logps/rejected": -25.743032455444336, | |
| "loss": 0.8241711854934692, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.4183700382709503, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.15070247650146484, | |
| "rewards/margins": 1.0849279165267944, | |
| "rewards/rejected": -0.9342254400253296, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.09055475465855091, | |
| "grad_norm": 6.543994426727295, | |
| "learning_rate": 0.00017966101694915257, | |
| "logits/chosen": -0.5657305717468262, | |
| "logits/rejected": -0.5669429898262024, | |
| "logps/chosen": -11.976017951965332, | |
| "logps/rejected": -18.324581146240234, | |
| "loss": 1.1098811626434326, | |
| "memory(GiB)": 46.08, | |
| "nll_loss": 0.5012481808662415, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.04995343089103699, | |
| "rewards/margins": 0.5761421918869019, | |
| "rewards/rejected": -0.6260955929756165, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09226333493512734, | |
| "grad_norm": 7.451931476593018, | |
| "learning_rate": 0.00018305084745762714, | |
| "logits/chosen": -0.5736872553825378, | |
| "logits/rejected": -0.5727863907814026, | |
| "logps/chosen": -9.956096649169922, | |
| "logps/rejected": -17.354209899902344, | |
| "loss": 1.0036059617996216, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.35273733735084534, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.07980930060148239, | |
| "rewards/margins": 0.5828754901885986, | |
| "rewards/rejected": -0.6626847982406616, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09397191521170377, | |
| "grad_norm": 4.901066303253174, | |
| "learning_rate": 0.0001864406779661017, | |
| "logits/chosen": -0.5865222811698914, | |
| "logits/rejected": -0.5857770442962646, | |
| "logps/chosen": -6.749457359313965, | |
| "logps/rejected": -19.966379165649414, | |
| "loss": 0.836351215839386, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.30449604988098145, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11927387118339539, | |
| "rewards/margins": 0.7463572025299072, | |
| "rewards/rejected": -0.6270833611488342, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.09568049548828021, | |
| "grad_norm": 3.0312962532043457, | |
| "learning_rate": 0.0001898305084745763, | |
| "logits/chosen": -0.5644817352294922, | |
| "logits/rejected": -0.5671055912971497, | |
| "logps/chosen": -6.525354862213135, | |
| "logps/rejected": -18.556304931640625, | |
| "loss": 0.7299084663391113, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.2566152811050415, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.051953963935375214, | |
| "rewards/margins": 0.8131421804428101, | |
| "rewards/rejected": -0.7611882090568542, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.09738907576485664, | |
| "grad_norm": 6.161406517028809, | |
| "learning_rate": 0.00019322033898305085, | |
| "logits/chosen": -0.5638913512229919, | |
| "logits/rejected": -0.5684786438941956, | |
| "logps/chosen": -8.483434677124023, | |
| "logps/rejected": -20.397701263427734, | |
| "loss": 0.988010585308075, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4928280711174011, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.17585664987564087, | |
| "rewards/margins": 0.6749651432037354, | |
| "rewards/rejected": -0.4991084933280945, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.09909765604143307, | |
| "grad_norm": 4.03005313873291, | |
| "learning_rate": 0.00019661016949152545, | |
| "logits/chosen": -0.5518775582313538, | |
| "logits/rejected": -0.552839994430542, | |
| "logps/chosen": -6.419961929321289, | |
| "logps/rejected": -20.10483169555664, | |
| "loss": 0.7270359396934509, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.2987552881240845, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.23015271127223969, | |
| "rewards/margins": 0.8427435159683228, | |
| "rewards/rejected": -0.6125907897949219, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.1008062363180095, | |
| "grad_norm": 2.9903881549835205, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.558972954750061, | |
| "logits/rejected": -0.559365451335907, | |
| "logps/chosen": -7.266337871551514, | |
| "logps/rejected": -19.700899124145508, | |
| "loss": 0.8035504221916199, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.35604721307754517, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.23076069355010986, | |
| "rewards/margins": 0.6581640243530273, | |
| "rewards/rejected": -0.4274032711982727, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.10251481659458593, | |
| "grad_norm": 2.308953046798706, | |
| "learning_rate": 0.00019999960020133237, | |
| "logits/chosen": -0.5721818804740906, | |
| "logits/rejected": -0.5736841559410095, | |
| "logps/chosen": -5.192386150360107, | |
| "logps/rejected": -16.873666763305664, | |
| "loss": 0.6971458196640015, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.25499823689460754, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14774081110954285, | |
| "rewards/margins": 0.7478816509246826, | |
| "rewards/rejected": -0.6001408696174622, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.10422339687116237, | |
| "grad_norm": 6.15336275100708, | |
| "learning_rate": 0.00019999840080852627, | |
| "logits/chosen": -0.6088159680366516, | |
| "logits/rejected": -0.6091991662979126, | |
| "logps/chosen": -10.085458755493164, | |
| "logps/rejected": -16.714794158935547, | |
| "loss": 1.2082210779190063, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.6319302320480347, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.015833575278520584, | |
| "rewards/margins": 0.46795743703842163, | |
| "rewards/rejected": -0.4837909936904907, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1059319771477388, | |
| "grad_norm": 4.543377876281738, | |
| "learning_rate": 0.00019999640183117196, | |
| "logits/chosen": -0.6160375475883484, | |
| "logits/rejected": -0.6183785796165466, | |
| "logps/chosen": -7.354756832122803, | |
| "logps/rejected": -17.332752227783203, | |
| "loss": 0.9280235767364502, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.39269304275512695, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.00012398138642311096, | |
| "rewards/margins": 0.7065204381942749, | |
| "rewards/rejected": -0.7063965797424316, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.10764055742431523, | |
| "grad_norm": 3.700834035873413, | |
| "learning_rate": 0.00019999360328525325, | |
| "logits/chosen": -0.5955262780189514, | |
| "logits/rejected": -0.5960131287574768, | |
| "logps/chosen": -7.038027763366699, | |
| "logps/rejected": -19.62297248840332, | |
| "loss": 0.8426406383514404, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.304790735244751, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.04702156037092209, | |
| "rewards/margins": 0.6756925582885742, | |
| "rewards/rejected": -0.6286709904670715, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.10934913770089166, | |
| "grad_norm": 3.616783857345581, | |
| "learning_rate": 0.00019999000519314722, | |
| "logits/chosen": -0.5933761596679688, | |
| "logits/rejected": -0.5956672430038452, | |
| "logps/chosen": -10.029403686523438, | |
| "logps/rejected": -19.743268966674805, | |
| "loss": 0.8910276889801025, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4178580045700073, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.059932250529527664, | |
| "rewards/margins": 0.7701122164726257, | |
| "rewards/rejected": -0.7101800441741943, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.11105771797746809, | |
| "grad_norm": 2.8669040203094482, | |
| "learning_rate": 0.00019998560758362416, | |
| "logits/chosen": -0.6144078373908997, | |
| "logits/rejected": -0.6167560815811157, | |
| "logps/chosen": -10.685945510864258, | |
| "logps/rejected": -23.724315643310547, | |
| "loss": 0.7696695923805237, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3780427873134613, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1446903944015503, | |
| "rewards/margins": 1.0186232328414917, | |
| "rewards/rejected": -0.873932957649231, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11276629825404454, | |
| "grad_norm": 4.312869548797607, | |
| "learning_rate": 0.00019998041049184719, | |
| "logits/chosen": -0.620762050151825, | |
| "logits/rejected": -0.6244264245033264, | |
| "logps/chosen": -11.728214263916016, | |
| "logps/rejected": -26.204395294189453, | |
| "loss": 0.7992648482322693, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4216463565826416, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.14800474047660828, | |
| "rewards/margins": 1.0791853666305542, | |
| "rewards/rejected": -0.9311806559562683, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.11447487853062097, | |
| "grad_norm": 7.865874290466309, | |
| "learning_rate": 0.00019997441395937213, | |
| "logits/chosen": -0.6298569440841675, | |
| "logits/rejected": -0.6332789659500122, | |
| "logps/chosen": -7.128231525421143, | |
| "logps/rejected": -22.970563888549805, | |
| "loss": 0.7514320015907288, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.33478716015815735, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05204010754823685, | |
| "rewards/margins": 0.9836788773536682, | |
| "rewards/rejected": -0.931638777256012, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.1161834588071974, | |
| "grad_norm": 6.099157810211182, | |
| "learning_rate": 0.0001999676180341471, | |
| "logits/chosen": -0.6536255478858948, | |
| "logits/rejected": -0.6564731597900391, | |
| "logps/chosen": -10.524028778076172, | |
| "logps/rejected": -19.91427993774414, | |
| "loss": 1.1307811737060547, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.7356545925140381, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.028077581897377968, | |
| "rewards/margins": 0.9777989387512207, | |
| "rewards/rejected": -0.9497213363647461, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.11789203908377383, | |
| "grad_norm": 5.27453088760376, | |
| "learning_rate": 0.00019996002277051218, | |
| "logits/chosen": -0.6637449264526367, | |
| "logits/rejected": -0.6651371717453003, | |
| "logps/chosen": -9.458850860595703, | |
| "logps/rejected": -16.127042770385742, | |
| "loss": 1.4500970840454102, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.8368474841117859, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.15293718874454498, | |
| "rewards/margins": 0.500515878200531, | |
| "rewards/rejected": -0.6534531116485596, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.005497 | |
| }, | |
| { | |
| "epoch": 0.11960061936035025, | |
| "grad_norm": 4.469899654388428, | |
| "learning_rate": 0.00019995162822919883, | |
| "logits/chosen": -0.6642380356788635, | |
| "logits/rejected": -0.664824366569519, | |
| "logps/chosen": -8.725358963012695, | |
| "logps/rejected": -16.164390563964844, | |
| "loss": 0.8428195714950562, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3803461194038391, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.08946336805820465, | |
| "rewards/margins": 0.7338303327560425, | |
| "rewards/rejected": -0.644366979598999, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12130919963692668, | |
| "grad_norm": 4.995606422424316, | |
| "learning_rate": 0.00019994243447732957, | |
| "logits/chosen": -0.6431492567062378, | |
| "logits/rejected": -0.6473235487937927, | |
| "logps/chosen": -8.270989418029785, | |
| "logps/rejected": -24.483354568481445, | |
| "loss": 0.8698587417602539, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4563717544078827, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07262411713600159, | |
| "rewards/margins": 1.0772123336791992, | |
| "rewards/rejected": -1.0045881271362305, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12301777991350313, | |
| "grad_norm": 3.5250916481018066, | |
| "learning_rate": 0.00019993244158841747, | |
| "logits/chosen": -0.6772405505180359, | |
| "logits/rejected": -0.6789288520812988, | |
| "logps/chosen": -9.19353199005127, | |
| "logps/rejected": -27.746652603149414, | |
| "loss": 0.8238008618354797, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.39661213755607605, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09302112460136414, | |
| "rewards/margins": 1.367937684059143, | |
| "rewards/rejected": -1.274916410446167, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.12472636019007956, | |
| "grad_norm": 3.276311159133911, | |
| "learning_rate": 0.00019992164964236533, | |
| "logits/chosen": -0.6857064962387085, | |
| "logits/rejected": -0.685559868812561, | |
| "logps/chosen": -11.672329902648926, | |
| "logps/rejected": -21.510480880737305, | |
| "loss": 0.9018468856811523, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.41466090083122253, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.07735104858875275, | |
| "rewards/margins": 0.9590628147125244, | |
| "rewards/rejected": -0.8817118406295776, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.126434940466656, | |
| "grad_norm": 3.369281768798828, | |
| "learning_rate": 0.00019991005872546527, | |
| "logits/chosen": -0.6608355641365051, | |
| "logits/rejected": -0.6626392602920532, | |
| "logps/chosen": -7.696371078491211, | |
| "logps/rejected": -16.016326904296875, | |
| "loss": 0.8347861766815186, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3552168607711792, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13171803951263428, | |
| "rewards/margins": 0.7066640853881836, | |
| "rewards/rejected": -0.5749460458755493, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.12814352074323243, | |
| "grad_norm": 2.894788980484009, | |
| "learning_rate": 0.00019989766893039804, | |
| "logits/chosen": -0.6222079992294312, | |
| "logits/rejected": -0.6232355833053589, | |
| "logps/chosen": -5.741198539733887, | |
| "logps/rejected": -21.31194305419922, | |
| "loss": 0.7077224850654602, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.2760768234729767, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08473706245422363, | |
| "rewards/margins": 0.9282934665679932, | |
| "rewards/rejected": -0.8435564041137695, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.12985210101980885, | |
| "grad_norm": 2.1586077213287354, | |
| "learning_rate": 0.00019988448035623203, | |
| "logits/chosen": -0.6409361958503723, | |
| "logits/rejected": -0.6418861150741577, | |
| "logps/chosen": -7.263876438140869, | |
| "logps/rejected": -17.95524024963379, | |
| "loss": 0.8056262731552124, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.2723458409309387, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.10251796990633011, | |
| "rewards/margins": 0.5812361240386963, | |
| "rewards/rejected": -0.4787181317806244, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.1315606812963853, | |
| "grad_norm": 3.0591204166412354, | |
| "learning_rate": 0.00019987049310842272, | |
| "logits/chosen": -0.6324824690818787, | |
| "logits/rejected": -0.6336201429367065, | |
| "logps/chosen": -10.325702667236328, | |
| "logps/rejected": -15.849100112915039, | |
| "loss": 0.8897943496704102, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3855420649051666, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16009055078029633, | |
| "rewards/margins": 0.6010256409645081, | |
| "rewards/rejected": -0.4409351050853729, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.1332692615729617, | |
| "grad_norm": 2.668419122695923, | |
| "learning_rate": 0.00019985570729881184, | |
| "logits/chosen": -0.6462000012397766, | |
| "logits/rejected": -0.6490585207939148, | |
| "logps/chosen": -5.475035667419434, | |
| "logps/rejected": -20.422216415405273, | |
| "loss": 0.7187508344650269, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.26306530833244324, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.13646253943443298, | |
| "rewards/margins": 0.6754783391952515, | |
| "rewards/rejected": -0.5390157699584961, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.13497784184953815, | |
| "grad_norm": 4.360518932342529, | |
| "learning_rate": 0.00019984012304562622, | |
| "logits/chosen": -0.6780133247375488, | |
| "logits/rejected": -0.6758167147636414, | |
| "logps/chosen": -11.310664176940918, | |
| "logps/rejected": -15.12096881866455, | |
| "loss": 0.9152082800865173, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.45073550939559937, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15347006916999817, | |
| "rewards/margins": 0.7282993197441101, | |
| "rewards/rejected": -0.5748292207717896, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.1366864221261146, | |
| "grad_norm": 2.7597768306732178, | |
| "learning_rate": 0.00019982374047347723, | |
| "logits/chosen": -0.6909894943237305, | |
| "logits/rejected": -0.694047212600708, | |
| "logps/chosen": -6.004232406616211, | |
| "logps/rejected": -23.221824645996094, | |
| "loss": 0.6792643666267395, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.31354260444641113, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.21520498394966125, | |
| "rewards/margins": 1.1965129375457764, | |
| "rewards/rejected": -0.9813080430030823, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.138395002402691, | |
| "grad_norm": 4.00593900680542, | |
| "learning_rate": 0.00019980655971335945, | |
| "logits/chosen": -0.666761577129364, | |
| "logits/rejected": -0.6698122620582581, | |
| "logps/chosen": -11.200495719909668, | |
| "logps/rejected": -20.89803123474121, | |
| "loss": 1.0373343229293823, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.5717941522598267, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.03891691192984581, | |
| "rewards/margins": 0.8691489696502686, | |
| "rewards/rejected": -0.9080657958984375, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.14010358267926745, | |
| "grad_norm": 3.7606523036956787, | |
| "learning_rate": 0.00019978858090264975, | |
| "logits/chosen": -0.6808147430419922, | |
| "logits/rejected": -0.683088481426239, | |
| "logps/chosen": -8.414874076843262, | |
| "logps/rejected": -28.505592346191406, | |
| "loss": 0.7084274888038635, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3828541338443756, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1215677559375763, | |
| "rewards/margins": 1.7334877252578735, | |
| "rewards/rejected": -1.6119199991226196, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.14181216295584387, | |
| "grad_norm": 4.108179569244385, | |
| "learning_rate": 0.0001997698041851063, | |
| "logits/chosen": -0.6897909045219421, | |
| "logits/rejected": -0.6913143396377563, | |
| "logps/chosen": -4.813051223754883, | |
| "logps/rejected": -26.06230926513672, | |
| "loss": 0.572483241558075, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.24444976449012756, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15832601487636566, | |
| "rewards/margins": 1.6045297384262085, | |
| "rewards/rejected": -1.4462038278579712, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.1435207432324203, | |
| "grad_norm": 5.49106502532959, | |
| "learning_rate": 0.00019975022971086714, | |
| "logits/chosen": -0.6466387510299683, | |
| "logits/rejected": -0.6520243883132935, | |
| "logps/chosen": -7.595500946044922, | |
| "logps/rejected": -33.218482971191406, | |
| "loss": 0.9090702533721924, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.5250993371009827, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.13341139256954193, | |
| "rewards/margins": 1.5776695013046265, | |
| "rewards/rejected": -1.444258213043213, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.14522932350899675, | |
| "grad_norm": 4.539761543273926, | |
| "learning_rate": 0.00019972985763644932, | |
| "logits/chosen": -0.6421160101890564, | |
| "logits/rejected": -0.6411360502243042, | |
| "logps/chosen": -7.4049482345581055, | |
| "logps/rejected": -21.37047576904297, | |
| "loss": 0.8407540917396545, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4470757246017456, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1697394847869873, | |
| "rewards/margins": 1.345821738243103, | |
| "rewards/rejected": -1.1760823726654053, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.14693790378557317, | |
| "grad_norm": 4.877723217010498, | |
| "learning_rate": 0.00019970868812474736, | |
| "logits/chosen": -0.6163697242736816, | |
| "logits/rejected": -0.6189360022544861, | |
| "logps/chosen": -12.07491683959961, | |
| "logps/rejected": -29.372955322265625, | |
| "loss": 0.848598301410675, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.49112260341644287, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1017676591873169, | |
| "rewards/margins": 1.7578887939453125, | |
| "rewards/rejected": -1.6561211347579956, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.14864648406214961, | |
| "grad_norm": 5.431716442108154, | |
| "learning_rate": 0.00019968672134503213, | |
| "logits/chosen": -0.6225081086158752, | |
| "logits/rejected": -0.6252766251564026, | |
| "logps/chosen": -7.893375873565674, | |
| "logps/rejected": -24.980260848999023, | |
| "loss": 0.7993619441986084, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3846016228199005, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.16642117500305176, | |
| "rewards/margins": 1.3823862075805664, | |
| "rewards/rejected": -1.215964913368225, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.15035506433872603, | |
| "grad_norm": 3.7740750312805176, | |
| "learning_rate": 0.00019966395747294938, | |
| "logits/chosen": -0.5984699130058289, | |
| "logits/rejected": -0.6030604839324951, | |
| "logps/chosen": -5.385066032409668, | |
| "logps/rejected": -25.168312072753906, | |
| "loss": 0.6654453873634338, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3348524868488312, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.16900494694709778, | |
| "rewards/margins": 1.3018345832824707, | |
| "rewards/rejected": -1.1328295469284058, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.005492 | |
| }, | |
| { | |
| "epoch": 0.15206364461530247, | |
| "grad_norm": 3.6669890880584717, | |
| "learning_rate": 0.0001996403966905185, | |
| "logits/chosen": -0.6115779280662537, | |
| "logits/rejected": -0.615218997001648, | |
| "logps/chosen": -8.385238647460938, | |
| "logps/rejected": -20.905569076538086, | |
| "loss": 0.8084090948104858, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.39410629868507385, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.07257324457168579, | |
| "rewards/margins": 1.0608566999435425, | |
| "rewards/rejected": -0.9882834553718567, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.00549 | |
| }, | |
| { | |
| "epoch": 0.15377222489187892, | |
| "grad_norm": 8.954024314880371, | |
| "learning_rate": 0.00019961603918613077, | |
| "logits/chosen": -0.6033557653427124, | |
| "logits/rejected": -0.6063033938407898, | |
| "logps/chosen": -7.85408878326416, | |
| "logps/rejected": -24.28641700744629, | |
| "loss": 0.8988556861877441, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4972013235092163, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1499406397342682, | |
| "rewards/margins": 1.2390244007110596, | |
| "rewards/rejected": -1.0890836715698242, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.15548080516845533, | |
| "grad_norm": 2.68121075630188, | |
| "learning_rate": 0.00019959088515454827, | |
| "logits/chosen": -0.6473177075386047, | |
| "logits/rejected": -0.6510601043701172, | |
| "logps/chosen": -6.986569404602051, | |
| "logps/rejected": -28.0955810546875, | |
| "loss": 0.6454746723175049, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3593181073665619, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.310781866312027, | |
| "rewards/margins": 1.7279632091522217, | |
| "rewards/rejected": -1.417181372642517, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.005489 | |
| }, | |
| { | |
| "epoch": 0.15718938544503178, | |
| "grad_norm": 7.000541687011719, | |
| "learning_rate": 0.0001995649347969019, | |
| "logits/chosen": -0.7174542546272278, | |
| "logits/rejected": -0.7201290726661682, | |
| "logps/chosen": -11.954474449157715, | |
| "logps/rejected": -24.34893226623535, | |
| "loss": 1.0948961973190308, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.6069883704185486, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.005067221820354462, | |
| "rewards/margins": 1.2273277044296265, | |
| "rewards/rejected": -1.232394814491272, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.1588979657216082, | |
| "grad_norm": 4.3811211585998535, | |
| "learning_rate": 0.00019953818832069, | |
| "logits/chosen": -0.6739280223846436, | |
| "logits/rejected": -0.6795160174369812, | |
| "logps/chosen": -6.881966590881348, | |
| "logps/rejected": -37.4478645324707, | |
| "loss": 0.6469016075134277, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.40633073449134827, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.20596878230571747, | |
| "rewards/margins": 2.5138516426086426, | |
| "rewards/rejected": -2.3078830242156982, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.16060654599818464, | |
| "grad_norm": 12.26343822479248, | |
| "learning_rate": 0.00019951064593977668, | |
| "logits/chosen": -0.6859129667282104, | |
| "logits/rejected": -0.6899083852767944, | |
| "logps/chosen": -13.38476848602295, | |
| "logps/rejected": -30.595182418823242, | |
| "loss": 1.2918721437454224, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.6223256587982178, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.30435577034950256, | |
| "rewards/margins": 1.605468988418579, | |
| "rewards/rejected": -1.9098248481750488, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.005491 | |
| }, | |
| { | |
| "epoch": 0.16231512627476108, | |
| "grad_norm": 6.570938587188721, | |
| "learning_rate": 0.00019948230787439017, | |
| "logits/chosen": -0.7028453946113586, | |
| "logits/rejected": -0.7050482034683228, | |
| "logps/chosen": -6.761815071105957, | |
| "logps/rejected": -27.314367294311523, | |
| "loss": 0.9538392424583435, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.39429235458374023, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.012213893234729767, | |
| "rewards/margins": 1.6957728862762451, | |
| "rewards/rejected": -1.6835590600967407, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.005493 | |
| }, | |
| { | |
| "epoch": 0.1640237065513375, | |
| "grad_norm": 2.8915793895721436, | |
| "learning_rate": 0.0001994531743511208, | |
| "logits/chosen": -0.6953604817390442, | |
| "logits/rejected": -0.6982015371322632, | |
| "logps/chosen": -7.192444801330566, | |
| "logps/rejected": -26.632644653320312, | |
| "loss": 0.6771315336227417, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.3128400444984436, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.21012118458747864, | |
| "rewards/margins": 1.6979337930679321, | |
| "rewards/rejected": -1.4878127574920654, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.005494 | |
| }, | |
| { | |
| "epoch": 0.16573228682791394, | |
| "grad_norm": 2.7815051078796387, | |
| "learning_rate": 0.00019942324560291952, | |
| "logits/chosen": -0.6696122884750366, | |
| "logits/rejected": -0.6713677644729614, | |
| "logps/chosen": -4.250362396240234, | |
| "logps/rejected": -22.2177791595459, | |
| "loss": 0.6821787357330322, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.26163250207901, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09910638630390167, | |
| "rewards/margins": 1.2715519666671753, | |
| "rewards/rejected": -1.1724457740783691, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.16744086710449035, | |
| "grad_norm": 2.4311976432800293, | |
| "learning_rate": 0.00019939252186909574, | |
| "logits/chosen": -0.6763203740119934, | |
| "logits/rejected": -0.6752580404281616, | |
| "logps/chosen": -6.972185134887695, | |
| "logps/rejected": -21.0667667388916, | |
| "loss": 0.5966892838478088, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.2420358657836914, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14732374250888824, | |
| "rewards/margins": 1.0790168046951294, | |
| "rewards/rejected": -0.9316931366920471, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1691494473810668, | |
| "grad_norm": 5.822193622589111, | |
| "learning_rate": 0.00019936100339531564, | |
| "logits/chosen": -0.6894733905792236, | |
| "logits/rejected": -0.6909453272819519, | |
| "logps/chosen": -6.009974479675293, | |
| "logps/rejected": -21.0426025390625, | |
| "loss": 0.7569796442985535, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.4093407690525055, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.26579749584198, | |
| "rewards/margins": 1.3290454149246216, | |
| "rewards/rejected": -1.0632479190826416, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.005495 | |
| }, | |
| { | |
| "epoch": 0.1708580276576432, | |
| "grad_norm": 3.2212934494018555, | |
| "learning_rate": 0.0001993286904336001, | |
| "logits/chosen": -0.7202757000923157, | |
| "logits/rejected": -0.7197086215019226, | |
| "logps/chosen": -6.131860733032227, | |
| "logps/rejected": -21.27735137939453, | |
| "loss": 0.622944712638855, | |
| "memory(GiB)": 46.38, | |
| "nll_loss": 0.28273510932922363, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.26464149355888367, | |
| "rewards/margins": 1.1921066045761108, | |
| "rewards/rejected": -0.9274651408195496, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.005496 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1170, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.266692861809132e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |