Instructions to use cragtmp/pairgt705r16-250 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/pairgt705r16-250 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/pairgt705r16-250") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.5578800557880056, | |
| "eval_steps": 300, | |
| "global_step": 250, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0022315202231520223, | |
| "grad_norm": 8.175573348999023, | |
| "learning_rate": 4.444444444444445e-06, | |
| "logits/chosen": -0.48349103331565857, | |
| "logits/rejected": -0.652603030204773, | |
| "logps/chosen": -8.859519004821777, | |
| "logps/rejected": -16.016435623168945, | |
| "loss": 1.3468515872955322, | |
| "memory(GiB)": 33.44, | |
| "nll_loss": 0.6537042856216431, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.010093 | |
| }, | |
| { | |
| "epoch": 0.004463040446304045, | |
| "grad_norm": 6.496051788330078, | |
| "learning_rate": 8.88888888888889e-06, | |
| "logits/chosen": -0.5174899101257324, | |
| "logits/rejected": -0.6262180805206299, | |
| "logps/chosen": -9.287378311157227, | |
| "logps/rejected": -13.981985092163086, | |
| "loss": 1.290852665901184, | |
| "memory(GiB)": 36.3, | |
| "nll_loss": 0.5977055430412292, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.010436 | |
| }, | |
| { | |
| "epoch": 0.0066945606694560665, | |
| "grad_norm": 5.3426923751831055, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "logits/chosen": -0.4254978895187378, | |
| "logits/rejected": -0.6118676662445068, | |
| "logps/chosen": -6.5775346755981445, | |
| "logps/rejected": -16.196733474731445, | |
| "loss": 1.1887776851654053, | |
| "memory(GiB)": 36.3, | |
| "nll_loss": 0.49580031633377075, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.0025197849608957767, | |
| "rewards/margins": 0.0005687186494469643, | |
| "rewards/rejected": -0.0030885031446814537, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.010535 | |
| }, | |
| { | |
| "epoch": 0.00892608089260809, | |
| "grad_norm": 5.717321395874023, | |
| "learning_rate": 1.777777777777778e-05, | |
| "logits/chosen": -0.5246356129646301, | |
| "logits/rejected": -0.651706337928772, | |
| "logps/chosen": -7.447962760925293, | |
| "logps/rejected": -16.996183395385742, | |
| "loss": 1.3215211629867554, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.632453203201294, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.004622042179107666, | |
| "rewards/margins": 0.008373789489269257, | |
| "rewards/rejected": -0.0037517473101615906, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.010586 | |
| }, | |
| { | |
| "epoch": 0.011157601115760111, | |
| "grad_norm": 7.188594341278076, | |
| "learning_rate": 2.2222222222222223e-05, | |
| "logits/chosen": -0.5062788128852844, | |
| "logits/rejected": -0.6033568382263184, | |
| "logps/chosen": -7.093954086303711, | |
| "logps/rejected": -15.186193466186523, | |
| "loss": 1.0765105485916138, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.4042052626609802, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.018988817930221558, | |
| "rewards/margins": 0.04282933473587036, | |
| "rewards/rejected": -0.023840520530939102, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.010619 | |
| }, | |
| { | |
| "epoch": 0.013389121338912133, | |
| "grad_norm": 3.8232157230377197, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "logits/chosen": -0.4826778173446655, | |
| "logits/rejected": -0.5863982439041138, | |
| "logps/chosen": -6.322361946105957, | |
| "logps/rejected": -16.8499755859375, | |
| "loss": 1.2770025730133057, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.6041065454483032, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.007987724617123604, | |
| "rewards/margins": 0.0449829027056694, | |
| "rewards/rejected": -0.03699517622590065, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.010645 | |
| }, | |
| { | |
| "epoch": 0.015620641562064157, | |
| "grad_norm": 3.0141377449035645, | |
| "learning_rate": 3.111111111111111e-05, | |
| "logits/chosen": -0.557126522064209, | |
| "logits/rejected": -0.6060188412666321, | |
| "logps/chosen": -5.420467853546143, | |
| "logps/rejected": -11.815977096557617, | |
| "loss": 1.1219334602355957, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.46769219636917114, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.010057949461042881, | |
| "rewards/margins": 0.10709290951490402, | |
| "rewards/rejected": -0.09703496098518372, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.010666 | |
| }, | |
| { | |
| "epoch": 0.01785216178521618, | |
| "grad_norm": 2.8756191730499268, | |
| "learning_rate": 3.555555555555556e-05, | |
| "logits/chosen": -0.5616711378097534, | |
| "logits/rejected": -0.6365323066711426, | |
| "logps/chosen": -6.283439636230469, | |
| "logps/rejected": -19.981098175048828, | |
| "loss": 0.8637306690216064, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.33207178115844727, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.011994147673249245, | |
| "rewards/margins": 0.4002670347690582, | |
| "rewards/rejected": -0.4122611880302429, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.0200836820083682, | |
| "grad_norm": 5.291012763977051, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.502879798412323, | |
| "logits/rejected": -0.5977268815040588, | |
| "logps/chosen": -16.167051315307617, | |
| "logps/rejected": -20.485633850097656, | |
| "loss": 1.618671178817749, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 1.0418576002120972, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.21173161268234253, | |
| "rewards/margins": 0.39757153391838074, | |
| "rewards/rejected": -0.6093031167984009, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.022315202231520222, | |
| "grad_norm": 5.504859447479248, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "logits/chosen": -0.4140257239341736, | |
| "logits/rejected": -0.5436943173408508, | |
| "logps/chosen": -10.317049026489258, | |
| "logps/rejected": -26.558115005493164, | |
| "loss": 1.271435260772705, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.6719653606414795, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.2977833151817322, | |
| "rewards/margins": 0.4953876733779907, | |
| "rewards/rejected": -0.7931710481643677, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.024546722454672244, | |
| "grad_norm": 8.8348970413208, | |
| "learning_rate": 4.888888888888889e-05, | |
| "logits/chosen": -0.4538601040840149, | |
| "logits/rejected": -0.5884804129600525, | |
| "logps/chosen": -15.600846290588379, | |
| "logps/rejected": -27.856977462768555, | |
| "loss": 1.6294305324554443, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 1.0609474182128906, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.48508310317993164, | |
| "rewards/margins": 0.41195282340049744, | |
| "rewards/rejected": -0.8970359563827515, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.0107 | |
| }, | |
| { | |
| "epoch": 0.026778242677824266, | |
| "grad_norm": 4.871168613433838, | |
| "learning_rate": 5.333333333333333e-05, | |
| "logits/chosen": -0.4462035596370697, | |
| "logits/rejected": -0.5622009634971619, | |
| "logps/chosen": -10.827975273132324, | |
| "logps/rejected": -27.8737850189209, | |
| "loss": 1.309844732284546, | |
| "memory(GiB)": 42.78, | |
| "nll_loss": 0.6817098259925842, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.34655484557151794, | |
| "rewards/margins": 0.38605934381484985, | |
| "rewards/rejected": -0.7326142191886902, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.010701 | |
| }, | |
| { | |
| "epoch": 0.02900976290097629, | |
| "grad_norm": 5.154696464538574, | |
| "learning_rate": 5.7777777777777776e-05, | |
| "logits/chosen": -0.45840126276016235, | |
| "logits/rejected": -0.5749193429946899, | |
| "logps/chosen": -9.034074783325195, | |
| "logps/rejected": -23.558507919311523, | |
| "loss": 1.3584285974502563, | |
| "memory(GiB)": 42.78, | |
| "nll_loss": 0.8017209768295288, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.15672500431537628, | |
| "rewards/margins": 0.44559869170188904, | |
| "rewards/rejected": -0.6023237109184265, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.010704 | |
| }, | |
| { | |
| "epoch": 0.031241283124128313, | |
| "grad_norm": 2.928802013397217, | |
| "learning_rate": 6.222222222222222e-05, | |
| "logits/chosen": -0.4339243173599243, | |
| "logits/rejected": -0.5222603678703308, | |
| "logps/chosen": -7.9224724769592285, | |
| "logps/rejected": -25.263307571411133, | |
| "loss": 1.176775574684143, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.548651397228241, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09932564944028854, | |
| "rewards/margins": 0.27659934759140015, | |
| "rewards/rejected": -0.3759249448776245, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.010698 | |
| }, | |
| { | |
| "epoch": 0.03347280334728033, | |
| "grad_norm": 1.9422496557235718, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.4753529131412506, | |
| "logits/rejected": -0.5179453492164612, | |
| "logps/chosen": -8.660318374633789, | |
| "logps/rejected": -16.743135452270508, | |
| "loss": 1.1362940073013306, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.5188332796096802, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.09274716675281525, | |
| "rewards/margins": 0.20326045155525208, | |
| "rewards/rejected": -0.29600760340690613, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.010702 | |
| }, | |
| { | |
| "epoch": 0.03570432357043236, | |
| "grad_norm": 1.7832196950912476, | |
| "learning_rate": 7.111111111111112e-05, | |
| "logits/chosen": -0.39417293667793274, | |
| "logits/rejected": -0.5316826701164246, | |
| "logps/chosen": -4.724964618682861, | |
| "logps/rejected": -19.69357681274414, | |
| "loss": 1.0538526773452759, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.4770840108394623, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06691457331180573, | |
| "rewards/margins": 0.27725517749786377, | |
| "rewards/rejected": -0.21034058928489685, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.010702 | |
| }, | |
| { | |
| "epoch": 0.03793584379358438, | |
| "grad_norm": 1.5563856363296509, | |
| "learning_rate": 7.555555555555556e-05, | |
| "logits/chosen": -0.4563882350921631, | |
| "logits/rejected": -0.5541551113128662, | |
| "logps/chosen": -9.05321979522705, | |
| "logps/rejected": -18.82474708557129, | |
| "loss": 1.2152374982833862, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.6201823353767395, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.11768844723701477, | |
| "rewards/margins": 0.2521967887878418, | |
| "rewards/rejected": -0.13450834155082703, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.010706 | |
| }, | |
| { | |
| "epoch": 0.0401673640167364, | |
| "grad_norm": 1.9268314838409424, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.4476441740989685, | |
| "logits/rejected": -0.4938126504421234, | |
| "logps/chosen": -9.981496810913086, | |
| "logps/rejected": -14.752214431762695, | |
| "loss": 1.1654764413833618, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.46348586678504944, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.008895257487893105, | |
| "rewards/margins": 0.039339594542980194, | |
| "rewards/rejected": -0.030444344505667686, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.010707 | |
| }, | |
| { | |
| "epoch": 0.042398884239888426, | |
| "grad_norm": 1.6981456279754639, | |
| "learning_rate": 8.444444444444444e-05, | |
| "logits/chosen": -0.49693721532821655, | |
| "logits/rejected": -0.5383259057998657, | |
| "logps/chosen": -7.632569313049316, | |
| "logps/rejected": -17.26980209350586, | |
| "loss": 1.1578692197799683, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.5097256898880005, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06525340676307678, | |
| "rewards/margins": 0.123507060110569, | |
| "rewards/rejected": -0.05825363099575043, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.010709 | |
| }, | |
| { | |
| "epoch": 0.044630404463040445, | |
| "grad_norm": 2.013322591781616, | |
| "learning_rate": 8.888888888888889e-05, | |
| "logits/chosen": -0.4885023236274719, | |
| "logits/rejected": -0.5652343034744263, | |
| "logps/chosen": -6.508520603179932, | |
| "logps/rejected": -13.635923385620117, | |
| "loss": 1.0892918109893799, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.45972177386283875, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.06720655411481857, | |
| "rewards/margins": 0.18712735176086426, | |
| "rewards/rejected": -0.11992079019546509, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.010713 | |
| }, | |
| { | |
| "epoch": 0.04686192468619247, | |
| "grad_norm": 1.775608777999878, | |
| "learning_rate": 9.333333333333334e-05, | |
| "logits/chosen": -0.4235825836658478, | |
| "logits/rejected": -0.4997040629386902, | |
| "logps/chosen": -7.756269454956055, | |
| "logps/rejected": -22.05597496032715, | |
| "loss": 1.1610935926437378, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5124741792678833, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.056686438620090485, | |
| "rewards/margins": 0.15342777967453003, | |
| "rewards/rejected": -0.09674134850502014, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.010711 | |
| }, | |
| { | |
| "epoch": 0.04909344490934449, | |
| "grad_norm": 1.6878494024276733, | |
| "learning_rate": 9.777777777777778e-05, | |
| "logits/chosen": -0.448173850774765, | |
| "logits/rejected": -0.46942824125289917, | |
| "logps/chosen": -9.774542808532715, | |
| "logps/rejected": -14.852673530578613, | |
| "loss": 1.1857895851135254, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5429187417030334, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.08716461062431335, | |
| "rewards/margins": 0.17264463007450104, | |
| "rewards/rejected": -0.08548003435134888, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.01071 | |
| }, | |
| { | |
| "epoch": 0.051324965132496514, | |
| "grad_norm": 1.9283621311187744, | |
| "learning_rate": 0.00010222222222222222, | |
| "logits/chosen": -0.4297652244567871, | |
| "logits/rejected": -0.5464367866516113, | |
| "logps/chosen": -7.680075168609619, | |
| "logps/rejected": -20.64339828491211, | |
| "loss": 1.1528663635253906, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.48048245906829834, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.05369298905134201, | |
| "rewards/margins": 0.09629381448030472, | |
| "rewards/rejected": -0.04260082542896271, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.01071 | |
| }, | |
| { | |
| "epoch": 0.05355648535564853, | |
| "grad_norm": 1.8897244930267334, | |
| "learning_rate": 0.00010666666666666667, | |
| "logits/chosen": -0.4073754847049713, | |
| "logits/rejected": -0.4649578034877777, | |
| "logps/chosen": -9.451826095581055, | |
| "logps/rejected": -20.540328979492188, | |
| "loss": 1.0510568618774414, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.431056946516037, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.055333852767944336, | |
| "rewards/margins": 0.23058435320854187, | |
| "rewards/rejected": -0.17525050044059753, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.010709 | |
| }, | |
| { | |
| "epoch": 0.05578800557880056, | |
| "grad_norm": 1.968520998954773, | |
| "learning_rate": 0.00011111111111111112, | |
| "logits/chosen": -0.4085446000099182, | |
| "logits/rejected": -0.49927735328674316, | |
| "logps/chosen": -9.85863971710205, | |
| "logps/rejected": -21.732637405395508, | |
| "loss": 1.166273593902588, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5423365831375122, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03325103968381882, | |
| "rewards/margins": 0.2285088747739792, | |
| "rewards/rejected": -0.19525781273841858, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.010709 | |
| }, | |
| { | |
| "epoch": 0.05801952580195258, | |
| "grad_norm": 3.0135302543640137, | |
| "learning_rate": 0.00011555555555555555, | |
| "logits/chosen": -0.44835054874420166, | |
| "logits/rejected": -0.5419439077377319, | |
| "logps/chosen": -4.6747965812683105, | |
| "logps/rejected": -18.435997009277344, | |
| "loss": 0.9960591793060303, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39432889223098755, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.017948223277926445, | |
| "rewards/margins": 0.27569395303726196, | |
| "rewards/rejected": -0.29364219307899475, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.010712 | |
| }, | |
| { | |
| "epoch": 0.0602510460251046, | |
| "grad_norm": 2.0994958877563477, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.4755466878414154, | |
| "logits/rejected": -0.513874888420105, | |
| "logps/chosen": -14.17818832397461, | |
| "logps/rejected": -15.192220687866211, | |
| "loss": 1.3128914833068848, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.732846736907959, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11946821957826614, | |
| "rewards/margins": 0.27503034472465515, | |
| "rewards/rejected": -0.1555621325969696, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.010714 | |
| }, | |
| { | |
| "epoch": 0.06248256624825663, | |
| "grad_norm": 2.619943857192993, | |
| "learning_rate": 0.00012444444444444444, | |
| "logits/chosen": -0.33525484800338745, | |
| "logits/rejected": -0.4649803340435028, | |
| "logps/chosen": -6.553568363189697, | |
| "logps/rejected": -23.942062377929688, | |
| "loss": 1.007144808769226, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4446461498737335, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07584571838378906, | |
| "rewards/margins": 0.3631606996059418, | |
| "rewards/rejected": -0.2873149812221527, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.010711 | |
| }, | |
| { | |
| "epoch": 0.06471408647140865, | |
| "grad_norm": 2.1066770553588867, | |
| "learning_rate": 0.00012888888888888892, | |
| "logits/chosen": -0.37913525104522705, | |
| "logits/rejected": -0.4620123505592346, | |
| "logps/chosen": -7.321231842041016, | |
| "logps/rejected": -21.526382446289062, | |
| "loss": 1.0192487239837646, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4804428219795227, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.026389580219984055, | |
| "rewards/margins": 0.46746930480003357, | |
| "rewards/rejected": -0.441079705953598, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.010712 | |
| }, | |
| { | |
| "epoch": 0.06694560669456066, | |
| "grad_norm": 1.8226919174194336, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.3827905058860779, | |
| "logits/rejected": -0.48159855604171753, | |
| "logps/chosen": -6.776709079742432, | |
| "logps/rejected": -22.80392074584961, | |
| "loss": 1.0347448587417603, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.500119149684906, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10474913567304611, | |
| "rewards/margins": 0.39701035618782043, | |
| "rewards/rejected": -0.2922612428665161, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.010712 | |
| }, | |
| { | |
| "epoch": 0.06917712691771269, | |
| "grad_norm": 1.8681020736694336, | |
| "learning_rate": 0.0001377777777777778, | |
| "logits/chosen": -0.3609718978404999, | |
| "logits/rejected": -0.43842607736587524, | |
| "logps/chosen": -5.881144046783447, | |
| "logps/rejected": -21.236047744750977, | |
| "loss": 0.9905272126197815, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.43477141857147217, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04010690003633499, | |
| "rewards/margins": 0.3823702037334442, | |
| "rewards/rejected": -0.34226328134536743, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.010714 | |
| }, | |
| { | |
| "epoch": 0.07140864714086471, | |
| "grad_norm": 2.225977897644043, | |
| "learning_rate": 0.00014222222222222224, | |
| "logits/chosen": -0.39412301778793335, | |
| "logits/rejected": -0.4322904050350189, | |
| "logps/chosen": -10.140836715698242, | |
| "logps/rejected": -18.79208755493164, | |
| "loss": 1.0995820760726929, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5035545229911804, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04120786115527153, | |
| "rewards/margins": 0.2624339461326599, | |
| "rewards/rejected": -0.22122608125209808, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.010716 | |
| }, | |
| { | |
| "epoch": 0.07364016736401674, | |
| "grad_norm": 2.788853406906128, | |
| "learning_rate": 0.00014666666666666666, | |
| "logits/chosen": -0.27406275272369385, | |
| "logits/rejected": -0.371414452791214, | |
| "logps/chosen": -12.10950756072998, | |
| "logps/rejected": -24.930038452148438, | |
| "loss": 1.2428903579711914, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6102337837219238, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.08664405345916748, | |
| "rewards/margins": 0.2861720621585846, | |
| "rewards/rejected": -0.3728161156177521, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.010715 | |
| }, | |
| { | |
| "epoch": 0.07587168758716877, | |
| "grad_norm": 2.416369676589966, | |
| "learning_rate": 0.0001511111111111111, | |
| "logits/chosen": -0.24224025011062622, | |
| "logits/rejected": -0.3833686113357544, | |
| "logps/chosen": -6.028831958770752, | |
| "logps/rejected": -22.455066680908203, | |
| "loss": 0.9914643168449402, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.44179052114486694, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.011510152369737625, | |
| "rewards/margins": 0.5171858668327332, | |
| "rewards/rejected": -0.5056756734848022, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.010714 | |
| }, | |
| { | |
| "epoch": 0.07810320781032078, | |
| "grad_norm": 4.029798984527588, | |
| "learning_rate": 0.00015555555555555556, | |
| "logits/chosen": -0.2615310847759247, | |
| "logits/rejected": -0.39800190925598145, | |
| "logps/chosen": -5.90588903427124, | |
| "logps/rejected": -24.642311096191406, | |
| "loss": 0.8372505307197571, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4036243259906769, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.03906700387597084, | |
| "rewards/margins": 0.8896325826644897, | |
| "rewards/rejected": -0.9286996126174927, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.010715 | |
| }, | |
| { | |
| "epoch": 0.0803347280334728, | |
| "grad_norm": 2.4356110095977783, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.25296953320503235, | |
| "logits/rejected": -0.3325399160385132, | |
| "logps/chosen": -9.764960289001465, | |
| "logps/rejected": -23.14637565612793, | |
| "loss": 1.0952283143997192, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.641168475151062, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.002499673515558243, | |
| "rewards/margins": 0.8523399829864502, | |
| "rewards/rejected": -0.8498403429985046, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.010716 | |
| }, | |
| { | |
| "epoch": 0.08256624825662483, | |
| "grad_norm": 1.9291634559631348, | |
| "learning_rate": 0.00016444444444444444, | |
| "logits/chosen": -0.20930960774421692, | |
| "logits/rejected": -0.3604508936405182, | |
| "logps/chosen": -2.847867488861084, | |
| "logps/rejected": -30.63514518737793, | |
| "loss": 0.6885566711425781, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.2891227900981903, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.061974309384822845, | |
| "rewards/margins": 1.0785088539123535, | |
| "rewards/rejected": -1.0165345668792725, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.010715 | |
| }, | |
| { | |
| "epoch": 0.08479776847977685, | |
| "grad_norm": 1.6937510967254639, | |
| "learning_rate": 0.00016888888888888889, | |
| "logits/chosen": -0.2987847626209259, | |
| "logits/rejected": -0.37470635771751404, | |
| "logps/chosen": -6.199091911315918, | |
| "logps/rejected": -19.3011474609375, | |
| "loss": 0.8923996090888977, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.38914668560028076, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0021905135363340378, | |
| "rewards/margins": 0.6954408288002014, | |
| "rewards/rejected": -0.6932503581047058, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.010716 | |
| }, | |
| { | |
| "epoch": 0.08702928870292886, | |
| "grad_norm": 2.106278896331787, | |
| "learning_rate": 0.00017333333333333334, | |
| "logits/chosen": -0.28487277030944824, | |
| "logits/rejected": -0.34711676836013794, | |
| "logps/chosen": -8.657167434692383, | |
| "logps/rejected": -26.564130783081055, | |
| "loss": 1.023146390914917, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5919384956359863, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05617165565490723, | |
| "rewards/margins": 1.1481283903121948, | |
| "rewards/rejected": -1.091956615447998, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.010717 | |
| }, | |
| { | |
| "epoch": 0.08926080892608089, | |
| "grad_norm": 2.619154214859009, | |
| "learning_rate": 0.00017777777777777779, | |
| "logits/chosen": -0.2898882031440735, | |
| "logits/rejected": -0.3393169343471527, | |
| "logps/chosen": -8.001999855041504, | |
| "logps/rejected": -20.189369201660156, | |
| "loss": 0.9479650855064392, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.42854148149490356, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0008942075073719025, | |
| "rewards/margins": 0.7672775983810425, | |
| "rewards/rejected": -0.7663832902908325, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.010719 | |
| }, | |
| { | |
| "epoch": 0.09149232914923291, | |
| "grad_norm": 2.770841360092163, | |
| "learning_rate": 0.00018222222222222224, | |
| "logits/chosen": -0.22048279643058777, | |
| "logits/rejected": -0.30986371636390686, | |
| "logps/chosen": -5.240083694458008, | |
| "logps/rejected": -22.307451248168945, | |
| "loss": 0.8702710866928101, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39226293563842773, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.017199480906128883, | |
| "rewards/margins": 0.9372033476829529, | |
| "rewards/rejected": -0.9200038313865662, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.010719 | |
| }, | |
| { | |
| "epoch": 0.09372384937238494, | |
| "grad_norm": 4.61620569229126, | |
| "learning_rate": 0.0001866666666666667, | |
| "logits/chosen": -0.30797824263572693, | |
| "logits/rejected": -0.3721832036972046, | |
| "logps/chosen": -10.481635093688965, | |
| "logps/rejected": -23.132564544677734, | |
| "loss": 1.2510943412780762, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6913026571273804, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.25621044635772705, | |
| "rewards/margins": 0.5585607886314392, | |
| "rewards/rejected": -0.814771294593811, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.010721 | |
| }, | |
| { | |
| "epoch": 0.09595536959553697, | |
| "grad_norm": 3.806872844696045, | |
| "learning_rate": 0.00019111111111111114, | |
| "logits/chosen": -0.22567886114120483, | |
| "logits/rejected": -0.3761019706726074, | |
| "logps/chosen": -8.201981544494629, | |
| "logps/rejected": -34.75733184814453, | |
| "loss": 1.0068457126617432, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6396302580833435, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.12671321630477905, | |
| "rewards/margins": 1.7875899076461792, | |
| "rewards/rejected": -1.914302945137024, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.010722 | |
| }, | |
| { | |
| "epoch": 0.09818688981868898, | |
| "grad_norm": 3.342564821243286, | |
| "learning_rate": 0.00019555555555555556, | |
| "logits/chosen": -0.259334534406662, | |
| "logits/rejected": -0.33293721079826355, | |
| "logps/chosen": -9.735747337341309, | |
| "logps/rejected": -34.48583221435547, | |
| "loss": 0.9845027327537537, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5914844870567322, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.2998116612434387, | |
| "rewards/margins": 1.7843880653381348, | |
| "rewards/rejected": -2.084199905395508, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.010723 | |
| }, | |
| { | |
| "epoch": 0.100418410041841, | |
| "grad_norm": 3.4293951988220215, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.34163057804107666, | |
| "logits/rejected": -0.36223551630973816, | |
| "logps/chosen": -9.353399276733398, | |
| "logps/rejected": -21.651199340820312, | |
| "loss": 1.0366103649139404, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5141280889511108, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.003630978986620903, | |
| "rewards/margins": 0.7049190402030945, | |
| "rewards/rejected": -0.7085499167442322, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.010724 | |
| }, | |
| { | |
| "epoch": 0.10264993026499303, | |
| "grad_norm": 2.1774137020111084, | |
| "learning_rate": 0.0001999993185874369, | |
| "logits/chosen": -0.3677416443824768, | |
| "logits/rejected": -0.3854161500930786, | |
| "logps/chosen": -11.536070823669434, | |
| "logps/rejected": -27.305158615112305, | |
| "loss": 0.9515228271484375, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5171921849250793, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.09924840927124023, | |
| "rewards/margins": 1.116947889328003, | |
| "rewards/rejected": -1.2161962985992432, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.010724 | |
| }, | |
| { | |
| "epoch": 0.10488145048814505, | |
| "grad_norm": 2.2629730701446533, | |
| "learning_rate": 0.00019999727435903407, | |
| "logits/chosen": -0.3420083522796631, | |
| "logits/rejected": -0.4473438858985901, | |
| "logps/chosen": -4.170689582824707, | |
| "logps/rejected": -21.129119873046875, | |
| "loss": 0.9114863276481628, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3966943621635437, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1746423840522766, | |
| "rewards/margins": 0.61202472448349, | |
| "rewards/rejected": -0.43738237023353577, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.010725 | |
| }, | |
| { | |
| "epoch": 0.10711297071129706, | |
| "grad_norm": 1.6574047803878784, | |
| "learning_rate": 0.0001999938673426507, | |
| "logits/chosen": -0.31779757142066956, | |
| "logits/rejected": -0.4338604807853699, | |
| "logps/chosen": -5.825237274169922, | |
| "logps/rejected": -20.981552124023438, | |
| "loss": 0.9128789305686951, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4218422770500183, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1773630529642105, | |
| "rewards/margins": 0.718612551689148, | |
| "rewards/rejected": -0.5412494540214539, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.010725 | |
| }, | |
| { | |
| "epoch": 0.10934449093444909, | |
| "grad_norm": 2.0683908462524414, | |
| "learning_rate": 0.00019998909758471852, | |
| "logits/chosen": -0.3863949179649353, | |
| "logits/rejected": -0.4458945393562317, | |
| "logps/chosen": -7.798675537109375, | |
| "logps/rejected": -21.307409286499023, | |
| "loss": 1.0268117189407349, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5051021575927734, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08097527176141739, | |
| "rewards/margins": 0.7529874444007874, | |
| "rewards/rejected": -0.672012209892273, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.010726 | |
| }, | |
| { | |
| "epoch": 0.11157601115760112, | |
| "grad_norm": 2.338461399078369, | |
| "learning_rate": 0.000199982965150241, | |
| "logits/chosen": -0.34079253673553467, | |
| "logits/rejected": -0.3965541124343872, | |
| "logps/chosen": -11.766353607177734, | |
| "logps/rejected": -19.651931762695312, | |
| "loss": 1.1824036836624146, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.609149158000946, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.08129046857357025, | |
| "rewards/margins": 0.3777032196521759, | |
| "rewards/rejected": -0.4589936435222626, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.010726 | |
| }, | |
| { | |
| "epoch": 0.11380753138075314, | |
| "grad_norm": 1.6744564771652222, | |
| "learning_rate": 0.00019997547012279244, | |
| "logits/chosen": -0.31765079498291016, | |
| "logits/rejected": -0.42205262184143066, | |
| "logps/chosen": -5.897686958312988, | |
| "logps/rejected": -25.42192268371582, | |
| "loss": 0.8473464846611023, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4084213376045227, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2017829716205597, | |
| "rewards/margins": 0.7832211256027222, | |
| "rewards/rejected": -0.5814382433891296, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.11603905160390517, | |
| "grad_norm": 1.8061268329620361, | |
| "learning_rate": 0.00019996661260451704, | |
| "logits/chosen": -0.32708457112312317, | |
| "logits/rejected": -0.41108813881874084, | |
| "logps/chosen": -8.663649559020996, | |
| "logps/rejected": -32.308448791503906, | |
| "loss": 0.8938776850700378, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.48662397265434265, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.01828554831445217, | |
| "rewards/margins": 1.3651036024093628, | |
| "rewards/rejected": -1.3833892345428467, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.11827057182705718, | |
| "grad_norm": 1.9129594564437866, | |
| "learning_rate": 0.00019995639271612722, | |
| "logits/chosen": -0.3344545364379883, | |
| "logits/rejected": -0.43980082869529724, | |
| "logps/chosen": -9.373285293579102, | |
| "logps/rejected": -30.374614715576172, | |
| "loss": 0.8187388181686401, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3988412916660309, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.04744601994752884, | |
| "rewards/margins": 1.1539989709854126, | |
| "rewards/rejected": -1.2014449834823608, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.1205020920502092, | |
| "grad_norm": 6.22075891494751, | |
| "learning_rate": 0.00019994481059690223, | |
| "logits/chosen": -0.3710540533065796, | |
| "logits/rejected": -0.45295441150665283, | |
| "logps/chosen": -11.353669166564941, | |
| "logps/rejected": -35.60136795043945, | |
| "loss": 1.3072545528411865, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.8566557168960571, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.1803397834300995, | |
| "rewards/margins": 2.1112091541290283, | |
| "rewards/rejected": -2.29154896736145, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.12273361227336123, | |
| "grad_norm": 3.538923501968384, | |
| "learning_rate": 0.00019993186640468604, | |
| "logits/chosen": -0.2791898250579834, | |
| "logits/rejected": -0.3996254801750183, | |
| "logps/chosen": -12.779634475708008, | |
| "logps/rejected": -37.21310043334961, | |
| "loss": 1.0243951082229614, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6127378940582275, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.261193186044693, | |
| "rewards/margins": 1.434675693511963, | |
| "rewards/rejected": -1.695868968963623, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.12496513249651325, | |
| "grad_norm": 2.5944247245788574, | |
| "learning_rate": 0.0001999175603158854, | |
| "logits/chosen": -0.2531765401363373, | |
| "logits/rejected": -0.4114147424697876, | |
| "logps/chosen": -9.740252494812012, | |
| "logps/rejected": -36.96112823486328, | |
| "loss": 0.8653287291526794, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5133413076400757, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.015189380384981632, | |
| "rewards/margins": 1.5309333801269531, | |
| "rewards/rejected": -1.5461229085922241, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.12719665271966527, | |
| "grad_norm": 3.273171901702881, | |
| "learning_rate": 0.0001999018925254673, | |
| "logits/chosen": -0.3509857654571533, | |
| "logits/rejected": -0.4661892056465149, | |
| "logps/chosen": -8.814093589782715, | |
| "logps/rejected": -30.390697479248047, | |
| "loss": 0.9130730032920837, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5733908414840698, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.0046962546184659, | |
| "rewards/margins": 1.3072673082351685, | |
| "rewards/rejected": -1.3025707006454468, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.1294281729428173, | |
| "grad_norm": 2.717229127883911, | |
| "learning_rate": 0.00019988486324695628, | |
| "logits/chosen": -0.33554819226264954, | |
| "logits/rejected": -0.4281303584575653, | |
| "logps/chosen": -14.103944778442383, | |
| "logps/rejected": -32.3876838684082, | |
| "loss": 0.9715602397918701, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5424861311912537, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0524468794465065, | |
| "rewards/margins": 1.0883628129959106, | |
| "rewards/rejected": -1.1408096551895142, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.13165969316596932, | |
| "grad_norm": 2.887491226196289, | |
| "learning_rate": 0.00019986647271243163, | |
| "logits/chosen": -0.3923209011554718, | |
| "logits/rejected": -0.48743686079978943, | |
| "logps/chosen": -6.2308878898620605, | |
| "logps/rejected": -21.537296295166016, | |
| "loss": 0.9816198945045471, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4462883472442627, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.06832532584667206, | |
| "rewards/margins": 0.5661296844482422, | |
| "rewards/rejected": -0.6344550251960754, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.13389121338912133, | |
| "grad_norm": 2.2311718463897705, | |
| "learning_rate": 0.00019984672117252423, | |
| "logits/chosen": -0.33507245779037476, | |
| "logits/rejected": -0.49380406737327576, | |
| "logps/chosen": -9.220368385314941, | |
| "logps/rejected": -37.96326446533203, | |
| "loss": 0.9401113986968994, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5612199902534485, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.06330323219299316, | |
| "rewards/margins": 1.686211347579956, | |
| "rewards/rejected": -1.622908115386963, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.13612273361227337, | |
| "grad_norm": 1.992959976196289, | |
| "learning_rate": 0.00019982560889641296, | |
| "logits/chosen": -0.35564690828323364, | |
| "logits/rejected": -0.5200420618057251, | |
| "logps/chosen": -3.4553239345550537, | |
| "logps/rejected": -32.64472198486328, | |
| "loss": 0.640341579914093, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3033585250377655, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08748181164264679, | |
| "rewards/margins": 1.5070304870605469, | |
| "rewards/rejected": -1.419548511505127, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.13835425383542538, | |
| "grad_norm": 3.40260648727417, | |
| "learning_rate": 0.00019980313617182127, | |
| "logits/chosen": -0.3457183837890625, | |
| "logits/rejected": -0.5498067736625671, | |
| "logps/chosen": -6.69366455078125, | |
| "logps/rejected": -37.40818405151367, | |
| "loss": 0.9436236619949341, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6088553667068481, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.10982945561408997, | |
| "rewards/margins": 1.797737956047058, | |
| "rewards/rejected": -1.9075673818588257, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.14058577405857742, | |
| "grad_norm": 4.374825954437256, | |
| "learning_rate": 0.00019977930330501308, | |
| "logits/chosen": -0.42058196663856506, | |
| "logits/rejected": -0.5126227736473083, | |
| "logps/chosen": -10.140219688415527, | |
| "logps/rejected": -33.032615661621094, | |
| "loss": 1.193029522895813, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6540992856025696, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.22300566732883453, | |
| "rewards/margins": 1.272392988204956, | |
| "rewards/rejected": -1.495398759841919, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.14281729428172943, | |
| "grad_norm": 4.756910800933838, | |
| "learning_rate": 0.0001997541106207887, | |
| "logits/chosen": -0.4631284475326538, | |
| "logits/rejected": -0.5332682728767395, | |
| "logps/chosen": -8.054980278015137, | |
| "logps/rejected": -31.029682159423828, | |
| "loss": 1.0884121656417847, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6862107515335083, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.1161859929561615, | |
| "rewards/margins": 1.4922480583190918, | |
| "rewards/rejected": -1.6084339618682861, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.14504881450488144, | |
| "grad_norm": 3.428164005279541, | |
| "learning_rate": 0.0001997275584624803, | |
| "logits/chosen": -0.3415633738040924, | |
| "logits/rejected": -0.49688977003097534, | |
| "logps/chosen": -7.313436031341553, | |
| "logps/rejected": -35.58869934082031, | |
| "loss": 0.957207977771759, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.590711772441864, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.05026661604642868, | |
| "rewards/margins": 1.5162088871002197, | |
| "rewards/rejected": -1.4659425020217896, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.14728033472803348, | |
| "grad_norm": 3.1654562950134277, | |
| "learning_rate": 0.00019969964719194745, | |
| "logits/chosen": -0.4512020945549011, | |
| "logits/rejected": -0.5287590026855469, | |
| "logps/chosen": -8.630544662475586, | |
| "logps/rejected": -15.341949462890625, | |
| "loss": 1.1465851068496704, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5758541822433472, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.06041776388883591, | |
| "rewards/margins": 0.51249760389328, | |
| "rewards/rejected": -0.45207977294921875, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.1495118549511855, | |
| "grad_norm": 2.0986812114715576, | |
| "learning_rate": 0.0001996703771895719, | |
| "logits/chosen": -0.5272831320762634, | |
| "logits/rejected": -0.517794668674469, | |
| "logps/chosen": -12.980257034301758, | |
| "logps/rejected": -18.752052307128906, | |
| "loss": 1.3610563278198242, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6797517538070679, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.026422299444675446, | |
| "rewards/margins": 0.5318213105201721, | |
| "rewards/rejected": -0.5053990483283997, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.15174337517433753, | |
| "grad_norm": 1.9081969261169434, | |
| "learning_rate": 0.00019963974885425266, | |
| "logits/chosen": -0.4080069661140442, | |
| "logits/rejected": -0.47813406586647034, | |
| "logps/chosen": -7.824826717376709, | |
| "logps/rejected": -18.751680374145508, | |
| "loss": 1.0740342140197754, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.45793265104293823, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.04187186062335968, | |
| "rewards/margins": 0.3901542127132416, | |
| "rewards/rejected": -0.3482823669910431, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.15397489539748954, | |
| "grad_norm": 1.700203537940979, | |
| "learning_rate": 0.0001996077626034003, | |
| "logits/chosen": -0.45641785860061646, | |
| "logits/rejected": -0.5060834884643555, | |
| "logps/chosen": -11.462532043457031, | |
| "logps/rejected": -16.27201271057129, | |
| "loss": 1.1681339740753174, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6015636920928955, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.136613130569458, | |
| "rewards/margins": 0.3738591969013214, | |
| "rewards/rejected": -0.2372460514307022, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.15620641562064155, | |
| "grad_norm": 1.9888875484466553, | |
| "learning_rate": 0.00019957441887293156, | |
| "logits/chosen": -0.4031111001968384, | |
| "logits/rejected": -0.47320762276649475, | |
| "logps/chosen": -7.325850009918213, | |
| "logps/rejected": -25.553611755371094, | |
| "loss": 1.002021074295044, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4237433671951294, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.013660086318850517, | |
| "rewards/margins": 0.49219831824302673, | |
| "rewards/rejected": -0.4785382151603699, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.1584379358437936, | |
| "grad_norm": 1.5379258394241333, | |
| "learning_rate": 0.0001995397181172631, | |
| "logits/chosen": -0.40455764532089233, | |
| "logits/rejected": -0.518138587474823, | |
| "logps/chosen": -3.8365478515625, | |
| "logps/rejected": -26.37249755859375, | |
| "loss": 0.8130152225494385, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.34526968002319336, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10106083005666733, | |
| "rewards/margins": 0.8268870115280151, | |
| "rewards/rejected": -0.7258262038230896, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.1606694560669456, | |
| "grad_norm": 1.612131953239441, | |
| "learning_rate": 0.0001995036608093056, | |
| "logits/chosen": -0.4558025002479553, | |
| "logits/rejected": -0.48799094557762146, | |
| "logps/chosen": -8.70871639251709, | |
| "logps/rejected": -17.577770233154297, | |
| "loss": 0.8906623125076294, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3765795826911926, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.05890116095542908, | |
| "rewards/margins": 0.6036397814750671, | |
| "rewards/rejected": -0.5447385907173157, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.16290097629009762, | |
| "grad_norm": 1.3791937828063965, | |
| "learning_rate": 0.00019946624744045704, | |
| "logits/chosen": -0.4362650215625763, | |
| "logits/rejected": -0.48206600546836853, | |
| "logps/chosen": -10.413619995117188, | |
| "logps/rejected": -27.357479095458984, | |
| "loss": 0.8979863524436951, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3758661448955536, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.009980186820030212, | |
| "rewards/margins": 0.9504665732383728, | |
| "rewards/rejected": -0.960446834564209, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.16513249651324965, | |
| "grad_norm": 1.7471097707748413, | |
| "learning_rate": 0.00019942747852059632, | |
| "logits/chosen": -0.423688143491745, | |
| "logits/rejected": -0.49418017268180847, | |
| "logps/chosen": -8.749202728271484, | |
| "logps/rejected": -33.218692779541016, | |
| "loss": 0.8359287977218628, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.36860865354537964, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.05798308178782463, | |
| "rewards/margins": 1.4300649166107178, | |
| "rewards/rejected": -1.4880479574203491, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.16736401673640167, | |
| "grad_norm": 2.2621185779571533, | |
| "learning_rate": 0.00019938735457807592, | |
| "logits/chosen": -0.40228813886642456, | |
| "logits/rejected": -0.47656214237213135, | |
| "logps/chosen": -10.918057441711426, | |
| "logps/rejected": -30.61962890625, | |
| "loss": 0.9725239872932434, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.499444842338562, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.06699477136135101, | |
| "rewards/margins": 0.938097357749939, | |
| "rewards/rejected": -1.0050921440124512, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.1695955369595537, | |
| "grad_norm": 2.474619150161743, | |
| "learning_rate": 0.00019934587615971506, | |
| "logits/chosen": -0.38186344504356384, | |
| "logits/rejected": -0.4598054587841034, | |
| "logps/chosen": -6.823958873748779, | |
| "logps/rejected": -29.09862518310547, | |
| "loss": 0.9761800765991211, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.48571133613586426, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.05072644352912903, | |
| "rewards/margins": 0.8625801205635071, | |
| "rewards/rejected": -0.9133066534996033, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.17182705718270572, | |
| "grad_norm": 1.823959231376648, | |
| "learning_rate": 0.00019930304383079204, | |
| "logits/chosen": -0.4149280786514282, | |
| "logits/rejected": -0.5062562227249146, | |
| "logps/chosen": -8.54432201385498, | |
| "logps/rejected": -29.242015838623047, | |
| "loss": 0.8722183108329773, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4606979191303253, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.01995794102549553, | |
| "rewards/margins": 1.4311785697937012, | |
| "rewards/rejected": -1.4112205505371094, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.17405857740585773, | |
| "grad_norm": 1.793901801109314, | |
| "learning_rate": 0.00019925885817503663, | |
| "logits/chosen": -0.4355413317680359, | |
| "logits/rejected": -0.5245873332023621, | |
| "logps/chosen": -4.893879413604736, | |
| "logps/rejected": -25.42880630493164, | |
| "loss": 0.7558175921440125, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.38899344205856323, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08300305157899857, | |
| "rewards/margins": 1.0970323085784912, | |
| "rewards/rejected": -1.0140292644500732, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.010696 | |
| }, | |
| { | |
| "epoch": 0.17629009762900977, | |
| "grad_norm": 2.114241123199463, | |
| "learning_rate": 0.00019921331979462197, | |
| "logits/chosen": -0.3358357548713684, | |
| "logits/rejected": -0.47999072074890137, | |
| "logps/chosen": -5.950570583343506, | |
| "logps/rejected": -28.20298957824707, | |
| "loss": 0.8057999610900879, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4144690930843353, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05946407839655876, | |
| "rewards/margins": 1.0457231998443604, | |
| "rewards/rejected": -0.9862591028213501, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.010697 | |
| }, | |
| { | |
| "epoch": 0.17852161785216178, | |
| "grad_norm": 2.7315855026245117, | |
| "learning_rate": 0.00019916642931015662, | |
| "logits/chosen": -0.43205446004867554, | |
| "logits/rejected": -0.5006397366523743, | |
| "logps/chosen": -7.170259952545166, | |
| "logps/rejected": -22.804529190063477, | |
| "loss": 1.0863537788391113, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6158946752548218, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.03549172729253769, | |
| "rewards/margins": 0.8894610404968262, | |
| "rewards/rejected": -0.9249527454376221, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.010698 | |
| }, | |
| { | |
| "epoch": 0.18075313807531382, | |
| "grad_norm": 2.479121685028076, | |
| "learning_rate": 0.00019911818736067586, | |
| "logits/chosen": -0.40614452958106995, | |
| "logits/rejected": -0.5118440389633179, | |
| "logps/chosen": -4.780482769012451, | |
| "logps/rejected": -22.085041046142578, | |
| "loss": 0.7858155965805054, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.44690829515457153, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.21181246638298035, | |
| "rewards/margins": 1.2262333631515503, | |
| "rewards/rejected": -1.0144208669662476, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.010699 | |
| }, | |
| { | |
| "epoch": 0.18298465829846583, | |
| "grad_norm": 1.6746541261672974, | |
| "learning_rate": 0.00019906859460363307, | |
| "logits/chosen": -0.4001500606536865, | |
| "logits/rejected": -0.45929989218711853, | |
| "logps/chosen": -7.395153045654297, | |
| "logps/rejected": -25.426557540893555, | |
| "loss": 0.7357066869735718, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4178068935871124, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16341763734817505, | |
| "rewards/margins": 1.525546669960022, | |
| "rewards/rejected": -1.3621290922164917, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.0107 | |
| }, | |
| { | |
| "epoch": 0.18521617852161784, | |
| "grad_norm": 4.773955821990967, | |
| "learning_rate": 0.00019901765171489086, | |
| "logits/chosen": -0.30332040786743164, | |
| "logits/rejected": -0.4577845633029938, | |
| "logps/chosen": -10.913299560546875, | |
| "logps/rejected": -46.28175354003906, | |
| "loss": 1.1305065155029297, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7709158658981323, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.34224939346313477, | |
| "rewards/margins": 2.636122703552246, | |
| "rewards/rejected": -2.9783718585968018, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.0107 | |
| }, | |
| { | |
| "epoch": 0.18744769874476988, | |
| "grad_norm": 2.5695321559906006, | |
| "learning_rate": 0.0001989653593887117, | |
| "logits/chosen": -0.3644600212574005, | |
| "logits/rejected": -0.43475809693336487, | |
| "logps/chosen": -6.348275661468506, | |
| "logps/rejected": -29.636547088623047, | |
| "loss": 0.8502273559570312, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4918310344219208, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07552118599414825, | |
| "rewards/margins": 1.7124391794204712, | |
| "rewards/rejected": -1.636918067932129, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.010702 | |
| }, | |
| { | |
| "epoch": 0.1896792189679219, | |
| "grad_norm": 3.117232322692871, | |
| "learning_rate": 0.00019891171833774854, | |
| "logits/chosen": -0.31497788429260254, | |
| "logits/rejected": -0.40428590774536133, | |
| "logps/chosen": -10.195795059204102, | |
| "logps/rejected": -43.74475860595703, | |
| "loss": 1.0120048522949219, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6030641198158264, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.17749960720539093, | |
| "rewards/margins": 2.177133083343506, | |
| "rewards/rejected": -2.35463285446167, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.010701 | |
| }, | |
| { | |
| "epoch": 0.19191073919107393, | |
| "grad_norm": 2.5167582035064697, | |
| "learning_rate": 0.00019885672929303508, | |
| "logits/chosen": -0.3179773986339569, | |
| "logits/rejected": -0.42796629667282104, | |
| "logps/chosen": -10.96944522857666, | |
| "logps/rejected": -40.80889129638672, | |
| "loss": 0.8473846912384033, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5096143484115601, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.08502935618162155, | |
| "rewards/margins": 2.197641134262085, | |
| "rewards/rejected": -2.282670259475708, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.010702 | |
| }, | |
| { | |
| "epoch": 0.19414225941422594, | |
| "grad_norm": 2.2492237091064453, | |
| "learning_rate": 0.00019880039300397591, | |
| "logits/chosen": -0.4064781665802002, | |
| "logits/rejected": -0.4387715458869934, | |
| "logps/chosen": -7.350955009460449, | |
| "logps/rejected": -30.075700759887695, | |
| "loss": 0.9061151742935181, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5411654710769653, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.04652661085128784, | |
| "rewards/margins": 1.5254417657852173, | |
| "rewards/rejected": -1.4789149761199951, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.010703 | |
| }, | |
| { | |
| "epoch": 0.19637377963737795, | |
| "grad_norm": 1.698593258857727, | |
| "learning_rate": 0.00019874271023833604, | |
| "logits/chosen": -0.36257320642471313, | |
| "logits/rejected": -0.4434874653816223, | |
| "logps/chosen": -8.048574447631836, | |
| "logps/rejected": -30.737728118896484, | |
| "loss": 0.8314277529716492, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.47138625383377075, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10594448447227478, | |
| "rewards/margins": 1.524275541305542, | |
| "rewards/rejected": -1.4183311462402344, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.010703 | |
| }, | |
| { | |
| "epoch": 0.19860529986053, | |
| "grad_norm": 3.0257344245910645, | |
| "learning_rate": 0.00019868368178223075, | |
| "logits/chosen": -0.3720957636833191, | |
| "logits/rejected": -0.45681309700012207, | |
| "logps/chosen": -9.780877113342285, | |
| "logps/rejected": -23.92654037475586, | |
| "loss": 1.1227757930755615, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6208180785179138, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.049955643713474274, | |
| "rewards/margins": 0.7902018427848816, | |
| "rewards/rejected": -0.8401575088500977, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.010704 | |
| }, | |
| { | |
| "epoch": 0.200836820083682, | |
| "grad_norm": 1.996423363685608, | |
| "learning_rate": 0.00019862330844011466, | |
| "logits/chosen": -0.4094502031803131, | |
| "logits/rejected": -0.5237057209014893, | |
| "logps/chosen": -7.119333744049072, | |
| "logps/rejected": -27.10557746887207, | |
| "loss": 0.9298258423805237, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5608960390090942, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13814933598041534, | |
| "rewards/margins": 1.2807323932647705, | |
| "rewards/rejected": -1.1425830125808716, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.010705 | |
| }, | |
| { | |
| "epoch": 0.20306834030683404, | |
| "grad_norm": 2.4107954502105713, | |
| "learning_rate": 0.00019856159103477086, | |
| "logits/chosen": -0.38746166229248047, | |
| "logits/rejected": -0.488497257232666, | |
| "logps/chosen": -4.5973896980285645, | |
| "logps/rejected": -27.419519424438477, | |
| "loss": 0.710839033126831, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.30818992853164673, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.038327932357788086, | |
| "rewards/margins": 1.1028857231140137, | |
| "rewards/rejected": -1.064557671546936, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.010705 | |
| }, | |
| { | |
| "epoch": 0.20529986052998606, | |
| "grad_norm": 1.7134486436843872, | |
| "learning_rate": 0.00019849853040729962, | |
| "logits/chosen": -0.39711794257164, | |
| "logits/rejected": -0.5056676268577576, | |
| "logps/chosen": -3.698580265045166, | |
| "logps/rejected": -35.89771270751953, | |
| "loss": 0.6057847142219543, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.28385108709335327, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.012411292642354965, | |
| "rewards/margins": 1.7848464250564575, | |
| "rewards/rejected": -1.7724350690841675, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.010705 | |
| }, | |
| { | |
| "epoch": 0.20753138075313807, | |
| "grad_norm": 3.236150026321411, | |
| "learning_rate": 0.00019843412741710705, | |
| "logits/chosen": -0.4137122631072998, | |
| "logits/rejected": -0.5312527418136597, | |
| "logps/chosen": -8.622723579406738, | |
| "logps/rejected": -32.65446853637695, | |
| "loss": 0.923988938331604, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5595443248748779, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.008658979088068008, | |
| "rewards/margins": 1.6513465642929077, | |
| "rewards/rejected": -1.6600055694580078, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.010706 | |
| }, | |
| { | |
| "epoch": 0.2097629009762901, | |
| "grad_norm": 3.0684919357299805, | |
| "learning_rate": 0.00019836838294189327, | |
| "logits/chosen": -0.30109331011772156, | |
| "logits/rejected": -0.5258408784866333, | |
| "logps/chosen": -4.7982635498046875, | |
| "logps/rejected": -46.58249282836914, | |
| "loss": 0.6704127788543701, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.41316378116607666, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.022386539727449417, | |
| "rewards/margins": 2.3209354877471924, | |
| "rewards/rejected": -2.3433220386505127, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.010705 | |
| }, | |
| { | |
| "epoch": 0.21199442119944212, | |
| "grad_norm": 1.8835054636001587, | |
| "learning_rate": 0.00019830129787764048, | |
| "logits/chosen": -0.41429489850997925, | |
| "logits/rejected": -0.5583072304725647, | |
| "logps/chosen": -7.361013412475586, | |
| "logps/rejected": -39.35795211791992, | |
| "loss": 0.6725447773933411, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.368007630109787, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.1507667899131775, | |
| "rewards/margins": 2.0595011711120605, | |
| "rewards/rejected": -2.210268020629883, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.010706 | |
| }, | |
| { | |
| "epoch": 0.21422594142259413, | |
| "grad_norm": 2.3120245933532715, | |
| "learning_rate": 0.00019823287313860087, | |
| "logits/chosen": -0.372950941324234, | |
| "logits/rejected": -0.49759799242019653, | |
| "logps/chosen": -11.2495756149292, | |
| "logps/rejected": -34.734066009521484, | |
| "loss": 1.1070480346679688, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6910135746002197, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.07585638761520386, | |
| "rewards/margins": 1.6244981288909912, | |
| "rewards/rejected": -1.7003545761108398, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.010706 | |
| }, | |
| { | |
| "epoch": 0.21645746164574617, | |
| "grad_norm": 2.277174711227417, | |
| "learning_rate": 0.00019816310965728388, | |
| "logits/chosen": -0.4299129247665405, | |
| "logits/rejected": -0.4980982542037964, | |
| "logps/chosen": -9.542954444885254, | |
| "logps/rejected": -25.756847381591797, | |
| "loss": 0.9643784165382385, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4663383364677429, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.04499448090791702, | |
| "rewards/margins": 1.144527554512024, | |
| "rewards/rejected": -1.1895220279693604, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.010706 | |
| }, | |
| { | |
| "epoch": 0.21868898186889818, | |
| "grad_norm": 1.9245892763137817, | |
| "learning_rate": 0.00019809200838444383, | |
| "logits/chosen": -0.4750334322452545, | |
| "logits/rejected": -0.5499654412269592, | |
| "logps/chosen": -7.279554843902588, | |
| "logps/rejected": -27.49015998840332, | |
| "loss": 0.7538543343544006, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.37693145871162415, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.19298376142978668, | |
| "rewards/margins": 1.2535287141799927, | |
| "rewards/rejected": -1.0605449676513672, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.010707 | |
| }, | |
| { | |
| "epoch": 0.22092050209205022, | |
| "grad_norm": 2.6517419815063477, | |
| "learning_rate": 0.0001980195702890667, | |
| "logits/chosen": -0.3958469033241272, | |
| "logits/rejected": -0.5089414715766907, | |
| "logps/chosen": -7.152680397033691, | |
| "logps/rejected": -34.461917877197266, | |
| "loss": 0.8412438035011292, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3738154470920563, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.022486146539449692, | |
| "rewards/margins": 1.67362380027771, | |
| "rewards/rejected": -1.6961098909378052, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.010708 | |
| }, | |
| { | |
| "epoch": 0.22315202231520223, | |
| "grad_norm": 2.8246142864227295, | |
| "learning_rate": 0.00019794579635835704, | |
| "logits/chosen": -0.4292357861995697, | |
| "logits/rejected": -0.5326910614967346, | |
| "logps/chosen": -7.5378594398498535, | |
| "logps/rejected": -21.57219696044922, | |
| "loss": 1.0386667251586914, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5401602387428284, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.06580009311437607, | |
| "rewards/margins": 0.625900149345398, | |
| "rewards/rejected": -0.5601000189781189, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.010708 | |
| }, | |
| { | |
| "epoch": 0.22538354253835424, | |
| "grad_norm": 2.5541062355041504, | |
| "learning_rate": 0.00019787068759772458, | |
| "logits/chosen": -0.2897275686264038, | |
| "logits/rejected": -0.469921737909317, | |
| "logps/chosen": -5.731183052062988, | |
| "logps/rejected": -42.3974494934082, | |
| "loss": 0.6600039005279541, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.34703782200813293, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.03177756816148758, | |
| "rewards/margins": 2.005840539932251, | |
| "rewards/rejected": -1.9740626811981201, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.22761506276150628, | |
| "grad_norm": 1.7807402610778809, | |
| "learning_rate": 0.0001977942450307703, | |
| "logits/chosen": -0.4453420042991638, | |
| "logits/rejected": -0.5632447004318237, | |
| "logps/chosen": -2.4129638671875, | |
| "logps/rejected": -25.95719337463379, | |
| "loss": 0.5793961882591248, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.23024141788482666, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14239919185638428, | |
| "rewards/margins": 1.4281731843948364, | |
| "rewards/rejected": -1.2857739925384521, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.2298465829846583, | |
| "grad_norm": 2.2132644653320312, | |
| "learning_rate": 0.00019771646969927276, | |
| "logits/chosen": -0.35926875472068787, | |
| "logits/rejected": -0.520535945892334, | |
| "logps/chosen": -13.426995277404785, | |
| "logps/rejected": -45.62168884277344, | |
| "loss": 1.015347957611084, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7125861644744873, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.29009538888931274, | |
| "rewards/margins": 2.0907297134399414, | |
| "rewards/rejected": -2.3808252811431885, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.23207810320781033, | |
| "grad_norm": 3.2295114994049072, | |
| "learning_rate": 0.00019763736266317373, | |
| "logits/chosen": -0.40255796909332275, | |
| "logits/rejected": -0.48326143622398376, | |
| "logps/chosen": -11.606037139892578, | |
| "logps/rejected": -31.71380043029785, | |
| "loss": 1.1166499853134155, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6979129910469055, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.08108239620923996, | |
| "rewards/margins": 1.4596813917160034, | |
| "rewards/rejected": -1.5407637357711792, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.23430962343096234, | |
| "grad_norm": 10.526008605957031, | |
| "learning_rate": 0.00019755692500056377, | |
| "logits/chosen": -0.39488697052001953, | |
| "logits/rejected": -0.4993595480918884, | |
| "logps/chosen": -8.515541076660156, | |
| "logps/rejected": -43.509639739990234, | |
| "loss": 0.9588133096694946, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6071394085884094, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.21072883903980255, | |
| "rewards/margins": 2.291653633117676, | |
| "rewards/rejected": -2.502382278442383, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.23654114365411436, | |
| "grad_norm": 4.369258880615234, | |
| "learning_rate": 0.0001974751578076675, | |
| "logits/chosen": -0.47596731781959534, | |
| "logits/rejected": -0.567024827003479, | |
| "logps/chosen": -9.769340515136719, | |
| "logps/rejected": -36.51396560668945, | |
| "loss": 1.1472177505493164, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7814697623252869, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.07862536609172821, | |
| "rewards/margins": 1.9599454402923584, | |
| "rewards/rejected": -2.0385708808898926, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.2387726638772664, | |
| "grad_norm": 2.6377806663513184, | |
| "learning_rate": 0.0001973920621988288, | |
| "logits/chosen": -0.4363410472869873, | |
| "logits/rejected": -0.5180681943893433, | |
| "logps/chosen": -8.525186538696289, | |
| "logps/rejected": -36.119422912597656, | |
| "loss": 0.8840208053588867, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5660971999168396, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.11222146451473236, | |
| "rewards/margins": 2.031522035598755, | |
| "rewards/rejected": -2.1437435150146484, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.2410041841004184, | |
| "grad_norm": 3.5556135177612305, | |
| "learning_rate": 0.00019730763930649557, | |
| "logits/chosen": -0.4549260139465332, | |
| "logits/rejected": -0.5709996223449707, | |
| "logps/chosen": -6.807540416717529, | |
| "logps/rejected": -35.386817932128906, | |
| "loss": 1.0365853309631348, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6718467473983765, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.010064257308840752, | |
| "rewards/margins": 2.010096549987793, | |
| "rewards/rejected": -2.0201611518859863, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.24323570432357045, | |
| "grad_norm": 2.9586894512176514, | |
| "learning_rate": 0.0001972218902812041, | |
| "logits/chosen": -0.5169477462768555, | |
| "logits/rejected": -0.5766913890838623, | |
| "logps/chosen": -9.75178050994873, | |
| "logps/rejected": -26.94969940185547, | |
| "loss": 1.03122079372406, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6585339307785034, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.047493062913417816, | |
| "rewards/margins": 1.4683667421340942, | |
| "rewards/rejected": -1.5158597230911255, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.24546722454672246, | |
| "grad_norm": 2.40643310546875, | |
| "learning_rate": 0.0001971348162915637, | |
| "logits/chosen": -0.40012210607528687, | |
| "logits/rejected": -0.5228334665298462, | |
| "logps/chosen": -12.064148902893066, | |
| "logps/rejected": -42.65177917480469, | |
| "loss": 1.028669834136963, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.584478497505188, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0045367032289505005, | |
| "rewards/margins": 1.1938111782073975, | |
| "rewards/rejected": -1.189274549484253, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.24769874476987447, | |
| "grad_norm": 1.9528326988220215, | |
| "learning_rate": 0.0001970464185242406, | |
| "logits/chosen": -0.48454731702804565, | |
| "logits/rejected": -0.5713267922401428, | |
| "logps/chosen": -8.57382869720459, | |
| "logps/rejected": -28.3697452545166, | |
| "loss": 0.9442793130874634, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5884312987327576, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.007765632122755051, | |
| "rewards/margins": 1.1733622550964355, | |
| "rewards/rejected": -1.181127905845642, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.2499302649930265, | |
| "grad_norm": 1.6935343742370605, | |
| "learning_rate": 0.00019695669818394176, | |
| "logits/chosen": -0.49247032403945923, | |
| "logits/rejected": -0.5529605150222778, | |
| "logps/chosen": -6.149413108825684, | |
| "logps/rejected": -26.09927749633789, | |
| "loss": 0.8117169141769409, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.36330851912498474, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.11475833505392075, | |
| "rewards/margins": 0.9903795719146729, | |
| "rewards/rejected": -0.8756212592124939, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.25216178521617855, | |
| "grad_norm": 1.7400895357131958, | |
| "learning_rate": 0.00019686565649339852, | |
| "logits/chosen": -0.47781193256378174, | |
| "logits/rejected": -0.541789174079895, | |
| "logps/chosen": -7.246283054351807, | |
| "logps/rejected": -28.977123260498047, | |
| "loss": 0.8169933557510376, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.46227994561195374, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1930399090051651, | |
| "rewards/margins": 1.5713894367218018, | |
| "rewards/rejected": -1.3783494234085083, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.25439330543933053, | |
| "grad_norm": 2.0717272758483887, | |
| "learning_rate": 0.0001967732946933499, | |
| "logits/chosen": -0.48887836933135986, | |
| "logits/rejected": -0.5135952234268188, | |
| "logps/chosen": -9.175788879394531, | |
| "logps/rejected": -19.074743270874023, | |
| "loss": 1.0894757509231567, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5358699560165405, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.011165066622197628, | |
| "rewards/margins": 0.7140389084815979, | |
| "rewards/rejected": -0.7252039313316345, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.25662482566248257, | |
| "grad_norm": 1.8609806299209595, | |
| "learning_rate": 0.00019667961404252573, | |
| "logits/chosen": -0.46024733781814575, | |
| "logits/rejected": -0.5330649018287659, | |
| "logps/chosen": -6.905147552490234, | |
| "logps/rejected": -30.54239273071289, | |
| "loss": 0.8680601119995117, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.44586634635925293, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.03578485921025276, | |
| "rewards/margins": 1.5293731689453125, | |
| "rewards/rejected": -1.4935882091522217, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.2588563458856346, | |
| "grad_norm": 1.66657292842865, | |
| "learning_rate": 0.00019658461581762948, | |
| "logits/chosen": -0.430117666721344, | |
| "logits/rejected": -0.5585033297538757, | |
| "logps/chosen": -5.328842639923096, | |
| "logps/rejected": -37.261329650878906, | |
| "loss": 0.6072223782539368, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3235556483268738, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11161011457443237, | |
| "rewards/margins": 2.0768401622772217, | |
| "rewards/rejected": -1.965229868888855, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.2610878661087866, | |
| "grad_norm": 1.51878821849823, | |
| "learning_rate": 0.0001964883013133208, | |
| "logits/chosen": -0.419185996055603, | |
| "logits/rejected": -0.5297868251800537, | |
| "logps/chosen": -8.04638385772705, | |
| "logps/rejected": -37.03801727294922, | |
| "loss": 0.7135862708091736, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.40418556332588196, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.003706634044647217, | |
| "rewards/margins": 2.0922625064849854, | |
| "rewards/rejected": -2.0959692001342773, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.26331938633193863, | |
| "grad_norm": 1.7501200437545776, | |
| "learning_rate": 0.00019639067184219796, | |
| "logits/chosen": -0.4789353609085083, | |
| "logits/rejected": -0.5624681711196899, | |
| "logps/chosen": -2.698453426361084, | |
| "logps/rejected": -30.66053009033203, | |
| "loss": 0.4839392304420471, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.23937827348709106, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1991066038608551, | |
| "rewards/margins": 2.1478512287139893, | |
| "rewards/rejected": -1.948744773864746, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.26555090655509067, | |
| "grad_norm": 5.462699890136719, | |
| "learning_rate": 0.00019629172873477995, | |
| "logits/chosen": -0.4896751642227173, | |
| "logits/rejected": -0.6056660413742065, | |
| "logps/chosen": -9.186168670654297, | |
| "logps/rejected": -43.67456817626953, | |
| "loss": 1.0974973440170288, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7505476474761963, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.26940032839775085, | |
| "rewards/margins": 2.277892589569092, | |
| "rewards/rejected": -2.547292709350586, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.26778242677824265, | |
| "grad_norm": 2.521127462387085, | |
| "learning_rate": 0.00019619147333948823, | |
| "logits/chosen": -0.40272024273872375, | |
| "logits/rejected": -0.6465494632720947, | |
| "logps/chosen": -4.102967262268066, | |
| "logps/rejected": -46.14149475097656, | |
| "loss": 0.6112779974937439, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.35009804368019104, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.06559442728757858, | |
| "rewards/margins": 2.652864456176758, | |
| "rewards/rejected": -2.718458652496338, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.2700139470013947, | |
| "grad_norm": 6.966860771179199, | |
| "learning_rate": 0.00019608990702262862, | |
| "logits/chosen": -0.46823495626449585, | |
| "logits/rejected": -0.5669148564338684, | |
| "logps/chosen": -11.427492141723633, | |
| "logps/rejected": -41.708621978759766, | |
| "loss": 0.9116367101669312, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5967401266098022, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.1262148916721344, | |
| "rewards/margins": 2.7404427528381348, | |
| "rewards/rejected": -2.8666577339172363, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.27224546722454673, | |
| "grad_norm": 3.0951266288757324, | |
| "learning_rate": 0.0001959870311683723, | |
| "logits/chosen": -0.4486353099346161, | |
| "logits/rejected": -0.5479130744934082, | |
| "logps/chosen": -12.51127815246582, | |
| "logps/rejected": -38.43931198120117, | |
| "loss": 0.9770362377166748, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5739753246307373, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.2812083661556244, | |
| "rewards/margins": 1.7542171478271484, | |
| "rewards/rejected": -2.0354256629943848, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.2744769874476987, | |
| "grad_norm": 2.664623498916626, | |
| "learning_rate": 0.00019588284717873738, | |
| "logits/chosen": -0.48905450105667114, | |
| "logits/rejected": -0.5784589052200317, | |
| "logps/chosen": -11.445174217224121, | |
| "logps/rejected": -45.63172149658203, | |
| "loss": 0.8187350630760193, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5693225860595703, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.07134091854095459, | |
| "rewards/margins": 2.74631929397583, | |
| "rewards/rejected": -2.8176605701446533, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.27670850767085076, | |
| "grad_norm": 1.5270544290542603, | |
| "learning_rate": 0.00019577735647356928, | |
| "logits/chosen": -0.42984533309936523, | |
| "logits/rejected": -0.5359001159667969, | |
| "logps/chosen": -6.653199195861816, | |
| "logps/rejected": -29.57577133178711, | |
| "loss": 0.7354912757873535, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3922813832759857, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1660708487033844, | |
| "rewards/margins": 1.5390381813049316, | |
| "rewards/rejected": -1.3729673624038696, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.2789400278940028, | |
| "grad_norm": 3.5429413318634033, | |
| "learning_rate": 0.00019567056049052203, | |
| "logits/chosen": -0.3107150197029114, | |
| "logits/rejected": -0.4991438388824463, | |
| "logps/chosen": -5.079807758331299, | |
| "logps/rejected": -40.358970642089844, | |
| "loss": 0.6619258522987366, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.36486440896987915, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.030078772455453873, | |
| "rewards/margins": 1.9852522611618042, | |
| "rewards/rejected": -1.955173373222351, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.28117154811715483, | |
| "grad_norm": 1.961870551109314, | |
| "learning_rate": 0.00019556246068503795, | |
| "logits/chosen": -0.44410189986228943, | |
| "logits/rejected": -0.4920841455459595, | |
| "logps/chosen": -11.91314697265625, | |
| "logps/rejected": -31.1485595703125, | |
| "loss": 0.8891083598136902, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5505969524383545, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.03779969736933708, | |
| "rewards/margins": 1.8280887603759766, | |
| "rewards/rejected": -1.790289044380188, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.2834030683403068, | |
| "grad_norm": 2.261699676513672, | |
| "learning_rate": 0.00019545305853032848, | |
| "logits/chosen": -0.3864215016365051, | |
| "logits/rejected": -0.4863501191139221, | |
| "logps/chosen": -7.286771774291992, | |
| "logps/rejected": -30.703035354614258, | |
| "loss": 0.8944107294082642, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5101214051246643, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.018673699349164963, | |
| "rewards/margins": 1.4196372032165527, | |
| "rewards/rejected": -1.400963544845581, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.28563458856345886, | |
| "grad_norm": 1.475645899772644, | |
| "learning_rate": 0.0001953423555173536, | |
| "logits/chosen": -0.36042094230651855, | |
| "logits/rejected": -0.5007886290550232, | |
| "logps/chosen": -5.484119892120361, | |
| "logps/rejected": -41.732566833496094, | |
| "loss": 0.587951123714447, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.33234262466430664, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.022678524255752563, | |
| "rewards/margins": 1.7825675010681152, | |
| "rewards/rejected": -1.7598888874053955, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.2878661087866109, | |
| "grad_norm": 1.8218269348144531, | |
| "learning_rate": 0.0001952303531548018, | |
| "logits/chosen": -0.33974117040634155, | |
| "logits/rejected": -0.44949695467948914, | |
| "logps/chosen": -5.385599136352539, | |
| "logps/rejected": -34.09246063232422, | |
| "loss": 0.566850483417511, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.25613701343536377, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.12256469577550888, | |
| "rewards/margins": 1.9903541803359985, | |
| "rewards/rejected": -1.8677895069122314, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.2900976290097629, | |
| "grad_norm": 1.8668869733810425, | |
| "learning_rate": 0.00019511705296906945, | |
| "logits/chosen": -0.3487342596054077, | |
| "logits/rejected": -0.4806521534919739, | |
| "logps/chosen": -4.425655841827393, | |
| "logps/rejected": -30.515653610229492, | |
| "loss": 0.5262651443481445, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.25739917159080505, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.12762486934661865, | |
| "rewards/margins": 1.6179413795471191, | |
| "rewards/rejected": -1.4903165102005005, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.2923291492329149, | |
| "grad_norm": 2.4468886852264404, | |
| "learning_rate": 0.00019500245650423987, | |
| "logits/chosen": -0.3514082133769989, | |
| "logits/rejected": -0.4678734242916107, | |
| "logps/chosen": -9.789356231689453, | |
| "logps/rejected": -43.26856231689453, | |
| "loss": 0.8514004349708557, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5882378816604614, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.00511053204536438, | |
| "rewards/margins": 2.595022678375244, | |
| "rewards/rejected": -2.600132942199707, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.29456066945606696, | |
| "grad_norm": 1.4899861812591553, | |
| "learning_rate": 0.00019488656532206256, | |
| "logits/chosen": -0.32015788555145264, | |
| "logits/rejected": -0.5057851672172546, | |
| "logps/chosen": -5.5769572257995605, | |
| "logps/rejected": -39.262237548828125, | |
| "loss": 0.5258051156997681, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.2577199935913086, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.012265877798199654, | |
| "rewards/margins": 1.970078945159912, | |
| "rewards/rejected": -1.957813024520874, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.29679218967921894, | |
| "grad_norm": 2.7044637203216553, | |
| "learning_rate": 0.00019476938100193166, | |
| "logits/chosen": -0.3656051754951477, | |
| "logits/rejected": -0.4236447215080261, | |
| "logps/chosen": -10.65760612487793, | |
| "logps/rejected": -38.63339614868164, | |
| "loss": 0.9246849417686462, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6106225848197937, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.030058247968554497, | |
| "rewards/margins": 2.29494047164917, | |
| "rewards/rejected": -2.2648820877075195, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.299023709902371, | |
| "grad_norm": 1.82398521900177, | |
| "learning_rate": 0.00019465090514086448, | |
| "logits/chosen": -0.2924862504005432, | |
| "logits/rejected": -0.49178171157836914, | |
| "logps/chosen": -5.639602184295654, | |
| "logps/rejected": -44.825313568115234, | |
| "loss": 0.5453966856002808, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3345707952976227, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07429855316877365, | |
| "rewards/margins": 2.4938178062438965, | |
| "rewards/rejected": -2.4195189476013184, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.301255230125523, | |
| "grad_norm": 3.8286569118499756, | |
| "learning_rate": 0.00019453113935347983, | |
| "logits/chosen": -0.29531559348106384, | |
| "logits/rejected": -0.43998682498931885, | |
| "logps/chosen": -10.71696662902832, | |
| "logps/rejected": -31.618389129638672, | |
| "loss": 1.1089136600494385, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7216206789016724, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.1611023098230362, | |
| "rewards/margins": 1.5489929914474487, | |
| "rewards/rejected": -1.7100951671600342, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.30348675034867506, | |
| "grad_norm": 2.3694629669189453, | |
| "learning_rate": 0.000194410085271976, | |
| "logits/chosen": -0.3209247291088104, | |
| "logits/rejected": -0.47681719064712524, | |
| "logps/chosen": -8.806313514709473, | |
| "logps/rejected": -42.08256912231445, | |
| "loss": 0.8723977208137512, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6001561880111694, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.08420376479625702, | |
| "rewards/margins": 2.307250499725342, | |
| "rewards/rejected": -2.3914542198181152, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.30571827057182704, | |
| "grad_norm": 4.322510719299316, | |
| "learning_rate": 0.00019428774454610843, | |
| "logits/chosen": -0.3234959542751312, | |
| "logits/rejected": -0.43433526158332825, | |
| "logps/chosen": -8.827983856201172, | |
| "logps/rejected": -38.56624984741211, | |
| "loss": 0.8363085985183716, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5304505825042725, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.03617179021239281, | |
| "rewards/margins": 2.3936820030212402, | |
| "rewards/rejected": -2.429853677749634, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.3079497907949791, | |
| "grad_norm": 1.8575319051742554, | |
| "learning_rate": 0.00019416411884316722, | |
| "logits/chosen": -0.19573748111724854, | |
| "logits/rejected": -0.39096614718437195, | |
| "logps/chosen": -5.302525043487549, | |
| "logps/rejected": -39.366905212402344, | |
| "loss": 0.5817482471466064, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3171233534812927, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06202463060617447, | |
| "rewards/margins": 2.1402504444122314, | |
| "rewards/rejected": -2.07822585105896, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.3101813110181311, | |
| "grad_norm": 1.6324138641357422, | |
| "learning_rate": 0.00019403920984795454, | |
| "logits/chosen": -0.18411299586296082, | |
| "logits/rejected": -0.3911224901676178, | |
| "logps/chosen": -4.253074645996094, | |
| "logps/rejected": -37.889976501464844, | |
| "loss": 0.6420720815658569, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3620051145553589, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1460508555173874, | |
| "rewards/margins": 2.2889294624328613, | |
| "rewards/rejected": -2.142878770828247, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.3124128312412831, | |
| "grad_norm": 2.665651798248291, | |
| "learning_rate": 0.00019391301926276156, | |
| "logits/chosen": -0.22396986186504364, | |
| "logits/rejected": -0.3946935534477234, | |
| "logps/chosen": -4.665857315063477, | |
| "logps/rejected": -40.48711395263672, | |
| "loss": 0.7322566509246826, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.41601666808128357, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.039280496537685394, | |
| "rewards/margins": 2.420466899871826, | |
| "rewards/rejected": -2.459747314453125, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.31464435146443515, | |
| "grad_norm": 2.0447568893432617, | |
| "learning_rate": 0.00019378554880734527, | |
| "logits/chosen": -0.22006088495254517, | |
| "logits/rejected": -0.3875121772289276, | |
| "logps/chosen": -5.640967845916748, | |
| "logps/rejected": -47.2126579284668, | |
| "loss": 0.6299532651901245, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4075142443180084, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07418311387300491, | |
| "rewards/margins": 3.378464460372925, | |
| "rewards/rejected": -3.304281711578369, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.3168758716875872, | |
| "grad_norm": 3.150909185409546, | |
| "learning_rate": 0.00019365680021890506, | |
| "logits/chosen": -0.2578600347042084, | |
| "logits/rejected": -0.35254308581352234, | |
| "logps/chosen": -8.539968490600586, | |
| "logps/rejected": -34.56965637207031, | |
| "loss": 0.9595645070075989, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5309237241744995, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.1485617607831955, | |
| "rewards/margins": 1.7760200500488281, | |
| "rewards/rejected": -1.9245820045471191, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.010696 | |
| }, | |
| { | |
| "epoch": 0.31910739191073917, | |
| "grad_norm": 3.2599754333496094, | |
| "learning_rate": 0.0001935267752520591, | |
| "logits/chosen": -0.3178224563598633, | |
| "logits/rejected": -0.43051257729530334, | |
| "logps/chosen": -9.458460807800293, | |
| "logps/rejected": -43.98479080200195, | |
| "loss": 0.8238604068756104, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5105634331703186, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.19997264444828033, | |
| "rewards/margins": 2.638275146484375, | |
| "rewards/rejected": -2.8382480144500732, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.010696 | |
| }, | |
| { | |
| "epoch": 0.3213389121338912, | |
| "grad_norm": 7.584465503692627, | |
| "learning_rate": 0.00019339547567882024, | |
| "logits/chosen": -0.2016015499830246, | |
| "logits/rejected": -0.36200886964797974, | |
| "logps/chosen": -9.776619911193848, | |
| "logps/rejected": -48.03835678100586, | |
| "loss": 0.9604641199111938, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7163732647895813, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.24650944769382477, | |
| "rewards/margins": 3.3983724117279053, | |
| "rewards/rejected": -3.151862621307373, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.010696 | |
| }, | |
| { | |
| "epoch": 0.32357043235704325, | |
| "grad_norm": 3.555295944213867, | |
| "learning_rate": 0.0001932629032885721, | |
| "logits/chosen": -0.26102834939956665, | |
| "logits/rejected": -0.3585357069969177, | |
| "logps/chosen": -12.133922576904297, | |
| "logps/rejected": -48.155155181884766, | |
| "loss": 0.9948782920837402, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6610950231552124, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.4001372456550598, | |
| "rewards/margins": 2.751622200012207, | |
| "rewards/rejected": -3.151759386062622, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.010697 | |
| }, | |
| { | |
| "epoch": 0.32580195258019523, | |
| "grad_norm": 2.2978155612945557, | |
| "learning_rate": 0.0001931290598880445, | |
| "logits/chosen": -0.20670001208782196, | |
| "logits/rejected": -0.38169875741004944, | |
| "logps/chosen": -6.4796600341796875, | |
| "logps/rejected": -41.426429748535156, | |
| "loss": 0.6576346158981323, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.42290252447128296, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11042710393667221, | |
| "rewards/margins": 2.6782710552215576, | |
| "rewards/rejected": -2.5678436756134033, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.010697 | |
| }, | |
| { | |
| "epoch": 0.32803347280334727, | |
| "grad_norm": 2.1882224082946777, | |
| "learning_rate": 0.00019299394730128895, | |
| "logits/chosen": -0.20903249084949493, | |
| "logits/rejected": -0.2923564314842224, | |
| "logps/chosen": -12.293680191040039, | |
| "logps/rejected": -50.68069076538086, | |
| "loss": 0.8728819489479065, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5617231130599976, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.08868011832237244, | |
| "rewards/margins": 3.250684976577759, | |
| "rewards/rejected": -3.339365005493164, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.010696 | |
| }, | |
| { | |
| "epoch": 0.3302649930264993, | |
| "grad_norm": 2.5009729862213135, | |
| "learning_rate": 0.00019285756736965367, | |
| "logits/chosen": -0.2492772340774536, | |
| "logits/rejected": -0.3531278669834137, | |
| "logps/chosen": -7.951318264007568, | |
| "logps/rejected": -34.95103073120117, | |
| "loss": 0.9188458323478699, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5677845478057861, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.015583137050271034, | |
| "rewards/margins": 2.127014398574829, | |
| "rewards/rejected": -2.111431360244751, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.010697 | |
| }, | |
| { | |
| "epoch": 0.33249651324965135, | |
| "grad_norm": 2.460752487182617, | |
| "learning_rate": 0.00019271992195175875, | |
| "logits/chosen": -0.31061843037605286, | |
| "logits/rejected": -0.42540180683135986, | |
| "logps/chosen": -8.994503021240234, | |
| "logps/rejected": -38.728179931640625, | |
| "loss": 0.9080746173858643, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5827285051345825, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09331205487251282, | |
| "rewards/margins": 2.394498348236084, | |
| "rewards/rejected": -2.3011860847473145, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.010697 | |
| }, | |
| { | |
| "epoch": 0.33472803347280333, | |
| "grad_norm": 1.7428467273712158, | |
| "learning_rate": 0.00019258101292347042, | |
| "logits/chosen": -0.19874219596385956, | |
| "logits/rejected": -0.36566510796546936, | |
| "logps/chosen": -8.282856941223145, | |
| "logps/rejected": -47.80164337158203, | |
| "loss": 0.6850791573524475, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5025182366371155, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09450387954711914, | |
| "rewards/margins": 2.836395502090454, | |
| "rewards/rejected": -2.741891622543335, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.010697 | |
| }, | |
| { | |
| "epoch": 0.33695955369595537, | |
| "grad_norm": 1.7387069463729858, | |
| "learning_rate": 0.00019244084217787588, | |
| "logits/chosen": -0.22253645956516266, | |
| "logits/rejected": -0.36506688594818115, | |
| "logps/chosen": -8.663468360900879, | |
| "logps/rejected": -48.536319732666016, | |
| "loss": 0.7012121081352234, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.469788521528244, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1591811329126358, | |
| "rewards/margins": 2.9181699752807617, | |
| "rewards/rejected": -2.758988857269287, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.3391910739191074, | |
| "grad_norm": 2.085836887359619, | |
| "learning_rate": 0.00019229941162525726, | |
| "logits/chosen": -0.25783437490463257, | |
| "logits/rejected": -0.2909075915813446, | |
| "logps/chosen": -9.45044994354248, | |
| "logps/rejected": -33.906532287597656, | |
| "loss": 0.8592720627784729, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4804239869117737, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.12236574292182922, | |
| "rewards/margins": 1.7898168563842773, | |
| "rewards/rejected": -1.9121828079223633, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.3414225941422594, | |
| "grad_norm": 1.8399463891983032, | |
| "learning_rate": 0.00019215672319306565, | |
| "logits/chosen": -0.27110740542411804, | |
| "logits/rejected": -0.3448094129562378, | |
| "logps/chosen": -6.487441062927246, | |
| "logps/rejected": -33.882781982421875, | |
| "loss": 0.6851896047592163, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3750152587890625, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0861067920923233, | |
| "rewards/margins": 2.013005018234253, | |
| "rewards/rejected": -1.9268981218338013, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.34365411436541143, | |
| "grad_norm": 1.2756677865982056, | |
| "learning_rate": 0.00019201277882589487, | |
| "logits/chosen": -0.23933258652687073, | |
| "logits/rejected": -0.40502744913101196, | |
| "logps/chosen": -4.149328231811523, | |
| "logps/rejected": -56.27098083496094, | |
| "loss": 0.3939424157142639, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.240768164396286, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10984864085912704, | |
| "rewards/margins": 3.799041271209717, | |
| "rewards/rejected": -3.689192771911621, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.3458856345885635, | |
| "grad_norm": 2.6633708477020264, | |
| "learning_rate": 0.00019186758048545498, | |
| "logits/chosen": -0.2815844714641571, | |
| "logits/rejected": -0.422237366437912, | |
| "logps/chosen": -9.068172454833984, | |
| "logps/rejected": -44.39888000488281, | |
| "loss": 0.833120584487915, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5922810435295105, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.021779753267765045, | |
| "rewards/margins": 2.4418890476226807, | |
| "rewards/rejected": -2.4636685848236084, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.34811715481171546, | |
| "grad_norm": 3.4869775772094727, | |
| "learning_rate": 0.00019172113015054532, | |
| "logits/chosen": -0.38594380021095276, | |
| "logits/rejected": -0.4550650715827942, | |
| "logps/chosen": -9.38473129272461, | |
| "logps/rejected": -38.14994812011719, | |
| "loss": 0.6951225996017456, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.44333207607269287, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07232007384300232, | |
| "rewards/margins": 2.3049843311309814, | |
| "rewards/rejected": -2.2326643466949463, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.3503486750348675, | |
| "grad_norm": 2.0695393085479736, | |
| "learning_rate": 0.00019157342981702792, | |
| "logits/chosen": -0.30112287402153015, | |
| "logits/rejected": -0.4652690887451172, | |
| "logps/chosen": -4.151251792907715, | |
| "logps/rejected": -40.637821197509766, | |
| "loss": 0.5484941005706787, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.34684789180755615, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.14294274151325226, | |
| "rewards/margins": 2.3962206840515137, | |
| "rewards/rejected": -2.2532777786254883, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.35258019525801954, | |
| "grad_norm": 2.7222163677215576, | |
| "learning_rate": 0.0001914244814978001, | |
| "logits/chosen": -0.3103567063808441, | |
| "logits/rejected": -0.430208683013916, | |
| "logps/chosen": -12.615564346313477, | |
| "logps/rejected": -38.72933578491211, | |
| "loss": 0.793499231338501, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5542211532592773, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.015316572040319443, | |
| "rewards/margins": 2.3503148555755615, | |
| "rewards/rejected": -2.334998369216919, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.3548117154811716, | |
| "grad_norm": 2.9450817108154297, | |
| "learning_rate": 0.00019127428722276685, | |
| "logits/chosen": -0.24224838614463806, | |
| "logits/rejected": -0.43393394351005554, | |
| "logps/chosen": -8.04431438446045, | |
| "logps/rejected": -53.618770599365234, | |
| "loss": 0.753520131111145, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5266157984733582, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10486146807670593, | |
| "rewards/margins": 3.499842643737793, | |
| "rewards/rejected": -3.3949811458587646, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.35704323570432356, | |
| "grad_norm": 6.73776912689209, | |
| "learning_rate": 0.0001911228490388136, | |
| "logits/chosen": -0.3112480044364929, | |
| "logits/rejected": -0.4515516757965088, | |
| "logps/chosen": -9.544122695922852, | |
| "logps/rejected": -44.96870803833008, | |
| "loss": 0.7057361006736755, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5024272799491882, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.22010847926139832, | |
| "rewards/margins": 2.9551522731781006, | |
| "rewards/rejected": -2.735043525695801, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.3592747559274756, | |
| "grad_norm": 3.6044814586639404, | |
| "learning_rate": 0.00019097016900977788, | |
| "logits/chosen": -0.3657134771347046, | |
| "logits/rejected": -0.45344415307044983, | |
| "logps/chosen": -11.24877643585205, | |
| "logps/rejected": -45.62288284301758, | |
| "loss": 0.5986043810844421, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3538128137588501, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06909701228141785, | |
| "rewards/margins": 3.109391927719116, | |
| "rewards/rejected": -3.040294885635376, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.36150627615062764, | |
| "grad_norm": 1.7556335926055908, | |
| "learning_rate": 0.00019081624921642157, | |
| "logits/chosen": -0.3330416977405548, | |
| "logits/rejected": -0.49046823382377625, | |
| "logps/chosen": -7.067329406738281, | |
| "logps/rejected": -46.18006896972656, | |
| "loss": 0.6361539363861084, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39248889684677124, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14040817320346832, | |
| "rewards/margins": 2.906202793121338, | |
| "rewards/rejected": -2.765794515609741, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.3637377963737796, | |
| "grad_norm": 1.4350221157073975, | |
| "learning_rate": 0.00019066109175640224, | |
| "logits/chosen": -0.38426709175109863, | |
| "logits/rejected": -0.3983399271965027, | |
| "logps/chosen": -12.697317123413086, | |
| "logps/rejected": -50.39441680908203, | |
| "loss": 0.7568346858024597, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4696040451526642, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.14664673805236816, | |
| "rewards/margins": 3.4247310161590576, | |
| "rewards/rejected": -3.2780845165252686, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.36596931659693166, | |
| "grad_norm": 2.5890817642211914, | |
| "learning_rate": 0.00019050469874424476, | |
| "logits/chosen": -0.32147228717803955, | |
| "logits/rejected": -0.45530298352241516, | |
| "logps/chosen": -8.81505012512207, | |
| "logps/rejected": -47.758445739746094, | |
| "loss": 0.8394909501075745, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5335902571678162, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.005741395056247711, | |
| "rewards/margins": 3.229443073272705, | |
| "rewards/rejected": -3.23518443107605, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.3682008368200837, | |
| "grad_norm": 2.527979850769043, | |
| "learning_rate": 0.0001903470723113124, | |
| "logits/chosen": -0.3687136173248291, | |
| "logits/rejected": -0.36498233675956726, | |
| "logps/chosen": -12.974212646484375, | |
| "logps/rejected": -32.33938217163086, | |
| "loss": 0.9435381889343262, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5042305588722229, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.09565389156341553, | |
| "rewards/margins": 1.7492725849151611, | |
| "rewards/rejected": -1.8449265956878662, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.3704323570432357, | |
| "grad_norm": 2.3836722373962402, | |
| "learning_rate": 0.00019018821460577777, | |
| "logits/chosen": -0.2881522476673126, | |
| "logits/rejected": -0.39948752522468567, | |
| "logps/chosen": -14.373290061950684, | |
| "logps/rejected": -46.974891662597656, | |
| "loss": 1.0135047435760498, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6972138285636902, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.46250468492507935, | |
| "rewards/margins": 2.5046420097351074, | |
| "rewards/rejected": -2.967146873474121, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.3726638772663877, | |
| "grad_norm": 2.324857234954834, | |
| "learning_rate": 0.00019002812779259364, | |
| "logits/chosen": -0.29876166582107544, | |
| "logits/rejected": -0.47440457344055176, | |
| "logps/chosen": -6.713703632354736, | |
| "logps/rejected": -38.95991134643555, | |
| "loss": 0.7639641761779785, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4946966767311096, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.18299029767513275, | |
| "rewards/margins": 2.441457748413086, | |
| "rewards/rejected": -2.258467435836792, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.37489539748953976, | |
| "grad_norm": 5.72042179107666, | |
| "learning_rate": 0.00018986681405346322, | |
| "logits/chosen": -0.28162381052970886, | |
| "logits/rejected": -0.47184035181999207, | |
| "logps/chosen": -9.439067840576172, | |
| "logps/rejected": -53.3689079284668, | |
| "loss": 0.964309811592102, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6164814233779907, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.01046261191368103, | |
| "rewards/margins": 3.1293952465057373, | |
| "rewards/rejected": -3.1398582458496094, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.37712691771269174, | |
| "grad_norm": 4.976809978485107, | |
| "learning_rate": 0.00018970427558681082, | |
| "logits/chosen": -0.25434356927871704, | |
| "logits/rejected": -0.48102837800979614, | |
| "logps/chosen": -8.21963119506836, | |
| "logps/rejected": -65.61998748779297, | |
| "loss": 0.8252819776535034, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.646252453327179, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1419672667980194, | |
| "rewards/margins": 4.092907428741455, | |
| "rewards/rejected": -3.9509406089782715, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.3793584379358438, | |
| "grad_norm": 3.3867485523223877, | |
| "learning_rate": 0.0001895405146077514, | |
| "logits/chosen": -0.34642744064331055, | |
| "logits/rejected": -0.4897533357143402, | |
| "logps/chosen": -5.762866020202637, | |
| "logps/rejected": -46.86370086669922, | |
| "loss": 0.7062004804611206, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.33989417552948, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.06110583245754242, | |
| "rewards/margins": 2.4862968921661377, | |
| "rewards/rejected": -2.5474026203155518, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.3815899581589958, | |
| "grad_norm": 1.8158555030822754, | |
| "learning_rate": 0.00018937553334806077, | |
| "logits/chosen": -0.2750059962272644, | |
| "logits/rejected": -0.4136987030506134, | |
| "logps/chosen": -8.728262901306152, | |
| "logps/rejected": -45.89287185668945, | |
| "loss": 0.7403351068496704, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.49930721521377563, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.16491073369979858, | |
| "rewards/margins": 3.0132622718811035, | |
| "rewards/rejected": -2.8483517169952393, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.38382147838214786, | |
| "grad_norm": 1.472412109375, | |
| "learning_rate": 0.000189209334056145, | |
| "logits/chosen": -0.27084222435951233, | |
| "logits/rejected": -0.434164434671402, | |
| "logps/chosen": -5.168161392211914, | |
| "logps/rejected": -45.41401672363281, | |
| "loss": 0.6193027496337891, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.42660266160964966, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12104358524084091, | |
| "rewards/margins": 2.716996431350708, | |
| "rewards/rejected": -2.5959529876708984, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.38605299860529985, | |
| "grad_norm": 3.4075303077697754, | |
| "learning_rate": 0.00018904191899700977, | |
| "logits/chosen": -0.3655165433883667, | |
| "logits/rejected": -0.41131308674812317, | |
| "logps/chosen": -6.5695905685424805, | |
| "logps/rejected": -32.802406311035156, | |
| "loss": 0.7823173403739929, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4896646738052368, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.10015285015106201, | |
| "rewards/margins": 1.8082492351531982, | |
| "rewards/rejected": -1.7080962657928467, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.3882845188284519, | |
| "grad_norm": 1.7677769660949707, | |
| "learning_rate": 0.0001888732904522296, | |
| "logits/chosen": -0.3326292634010315, | |
| "logits/rejected": -0.4164149761199951, | |
| "logps/chosen": -5.277183532714844, | |
| "logps/rejected": -42.28554916381836, | |
| "loss": 0.6526207327842712, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4348045885562897, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10670876502990723, | |
| "rewards/margins": 2.7690269947052, | |
| "rewards/rejected": -2.662318468093872, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.3905160390516039, | |
| "grad_norm": 2.253504753112793, | |
| "learning_rate": 0.00018870345071991663, | |
| "logits/chosen": -0.3795526325702667, | |
| "logits/rejected": -0.4494696855545044, | |
| "logps/chosen": -4.6198410987854, | |
| "logps/rejected": -34.95786666870117, | |
| "loss": 0.5223369598388672, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.29292282462120056, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.05781913921236992, | |
| "rewards/margins": 2.233022928237915, | |
| "rewards/rejected": -2.175203800201416, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.3927475592747559, | |
| "grad_norm": 4.090317726135254, | |
| "learning_rate": 0.00018853240211468944, | |
| "logits/chosen": -0.33655816316604614, | |
| "logits/rejected": -0.3891099691390991, | |
| "logps/chosen": -12.897551536560059, | |
| "logps/rejected": -34.91562271118164, | |
| "loss": 0.9967415928840637, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5328224301338196, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0005232337862253189, | |
| "rewards/margins": 1.7757031917572021, | |
| "rewards/rejected": -1.7762264013290405, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.39497907949790795, | |
| "grad_norm": 1.5479252338409424, | |
| "learning_rate": 0.0001883601469676414, | |
| "logits/chosen": -0.31817540526390076, | |
| "logits/rejected": -0.4586165249347687, | |
| "logps/chosen": -4.228600025177002, | |
| "logps/rejected": -44.335289001464844, | |
| "loss": 0.5654776096343994, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.354885458946228, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.04608811438083649, | |
| "rewards/margins": 2.883877754211426, | |
| "rewards/rejected": -2.83778977394104, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.39721059972106, | |
| "grad_norm": 1.458658218383789, | |
| "learning_rate": 0.00018818668762630888, | |
| "logits/chosen": -0.3560311794281006, | |
| "logits/rejected": -0.46038633584976196, | |
| "logps/chosen": -6.351040363311768, | |
| "logps/rejected": -38.50391387939453, | |
| "loss": 0.5693007111549377, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3589138686656952, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06642849743366241, | |
| "rewards/margins": 2.5289833545684814, | |
| "rewards/rejected": -2.462554693222046, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.39944211994421197, | |
| "grad_norm": 1.4788439273834229, | |
| "learning_rate": 0.00018801202645463947, | |
| "logits/chosen": -0.44740062952041626, | |
| "logits/rejected": -0.48686325550079346, | |
| "logps/chosen": -7.422541618347168, | |
| "logps/rejected": -34.7234001159668, | |
| "loss": 0.7467449903488159, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5351516008377075, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2607961595058441, | |
| "rewards/margins": 2.635673999786377, | |
| "rewards/rejected": -2.374877691268921, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.401673640167364, | |
| "grad_norm": 1.2784523963928223, | |
| "learning_rate": 0.00018783616583295943, | |
| "logits/chosen": -0.34507742524147034, | |
| "logits/rejected": -0.46668770909309387, | |
| "logps/chosen": -4.764893531799316, | |
| "logps/rejected": -44.04815673828125, | |
| "loss": 0.49975255131721497, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3011859357357025, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.152861088514328, | |
| "rewards/margins": 2.924600124359131, | |
| "rewards/rejected": -2.7717387676239014, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.40390516039051605, | |
| "grad_norm": 1.7386562824249268, | |
| "learning_rate": 0.0001876591081579415, | |
| "logits/chosen": -0.38848260045051575, | |
| "logits/rejected": -0.48753347992897034, | |
| "logps/chosen": -5.946084499359131, | |
| "logps/rejected": -40.89453125, | |
| "loss": 0.59507155418396, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.37911903858184814, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1187826544046402, | |
| "rewards/margins": 2.863964319229126, | |
| "rewards/rejected": -2.7451813220977783, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.4061366806136681, | |
| "grad_norm": 1.747938632965088, | |
| "learning_rate": 0.0001874808558425722, | |
| "logits/chosen": -0.3996775150299072, | |
| "logits/rejected": -0.4858594536781311, | |
| "logps/chosen": -8.173686027526855, | |
| "logps/rejected": -36.68798065185547, | |
| "loss": 0.7136989831924438, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4385717213153839, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.21724800765514374, | |
| "rewards/margins": 2.21327543258667, | |
| "rewards/rejected": -1.9960275888442993, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.40836820083682007, | |
| "grad_norm": 2.1921677589416504, | |
| "learning_rate": 0.00018730141131611882, | |
| "logits/chosen": -0.3768147826194763, | |
| "logits/rejected": -0.4843496084213257, | |
| "logps/chosen": -7.464463233947754, | |
| "logps/rejected": -37.9464111328125, | |
| "loss": 0.744111180305481, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.43925032019615173, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.062185730785131454, | |
| "rewards/margins": 2.2055001258850098, | |
| "rewards/rejected": -2.1433143615722656, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.4105997210599721, | |
| "grad_norm": 3.3944175243377686, | |
| "learning_rate": 0.0001871207770240965, | |
| "logits/chosen": -0.3745571970939636, | |
| "logits/rejected": -0.5446013808250427, | |
| "logps/chosen": -6.670903205871582, | |
| "logps/rejected": -52.90716552734375, | |
| "loss": 0.8081664443016052, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.546490490436554, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.06610552966594696, | |
| "rewards/margins": 3.103334426879883, | |
| "rewards/rejected": -3.037229061126709, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.41283124128312415, | |
| "grad_norm": 1.7184181213378906, | |
| "learning_rate": 0.00018693895542823476, | |
| "logits/chosen": -0.42309850454330444, | |
| "logits/rejected": -0.5455373525619507, | |
| "logps/chosen": -4.061583518981934, | |
| "logps/rejected": -46.45550537109375, | |
| "loss": 0.5212042331695557, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3185817003250122, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.06332439184188843, | |
| "rewards/margins": 3.2307968139648438, | |
| "rewards/rejected": -3.1674723625183105, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.41506276150627613, | |
| "grad_norm": 2.1810686588287354, | |
| "learning_rate": 0.00018675594900644394, | |
| "logits/chosen": -0.43507513403892517, | |
| "logits/rejected": -0.5661131739616394, | |
| "logps/chosen": -7.813204765319824, | |
| "logps/rejected": -47.85923385620117, | |
| "loss": 0.6977582573890686, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4816473722457886, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.05514959990978241, | |
| "rewards/margins": 3.3984975814819336, | |
| "rewards/rejected": -3.3433480262756348, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.4172942817294282, | |
| "grad_norm": 8.446174621582031, | |
| "learning_rate": 0.0001865717602527816, | |
| "logits/chosen": -0.3857502043247223, | |
| "logits/rejected": -0.5707287788391113, | |
| "logps/chosen": -5.875633239746094, | |
| "logps/rejected": -52.29627990722656, | |
| "loss": 0.8916729688644409, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6320705413818359, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10125800967216492, | |
| "rewards/margins": 3.7010817527770996, | |
| "rewards/rejected": -3.599823474884033, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.4195258019525802, | |
| "grad_norm": 1.2875564098358154, | |
| "learning_rate": 0.00018638639167741834, | |
| "logits/chosen": -0.45664966106414795, | |
| "logits/rejected": -0.6208757162094116, | |
| "logps/chosen": -6.463584899902344, | |
| "logps/rejected": -63.02524185180664, | |
| "loss": 0.5230106115341187, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.38262802362442017, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.25487378239631653, | |
| "rewards/margins": 4.994178295135498, | |
| "rewards/rejected": -4.739304065704346, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.4217573221757322, | |
| "grad_norm": 2.2951433658599854, | |
| "learning_rate": 0.00018619984580660367, | |
| "logits/chosen": -0.4468421936035156, | |
| "logits/rejected": -0.590311586856842, | |
| "logps/chosen": -7.629635334014893, | |
| "logps/rejected": -60.66893768310547, | |
| "loss": 0.6314592361450195, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4014724791049957, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.0873238816857338, | |
| "rewards/margins": 4.23132848739624, | |
| "rewards/rejected": -4.318652629852295, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.42398884239888424, | |
| "grad_norm": 3.432699680328369, | |
| "learning_rate": 0.00018601212518263156, | |
| "logits/chosen": -0.4163021147251129, | |
| "logits/rejected": -0.5166957378387451, | |
| "logps/chosen": -10.489439010620117, | |
| "logps/rejected": -59.12989044189453, | |
| "loss": 0.9744394421577454, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.7091968655586243, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.017084941267967224, | |
| "rewards/margins": 4.347151279449463, | |
| "rewards/rejected": -4.330066680908203, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.4262203626220363, | |
| "grad_norm": 3.6154932975769043, | |
| "learning_rate": 0.00018582323236380588, | |
| "logits/chosen": -0.5206790566444397, | |
| "logits/rejected": -0.5340564250946045, | |
| "logps/chosen": -14.040782928466797, | |
| "logps/rejected": -46.77815628051758, | |
| "loss": 1.0751701593399048, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.665191113948822, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.24230876564979553, | |
| "rewards/margins": 3.153132438659668, | |
| "rewards/rejected": -3.3954415321350098, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.42845188284518826, | |
| "grad_norm": 8.427726745605469, | |
| "learning_rate": 0.00018563316992440543, | |
| "logits/chosen": -0.4730026423931122, | |
| "logits/rejected": -0.6191343069076538, | |
| "logps/chosen": -6.7660651206970215, | |
| "logps/rejected": -55.98576354980469, | |
| "loss": 0.8084225058555603, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5363692045211792, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.10752980411052704, | |
| "rewards/margins": 3.833192825317383, | |
| "rewards/rejected": -3.940722703933716, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.4306834030683403, | |
| "grad_norm": 2.5356807708740234, | |
| "learning_rate": 0.00018544194045464886, | |
| "logits/chosen": -0.41117027401924133, | |
| "logits/rejected": -0.5410706400871277, | |
| "logps/chosen": -6.973834991455078, | |
| "logps/rejected": -47.055511474609375, | |
| "loss": 0.7811009883880615, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5517580509185791, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13715188205242157, | |
| "rewards/margins": 3.0469465255737305, | |
| "rewards/rejected": -2.909794330596924, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.010692 | |
| }, | |
| { | |
| "epoch": 0.43291492329149234, | |
| "grad_norm": 1.7070624828338623, | |
| "learning_rate": 0.00018524954656065946, | |
| "logits/chosen": -0.46515780687332153, | |
| "logits/rejected": -0.5741381645202637, | |
| "logps/chosen": -7.333560943603516, | |
| "logps/rejected": -46.890380859375, | |
| "loss": 0.46373608708381653, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3009029030799866, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09283138811588287, | |
| "rewards/margins": 3.2314822673797607, | |
| "rewards/rejected": -3.138651132583618, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.4351464435146444, | |
| "grad_norm": 2.165066957473755, | |
| "learning_rate": 0.00018505599086442956, | |
| "logits/chosen": -0.4237922728061676, | |
| "logits/rejected": -0.6133349537849426, | |
| "logps/chosen": -2.157940626144409, | |
| "logps/rejected": -44.79521942138672, | |
| "loss": 0.48500534892082214, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.28576743602752686, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1598954200744629, | |
| "rewards/margins": 2.9778366088867188, | |
| "rewards/rejected": -2.817941188812256, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.43737796373779636, | |
| "grad_norm": 2.6087758541107178, | |
| "learning_rate": 0.0001848612760037848, | |
| "logits/chosen": -0.42983922362327576, | |
| "logits/rejected": -0.5865707397460938, | |
| "logps/chosen": -4.183155536651611, | |
| "logps/rejected": -44.91338348388672, | |
| "loss": 0.4380960762500763, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.22082072496414185, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1885657161474228, | |
| "rewards/margins": 2.626762628555298, | |
| "rewards/rejected": -2.438196897506714, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.4396094839609484, | |
| "grad_norm": 2.3417139053344727, | |
| "learning_rate": 0.0001846654046323482, | |
| "logits/chosen": -0.4529270827770233, | |
| "logits/rejected": -0.5250231027603149, | |
| "logps/chosen": -10.214118957519531, | |
| "logps/rejected": -33.07242202758789, | |
| "loss": 0.9449623823165894, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6152971982955933, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.03806466981768608, | |
| "rewards/margins": 1.6490262746810913, | |
| "rewards/rejected": -1.6870909929275513, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.44184100418410044, | |
| "grad_norm": 2.435980796813965, | |
| "learning_rate": 0.0001844683794195041, | |
| "logits/chosen": -0.41686204075813293, | |
| "logits/rejected": -0.5872527956962585, | |
| "logps/chosen": -5.5450968742370605, | |
| "logps/rejected": -41.29132843017578, | |
| "loss": 0.6443852782249451, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3510324954986572, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.10375159978866577, | |
| "rewards/margins": 2.4684395790100098, | |
| "rewards/rejected": -2.364687919616699, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.4440725244072524, | |
| "grad_norm": 2.279975414276123, | |
| "learning_rate": 0.00018427020305036157, | |
| "logits/chosen": -0.4846893548965454, | |
| "logits/rejected": -0.5544926524162292, | |
| "logps/chosen": -5.250210762023926, | |
| "logps/rejected": -37.56634521484375, | |
| "loss": 0.6850971579551697, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3965678811073303, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.009095368906855583, | |
| "rewards/margins": 2.2770018577575684, | |
| "rewards/rejected": -2.267906427383423, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.010693 | |
| }, | |
| { | |
| "epoch": 0.44630404463040446, | |
| "grad_norm": 3.310929298400879, | |
| "learning_rate": 0.00018407087822571794, | |
| "logits/chosen": -0.45392054319381714, | |
| "logits/rejected": -0.5642043352127075, | |
| "logps/chosen": -9.782092094421387, | |
| "logps/rejected": -40.09915542602539, | |
| "loss": 0.8508836030960083, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6215177178382874, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1146484911441803, | |
| "rewards/margins": 2.442267656326294, | |
| "rewards/rejected": -2.3276190757751465, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.4485355648535565, | |
| "grad_norm": 2.2623071670532227, | |
| "learning_rate": 0.00018387040766202202, | |
| "logits/chosen": -0.45955681800842285, | |
| "logits/rejected": -0.5978164672851562, | |
| "logps/chosen": -9.393783569335938, | |
| "logps/rejected": -52.4150390625, | |
| "loss": 0.6487902998924255, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4702387750148773, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14986836910247803, | |
| "rewards/margins": 3.318939208984375, | |
| "rewards/rejected": -3.1690707206726074, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.010683 | |
| }, | |
| { | |
| "epoch": 0.4507670850767085, | |
| "grad_norm": 1.4719666242599487, | |
| "learning_rate": 0.00018366879409133702, | |
| "logits/chosen": -0.5009268522262573, | |
| "logits/rejected": -0.625489354133606, | |
| "logps/chosen": -7.751692771911621, | |
| "logps/rejected": -50.78370666503906, | |
| "loss": 0.5859130620956421, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39871278405189514, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10605036467313766, | |
| "rewards/margins": 3.2280044555664062, | |
| "rewards/rejected": -3.1219542026519775, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.010683 | |
| }, | |
| { | |
| "epoch": 0.4529986052998605, | |
| "grad_norm": 3.2725584506988525, | |
| "learning_rate": 0.00018346604026130335, | |
| "logits/chosen": -0.5253587961196899, | |
| "logits/rejected": -0.6153156161308289, | |
| "logps/chosen": -7.448980331420898, | |
| "logps/rejected": -37.25505828857422, | |
| "loss": 0.8574545383453369, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5657089352607727, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.08424842357635498, | |
| "rewards/margins": 2.4470019340515137, | |
| "rewards/rejected": -2.3627536296844482, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.010683 | |
| }, | |
| { | |
| "epoch": 0.45523012552301256, | |
| "grad_norm": 1.6742641925811768, | |
| "learning_rate": 0.00018326214893510113, | |
| "logits/chosen": -0.5298970937728882, | |
| "logits/rejected": -0.5919500589370728, | |
| "logps/chosen": -6.125566005706787, | |
| "logps/rejected": -37.60496139526367, | |
| "loss": 0.637344479560852, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3929066061973572, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.13108696043491364, | |
| "rewards/margins": 2.768951654434204, | |
| "rewards/rejected": -2.637864589691162, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.45746164574616455, | |
| "grad_norm": 1.8297412395477295, | |
| "learning_rate": 0.00018305712289141263, | |
| "logits/chosen": -0.5556704998016357, | |
| "logits/rejected": -0.6641337871551514, | |
| "logps/chosen": -7.0842132568359375, | |
| "logps/rejected": -43.63640213012695, | |
| "loss": 0.611258327960968, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3571435213088989, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.08243419229984283, | |
| "rewards/margins": 2.901592969894409, | |
| "rewards/rejected": -2.8191587924957275, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.4596931659693166, | |
| "grad_norm": 2.103322982788086, | |
| "learning_rate": 0.00018285096492438424, | |
| "logits/chosen": -0.5411264896392822, | |
| "logits/rejected": -0.6788846254348755, | |
| "logps/chosen": -7.095435619354248, | |
| "logps/rejected": -55.614654541015625, | |
| "loss": 0.5769423842430115, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3610311448574066, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.028350576758384705, | |
| "rewards/margins": 3.771873950958252, | |
| "rewards/rejected": -3.743523120880127, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.4619246861924686, | |
| "grad_norm": 5.2644124031066895, | |
| "learning_rate": 0.00018264367784358854, | |
| "logits/chosen": -0.5137989521026611, | |
| "logits/rejected": -0.6350421905517578, | |
| "logps/chosen": -8.56877326965332, | |
| "logps/rejected": -47.056922912597656, | |
| "loss": 0.8458958268165588, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6215453743934631, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1831740289926529, | |
| "rewards/margins": 3.3318536281585693, | |
| "rewards/rejected": -3.148679494857788, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.46415620641562066, | |
| "grad_norm": 2.3040452003479004, | |
| "learning_rate": 0.00018243526447398595, | |
| "logits/chosen": -0.5189839005470276, | |
| "logits/rejected": -0.6215395927429199, | |
| "logps/chosen": -8.22704792022705, | |
| "logps/rejected": -45.81852340698242, | |
| "loss": 0.6660462617874146, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.42924296855926514, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.015878167003393173, | |
| "rewards/margins": 3.395660877227783, | |
| "rewards/rejected": -3.3797831535339355, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.46638772663877265, | |
| "grad_norm": 4.965414047241211, | |
| "learning_rate": 0.00018222572765588625, | |
| "logits/chosen": -0.4948608875274658, | |
| "logits/rejected": -0.5670303106307983, | |
| "logps/chosen": -14.887557983398438, | |
| "logps/rejected": -48.515113830566406, | |
| "loss": 0.8501808643341064, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5177828669548035, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.011799663305282593, | |
| "rewards/margins": 3.1876440048217773, | |
| "rewards/rejected": -3.175844192504883, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4686192468619247, | |
| "grad_norm": 2.125880479812622, | |
| "learning_rate": 0.00018201507024490988, | |
| "logits/chosen": -0.4645600914955139, | |
| "logits/rejected": -0.5849769711494446, | |
| "logps/chosen": -14.342391967773438, | |
| "logps/rejected": -53.85160446166992, | |
| "loss": 0.7610176205635071, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.60414057970047, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1484633982181549, | |
| "rewards/margins": 3.265408992767334, | |
| "rewards/rejected": -3.11694598197937, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4708507670850767, | |
| "grad_norm": 1.3584539890289307, | |
| "learning_rate": 0.0001818032951119489, | |
| "logits/chosen": -0.4379713833332062, | |
| "logits/rejected": -0.6403225660324097, | |
| "logps/chosen": -3.4099626541137695, | |
| "logps/rejected": -55.08962631225586, | |
| "loss": 0.4291754364967346, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.28185123205184937, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2514503002166748, | |
| "rewards/margins": 3.88580584526062, | |
| "rewards/rejected": -3.6343557834625244, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4730822873082287, | |
| "grad_norm": 1.7748886346817017, | |
| "learning_rate": 0.00018159040514312803, | |
| "logits/chosen": -0.5069133043289185, | |
| "logits/rejected": -0.5805174708366394, | |
| "logps/chosen": -8.58336067199707, | |
| "logps/rejected": -35.97822189331055, | |
| "loss": 0.663266658782959, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3847760558128357, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.2307383120059967, | |
| "rewards/margins": 2.5746662616729736, | |
| "rewards/rejected": -2.343928098678589, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.47531380753138075, | |
| "grad_norm": 1.843264102935791, | |
| "learning_rate": 0.00018137640323976536, | |
| "logits/chosen": -0.4634440243244171, | |
| "logits/rejected": -0.5595231056213379, | |
| "logps/chosen": -12.369077682495117, | |
| "logps/rejected": -49.64701843261719, | |
| "loss": 0.7064059972763062, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5452557802200317, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.06534570455551147, | |
| "rewards/margins": 3.548327684402466, | |
| "rewards/rejected": -3.4829816818237305, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4775453277545328, | |
| "grad_norm": 3.4433913230895996, | |
| "learning_rate": 0.00018116129231833249, | |
| "logits/chosen": -0.4008879065513611, | |
| "logits/rejected": -0.5341296195983887, | |
| "logps/chosen": -8.161286354064941, | |
| "logps/rejected": -41.809959411621094, | |
| "loss": 0.7387677431106567, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4233713746070862, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.04444505646824837, | |
| "rewards/margins": 2.688593626022339, | |
| "rewards/rejected": -2.644148588180542, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4797768479776848, | |
| "grad_norm": 2.6310174465179443, | |
| "learning_rate": 0.00018094507531041517, | |
| "logits/chosen": -0.4581325352191925, | |
| "logits/rejected": -0.5395053625106812, | |
| "logps/chosen": -12.050057411193848, | |
| "logps/rejected": -46.67640686035156, | |
| "loss": 0.6482417583465576, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4028882384300232, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.03946290165185928, | |
| "rewards/margins": 3.062953233718872, | |
| "rewards/rejected": -3.0234906673431396, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4820083682008368, | |
| "grad_norm": 2.039609432220459, | |
| "learning_rate": 0.00018072775516267306, | |
| "logits/chosen": -0.40940549969673157, | |
| "logits/rejected": -0.5348517894744873, | |
| "logps/chosen": -5.345945835113525, | |
| "logps/rejected": -55.2205696105957, | |
| "loss": 0.588547945022583, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.35309699177742004, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.013576401397585869, | |
| "rewards/margins": 3.3509364128112793, | |
| "rewards/rejected": -3.33735990524292, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.48423988842398885, | |
| "grad_norm": 1.844130039215088, | |
| "learning_rate": 0.00018050933483679976, | |
| "logits/chosen": -0.388172447681427, | |
| "logits/rejected": -0.5932977199554443, | |
| "logps/chosen": -7.16074800491333, | |
| "logps/rejected": -57.54563903808594, | |
| "loss": 0.5982820987701416, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3665384352207184, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.12162206321954727, | |
| "rewards/margins": 3.5915048122406006, | |
| "rewards/rejected": -3.4698829650878906, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4864714086471409, | |
| "grad_norm": 3.176985263824463, | |
| "learning_rate": 0.0001802898173094824, | |
| "logits/chosen": -0.4476504623889923, | |
| "logits/rejected": -0.6101452112197876, | |
| "logps/chosen": -8.568498611450195, | |
| "logps/rejected": -55.76399612426758, | |
| "loss": 0.759227454662323, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5219362378120422, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.05749676004052162, | |
| "rewards/margins": 4.200704574584961, | |
| "rewards/rejected": -4.143207550048828, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.4887029288702929, | |
| "grad_norm": 8.979230880737305, | |
| "learning_rate": 0.0001800692055723609, | |
| "logits/chosen": -0.5705654621124268, | |
| "logits/rejected": -0.6717063188552856, | |
| "logps/chosen": -9.38418197631836, | |
| "logps/rejected": -48.490394592285156, | |
| "loss": 0.9973833560943604, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.765608549118042, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.36961740255355835, | |
| "rewards/margins": 3.4103264808654785, | |
| "rewards/rejected": -3.7799437046051025, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.4909344490934449, | |
| "grad_norm": 13.02912425994873, | |
| "learning_rate": 0.0001798475026319875, | |
| "logits/chosen": -0.48003196716308594, | |
| "logits/rejected": -0.6781996488571167, | |
| "logps/chosen": -7.269015789031982, | |
| "logps/rejected": -62.30265808105469, | |
| "loss": 0.7909015417098999, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.53118896484375, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.15388834476470947, | |
| "rewards/margins": 4.509274959564209, | |
| "rewards/rejected": -4.663163185119629, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.010686 | |
| }, | |
| { | |
| "epoch": 0.49316596931659695, | |
| "grad_norm": 6.664190292358398, | |
| "learning_rate": 0.00017962471150978563, | |
| "logits/chosen": -0.5324437022209167, | |
| "logits/rejected": -0.6654635667800903, | |
| "logps/chosen": -7.194028377532959, | |
| "logps/rejected": -59.914695739746094, | |
| "loss": 0.8783823251724243, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6288973689079285, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.018478773534297943, | |
| "rewards/margins": 4.640980243682861, | |
| "rewards/rejected": -4.622502326965332, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.49539748953974894, | |
| "grad_norm": 2.010087251663208, | |
| "learning_rate": 0.00017940083524200858, | |
| "logits/chosen": -0.43658989667892456, | |
| "logits/rejected": -0.5585737228393555, | |
| "logps/chosen": -8.627237319946289, | |
| "logps/rejected": -48.756126403808594, | |
| "loss": 0.5573357939720154, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39346298575401306, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.34565243124961853, | |
| "rewards/margins": 3.3448474407196045, | |
| "rewards/rejected": -2.999195098876953, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.497629009762901, | |
| "grad_norm": 2.036358118057251, | |
| "learning_rate": 0.00017917587687969847, | |
| "logits/chosen": -0.434632807970047, | |
| "logits/rejected": -0.5482152104377747, | |
| "logps/chosen": -11.499567985534668, | |
| "logps/rejected": -41.673377990722656, | |
| "loss": 0.8241864442825317, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6470968723297119, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23597590625286102, | |
| "rewards/margins": 2.9532856941223145, | |
| "rewards/rejected": -2.7173097133636475, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.499860529986053, | |
| "grad_norm": 2.800816297531128, | |
| "learning_rate": 0.00017894983948864431, | |
| "logits/chosen": -0.42586764693260193, | |
| "logits/rejected": -0.5355687141418457, | |
| "logps/chosen": -8.567970275878906, | |
| "logps/rejected": -38.82350158691406, | |
| "loss": 0.8209130167961121, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5143148899078369, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0072904713451862335, | |
| "rewards/margins": 2.314070224761963, | |
| "rewards/rejected": -2.3213610649108887, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.502092050209205, | |
| "grad_norm": 3.365342140197754, | |
| "learning_rate": 0.0001787227261493405, | |
| "logits/chosen": -0.423734188079834, | |
| "logits/rejected": -0.568479061126709, | |
| "logps/chosen": -7.375796794891357, | |
| "logps/rejected": -49.31288146972656, | |
| "loss": 0.7071059942245483, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.46694087982177734, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.004096744582056999, | |
| "rewards/margins": 3.2242605686187744, | |
| "rewards/rejected": -3.2283570766448975, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.5043235704323571, | |
| "grad_norm": 1.2737809419631958, | |
| "learning_rate": 0.0001784945399569447, | |
| "logits/chosen": -0.36446237564086914, | |
| "logits/rejected": -0.5933336615562439, | |
| "logps/chosen": -3.509737730026245, | |
| "logps/rejected": -58.02750778198242, | |
| "loss": 0.33625951409339905, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.22468024492263794, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18253092467784882, | |
| "rewards/margins": 3.6850192546844482, | |
| "rewards/rejected": -3.502488136291504, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.5065550906555091, | |
| "grad_norm": 2.068448305130005, | |
| "learning_rate": 0.00017826528402123564, | |
| "logits/chosen": -0.42301344871520996, | |
| "logits/rejected": -0.5985809564590454, | |
| "logps/chosen": -2.5439209938049316, | |
| "logps/rejected": -45.29689025878906, | |
| "loss": 0.36974459886550903, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.231589674949646, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.2267550826072693, | |
| "rewards/margins": 3.147808790206909, | |
| "rewards/rejected": -2.9210541248321533, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.010687 | |
| }, | |
| { | |
| "epoch": 0.5087866108786611, | |
| "grad_norm": 1.3184460401535034, | |
| "learning_rate": 0.00017803496146657084, | |
| "logits/chosen": -0.4008505344390869, | |
| "logits/rejected": -0.592756450176239, | |
| "logps/chosen": -6.708431243896484, | |
| "logps/rejected": -48.843502044677734, | |
| "loss": 0.6300328969955444, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.46876925230026245, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.32074451446533203, | |
| "rewards/margins": 3.1505868434906006, | |
| "rewards/rejected": -2.8298423290252686, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.5110181311018132, | |
| "grad_norm": 2.306436538696289, | |
| "learning_rate": 0.00017780357543184397, | |
| "logits/chosen": -0.4543289244174957, | |
| "logits/rejected": -0.5702416300773621, | |
| "logps/chosen": -7.456311225891113, | |
| "logps/rejected": -55.43143081665039, | |
| "loss": 0.6797499060630798, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.43957531452178955, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.061677221208810806, | |
| "rewards/margins": 4.144193649291992, | |
| "rewards/rejected": -4.082516670227051, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.5132496513249651, | |
| "grad_norm": 5.570302963256836, | |
| "learning_rate": 0.000177571129070442, | |
| "logits/chosen": -0.5052129626274109, | |
| "logits/rejected": -0.5332801342010498, | |
| "logps/chosen": -10.987539291381836, | |
| "logps/rejected": -43.629920959472656, | |
| "loss": 0.8144917488098145, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5699902772903442, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.07897716760635376, | |
| "rewards/margins": 2.79160213470459, | |
| "rewards/rejected": -2.870579481124878, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.010688 | |
| }, | |
| { | |
| "epoch": 0.5154811715481171, | |
| "grad_norm": 1.758008360862732, | |
| "learning_rate": 0.00017733762555020234, | |
| "logits/chosen": -0.49660688638687134, | |
| "logits/rejected": -0.5793140530586243, | |
| "logps/chosen": -7.395486354827881, | |
| "logps/rejected": -45.230892181396484, | |
| "loss": 0.4777700901031494, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3038936257362366, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.13568957149982452, | |
| "rewards/margins": 3.222832202911377, | |
| "rewards/rejected": -3.0871424674987793, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5177126917712692, | |
| "grad_norm": 1.362999439239502, | |
| "learning_rate": 0.0001771030680533697, | |
| "logits/chosen": -0.4924534261226654, | |
| "logits/rejected": -0.6207826733589172, | |
| "logps/chosen": -4.7806715965271, | |
| "logps/rejected": -48.792823791503906, | |
| "loss": 0.4094929099082947, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.2229592204093933, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.2055450677871704, | |
| "rewards/margins": 3.34159779548645, | |
| "rewards/rejected": -3.1360526084899902, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5199442119944212, | |
| "grad_norm": 1.446892261505127, | |
| "learning_rate": 0.00017686745977655254, | |
| "logits/chosen": -0.5510218739509583, | |
| "logits/rejected": -0.5702377557754517, | |
| "logps/chosen": -7.457989692687988, | |
| "logps/rejected": -40.870391845703125, | |
| "loss": 0.6166619658470154, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.37686091661453247, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.019258877262473106, | |
| "rewards/margins": 2.9649226665496826, | |
| "rewards/rejected": -2.9456636905670166, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5221757322175732, | |
| "grad_norm": 2.5673022270202637, | |
| "learning_rate": 0.00017663080393067967, | |
| "logits/chosen": -0.4004722833633423, | |
| "logits/rejected": -0.6144905090332031, | |
| "logps/chosen": -8.209660530090332, | |
| "logps/rejected": -64.06336975097656, | |
| "loss": 0.4909789562225342, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.31386396288871765, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20118242502212524, | |
| "rewards/margins": 4.270333290100098, | |
| "rewards/rejected": -4.069150447845459, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5244072524407253, | |
| "grad_norm": 4.679993152618408, | |
| "learning_rate": 0.00017639310374095642, | |
| "logits/chosen": -0.47914889454841614, | |
| "logits/rejected": -0.6579112410545349, | |
| "logps/chosen": -8.027458190917969, | |
| "logps/rejected": -49.39167022705078, | |
| "loss": 0.6046391129493713, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4407365620136261, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.19219349324703217, | |
| "rewards/margins": 3.430323362350464, | |
| "rewards/rejected": -3.2381296157836914, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5266387726638773, | |
| "grad_norm": 2.3275198936462402, | |
| "learning_rate": 0.00017615436244682067, | |
| "logits/chosen": -0.48543357849121094, | |
| "logits/rejected": -0.6728047132492065, | |
| "logps/chosen": -5.8822832107543945, | |
| "logps/rejected": -53.12212371826172, | |
| "loss": 0.7272516489028931, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5779345035552979, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.11761157214641571, | |
| "rewards/margins": 3.723693370819092, | |
| "rewards/rejected": -3.606081962585449, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5288702928870292, | |
| "grad_norm": 1.9778822660446167, | |
| "learning_rate": 0.0001759145833018988, | |
| "logits/chosen": -0.5121138095855713, | |
| "logits/rejected": -0.581526517868042, | |
| "logps/chosen": -11.055684089660645, | |
| "logps/rejected": -48.428466796875, | |
| "loss": 0.6768224835395813, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4439318776130676, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07668354362249374, | |
| "rewards/margins": 3.0230700969696045, | |
| "rewards/rejected": -2.9463863372802734, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5311018131101813, | |
| "grad_norm": 2.473088264465332, | |
| "learning_rate": 0.00017567376957396125, | |
| "logits/chosen": -0.4359075427055359, | |
| "logits/rejected": -0.6152986288070679, | |
| "logps/chosen": -8.427140235900879, | |
| "logps/rejected": -43.27656555175781, | |
| "loss": 0.8277904391288757, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5778707265853882, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.2914345860481262, | |
| "rewards/margins": 2.8861725330352783, | |
| "rewards/rejected": -2.594738006591797, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 4.2344560623168945, | |
| "learning_rate": 0.00017543192454487795, | |
| "logits/chosen": -0.5183901786804199, | |
| "logits/rejected": -0.648127555847168, | |
| "logps/chosen": -7.237810134887695, | |
| "logps/rejected": -46.60614776611328, | |
| "loss": 0.5062097311019897, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3680287003517151, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09910139441490173, | |
| "rewards/margins": 3.3295600414276123, | |
| "rewards/rejected": -3.2304584980010986, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5355648535564853, | |
| "grad_norm": 12.738329887390137, | |
| "learning_rate": 0.0001751890515105738, | |
| "logits/chosen": -0.5236122608184814, | |
| "logits/rejected": -0.6659674644470215, | |
| "logps/chosen": -6.250277042388916, | |
| "logps/rejected": -48.39547348022461, | |
| "loss": 0.8066755533218384, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5374718904495239, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.011939210817217827, | |
| "rewards/margins": 3.1737723350524902, | |
| "rewards/rejected": -3.1618332862854004, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5377963737796374, | |
| "grad_norm": 1.7081589698791504, | |
| "learning_rate": 0.00017494515378098347, | |
| "logits/chosen": -0.49652621150016785, | |
| "logits/rejected": -0.6365297436714172, | |
| "logps/chosen": -4.525838375091553, | |
| "logps/rejected": -44.274539947509766, | |
| "loss": 0.4856886863708496, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.26593509316444397, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.10261054337024689, | |
| "rewards/margins": 3.1593854427337646, | |
| "rewards/rejected": -3.056774616241455, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5400278940027894, | |
| "grad_norm": 1.5723114013671875, | |
| "learning_rate": 0.00017470023468000654, | |
| "logits/chosen": -0.5223122835159302, | |
| "logits/rejected": -0.6690611839294434, | |
| "logps/chosen": -3.2274744510650635, | |
| "logps/rejected": -53.48045349121094, | |
| "loss": 0.3347703516483307, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.19753773510456085, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1409139484167099, | |
| "rewards/margins": 3.965757369995117, | |
| "rewards/rejected": -3.824843406677246, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.010691 | |
| }, | |
| { | |
| "epoch": 0.5422594142259414, | |
| "grad_norm": 1.1658532619476318, | |
| "learning_rate": 0.00017445429754546209, | |
| "logits/chosen": -0.4327467083930969, | |
| "logits/rejected": -0.5850556492805481, | |
| "logps/chosen": -6.455155372619629, | |
| "logps/rejected": -53.67913055419922, | |
| "loss": 0.45557722449302673, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3267042934894562, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24175924062728882, | |
| "rewards/margins": 3.549290418624878, | |
| "rewards/rejected": -3.3075313568115234, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5444909344490935, | |
| "grad_norm": 1.9491972923278809, | |
| "learning_rate": 0.00017420734572904309, | |
| "logits/chosen": -0.4307960569858551, | |
| "logits/rejected": -0.6243136525154114, | |
| "logps/chosen": -5.606278419494629, | |
| "logps/rejected": -51.735652923583984, | |
| "loss": 0.5139089226722717, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3616556227207184, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1640806794166565, | |
| "rewards/margins": 3.619340419769287, | |
| "rewards/rejected": -3.4552597999572754, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5467224546722455, | |
| "grad_norm": 2.2012929916381836, | |
| "learning_rate": 0.00017395938259627102, | |
| "logits/chosen": -0.343536376953125, | |
| "logits/rejected": -0.569451630115509, | |
| "logps/chosen": -5.0532708168029785, | |
| "logps/rejected": -62.23390197753906, | |
| "loss": 0.3923553228378296, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.29478776454925537, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23885516822338104, | |
| "rewards/margins": 4.132390975952148, | |
| "rewards/rejected": -3.893535852432251, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5489539748953974, | |
| "grad_norm": 3.378282308578491, | |
| "learning_rate": 0.00017371041152644976, | |
| "logits/chosen": -0.4609750807285309, | |
| "logits/rejected": -0.6062232851982117, | |
| "logps/chosen": -6.916518211364746, | |
| "logps/rejected": -52.16080856323242, | |
| "loss": 0.6823198199272156, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.45661455392837524, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.3001694083213806, | |
| "rewards/margins": 3.915588855743408, | |
| "rewards/rejected": -3.6154191493988037, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.01069 | |
| }, | |
| { | |
| "epoch": 0.5511854951185495, | |
| "grad_norm": 2.7868404388427734, | |
| "learning_rate": 0.00017346043591261957, | |
| "logits/chosen": -0.4002017676830292, | |
| "logits/rejected": -0.6774240732192993, | |
| "logps/chosen": -7.5064496994018555, | |
| "logps/rejected": -64.324951171875, | |
| "loss": 0.5472509860992432, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4029460847377777, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.3002982437610626, | |
| "rewards/margins": 4.144438743591309, | |
| "rewards/rejected": -3.8441405296325684, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5534170153417015, | |
| "grad_norm": 2.1542208194732666, | |
| "learning_rate": 0.0001732094591615109, | |
| "logits/chosen": -0.34761539101600647, | |
| "logits/rejected": -0.6237728595733643, | |
| "logps/chosen": -8.17116641998291, | |
| "logps/rejected": -72.38832092285156, | |
| "loss": 0.5291301012039185, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3634389340877533, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2887139618396759, | |
| "rewards/margins": 4.893632888793945, | |
| "rewards/rejected": -4.604918956756592, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5556485355648536, | |
| "grad_norm": 5.7039337158203125, | |
| "learning_rate": 0.00017295748469349804, | |
| "logits/chosen": -0.44048506021499634, | |
| "logits/rejected": -0.7222636342048645, | |
| "logps/chosen": -7.497531890869141, | |
| "logps/rejected": -82.19099426269531, | |
| "loss": 0.7382796406745911, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6829304695129395, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09070631116628647, | |
| "rewards/margins": 6.177928924560547, | |
| "rewards/rejected": -6.087222099304199, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.010689 | |
| }, | |
| { | |
| "epoch": 0.5578800557880056, | |
| "grad_norm": 9.315430641174316, | |
| "learning_rate": 0.00017270451594255233, | |
| "logits/chosen": -0.5497281551361084, | |
| "logits/rejected": -0.6751365065574646, | |
| "logps/chosen": -8.304182052612305, | |
| "logps/rejected": -60.03815460205078, | |
| "loss": 0.5764181017875671, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4564261734485626, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.06676550954580307, | |
| "rewards/margins": 4.525730133056641, | |
| "rewards/rejected": -4.592494964599609, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.01069 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 896, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.379183154429952e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |