Instructions to use cragtmp/pairgt705r16-200 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/pairgt705r16-200 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/pairgt705r16-200") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.11157601115760112, | |
| "eval_steps": 300, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0022315202231520223, | |
| "grad_norm": 8.175573348999023, | |
| "learning_rate": 4.444444444444445e-06, | |
| "logits/chosen": -0.48349103331565857, | |
| "logits/rejected": -0.652603030204773, | |
| "logps/chosen": -8.859519004821777, | |
| "logps/rejected": -16.016435623168945, | |
| "loss": 1.3468515872955322, | |
| "memory(GiB)": 33.44, | |
| "nll_loss": 0.6537042856216431, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.010093 | |
| }, | |
| { | |
| "epoch": 0.004463040446304045, | |
| "grad_norm": 6.496051788330078, | |
| "learning_rate": 8.88888888888889e-06, | |
| "logits/chosen": -0.5174899101257324, | |
| "logits/rejected": -0.6262180805206299, | |
| "logps/chosen": -9.287378311157227, | |
| "logps/rejected": -13.981985092163086, | |
| "loss": 1.290852665901184, | |
| "memory(GiB)": 36.3, | |
| "nll_loss": 0.5977055430412292, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.010436 | |
| }, | |
| { | |
| "epoch": 0.0066945606694560665, | |
| "grad_norm": 5.3426923751831055, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "logits/chosen": -0.4254978895187378, | |
| "logits/rejected": -0.6118676662445068, | |
| "logps/chosen": -6.5775346755981445, | |
| "logps/rejected": -16.196733474731445, | |
| "loss": 1.1887776851654053, | |
| "memory(GiB)": 36.3, | |
| "nll_loss": 0.49580031633377075, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.0025197849608957767, | |
| "rewards/margins": 0.0005687186494469643, | |
| "rewards/rejected": -0.0030885031446814537, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.010535 | |
| }, | |
| { | |
| "epoch": 0.00892608089260809, | |
| "grad_norm": 5.717321395874023, | |
| "learning_rate": 1.777777777777778e-05, | |
| "logits/chosen": -0.5246356129646301, | |
| "logits/rejected": -0.651706337928772, | |
| "logps/chosen": -7.447962760925293, | |
| "logps/rejected": -16.996183395385742, | |
| "loss": 1.3215211629867554, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.632453203201294, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.004622042179107666, | |
| "rewards/margins": 0.008373789489269257, | |
| "rewards/rejected": -0.0037517473101615906, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.010586 | |
| }, | |
| { | |
| "epoch": 0.011157601115760111, | |
| "grad_norm": 7.188594341278076, | |
| "learning_rate": 2.2222222222222223e-05, | |
| "logits/chosen": -0.5062788128852844, | |
| "logits/rejected": -0.6033568382263184, | |
| "logps/chosen": -7.093954086303711, | |
| "logps/rejected": -15.186193466186523, | |
| "loss": 1.0765105485916138, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.4042052626609802, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.018988817930221558, | |
| "rewards/margins": 0.04282933473587036, | |
| "rewards/rejected": -0.023840520530939102, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.010619 | |
| }, | |
| { | |
| "epoch": 0.013389121338912133, | |
| "grad_norm": 3.8232157230377197, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "logits/chosen": -0.4826778173446655, | |
| "logits/rejected": -0.5863982439041138, | |
| "logps/chosen": -6.322361946105957, | |
| "logps/rejected": -16.8499755859375, | |
| "loss": 1.2770025730133057, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.6041065454483032, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.007987724617123604, | |
| "rewards/margins": 0.0449829027056694, | |
| "rewards/rejected": -0.03699517622590065, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.010645 | |
| }, | |
| { | |
| "epoch": 0.015620641562064157, | |
| "grad_norm": 3.0141377449035645, | |
| "learning_rate": 3.111111111111111e-05, | |
| "logits/chosen": -0.557126522064209, | |
| "logits/rejected": -0.6060188412666321, | |
| "logps/chosen": -5.420467853546143, | |
| "logps/rejected": -11.815977096557617, | |
| "loss": 1.1219334602355957, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.46769219636917114, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.010057949461042881, | |
| "rewards/margins": 0.10709290951490402, | |
| "rewards/rejected": -0.09703496098518372, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.010666 | |
| }, | |
| { | |
| "epoch": 0.01785216178521618, | |
| "grad_norm": 2.8756191730499268, | |
| "learning_rate": 3.555555555555556e-05, | |
| "logits/chosen": -0.5616711378097534, | |
| "logits/rejected": -0.6365323066711426, | |
| "logps/chosen": -6.283439636230469, | |
| "logps/rejected": -19.981098175048828, | |
| "loss": 0.8637306690216064, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.33207178115844727, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.011994147673249245, | |
| "rewards/margins": 0.4002670347690582, | |
| "rewards/rejected": -0.4122611880302429, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.010684 | |
| }, | |
| { | |
| "epoch": 0.0200836820083682, | |
| "grad_norm": 5.291012763977051, | |
| "learning_rate": 4e-05, | |
| "logits/chosen": -0.502879798412323, | |
| "logits/rejected": -0.5977268815040588, | |
| "logps/chosen": -16.167051315307617, | |
| "logps/rejected": -20.485633850097656, | |
| "loss": 1.618671178817749, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 1.0418576002120972, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.21173161268234253, | |
| "rewards/margins": 0.39757153391838074, | |
| "rewards/rejected": -0.6093031167984009, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.010694 | |
| }, | |
| { | |
| "epoch": 0.022315202231520222, | |
| "grad_norm": 5.504859447479248, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "logits/chosen": -0.4140257239341736, | |
| "logits/rejected": -0.5436943173408508, | |
| "logps/chosen": -10.317049026489258, | |
| "logps/rejected": -26.558115005493164, | |
| "loss": 1.271435260772705, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 0.6719653606414795, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.2977833151817322, | |
| "rewards/margins": 0.4953876733779907, | |
| "rewards/rejected": -0.7931710481643677, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.010695 | |
| }, | |
| { | |
| "epoch": 0.024546722454672244, | |
| "grad_norm": 8.8348970413208, | |
| "learning_rate": 4.888888888888889e-05, | |
| "logits/chosen": -0.4538601040840149, | |
| "logits/rejected": -0.5884804129600525, | |
| "logps/chosen": -15.600846290588379, | |
| "logps/rejected": -27.856977462768555, | |
| "loss": 1.6294305324554443, | |
| "memory(GiB)": 39.38, | |
| "nll_loss": 1.0609474182128906, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.48508310317993164, | |
| "rewards/margins": 0.41195282340049744, | |
| "rewards/rejected": -0.8970359563827515, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.0107 | |
| }, | |
| { | |
| "epoch": 0.026778242677824266, | |
| "grad_norm": 4.871168613433838, | |
| "learning_rate": 5.333333333333333e-05, | |
| "logits/chosen": -0.4462035596370697, | |
| "logits/rejected": -0.5622009634971619, | |
| "logps/chosen": -10.827975273132324, | |
| "logps/rejected": -27.8737850189209, | |
| "loss": 1.309844732284546, | |
| "memory(GiB)": 42.78, | |
| "nll_loss": 0.6817098259925842, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.34655484557151794, | |
| "rewards/margins": 0.38605934381484985, | |
| "rewards/rejected": -0.7326142191886902, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.010701 | |
| }, | |
| { | |
| "epoch": 0.02900976290097629, | |
| "grad_norm": 5.154696464538574, | |
| "learning_rate": 5.7777777777777776e-05, | |
| "logits/chosen": -0.45840126276016235, | |
| "logits/rejected": -0.5749193429946899, | |
| "logps/chosen": -9.034074783325195, | |
| "logps/rejected": -23.558507919311523, | |
| "loss": 1.3584285974502563, | |
| "memory(GiB)": 42.78, | |
| "nll_loss": 0.8017209768295288, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.15672500431537628, | |
| "rewards/margins": 0.44559869170188904, | |
| "rewards/rejected": -0.6023237109184265, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.010704 | |
| }, | |
| { | |
| "epoch": 0.031241283124128313, | |
| "grad_norm": 2.928802013397217, | |
| "learning_rate": 6.222222222222222e-05, | |
| "logits/chosen": -0.4339243173599243, | |
| "logits/rejected": -0.5222603678703308, | |
| "logps/chosen": -7.9224724769592285, | |
| "logps/rejected": -25.263307571411133, | |
| "loss": 1.176775574684143, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.548651397228241, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09932564944028854, | |
| "rewards/margins": 0.27659934759140015, | |
| "rewards/rejected": -0.3759249448776245, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.010698 | |
| }, | |
| { | |
| "epoch": 0.03347280334728033, | |
| "grad_norm": 1.9422496557235718, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.4753529131412506, | |
| "logits/rejected": -0.5179453492164612, | |
| "logps/chosen": -8.660318374633789, | |
| "logps/rejected": -16.743135452270508, | |
| "loss": 1.1362940073013306, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.5188332796096802, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.09274716675281525, | |
| "rewards/margins": 0.20326045155525208, | |
| "rewards/rejected": -0.29600760340690613, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.010702 | |
| }, | |
| { | |
| "epoch": 0.03570432357043236, | |
| "grad_norm": 1.7832196950912476, | |
| "learning_rate": 7.111111111111112e-05, | |
| "logits/chosen": -0.39417293667793274, | |
| "logits/rejected": -0.5316826701164246, | |
| "logps/chosen": -4.724964618682861, | |
| "logps/rejected": -19.69357681274414, | |
| "loss": 1.0538526773452759, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.4770840108394623, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.06691457331180573, | |
| "rewards/margins": 0.27725517749786377, | |
| "rewards/rejected": -0.21034058928489685, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.010702 | |
| }, | |
| { | |
| "epoch": 0.03793584379358438, | |
| "grad_norm": 1.5563856363296509, | |
| "learning_rate": 7.555555555555556e-05, | |
| "logits/chosen": -0.4563882350921631, | |
| "logits/rejected": -0.5541551113128662, | |
| "logps/chosen": -9.05321979522705, | |
| "logps/rejected": -18.82474708557129, | |
| "loss": 1.2152374982833862, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.6201823353767395, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.11768844723701477, | |
| "rewards/margins": 0.2521967887878418, | |
| "rewards/rejected": -0.13450834155082703, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.010706 | |
| }, | |
| { | |
| "epoch": 0.0401673640167364, | |
| "grad_norm": 1.9268314838409424, | |
| "learning_rate": 8e-05, | |
| "logits/chosen": -0.4476441740989685, | |
| "logits/rejected": -0.4938126504421234, | |
| "logps/chosen": -9.981496810913086, | |
| "logps/rejected": -14.752214431762695, | |
| "loss": 1.1654764413833618, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.46348586678504944, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.008895257487893105, | |
| "rewards/margins": 0.039339594542980194, | |
| "rewards/rejected": -0.030444344505667686, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.010707 | |
| }, | |
| { | |
| "epoch": 0.042398884239888426, | |
| "grad_norm": 1.6981456279754639, | |
| "learning_rate": 8.444444444444444e-05, | |
| "logits/chosen": -0.49693721532821655, | |
| "logits/rejected": -0.5383259057998657, | |
| "logps/chosen": -7.632569313049316, | |
| "logps/rejected": -17.26980209350586, | |
| "loss": 1.1578692197799683, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.5097256898880005, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.06525340676307678, | |
| "rewards/margins": 0.123507060110569, | |
| "rewards/rejected": -0.05825363099575043, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.010709 | |
| }, | |
| { | |
| "epoch": 0.044630404463040445, | |
| "grad_norm": 2.013322591781616, | |
| "learning_rate": 8.888888888888889e-05, | |
| "logits/chosen": -0.4885023236274719, | |
| "logits/rejected": -0.5652343034744263, | |
| "logps/chosen": -6.508520603179932, | |
| "logps/rejected": -13.635923385620117, | |
| "loss": 1.0892918109893799, | |
| "memory(GiB)": 46.23, | |
| "nll_loss": 0.45972177386283875, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.06720655411481857, | |
| "rewards/margins": 0.18712735176086426, | |
| "rewards/rejected": -0.11992079019546509, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.010713 | |
| }, | |
| { | |
| "epoch": 0.04686192468619247, | |
| "grad_norm": 1.775608777999878, | |
| "learning_rate": 9.333333333333334e-05, | |
| "logits/chosen": -0.4235825836658478, | |
| "logits/rejected": -0.4997040629386902, | |
| "logps/chosen": -7.756269454956055, | |
| "logps/rejected": -22.05597496032715, | |
| "loss": 1.1610935926437378, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5124741792678833, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.056686438620090485, | |
| "rewards/margins": 0.15342777967453003, | |
| "rewards/rejected": -0.09674134850502014, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.010711 | |
| }, | |
| { | |
| "epoch": 0.04909344490934449, | |
| "grad_norm": 1.6878494024276733, | |
| "learning_rate": 9.777777777777778e-05, | |
| "logits/chosen": -0.448173850774765, | |
| "logits/rejected": -0.46942824125289917, | |
| "logps/chosen": -9.774542808532715, | |
| "logps/rejected": -14.852673530578613, | |
| "loss": 1.1857895851135254, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5429187417030334, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.08716461062431335, | |
| "rewards/margins": 0.17264463007450104, | |
| "rewards/rejected": -0.08548003435134888, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.01071 | |
| }, | |
| { | |
| "epoch": 0.051324965132496514, | |
| "grad_norm": 1.9283621311187744, | |
| "learning_rate": 0.00010222222222222222, | |
| "logits/chosen": -0.4297652244567871, | |
| "logits/rejected": -0.5464367866516113, | |
| "logps/chosen": -7.680075168609619, | |
| "logps/rejected": -20.64339828491211, | |
| "loss": 1.1528663635253906, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.48048245906829834, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.05369298905134201, | |
| "rewards/margins": 0.09629381448030472, | |
| "rewards/rejected": -0.04260082542896271, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.01071 | |
| }, | |
| { | |
| "epoch": 0.05355648535564853, | |
| "grad_norm": 1.8897244930267334, | |
| "learning_rate": 0.00010666666666666667, | |
| "logits/chosen": -0.4073754847049713, | |
| "logits/rejected": -0.4649578034877777, | |
| "logps/chosen": -9.451826095581055, | |
| "logps/rejected": -20.540328979492188, | |
| "loss": 1.0510568618774414, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.431056946516037, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.055333852767944336, | |
| "rewards/margins": 0.23058435320854187, | |
| "rewards/rejected": -0.17525050044059753, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.010709 | |
| }, | |
| { | |
| "epoch": 0.05578800557880056, | |
| "grad_norm": 1.968520998954773, | |
| "learning_rate": 0.00011111111111111112, | |
| "logits/chosen": -0.4085446000099182, | |
| "logits/rejected": -0.49927735328674316, | |
| "logps/chosen": -9.85863971710205, | |
| "logps/rejected": -21.732637405395508, | |
| "loss": 1.166273593902588, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5423365831375122, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03325103968381882, | |
| "rewards/margins": 0.2285088747739792, | |
| "rewards/rejected": -0.19525781273841858, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.010709 | |
| }, | |
| { | |
| "epoch": 0.05801952580195258, | |
| "grad_norm": 3.0135302543640137, | |
| "learning_rate": 0.00011555555555555555, | |
| "logits/chosen": -0.44835054874420166, | |
| "logits/rejected": -0.5419439077377319, | |
| "logps/chosen": -4.6747965812683105, | |
| "logps/rejected": -18.435997009277344, | |
| "loss": 0.9960591793060303, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39432889223098755, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.017948223277926445, | |
| "rewards/margins": 0.27569395303726196, | |
| "rewards/rejected": -0.29364219307899475, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.010712 | |
| }, | |
| { | |
| "epoch": 0.0602510460251046, | |
| "grad_norm": 2.0994958877563477, | |
| "learning_rate": 0.00012, | |
| "logits/chosen": -0.4755466878414154, | |
| "logits/rejected": -0.513874888420105, | |
| "logps/chosen": -14.17818832397461, | |
| "logps/rejected": -15.192220687866211, | |
| "loss": 1.3128914833068848, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.732846736907959, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11946821957826614, | |
| "rewards/margins": 0.27503034472465515, | |
| "rewards/rejected": -0.1555621325969696, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.010714 | |
| }, | |
| { | |
| "epoch": 0.06248256624825663, | |
| "grad_norm": 2.619943857192993, | |
| "learning_rate": 0.00012444444444444444, | |
| "logits/chosen": -0.33525484800338745, | |
| "logits/rejected": -0.4649803340435028, | |
| "logps/chosen": -6.553568363189697, | |
| "logps/rejected": -23.942062377929688, | |
| "loss": 1.007144808769226, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4446461498737335, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.07584571838378906, | |
| "rewards/margins": 0.3631606996059418, | |
| "rewards/rejected": -0.2873149812221527, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.010711 | |
| }, | |
| { | |
| "epoch": 0.06471408647140865, | |
| "grad_norm": 2.1066770553588867, | |
| "learning_rate": 0.00012888888888888892, | |
| "logits/chosen": -0.37913525104522705, | |
| "logits/rejected": -0.4620123505592346, | |
| "logps/chosen": -7.321231842041016, | |
| "logps/rejected": -21.526382446289062, | |
| "loss": 1.0192487239837646, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4804428219795227, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.026389580219984055, | |
| "rewards/margins": 0.46746930480003357, | |
| "rewards/rejected": -0.441079705953598, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.010712 | |
| }, | |
| { | |
| "epoch": 0.06694560669456066, | |
| "grad_norm": 1.8226919174194336, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.3827905058860779, | |
| "logits/rejected": -0.48159855604171753, | |
| "logps/chosen": -6.776709079742432, | |
| "logps/rejected": -22.80392074584961, | |
| "loss": 1.0347448587417603, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.500119149684906, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10474913567304611, | |
| "rewards/margins": 0.39701035618782043, | |
| "rewards/rejected": -0.2922612428665161, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.010712 | |
| }, | |
| { | |
| "epoch": 0.06917712691771269, | |
| "grad_norm": 1.8681020736694336, | |
| "learning_rate": 0.0001377777777777778, | |
| "logits/chosen": -0.3609718978404999, | |
| "logits/rejected": -0.43842607736587524, | |
| "logps/chosen": -5.881144046783447, | |
| "logps/rejected": -21.236047744750977, | |
| "loss": 0.9905272126197815, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.43477141857147217, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04010690003633499, | |
| "rewards/margins": 0.3823702037334442, | |
| "rewards/rejected": -0.34226328134536743, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.010714 | |
| }, | |
| { | |
| "epoch": 0.07140864714086471, | |
| "grad_norm": 2.225977897644043, | |
| "learning_rate": 0.00014222222222222224, | |
| "logits/chosen": -0.39412301778793335, | |
| "logits/rejected": -0.4322904050350189, | |
| "logps/chosen": -10.140836715698242, | |
| "logps/rejected": -18.79208755493164, | |
| "loss": 1.0995820760726929, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5035545229911804, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.04120786115527153, | |
| "rewards/margins": 0.2624339461326599, | |
| "rewards/rejected": -0.22122608125209808, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.010716 | |
| }, | |
| { | |
| "epoch": 0.07364016736401674, | |
| "grad_norm": 2.788853406906128, | |
| "learning_rate": 0.00014666666666666666, | |
| "logits/chosen": -0.27406275272369385, | |
| "logits/rejected": -0.371414452791214, | |
| "logps/chosen": -12.10950756072998, | |
| "logps/rejected": -24.930038452148438, | |
| "loss": 1.2428903579711914, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6102337837219238, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.08664405345916748, | |
| "rewards/margins": 0.2861720621585846, | |
| "rewards/rejected": -0.3728161156177521, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.010715 | |
| }, | |
| { | |
| "epoch": 0.07587168758716877, | |
| "grad_norm": 2.416369676589966, | |
| "learning_rate": 0.0001511111111111111, | |
| "logits/chosen": -0.24224025011062622, | |
| "logits/rejected": -0.3833686113357544, | |
| "logps/chosen": -6.028831958770752, | |
| "logps/rejected": -22.455066680908203, | |
| "loss": 0.9914643168449402, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.44179052114486694, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.011510152369737625, | |
| "rewards/margins": 0.5171858668327332, | |
| "rewards/rejected": -0.5056756734848022, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.010714 | |
| }, | |
| { | |
| "epoch": 0.07810320781032078, | |
| "grad_norm": 4.029798984527588, | |
| "learning_rate": 0.00015555555555555556, | |
| "logits/chosen": -0.2615310847759247, | |
| "logits/rejected": -0.39800190925598145, | |
| "logps/chosen": -5.90588903427124, | |
| "logps/rejected": -24.642311096191406, | |
| "loss": 0.8372505307197571, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4036243259906769, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.03906700387597084, | |
| "rewards/margins": 0.8896325826644897, | |
| "rewards/rejected": -0.9286996126174927, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.010715 | |
| }, | |
| { | |
| "epoch": 0.0803347280334728, | |
| "grad_norm": 2.4356110095977783, | |
| "learning_rate": 0.00016, | |
| "logits/chosen": -0.25296953320503235, | |
| "logits/rejected": -0.3325399160385132, | |
| "logps/chosen": -9.764960289001465, | |
| "logps/rejected": -23.14637565612793, | |
| "loss": 1.0952283143997192, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.641168475151062, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.002499673515558243, | |
| "rewards/margins": 0.8523399829864502, | |
| "rewards/rejected": -0.8498403429985046, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.010716 | |
| }, | |
| { | |
| "epoch": 0.08256624825662483, | |
| "grad_norm": 1.9291634559631348, | |
| "learning_rate": 0.00016444444444444444, | |
| "logits/chosen": -0.20930960774421692, | |
| "logits/rejected": -0.3604508936405182, | |
| "logps/chosen": -2.847867488861084, | |
| "logps/rejected": -30.63514518737793, | |
| "loss": 0.6885566711425781, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.2891227900981903, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.061974309384822845, | |
| "rewards/margins": 1.0785088539123535, | |
| "rewards/rejected": -1.0165345668792725, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.010715 | |
| }, | |
| { | |
| "epoch": 0.08479776847977685, | |
| "grad_norm": 1.6937510967254639, | |
| "learning_rate": 0.00016888888888888889, | |
| "logits/chosen": -0.2987847626209259, | |
| "logits/rejected": -0.37470635771751404, | |
| "logps/chosen": -6.199091911315918, | |
| "logps/rejected": -19.3011474609375, | |
| "loss": 0.8923996090888977, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.38914668560028076, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0021905135363340378, | |
| "rewards/margins": 0.6954408288002014, | |
| "rewards/rejected": -0.6932503581047058, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.010716 | |
| }, | |
| { | |
| "epoch": 0.08702928870292886, | |
| "grad_norm": 2.106278896331787, | |
| "learning_rate": 0.00017333333333333334, | |
| "logits/chosen": -0.28487277030944824, | |
| "logits/rejected": -0.34711676836013794, | |
| "logps/chosen": -8.657167434692383, | |
| "logps/rejected": -26.564130783081055, | |
| "loss": 1.023146390914917, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5919384956359863, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.05617165565490723, | |
| "rewards/margins": 1.1481283903121948, | |
| "rewards/rejected": -1.091956615447998, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.010717 | |
| }, | |
| { | |
| "epoch": 0.08926080892608089, | |
| "grad_norm": 2.619154214859009, | |
| "learning_rate": 0.00017777777777777779, | |
| "logits/chosen": -0.2898882031440735, | |
| "logits/rejected": -0.3393169343471527, | |
| "logps/chosen": -8.001999855041504, | |
| "logps/rejected": -20.189369201660156, | |
| "loss": 0.9479650855064392, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.42854148149490356, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0008942075073719025, | |
| "rewards/margins": 0.7672775983810425, | |
| "rewards/rejected": -0.7663832902908325, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.010719 | |
| }, | |
| { | |
| "epoch": 0.09149232914923291, | |
| "grad_norm": 2.770841360092163, | |
| "learning_rate": 0.00018222222222222224, | |
| "logits/chosen": -0.22048279643058777, | |
| "logits/rejected": -0.30986371636390686, | |
| "logps/chosen": -5.240083694458008, | |
| "logps/rejected": -22.307451248168945, | |
| "loss": 0.8702710866928101, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.39226293563842773, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.017199480906128883, | |
| "rewards/margins": 0.9372033476829529, | |
| "rewards/rejected": -0.9200038313865662, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.010719 | |
| }, | |
| { | |
| "epoch": 0.09372384937238494, | |
| "grad_norm": 4.61620569229126, | |
| "learning_rate": 0.0001866666666666667, | |
| "logits/chosen": -0.30797824263572693, | |
| "logits/rejected": -0.3721832036972046, | |
| "logps/chosen": -10.481635093688965, | |
| "logps/rejected": -23.132564544677734, | |
| "loss": 1.2510943412780762, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6913026571273804, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.25621044635772705, | |
| "rewards/margins": 0.5585607886314392, | |
| "rewards/rejected": -0.814771294593811, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.010721 | |
| }, | |
| { | |
| "epoch": 0.09595536959553697, | |
| "grad_norm": 3.806872844696045, | |
| "learning_rate": 0.00019111111111111114, | |
| "logits/chosen": -0.22567886114120483, | |
| "logits/rejected": -0.3761019706726074, | |
| "logps/chosen": -8.201981544494629, | |
| "logps/rejected": -34.75733184814453, | |
| "loss": 1.0068457126617432, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.6396302580833435, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.12671321630477905, | |
| "rewards/margins": 1.7875899076461792, | |
| "rewards/rejected": -1.914302945137024, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.010722 | |
| }, | |
| { | |
| "epoch": 0.09818688981868898, | |
| "grad_norm": 3.342564821243286, | |
| "learning_rate": 0.00019555555555555556, | |
| "logits/chosen": -0.259334534406662, | |
| "logits/rejected": -0.33293721079826355, | |
| "logps/chosen": -9.735747337341309, | |
| "logps/rejected": -34.48583221435547, | |
| "loss": 0.9845027327537537, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5914844870567322, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.2998116612434387, | |
| "rewards/margins": 1.7843880653381348, | |
| "rewards/rejected": -2.084199905395508, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.010723 | |
| }, | |
| { | |
| "epoch": 0.100418410041841, | |
| "grad_norm": 3.4293951988220215, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.34163057804107666, | |
| "logits/rejected": -0.36223551630973816, | |
| "logps/chosen": -9.353399276733398, | |
| "logps/rejected": -21.651199340820312, | |
| "loss": 1.0366103649139404, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5141280889511108, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.003630978986620903, | |
| "rewards/margins": 0.7049190402030945, | |
| "rewards/rejected": -0.7085499167442322, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.010724 | |
| }, | |
| { | |
| "epoch": 0.10264993026499303, | |
| "grad_norm": 2.1774137020111084, | |
| "learning_rate": 0.0001999993185874369, | |
| "logits/chosen": -0.3677416443824768, | |
| "logits/rejected": -0.3854161500930786, | |
| "logps/chosen": -11.536070823669434, | |
| "logps/rejected": -27.305158615112305, | |
| "loss": 0.9515228271484375, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5171921849250793, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.09924840927124023, | |
| "rewards/margins": 1.116947889328003, | |
| "rewards/rejected": -1.2161962985992432, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.010724 | |
| }, | |
| { | |
| "epoch": 0.10488145048814505, | |
| "grad_norm": 2.2629730701446533, | |
| "learning_rate": 0.00019999727435903407, | |
| "logits/chosen": -0.3420083522796631, | |
| "logits/rejected": -0.4473438858985901, | |
| "logps/chosen": -4.170689582824707, | |
| "logps/rejected": -21.129119873046875, | |
| "loss": 0.9114863276481628, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.3966943621635437, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1746423840522766, | |
| "rewards/margins": 0.61202472448349, | |
| "rewards/rejected": -0.43738237023353577, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.010725 | |
| }, | |
| { | |
| "epoch": 0.10711297071129706, | |
| "grad_norm": 1.6574047803878784, | |
| "learning_rate": 0.0001999938673426507, | |
| "logits/chosen": -0.31779757142066956, | |
| "logits/rejected": -0.4338604807853699, | |
| "logps/chosen": -5.825237274169922, | |
| "logps/rejected": -20.981552124023438, | |
| "loss": 0.9128789305686951, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.4218422770500183, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1773630529642105, | |
| "rewards/margins": 0.718612551689148, | |
| "rewards/rejected": -0.5412494540214539, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.010725 | |
| }, | |
| { | |
| "epoch": 0.10934449093444909, | |
| "grad_norm": 2.0683908462524414, | |
| "learning_rate": 0.00019998909758471852, | |
| "logits/chosen": -0.3863949179649353, | |
| "logits/rejected": -0.4458945393562317, | |
| "logps/chosen": -7.798675537109375, | |
| "logps/rejected": -21.307409286499023, | |
| "loss": 1.0268117189407349, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.5051021575927734, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08097527176141739, | |
| "rewards/margins": 0.7529874444007874, | |
| "rewards/rejected": -0.672012209892273, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.010726 | |
| }, | |
| { | |
| "epoch": 0.11157601115760112, | |
| "grad_norm": 2.338461399078369, | |
| "learning_rate": 0.000199982965150241, | |
| "logits/chosen": -0.34079253673553467, | |
| "logits/rejected": -0.3965541124343872, | |
| "logps/chosen": -11.766353607177734, | |
| "logps/rejected": -19.651931762695312, | |
| "loss": 1.1824036836624146, | |
| "memory(GiB)": 46.81, | |
| "nll_loss": 0.609149158000946, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.08129046857357025, | |
| "rewards/margins": 0.3777032196521759, | |
| "rewards/rejected": -0.4589936435222626, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.010726 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 896, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.73582429044736e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |