Instructions to use seed429/trained with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use seed429/trained with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("seed429/trained", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.2544529262086514, | |
| "eval_steps": 500, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.167724609375, | |
| "epoch": 0.005089058524173028, | |
| "grad_norm": 63.83088684082031, | |
| "learning_rate": 5e-06, | |
| "logits/chosen": -1.1478307765991018, | |
| "logits/rejected": -1.1531979437304007, | |
| "logps/chosen": -230.5, | |
| "logps/rejected": -250.5, | |
| "loss": 0.726806640625, | |
| "mean_token_accuracy": 0.9508575797080994, | |
| "num_tokens": 387774.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.0360107421875, | |
| "rewards/margins": 0.007598876953125, | |
| "rewards/rejected": -0.04305267333984375, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 0.1708984375, | |
| "epoch": 0.010178117048346057, | |
| "grad_norm": 58.35269546508789, | |
| "learning_rate": 4.974619289340102e-06, | |
| "logits/chosen": -1.1465309061137527, | |
| "logits/rejected": -1.1435811743754352, | |
| "logps/chosen": -202.75, | |
| "logps/rejected": -220.75, | |
| "loss": 0.73284912109375, | |
| "mean_token_accuracy": 0.9518170654773712, | |
| "num_tokens": 796045.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.01251220703125, | |
| "rewards/margins": -0.01416015625, | |
| "rewards/rejected": 0.00146484375, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 0.1708984375, | |
| "epoch": 0.015267175572519083, | |
| "grad_norm": 52.742557525634766, | |
| "learning_rate": 4.949238578680203e-06, | |
| "logits/chosen": -1.22388826039798, | |
| "logits/rejected": -1.2534275052969308, | |
| "logps/chosen": -217.0, | |
| "logps/rejected": -210.75, | |
| "loss": 0.695587158203125, | |
| "mean_token_accuracy": 0.9499112516641617, | |
| "num_tokens": 1158499.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.03204345703125, | |
| "rewards/margins": 0.07501220703125, | |
| "rewards/rejected": -0.1068115234375, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 0.175537109375, | |
| "epoch": 0.020356234096692113, | |
| "grad_norm": 58.555728912353516, | |
| "learning_rate": 4.923857868020305e-06, | |
| "logits/chosen": -1.0887703188820197, | |
| "logits/rejected": -1.110711324029513, | |
| "logps/chosen": -247.5, | |
| "logps/rejected": -225.25, | |
| "loss": 0.7191162109375, | |
| "mean_token_accuracy": 0.9449715912342072, | |
| "num_tokens": 1526178.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.0124664306640625, | |
| "rewards/margins": 0.05133056640625, | |
| "rewards/rejected": -0.0640869140625, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 0.181884765625, | |
| "epoch": 0.02544529262086514, | |
| "grad_norm": 57.25611114501953, | |
| "learning_rate": 4.898477157360406e-06, | |
| "logits/chosen": -1.1241738300809683, | |
| "logits/rejected": -1.1185368980659924, | |
| "logps/chosen": -197.25, | |
| "logps/rejected": -204.5, | |
| "loss": 0.746917724609375, | |
| "mean_token_accuracy": 0.9447457045316696, | |
| "num_tokens": 1898739.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.036865234375, | |
| "rewards/margins": 0.0240478515625, | |
| "rewards/rejected": -0.06103515625, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.172119140625, | |
| "epoch": 0.030534351145038167, | |
| "grad_norm": 55.632781982421875, | |
| "learning_rate": 4.873096446700508e-06, | |
| "logits/chosen": -1.118042467736593, | |
| "logits/rejected": -1.1188858755620001, | |
| "logps/chosen": -195.5, | |
| "logps/rejected": -213.5, | |
| "loss": 0.706695556640625, | |
| "mean_token_accuracy": 0.9515382200479507, | |
| "num_tokens": 2280846.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.0267333984375, | |
| "rewards/margins": 0.051971435546875, | |
| "rewards/rejected": -0.07904052734375, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 0.165283203125, | |
| "epoch": 0.035623409669211195, | |
| "grad_norm": 58.1217155456543, | |
| "learning_rate": 4.84771573604061e-06, | |
| "logits/chosen": -1.2056221529623334, | |
| "logits/rejected": -1.1698524733043854, | |
| "logps/chosen": -203.75, | |
| "logps/rejected": -237.5, | |
| "loss": 0.778106689453125, | |
| "mean_token_accuracy": 0.9536973237991333, | |
| "num_tokens": 2661565.0, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.047119140625, | |
| "rewards/margins": -0.0155029296875, | |
| "rewards/rejected": -0.031982421875, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 0.16015625, | |
| "epoch": 0.04071246819338423, | |
| "grad_norm": 57.468605041503906, | |
| "learning_rate": 4.822335025380711e-06, | |
| "logits/chosen": -1.285398958255684, | |
| "logits/rejected": -1.2651885553215019, | |
| "logps/chosen": -185.25, | |
| "logps/rejected": -195.0, | |
| "loss": 0.76959228515625, | |
| "mean_token_accuracy": 0.9562991708517075, | |
| "num_tokens": 3011121.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.07479095458984375, | |
| "rewards/margins": -0.06903076171875, | |
| "rewards/rejected": -0.0052642822265625, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 0.177978515625, | |
| "epoch": 0.04580152671755725, | |
| "grad_norm": 61.59230041503906, | |
| "learning_rate": 4.796954314720812e-06, | |
| "logits/chosen": -1.1463901211868202, | |
| "logits/rejected": -1.151384163231262, | |
| "logps/chosen": -262.0, | |
| "logps/rejected": -263.0, | |
| "loss": 0.77764892578125, | |
| "mean_token_accuracy": 0.9490418434143066, | |
| "num_tokens": 3364659.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.0624542236328125, | |
| "rewards/margins": -0.07977294921875, | |
| "rewards/rejected": 0.017181396484375, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 0.17041015625, | |
| "epoch": 0.05089058524173028, | |
| "grad_norm": 66.9396743774414, | |
| "learning_rate": 4.771573604060914e-06, | |
| "logits/chosen": -1.1312320566718426, | |
| "logits/rejected": -1.114105189953177, | |
| "logps/chosen": -246.25, | |
| "logps/rejected": -253.5, | |
| "loss": 0.784912109375, | |
| "mean_token_accuracy": 0.9495462626218796, | |
| "num_tokens": 3756722.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.11962890625, | |
| "rewards/margins": -0.0777587890625, | |
| "rewards/rejected": -0.0416259765625, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.17041015625, | |
| "epoch": 0.05597964376590331, | |
| "grad_norm": 60.69718933105469, | |
| "learning_rate": 4.746192893401016e-06, | |
| "logits/chosen": -1.2082123033021486, | |
| "logits/rejected": -1.240414757271401, | |
| "logps/chosen": -206.75, | |
| "logps/rejected": -253.0, | |
| "loss": 0.77130126953125, | |
| "mean_token_accuracy": 0.9514396339654922, | |
| "num_tokens": 4150502.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.122711181640625, | |
| "rewards/margins": -0.0660400390625, | |
| "rewards/rejected": -0.056396484375, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.166015625, | |
| "epoch": 0.061068702290076333, | |
| "grad_norm": 68.75598907470703, | |
| "learning_rate": 4.7208121827411175e-06, | |
| "logits/chosen": -1.1497054731535286, | |
| "logits/rejected": -1.1323881415685357, | |
| "logps/chosen": -233.0, | |
| "logps/rejected": -214.0, | |
| "loss": 0.81524658203125, | |
| "mean_token_accuracy": 0.9499669224023819, | |
| "num_tokens": 4548017.0, | |
| "rewards/accuracies": 0.3125, | |
| "rewards/chosen": -0.14825439453125, | |
| "rewards/margins": -0.148681640625, | |
| "rewards/rejected": 0.0008544921875, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.171142578125, | |
| "epoch": 0.06615776081424936, | |
| "grad_norm": 54.791534423828125, | |
| "learning_rate": 4.695431472081219e-06, | |
| "logits/chosen": -1.1963053139896285, | |
| "logits/rejected": -1.164336637055035, | |
| "logps/chosen": -204.0, | |
| "logps/rejected": -226.5, | |
| "loss": 0.71929931640625, | |
| "mean_token_accuracy": 0.952528104186058, | |
| "num_tokens": 4902525.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.0484619140625, | |
| "rewards/margins": 0.0706787109375, | |
| "rewards/rejected": -0.1187744140625, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.165771484375, | |
| "epoch": 0.07124681933842239, | |
| "grad_norm": 55.923667907714844, | |
| "learning_rate": 4.67005076142132e-06, | |
| "logits/chosen": -1.227218462140038, | |
| "logits/rejected": -1.2252739974581663, | |
| "logps/chosen": -204.0, | |
| "logps/rejected": -245.75, | |
| "loss": 0.681884765625, | |
| "mean_token_accuracy": 0.9524703174829483, | |
| "num_tokens": 5247776.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.017791748046875, | |
| "rewards/margins": 0.07401275634765625, | |
| "rewards/rejected": -0.056304931640625, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.16796875, | |
| "epoch": 0.07633587786259542, | |
| "grad_norm": 54.7180290222168, | |
| "learning_rate": 4.644670050761422e-06, | |
| "logits/chosen": -1.1794452967378677, | |
| "logits/rejected": -1.213616516672937, | |
| "logps/chosen": -208.75, | |
| "logps/rejected": -199.5, | |
| "loss": 0.7034912109375, | |
| "mean_token_accuracy": 0.9460672587156296, | |
| "num_tokens": 5614879.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.097320556640625, | |
| "rewards/margins": 0.0595703125, | |
| "rewards/rejected": -0.15673828125, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.176513671875, | |
| "epoch": 0.08142493638676845, | |
| "grad_norm": 62.994319915771484, | |
| "learning_rate": 4.6192893401015235e-06, | |
| "logits/chosen": -1.2212638279189771, | |
| "logits/rejected": -1.2088961146919388, | |
| "logps/chosen": -227.25, | |
| "logps/rejected": -213.0, | |
| "loss": 0.83746337890625, | |
| "mean_token_accuracy": 0.9471840560436249, | |
| "num_tokens": 5971613.0, | |
| "rewards/accuracies": 0.28125, | |
| "rewards/chosen": -0.173828125, | |
| "rewards/margins": -0.18463134765625, | |
| "rewards/rejected": 0.01068115234375, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.169677734375, | |
| "epoch": 0.08651399491094147, | |
| "grad_norm": 60.76310348510742, | |
| "learning_rate": 4.593908629441624e-06, | |
| "logits/chosen": -1.2065562340385436, | |
| "logits/rejected": -1.2022840016395056, | |
| "logps/chosen": -218.5, | |
| "logps/rejected": -190.0, | |
| "loss": 0.77734375, | |
| "mean_token_accuracy": 0.9474756270647049, | |
| "num_tokens": 6368369.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.067138671875, | |
| "rewards/margins": -0.05255126953125, | |
| "rewards/rejected": -0.0137939453125, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.1748046875, | |
| "epoch": 0.0916030534351145, | |
| "grad_norm": 61.58626174926758, | |
| "learning_rate": 4.568527918781726e-06, | |
| "logits/chosen": -1.1644959212587278, | |
| "logits/rejected": -1.1554610862237855, | |
| "logps/chosen": -213.5, | |
| "logps/rejected": -256.5, | |
| "loss": 0.744384765625, | |
| "mean_token_accuracy": 0.9518721997737885, | |
| "num_tokens": 6749942.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.1009521484375, | |
| "rewards/margins": 0.003753662109375, | |
| "rewards/rejected": -0.104736328125, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.170654296875, | |
| "epoch": 0.09669211195928754, | |
| "grad_norm": 69.10458374023438, | |
| "learning_rate": 4.543147208121828e-06, | |
| "logits/chosen": -1.2018930915056671, | |
| "logits/rejected": -1.1882594101155102, | |
| "logps/chosen": -208.75, | |
| "logps/rejected": -223.0, | |
| "loss": 0.7578125, | |
| "mean_token_accuracy": 0.9503921419382095, | |
| "num_tokens": 7150669.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.16357421875, | |
| "rewards/margins": -0.0054931640625, | |
| "rewards/rejected": -0.157958984375, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.1708984375, | |
| "epoch": 0.10178117048346055, | |
| "grad_norm": 59.20901870727539, | |
| "learning_rate": 4.5177664974619295e-06, | |
| "logits/chosen": -1.153684045887259, | |
| "logits/rejected": -1.1406723101806675, | |
| "logps/chosen": -214.25, | |
| "logps/rejected": -235.75, | |
| "loss": 0.742584228515625, | |
| "mean_token_accuracy": 0.9510545581579208, | |
| "num_tokens": 7577633.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.1868896484375, | |
| "rewards/margins": -0.008544921875, | |
| "rewards/rejected": -0.17822265625, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.160888671875, | |
| "epoch": 0.10687022900763359, | |
| "grad_norm": 53.25274658203125, | |
| "learning_rate": 4.492385786802031e-06, | |
| "logits/chosen": -1.2115618534718147, | |
| "logits/rejected": -1.1697568144140837, | |
| "logps/chosen": -220.5, | |
| "logps/rejected": -224.5, | |
| "loss": 0.6365966796875, | |
| "mean_token_accuracy": 0.954043835401535, | |
| "num_tokens": 7935697.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.0498046875, | |
| "rewards/margins": 0.22021484375, | |
| "rewards/rejected": -0.2708282470703125, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.1708984375, | |
| "epoch": 0.11195928753180662, | |
| "grad_norm": 64.42499542236328, | |
| "learning_rate": 4.467005076142132e-06, | |
| "logits/chosen": -1.163452744541083, | |
| "logits/rejected": -1.1574276551228084, | |
| "logps/chosen": -206.75, | |
| "logps/rejected": -249.0, | |
| "loss": 0.7249755859375, | |
| "mean_token_accuracy": 0.9557177871465683, | |
| "num_tokens": 8344719.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.064208984375, | |
| "rewards/margins": 0.043914794921875, | |
| "rewards/rejected": -0.108154296875, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.1650390625, | |
| "epoch": 0.11704834605597965, | |
| "grad_norm": 57.46247863769531, | |
| "learning_rate": 4.441624365482234e-06, | |
| "logits/chosen": -1.184751779280805, | |
| "logits/rejected": -1.1601956141572203, | |
| "logps/chosen": -221.5, | |
| "logps/rejected": -223.5, | |
| "loss": 0.725341796875, | |
| "mean_token_accuracy": 0.9495507925748825, | |
| "num_tokens": 8715576.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.12018585205078125, | |
| "rewards/margins": 0.1531982421875, | |
| "rewards/rejected": -0.27362060546875, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.166259765625, | |
| "epoch": 0.12213740458015267, | |
| "grad_norm": 88.59230041503906, | |
| "learning_rate": 4.4162436548223355e-06, | |
| "logits/chosen": -1.2269864585121328, | |
| "logits/rejected": -1.2167687340565112, | |
| "logps/chosen": -190.5, | |
| "logps/rejected": -223.25, | |
| "loss": 0.616790771484375, | |
| "mean_token_accuracy": 0.9541012793779373, | |
| "num_tokens": 9131729.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.0047607421875, | |
| "rewards/margins": 0.2396240234375, | |
| "rewards/rejected": -0.244873046875, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.174560546875, | |
| "epoch": 0.1272264631043257, | |
| "grad_norm": 59.16816711425781, | |
| "learning_rate": 4.390862944162436e-06, | |
| "logits/chosen": -1.2085149622005857, | |
| "logits/rejected": -1.1962000528044974, | |
| "logps/chosen": -209.5, | |
| "logps/rejected": -248.25, | |
| "loss": 0.68780517578125, | |
| "mean_token_accuracy": 0.9498510509729385, | |
| "num_tokens": 9510884.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.14385986328125, | |
| "rewards/margins": 0.06866455078125, | |
| "rewards/rejected": -0.212890625, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.166259765625, | |
| "epoch": 0.13231552162849872, | |
| "grad_norm": 58.58485412597656, | |
| "learning_rate": 4.365482233502538e-06, | |
| "logits/chosen": -1.2357831115334332, | |
| "logits/rejected": -1.2414339305565623, | |
| "logps/chosen": -205.25, | |
| "logps/rejected": -210.0, | |
| "loss": 0.735107421875, | |
| "mean_token_accuracy": 0.9495077282190323, | |
| "num_tokens": 9892399.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.144287109375, | |
| "rewards/margins": 0.02099609375, | |
| "rewards/rejected": -0.16522216796875, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.17333984375, | |
| "epoch": 0.13740458015267176, | |
| "grad_norm": 51.31973648071289, | |
| "learning_rate": 4.34010152284264e-06, | |
| "logits/chosen": -1.1937940321742593, | |
| "logits/rejected": -1.20553321824887, | |
| "logps/chosen": -185.875, | |
| "logps/rejected": -204.75, | |
| "loss": 0.66217041015625, | |
| "mean_token_accuracy": 0.9475287944078445, | |
| "num_tokens": 10284784.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.072509765625, | |
| "rewards/margins": 0.17462158203125, | |
| "rewards/rejected": -0.247314453125, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.16552734375, | |
| "epoch": 0.14249363867684478, | |
| "grad_norm": 61.93020248413086, | |
| "learning_rate": 4.3147208121827415e-06, | |
| "logits/chosen": -1.2497175985959397, | |
| "logits/rejected": -1.2349540219835924, | |
| "logps/chosen": -185.5, | |
| "logps/rejected": -200.5, | |
| "loss": 0.785888671875, | |
| "mean_token_accuracy": 0.9526190459728241, | |
| "num_tokens": 10640064.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.24853515625, | |
| "rewards/margins": -0.0711669921875, | |
| "rewards/rejected": -0.1773681640625, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.168701171875, | |
| "epoch": 0.1475826972010178, | |
| "grad_norm": 47.82231903076172, | |
| "learning_rate": 4.289340101522843e-06, | |
| "logits/chosen": -1.2240958044550552, | |
| "logits/rejected": -1.2331657411234425, | |
| "logps/chosen": -164.75, | |
| "logps/rejected": -183.5, | |
| "loss": 0.64813232421875, | |
| "mean_token_accuracy": 0.9512129127979279, | |
| "num_tokens": 11043531.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.0230712890625, | |
| "rewards/margins": 0.1962890625, | |
| "rewards/rejected": -0.21942138671875, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.166015625, | |
| "epoch": 0.15267175572519084, | |
| "grad_norm": 64.59899139404297, | |
| "learning_rate": 4.263959390862945e-06, | |
| "logits/chosen": -1.1938851832774966, | |
| "logits/rejected": -1.2063193481273322, | |
| "logps/chosen": -203.375, | |
| "logps/rejected": -209.25, | |
| "loss": 0.75030517578125, | |
| "mean_token_accuracy": 0.9482824355363846, | |
| "num_tokens": 11433645.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.160888671875, | |
| "rewards/margins": 0.0379638671875, | |
| "rewards/rejected": -0.1988525390625, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.174560546875, | |
| "epoch": 0.15776081424936386, | |
| "grad_norm": 50.42904281616211, | |
| "learning_rate": 4.238578680203046e-06, | |
| "logits/chosen": -1.1847193683809207, | |
| "logits/rejected": -1.2039758508125116, | |
| "logps/chosen": -187.0, | |
| "logps/rejected": -196.0, | |
| "loss": 0.6805324554443359, | |
| "mean_token_accuracy": 0.9458457380533218, | |
| "num_tokens": 11802241.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.01849365234375, | |
| "rewards/margins": 0.2666015625, | |
| "rewards/rejected": -0.285400390625, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.164794921875, | |
| "epoch": 0.1628498727735369, | |
| "grad_norm": 65.630126953125, | |
| "learning_rate": 4.2131979695431475e-06, | |
| "logits/chosen": -1.2242753640413924, | |
| "logits/rejected": -1.2582800165640973, | |
| "logps/chosen": -237.25, | |
| "logps/rejected": -239.75, | |
| "loss": 0.762481689453125, | |
| "mean_token_accuracy": 0.9494172036647797, | |
| "num_tokens": 12168742.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.256591796875, | |
| "rewards/margins": 0.0673828125, | |
| "rewards/rejected": -0.323486328125, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.1669921875, | |
| "epoch": 0.16793893129770993, | |
| "grad_norm": 64.15123748779297, | |
| "learning_rate": 4.187817258883249e-06, | |
| "logits/chosen": -1.2054564969855512, | |
| "logits/rejected": -1.2242075139011555, | |
| "logps/chosen": -225.75, | |
| "logps/rejected": -242.25, | |
| "loss": 0.776153564453125, | |
| "mean_token_accuracy": 0.9507817625999451, | |
| "num_tokens": 12544019.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.259033203125, | |
| "rewards/margins": -0.0609130859375, | |
| "rewards/rejected": -0.1982421875, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.16162109375, | |
| "epoch": 0.17302798982188294, | |
| "grad_norm": 59.748802185058594, | |
| "learning_rate": 4.162436548223351e-06, | |
| "logits/chosen": -1.1906290703191211, | |
| "logits/rejected": -1.2255973378124254, | |
| "logps/chosen": -185.5, | |
| "logps/rejected": -189.5, | |
| "loss": 0.81256103515625, | |
| "mean_token_accuracy": 0.951210081577301, | |
| "num_tokens": 12934809.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.261016845703125, | |
| "rewards/margins": -0.1204071044921875, | |
| "rewards/rejected": -0.140380859375, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.160400390625, | |
| "epoch": 0.178117048346056, | |
| "grad_norm": 62.484031677246094, | |
| "learning_rate": 4.137055837563453e-06, | |
| "logits/chosen": -1.1568720249350068, | |
| "logits/rejected": -1.1932806025584015, | |
| "logps/chosen": -214.75, | |
| "logps/rejected": -264.25, | |
| "loss": 0.743255615234375, | |
| "mean_token_accuracy": 0.952626571059227, | |
| "num_tokens": 13333240.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.19916534423828125, | |
| "rewards/margins": 0.0906982421875, | |
| "rewards/rejected": -0.2904052734375, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.168701171875, | |
| "epoch": 0.183206106870229, | |
| "grad_norm": 57.09201431274414, | |
| "learning_rate": 4.1116751269035535e-06, | |
| "logits/chosen": -1.244021900396991, | |
| "logits/rejected": -1.2053838438463438, | |
| "logps/chosen": -227.75, | |
| "logps/rejected": -235.75, | |
| "loss": 0.598724365234375, | |
| "mean_token_accuracy": 0.9517507553100586, | |
| "num_tokens": 13672135.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.099365234375, | |
| "rewards/margins": 0.307861328125, | |
| "rewards/rejected": -0.4072265625, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.168212890625, | |
| "epoch": 0.18829516539440203, | |
| "grad_norm": 70.22441101074219, | |
| "learning_rate": 4.086294416243655e-06, | |
| "logits/chosen": -1.2293163289174895, | |
| "logits/rejected": -1.2229109217299612, | |
| "logps/chosen": -224.25, | |
| "logps/rejected": -227.75, | |
| "loss": 0.82135009765625, | |
| "mean_token_accuracy": 0.9494140148162842, | |
| "num_tokens": 14069079.0, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.0679931640625, | |
| "rewards/margins": -0.12286376953125, | |
| "rewards/rejected": 0.0546875, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.16357421875, | |
| "epoch": 0.19338422391857507, | |
| "grad_norm": 76.26187896728516, | |
| "learning_rate": 4.060913705583757e-06, | |
| "logits/chosen": -1.210362411249237, | |
| "logits/rejected": -1.2507633848434636, | |
| "logps/chosen": -263.5, | |
| "logps/rejected": -245.75, | |
| "loss": 0.789825439453125, | |
| "mean_token_accuracy": 0.9464226067066193, | |
| "num_tokens": 14439718.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.00927734375, | |
| "rewards/margins": -0.00775146484375, | |
| "rewards/rejected": -0.001953125, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.1767578125, | |
| "epoch": 0.1984732824427481, | |
| "grad_norm": 60.25480270385742, | |
| "learning_rate": 4.035532994923858e-06, | |
| "logits/chosen": -1.2676762543068074, | |
| "logits/rejected": -1.2517246495133931, | |
| "logps/chosen": -240.25, | |
| "logps/rejected": -250.0, | |
| "loss": 0.706390380859375, | |
| "mean_token_accuracy": 0.9461905360221863, | |
| "num_tokens": 14842983.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.234130859375, | |
| "rewards/margins": 0.1005859375, | |
| "rewards/rejected": -0.334716796875, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.158447265625, | |
| "epoch": 0.2035623409669211, | |
| "grad_norm": 56.411930084228516, | |
| "learning_rate": 4.0101522842639595e-06, | |
| "logits/chosen": -1.253394155349274, | |
| "logits/rejected": -1.2763997522602422, | |
| "logps/chosen": -219.5, | |
| "logps/rejected": -248.0, | |
| "loss": 0.6590461730957031, | |
| "mean_token_accuracy": 0.9516128301620483, | |
| "num_tokens": 15207602.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.115966796875, | |
| "rewards/margins": 0.2529296875, | |
| "rewards/rejected": -0.3690185546875, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.162109375, | |
| "epoch": 0.20865139949109415, | |
| "grad_norm": 50.47223663330078, | |
| "learning_rate": 3.984771573604061e-06, | |
| "logits/chosen": -1.221418931634342, | |
| "logits/rejected": -1.240179635098703, | |
| "logps/chosen": -198.75, | |
| "logps/rejected": -241.0, | |
| "loss": 0.61651611328125, | |
| "mean_token_accuracy": 0.9533202648162842, | |
| "num_tokens": 15615485.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.01708984375, | |
| "rewards/margins": 0.32470703125, | |
| "rewards/rejected": -0.3079833984375, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.164794921875, | |
| "epoch": 0.21374045801526717, | |
| "grad_norm": 63.18607711791992, | |
| "learning_rate": 3.959390862944163e-06, | |
| "logits/chosen": -1.2487682814246732, | |
| "logits/rejected": -1.2684586865119198, | |
| "logps/chosen": -230.5, | |
| "logps/rejected": -251.25, | |
| "loss": 0.73516845703125, | |
| "mean_token_accuracy": 0.9500314593315125, | |
| "num_tokens": 16006587.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.0408935546875, | |
| "rewards/margins": 0.07275390625, | |
| "rewards/rejected": -0.11383056640625, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.16796875, | |
| "epoch": 0.21882951653944022, | |
| "grad_norm": 57.65352249145508, | |
| "learning_rate": 3.934010152284265e-06, | |
| "logits/chosen": -1.3110932592597404, | |
| "logits/rejected": -1.3089875033252198, | |
| "logps/chosen": -223.0, | |
| "logps/rejected": -271.25, | |
| "loss": 0.7037353515625, | |
| "mean_token_accuracy": 0.952717587351799, | |
| "num_tokens": 16376034.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.1783447265625, | |
| "rewards/margins": 0.10040283203125, | |
| "rewards/rejected": -0.2783203125, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.162353515625, | |
| "epoch": 0.22391857506361323, | |
| "grad_norm": 51.37344741821289, | |
| "learning_rate": 3.9086294416243655e-06, | |
| "logits/chosen": -1.293287887477467, | |
| "logits/rejected": -1.2826172419774333, | |
| "logps/chosen": -169.0, | |
| "logps/rejected": -188.25, | |
| "loss": 0.68048095703125, | |
| "mean_token_accuracy": 0.9513245075941086, | |
| "num_tokens": 16729880.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.14501953125, | |
| "rewards/margins": 0.17425537109375, | |
| "rewards/rejected": -0.31884765625, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.162109375, | |
| "epoch": 0.22900763358778625, | |
| "grad_norm": 60.11509704589844, | |
| "learning_rate": 3.883248730964467e-06, | |
| "logits/chosen": -1.2668976340142997, | |
| "logits/rejected": -1.2750247764479736, | |
| "logps/chosen": -227.0, | |
| "logps/rejected": -250.0, | |
| "loss": 0.6617431640625, | |
| "mean_token_accuracy": 0.9519101679325104, | |
| "num_tokens": 17112685.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.0929718017578125, | |
| "rewards/margins": 0.20703125, | |
| "rewards/rejected": -0.2998046875, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.16552734375, | |
| "epoch": 0.2340966921119593, | |
| "grad_norm": 70.05858612060547, | |
| "learning_rate": 3.857868020304569e-06, | |
| "logits/chosen": -1.256115313351624, | |
| "logits/rejected": -1.292612336747009, | |
| "logps/chosen": -203.75, | |
| "logps/rejected": -204.25, | |
| "loss": 0.78472900390625, | |
| "mean_token_accuracy": 0.9469475299119949, | |
| "num_tokens": 17464688.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.1900482177734375, | |
| "rewards/margins": -0.072418212890625, | |
| "rewards/rejected": -0.118408203125, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.16552734375, | |
| "epoch": 0.23918575063613232, | |
| "grad_norm": 63.72059631347656, | |
| "learning_rate": 3.832487309644671e-06, | |
| "logits/chosen": -1.2366188823977582, | |
| "logits/rejected": -1.2068790190894856, | |
| "logps/chosen": -215.75, | |
| "logps/rejected": -216.25, | |
| "loss": 0.70928955078125, | |
| "mean_token_accuracy": 0.947726234793663, | |
| "num_tokens": 17827406.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.126556396484375, | |
| "rewards/margins": 0.05908203125, | |
| "rewards/rejected": -0.18597412109375, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.173095703125, | |
| "epoch": 0.24427480916030533, | |
| "grad_norm": 51.02957534790039, | |
| "learning_rate": 3.8071065989847715e-06, | |
| "logits/chosen": -1.2951891338286738, | |
| "logits/rejected": -1.2901734123706725, | |
| "logps/chosen": -186.375, | |
| "logps/rejected": -190.375, | |
| "loss": 0.686798095703125, | |
| "mean_token_accuracy": 0.9495810121297836, | |
| "num_tokens": 18168837.0, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.149169921875, | |
| "rewards/margins": 0.10107421875, | |
| "rewards/rejected": -0.25054931640625, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.171142578125, | |
| "epoch": 0.24936386768447838, | |
| "grad_norm": 65.16993713378906, | |
| "learning_rate": 3.7817258883248736e-06, | |
| "logits/chosen": -1.2489111246586129, | |
| "logits/rejected": -1.2595230297930642, | |
| "logps/chosen": -226.25, | |
| "logps/rejected": -253.5, | |
| "loss": 0.6953582763671875, | |
| "mean_token_accuracy": 0.9487173557281494, | |
| "num_tokens": 18520757.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.05126953125, | |
| "rewards/margins": 0.1453857421875, | |
| "rewards/rejected": -0.197357177734375, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.161865234375, | |
| "epoch": 0.2544529262086514, | |
| "grad_norm": 85.86858367919922, | |
| "learning_rate": 3.756345177664975e-06, | |
| "logits/chosen": -1.2788417924140663, | |
| "logits/rejected": -1.2818688140867107, | |
| "logps/chosen": -222.25, | |
| "logps/rejected": -228.0, | |
| "loss": 0.906097412109375, | |
| "mean_token_accuracy": 0.9481759369373322, | |
| "num_tokens": 18907465.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.32647705078125, | |
| "rewards/margins": -0.261962890625, | |
| "rewards/rejected": -0.06494140625, | |
| "step": 50 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 197, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.9987517381264015e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |