Instructions to use rombirli/milestone2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use rombirli/milestone2 with Transformers:
# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("rombirli/milestone2") model = AutoModelForSeq2SeqLM.from_pretrained("rombirli/milestone2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 9.401709401709402, | |
| "eval_steps": 500, | |
| "global_step": 22000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.21367521367521367, | |
| "grad_norm": 4.928079605102539, | |
| "learning_rate": 5e-05, | |
| "logits/chosen": -17.893346786499023, | |
| "logits/rejected": -17.935224533081055, | |
| "logps/chosen": -247.3836669921875, | |
| "logps/rejected": -228.11244201660156, | |
| "loss": 0.7455, | |
| "rewards/accuracies": 0.5327500104904175, | |
| "rewards/chosen": 0.5997859835624695, | |
| "rewards/margins": 0.08256139606237411, | |
| "rewards/rejected": 0.5172246098518372, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.21367521367521367, | |
| "eval_logits/chosen": -17.495702743530273, | |
| "eval_logits/rejected": -17.58708381652832, | |
| "eval_logps/chosen": -242.62672424316406, | |
| "eval_logps/rejected": -221.27163696289062, | |
| "eval_loss": 0.7328621745109558, | |
| "eval_rewards/accuracies": 0.5503731369972229, | |
| "eval_rewards/chosen": 1.2266465425491333, | |
| "eval_rewards/margins": 0.1979004591703415, | |
| "eval_rewards/rejected": 1.0287461280822754, | |
| "eval_runtime": 228.1137, | |
| "eval_samples_per_second": 11.718, | |
| "eval_steps_per_second": 1.469, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "grad_norm": 4.208562850952148, | |
| "learning_rate": 4.890829694323144e-05, | |
| "logits/chosen": -16.971363067626953, | |
| "logits/rejected": -17.00401496887207, | |
| "logps/chosen": -247.00656127929688, | |
| "logps/rejected": -228.8548126220703, | |
| "loss": 0.7843, | |
| "rewards/accuracies": 0.5517500042915344, | |
| "rewards/chosen": 0.8434626460075378, | |
| "rewards/margins": 0.19367894530296326, | |
| "rewards/rejected": 0.649783730506897, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "eval_logits/chosen": -17.079561233520508, | |
| "eval_logits/rejected": -17.085018157958984, | |
| "eval_logps/chosen": -242.22113037109375, | |
| "eval_logps/rejected": -221.7228546142578, | |
| "eval_loss": 0.7642466425895691, | |
| "eval_rewards/accuracies": 0.5776119232177734, | |
| "eval_rewards/chosen": 1.2672061920166016, | |
| "eval_rewards/margins": 0.28358009457588196, | |
| "eval_rewards/rejected": 0.9836260676383972, | |
| "eval_runtime": 228.0897, | |
| "eval_samples_per_second": 11.719, | |
| "eval_steps_per_second": 1.469, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.6410256410256411, | |
| "grad_norm": 3.5691583156585693, | |
| "learning_rate": 4.7816593886462886e-05, | |
| "logits/chosen": -16.51204490661621, | |
| "logits/rejected": -16.47532844543457, | |
| "logps/chosen": -240.64077758789062, | |
| "logps/rejected": -222.9105987548828, | |
| "loss": 0.7908, | |
| "rewards/accuracies": 0.5792499780654907, | |
| "rewards/chosen": 1.2004680633544922, | |
| "rewards/margins": 0.30569130182266235, | |
| "rewards/rejected": 0.8947767615318298, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.6410256410256411, | |
| "eval_logits/chosen": -16.36088752746582, | |
| "eval_logits/rejected": -16.358932495117188, | |
| "eval_logps/chosen": -239.6025848388672, | |
| "eval_logps/rejected": -219.82733154296875, | |
| "eval_loss": 0.7727888226509094, | |
| "eval_rewards/accuracies": 0.5697761178016663, | |
| "eval_rewards/chosen": 1.5290582180023193, | |
| "eval_rewards/margins": 0.35588183999061584, | |
| "eval_rewards/rejected": 1.1731764078140259, | |
| "eval_runtime": 228.179, | |
| "eval_samples_per_second": 11.714, | |
| "eval_steps_per_second": 1.468, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.8547008547008547, | |
| "grad_norm": 6.145715713500977, | |
| "learning_rate": 4.672489082969432e-05, | |
| "logits/chosen": -16.44040870666504, | |
| "logits/rejected": -16.468050003051758, | |
| "logps/chosen": -245.83175659179688, | |
| "logps/rejected": -227.9639892578125, | |
| "loss": 0.7897, | |
| "rewards/accuracies": 0.5802500247955322, | |
| "rewards/chosen": 1.1456317901611328, | |
| "rewards/margins": 0.3306076228618622, | |
| "rewards/rejected": 0.8150242567062378, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.8547008547008547, | |
| "eval_logits/chosen": -16.609996795654297, | |
| "eval_logits/rejected": -16.722354888916016, | |
| "eval_logps/chosen": -241.63665771484375, | |
| "eval_logps/rejected": -222.01730346679688, | |
| "eval_loss": 0.7797393202781677, | |
| "eval_rewards/accuracies": 0.5716418027877808, | |
| "eval_rewards/chosen": 1.3256531953811646, | |
| "eval_rewards/margins": 0.37147435545921326, | |
| "eval_rewards/rejected": 0.9541788101196289, | |
| "eval_runtime": 227.8733, | |
| "eval_samples_per_second": 11.73, | |
| "eval_steps_per_second": 1.47, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.0683760683760684, | |
| "grad_norm": 8.053547859191895, | |
| "learning_rate": 4.563318777292577e-05, | |
| "logits/chosen": -16.771224975585938, | |
| "logits/rejected": -16.817113876342773, | |
| "logps/chosen": -241.07923889160156, | |
| "logps/rejected": -230.9042510986328, | |
| "loss": 0.6165, | |
| "rewards/accuracies": 0.6802499890327454, | |
| "rewards/chosen": 1.3186030387878418, | |
| "rewards/margins": 0.9475009441375732, | |
| "rewards/rejected": 0.37110206484794617, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.0683760683760684, | |
| "eval_logits/chosen": -18.916522979736328, | |
| "eval_logits/rejected": -19.013525009155273, | |
| "eval_logps/chosen": -245.43980407714844, | |
| "eval_logps/rejected": -226.0865936279297, | |
| "eval_loss": 0.8502845168113708, | |
| "eval_rewards/accuracies": 0.5727611780166626, | |
| "eval_rewards/chosen": 0.9453384876251221, | |
| "eval_rewards/margins": 0.39808395504951477, | |
| "eval_rewards/rejected": 0.5472545027732849, | |
| "eval_runtime": 227.8708, | |
| "eval_samples_per_second": 11.73, | |
| "eval_steps_per_second": 1.47, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.282051282051282, | |
| "grad_norm": 5.05163049697876, | |
| "learning_rate": 4.4541484716157205e-05, | |
| "logits/chosen": -18.562543869018555, | |
| "logits/rejected": -18.527542114257812, | |
| "logps/chosen": -240.0729217529297, | |
| "logps/rejected": -241.17103576660156, | |
| "loss": 0.2892, | |
| "rewards/accuracies": 0.8794999718666077, | |
| "rewards/chosen": 1.5824379920959473, | |
| "rewards/margins": 2.353099822998047, | |
| "rewards/rejected": -0.7706621289253235, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.282051282051282, | |
| "eval_logits/chosen": -18.576160430908203, | |
| "eval_logits/rejected": -18.738643646240234, | |
| "eval_logps/chosen": -244.65501403808594, | |
| "eval_logps/rejected": -225.6937713623047, | |
| "eval_loss": 0.8693752884864807, | |
| "eval_rewards/accuracies": 0.579104483127594, | |
| "eval_rewards/chosen": 1.0238155126571655, | |
| "eval_rewards/margins": 0.4372811019420624, | |
| "eval_rewards/rejected": 0.5865345597267151, | |
| "eval_runtime": 227.9156, | |
| "eval_samples_per_second": 11.728, | |
| "eval_steps_per_second": 1.47, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.4957264957264957, | |
| "grad_norm": 7.019180774688721, | |
| "learning_rate": 4.344978165938865e-05, | |
| "logits/chosen": -18.66375160217285, | |
| "logits/rejected": -18.701576232910156, | |
| "logps/chosen": -238.48146057128906, | |
| "logps/rejected": -242.01947021484375, | |
| "loss": 0.2854, | |
| "rewards/accuracies": 0.8837500214576721, | |
| "rewards/chosen": 1.5945905447006226, | |
| "rewards/margins": 2.4082257747650146, | |
| "rewards/rejected": -0.8136354088783264, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 1.4957264957264957, | |
| "eval_logits/chosen": -18.779308319091797, | |
| "eval_logits/rejected": -18.989845275878906, | |
| "eval_logps/chosen": -243.39840698242188, | |
| "eval_logps/rejected": -224.86245727539062, | |
| "eval_loss": 0.8864023685455322, | |
| "eval_rewards/accuracies": 0.5776119232177734, | |
| "eval_rewards/chosen": 1.1494779586791992, | |
| "eval_rewards/margins": 0.4798123836517334, | |
| "eval_rewards/rejected": 0.6696655750274658, | |
| "eval_runtime": 227.9853, | |
| "eval_samples_per_second": 11.724, | |
| "eval_steps_per_second": 1.469, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 1.7094017094017095, | |
| "grad_norm": 7.860182285308838, | |
| "learning_rate": 4.235807860262009e-05, | |
| "logits/chosen": -18.62232208251953, | |
| "logits/rejected": -18.68227767944336, | |
| "logps/chosen": -239.76577758789062, | |
| "logps/rejected": -242.22262573242188, | |
| "loss": 0.3174, | |
| "rewards/accuracies": 0.859499990940094, | |
| "rewards/chosen": 1.3996559381484985, | |
| "rewards/margins": 2.317948818206787, | |
| "rewards/rejected": -0.9182929396629333, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 1.7094017094017095, | |
| "eval_logits/chosen": -19.075952529907227, | |
| "eval_logits/rejected": -19.315759658813477, | |
| "eval_logps/chosen": -247.94288635253906, | |
| "eval_logps/rejected": -229.47616577148438, | |
| "eval_loss": 0.8939631581306458, | |
| "eval_rewards/accuracies": 0.5742537379264832, | |
| "eval_rewards/chosen": 0.6950293779373169, | |
| "eval_rewards/margins": 0.4867364168167114, | |
| "eval_rewards/rejected": 0.20829293131828308, | |
| "eval_runtime": 228.1073, | |
| "eval_samples_per_second": 11.718, | |
| "eval_steps_per_second": 1.469, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 1.9230769230769231, | |
| "grad_norm": 7.142192840576172, | |
| "learning_rate": 4.126637554585153e-05, | |
| "logits/chosen": -18.834980010986328, | |
| "logits/rejected": -18.85399627685547, | |
| "logps/chosen": -237.92694091796875, | |
| "logps/rejected": -241.12193298339844, | |
| "loss": 0.3407, | |
| "rewards/accuracies": 0.8569999933242798, | |
| "rewards/chosen": 1.4859353303909302, | |
| "rewards/margins": 2.1926088333129883, | |
| "rewards/rejected": -0.7066735625267029, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 1.9230769230769231, | |
| "eval_logits/chosen": -18.660301208496094, | |
| "eval_logits/rejected": -18.76552391052246, | |
| "eval_logps/chosen": -245.375, | |
| "eval_logps/rejected": -226.55128479003906, | |
| "eval_loss": 0.8752386569976807, | |
| "eval_rewards/accuracies": 0.579104483127594, | |
| "eval_rewards/chosen": 0.95181804895401, | |
| "eval_rewards/margins": 0.45103806257247925, | |
| "eval_rewards/rejected": 0.5007798671722412, | |
| "eval_runtime": 227.9353, | |
| "eval_samples_per_second": 11.727, | |
| "eval_steps_per_second": 1.47, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.1367521367521367, | |
| "grad_norm": 3.366326093673706, | |
| "learning_rate": 4.017467248908297e-05, | |
| "logits/chosen": -19.808855056762695, | |
| "logits/rejected": -19.856393814086914, | |
| "logps/chosen": -241.35366821289062, | |
| "logps/rejected": -259.6560363769531, | |
| "loss": 0.1671, | |
| "rewards/accuracies": 0.9362499713897705, | |
| "rewards/chosen": 1.4077472686767578, | |
| "rewards/margins": 3.8491322994232178, | |
| "rewards/rejected": -2.441384792327881, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 2.1367521367521367, | |
| "eval_logits/chosen": -22.046789169311523, | |
| "eval_logits/rejected": -22.61486053466797, | |
| "eval_logps/chosen": -268.6415710449219, | |
| "eval_logps/rejected": -251.24929809570312, | |
| "eval_loss": 1.0633221864700317, | |
| "eval_rewards/accuracies": 0.5742537379264832, | |
| "eval_rewards/chosen": -1.3748414516448975, | |
| "eval_rewards/margins": 0.5941786170005798, | |
| "eval_rewards/rejected": -1.9690202474594116, | |
| "eval_runtime": 228.035, | |
| "eval_samples_per_second": 11.722, | |
| "eval_steps_per_second": 1.469, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 2.3504273504273505, | |
| "grad_norm": 0.4629862606525421, | |
| "learning_rate": 3.9082969432314415e-05, | |
| "logits/chosen": -21.48691177368164, | |
| "logits/rejected": -21.680583953857422, | |
| "logps/chosen": -248.6252899169922, | |
| "logps/rejected": -278.22113037109375, | |
| "loss": 0.0894, | |
| "rewards/accuracies": 0.9677500128746033, | |
| "rewards/chosen": 0.5657418966293335, | |
| "rewards/margins": 4.973217964172363, | |
| "rewards/rejected": -4.407476425170898, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 2.3504273504273505, | |
| "eval_logits/chosen": -21.514081954956055, | |
| "eval_logits/rejected": -21.708589553833008, | |
| "eval_logps/chosen": -266.9635314941406, | |
| "eval_logps/rejected": -249.8363800048828, | |
| "eval_loss": 1.1009100675582886, | |
| "eval_rewards/accuracies": 0.562686562538147, | |
| "eval_rewards/chosen": -1.2070350646972656, | |
| "eval_rewards/margins": 0.6206951141357422, | |
| "eval_rewards/rejected": -1.8277301788330078, | |
| "eval_runtime": 228.1018, | |
| "eval_samples_per_second": 11.718, | |
| "eval_steps_per_second": 1.469, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 2.564102564102564, | |
| "grad_norm": 8.165853500366211, | |
| "learning_rate": 3.799126637554585e-05, | |
| "logits/chosen": -21.36423110961914, | |
| "logits/rejected": -21.592361450195312, | |
| "logps/chosen": -247.65838623046875, | |
| "logps/rejected": -276.07623291015625, | |
| "loss": 0.0929, | |
| "rewards/accuracies": 0.9667500257492065, | |
| "rewards/chosen": 0.566991925239563, | |
| "rewards/margins": 4.974726676940918, | |
| "rewards/rejected": -4.4077348709106445, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 2.564102564102564, | |
| "eval_logits/chosen": -21.843263626098633, | |
| "eval_logits/rejected": -22.647571563720703, | |
| "eval_logps/chosen": -271.59844970703125, | |
| "eval_logps/rejected": -254.54527282714844, | |
| "eval_loss": 1.1119718551635742, | |
| "eval_rewards/accuracies": 0.5697761178016663, | |
| "eval_rewards/chosen": -1.6705284118652344, | |
| "eval_rewards/margins": 0.6280881762504578, | |
| "eval_rewards/rejected": -2.298616647720337, | |
| "eval_runtime": 228.1658, | |
| "eval_samples_per_second": 11.715, | |
| "eval_steps_per_second": 1.468, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 2.7777777777777777, | |
| "grad_norm": 0.7172908782958984, | |
| "learning_rate": 3.68995633187773e-05, | |
| "logits/chosen": -21.93791389465332, | |
| "logits/rejected": -22.361909866333008, | |
| "logps/chosen": -255.6808319091797, | |
| "logps/rejected": -286.0832214355469, | |
| "loss": 0.0918, | |
| "rewards/accuracies": 0.965749979019165, | |
| "rewards/chosen": -0.06728626787662506, | |
| "rewards/margins": 5.06732177734375, | |
| "rewards/rejected": -5.134607315063477, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 2.7777777777777777, | |
| "eval_logits/chosen": -21.824033737182617, | |
| "eval_logits/rejected": -22.275728225708008, | |
| "eval_logps/chosen": -270.8564147949219, | |
| "eval_logps/rejected": -254.7839813232422, | |
| "eval_loss": 1.133668303489685, | |
| "eval_rewards/accuracies": 0.5802238583564758, | |
| "eval_rewards/chosen": -1.596319317817688, | |
| "eval_rewards/margins": 0.7261707186698914, | |
| "eval_rewards/rejected": -2.3224899768829346, | |
| "eval_runtime": 227.9485, | |
| "eval_samples_per_second": 11.726, | |
| "eval_steps_per_second": 1.47, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 2.9914529914529915, | |
| "grad_norm": 2.079650640487671, | |
| "learning_rate": 3.5807860262008734e-05, | |
| "logits/chosen": -22.237197875976562, | |
| "logits/rejected": -22.402421951293945, | |
| "logps/chosen": -257.87725830078125, | |
| "logps/rejected": -288.0488586425781, | |
| "loss": 0.1018, | |
| "rewards/accuracies": 0.9635000228881836, | |
| "rewards/chosen": -0.3456314504146576, | |
| "rewards/margins": 5.053824424743652, | |
| "rewards/rejected": -5.399456024169922, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 2.9914529914529915, | |
| "eval_logits/chosen": -22.45467758178711, | |
| "eval_logits/rejected": -22.827308654785156, | |
| "eval_logps/chosen": -275.2033996582031, | |
| "eval_logps/rejected": -259.20159912109375, | |
| "eval_loss": 1.1700248718261719, | |
| "eval_rewards/accuracies": 0.5701492428779602, | |
| "eval_rewards/chosen": -2.031022787094116, | |
| "eval_rewards/margins": 0.7332298755645752, | |
| "eval_rewards/rejected": -2.7642529010772705, | |
| "eval_runtime": 227.8703, | |
| "eval_samples_per_second": 11.73, | |
| "eval_steps_per_second": 1.47, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 3.2051282051282053, | |
| "grad_norm": 3.4078361988067627, | |
| "learning_rate": 3.4716157205240176e-05, | |
| "logits/chosen": -23.701507568359375, | |
| "logits/rejected": -23.8421688079834, | |
| "logps/chosen": -263.1128234863281, | |
| "logps/rejected": -315.31719970703125, | |
| "loss": 0.0299, | |
| "rewards/accuracies": 0.9897500276565552, | |
| "rewards/chosen": -0.8062784075737, | |
| "rewards/margins": 7.403973579406738, | |
| "rewards/rejected": -8.210251808166504, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 3.2051282051282053, | |
| "eval_logits/chosen": -24.26601791381836, | |
| "eval_logits/rejected": -24.537738800048828, | |
| "eval_logps/chosen": -295.60528564453125, | |
| "eval_logps/rejected": -280.7348327636719, | |
| "eval_loss": 1.3489611148834229, | |
| "eval_rewards/accuracies": 0.5686567425727844, | |
| "eval_rewards/chosen": -4.071210861206055, | |
| "eval_rewards/margins": 0.846366286277771, | |
| "eval_rewards/rejected": -4.917576789855957, | |
| "eval_runtime": 228.1695, | |
| "eval_samples_per_second": 11.715, | |
| "eval_steps_per_second": 1.468, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 3.4188034188034186, | |
| "grad_norm": 0.8472763895988464, | |
| "learning_rate": 3.362445414847162e-05, | |
| "logits/chosen": -25.03811264038086, | |
| "logits/rejected": -25.47620964050293, | |
| "logps/chosen": -272.96221923828125, | |
| "logps/rejected": -330.9865417480469, | |
| "loss": 0.0335, | |
| "rewards/accuracies": 0.9869999885559082, | |
| "rewards/chosen": -1.7266676425933838, | |
| "rewards/margins": 7.801348686218262, | |
| "rewards/rejected": -9.528016090393066, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 3.4188034188034186, | |
| "eval_logits/chosen": -25.045902252197266, | |
| "eval_logits/rejected": -26.036436080932617, | |
| "eval_logps/chosen": -298.59942626953125, | |
| "eval_logps/rejected": -283.6900329589844, | |
| "eval_loss": 1.3672035932540894, | |
| "eval_rewards/accuracies": 0.5697761178016663, | |
| "eval_rewards/chosen": -4.370626449584961, | |
| "eval_rewards/margins": 0.8424644470214844, | |
| "eval_rewards/rejected": -5.2130913734436035, | |
| "eval_runtime": 228.1698, | |
| "eval_samples_per_second": 11.715, | |
| "eval_steps_per_second": 1.468, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 3.6324786324786325, | |
| "grad_norm": 0.4369616210460663, | |
| "learning_rate": 3.2532751091703054e-05, | |
| "logits/chosen": -25.275936126708984, | |
| "logits/rejected": -25.85784339904785, | |
| "logps/chosen": -272.4268493652344, | |
| "logps/rejected": -328.8055725097656, | |
| "loss": 0.0342, | |
| "rewards/accuracies": 0.9862499833106995, | |
| "rewards/chosen": -1.7520734071731567, | |
| "rewards/margins": 7.620083332061768, | |
| "rewards/rejected": -9.372157096862793, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 3.6324786324786325, | |
| "eval_logits/chosen": -25.376535415649414, | |
| "eval_logits/rejected": -25.840946197509766, | |
| "eval_logps/chosen": -302.3465576171875, | |
| "eval_logps/rejected": -286.4819641113281, | |
| "eval_loss": 1.4073855876922607, | |
| "eval_rewards/accuracies": 0.5574626922607422, | |
| "eval_rewards/chosen": -4.745336055755615, | |
| "eval_rewards/margins": 0.7469544410705566, | |
| "eval_rewards/rejected": -5.492290019989014, | |
| "eval_runtime": 228.1692, | |
| "eval_samples_per_second": 11.715, | |
| "eval_steps_per_second": 1.468, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 3.8461538461538463, | |
| "grad_norm": 0.20020511746406555, | |
| "learning_rate": 3.14410480349345e-05, | |
| "logits/chosen": -25.79690933227539, | |
| "logits/rejected": -26.186351776123047, | |
| "logps/chosen": -275.40826416015625, | |
| "logps/rejected": -333.3716125488281, | |
| "loss": 0.0406, | |
| "rewards/accuracies": 0.9865000247955322, | |
| "rewards/chosen": -2.3063974380493164, | |
| "rewards/margins": 7.773219108581543, | |
| "rewards/rejected": -10.079617500305176, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 3.8461538461538463, | |
| "eval_logits/chosen": -25.633359909057617, | |
| "eval_logits/rejected": -26.33572769165039, | |
| "eval_logps/chosen": -305.1189270019531, | |
| "eval_logps/rejected": -290.773193359375, | |
| "eval_loss": 1.4024347066879272, | |
| "eval_rewards/accuracies": 0.5660447478294373, | |
| "eval_rewards/chosen": -5.022571086883545, | |
| "eval_rewards/margins": 0.8988366723060608, | |
| "eval_rewards/rejected": -5.921407699584961, | |
| "eval_runtime": 227.3147, | |
| "eval_samples_per_second": 11.759, | |
| "eval_steps_per_second": 1.474, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 4.05982905982906, | |
| "grad_norm": 0.4492078125476837, | |
| "learning_rate": 3.0349344978165938e-05, | |
| "logits/chosen": -25.544862747192383, | |
| "logits/rejected": -25.84202003479004, | |
| "logps/chosen": -275.60540771484375, | |
| "logps/rejected": -333.7979431152344, | |
| "loss": 0.0353, | |
| "rewards/accuracies": 0.9869999885559082, | |
| "rewards/chosen": -2.0801212787628174, | |
| "rewards/margins": 7.923834800720215, | |
| "rewards/rejected": -10.00395679473877, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 4.05982905982906, | |
| "eval_logits/chosen": -26.5059871673584, | |
| "eval_logits/rejected": -26.621540069580078, | |
| "eval_logps/chosen": -315.5564880371094, | |
| "eval_logps/rejected": -300.5618591308594, | |
| "eval_loss": 1.492741584777832, | |
| "eval_rewards/accuracies": 0.5660447478294373, | |
| "eval_rewards/chosen": -6.066328525543213, | |
| "eval_rewards/margins": 0.833947479724884, | |
| "eval_rewards/rejected": -6.900275707244873, | |
| "eval_runtime": 227.4988, | |
| "eval_samples_per_second": 11.75, | |
| "eval_steps_per_second": 1.473, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 4.273504273504273, | |
| "grad_norm": 0.786451518535614, | |
| "learning_rate": 2.9257641921397383e-05, | |
| "logits/chosen": -26.779680252075195, | |
| "logits/rejected": -26.80259132385254, | |
| "logps/chosen": -283.5688171386719, | |
| "logps/rejected": -356.3512268066406, | |
| "loss": 0.0127, | |
| "rewards/accuracies": 0.9944999814033508, | |
| "rewards/chosen": -2.842845916748047, | |
| "rewards/margins": 9.423320770263672, | |
| "rewards/rejected": -12.266166687011719, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 4.273504273504273, | |
| "eval_logits/chosen": -27.469865798950195, | |
| "eval_logits/rejected": -27.798917770385742, | |
| "eval_logps/chosen": -325.7637023925781, | |
| "eval_logps/rejected": -311.94171142578125, | |
| "eval_loss": 1.5876415967941284, | |
| "eval_rewards/accuracies": 0.5615671873092651, | |
| "eval_rewards/chosen": -7.0870537757873535, | |
| "eval_rewards/margins": 0.9512065649032593, | |
| "eval_rewards/rejected": -8.038260459899902, | |
| "eval_runtime": 227.4171, | |
| "eval_samples_per_second": 11.754, | |
| "eval_steps_per_second": 1.473, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 4.487179487179487, | |
| "grad_norm": 0.010021047666668892, | |
| "learning_rate": 2.816593886462882e-05, | |
| "logits/chosen": -27.027307510375977, | |
| "logits/rejected": -27.183887481689453, | |
| "logps/chosen": -284.8421325683594, | |
| "logps/rejected": -359.85992431640625, | |
| "loss": 0.0208, | |
| "rewards/accuracies": 0.9887499809265137, | |
| "rewards/chosen": -3.0061757564544678, | |
| "rewards/margins": 9.546944618225098, | |
| "rewards/rejected": -12.553121566772461, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 4.487179487179487, | |
| "eval_logits/chosen": -27.8445987701416, | |
| "eval_logits/rejected": -28.134754180908203, | |
| "eval_logps/chosen": -331.4013977050781, | |
| "eval_logps/rejected": -317.50494384765625, | |
| "eval_loss": 1.6331137418746948, | |
| "eval_rewards/accuracies": 0.5701492428779602, | |
| "eval_rewards/chosen": -7.650820732116699, | |
| "eval_rewards/margins": 0.9437649250030518, | |
| "eval_rewards/rejected": -8.594585418701172, | |
| "eval_runtime": 227.6795, | |
| "eval_samples_per_second": 11.74, | |
| "eval_steps_per_second": 1.471, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 4.700854700854701, | |
| "grad_norm": 0.36542195081710815, | |
| "learning_rate": 2.7074235807860267e-05, | |
| "logits/chosen": -27.794286727905273, | |
| "logits/rejected": -27.915931701660156, | |
| "logps/chosen": -291.84320068359375, | |
| "logps/rejected": -370.82891845703125, | |
| "loss": 0.0187, | |
| "rewards/accuracies": 0.9929999709129333, | |
| "rewards/chosen": -3.9194016456604004, | |
| "rewards/margins": 9.847352027893066, | |
| "rewards/rejected": -13.766753196716309, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 4.700854700854701, | |
| "eval_logits/chosen": -28.695451736450195, | |
| "eval_logits/rejected": -29.109943389892578, | |
| "eval_logps/chosen": -340.71160888671875, | |
| "eval_logps/rejected": -326.3081359863281, | |
| "eval_loss": 1.7010728120803833, | |
| "eval_rewards/accuracies": 0.5533581972122192, | |
| "eval_rewards/chosen": -8.581844329833984, | |
| "eval_rewards/margins": 0.8930591344833374, | |
| "eval_rewards/rejected": -9.474903106689453, | |
| "eval_runtime": 227.9038, | |
| "eval_samples_per_second": 11.729, | |
| "eval_steps_per_second": 1.47, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 4.914529914529915, | |
| "grad_norm": 0.3806762099266052, | |
| "learning_rate": 2.5982532751091705e-05, | |
| "logits/chosen": -28.41119384765625, | |
| "logits/rejected": -29.06536865234375, | |
| "logps/chosen": -296.35723876953125, | |
| "logps/rejected": -373.481201171875, | |
| "loss": 0.0225, | |
| "rewards/accuracies": 0.9915000200271606, | |
| "rewards/chosen": -4.082763671875, | |
| "rewards/margins": 9.720556259155273, | |
| "rewards/rejected": -13.803319931030273, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 4.914529914529915, | |
| "eval_logits/chosen": -29.32524871826172, | |
| "eval_logits/rejected": -30.48952865600586, | |
| "eval_logps/chosen": -336.1420593261719, | |
| "eval_logps/rejected": -321.3468933105469, | |
| "eval_loss": 1.700086236000061, | |
| "eval_rewards/accuracies": 0.5582089424133301, | |
| "eval_rewards/chosen": -8.124887466430664, | |
| "eval_rewards/margins": 0.8538958430290222, | |
| "eval_rewards/rejected": -8.978782653808594, | |
| "eval_runtime": 227.8283, | |
| "eval_samples_per_second": 11.733, | |
| "eval_steps_per_second": 1.47, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 5.128205128205128, | |
| "grad_norm": 0.2094322144985199, | |
| "learning_rate": 2.4890829694323144e-05, | |
| "logits/chosen": -28.792156219482422, | |
| "logits/rejected": -29.474102020263672, | |
| "logps/chosen": -296.71466064453125, | |
| "logps/rejected": -377.149658203125, | |
| "loss": 0.0158, | |
| "rewards/accuracies": 0.9934999942779541, | |
| "rewards/chosen": -4.169726848602295, | |
| "rewards/margins": 10.347012519836426, | |
| "rewards/rejected": -14.516740798950195, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 5.128205128205128, | |
| "eval_logits/chosen": -30.29293441772461, | |
| "eval_logits/rejected": -30.985925674438477, | |
| "eval_logps/chosen": -351.3580627441406, | |
| "eval_logps/rejected": -336.6136474609375, | |
| "eval_loss": 1.815493106842041, | |
| "eval_rewards/accuracies": 0.5555970072746277, | |
| "eval_rewards/chosen": -9.646490097045898, | |
| "eval_rewards/margins": 0.8589639663696289, | |
| "eval_rewards/rejected": -10.505454063415527, | |
| "eval_runtime": 227.9111, | |
| "eval_samples_per_second": 11.728, | |
| "eval_steps_per_second": 1.47, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 5.3418803418803416, | |
| "grad_norm": 0.10701989382505417, | |
| "learning_rate": 2.3799126637554586e-05, | |
| "logits/chosen": -29.149518966674805, | |
| "logits/rejected": -29.762508392333984, | |
| "logps/chosen": -296.66693115234375, | |
| "logps/rejected": -384.7826843261719, | |
| "loss": 0.0129, | |
| "rewards/accuracies": 0.9927499890327454, | |
| "rewards/chosen": -4.225397109985352, | |
| "rewards/margins": 10.851059913635254, | |
| "rewards/rejected": -15.076457023620605, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 5.3418803418803416, | |
| "eval_logits/chosen": -30.771709442138672, | |
| "eval_logits/rejected": -31.801382064819336, | |
| "eval_logps/chosen": -351.3876953125, | |
| "eval_logps/rejected": -337.5948181152344, | |
| "eval_loss": 1.822997808456421, | |
| "eval_rewards/accuracies": 0.5578358173370361, | |
| "eval_rewards/chosen": -9.649447441101074, | |
| "eval_rewards/margins": 0.9541246891021729, | |
| "eval_rewards/rejected": -10.603572845458984, | |
| "eval_runtime": 227.8818, | |
| "eval_samples_per_second": 11.73, | |
| "eval_steps_per_second": 1.47, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 5.555555555555555, | |
| "grad_norm": 5.323533535003662, | |
| "learning_rate": 2.2707423580786028e-05, | |
| "logits/chosen": -29.866849899291992, | |
| "logits/rejected": -30.677040100097656, | |
| "logps/chosen": -301.1296081542969, | |
| "logps/rejected": -388.8807678222656, | |
| "loss": 0.0148, | |
| "rewards/accuracies": 0.9940000176429749, | |
| "rewards/chosen": -4.681130886077881, | |
| "rewards/margins": 10.871023178100586, | |
| "rewards/rejected": -15.552155494689941, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 5.555555555555555, | |
| "eval_logits/chosen": -29.594120025634766, | |
| "eval_logits/rejected": -30.170185089111328, | |
| "eval_logps/chosen": -342.6488952636719, | |
| "eval_logps/rejected": -329.54034423828125, | |
| "eval_loss": 1.7344962358474731, | |
| "eval_rewards/accuracies": 0.5600746273994446, | |
| "eval_rewards/chosen": -8.775569915771484, | |
| "eval_rewards/margins": 1.0225567817687988, | |
| "eval_rewards/rejected": -9.798127174377441, | |
| "eval_runtime": 228.0608, | |
| "eval_samples_per_second": 11.721, | |
| "eval_steps_per_second": 1.469, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 5.769230769230769, | |
| "grad_norm": 0.2315172553062439, | |
| "learning_rate": 2.161572052401747e-05, | |
| "logits/chosen": -29.85978889465332, | |
| "logits/rejected": -30.509546279907227, | |
| "logps/chosen": -301.72674560546875, | |
| "logps/rejected": -391.1932373046875, | |
| "loss": 0.0189, | |
| "rewards/accuracies": 0.9927499890327454, | |
| "rewards/chosen": -4.796882152557373, | |
| "rewards/margins": 10.797426223754883, | |
| "rewards/rejected": -15.594307899475098, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 5.769230769230769, | |
| "eval_logits/chosen": -30.208812713623047, | |
| "eval_logits/rejected": -31.183263778686523, | |
| "eval_logps/chosen": -345.8949890136719, | |
| "eval_logps/rejected": -331.9636535644531, | |
| "eval_loss": 1.7506355047225952, | |
| "eval_rewards/accuracies": 0.5593283772468567, | |
| "eval_rewards/chosen": -9.100179672241211, | |
| "eval_rewards/margins": 0.9402767419815063, | |
| "eval_rewards/rejected": -10.040454864501953, | |
| "eval_runtime": 227.9921, | |
| "eval_samples_per_second": 11.724, | |
| "eval_steps_per_second": 1.469, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 5.982905982905983, | |
| "grad_norm": 4.712192058563232, | |
| "learning_rate": 2.052401746724891e-05, | |
| "logits/chosen": -29.906803131103516, | |
| "logits/rejected": -30.264978408813477, | |
| "logps/chosen": -307.0865173339844, | |
| "logps/rejected": -395.9546813964844, | |
| "loss": 0.0152, | |
| "rewards/accuracies": 0.9944999814033508, | |
| "rewards/chosen": -5.222396373748779, | |
| "rewards/margins": 10.86800479888916, | |
| "rewards/rejected": -16.09040069580078, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 5.982905982905983, | |
| "eval_logits/chosen": -29.900236129760742, | |
| "eval_logits/rejected": -30.382579803466797, | |
| "eval_logps/chosen": -348.7581787109375, | |
| "eval_logps/rejected": -334.68280029296875, | |
| "eval_loss": 1.7904853820800781, | |
| "eval_rewards/accuracies": 0.5559701323509216, | |
| "eval_rewards/chosen": -9.386497497558594, | |
| "eval_rewards/margins": 0.9258707165718079, | |
| "eval_rewards/rejected": -10.312368392944336, | |
| "eval_runtime": 227.9248, | |
| "eval_samples_per_second": 11.728, | |
| "eval_steps_per_second": 1.47, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 6.196581196581197, | |
| "grad_norm": 0.004079462960362434, | |
| "learning_rate": 1.943231441048035e-05, | |
| "logits/chosen": -30.478179931640625, | |
| "logits/rejected": -30.970232009887695, | |
| "logps/chosen": -313.88165283203125, | |
| "logps/rejected": -409.17962646484375, | |
| "loss": 0.0126, | |
| "rewards/accuracies": 0.9942499995231628, | |
| "rewards/chosen": -5.9417924880981445, | |
| "rewards/margins": 11.768869400024414, | |
| "rewards/rejected": -17.710660934448242, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 6.196581196581197, | |
| "eval_logits/chosen": -30.50238800048828, | |
| "eval_logits/rejected": -31.02549171447754, | |
| "eval_logps/chosen": -358.1636047363281, | |
| "eval_logps/rejected": -344.337890625, | |
| "eval_loss": 1.86916184425354, | |
| "eval_rewards/accuracies": 0.5600746273994446, | |
| "eval_rewards/chosen": -10.32703971862793, | |
| "eval_rewards/margins": 0.9508424401283264, | |
| "eval_rewards/rejected": -11.277880668640137, | |
| "eval_runtime": 227.418, | |
| "eval_samples_per_second": 11.754, | |
| "eval_steps_per_second": 1.473, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 6.410256410256411, | |
| "grad_norm": 0.06197773665189743, | |
| "learning_rate": 1.8340611353711792e-05, | |
| "logits/chosen": -30.11530876159668, | |
| "logits/rejected": -30.605209350585938, | |
| "logps/chosen": -308.64007568359375, | |
| "logps/rejected": -403.6331787109375, | |
| "loss": 0.0124, | |
| "rewards/accuracies": 0.9934999942779541, | |
| "rewards/chosen": -5.467129707336426, | |
| "rewards/margins": 11.565047264099121, | |
| "rewards/rejected": -17.032175064086914, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 6.410256410256411, | |
| "eval_logits/chosen": -30.82184600830078, | |
| "eval_logits/rejected": -31.706174850463867, | |
| "eval_logps/chosen": -357.69537353515625, | |
| "eval_logps/rejected": -344.0749206542969, | |
| "eval_loss": 1.8543611764907837, | |
| "eval_rewards/accuracies": 0.5597015023231506, | |
| "eval_rewards/chosen": -10.280218124389648, | |
| "eval_rewards/margins": 0.9713651537895203, | |
| "eval_rewards/rejected": -11.251583099365234, | |
| "eval_runtime": 227.9507, | |
| "eval_samples_per_second": 11.726, | |
| "eval_steps_per_second": 1.47, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 6.6239316239316235, | |
| "grad_norm": 0.03625645488500595, | |
| "learning_rate": 1.7248908296943234e-05, | |
| "logits/chosen": -31.255956649780273, | |
| "logits/rejected": -31.90044403076172, | |
| "logps/chosen": -316.18853759765625, | |
| "logps/rejected": -415.66796875, | |
| "loss": 0.0119, | |
| "rewards/accuracies": 0.9942499995231628, | |
| "rewards/chosen": -6.230967998504639, | |
| "rewards/margins": 11.93471908569336, | |
| "rewards/rejected": -18.165685653686523, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 6.6239316239316235, | |
| "eval_logits/chosen": -31.26849937438965, | |
| "eval_logits/rejected": -32.083431243896484, | |
| "eval_logps/chosen": -362.8932800292969, | |
| "eval_logps/rejected": -351.0294494628906, | |
| "eval_loss": 1.8719128370285034, | |
| "eval_rewards/accuracies": 0.5701492428779602, | |
| "eval_rewards/chosen": -10.800006866455078, | |
| "eval_rewards/margins": 1.1470307111740112, | |
| "eval_rewards/rejected": -11.947038650512695, | |
| "eval_runtime": 227.9667, | |
| "eval_samples_per_second": 11.725, | |
| "eval_steps_per_second": 1.47, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 6.837606837606837, | |
| "grad_norm": 0.20229032635688782, | |
| "learning_rate": 1.6157205240174673e-05, | |
| "logits/chosen": -31.66826629638672, | |
| "logits/rejected": -32.30759048461914, | |
| "logps/chosen": -319.5751647949219, | |
| "logps/rejected": -420.54534912109375, | |
| "loss": 0.0109, | |
| "rewards/accuracies": 0.9947500228881836, | |
| "rewards/chosen": -6.482852935791016, | |
| "rewards/margins": 12.024003982543945, | |
| "rewards/rejected": -18.50685691833496, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 6.837606837606837, | |
| "eval_logits/chosen": -31.825002670288086, | |
| "eval_logits/rejected": -32.77232360839844, | |
| "eval_logps/chosen": -362.9580078125, | |
| "eval_logps/rejected": -349.5175476074219, | |
| "eval_loss": 1.9149656295776367, | |
| "eval_rewards/accuracies": 0.562686562538147, | |
| "eval_rewards/chosen": -10.806483268737793, | |
| "eval_rewards/margins": 0.9893614649772644, | |
| "eval_rewards/rejected": -11.795844078063965, | |
| "eval_runtime": 228.1418, | |
| "eval_samples_per_second": 11.716, | |
| "eval_steps_per_second": 1.468, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 7.051282051282051, | |
| "grad_norm": 0.00038808645331300795, | |
| "learning_rate": 1.5065502183406113e-05, | |
| "logits/chosen": -32.047367095947266, | |
| "logits/rejected": -32.96037673950195, | |
| "logps/chosen": -321.9444274902344, | |
| "logps/rejected": -421.9002380371094, | |
| "loss": 0.0161, | |
| "rewards/accuracies": 0.9925000071525574, | |
| "rewards/chosen": -6.6494622230529785, | |
| "rewards/margins": 12.112425804138184, | |
| "rewards/rejected": -18.76188850402832, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 7.051282051282051, | |
| "eval_logits/chosen": -33.680885314941406, | |
| "eval_logits/rejected": -34.744083404541016, | |
| "eval_logps/chosen": -383.9889831542969, | |
| "eval_logps/rejected": -370.952392578125, | |
| "eval_loss": 2.086275577545166, | |
| "eval_rewards/accuracies": 0.5526119470596313, | |
| "eval_rewards/chosen": -12.909579277038574, | |
| "eval_rewards/margins": 1.0297467708587646, | |
| "eval_rewards/rejected": -13.939325332641602, | |
| "eval_runtime": 226.7868, | |
| "eval_samples_per_second": 11.786, | |
| "eval_steps_per_second": 1.477, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 7.264957264957265, | |
| "grad_norm": 0.022403132170438766, | |
| "learning_rate": 1.3973799126637555e-05, | |
| "logits/chosen": -33.031978607177734, | |
| "logits/rejected": -33.99634552001953, | |
| "logps/chosen": -326.0166931152344, | |
| "logps/rejected": -433.9259948730469, | |
| "loss": 0.0093, | |
| "rewards/accuracies": 0.9952499866485596, | |
| "rewards/chosen": -7.22238826751709, | |
| "rewards/margins": 12.905363082885742, | |
| "rewards/rejected": -20.12775230407715, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 7.264957264957265, | |
| "eval_logits/chosen": -32.838279724121094, | |
| "eval_logits/rejected": -33.81065368652344, | |
| "eval_logps/chosen": -374.7555847167969, | |
| "eval_logps/rejected": -361.67498779296875, | |
| "eval_loss": 1.9890711307525635, | |
| "eval_rewards/accuracies": 0.5570895671844482, | |
| "eval_rewards/chosen": -11.98624038696289, | |
| "eval_rewards/margins": 1.0253472328186035, | |
| "eval_rewards/rejected": -13.011587142944336, | |
| "eval_runtime": 227.8723, | |
| "eval_samples_per_second": 11.73, | |
| "eval_steps_per_second": 1.47, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 7.478632478632479, | |
| "grad_norm": 0.01652335375547409, | |
| "learning_rate": 1.2882096069868996e-05, | |
| "logits/chosen": -32.10330581665039, | |
| "logits/rejected": -32.913116455078125, | |
| "logps/chosen": -319.0428161621094, | |
| "logps/rejected": -421.7063293457031, | |
| "loss": 0.0116, | |
| "rewards/accuracies": 0.9944999814033508, | |
| "rewards/chosen": -6.535008907318115, | |
| "rewards/margins": 12.34512996673584, | |
| "rewards/rejected": -18.880136489868164, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 7.478632478632479, | |
| "eval_logits/chosen": -31.835594177246094, | |
| "eval_logits/rejected": -32.65978240966797, | |
| "eval_logps/chosen": -364.2667541503906, | |
| "eval_logps/rejected": -350.83392333984375, | |
| "eval_loss": 1.9134238958358765, | |
| "eval_rewards/accuracies": 0.5611940026283264, | |
| "eval_rewards/chosen": -10.937359809875488, | |
| "eval_rewards/margins": 0.9901263117790222, | |
| "eval_rewards/rejected": -11.927485466003418, | |
| "eval_runtime": 227.8103, | |
| "eval_samples_per_second": 11.733, | |
| "eval_steps_per_second": 1.471, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 7.6923076923076925, | |
| "grad_norm": 0.0030172993429005146, | |
| "learning_rate": 1.1790393013100438e-05, | |
| "logits/chosen": -31.859935760498047, | |
| "logits/rejected": -32.7746696472168, | |
| "logps/chosen": -316.1585388183594, | |
| "logps/rejected": -419.97430419921875, | |
| "loss": 0.0105, | |
| "rewards/accuracies": 0.9950000047683716, | |
| "rewards/chosen": -6.1652021408081055, | |
| "rewards/margins": 12.33544921875, | |
| "rewards/rejected": -18.500652313232422, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 7.6923076923076925, | |
| "eval_logits/chosen": -33.39469528198242, | |
| "eval_logits/rejected": -34.474544525146484, | |
| "eval_logps/chosen": -379.9172668457031, | |
| "eval_logps/rejected": -366.830322265625, | |
| "eval_loss": 2.0327441692352295, | |
| "eval_rewards/accuracies": 0.5638059973716736, | |
| "eval_rewards/chosen": -12.502408027648926, | |
| "eval_rewards/margins": 1.024713158607483, | |
| "eval_rewards/rejected": -13.527120590209961, | |
| "eval_runtime": 227.4415, | |
| "eval_samples_per_second": 11.752, | |
| "eval_steps_per_second": 1.473, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 7.905982905982906, | |
| "grad_norm": 16.508834838867188, | |
| "learning_rate": 1.0698689956331878e-05, | |
| "logits/chosen": -32.33524703979492, | |
| "logits/rejected": -33.17497253417969, | |
| "logps/chosen": -320.648193359375, | |
| "logps/rejected": -426.4129333496094, | |
| "loss": 0.0141, | |
| "rewards/accuracies": 0.9917500019073486, | |
| "rewards/chosen": -6.537839412689209, | |
| "rewards/margins": 12.470658302307129, | |
| "rewards/rejected": -19.008495330810547, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 7.905982905982906, | |
| "eval_logits/chosen": -32.687374114990234, | |
| "eval_logits/rejected": -33.56389236450195, | |
| "eval_logps/chosen": -370.7414855957031, | |
| "eval_logps/rejected": -357.1487731933594, | |
| "eval_loss": 1.9871249198913574, | |
| "eval_rewards/accuracies": 0.5548507571220398, | |
| "eval_rewards/chosen": -11.584826469421387, | |
| "eval_rewards/margins": 0.9741416573524475, | |
| "eval_rewards/rejected": -12.558969497680664, | |
| "eval_runtime": 227.2911, | |
| "eval_samples_per_second": 11.76, | |
| "eval_steps_per_second": 1.474, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 8.11965811965812, | |
| "grad_norm": 0.008148429915308952, | |
| "learning_rate": 9.60698689956332e-06, | |
| "logits/chosen": -33.27425003051758, | |
| "logits/rejected": -34.29746627807617, | |
| "logps/chosen": -327.61883544921875, | |
| "logps/rejected": -437.17681884765625, | |
| "loss": 0.008, | |
| "rewards/accuracies": 0.9957500100135803, | |
| "rewards/chosen": -7.342708110809326, | |
| "rewards/margins": 13.04981803894043, | |
| "rewards/rejected": -20.392526626586914, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 8.11965811965812, | |
| "eval_logits/chosen": -34.412513732910156, | |
| "eval_logits/rejected": -35.9024658203125, | |
| "eval_logps/chosen": -388.45513916015625, | |
| "eval_logps/rejected": -375.42486572265625, | |
| "eval_loss": 2.118881940841675, | |
| "eval_rewards/accuracies": 0.5604477524757385, | |
| "eval_rewards/chosen": -13.356197357177734, | |
| "eval_rewards/margins": 1.0303833484649658, | |
| "eval_rewards/rejected": -14.386581420898438, | |
| "eval_runtime": 227.1891, | |
| "eval_samples_per_second": 11.766, | |
| "eval_steps_per_second": 1.475, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 8.333333333333334, | |
| "grad_norm": 0.035114262253046036, | |
| "learning_rate": 8.51528384279476e-06, | |
| "logits/chosen": -33.662052154541016, | |
| "logits/rejected": -34.972896575927734, | |
| "logps/chosen": -332.39031982421875, | |
| "logps/rejected": -444.69793701171875, | |
| "loss": 0.0146, | |
| "rewards/accuracies": 0.9940000176429749, | |
| "rewards/chosen": -7.840022563934326, | |
| "rewards/margins": 13.208553314208984, | |
| "rewards/rejected": -21.04857635498047, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 8.333333333333334, | |
| "eval_logits/chosen": -34.22267532348633, | |
| "eval_logits/rejected": -35.91259765625, | |
| "eval_logps/chosen": -386.5843200683594, | |
| "eval_logps/rejected": -373.9736022949219, | |
| "eval_loss": 2.091254711151123, | |
| "eval_rewards/accuracies": 0.5593283772468567, | |
| "eval_rewards/chosen": -13.169110298156738, | |
| "eval_rewards/margins": 1.0723390579223633, | |
| "eval_rewards/rejected": -14.241450309753418, | |
| "eval_runtime": 227.9067, | |
| "eval_samples_per_second": 11.728, | |
| "eval_steps_per_second": 1.47, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 8.547008547008547, | |
| "grad_norm": 0.001891271909698844, | |
| "learning_rate": 7.423580786026202e-06, | |
| "logits/chosen": -33.975555419921875, | |
| "logits/rejected": -35.19069290161133, | |
| "logps/chosen": -332.5311279296875, | |
| "logps/rejected": -444.55194091796875, | |
| "loss": 0.01, | |
| "rewards/accuracies": 0.9952499866485596, | |
| "rewards/chosen": -7.8769989013671875, | |
| "rewards/margins": 13.22789192199707, | |
| "rewards/rejected": -21.104890823364258, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 8.547008547008547, | |
| "eval_logits/chosen": -34.138275146484375, | |
| "eval_logits/rejected": -35.49238586425781, | |
| "eval_logps/chosen": -389.0328369140625, | |
| "eval_logps/rejected": -376.4501953125, | |
| "eval_loss": 2.1092472076416016, | |
| "eval_rewards/accuracies": 0.5593283772468567, | |
| "eval_rewards/chosen": -13.413966178894043, | |
| "eval_rewards/margins": 1.0751436948776245, | |
| "eval_rewards/rejected": -14.48910903930664, | |
| "eval_runtime": 227.7973, | |
| "eval_samples_per_second": 11.734, | |
| "eval_steps_per_second": 1.471, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 8.760683760683762, | |
| "grad_norm": 1.0492886304855347, | |
| "learning_rate": 6.3318777292576415e-06, | |
| "logits/chosen": -33.439266204833984, | |
| "logits/rejected": -34.95777893066406, | |
| "logps/chosen": -331.6947326660156, | |
| "logps/rejected": -441.31298828125, | |
| "loss": 0.0126, | |
| "rewards/accuracies": 0.9937499761581421, | |
| "rewards/chosen": -7.511509418487549, | |
| "rewards/margins": 13.192078590393066, | |
| "rewards/rejected": -20.70358657836914, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 8.760683760683762, | |
| "eval_logits/chosen": -34.35652542114258, | |
| "eval_logits/rejected": -36.15835952758789, | |
| "eval_logps/chosen": -387.4725646972656, | |
| "eval_logps/rejected": -375.294189453125, | |
| "eval_loss": 2.09629487991333, | |
| "eval_rewards/accuracies": 0.562313437461853, | |
| "eval_rewards/chosen": -13.25793743133545, | |
| "eval_rewards/margins": 1.115572452545166, | |
| "eval_rewards/rejected": -14.373512268066406, | |
| "eval_runtime": 227.8406, | |
| "eval_samples_per_second": 11.732, | |
| "eval_steps_per_second": 1.47, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 8.974358974358974, | |
| "grad_norm": 6.9876251220703125, | |
| "learning_rate": 5.240174672489083e-06, | |
| "logits/chosen": -33.97458267211914, | |
| "logits/rejected": -35.557865142822266, | |
| "logps/chosen": -330.39239501953125, | |
| "logps/rejected": -444.573486328125, | |
| "loss": 0.0119, | |
| "rewards/accuracies": 0.9944999814033508, | |
| "rewards/chosen": -7.664352893829346, | |
| "rewards/margins": 13.433502197265625, | |
| "rewards/rejected": -21.09785270690918, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 8.974358974358974, | |
| "eval_logits/chosen": -34.37322235107422, | |
| "eval_logits/rejected": -36.26004409790039, | |
| "eval_logps/chosen": -386.285888671875, | |
| "eval_logps/rejected": -373.96063232421875, | |
| "eval_loss": 2.07737135887146, | |
| "eval_rewards/accuracies": 0.5649253726005554, | |
| "eval_rewards/chosen": -13.139269828796387, | |
| "eval_rewards/margins": 1.1008845567703247, | |
| "eval_rewards/rejected": -14.240155220031738, | |
| "eval_runtime": 227.6828, | |
| "eval_samples_per_second": 11.74, | |
| "eval_steps_per_second": 1.471, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 9.188034188034187, | |
| "grad_norm": 0.0024337973445653915, | |
| "learning_rate": 4.1484716157205246e-06, | |
| "logits/chosen": -33.696048736572266, | |
| "logits/rejected": -35.321414947509766, | |
| "logps/chosen": -330.987548828125, | |
| "logps/rejected": -445.3059387207031, | |
| "loss": 0.007, | |
| "rewards/accuracies": 0.9957500100135803, | |
| "rewards/chosen": -7.504194736480713, | |
| "rewards/margins": 13.350516319274902, | |
| "rewards/rejected": -20.854713439941406, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 9.188034188034187, | |
| "eval_logits/chosen": -34.3525505065918, | |
| "eval_logits/rejected": -36.3557243347168, | |
| "eval_logps/chosen": -384.0542297363281, | |
| "eval_logps/rejected": -371.8487243652344, | |
| "eval_loss": 2.050776958465576, | |
| "eval_rewards/accuracies": 0.5686567425727844, | |
| "eval_rewards/chosen": -12.916106224060059, | |
| "eval_rewards/margins": 1.1128581762313843, | |
| "eval_rewards/rejected": -14.028963088989258, | |
| "eval_runtime": 227.9747, | |
| "eval_samples_per_second": 11.725, | |
| "eval_steps_per_second": 1.469, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 9.401709401709402, | |
| "grad_norm": 0.03277166187763214, | |
| "learning_rate": 3.056768558951965e-06, | |
| "logits/chosen": -34.06507873535156, | |
| "logits/rejected": -35.69638442993164, | |
| "logps/chosen": -332.1161804199219, | |
| "logps/rejected": -444.4291076660156, | |
| "loss": 0.0106, | |
| "rewards/accuracies": 0.9950000047683716, | |
| "rewards/chosen": -7.72641658782959, | |
| "rewards/margins": 13.240401268005371, | |
| "rewards/rejected": -20.966815948486328, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 9.401709401709402, | |
| "eval_logits/chosen": -34.42190933227539, | |
| "eval_logits/rejected": -36.19350051879883, | |
| "eval_logps/chosen": -387.06207275390625, | |
| "eval_logps/rejected": -374.70416259765625, | |
| "eval_loss": 2.0756402015686035, | |
| "eval_rewards/accuracies": 0.5649253726005554, | |
| "eval_rewards/chosen": -13.216888427734375, | |
| "eval_rewards/margins": 1.0976189374923706, | |
| "eval_rewards/rejected": -14.314507484436035, | |
| "eval_runtime": 227.5352, | |
| "eval_samples_per_second": 11.748, | |
| "eval_steps_per_second": 1.472, | |
| "step": 22000 | |
| } | |
| ], | |
| "logging_steps": 500, | |
| "max_steps": 23400, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 1000, | |
| "total_flos": 0.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |