Instructions to use FluffyAIcode/Kakeya-OProver-Stage3-DPO with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FluffyAIcode/Kakeya-OProver-Stage3-DPO with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("m-a-p/OProver-8B") model = PeftModel.from_pretrained(base_model, "FluffyAIcode/Kakeya-OProver-Stage3-DPO") - Notebooks
- Google Colab
- Kaggle
| { | |
| "max_steps": 88, | |
| "save_steps": 22, | |
| "is_world_process_zero": true, | |
| "train_batch_size": 1, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "is_hyper_param_search": false, | |
| "num_input_tokens_seen": 0, | |
| "log_history": [ | |
| { | |
| "epoch": 0.011428571428571429, | |
| "grad_norm": 5.672101974487305, | |
| "learning_rate": 0.0, | |
| "logits/chosen": -0.003827691078186035, | |
| "logits/rejected": 1.6622543334960938, | |
| "logps/chosen": -53.823280334472656, | |
| "logps/rejected": -83.19792175292969, | |
| "loss": 0.6931, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.022857142857142857, | |
| "grad_norm": 5.676645755767822, | |
| "learning_rate": 1.0000000000000002e-06, | |
| "logits/chosen": -0.23317879438400269, | |
| "logits/rejected": 1.487736701965332, | |
| "logps/chosen": -105.3038101196289, | |
| "logps/rejected": -72.62786102294922, | |
| "loss": 0.6931, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.03428571428571429, | |
| "grad_norm": 5.494569778442383, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "logits/chosen": -0.34497007727622986, | |
| "logits/rejected": 1.3572413921356201, | |
| "logps/chosen": -78.18315124511719, | |
| "logps/rejected": -92.42572021484375, | |
| "loss": 0.6925, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.010104288347065449, | |
| "rewards/margins": 0.001475572120398283, | |
| "rewards/rejected": -0.011579860001802444, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.045714285714285714, | |
| "grad_norm": 5.875666618347168, | |
| "learning_rate": 3e-06, | |
| "logits/chosen": 0.0768582671880722, | |
| "logits/rejected": 1.793702244758606, | |
| "logps/chosen": -49.45244598388672, | |
| "logps/rejected": -70.34400939941406, | |
| "loss": 0.6824, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.006157493684440851, | |
| "rewards/margins": 0.02201489359140396, | |
| "rewards/rejected": -0.028172386810183525, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.05714285714285714, | |
| "grad_norm": 4.4969987869262695, | |
| "learning_rate": 4.000000000000001e-06, | |
| "logits/chosen": 0.29756978154182434, | |
| "logits/rejected": 1.5599043369293213, | |
| "logps/chosen": -38.330902099609375, | |
| "logps/rejected": -58.7880859375, | |
| "loss": 0.6602, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.0054547907784581184, | |
| "rewards/margins": 0.06765428930521011, | |
| "rewards/rejected": -0.06219949945807457, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.06857142857142857, | |
| "grad_norm": 5.193802356719971, | |
| "learning_rate": 5e-06, | |
| "logits/chosen": -0.097133569419384, | |
| "logits/rejected": 1.5903254747390747, | |
| "logps/chosen": -71.06304168701172, | |
| "logps/rejected": -69.80386352539062, | |
| "loss": 0.6118, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.02022118680179119, | |
| "rewards/margins": 0.1755855232477188, | |
| "rewards/rejected": -0.15536434948444366, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 4.568131446838379, | |
| "learning_rate": 4.998209387040829e-06, | |
| "logits/chosen": 0.22878801822662354, | |
| "logits/rejected": 1.2406954765319824, | |
| "logps/chosen": -65.77464294433594, | |
| "logps/rejected": -70.03345489501953, | |
| "loss": 0.5809, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.008165514096617699, | |
| "rewards/margins": 0.2519247233867645, | |
| "rewards/rejected": -0.2437591850757599, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.09142857142857143, | |
| "grad_norm": 3.668226480484009, | |
| "learning_rate": 4.992840113199131e-06, | |
| "logits/chosen": -0.06199551001191139, | |
| "logits/rejected": 1.0075984001159668, | |
| "logps/chosen": -31.54962158203125, | |
| "logps/rejected": -48.84445571899414, | |
| "loss": 0.5925, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.006166815757751465, | |
| "rewards/margins": 0.21949976682662964, | |
| "rewards/rejected": -0.21333293616771698, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.10285714285714286, | |
| "grad_norm": 4.007819652557373, | |
| "learning_rate": 4.983899869907963e-06, | |
| "logits/chosen": 0.04794704169034958, | |
| "logits/rejected": 1.0474152565002441, | |
| "logps/chosen": -74.90632629394531, | |
| "logps/rejected": -68.87115478515625, | |
| "loss": 0.5221, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.017194844782352448, | |
| "rewards/margins": 0.40241336822509766, | |
| "rewards/rejected": -0.3852185010910034, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.11428571428571428, | |
| "grad_norm": 4.3215508460998535, | |
| "learning_rate": 4.971401463979722e-06, | |
| "logits/chosen": 0.11494935303926468, | |
| "logits/rejected": 1.1323603391647339, | |
| "logps/chosen": -57.83014678955078, | |
| "logps/rejected": -69.66509246826172, | |
| "loss": 0.4632, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.035677470266819, | |
| "rewards/margins": 0.5738754868507385, | |
| "rewards/rejected": -0.5381979942321777, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.12571428571428572, | |
| "grad_norm": 3.5642457008361816, | |
| "learning_rate": 4.955362799260507e-06, | |
| "logits/chosen": -0.14375551044940948, | |
| "logits/rejected": 0.6537873148918152, | |
| "logps/chosen": -53.47944259643555, | |
| "logps/rejected": -81.25194549560547, | |
| "loss": 0.4828, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.019211266189813614, | |
| "rewards/margins": 0.5275158882141113, | |
| "rewards/rejected": -0.5083046555519104, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.13714285714285715, | |
| "grad_norm": 3.5064291954040527, | |
| "learning_rate": 4.935806850983034e-06, | |
| "logits/chosen": -0.02809108793735504, | |
| "logits/rejected": 1.3847907781600952, | |
| "logps/chosen": -54.27452850341797, | |
| "logps/rejected": -84.8036117553711, | |
| "loss": 0.3669, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.038996659219264984, | |
| "rewards/margins": 0.9113224744796753, | |
| "rewards/rejected": -0.8723257184028625, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.14857142857142858, | |
| "grad_norm": 4.0220561027526855, | |
| "learning_rate": 4.912761632854834e-06, | |
| "logits/chosen": -0.40826213359832764, | |
| "logits/rejected": 1.0781131982803345, | |
| "logps/chosen": -80.10173797607422, | |
| "logps/rejected": -64.88600158691406, | |
| "loss": 0.4242, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.028980137780308723, | |
| "rewards/margins": 0.7560938000679016, | |
| "rewards/rejected": -0.727113664150238, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 3.641127347946167, | |
| "learning_rate": 4.8862601569288885e-06, | |
| "logits/chosen": -0.3284621238708496, | |
| "logits/rejected": 0.6769169569015503, | |
| "logps/chosen": -126.9131088256836, | |
| "logps/rejected": -108.0735855102539, | |
| "loss": 0.378, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10002796351909637, | |
| "rewards/margins": 0.9067593812942505, | |
| "rewards/rejected": -0.8067314028739929, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.17142857142857143, | |
| "grad_norm": 3.1787471771240234, | |
| "learning_rate": 4.8563403863141825e-06, | |
| "logits/chosen": -0.23578333854675293, | |
| "logits/rejected": 0.8872382044792175, | |
| "logps/chosen": -77.02982330322266, | |
| "logps/rejected": -91.4344482421875, | |
| "loss": 0.3247, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.0036322600208222866, | |
| "rewards/margins": 1.1259247064590454, | |
| "rewards/rejected": -1.1295570135116577, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.18285714285714286, | |
| "grad_norm": 3.3664069175720215, | |
| "learning_rate": 4.823045180793914e-06, | |
| "logits/chosen": -0.33357855677604675, | |
| "logits/rejected": 0.9027751088142395, | |
| "logps/chosen": -57.791385650634766, | |
| "logps/rejected": -71.88220977783203, | |
| "loss": 0.3925, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.03762559965252876, | |
| "rewards/margins": 0.8615567684173584, | |
| "rewards/rejected": -0.823931097984314, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.19428571428571428, | |
| "grad_norm": 2.321681261062622, | |
| "learning_rate": 4.786422235429269e-06, | |
| "logits/chosen": -0.2371266484260559, | |
| "logits/rejected": 0.4381519556045532, | |
| "logps/chosen": -45.621620178222656, | |
| "logps/rejected": -89.46638488769531, | |
| "loss": 0.3503, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.028645562008023262, | |
| "rewards/margins": 1.0791183710098267, | |
| "rewards/rejected": -1.0504727363586426, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.2057142857142857, | |
| "grad_norm": 2.6169960498809814, | |
| "learning_rate": 4.746524012236706e-06, | |
| "logits/chosen": -0.1888342797756195, | |
| "logits/rejected": 0.44934579730033875, | |
| "logps/chosen": -69.54957580566406, | |
| "logps/rejected": -59.541568756103516, | |
| "loss": 0.4125, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.0358089953660965, | |
| "rewards/margins": 0.8032007813453674, | |
| "rewards/rejected": -0.7673917412757874, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.21714285714285714, | |
| "grad_norm": 2.923261880874634, | |
| "learning_rate": 4.703407665036622e-06, | |
| "logits/chosen": -0.20129157602787018, | |
| "logits/rejected": 0.6290000677108765, | |
| "logps/chosen": -56.686153411865234, | |
| "logps/rejected": -87.55162048339844, | |
| "loss": 0.264, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.054906971752643585, | |
| "rewards/margins": 1.5454007387161255, | |
| "rewards/rejected": -1.4904940128326416, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.22857142857142856, | |
| "grad_norm": 2.864265203475952, | |
| "learning_rate": 4.657134957581057e-06, | |
| "logits/chosen": -0.3821311295032501, | |
| "logits/rejected": 0.48754024505615234, | |
| "logps/chosen": -62.24723815917969, | |
| "logps/rejected": -60.93783950805664, | |
| "loss": 0.3685, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.06970775872468948, | |
| "rewards/margins": 1.0107057094573975, | |
| "rewards/rejected": -0.9409979581832886, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 1.9049395322799683, | |
| "learning_rate": 4.607772175077712e-06, | |
| "logits/chosen": -0.5025634765625, | |
| "logits/rejected": 0.4401867389678955, | |
| "logps/chosen": -57.89384460449219, | |
| "logps/rejected": -79.51171112060547, | |
| "loss": 0.3142, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.049478232860565186, | |
| "rewards/margins": 1.3050354719161987, | |
| "rewards/rejected": -1.2555571794509888, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.25142857142857145, | |
| "grad_norm": 2.7351036071777344, | |
| "learning_rate": 4.555390029237026e-06, | |
| "logits/chosen": -0.36178550124168396, | |
| "logits/rejected": 0.8178424835205078, | |
| "logps/chosen": -65.52536010742188, | |
| "logps/rejected": -100.3760986328125, | |
| "loss": 0.2818, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.06696957349777222, | |
| "rewards/margins": 1.5236375331878662, | |
| "rewards/rejected": -1.5906071662902832, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.25142857142857145, | |
| "eval_logits/chosen": -0.36531969904899597, | |
| "eval_logits/rejected": 0.3482947051525116, | |
| "eval_logps/chosen": -87.77478790283203, | |
| "eval_logps/rejected": -92.11418914794922, | |
| "eval_loss": 0.30896151065826416, | |
| "eval_rewards/accuracies": 0.9800000190734863, | |
| "eval_rewards/chosen": -0.20244216918945312, | |
| "eval_rewards/margins": 1.3565798997879028, | |
| "eval_rewards/rejected": -1.559022068977356, | |
| "eval_runtime": 209.0014, | |
| "eval_samples_per_second": 0.957, | |
| "eval_steps_per_second": 0.957, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.26285714285714284, | |
| "grad_norm": 2.936436653137207, | |
| "learning_rate": 4.5000635569783365e-06, | |
| "logits/chosen": -0.278434157371521, | |
| "logits/rejected": 0.1438252478837967, | |
| "logps/chosen": -70.02806091308594, | |
| "logps/rejected": -57.32536697387695, | |
| "loss": 0.3441, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.005648649297654629, | |
| "rewards/margins": 1.069925308227539, | |
| "rewards/rejected": -1.0642765760421753, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.2742857142857143, | |
| "grad_norm": 1.480675458908081, | |
| "learning_rate": 4.4418720129402145e-06, | |
| "logits/chosen": -0.6613065004348755, | |
| "logits/rejected": 0.20875723659992218, | |
| "logps/chosen": -43.0631217956543, | |
| "logps/rejected": -113.96063995361328, | |
| "loss": 0.2264, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.007623173296451569, | |
| "rewards/margins": 1.854811191558838, | |
| "rewards/rejected": -1.8471879959106445, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.2857142857142857, | |
| "grad_norm": 2.0406107902526855, | |
| "learning_rate": 4.3808987559489536e-06, | |
| "logits/chosen": -0.4824203848838806, | |
| "logits/rejected": 0.370841383934021, | |
| "logps/chosen": -39.89043426513672, | |
| "logps/rejected": -89.99382781982422, | |
| "loss": 0.2224, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.0602618083357811, | |
| "rewards/margins": 1.6918809413909912, | |
| "rewards/rejected": -1.6316192150115967, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.29714285714285715, | |
| "grad_norm": 2.2385094165802, | |
| "learning_rate": 4.317231129607859e-06, | |
| "logits/chosen": -0.5961613655090332, | |
| "logits/rejected": 0.14968276023864746, | |
| "logps/chosen": -76.45050048828125, | |
| "logps/rejected": -99.48614501953125, | |
| "loss": 0.2123, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.07128332555294037, | |
| "rewards/margins": 1.763782024383545, | |
| "rewards/rejected": -1.6924986839294434, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.30857142857142855, | |
| "grad_norm": 1.6301268339157104, | |
| "learning_rate": 4.2509603371783776e-06, | |
| "logits/chosen": -0.3383774161338806, | |
| "logits/rejected": 0.15638643503189087, | |
| "logps/chosen": -58.246971130371094, | |
| "logps/rejected": -79.45714569091797, | |
| "loss": 0.2009, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.04440131038427353, | |
| "rewards/margins": 1.9561799764633179, | |
| "rewards/rejected": -2.0005815029144287, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 2.236377716064453, | |
| "learning_rate": 4.1821813109322975e-06, | |
| "logits/chosen": -0.647399365901947, | |
| "logits/rejected": 0.22453227639198303, | |
| "logps/chosen": -88.88107299804688, | |
| "logps/rejected": -96.83210754394531, | |
| "loss": 0.2263, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.040186457335948944, | |
| "rewards/margins": 1.824659824371338, | |
| "rewards/rejected": -1.7844732999801636, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.3314285714285714, | |
| "grad_norm": 2.0542852878570557, | |
| "learning_rate": 4.110992576162193e-06, | |
| "logits/chosen": -0.5227777361869812, | |
| "logits/rejected": -0.2961636781692505, | |
| "logps/chosen": -78.49622344970703, | |
| "logps/rejected": -78.24589538574219, | |
| "loss": 0.2121, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10791393369436264, | |
| "rewards/margins": 1.7918672561645508, | |
| "rewards/rejected": -1.6839532852172852, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.34285714285714286, | |
| "grad_norm": 1.9906846284866333, | |
| "learning_rate": 4.037496110044885e-06, | |
| "logits/chosen": -0.44146519899368286, | |
| "logits/rejected": 0.24826864898204803, | |
| "logps/chosen": -89.6866683959961, | |
| "logps/rejected": -122.11793518066406, | |
| "loss": 0.1621, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.04959860444068909, | |
| "rewards/margins": 2.5837507247924805, | |
| "rewards/rejected": -2.6333494186401367, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.35428571428571426, | |
| "grad_norm": 2.3201839923858643, | |
| "learning_rate": 3.961797195560118e-06, | |
| "logits/chosen": -0.37571054697036743, | |
| "logits/rejected": -0.12684349715709686, | |
| "logps/chosen": -62.36381530761719, | |
| "logps/rejected": -68.8594741821289, | |
| "loss": 0.2406, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.013891173526644707, | |
| "rewards/margins": 1.7061822414398193, | |
| "rewards/rejected": -1.6922911405563354, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.3657142857142857, | |
| "grad_norm": 1.7459288835525513, | |
| "learning_rate": 3.884004270673711e-06, | |
| "logits/chosen": -0.4904371500015259, | |
| "logits/rejected": -0.09516231715679169, | |
| "logps/chosen": -51.67000198364258, | |
| "logps/rejected": -87.77179718017578, | |
| "loss": 0.1739, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.05766277387738228, | |
| "rewards/margins": 2.167266845703125, | |
| "rewards/rejected": -2.1096038818359375, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.37714285714285717, | |
| "grad_norm": 1.9478814601898193, | |
| "learning_rate": 3.8042287730012117e-06, | |
| "logits/chosen": -0.7833026051521301, | |
| "logits/rejected": -0.14795458316802979, | |
| "logps/chosen": -49.5107307434082, | |
| "logps/rejected": -77.62210845947266, | |
| "loss": 0.1861, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.02107466384768486, | |
| "rewards/margins": 1.9514578580856323, | |
| "rewards/rejected": -1.9303834438323975, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.38857142857142857, | |
| "grad_norm": 2.1133761405944824, | |
| "learning_rate": 3.7225849801745835e-06, | |
| "logits/chosen": -0.8189583420753479, | |
| "logits/rejected": -0.24318619072437286, | |
| "logps/chosen": -75.10845947265625, | |
| "logps/rejected": -111.31871032714844, | |
| "loss": 0.1489, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.029190005734562874, | |
| "rewards/margins": 2.6350479125976562, | |
| "rewards/rejected": -2.6058578491210938, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 2.116342306137085, | |
| "learning_rate": 3.6391898461406045e-06, | |
| "logits/chosen": -0.4198293685913086, | |
| "logits/rejected": -0.3276508152484894, | |
| "logps/chosen": -63.513519287109375, | |
| "logps/rejected": -93.56440734863281, | |
| "loss": 0.2266, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09839610755443573, | |
| "rewards/margins": 1.798091173171997, | |
| "rewards/rejected": -1.6996949911117554, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.4114285714285714, | |
| "grad_norm": 1.6935662031173706, | |
| "learning_rate": 3.55416283362546e-06, | |
| "logits/chosen": -0.8055887222290039, | |
| "logits/rejected": 0.15487802028656006, | |
| "logps/chosen": -46.510643005371094, | |
| "logps/rejected": -105.87352752685547, | |
| "loss": 0.1607, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.033490121364593506, | |
| "rewards/margins": 2.649106025695801, | |
| "rewards/rejected": -2.6156160831451416, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.4228571428571429, | |
| "grad_norm": 2.2720091342926025, | |
| "learning_rate": 3.4676257430055438e-06, | |
| "logits/chosen": -0.8104305267333984, | |
| "logits/rejected": 0.04826318100094795, | |
| "logps/chosen": -77.22013854980469, | |
| "logps/rejected": -98.19013977050781, | |
| "loss": 0.1415, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.03917883336544037, | |
| "rewards/margins": 2.6867618560791016, | |
| "rewards/rejected": -2.6475830078125, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.4342857142857143, | |
| "grad_norm": 1.546297550201416, | |
| "learning_rate": 3.3797025378295826e-06, | |
| "logits/chosen": -0.8403704166412354, | |
| "logits/rejected": 0.052355289459228516, | |
| "logps/chosen": -56.61090087890625, | |
| "logps/rejected": -119.7930679321289, | |
| "loss": 0.1658, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.022541070356965065, | |
| "rewards/margins": 2.8231887817382812, | |
| "rewards/rejected": -2.800647735595703, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.44571428571428573, | |
| "grad_norm": 2.0681819915771484, | |
| "learning_rate": 3.29051916724206e-06, | |
| "logits/chosen": -0.6301568746566772, | |
| "logits/rejected": -0.32246649265289307, | |
| "logps/chosen": -66.40396118164062, | |
| "logps/rejected": -81.09312438964844, | |
| "loss": 0.1799, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.009487343952059746, | |
| "rewards/margins": 2.2801120281219482, | |
| "rewards/rejected": -2.2706246376037598, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.45714285714285713, | |
| "grad_norm": 1.4052331447601318, | |
| "learning_rate": 3.2002033855622683e-06, | |
| "logits/chosen": -0.8533369302749634, | |
| "logits/rejected": -0.4283853769302368, | |
| "logps/chosen": -47.345802307128906, | |
| "logps/rejected": -93.77117919921875, | |
| "loss": 0.1517, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.026743369176983833, | |
| "rewards/margins": 2.6302499771118164, | |
| "rewards/rejected": -2.6569931507110596, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.4685714285714286, | |
| "grad_norm": 2.0809950828552246, | |
| "learning_rate": 3.1088845692774798e-06, | |
| "logits/chosen": -0.6270914077758789, | |
| "logits/rejected": -0.6155582070350647, | |
| "logps/chosen": -88.60835266113281, | |
| "logps/rejected": -67.6736831665039, | |
| "loss": 0.1825, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.04146631807088852, | |
| "rewards/margins": 2.0336129665374756, | |
| "rewards/rejected": -1.9921468496322632, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 1.1893919706344604, | |
| "learning_rate": 3.0166935317123824e-06, | |
| "logits/chosen": -1.0347564220428467, | |
| "logits/rejected": -0.4240405261516571, | |
| "logps/chosen": -56.76289367675781, | |
| "logps/rejected": -103.66142272949219, | |
| "loss": 0.1124, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.057413943111896515, | |
| "rewards/margins": 3.0061051845550537, | |
| "rewards/rejected": -3.06351900100708, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.49142857142857144, | |
| "grad_norm": 1.1706154346466064, | |
| "learning_rate": 2.9237623356402423e-06, | |
| "logits/chosen": -1.0618159770965576, | |
| "logits/rejected": -0.327092707157135, | |
| "logps/chosen": -32.207794189453125, | |
| "logps/rejected": -111.8665771484375, | |
| "loss": 0.0903, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.027263116091489792, | |
| "rewards/margins": 3.3231871128082275, | |
| "rewards/rejected": -3.350450277328491, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.5028571428571429, | |
| "grad_norm": 1.079911470413208, | |
| "learning_rate": 2.8302241041042564e-06, | |
| "logits/chosen": -1.1862759590148926, | |
| "logits/rejected": -0.7669480443000793, | |
| "logps/chosen": -89.4259262084961, | |
| "logps/rejected": -127.56314086914062, | |
| "loss": 0.0967, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.14472071826457977, | |
| "rewards/margins": 3.0603933334350586, | |
| "rewards/rejected": -2.915672540664673, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.5028571428571429, | |
| "eval_logits/chosen": -0.8571964502334595, | |
| "eval_logits/rejected": -0.6531373858451843, | |
| "eval_logps/chosen": -90.10453033447266, | |
| "eval_logps/rejected": -104.75491333007812, | |
| "eval_loss": 0.17935897409915924, | |
| "eval_rewards/accuracies": 0.9700000286102295, | |
| "eval_rewards/chosen": -0.4354174733161926, | |
| "eval_rewards/margins": 2.387676954269409, | |
| "eval_rewards/rejected": -2.8230948448181152, | |
| "eval_runtime": 208.3973, | |
| "eval_samples_per_second": 0.96, | |
| "eval_steps_per_second": 0.96, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.5142857142857142, | |
| "grad_norm": 1.5324379205703735, | |
| "learning_rate": 2.7362128297200784e-06, | |
| "logits/chosen": -0.7203244566917419, | |
| "logits/rejected": -0.5576686859130859, | |
| "logps/chosen": -65.52645874023438, | |
| "logps/rejected": -95.54450988769531, | |
| "loss": 0.1323, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.1149684339761734, | |
| "rewards/margins": 2.6911990642547607, | |
| "rewards/rejected": -2.576230525970459, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.5257142857142857, | |
| "grad_norm": 1.2247161865234375, | |
| "learning_rate": 2.6418631827326857e-06, | |
| "logits/chosen": -0.9313367009162903, | |
| "logits/rejected": -0.8070792555809021, | |
| "logps/chosen": -55.876502990722656, | |
| "logps/rejected": -119.91787719726562, | |
| "loss": 0.1285, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.06400280445814133, | |
| "rewards/margins": 2.901925802230835, | |
| "rewards/rejected": -2.837923288345337, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.5371428571428571, | |
| "grad_norm": 1.3425116539001465, | |
| "learning_rate": 2.547310318102548e-06, | |
| "logits/chosen": -0.9409236907958984, | |
| "logits/rejected": -0.7352248430252075, | |
| "logps/chosen": -50.5601806640625, | |
| "logps/rejected": -86.23294830322266, | |
| "loss": 0.1466, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09888257831335068, | |
| "rewards/margins": 2.470425844192505, | |
| "rewards/rejected": -2.3715431690216064, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.5485714285714286, | |
| "grad_norm": 1.4391740560531616, | |
| "learning_rate": 2.4526896818974534e-06, | |
| "logits/chosen": -0.8374643921852112, | |
| "logits/rejected": -0.47213953733444214, | |
| "logps/chosen": -50.190616607666016, | |
| "logps/rejected": -91.12651824951172, | |
| "loss": 0.1023, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.009993518702685833, | |
| "rewards/margins": 2.796506881713867, | |
| "rewards/rejected": -2.8065006732940674, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 1.5294134616851807, | |
| "learning_rate": 2.358136817267315e-06, | |
| "logits/chosen": -0.8648539185523987, | |
| "logits/rejected": -0.736384391784668, | |
| "logps/chosen": -72.85952758789062, | |
| "logps/rejected": -83.08409881591797, | |
| "loss": 0.1516, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.09306713193655014, | |
| "rewards/margins": 2.5247979164123535, | |
| "rewards/rejected": -2.4317305088043213, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 1.6909253597259521, | |
| "learning_rate": 2.263787170279922e-06, | |
| "logits/chosen": -1.3599584102630615, | |
| "logits/rejected": -1.2676033973693848, | |
| "logps/chosen": -78.65673065185547, | |
| "logps/rejected": -69.09491729736328, | |
| "loss": 0.1557, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.00439932756125927, | |
| "rewards/margins": 2.1822092533111572, | |
| "rewards/rejected": -2.177809953689575, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.5828571428571429, | |
| "grad_norm": 1.3136837482452393, | |
| "learning_rate": 2.169775895895745e-06, | |
| "logits/chosen": -0.7750363349914551, | |
| "logits/rejected": -0.7582042217254639, | |
| "logps/chosen": -48.27521514892578, | |
| "logps/rejected": -105.779541015625, | |
| "loss": 0.0944, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.060845933854579926, | |
| "rewards/margins": 3.2103078365325928, | |
| "rewards/rejected": -3.1494617462158203, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.5942857142857143, | |
| "grad_norm": 1.304816722869873, | |
| "learning_rate": 2.0762376643597586e-06, | |
| "logits/chosen": -0.7206559777259827, | |
| "logits/rejected": -0.7368943691253662, | |
| "logps/chosen": -49.27516174316406, | |
| "logps/rejected": -99.28387451171875, | |
| "loss": 0.1227, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.08159955590963364, | |
| "rewards/margins": 2.943441390991211, | |
| "rewards/rejected": -2.861841917037964, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.6057142857142858, | |
| "grad_norm": 1.1686677932739258, | |
| "learning_rate": 1.9833064682876175e-06, | |
| "logits/chosen": -0.7927972674369812, | |
| "logits/rejected": -0.8789339065551758, | |
| "logps/chosen": -62.97304916381836, | |
| "logps/rejected": -93.07855224609375, | |
| "loss": 0.097, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10683320462703705, | |
| "rewards/margins": 2.952019453048706, | |
| "rewards/rejected": -2.8451859951019287, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.6171428571428571, | |
| "grad_norm": 0.7459912300109863, | |
| "learning_rate": 1.8911154307225204e-06, | |
| "logits/chosen": -0.7670217752456665, | |
| "logits/rejected": -0.7017982006072998, | |
| "logps/chosen": -31.30267333984375, | |
| "logps/rejected": -110.78553771972656, | |
| "loss": 0.0593, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.003862532787024975, | |
| "rewards/margins": 3.5174167156219482, | |
| "rewards/rejected": -3.513554096221924, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.6285714285714286, | |
| "grad_norm": 1.5418952703475952, | |
| "learning_rate": 1.7997966144377328e-06, | |
| "logits/chosen": -0.986474871635437, | |
| "logits/rejected": -1.1061036586761475, | |
| "logps/chosen": -47.49861526489258, | |
| "logps/rejected": -67.53656005859375, | |
| "loss": 0.1543, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.04688534885644913, | |
| "rewards/margins": 2.227695941925049, | |
| "rewards/rejected": -2.27458119392395, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 1.0748093128204346, | |
| "learning_rate": 1.7094808327579401e-06, | |
| "logits/chosen": -1.324556589126587, | |
| "logits/rejected": -0.8223966360092163, | |
| "logps/chosen": -36.40914535522461, | |
| "logps/rejected": -105.08839416503906, | |
| "loss": 0.084, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.07963553071022034, | |
| "rewards/margins": 3.377859354019165, | |
| "rewards/rejected": -3.4574952125549316, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.6514285714285715, | |
| "grad_norm": 0.9280484318733215, | |
| "learning_rate": 1.6202974621704176e-06, | |
| "logits/chosen": -1.450647234916687, | |
| "logits/rejected": -0.8040248155593872, | |
| "logps/chosen": -68.76046752929688, | |
| "logps/rejected": -125.3299331665039, | |
| "loss": 0.0635, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.06499414145946503, | |
| "rewards/margins": 3.9410018920898438, | |
| "rewards/rejected": -3.876007318496704, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.6628571428571428, | |
| "grad_norm": 0.8896822333335876, | |
| "learning_rate": 1.5323742569944573e-06, | |
| "logits/chosen": -1.0071394443511963, | |
| "logits/rejected": -1.0022106170654297, | |
| "logps/chosen": -45.09584426879883, | |
| "logps/rejected": -109.64781951904297, | |
| "loss": 0.0802, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.034890901297330856, | |
| "rewards/margins": 3.5162737369537354, | |
| "rewards/rejected": -3.4813833236694336, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.6742857142857143, | |
| "grad_norm": 0.7682043313980103, | |
| "learning_rate": 1.44583716637454e-06, | |
| "logits/chosen": -1.0028694868087769, | |
| "logits/rejected": -0.813642144203186, | |
| "logps/chosen": -66.2764663696289, | |
| "logps/rejected": -112.77369689941406, | |
| "loss": 0.0576, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.0501595139503479, | |
| "rewards/margins": 3.7721147537231445, | |
| "rewards/rejected": -3.822274684906006, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.6857142857142857, | |
| "grad_norm": 1.0216327905654907, | |
| "learning_rate": 1.3608101538593965e-06, | |
| "logits/chosen": -1.1250649690628052, | |
| "logits/rejected": -0.9627130627632141, | |
| "logps/chosen": -42.440757751464844, | |
| "logps/rejected": -100.12843322753906, | |
| "loss": 0.0804, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.11411059647798538, | |
| "rewards/margins": 3.393651247024536, | |
| "rewards/rejected": -3.2795403003692627, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.6971428571428572, | |
| "grad_norm": 0.7271348834037781, | |
| "learning_rate": 1.277415019825417e-06, | |
| "logits/chosen": -0.7807080745697021, | |
| "logits/rejected": -0.7796292304992676, | |
| "logps/chosen": -33.5434455871582, | |
| "logps/rejected": -112.23175048828125, | |
| "loss": 0.0711, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.06058162823319435, | |
| "rewards/margins": 3.8745694160461426, | |
| "rewards/rejected": -3.9351511001586914, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.7085714285714285, | |
| "grad_norm": 1.7274105548858643, | |
| "learning_rate": 1.195771226998789e-06, | |
| "logits/chosen": -0.9823087453842163, | |
| "logits/rejected": -1.2148367166519165, | |
| "logps/chosen": -72.55377960205078, | |
| "logps/rejected": -75.32920837402344, | |
| "loss": 0.1183, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.12965497374534607, | |
| "rewards/margins": 2.7459590435028076, | |
| "rewards/rejected": -2.8756141662597656, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.9623571038246155, | |
| "learning_rate": 1.1159957293262888e-06, | |
| "logits/chosen": -1.0808844566345215, | |
| "logits/rejected": -0.8635554909706116, | |
| "logps/chosen": -49.637996673583984, | |
| "logps/rejected": -116.99398803710938, | |
| "loss": 0.09, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.02851293236017227, | |
| "rewards/margins": 3.4344334602355957, | |
| "rewards/rejected": -3.4059205055236816, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.7314285714285714, | |
| "grad_norm": 1.0066514015197754, | |
| "learning_rate": 1.0382028044398823e-06, | |
| "logits/chosen": -1.197101354598999, | |
| "logits/rejected": -1.1306017637252808, | |
| "logps/chosen": -50.98615264892578, | |
| "logps/rejected": -120.8044662475586, | |
| "loss": 0.0899, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.035914015024900436, | |
| "rewards/margins": 3.1908507347106934, | |
| "rewards/rejected": -3.2267649173736572, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.7428571428571429, | |
| "grad_norm": 1.1005553007125854, | |
| "learning_rate": 9.625038899551162e-07, | |
| "logits/chosen": -1.22350013256073, | |
| "logits/rejected": -1.1208860874176025, | |
| "logps/chosen": -66.32962036132812, | |
| "logps/rejected": -103.34649658203125, | |
| "loss": 0.0709, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18690410256385803, | |
| "rewards/margins": 3.4826159477233887, | |
| "rewards/rejected": -3.2957119941711426, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.7542857142857143, | |
| "grad_norm": 0.954483687877655, | |
| "learning_rate": 8.890074238378074e-07, | |
| "logits/chosen": -0.9665268659591675, | |
| "logits/rejected": -0.8029574751853943, | |
| "logps/chosen": -43.259857177734375, | |
| "logps/rejected": -104.5782241821289, | |
| "loss": 0.0993, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.044777870178222656, | |
| "rewards/margins": 3.1982903480529785, | |
| "rewards/rejected": -3.243067979812622, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.7542857142857143, | |
| "eval_logits/chosen": -1.1089446544647217, | |
| "eval_logits/rejected": -1.1692878007888794, | |
| "eval_logps/chosen": -91.48172760009766, | |
| "eval_logps/rejected": -110.86624145507812, | |
| "eval_loss": 0.14132851362228394, | |
| "eval_rewards/accuracies": 0.9700000286102295, | |
| "eval_rewards/chosen": -0.573137104511261, | |
| "eval_rewards/margins": 2.8610901832580566, | |
| "eval_rewards/rejected": -3.4342269897460938, | |
| "eval_runtime": 208.8549, | |
| "eval_samples_per_second": 0.958, | |
| "eval_steps_per_second": 0.958, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.7657142857142857, | |
| "grad_norm": 0.9773061871528625, | |
| "learning_rate": 8.178186890677029e-07, | |
| "logits/chosen": -1.02699875831604, | |
| "logits/rejected": -1.1385068893432617, | |
| "logps/chosen": -80.82888793945312, | |
| "logps/rejected": -100.25572967529297, | |
| "loss": 0.072, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.0796530619263649, | |
| "rewards/margins": 3.1960816383361816, | |
| "rewards/rejected": -3.116428852081299, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.7771428571428571, | |
| "grad_norm": 1.2940922975540161, | |
| "learning_rate": 7.490396628216237e-07, | |
| "logits/chosen": -1.2090729475021362, | |
| "logits/rejected": -1.2437564134597778, | |
| "logps/chosen": -87.85923767089844, | |
| "logps/rejected": -120.87287902832031, | |
| "loss": 0.1183, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.018895722925662994, | |
| "rewards/margins": 2.969498634338379, | |
| "rewards/rejected": -2.9506030082702637, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.7885714285714286, | |
| "grad_norm": 0.7793561220169067, | |
| "learning_rate": 6.827688703921407e-07, | |
| "logits/chosen": -1.1516605615615845, | |
| "logits/rejected": -1.295521855354309, | |
| "logps/chosen": -52.94973373413086, | |
| "logps/rejected": -84.64179229736328, | |
| "loss": 0.067, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18537920713424683, | |
| "rewards/margins": 3.4953463077545166, | |
| "rewards/rejected": -3.309967041015625, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 1.4742248058319092, | |
| "learning_rate": 6.191012440510469e-07, | |
| "logits/chosen": -1.3784356117248535, | |
| "logits/rejected": -1.3366318941116333, | |
| "logps/chosen": -57.7204475402832, | |
| "logps/rejected": -90.2862548828125, | |
| "loss": 0.1197, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.044269490987062454, | |
| "rewards/margins": 2.759215831756592, | |
| "rewards/rejected": -2.80348539352417, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.8114285714285714, | |
| "grad_norm": 0.7249897718429565, | |
| "learning_rate": 5.581279870597866e-07, | |
| "logits/chosen": -1.1907292604446411, | |
| "logits/rejected": -0.6756631731987, | |
| "logps/chosen": -32.33828353881836, | |
| "logps/rejected": -125.02144622802734, | |
| "loss": 0.0525, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.06472505629062653, | |
| "rewards/margins": 4.0654168128967285, | |
| "rewards/rejected": -4.130141258239746, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.8228571428571428, | |
| "grad_norm": 1.0847841501235962, | |
| "learning_rate": 4.999364430216639e-07, | |
| "logits/chosen": -1.237339735031128, | |
| "logits/rejected": -1.5806419849395752, | |
| "logps/chosen": -52.456146240234375, | |
| "logps/rejected": -94.31544494628906, | |
| "loss": 0.0992, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.10363951325416565, | |
| "rewards/margins": 2.9890761375427246, | |
| "rewards/rejected": -2.885436534881592, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.8342857142857143, | |
| "grad_norm": 1.278956651687622, | |
| "learning_rate": 4.4460997076297504e-07, | |
| "logits/chosen": -1.0774935483932495, | |
| "logits/rejected": -1.4760003089904785, | |
| "logps/chosen": -43.07012939453125, | |
| "logps/rejected": -74.25629425048828, | |
| "loss": 0.1131, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.06534770131111145, | |
| "rewards/margins": 2.8206787109375, | |
| "rewards/rejected": -2.75533127784729, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.8457142857142858, | |
| "grad_norm": 0.7833404541015625, | |
| "learning_rate": 3.922278249222894e-07, | |
| "logits/chosen": -1.1311602592468262, | |
| "logits/rejected": -1.0242271423339844, | |
| "logps/chosen": -53.541568756103516, | |
| "logps/rejected": -105.48152923583984, | |
| "loss": 0.0774, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.04792798310518265, | |
| "rewards/margins": 3.678433418273926, | |
| "rewards/rejected": -3.6305058002471924, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.8571428571428571, | |
| "grad_norm": 1.03605318069458, | |
| "learning_rate": 3.4286504241894283e-07, | |
| "logits/chosen": -0.9688073992729187, | |
| "logits/rejected": -1.2700920104980469, | |
| "logps/chosen": -38.00965118408203, | |
| "logps/rejected": -92.08466339111328, | |
| "loss": 0.1049, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.01876715011894703, | |
| "rewards/margins": 3.16585636138916, | |
| "rewards/rejected": -3.1846237182617188, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.8685714285714285, | |
| "grad_norm": 1.319770336151123, | |
| "learning_rate": 2.965923349633779e-07, | |
| "logits/chosen": -1.3658266067504883, | |
| "logits/rejected": -1.3608825206756592, | |
| "logps/chosen": -49.00103759765625, | |
| "logps/rejected": -117.49503326416016, | |
| "loss": 0.0818, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.09428122639656067, | |
| "rewards/margins": 3.61112642288208, | |
| "rewards/rejected": -3.7054080963134766, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 0.9297468662261963, | |
| "learning_rate": 2.53475987763295e-07, | |
| "logits/chosen": -1.0338634252548218, | |
| "logits/rejected": -1.1930313110351562, | |
| "logps/chosen": -67.0118179321289, | |
| "logps/rejected": -106.61903381347656, | |
| "loss": 0.0727, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.13288229703903198, | |
| "rewards/margins": 3.487334728240967, | |
| "rewards/rejected": -3.6202168464660645, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.8914285714285715, | |
| "grad_norm": 1.1066629886627197, | |
| "learning_rate": 2.135777645707318e-07, | |
| "logits/chosen": -1.384450078010559, | |
| "logits/rejected": -1.3552913665771484, | |
| "logps/chosen": -52.43301010131836, | |
| "logps/rejected": -101.87602996826172, | |
| "loss": 0.0989, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.009377628564834595, | |
| "rewards/margins": 3.135222911834717, | |
| "rewards/rejected": -3.125845432281494, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.9028571428571428, | |
| "grad_norm": 1.0631781816482544, | |
| "learning_rate": 1.7695481920608716e-07, | |
| "logits/chosen": -1.1844675540924072, | |
| "logits/rejected": -1.0223643779754639, | |
| "logps/chosen": -45.87510299682617, | |
| "logps/rejected": -102.84295654296875, | |
| "loss": 0.0862, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.05180816724896431, | |
| "rewards/margins": 3.2761740684509277, | |
| "rewards/rejected": -3.3279824256896973, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.9142857142857143, | |
| "grad_norm": 1.2742042541503906, | |
| "learning_rate": 1.4365961368581844e-07, | |
| "logits/chosen": -1.2797547578811646, | |
| "logits/rejected": -1.6902124881744385, | |
| "logps/chosen": -79.47929382324219, | |
| "logps/rejected": -78.93382263183594, | |
| "loss": 0.1025, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.0567280538380146, | |
| "rewards/margins": 2.9206228256225586, | |
| "rewards/rejected": -2.977350950241089, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.9257142857142857, | |
| "grad_norm": 0.8278792500495911, | |
| "learning_rate": 1.137398430711123e-07, | |
| "logits/chosen": -1.119363784790039, | |
| "logits/rejected": -0.9186141490936279, | |
| "logps/chosen": -29.899991989135742, | |
| "logps/rejected": -105.7519302368164, | |
| "loss": 0.0648, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.031892240047454834, | |
| "rewards/margins": 3.5144004821777344, | |
| "rewards/rejected": -3.4825081825256348, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.9371428571428572, | |
| "grad_norm": 1.0955795049667358, | |
| "learning_rate": 8.723836714516681e-08, | |
| "logits/chosen": -1.2281020879745483, | |
| "logits/rejected": -1.3817219734191895, | |
| "logps/chosen": -73.53196716308594, | |
| "logps/rejected": -103.11698913574219, | |
| "loss": 0.0811, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.06516408920288086, | |
| "rewards/margins": 3.2024097442626953, | |
| "rewards/rejected": -3.267573833465576, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.9485714285714286, | |
| "grad_norm": 0.6436601877212524, | |
| "learning_rate": 6.419314901696671e-08, | |
| "logits/chosen": -1.2053653001785278, | |
| "logits/rejected": -1.208804965019226, | |
| "logps/chosen": -28.06381607055664, | |
| "logps/rejected": -100.99942016601562, | |
| "loss": 0.0586, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.027196241542696953, | |
| "rewards/margins": 3.633328437805176, | |
| "rewards/rejected": -3.660524845123291, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.9888738393783569, | |
| "learning_rate": 4.4637200739493514e-08, | |
| "logits/chosen": -1.231987714767456, | |
| "logits/rejected": -1.143172025680542, | |
| "logps/chosen": -57.63927459716797, | |
| "logps/rejected": -96.07897186279297, | |
| "loss": 0.1077, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.05573497712612152, | |
| "rewards/margins": 3.1897521018981934, | |
| "rewards/rejected": -3.2454872131347656, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.9714285714285714, | |
| "grad_norm": 1.0415937900543213, | |
| "learning_rate": 2.8598536020278678e-08, | |
| "logits/chosen": -1.221508264541626, | |
| "logits/rejected": -1.4119690656661987, | |
| "logps/chosen": -48.45242691040039, | |
| "logps/rejected": -84.4826431274414, | |
| "loss": 0.0827, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.04423363134264946, | |
| "rewards/margins": 3.218625545501709, | |
| "rewards/rejected": -3.174391984939575, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.9828571428571429, | |
| "grad_norm": 1.0360701084136963, | |
| "learning_rate": 1.6100130092037704e-08, | |
| "logits/chosen": -1.3318215608596802, | |
| "logits/rejected": -1.6143568754196167, | |
| "logps/chosen": -45.959354400634766, | |
| "logps/rejected": -79.45930480957031, | |
| "loss": 0.0892, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.08850360661745071, | |
| "rewards/margins": 2.9804043769836426, | |
| "rewards/rejected": -3.068908214569092, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.9942857142857143, | |
| "grad_norm": 0.7161802053451538, | |
| "learning_rate": 7.159886800869875e-09, | |
| "logits/chosen": -1.1106700897216797, | |
| "logits/rejected": -0.9769763946533203, | |
| "logps/chosen": -85.0906982421875, | |
| "logps/rejected": -132.0802459716797, | |
| "loss": 0.0524, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.0784958153963089, | |
| "rewards/margins": 4.037193298339844, | |
| "rewards/rejected": -4.115689277648926, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 2.9429450035095215, | |
| "learning_rate": 1.7906129591713228e-09, | |
| "logits/chosen": -1.2418022155761719, | |
| "logits/rejected": -0.8798779249191284, | |
| "logps/chosen": -90.4301986694336, | |
| "logps/rejected": -115.04806518554688, | |
| "loss": 0.0987, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": -0.08904826641082764, | |
| "rewards/margins": 3.531545639038086, | |
| "rewards/rejected": -3.620594024658203, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_logits/chosen": -1.1477130651474, | |
| "eval_logits/rejected": -1.244410514831543, | |
| "eval_logps/chosen": -91.70614624023438, | |
| "eval_logps/rejected": -111.82247161865234, | |
| "eval_loss": 0.1359921395778656, | |
| "eval_rewards/accuracies": 0.9700000286102295, | |
| "eval_rewards/chosen": -0.5955771207809448, | |
| "eval_rewards/margins": 2.9342737197875977, | |
| "eval_rewards/rejected": -3.529850959777832, | |
| "eval_runtime": 209.3361, | |
| "eval_samples_per_second": 0.955, | |
| "eval_steps_per_second": 0.955, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "step": 88, | |
| "total_flos": 0.0, | |
| "train_loss": 0.2132695221172815, | |
| "train_runtime": 4416.7921, | |
| "train_samples_per_second": 0.317, | |
| "train_steps_per_second": 0.02 | |
| } | |
| ], | |
| "trial_params": null, | |
| "global_step": 88, | |
| "is_local_process_zero": true, | |
| "total_flos": 0.0, | |
| "num_train_epochs": 1, | |
| "epoch": 1.0, | |
| "best_metric": null, | |
| "trial_name": null | |
| } | |