Instructions to use FrontiersMind/Lumma-0.6B-Instruct with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use FrontiersMind/Lumma-0.6B-Instruct with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="FrontiersMind/Lumma-0.6B-Instruct", trust_remote_code=True) messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("FrontiersMind/Lumma-0.6B-Instruct", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use FrontiersMind/Lumma-0.6B-Instruct with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "FrontiersMind/Lumma-0.6B-Instruct" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FrontiersMind/Lumma-0.6B-Instruct", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/FrontiersMind/Lumma-0.6B-Instruct
- SGLang
How to use FrontiersMind/Lumma-0.6B-Instruct with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "FrontiersMind/Lumma-0.6B-Instruct" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FrontiersMind/Lumma-0.6B-Instruct", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "FrontiersMind/Lumma-0.6B-Instruct" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "FrontiersMind/Lumma-0.6B-Instruct", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use FrontiersMind/Lumma-0.6B-Instruct with Docker Model Runner:
docker model run hf.co/FrontiersMind/Lumma-0.6B-Instruct
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.1254115065057219, | |
| "eval_steps": 500, | |
| "global_step": 200, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.171857863664627, | |
| "epoch": 0.0006270575325286095, | |
| "grad_norm": 36.12955856323242, | |
| "learning_rate": 0.0, | |
| "logits/chosen": -16.618545689498976, | |
| "logits/rejected": -19.895854701940685, | |
| "logps/chosen": -618.4926280975342, | |
| "logps/rejected": -544.1511726379395, | |
| "loss": 1.0, | |
| "mean_token_accuracy": 0.7207779660820961, | |
| "num_tokens": 44742.0, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3859521597623825, | |
| "epoch": 0.001254115065057219, | |
| "grad_norm": 35.26237487792969, | |
| "learning_rate": 1e-08, | |
| "logits/chosen": -16.148485680429634, | |
| "logits/rejected": -15.444903538915032, | |
| "logps/chosen": -789.9899635314941, | |
| "logps/rejected": -629.6869964599609, | |
| "loss": 1.0, | |
| "mean_token_accuracy": 0.6869945079088211, | |
| "num_tokens": 96877.0, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.1979895681142807, | |
| "epoch": 0.0018811725975858284, | |
| "grad_norm": 41.65127944946289, | |
| "learning_rate": 2e-08, | |
| "logits/chosen": -18.29156918013904, | |
| "logits/rejected": -19.65692519211939, | |
| "logps/chosen": -1245.2266998291016, | |
| "logps/rejected": -570.8414497375488, | |
| "loss": 1.0063536167144775, | |
| "mean_token_accuracy": 0.6914148852229118, | |
| "num_tokens": 168920.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.017706198908854276, | |
| "rewards/margins": -0.025545110227540135, | |
| "rewards/rejected": 0.007838911202270538, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.1795232072472572, | |
| "epoch": 0.002508230130114438, | |
| "grad_norm": 44.819602966308594, | |
| "learning_rate": 3e-08, | |
| "logits/chosen": -20.724100083229605, | |
| "logits/rejected": -19.704480662994772, | |
| "logps/chosen": -1142.84916305542, | |
| "logps/rejected": -649.1872062683105, | |
| "loss": 1.0045382976531982, | |
| "mean_token_accuracy": 0.7210699692368507, | |
| "num_tokens": 243342.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.00683369068428874, | |
| "rewards/margins": -0.01820890378439799, | |
| "rewards/rejected": 0.025042592780664563, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.2270928248763084, | |
| "epoch": 0.0031352876626430477, | |
| "grad_norm": 32.66579055786133, | |
| "learning_rate": 4e-08, | |
| "logits/chosen": -16.499294980475682, | |
| "logits/rejected": -17.05921506779658, | |
| "logps/chosen": -709.8800754547119, | |
| "logps/rejected": -586.3846015930176, | |
| "loss": 1.0000782012939453, | |
| "mean_token_accuracy": 0.7035035043954849, | |
| "num_tokens": 295956.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.004917382728308439, | |
| "rewards/margins": -0.00028197653591632843, | |
| "rewards/rejected": -0.004635405610315502, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.8437139950692654, | |
| "epoch": 0.003762345195171657, | |
| "grad_norm": 35.4331169128418, | |
| "learning_rate": 5e-08, | |
| "logits/chosen": -21.37335490682356, | |
| "logits/rejected": -21.437480680261856, | |
| "logps/chosen": -284.04754638671875, | |
| "logps/rejected": -445.4689540863037, | |
| "loss": 0.9983432292938232, | |
| "mean_token_accuracy": 0.8082250654697418, | |
| "num_tokens": 342091.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.01554340252187103, | |
| "rewards/margins": 0.0067013868829235435, | |
| "rewards/rejected": 0.008842015580739826, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.0479743406176567, | |
| "epoch": 0.004389402727700266, | |
| "grad_norm": 37.445518493652344, | |
| "learning_rate": 6e-08, | |
| "logits/chosen": -18.649493652023672, | |
| "logits/rejected": -18.4066487416478, | |
| "logps/chosen": -805.4484777450562, | |
| "logps/rejected": -680.746976852417, | |
| "loss": 0.9999387264251709, | |
| "mean_token_accuracy": 0.7536595985293388, | |
| "num_tokens": 402856.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.002710643340833485, | |
| "rewards/margins": 0.00014570658095180988, | |
| "rewards/rejected": 0.0025649368471931666, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 0.9191301837563515, | |
| "epoch": 0.005016460260228876, | |
| "grad_norm": 38.56687927246094, | |
| "learning_rate": 7e-08, | |
| "logits/chosen": -23.125927299845493, | |
| "logits/rejected": -18.183520901420447, | |
| "logps/chosen": -924.5588388442993, | |
| "logps/rejected": -373.86534118652344, | |
| "loss": 0.9900327324867249, | |
| "mean_token_accuracy": 0.7644752189517021, | |
| "num_tokens": 466828.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.01720759950694628, | |
| "rewards/margins": 0.04020594718167558, | |
| "rewards/rejected": -0.02299834630684927, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 0.9575163498520851, | |
| "epoch": 0.005643517792757485, | |
| "grad_norm": 40.65217590332031, | |
| "learning_rate": 8e-08, | |
| "logits/chosen": -21.412901522784708, | |
| "logits/rejected": -21.05138834665733, | |
| "logps/chosen": -816.7314529418945, | |
| "logps/rejected": -663.6353340148926, | |
| "loss": 1.0026217699050903, | |
| "mean_token_accuracy": 0.771336242556572, | |
| "num_tokens": 527777.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.005182235909160227, | |
| "rewards/margins": -0.010497396113350987, | |
| "rewards/rejected": 0.005315160844475031, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.193418636918068, | |
| "epoch": 0.006270575325286095, | |
| "grad_norm": 42.18134689331055, | |
| "learning_rate": 9e-08, | |
| "logits/chosen": -20.675864147312936, | |
| "logits/rejected": -20.81446933923923, | |
| "logps/chosen": -905.0363216400146, | |
| "logps/rejected": -529.3571662902832, | |
| "loss": 1.0143247842788696, | |
| "mean_token_accuracy": 0.7211106270551682, | |
| "num_tokens": 582379.0, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": -0.04024720628513023, | |
| "rewards/margins": -0.05793563392944634, | |
| "rewards/rejected": 0.01768842909950763, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.0013729706406593, | |
| "epoch": 0.006897632857814705, | |
| "grad_norm": 26.49334144592285, | |
| "learning_rate": 1e-07, | |
| "logits/chosen": -18.441954576827186, | |
| "logits/rejected": -20.784630543895993, | |
| "logps/chosen": -532.7153358459473, | |
| "logps/rejected": -424.26265144348145, | |
| "loss": 0.9981816411018372, | |
| "mean_token_accuracy": 0.7596741318702698, | |
| "num_tokens": 629715.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.00034768966725096107, | |
| "rewards/margins": 0.007268631597980857, | |
| "rewards/rejected": -0.006920939544215798, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.0685330666601658, | |
| "epoch": 0.007524690390343314, | |
| "grad_norm": 34.10297393798828, | |
| "learning_rate": 1.0999999999999999e-07, | |
| "logits/chosen": -20.029515190554566, | |
| "logits/rejected": -21.2224080516646, | |
| "logps/chosen": -728.1428518295288, | |
| "logps/rejected": -420.13951873779297, | |
| "loss": 0.9948853850364685, | |
| "mean_token_accuracy": 0.7521882280707359, | |
| "num_tokens": 675406.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.010362100991187617, | |
| "rewards/margins": 0.020601681084372103, | |
| "rewards/rejected": -0.030963782221078873, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.0431296452879906, | |
| "epoch": 0.008151747922871924, | |
| "grad_norm": 26.776187896728516, | |
| "learning_rate": 1.2e-07, | |
| "logits/chosen": -19.538335123973816, | |
| "logits/rejected": -20.38955248873754, | |
| "logps/chosen": -445.5426654815674, | |
| "logps/rejected": -416.24525260925293, | |
| "loss": 0.997660756111145, | |
| "mean_token_accuracy": 0.7694718763232231, | |
| "num_tokens": 722623.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.010003616625908762, | |
| "rewards/margins": 0.009433707047719508, | |
| "rewards/rejected": 0.0005699098983313888, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.328450158238411, | |
| "epoch": 0.008778805455400532, | |
| "grad_norm": 40.44959259033203, | |
| "learning_rate": 1.3e-07, | |
| "logits/chosen": -16.50173976340228, | |
| "logits/rejected": -18.966777530094504, | |
| "logps/chosen": -1086.8657112121582, | |
| "logps/rejected": -677.222972869873, | |
| "loss": 0.9905858039855957, | |
| "mean_token_accuracy": 0.6911511719226837, | |
| "num_tokens": 786297.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.018621409428305924, | |
| "rewards/margins": 0.03770919982343912, | |
| "rewards/rejected": -0.01908779090445023, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.0233074873685837, | |
| "epoch": 0.009405862987929142, | |
| "grad_norm": 28.252763748168945, | |
| "learning_rate": 1.4e-07, | |
| "logits/chosen": -17.86138401016042, | |
| "logits/rejected": -19.831209346381634, | |
| "logps/chosen": -449.9010829925537, | |
| "logps/rejected": -492.7903289794922, | |
| "loss": 1.0015244483947754, | |
| "mean_token_accuracy": 0.7536996155977249, | |
| "num_tokens": 837006.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.0008059862302616239, | |
| "rewards/margins": -0.006120585021562874, | |
| "rewards/rejected": 0.006926572299562395, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.1438564285635948, | |
| "epoch": 0.010032920520457752, | |
| "grad_norm": 39.57615280151367, | |
| "learning_rate": 1.5e-07, | |
| "logits/chosen": -17.861874499690074, | |
| "logits/rejected": -19.590980097470435, | |
| "logps/chosen": -791.6395130157471, | |
| "logps/rejected": -567.6202964782715, | |
| "loss": 0.9942368268966675, | |
| "mean_token_accuracy": 0.7436006516218185, | |
| "num_tokens": 896266.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.008153757720720023, | |
| "rewards/margins": 0.023181513650342822, | |
| "rewards/rejected": -0.015027755754999816, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.1797396391630173, | |
| "epoch": 0.010659978052986362, | |
| "grad_norm": 31.603225708007812, | |
| "learning_rate": 1.6e-07, | |
| "logits/chosen": -16.27227861739119, | |
| "logits/rejected": -20.263959422316383, | |
| "logps/chosen": -687.8001708984375, | |
| "logps/rejected": -614.8188095092773, | |
| "loss": 1.00355064868927, | |
| "mean_token_accuracy": 0.7303128838539124, | |
| "num_tokens": 962374.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.0015672160079702735, | |
| "rewards/margins": -0.014266991434851661, | |
| "rewards/rejected": 0.012699775630608201, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.9821090400218964, | |
| "epoch": 0.01128703558551497, | |
| "grad_norm": 30.358339309692383, | |
| "learning_rate": 1.7000000000000001e-07, | |
| "logits/chosen": -19.800772516773982, | |
| "logits/rejected": -17.959288041851217, | |
| "logps/chosen": -607.3202495574951, | |
| "logps/rejected": -534.6925010681152, | |
| "loss": 1.002077579498291, | |
| "mean_token_accuracy": 0.7688523679971695, | |
| "num_tokens": 1016007.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.0275348040740937, | |
| "rewards/margins": -0.008413461735472083, | |
| "rewards/rejected": -0.019121342920698225, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.2196400687098503, | |
| "epoch": 0.01191409311804358, | |
| "grad_norm": 37.30662536621094, | |
| "learning_rate": 1.8e-07, | |
| "logits/chosen": -17.72504789763709, | |
| "logits/rejected": -16.12664834863506, | |
| "logps/chosen": -813.8953742980957, | |
| "logps/rejected": -505.71807956695557, | |
| "loss": 1.004115343093872, | |
| "mean_token_accuracy": 0.7162602841854095, | |
| "num_tokens": 1080373.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.006188086466863751, | |
| "rewards/margins": -0.016581419855356216, | |
| "rewards/rejected": 0.010393334203399718, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.1595325469970703, | |
| "epoch": 0.01254115065057219, | |
| "grad_norm": 44.13706970214844, | |
| "learning_rate": 1.8999999999999998e-07, | |
| "logits/chosen": -19.441370010137216, | |
| "logits/rejected": -19.42652252828183, | |
| "logps/chosen": -1272.5718240737915, | |
| "logps/rejected": -622.7399673461914, | |
| "loss": 1.0018830299377441, | |
| "mean_token_accuracy": 0.7498048022389412, | |
| "num_tokens": 1154517.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.02443491853773594, | |
| "rewards/margins": -0.007660747622139752, | |
| "rewards/rejected": -0.016774169402197003, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.1010279133915901, | |
| "epoch": 0.013168208183100799, | |
| "grad_norm": 41.25276184082031, | |
| "learning_rate": 2e-07, | |
| "logits/chosen": -21.419456943034934, | |
| "logits/rejected": -18.181673739978688, | |
| "logps/chosen": -728.3854866027832, | |
| "logps/rejected": -525.0471820831299, | |
| "loss": 0.9977896213531494, | |
| "mean_token_accuracy": 0.7623501494526863, | |
| "num_tokens": 1212935.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.010096669750055298, | |
| "rewards/margins": 0.008904347196221352, | |
| "rewards/rejected": 0.0011923184501938522, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.028150089085102, | |
| "epoch": 0.01379526571562941, | |
| "grad_norm": 36.785099029541016, | |
| "learning_rate": 2.0999999999999997e-07, | |
| "logits/chosen": -21.92485367743462, | |
| "logits/rejected": -18.499413813157435, | |
| "logps/chosen": -951.3307018280029, | |
| "logps/rejected": -426.83284759521484, | |
| "loss": 0.9958165884017944, | |
| "mean_token_accuracy": 0.7534473612904549, | |
| "num_tokens": 1281702.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.011519648949615657, | |
| "rewards/margins": 0.01635956938844174, | |
| "rewards/rejected": -0.027879221714101732, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.9120204672217369, | |
| "epoch": 0.01442232324815802, | |
| "grad_norm": 36.060447692871094, | |
| "learning_rate": 2.1999999999999998e-07, | |
| "logits/chosen": -20.064261738727723, | |
| "logits/rejected": -21.198644490481797, | |
| "logps/chosen": -380.3253688812256, | |
| "logps/rejected": -429.5263252258301, | |
| "loss": 0.9947471022605896, | |
| "mean_token_accuracy": 0.7963218614459038, | |
| "num_tokens": 1327486.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.007161529851146042, | |
| "rewards/margins": 0.02124298777198419, | |
| "rewards/rejected": -0.014081457338761538, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.282885067164898, | |
| "epoch": 0.015049380780686628, | |
| "grad_norm": 29.555295944213867, | |
| "learning_rate": 2.3e-07, | |
| "logits/chosen": -14.928810725754646, | |
| "logits/rejected": -15.783012175933775, | |
| "logps/chosen": -594.7181587219238, | |
| "logps/rejected": -425.2836685180664, | |
| "loss": 1.0085357427597046, | |
| "mean_token_accuracy": 0.7083301916718483, | |
| "num_tokens": 1377436.0, | |
| "rewards/accuracies": 0.28125, | |
| "rewards/chosen": -0.018809219647664577, | |
| "rewards/margins": -0.03420144016854465, | |
| "rewards/rejected": 0.015392220113426447, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.170431300997734, | |
| "epoch": 0.015676438313215236, | |
| "grad_norm": 30.94621467590332, | |
| "learning_rate": 2.4e-07, | |
| "logits/chosen": -15.975754306334057, | |
| "logits/rejected": -18.080566240707103, | |
| "logps/chosen": -616.5587253570557, | |
| "logps/rejected": -574.7409896850586, | |
| "loss": 0.995916485786438, | |
| "mean_token_accuracy": 0.7270784974098206, | |
| "num_tokens": 1424961.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.010408571077277884, | |
| "rewards/margins": 0.01637996477074921, | |
| "rewards/rejected": -0.00597139319870621, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.8303776457905769, | |
| "epoch": 0.016303495845743848, | |
| "grad_norm": 33.599998474121094, | |
| "learning_rate": 2.5e-07, | |
| "logits/chosen": -25.26339476179235, | |
| "logits/rejected": -21.119193724011815, | |
| "logps/chosen": -830.6931796073914, | |
| "logps/rejected": -321.0673656463623, | |
| "loss": 1.0016303062438965, | |
| "mean_token_accuracy": 0.7916704788804054, | |
| "num_tokens": 1479087.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.01703651063144207, | |
| "rewards/margins": -0.007413207786157727, | |
| "rewards/rejected": -0.009623300982639194, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.991417720913887, | |
| "epoch": 0.016930553378272456, | |
| "grad_norm": 36.997718811035156, | |
| "learning_rate": 2.6e-07, | |
| "logits/chosen": -21.212152458499872, | |
| "logits/rejected": -18.952785907097258, | |
| "logps/chosen": -704.5350914001465, | |
| "logps/rejected": -370.6160888671875, | |
| "loss": 0.9924548864364624, | |
| "mean_token_accuracy": 0.7522578835487366, | |
| "num_tokens": 1545047.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.017328572226688266, | |
| "rewards/margins": 0.03090921661350876, | |
| "rewards/rejected": -0.013580642873421311, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.9894383996725082, | |
| "epoch": 0.017557610910801064, | |
| "grad_norm": 32.38890838623047, | |
| "learning_rate": 2.7e-07, | |
| "logits/chosen": -15.813927428167577, | |
| "logits/rejected": -17.403900338000618, | |
| "logps/chosen": -491.92512130737305, | |
| "logps/rejected": -495.05503511428833, | |
| "loss": 0.9995163083076477, | |
| "mean_token_accuracy": 0.7497244253754616, | |
| "num_tokens": 1594476.0, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.008761245291680098, | |
| "rewards/margins": 0.001895940862596035, | |
| "rewards/rejected": -0.010657186910975724, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.9598497748374939, | |
| "epoch": 0.018184668443329676, | |
| "grad_norm": 37.41246795654297, | |
| "learning_rate": 2.8e-07, | |
| "logits/chosen": -19.56551149166531, | |
| "logits/rejected": -19.280089414645445, | |
| "logps/chosen": -857.0342273712158, | |
| "logps/rejected": -602.1430015563965, | |
| "loss": 0.9875982403755188, | |
| "mean_token_accuracy": 0.7813946753740311, | |
| "num_tokens": 1660065.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.013675417518243194, | |
| "rewards/margins": 0.05004646920133382, | |
| "rewards/rejected": -0.03637105316738598, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.324970230460167, | |
| "epoch": 0.018811725975858284, | |
| "grad_norm": 36.4524040222168, | |
| "learning_rate": 2.9e-07, | |
| "logits/chosen": -21.331314482840543, | |
| "logits/rejected": -18.526820149021674, | |
| "logps/chosen": -1117.674301147461, | |
| "logps/rejected": -583.0690956115723, | |
| "loss": 1.0027996301651, | |
| "mean_token_accuracy": 0.687925897538662, | |
| "num_tokens": 1720616.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.020995987113565207, | |
| "rewards/margins": -0.01269948878325522, | |
| "rewards/rejected": -0.008296501007862389, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.0734140500426292, | |
| "epoch": 0.019438783508386896, | |
| "grad_norm": 46.66982650756836, | |
| "learning_rate": 3e-07, | |
| "logits/chosen": -16.946001394868276, | |
| "logits/rejected": -16.085758178871664, | |
| "logps/chosen": -1352.3280754089355, | |
| "logps/rejected": -446.2639093399048, | |
| "loss": 0.9967788457870483, | |
| "mean_token_accuracy": 0.7191508114337921, | |
| "num_tokens": 1811101.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0069078231463208795, | |
| "rewards/margins": 0.012905016890726984, | |
| "rewards/rejected": -0.005997193278744817, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.323067456483841, | |
| "epoch": 0.020065841040915505, | |
| "grad_norm": 43.25249099731445, | |
| "learning_rate": 3.1e-07, | |
| "logits/chosen": -17.15731645945775, | |
| "logits/rejected": -16.6517620046484, | |
| "logps/chosen": -1334.5013446807861, | |
| "logps/rejected": -645.0475730895996, | |
| "loss": 0.9926663637161255, | |
| "mean_token_accuracy": 0.7025224380195141, | |
| "num_tokens": 1874585.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0028306127060204744, | |
| "rewards/margins": 0.0292252313811332, | |
| "rewards/rejected": -0.032055844203568995, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.0061679631471634, | |
| "epoch": 0.020692898573444113, | |
| "grad_norm": 31.95186996459961, | |
| "learning_rate": 3.2e-07, | |
| "logits/chosen": -19.57589939389031, | |
| "logits/rejected": -19.90894640965601, | |
| "logps/chosen": -616.9296951293945, | |
| "logps/rejected": -426.7467842102051, | |
| "loss": 1.0076781511306763, | |
| "mean_token_accuracy": 0.7674555331468582, | |
| "num_tokens": 1923915.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": -0.03830282250419259, | |
| "rewards/margins": -0.031945616006851196, | |
| "rewards/rejected": -0.006357205333188176, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.9171701222658157, | |
| "epoch": 0.021319956105972725, | |
| "grad_norm": 40.395572662353516, | |
| "learning_rate": 3.3e-07, | |
| "logits/chosen": -23.769768694096186, | |
| "logits/rejected": -21.32001457302996, | |
| "logps/chosen": -1274.3026218414307, | |
| "logps/rejected": -430.8449001312256, | |
| "loss": 0.991915225982666, | |
| "mean_token_accuracy": 0.7600029706954956, | |
| "num_tokens": 1992060.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0150325192080345, | |
| "rewards/margins": 0.03390131541527808, | |
| "rewards/rejected": -0.01886879827361554, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.1749595329165459, | |
| "epoch": 0.021947013638501333, | |
| "grad_norm": 44.95557403564453, | |
| "learning_rate": 3.4000000000000003e-07, | |
| "logits/chosen": -20.226573322321272, | |
| "logits/rejected": -19.058830108404514, | |
| "logps/chosen": -1253.8970890045166, | |
| "logps/rejected": -554.8555345535278, | |
| "loss": 1.0085124969482422, | |
| "mean_token_accuracy": 0.7034121379256248, | |
| "num_tokens": 2055149.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.031581409042701125, | |
| "rewards/margins": -0.03442110400646925, | |
| "rewards/rejected": 0.002839697408489883, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.1094688102602959, | |
| "epoch": 0.02257407117102994, | |
| "grad_norm": 40.33211135864258, | |
| "learning_rate": 3.5e-07, | |
| "logits/chosen": -20.24939867823679, | |
| "logits/rejected": -20.34034861023941, | |
| "logps/chosen": -832.8481521606445, | |
| "logps/rejected": -694.2218322753906, | |
| "loss": 0.9992198944091797, | |
| "mean_token_accuracy": 0.7405928075313568, | |
| "num_tokens": 2115443.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.009844484797213227, | |
| "rewards/margins": 0.0029849251732230186, | |
| "rewards/rejected": -0.01282941095996648, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.9377781078219414, | |
| "epoch": 0.023201128703558553, | |
| "grad_norm": 34.241668701171875, | |
| "learning_rate": 3.6e-07, | |
| "logits/chosen": -23.224412647259843, | |
| "logits/rejected": -21.117019989134523, | |
| "logps/chosen": -721.9840965270996, | |
| "logps/rejected": -388.344877243042, | |
| "loss": 0.99440598487854, | |
| "mean_token_accuracy": 0.7658621892333031, | |
| "num_tokens": 2172629.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.016015969216823578, | |
| "rewards/margins": 0.022238188714254647, | |
| "rewards/rejected": -0.0062222188571467996, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.0614213570952415, | |
| "epoch": 0.02382818623608716, | |
| "grad_norm": 34.88137435913086, | |
| "learning_rate": 3.7e-07, | |
| "logits/chosen": -21.41548795553992, | |
| "logits/rejected": -18.69351990419123, | |
| "logps/chosen": -1103.8941230773926, | |
| "logps/rejected": -619.8993282318115, | |
| "loss": 1.011991024017334, | |
| "mean_token_accuracy": 0.7375566810369492, | |
| "num_tokens": 2243025.0, | |
| "rewards/accuracies": 0.25, | |
| "rewards/chosen": -0.0650398419238627, | |
| "rewards/margins": -0.04807211959268898, | |
| "rewards/rejected": -0.016967719770036638, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.2264064773917198, | |
| "epoch": 0.02445524376861577, | |
| "grad_norm": 32.48948669433594, | |
| "learning_rate": 3.7999999999999996e-07, | |
| "logits/chosen": -18.42769778338538, | |
| "logits/rejected": -16.890675790644988, | |
| "logps/chosen": -775.1542854309082, | |
| "logps/rejected": -521.0977792739868, | |
| "loss": 1.0028043985366821, | |
| "mean_token_accuracy": 0.7075130566954613, | |
| "num_tokens": 2294828.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.009019852615892887, | |
| "rewards/margins": -0.011407412588596344, | |
| "rewards/rejected": 0.002387559274211526, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.2194309085607529, | |
| "epoch": 0.02508230130114438, | |
| "grad_norm": 35.85207748413086, | |
| "learning_rate": 3.8999999999999997e-07, | |
| "logits/chosen": -18.869462390156798, | |
| "logits/rejected": -17.76926630663928, | |
| "logps/chosen": -866.6771221160889, | |
| "logps/rejected": -515.5025405883789, | |
| "loss": 1.0078489780426025, | |
| "mean_token_accuracy": 0.7282191216945648, | |
| "num_tokens": 2359584.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.019920013728551567, | |
| "rewards/margins": -0.03206599899567664, | |
| "rewards/rejected": 0.012145984219387174, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.9393897280097008, | |
| "epoch": 0.02570935883367299, | |
| "grad_norm": 29.508663177490234, | |
| "learning_rate": 4e-07, | |
| "logits/chosen": -19.542580737616923, | |
| "logits/rejected": -17.785255602711995, | |
| "logps/chosen": -440.89880752563477, | |
| "logps/rejected": -531.4820680618286, | |
| "loss": 0.9985625147819519, | |
| "mean_token_accuracy": 0.7809053212404251, | |
| "num_tokens": 2407189.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0036070493515580893, | |
| "rewards/margins": 0.005761435255408287, | |
| "rewards/rejected": -0.002154385729227215, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.1858881711959839, | |
| "epoch": 0.026336416366201598, | |
| "grad_norm": 34.17562484741211, | |
| "learning_rate": 4.0999999999999994e-07, | |
| "logits/chosen": -20.121897634772164, | |
| "logits/rejected": -19.622514667746742, | |
| "logps/chosen": -804.0400094985962, | |
| "logps/rejected": -586.3046684265137, | |
| "loss": 0.9875714778900146, | |
| "mean_token_accuracy": 0.7288667857646942, | |
| "num_tokens": 2459432.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.0406644003232941, | |
| "rewards/margins": 0.05225609429180622, | |
| "rewards/rejected": -0.011591696529649198, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.8192418366670609, | |
| "epoch": 0.02696347389873021, | |
| "grad_norm": 43.9438591003418, | |
| "learning_rate": 4.1999999999999995e-07, | |
| "logits/chosen": -24.092886788439017, | |
| "logits/rejected": -23.664276651461066, | |
| "logps/chosen": -584.1518545150757, | |
| "logps/rejected": -503.76978302001953, | |
| "loss": 0.9815411567687988, | |
| "mean_token_accuracy": 0.8075317144393921, | |
| "num_tokens": 2512702.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.04232085426338017, | |
| "rewards/margins": 0.07526338030584157, | |
| "rewards/rejected": -0.032942528603598475, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.9453827887773514, | |
| "epoch": 0.02759053143125882, | |
| "grad_norm": 35.92549514770508, | |
| "learning_rate": 4.2999999999999996e-07, | |
| "logits/chosen": -18.338003960845416, | |
| "logits/rejected": -19.673824728737838, | |
| "logps/chosen": -925.3223133087158, | |
| "logps/rejected": -475.0994644165039, | |
| "loss": 0.9924615025520325, | |
| "mean_token_accuracy": 0.769691713154316, | |
| "num_tokens": 2575249.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.02094321296317503, | |
| "rewards/margins": 0.03026525373570621, | |
| "rewards/rejected": -0.009322041762061417, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.8736219257116318, | |
| "epoch": 0.028217588963787427, | |
| "grad_norm": 33.97110366821289, | |
| "learning_rate": 4.3999999999999997e-07, | |
| "logits/chosen": -22.332301111125155, | |
| "logits/rejected": -20.832310241019115, | |
| "logps/chosen": -462.5166606903076, | |
| "logps/rejected": -383.00551986694336, | |
| "loss": 1.0048575401306152, | |
| "mean_token_accuracy": 0.7859590947628021, | |
| "num_tokens": 2621631.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.009766561212018132, | |
| "rewards/margins": -0.019437916460447013, | |
| "rewards/rejected": 0.009671354899182916, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.02370435744524, | |
| "epoch": 0.02884464649631604, | |
| "grad_norm": 31.75177764892578, | |
| "learning_rate": 4.5e-07, | |
| "logits/chosen": -18.283618627987572, | |
| "logits/rejected": -18.815319615630727, | |
| "logps/chosen": -466.81629753112793, | |
| "logps/rejected": -454.2089099884033, | |
| "loss": 0.9951180219650269, | |
| "mean_token_accuracy": 0.7507254704833031, | |
| "num_tokens": 2674748.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.001771716313669458, | |
| "rewards/margins": 0.019629769725725055, | |
| "rewards/rejected": -0.01785805242252536, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.9373743236064911, | |
| "epoch": 0.029471704028844647, | |
| "grad_norm": 42.6140251159668, | |
| "learning_rate": 4.6e-07, | |
| "logits/chosen": -25.528625869209804, | |
| "logits/rejected": -21.64687665278925, | |
| "logps/chosen": -1166.7054986953735, | |
| "logps/rejected": -438.6943473815918, | |
| "loss": 0.9925483465194702, | |
| "mean_token_accuracy": 0.759131945669651, | |
| "num_tokens": 2744660.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.005512146046385169, | |
| "rewards/margins": 0.03011180693283677, | |
| "rewards/rejected": -0.024599659722298384, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.9783306047320366, | |
| "epoch": 0.030098761561373255, | |
| "grad_norm": 35.963809967041016, | |
| "learning_rate": 4.6999999999999995e-07, | |
| "logits/chosen": -19.222043644762906, | |
| "logits/rejected": -18.896907946229895, | |
| "logps/chosen": -515.0348672866821, | |
| "logps/rejected": -419.7729835510254, | |
| "loss": 0.9998578429222107, | |
| "mean_token_accuracy": 0.792612262070179, | |
| "num_tokens": 2790068.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.02343193959677592, | |
| "rewards/margins": 0.0005922880955040455, | |
| "rewards/rejected": -0.024024227866902947, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.10813407599926, | |
| "epoch": 0.030725819093901867, | |
| "grad_norm": 35.080543518066406, | |
| "learning_rate": 4.8e-07, | |
| "logits/chosen": -22.976597678281987, | |
| "logits/rejected": -20.831361335827353, | |
| "logps/chosen": -826.8215522766113, | |
| "logps/rejected": -406.26672554016113, | |
| "loss": 1.008866310119629, | |
| "mean_token_accuracy": 0.7337941229343414, | |
| "num_tokens": 2845743.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.02741124981548637, | |
| "rewards/margins": -0.03900438791606575, | |
| "rewards/rejected": 0.011593140079639852, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.3011442199349403, | |
| "epoch": 0.03135287662643047, | |
| "grad_norm": 32.856292724609375, | |
| "learning_rate": 4.9e-07, | |
| "logits/chosen": -14.496447176077387, | |
| "logits/rejected": -17.84699543352937, | |
| "logps/chosen": -565.9537868499756, | |
| "logps/rejected": -459.75712490081787, | |
| "loss": 0.9952901005744934, | |
| "mean_token_accuracy": 0.7119247242808342, | |
| "num_tokens": 2899233.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.004313211014959961, | |
| "rewards/margins": 0.018873692606575787, | |
| "rewards/rejected": -0.014560480834916234, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.2501383051276207, | |
| "epoch": 0.031979934158959084, | |
| "grad_norm": 36.4530143737793, | |
| "learning_rate": 5e-07, | |
| "logits/chosen": -21.17299309242602, | |
| "logits/rejected": -22.865218106484676, | |
| "logps/chosen": -866.4957427978516, | |
| "logps/rejected": -508.9821949005127, | |
| "loss": 1.0008279085159302, | |
| "mean_token_accuracy": 0.7066351845860481, | |
| "num_tokens": 2952150.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.0076497383415699005, | |
| "rewards/margins": -0.003307956736534834, | |
| "rewards/rejected": -0.004341780979302712, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1913169473409653, | |
| "epoch": 0.032606991691487695, | |
| "grad_norm": 40.79720687866211, | |
| "learning_rate": 5.1e-07, | |
| "logits/chosen": -17.331403938671592, | |
| "logits/rejected": -16.946636435404315, | |
| "logps/chosen": -760.1813850402832, | |
| "logps/rejected": -703.0359497070312, | |
| "loss": 1.0072510242462158, | |
| "mean_token_accuracy": 0.7222515121102333, | |
| "num_tokens": 3005503.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": -0.013277458609081805, | |
| "rewards/margins": -0.029311579186469316, | |
| "rewards/rejected": 0.01603412051917985, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.3226243034005165, | |
| "epoch": 0.0332340492240163, | |
| "grad_norm": 37.33218002319336, | |
| "learning_rate": 5.2e-07, | |
| "logits/chosen": -19.339108194716523, | |
| "logits/rejected": -17.709144071414954, | |
| "logps/chosen": -1036.9900550842285, | |
| "logps/rejected": -671.3515205383301, | |
| "loss": 1.0005102157592773, | |
| "mean_token_accuracy": 0.699407085776329, | |
| "num_tokens": 3062231.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.01915261917747557, | |
| "rewards/margins": -0.002298903651535511, | |
| "rewards/rejected": -0.016853714711032808, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.2621377930045128, | |
| "epoch": 0.03386110675654491, | |
| "grad_norm": 36.86682891845703, | |
| "learning_rate": 5.3e-07, | |
| "logits/chosen": -23.098386869669465, | |
| "logits/rejected": -18.559492736951306, | |
| "logps/chosen": -879.0279788970947, | |
| "logps/rejected": -472.2311248779297, | |
| "loss": 0.9976851940155029, | |
| "mean_token_accuracy": 0.687630370259285, | |
| "num_tokens": 3118527.0, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.01943317288532853, | |
| "rewards/margins": 0.009305761312134564, | |
| "rewards/rejected": -0.028738934081047773, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.0990462750196457, | |
| "epoch": 0.034488164289073524, | |
| "grad_norm": 29.28276824951172, | |
| "learning_rate": 5.4e-07, | |
| "logits/chosen": -17.590637043087355, | |
| "logits/rejected": -16.153945977490892, | |
| "logps/chosen": -548.3314371109009, | |
| "logps/rejected": -324.43446254730225, | |
| "loss": 0.9927998781204224, | |
| "mean_token_accuracy": 0.7380417436361313, | |
| "num_tokens": 3164828.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.007261359598487616, | |
| "rewards/margins": 0.02887870534323156, | |
| "rewards/rejected": -0.0216173455119133, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.2540519461035728, | |
| "epoch": 0.03511522182160213, | |
| "grad_norm": 36.696895599365234, | |
| "learning_rate": 5.5e-07, | |
| "logits/chosen": -15.279084980657903, | |
| "logits/rejected": -15.824559065606763, | |
| "logps/chosen": -903.7292518615723, | |
| "logps/rejected": -541.010986328125, | |
| "loss": 0.9985660314559937, | |
| "mean_token_accuracy": 0.6998207569122314, | |
| "num_tokens": 3233270.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.016322331794071943, | |
| "rewards/margins": 0.0056688676122576, | |
| "rewards/rejected": -0.021991199755575508, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.0729844830930233, | |
| "epoch": 0.03574227935413074, | |
| "grad_norm": 26.47355842590332, | |
| "learning_rate": 5.6e-07, | |
| "logits/chosen": -19.623318897458958, | |
| "logits/rejected": -20.258368385656922, | |
| "logps/chosen": -469.5618600845337, | |
| "logps/rejected": -361.1621437072754, | |
| "loss": 1.0013068914413452, | |
| "mean_token_accuracy": 0.7484212070703506, | |
| "num_tokens": 3268958.0, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.004558162530884147, | |
| "rewards/margins": -0.005245101172477007, | |
| "rewards/rejected": 0.009803264052607119, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.9888226762413979, | |
| "epoch": 0.03636933688665935, | |
| "grad_norm": 28.04119873046875, | |
| "learning_rate": 5.699999999999999e-07, | |
| "logits/chosen": -18.97722177970246, | |
| "logits/rejected": -17.818980544574217, | |
| "logps/chosen": -490.36932277679443, | |
| "logps/rejected": -353.6288299560547, | |
| "loss": 0.9960744976997375, | |
| "mean_token_accuracy": 0.763416476547718, | |
| "num_tokens": 3318736.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0007263210136443377, | |
| "rewards/margins": 0.015722022857517004, | |
| "rewards/rejected": -0.016448343638330698, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.2886198982596397, | |
| "epoch": 0.03699639441918796, | |
| "grad_norm": 43.716182708740234, | |
| "learning_rate": 5.8e-07, | |
| "logits/chosen": -20.97464568747773, | |
| "logits/rejected": -18.98481146897743, | |
| "logps/chosen": -1585.0814723968506, | |
| "logps/rejected": -528.0391731262207, | |
| "loss": 0.9945598840713501, | |
| "mean_token_accuracy": 0.7001667320728302, | |
| "num_tokens": 3386147.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.019920118735171854, | |
| "rewards/margins": 0.021774652879685163, | |
| "rewards/rejected": -0.0018545325146988034, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.039273351430893, | |
| "epoch": 0.03762345195171657, | |
| "grad_norm": 27.81415367126465, | |
| "learning_rate": 5.9e-07, | |
| "logits/chosen": -18.662482620406607, | |
| "logits/rejected": -20.1330546037938, | |
| "logps/chosen": -365.54387283325195, | |
| "logps/rejected": -373.88531494140625, | |
| "loss": 0.996242105960846, | |
| "mean_token_accuracy": 0.7572688236832619, | |
| "num_tokens": 3424538.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.006609153002500534, | |
| "rewards/margins": 0.015012014424428344, | |
| "rewards/rejected": -0.02162116818362847, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.2042050436139107, | |
| "epoch": 0.03825050948424518, | |
| "grad_norm": 36.16862869262695, | |
| "learning_rate": 6e-07, | |
| "logits/chosen": -20.75980830973855, | |
| "logits/rejected": -20.60451823594014, | |
| "logps/chosen": -1099.3400793075562, | |
| "logps/rejected": -421.7832374572754, | |
| "loss": 1.0015130043029785, | |
| "mean_token_accuracy": 0.7048044949769974, | |
| "num_tokens": 3491026.0, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.00036664726212620735, | |
| "rewards/margins": -0.005983836483210325, | |
| "rewards/rejected": 0.00635048293042928, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.0666373148560524, | |
| "epoch": 0.03887756701677379, | |
| "grad_norm": 43.32762908935547, | |
| "learning_rate": 6.1e-07, | |
| "logits/chosen": -23.173134701752, | |
| "logits/rejected": -20.672318471013675, | |
| "logps/chosen": -1242.8998069763184, | |
| "logps/rejected": -464.8951187133789, | |
| "loss": 0.9945209622383118, | |
| "mean_token_accuracy": 0.7305290177464485, | |
| "num_tokens": 3555810.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.005398005829192698, | |
| "rewards/margins": 0.022236518329009414, | |
| "rewards/rejected": -0.016838514362461865, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.7979357466101646, | |
| "epoch": 0.0395046245493024, | |
| "grad_norm": 30.137588500976562, | |
| "learning_rate": 6.2e-07, | |
| "logits/chosen": -22.89783292156173, | |
| "logits/rejected": -22.199726863036197, | |
| "logps/chosen": -536.3147115707397, | |
| "logps/rejected": -364.88674545288086, | |
| "loss": 0.9864821434020996, | |
| "mean_token_accuracy": 0.8112821727991104, | |
| "num_tokens": 3604824.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03518715803511441, | |
| "rewards/margins": 0.056509705260396004, | |
| "rewards/rejected": -0.02132254181196913, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.1044994071125984, | |
| "epoch": 0.04013168208183101, | |
| "grad_norm": 29.391481399536133, | |
| "learning_rate": 6.3e-07, | |
| "logits/chosen": -24.507481146010182, | |
| "logits/rejected": -22.21625134174552, | |
| "logps/chosen": -702.180121421814, | |
| "logps/rejected": -308.05684661865234, | |
| "loss": 0.9998461604118347, | |
| "mean_token_accuracy": 0.7285795137286186, | |
| "num_tokens": 3651250.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.004402894992381334, | |
| "rewards/margins": -0.0003644675016403198, | |
| "rewards/rejected": -0.004038428800413385, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.8255317062139511, | |
| "epoch": 0.04075873961435962, | |
| "grad_norm": 36.75194549560547, | |
| "learning_rate": 6.4e-07, | |
| "logits/chosen": -23.442134502527015, | |
| "logits/rejected": -21.24577292120065, | |
| "logps/chosen": -481.1418218612671, | |
| "logps/rejected": -390.04198455810547, | |
| "loss": 0.9808884859085083, | |
| "mean_token_accuracy": 0.8040206730365753, | |
| "num_tokens": 3700811.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.03725379565730691, | |
| "rewards/margins": 0.0775255209300667, | |
| "rewards/rejected": -0.040271724574267864, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.9590631648898125, | |
| "epoch": 0.041385797146888226, | |
| "grad_norm": 31.754987716674805, | |
| "learning_rate": 6.5e-07, | |
| "logits/chosen": -23.604474652863118, | |
| "logits/rejected": -21.18440918134874, | |
| "logps/chosen": -892.4836721420288, | |
| "logps/rejected": -423.81532859802246, | |
| "loss": 0.9878406524658203, | |
| "mean_token_accuracy": 0.7679838165640831, | |
| "num_tokens": 3752809.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.035222190992499236, | |
| "rewards/margins": 0.05575526849133894, | |
| "rewards/rejected": -0.020533079630695283, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.9526357278227806, | |
| "epoch": 0.04201285467941684, | |
| "grad_norm": 38.09070587158203, | |
| "learning_rate": 6.6e-07, | |
| "logits/chosen": -19.300392282829993, | |
| "logits/rejected": -20.892184024152968, | |
| "logps/chosen": -767.138952255249, | |
| "logps/rejected": -475.6669750213623, | |
| "loss": 0.9936155080795288, | |
| "mean_token_accuracy": 0.7684061825275421, | |
| "num_tokens": 3817303.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.02726819575764239, | |
| "rewards/margins": 0.025456703966483474, | |
| "rewards/rejected": 0.0018114912672899663, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.7557753957808018, | |
| "epoch": 0.04263991221194545, | |
| "grad_norm": 31.207439422607422, | |
| "learning_rate": 6.7e-07, | |
| "logits/chosen": -22.31144983616734, | |
| "logits/rejected": -22.303479200481075, | |
| "logps/chosen": -516.0994625091553, | |
| "logps/rejected": -432.821720123291, | |
| "loss": 0.993211030960083, | |
| "mean_token_accuracy": 0.8136529326438904, | |
| "num_tokens": 3869975.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.008595484774559736, | |
| "rewards/margins": 0.027202091412618756, | |
| "rewards/rejected": -0.018606607103720307, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.078584998846054, | |
| "epoch": 0.043266969744474054, | |
| "grad_norm": 35.849456787109375, | |
| "learning_rate": 6.800000000000001e-07, | |
| "logits/chosen": -20.188257880122976, | |
| "logits/rejected": -19.395488505188574, | |
| "logps/chosen": -778.6550903320312, | |
| "logps/rejected": -460.7582092285156, | |
| "loss": 0.9967914819717407, | |
| "mean_token_accuracy": 0.739520289003849, | |
| "num_tokens": 3917591.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0018483520834706724, | |
| "rewards/margins": 0.013088171719573438, | |
| "rewards/rejected": -0.014936523628421128, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.0627146326005459, | |
| "epoch": 0.043894027277002666, | |
| "grad_norm": 33.957401275634766, | |
| "learning_rate": 6.9e-07, | |
| "logits/chosen": -19.09365423111348, | |
| "logits/rejected": -19.238957994462496, | |
| "logps/chosen": -625.0276880264282, | |
| "logps/rejected": -460.5406036376953, | |
| "loss": 0.9846621155738831, | |
| "mean_token_accuracy": 0.7464545965194702, | |
| "num_tokens": 3963982.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.005297277413774282, | |
| "rewards/margins": 0.06182992341928184, | |
| "rewards/rejected": -0.056532644899562, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.0039971619844437, | |
| "epoch": 0.04452108480953128, | |
| "grad_norm": 36.00166702270508, | |
| "learning_rate": 7e-07, | |
| "logits/chosen": -21.96269636469623, | |
| "logits/rejected": -21.29580632185736, | |
| "logps/chosen": -772.8854808807373, | |
| "logps/rejected": -615.0897903442383, | |
| "loss": 0.9930751323699951, | |
| "mean_token_accuracy": 0.7512786686420441, | |
| "num_tokens": 4028293.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0168970461236313, | |
| "rewards/margins": 0.02881601534318179, | |
| "rewards/rejected": -0.011918970150873065, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.302395537495613, | |
| "epoch": 0.04514814234205988, | |
| "grad_norm": 39.504661560058594, | |
| "learning_rate": 7.1e-07, | |
| "logits/chosen": -19.878782312586424, | |
| "logits/rejected": -18.000410834982972, | |
| "logps/chosen": -1210.3033666610718, | |
| "logps/rejected": -607.6138458251953, | |
| "loss": 0.9891315698623657, | |
| "mean_token_accuracy": 0.703778937458992, | |
| "num_tokens": 4089535.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0096849100664258, | |
| "rewards/margins": 0.043962169205769897, | |
| "rewards/rejected": -0.034277260303497314, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.9964236989617348, | |
| "epoch": 0.045775199874588494, | |
| "grad_norm": 33.938472747802734, | |
| "learning_rate": 7.2e-07, | |
| "logits/chosen": -20.415109094760414, | |
| "logits/rejected": -17.26682495783373, | |
| "logps/chosen": -721.8188791275024, | |
| "logps/rejected": -408.42410469055176, | |
| "loss": 0.995058536529541, | |
| "mean_token_accuracy": 0.7626092284917831, | |
| "num_tokens": 4140075.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.015723853604868054, | |
| "rewards/margins": 0.019197183661162853, | |
| "rewards/rejected": -0.03492103505413979, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.017537921667099, | |
| "epoch": 0.046402257407117106, | |
| "grad_norm": 26.6578311920166, | |
| "learning_rate": 7.3e-07, | |
| "logits/chosen": -15.80474927414226, | |
| "logits/rejected": -16.128822298593438, | |
| "logps/chosen": -515.7086997032166, | |
| "logps/rejected": -239.00895309448242, | |
| "loss": 0.9995874762535095, | |
| "mean_token_accuracy": 0.7658038064837456, | |
| "num_tokens": 4194003.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.008220234914915636, | |
| "rewards/margins": 0.0016142040840350091, | |
| "rewards/rejected": -0.009834438504185528, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.9735286235809326, | |
| "epoch": 0.04702931493964571, | |
| "grad_norm": 33.58881759643555, | |
| "learning_rate": 7.4e-07, | |
| "logits/chosen": -20.946241053605, | |
| "logits/rejected": -19.067083934619777, | |
| "logps/chosen": -674.0198707580566, | |
| "logps/rejected": -419.6971263885498, | |
| "loss": 0.991060733795166, | |
| "mean_token_accuracy": 0.7505866810679436, | |
| "num_tokens": 4244222.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.015050875255838037, | |
| "rewards/margins": 0.03578460752032697, | |
| "rewards/rejected": -0.020733732322696596, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.137626238167286, | |
| "epoch": 0.04765637247217432, | |
| "grad_norm": 38.98091125488281, | |
| "learning_rate": 7.5e-07, | |
| "logits/chosen": -22.829858763000864, | |
| "logits/rejected": -19.879969265793594, | |
| "logps/chosen": -1177.3832550048828, | |
| "logps/rejected": -511.0323143005371, | |
| "loss": 0.9940009713172913, | |
| "mean_token_accuracy": 0.7326341941952705, | |
| "num_tokens": 4313717.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.021500761155039072, | |
| "rewards/margins": 0.023731452063657343, | |
| "rewards/rejected": -0.0452322136843577, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.2288251742720604, | |
| "epoch": 0.048283430004702935, | |
| "grad_norm": 28.220809936523438, | |
| "learning_rate": 7.599999999999999e-07, | |
| "logits/chosen": -17.088404479801554, | |
| "logits/rejected": -18.424581121455233, | |
| "logps/chosen": -600.109245300293, | |
| "logps/rejected": -335.4466133117676, | |
| "loss": 1.0012062788009644, | |
| "mean_token_accuracy": 0.7148683369159698, | |
| "num_tokens": 4358615.0, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": -0.014499580138362944, | |
| "rewards/margins": -0.004860305110923946, | |
| "rewards/rejected": -0.00963927514385432, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0265920907258987, | |
| "epoch": 0.04891048753723154, | |
| "grad_norm": 34.03989791870117, | |
| "learning_rate": 7.699999999999999e-07, | |
| "logits/chosen": -22.126280957342644, | |
| "logits/rejected": -21.625379783333514, | |
| "logps/chosen": -804.5845255851746, | |
| "logps/rejected": -453.7879638671875, | |
| "loss": 0.9970452785491943, | |
| "mean_token_accuracy": 0.7403309643268585, | |
| "num_tokens": 4415873.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.008073777018580586, | |
| "rewards/margins": 0.011700771981850266, | |
| "rewards/rejected": -0.019774550921283662, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.262473076581955, | |
| "epoch": 0.04953754506976015, | |
| "grad_norm": 36.033348083496094, | |
| "learning_rate": 7.799999999999999e-07, | |
| "logits/chosen": -18.124917388062837, | |
| "logits/rejected": -19.211221946008383, | |
| "logps/chosen": -795.0781173706055, | |
| "logps/rejected": -577.8308029174805, | |
| "loss": 0.9934069514274597, | |
| "mean_token_accuracy": 0.7068465352058411, | |
| "num_tokens": 4477334.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.004607248993124813, | |
| "rewards/margins": 0.026270719012245536, | |
| "rewards/rejected": -0.030877968529239297, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.9185331761837006, | |
| "epoch": 0.05016460260228876, | |
| "grad_norm": 36.832279205322266, | |
| "learning_rate": 7.9e-07, | |
| "logits/chosen": -20.603378074573, | |
| "logits/rejected": -17.056396975980135, | |
| "logps/chosen": -758.8550605773926, | |
| "logps/rejected": -412.65998458862305, | |
| "loss": 0.9883898496627808, | |
| "mean_token_accuracy": 0.7726860344409943, | |
| "num_tokens": 4533455.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.0016075177991297096, | |
| "rewards/margins": 0.04657475184649229, | |
| "rewards/rejected": -0.04818226984934881, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.121558502316475, | |
| "epoch": 0.05079166013481737, | |
| "grad_norm": 36.56794738769531, | |
| "learning_rate": 8e-07, | |
| "logits/chosen": -20.37862110155874, | |
| "logits/rejected": -18.992690204889037, | |
| "logps/chosen": -1184.8006420135498, | |
| "logps/rejected": -610.0655975341797, | |
| "loss": 0.9853536486625671, | |
| "mean_token_accuracy": 0.7357284799218178, | |
| "num_tokens": 4596652.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.02295642625540495, | |
| "rewards/margins": 0.059380507678724825, | |
| "rewards/rejected": -0.03642408235464245, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.0517073720693588, | |
| "epoch": 0.05141871766734598, | |
| "grad_norm": 39.78794860839844, | |
| "learning_rate": 8.1e-07, | |
| "logits/chosen": -23.220199460872006, | |
| "logits/rejected": -21.76251201594231, | |
| "logps/chosen": -901.9024753570557, | |
| "logps/rejected": -581.7087097167969, | |
| "loss": 0.9863370656967163, | |
| "mean_token_accuracy": 0.7483935281634331, | |
| "num_tokens": 4660574.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.005605014972388744, | |
| "rewards/margins": 0.05513616371899843, | |
| "rewards/rejected": -0.04953114781528711, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.031716726720333, | |
| "epoch": 0.05204577519987459, | |
| "grad_norm": 34.147884368896484, | |
| "learning_rate": 8.199999999999999e-07, | |
| "logits/chosen": -17.43597000771303, | |
| "logits/rejected": -17.040958005172556, | |
| "logps/chosen": -611.6086521148682, | |
| "logps/rejected": -463.6491508483887, | |
| "loss": 0.9925582408905029, | |
| "mean_token_accuracy": 0.7591038644313812, | |
| "num_tokens": 4726456.0, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.009094578330405056, | |
| "rewards/margins": 0.029864652664400637, | |
| "rewards/rejected": -0.03895922936499119, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.1349261552095413, | |
| "epoch": 0.052672832732403196, | |
| "grad_norm": 32.638126373291016, | |
| "learning_rate": 8.299999999999999e-07, | |
| "logits/chosen": -17.404521363601013, | |
| "logits/rejected": -19.98172508139376, | |
| "logps/chosen": -767.6361827850342, | |
| "logps/rejected": -448.48921966552734, | |
| "loss": 0.9871995449066162, | |
| "mean_token_accuracy": 0.7235324308276176, | |
| "num_tokens": 4792314.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.017612980911508203, | |
| "rewards/margins": 0.05156451647053473, | |
| "rewards/rejected": -0.033951534889638424, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.1050493195652962, | |
| "epoch": 0.05329989026493181, | |
| "grad_norm": 36.08334732055664, | |
| "learning_rate": 8.399999999999999e-07, | |
| "logits/chosen": -16.500999504676678, | |
| "logits/rejected": -18.25587297431137, | |
| "logps/chosen": -675.2915000915527, | |
| "logps/rejected": -561.0027389526367, | |
| "loss": 0.9919638633728027, | |
| "mean_token_accuracy": 0.741675615310669, | |
| "num_tokens": 4849066.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0004984733532182872, | |
| "rewards/margins": 0.03216184466145933, | |
| "rewards/rejected": -0.03166337008588016, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.220378190279007, | |
| "epoch": 0.05392694779746042, | |
| "grad_norm": 40.76183319091797, | |
| "learning_rate": 8.499999999999999e-07, | |
| "logits/chosen": -23.90722501767462, | |
| "logits/rejected": -22.38695916119651, | |
| "logps/chosen": -1048.8524017333984, | |
| "logps/rejected": -473.95777893066406, | |
| "loss": 0.9880315661430359, | |
| "mean_token_accuracy": 0.7109057381749153, | |
| "num_tokens": 4923190.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0222030496224761, | |
| "rewards/margins": 0.04874912742525339, | |
| "rewards/rejected": -0.07095217774622142, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.2091117054224014, | |
| "epoch": 0.054554005329989025, | |
| "grad_norm": 35.72580337524414, | |
| "learning_rate": 8.599999999999999e-07, | |
| "logits/chosen": -20.30170921476879, | |
| "logits/rejected": -21.20954152859497, | |
| "logps/chosen": -951.2183666229248, | |
| "logps/rejected": -513.4668788909912, | |
| "loss": 0.9863914251327515, | |
| "mean_token_accuracy": 0.7123682126402855, | |
| "num_tokens": 4974868.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.026849399670027196, | |
| "rewards/margins": 0.05532143288291991, | |
| "rewards/rejected": -0.028472037287428975, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.073004886507988, | |
| "epoch": 0.05518106286251764, | |
| "grad_norm": 36.27262496948242, | |
| "learning_rate": 8.699999999999999e-07, | |
| "logits/chosen": -19.685747925382, | |
| "logits/rejected": -17.267068163974074, | |
| "logps/chosen": -578.3146362304688, | |
| "logps/rejected": -475.0130271911621, | |
| "loss": 0.9875953197479248, | |
| "mean_token_accuracy": 0.7410635352134705, | |
| "num_tokens": 5037188.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.014228225103579462, | |
| "rewards/margins": 0.04966498585417867, | |
| "rewards/rejected": -0.03543675900436938, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.056903399527073, | |
| "epoch": 0.05580812039504625, | |
| "grad_norm": 35.787532806396484, | |
| "learning_rate": 8.799999999999999e-07, | |
| "logits/chosen": -20.64660484271999, | |
| "logits/rejected": -19.71323913593022, | |
| "logps/chosen": -527.9435653686523, | |
| "logps/rejected": -577.5134410858154, | |
| "loss": 0.9897867441177368, | |
| "mean_token_accuracy": 0.7574738562107086, | |
| "num_tokens": 5086966.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.00012873177183791995, | |
| "rewards/margins": 0.04125080001540482, | |
| "rewards/rejected": -0.04112206675927155, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.9986204952001572, | |
| "epoch": 0.05643517792757485, | |
| "grad_norm": 33.426368713378906, | |
| "learning_rate": 8.9e-07, | |
| "logits/chosen": -18.57544006926955, | |
| "logits/rejected": -19.12848221709334, | |
| "logps/chosen": -766.3484830856323, | |
| "logps/rejected": -476.17732429504395, | |
| "loss": 0.9895883798599243, | |
| "mean_token_accuracy": 0.7547919675707817, | |
| "num_tokens": 5144107.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.013297693920321763, | |
| "rewards/margins": 0.04271816968685016, | |
| "rewards/rejected": -0.029420473758364096, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.1071998253464699, | |
| "epoch": 0.057062235460103465, | |
| "grad_norm": 46.52241516113281, | |
| "learning_rate": 9e-07, | |
| "logits/chosen": -20.750110720341095, | |
| "logits/rejected": -20.73160492144149, | |
| "logps/chosen": -1105.2754192352295, | |
| "logps/rejected": -582.0479850769043, | |
| "loss": 0.9801906943321228, | |
| "mean_token_accuracy": 0.7243269085884094, | |
| "num_tokens": 5211621.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.019272988894954324, | |
| "rewards/margins": 0.0801434232853353, | |
| "rewards/rejected": -0.06087043380830437, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.1382925510406494, | |
| "epoch": 0.05768929299263208, | |
| "grad_norm": 37.77758026123047, | |
| "learning_rate": 9.1e-07, | |
| "logits/chosen": -20.904564962987713, | |
| "logits/rejected": -21.018963758425333, | |
| "logps/chosen": -640.5741844177246, | |
| "logps/rejected": -708.7987327575684, | |
| "loss": 0.9877656102180481, | |
| "mean_token_accuracy": 0.7462773993611336, | |
| "num_tokens": 5263236.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.032095869741169736, | |
| "rewards/margins": 0.04855327168479562, | |
| "rewards/rejected": -0.08064913935959339, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.1960504204034805, | |
| "epoch": 0.05831635052516068, | |
| "grad_norm": 27.9012508392334, | |
| "learning_rate": 9.2e-07, | |
| "logits/chosen": -17.198728228506177, | |
| "logits/rejected": -19.989566953539725, | |
| "logps/chosen": -581.2822170257568, | |
| "logps/rejected": -365.0048427581787, | |
| "loss": 0.9875739812850952, | |
| "mean_token_accuracy": 0.7414722666144371, | |
| "num_tokens": 5301490.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0007973910542204976, | |
| "rewards/margins": 0.04991468833759427, | |
| "rewards/rejected": -0.04911729716695845, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.9865989461541176, | |
| "epoch": 0.058943408057689294, | |
| "grad_norm": 31.25222396850586, | |
| "learning_rate": 9.3e-07, | |
| "logits/chosen": -18.790141123207366, | |
| "logits/rejected": -16.14887539333265, | |
| "logps/chosen": -577.1131019592285, | |
| "logps/rejected": -340.10778999328613, | |
| "loss": 0.9858304262161255, | |
| "mean_token_accuracy": 0.7623919099569321, | |
| "num_tokens": 5361142.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0011998027912341058, | |
| "rewards/margins": 0.057147986139170825, | |
| "rewards/rejected": -0.05594818387180567, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.044435366988182, | |
| "epoch": 0.059570465590217905, | |
| "grad_norm": 26.22032928466797, | |
| "learning_rate": 9.399999999999999e-07, | |
| "logits/chosen": -17.09738355288199, | |
| "logits/rejected": -17.458014048093904, | |
| "logps/chosen": -388.39873027801514, | |
| "logps/rejected": -326.0696334838867, | |
| "loss": 0.9898619055747986, | |
| "mean_token_accuracy": 0.7581661641597748, | |
| "num_tokens": 5408748.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0021333397598937154, | |
| "rewards/margins": 0.04059030464850366, | |
| "rewards/rejected": -0.04272364475764334, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.8697420880198479, | |
| "epoch": 0.06019752312274651, | |
| "grad_norm": 42.353424072265625, | |
| "learning_rate": 9.499999999999999e-07, | |
| "logits/chosen": -23.41937699390698, | |
| "logits/rejected": -21.70754765415036, | |
| "logps/chosen": -1428.7145009040833, | |
| "logps/rejected": -443.71881103515625, | |
| "loss": 0.9914920926094055, | |
| "mean_token_accuracy": 0.7912928014993668, | |
| "num_tokens": 5483101.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.011147335055284202, | |
| "rewards/margins": 0.045076546957716346, | |
| "rewards/rejected": -0.03392921155318618, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.1013405546545982, | |
| "epoch": 0.06082458065527512, | |
| "grad_norm": 36.10636520385742, | |
| "learning_rate": 9.6e-07, | |
| "logits/chosen": -19.821280825841903, | |
| "logits/rejected": -19.578973804909, | |
| "logps/chosen": -985.1940336227417, | |
| "logps/rejected": -473.689453125, | |
| "loss": 0.983747124671936, | |
| "mean_token_accuracy": 0.7495378330349922, | |
| "num_tokens": 5534649.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0021885630558244884, | |
| "rewards/margins": 0.06537919119000435, | |
| "rewards/rejected": -0.06756775546818972, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.2237722724676132, | |
| "epoch": 0.061451638187803734, | |
| "grad_norm": 41.582496643066406, | |
| "learning_rate": 9.7e-07, | |
| "logits/chosen": -20.153029153130383, | |
| "logits/rejected": -17.664550339329576, | |
| "logps/chosen": -1082.3712921142578, | |
| "logps/rejected": -649.8507308959961, | |
| "loss": 0.9809252023696899, | |
| "mean_token_accuracy": 0.718035951256752, | |
| "num_tokens": 5612387.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.02365162328351289, | |
| "rewards/margins": 0.07657872815616429, | |
| "rewards/rejected": -0.052927102777175605, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.0099660605192184, | |
| "epoch": 0.06207869572033234, | |
| "grad_norm": 30.545495986938477, | |
| "learning_rate": 9.8e-07, | |
| "logits/chosen": -19.286327351085962, | |
| "logits/rejected": -19.547563799363445, | |
| "logps/chosen": -635.9861097335815, | |
| "logps/rejected": -379.7309799194336, | |
| "loss": 0.9843310117721558, | |
| "mean_token_accuracy": 0.7559159845113754, | |
| "num_tokens": 5664396.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.005910164851229638, | |
| "rewards/margins": 0.06448549684137106, | |
| "rewards/rejected": -0.07039566081948578, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.1891107335686684, | |
| "epoch": 0.06270575325286094, | |
| "grad_norm": 30.441099166870117, | |
| "learning_rate": 9.9e-07, | |
| "logits/chosen": -16.462167828377467, | |
| "logits/rejected": -17.668335453566645, | |
| "logps/chosen": -774.8042068481445, | |
| "logps/rejected": -352.1152057647705, | |
| "loss": 0.9829254150390625, | |
| "mean_token_accuracy": 0.723647378385067, | |
| "num_tokens": 5712927.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0013654606882482767, | |
| "rewards/margins": 0.0686984455678612, | |
| "rewards/rejected": -0.07006390765309334, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.0059744790196419, | |
| "epoch": 0.06333281078538956, | |
| "grad_norm": 34.044551849365234, | |
| "learning_rate": 1e-06, | |
| "logits/chosen": -22.569647432957222, | |
| "logits/rejected": -20.571769885244017, | |
| "logps/chosen": -737.9557514190674, | |
| "logps/rejected": -456.0193290710449, | |
| "loss": 0.9836858510971069, | |
| "mean_token_accuracy": 0.7708024978637695, | |
| "num_tokens": 5762779.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.02014523115940392, | |
| "rewards/margins": 0.0654695084085688, | |
| "rewards/rejected": -0.045324277016334236, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.1221561804413795, | |
| "epoch": 0.06395986831791817, | |
| "grad_norm": 35.60519790649414, | |
| "learning_rate": 9.999988960301596e-07, | |
| "logits/chosen": -17.63612561400455, | |
| "logits/rejected": -21.225849866079535, | |
| "logps/chosen": -851.1271896362305, | |
| "logps/rejected": -731.4087066650391, | |
| "loss": 0.9757521152496338, | |
| "mean_token_accuracy": 0.7322330251336098, | |
| "num_tokens": 5820523.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.011595683405175805, | |
| "rewards/margins": 0.09945710864849389, | |
| "rewards/rejected": -0.08786143315955997, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.033433958888054, | |
| "epoch": 0.06458692585044677, | |
| "grad_norm": 33.74344253540039, | |
| "learning_rate": 9.999955841255138e-07, | |
| "logits/chosen": -21.6586000014676, | |
| "logits/rejected": -20.241547622800056, | |
| "logps/chosen": -748.6037483215332, | |
| "logps/rejected": -495.99595642089844, | |
| "loss": 0.9870611429214478, | |
| "mean_token_accuracy": 0.7368155121803284, | |
| "num_tokens": 5870733.0, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.03833825106266886, | |
| "rewards/margins": 0.050038286950439215, | |
| "rewards/rejected": -0.08837653254158795, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.118708185851574, | |
| "epoch": 0.06521398338297539, | |
| "grad_norm": 43.72235107421875, | |
| "learning_rate": 9.999900643006873e-07, | |
| "logits/chosen": -22.952759755082543, | |
| "logits/rejected": -18.112035021982514, | |
| "logps/chosen": -1293.3799285888672, | |
| "logps/rejected": -614.5923004150391, | |
| "loss": 0.9773090481758118, | |
| "mean_token_accuracy": 0.7410418093204498, | |
| "num_tokens": 5941283.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.02265817968873307, | |
| "rewards/margins": 0.09182942099869251, | |
| "rewards/rejected": -0.06917124305618927, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.3742387741804123, | |
| "epoch": 0.065841040915504, | |
| "grad_norm": 39.11056137084961, | |
| "learning_rate": 9.99982336580055e-07, | |
| "logits/chosen": -16.713279247073885, | |
| "logits/rejected": -16.98860342760087, | |
| "logps/chosen": -950.8361873626709, | |
| "logps/rejected": -464.50708770751953, | |
| "loss": 0.9773339629173279, | |
| "mean_token_accuracy": 0.6922967359423637, | |
| "num_tokens": 6000343.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.006588876945897937, | |
| "rewards/margins": 0.09067038784269243, | |
| "rewards/rejected": -0.08408151054754853, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.1545687764883041, | |
| "epoch": 0.0664680984480326, | |
| "grad_norm": 34.153663635253906, | |
| "learning_rate": 9.99972400997742e-07, | |
| "logits/chosen": -20.552279910445396, | |
| "logits/rejected": -18.52949584159018, | |
| "logps/chosen": -710.0431318283081, | |
| "logps/rejected": -350.6925792694092, | |
| "loss": 0.982926070690155, | |
| "mean_token_accuracy": 0.7238080576062202, | |
| "num_tokens": 6047719.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.01743771624751389, | |
| "rewards/margins": 0.06860713846981525, | |
| "rewards/rejected": -0.05116942140739411, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.8841631710529327, | |
| "epoch": 0.06709515598056122, | |
| "grad_norm": 30.25786018371582, | |
| "learning_rate": 9.999602575976219e-07, | |
| "logits/chosen": -16.81424879838689, | |
| "logits/rejected": -16.14855911409956, | |
| "logps/chosen": -426.7861785888672, | |
| "logps/rejected": -396.69312858581543, | |
| "loss": 0.979150652885437, | |
| "mean_token_accuracy": 0.8006457611918449, | |
| "num_tokens": 6096830.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.007483278808649629, | |
| "rewards/margins": 0.0836036205291748, | |
| "rewards/rejected": -0.07612034154590219, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.0404388830065727, | |
| "epoch": 0.06772221351308982, | |
| "grad_norm": 33.5556640625, | |
| "learning_rate": 9.999459064333188e-07, | |
| "logits/chosen": -15.91254721701439, | |
| "logits/rejected": -16.29134417675286, | |
| "logps/chosen": -601.9646797180176, | |
| "logps/rejected": -457.3084487915039, | |
| "loss": 0.9777726531028748, | |
| "mean_token_accuracy": 0.7538063228130341, | |
| "num_tokens": 6145266.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.019957647193223238, | |
| "rewards/margins": 0.08928463887423277, | |
| "rewards/rejected": -0.0693269899347797, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.2834724336862564, | |
| "epoch": 0.06834927104561843, | |
| "grad_norm": 34.99026870727539, | |
| "learning_rate": 9.999293475682062e-07, | |
| "logits/chosen": -17.259286736211884, | |
| "logits/rejected": -17.444496267757785, | |
| "logps/chosen": -667.7793045043945, | |
| "logps/rejected": -577.6125526428223, | |
| "loss": 0.9799240231513977, | |
| "mean_token_accuracy": 0.6992196813225746, | |
| "num_tokens": 6196039.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.005005566752515733, | |
| "rewards/margins": 0.08093663223553449, | |
| "rewards/rejected": -0.08594219759106636, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.055838204920292, | |
| "epoch": 0.06897632857814705, | |
| "grad_norm": 33.32623291015625, | |
| "learning_rate": 9.999105810754053e-07, | |
| "logits/chosen": -18.407450521012187, | |
| "logits/rejected": -18.873402077141666, | |
| "logps/chosen": -799.7204494476318, | |
| "logps/rejected": -477.783242225647, | |
| "loss": 0.9677953720092773, | |
| "mean_token_accuracy": 0.7510818913578987, | |
| "num_tokens": 6263445.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.052083960617892444, | |
| "rewards/margins": 0.1307980790734291, | |
| "rewards/rejected": -0.07871411880478263, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.9602865129709244, | |
| "epoch": 0.06960338611067565, | |
| "grad_norm": 28.93109130859375, | |
| "learning_rate": 9.99889607037787e-07, | |
| "logits/chosen": -16.415104591720436, | |
| "logits/rejected": -18.58728532903226, | |
| "logps/chosen": -381.7690181732178, | |
| "logps/rejected": -416.77470779418945, | |
| "loss": 0.9900650382041931, | |
| "mean_token_accuracy": 0.7899875342845917, | |
| "num_tokens": 6311526.0, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.004977155942469835, | |
| "rewards/margins": 0.039845253340899944, | |
| "rewards/rejected": -0.044822409050539136, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.8192609176039696, | |
| "epoch": 0.07023044364320426, | |
| "grad_norm": 39.31092071533203, | |
| "learning_rate": 9.998664255479704e-07, | |
| "logits/chosen": -25.072994460556252, | |
| "logits/rejected": -22.42456335487019, | |
| "logps/chosen": -1064.658107995987, | |
| "logps/rejected": -414.81433868408203, | |
| "loss": 0.9966785311698914, | |
| "mean_token_accuracy": 0.8144989609718323, | |
| "num_tokens": 6373673.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.06160880299285054, | |
| "rewards/margins": 0.012114129436668009, | |
| "rewards/rejected": -0.0737229329533875, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.9448361806571484, | |
| "epoch": 0.07085750117573288, | |
| "grad_norm": 39.90821075439453, | |
| "learning_rate": 9.99841036708322e-07, | |
| "logits/chosen": -23.766030290287702, | |
| "logits/rejected": -25.34154914444923, | |
| "logps/chosen": -1000.321138381958, | |
| "logps/rejected": -514.6866340637207, | |
| "loss": 0.9712129831314087, | |
| "mean_token_accuracy": 0.7757420614361763, | |
| "num_tokens": 6428282.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.034964483114890754, | |
| "rewards/margins": 0.11884536314755678, | |
| "rewards/rejected": -0.08388087863568217, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.8173889517784119, | |
| "epoch": 0.07148455870826148, | |
| "grad_norm": 30.850637435913086, | |
| "learning_rate": 9.998134406309553e-07, | |
| "logits/chosen": -25.008434498378293, | |
| "logits/rejected": -22.165182027384386, | |
| "logps/chosen": -702.1321802139282, | |
| "logps/rejected": -378.8375816345215, | |
| "loss": 0.9969829320907593, | |
| "mean_token_accuracy": 0.8100090399384499, | |
| "num_tokens": 6478216.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0617737959837541, | |
| "rewards/margins": 0.0021084430627524853, | |
| "rewards/rejected": -0.06388223776593804, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.0738236010074615, | |
| "epoch": 0.07211161624079009, | |
| "grad_norm": 37.23641586303711, | |
| "learning_rate": 9.997836374377318e-07, | |
| "logits/chosen": -21.598642905098632, | |
| "logits/rejected": -23.624653024193194, | |
| "logps/chosen": -677.4854145050049, | |
| "logps/rejected": -513.8848571777344, | |
| "loss": 0.9803842306137085, | |
| "mean_token_accuracy": 0.7514287456870079, | |
| "num_tokens": 6522645.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0021543916955124587, | |
| "rewards/margins": 0.0788510333513841, | |
| "rewards/rejected": -0.07669664057902992, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.0687246397137642, | |
| "epoch": 0.0727386737733187, | |
| "grad_norm": 28.08934783935547, | |
| "learning_rate": 9.997516272602588e-07, | |
| "logits/chosen": -18.0843256562564, | |
| "logits/rejected": -17.27698922154224, | |
| "logps/chosen": -591.8647804260254, | |
| "logps/rejected": -329.94952392578125, | |
| "loss": 0.9886791706085205, | |
| "mean_token_accuracy": 0.7329046651721001, | |
| "num_tokens": 6565380.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.014423841843381524, | |
| "rewards/margins": 0.045475234859623015, | |
| "rewards/rejected": -0.05989907821640372, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.2525769509375095, | |
| "epoch": 0.07336573130584731, | |
| "grad_norm": 32.46056365966797, | |
| "learning_rate": 9.997174102398892e-07, | |
| "logits/chosen": -19.069984483617883, | |
| "logits/rejected": -18.31701463203426, | |
| "logps/chosen": -857.891770362854, | |
| "logps/rejected": -576.6237850189209, | |
| "loss": 0.9878202676773071, | |
| "mean_token_accuracy": 0.7090706676244736, | |
| "num_tokens": 6621385.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.012965936097316444, | |
| "rewards/margins": 0.04882583348080516, | |
| "rewards/rejected": -0.06179177016019821, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.0708193145692348, | |
| "epoch": 0.07399278883837591, | |
| "grad_norm": 33.78789138793945, | |
| "learning_rate": 9.996809865277214e-07, | |
| "logits/chosen": -17.575822411940983, | |
| "logits/rejected": -15.71341222924891, | |
| "logps/chosen": -628.3108444213867, | |
| "logps/rejected": -381.9364585876465, | |
| "loss": 0.984896183013916, | |
| "mean_token_accuracy": 0.7500499114394188, | |
| "num_tokens": 6671308.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.02526119421236217, | |
| "rewards/margins": 0.060638573253527284, | |
| "rewards/rejected": -0.0858997656032443, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.1464358419179916, | |
| "epoch": 0.07461984637090453, | |
| "grad_norm": 29.262676239013672, | |
| "learning_rate": 9.996423562845978e-07, | |
| "logits/chosen": -18.950197207830822, | |
| "logits/rejected": -17.89534831083926, | |
| "logps/chosen": -499.1498966217041, | |
| "logps/rejected": -397.74127197265625, | |
| "loss": 0.9772639274597168, | |
| "mean_token_accuracy": 0.7390127554535866, | |
| "num_tokens": 6707362.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.014790326356887817, | |
| "rewards/margins": 0.09125107247382402, | |
| "rewards/rejected": -0.07646074634976685, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.1956902518868446, | |
| "epoch": 0.07524690390343314, | |
| "grad_norm": 31.247859954833984, | |
| "learning_rate": 9.996015196811054e-07, | |
| "logits/chosen": -16.430566598689513, | |
| "logits/rejected": -16.301428702284802, | |
| "logps/chosen": -712.8943672180176, | |
| "logps/rejected": -467.7664604187012, | |
| "loss": 0.9875868558883667, | |
| "mean_token_accuracy": 0.7251445576548576, | |
| "num_tokens": 6761518.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.00015118438750505447, | |
| "rewards/margins": 0.05001709656789899, | |
| "rewards/rejected": -0.04986591334454715, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.04892847687006, | |
| "epoch": 0.07587396143596174, | |
| "grad_norm": 36.938690185546875, | |
| "learning_rate": 9.995584768975734e-07, | |
| "logits/chosen": -20.353520038495564, | |
| "logits/rejected": -18.411114375084413, | |
| "logps/chosen": -787.6422328948975, | |
| "logps/rejected": -501.9888114929199, | |
| "loss": 0.9638845920562744, | |
| "mean_token_accuracy": 0.7510411590337753, | |
| "num_tokens": 6814204.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.037587814789731055, | |
| "rewards/margins": 0.1457526022568345, | |
| "rewards/rejected": -0.10816478868946433, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.911387711763382, | |
| "epoch": 0.07650101896849036, | |
| "grad_norm": 30.251392364501953, | |
| "learning_rate": 9.995132281240734e-07, | |
| "logits/chosen": -19.869032639332318, | |
| "logits/rejected": -18.91703122960338, | |
| "logps/chosen": -582.7686996459961, | |
| "logps/rejected": -366.2984085083008, | |
| "loss": 0.9788750410079956, | |
| "mean_token_accuracy": 0.7888387069106102, | |
| "num_tokens": 6861531.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.003442022774834186, | |
| "rewards/margins": 0.0853227588813752, | |
| "rewards/rejected": -0.08188073709607124, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.0427976697683334, | |
| "epoch": 0.07712807650101897, | |
| "grad_norm": 36.89279556274414, | |
| "learning_rate": 9.994657735604188e-07, | |
| "logits/chosen": -24.044872176023844, | |
| "logits/rejected": -22.597699453222447, | |
| "logps/chosen": -966.8881568908691, | |
| "logps/rejected": -505.8887948989868, | |
| "loss": 0.9708135724067688, | |
| "mean_token_accuracy": 0.7332872226834297, | |
| "num_tokens": 6921458.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.012047640164382756, | |
| "rewards/margins": 0.11771579552441835, | |
| "rewards/rejected": -0.10566815291531384, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.0259113758802414, | |
| "epoch": 0.07775513403354758, | |
| "grad_norm": 37.096275329589844, | |
| "learning_rate": 9.994161134161632e-07, | |
| "logits/chosen": -19.591871441281974, | |
| "logits/rejected": -20.936406703396575, | |
| "logps/chosen": -818.1269016265869, | |
| "logps/rejected": -639.8456077575684, | |
| "loss": 0.9665595293045044, | |
| "mean_token_accuracy": 0.7770890146493912, | |
| "num_tokens": 6982937.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.020557800424285233, | |
| "rewards/margins": 0.13559715449810028, | |
| "rewards/rejected": -0.11503935337532312, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.1710731238126755, | |
| "epoch": 0.07838219156607619, | |
| "grad_norm": 42.78230667114258, | |
| "learning_rate": 9.993642479105997e-07, | |
| "logits/chosen": -24.393052790442358, | |
| "logits/rejected": -18.192713037735032, | |
| "logps/chosen": -1177.7320861816406, | |
| "logps/rejected": -522.7479839324951, | |
| "loss": 0.9867607355117798, | |
| "mean_token_accuracy": 0.712364636361599, | |
| "num_tokens": 7046947.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.02724925708025694, | |
| "rewards/margins": 0.052655004314146936, | |
| "rewards/rejected": -0.07990426244214177, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.1666254326701164, | |
| "epoch": 0.0790092490986048, | |
| "grad_norm": 32.3548469543457, | |
| "learning_rate": 9.993101772727601e-07, | |
| "logits/chosen": -17.63798263385176, | |
| "logits/rejected": -17.47313740458377, | |
| "logps/chosen": -606.1291179656982, | |
| "logps/rejected": -430.56521797180176, | |
| "loss": 0.9682327508926392, | |
| "mean_token_accuracy": 0.7458649724721909, | |
| "num_tokens": 7102060.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0330769574502483, | |
| "rewards/margins": 0.13182413554750383, | |
| "rewards/rejected": -0.09874717495404184, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.1291334107518196, | |
| "epoch": 0.07963630663113341, | |
| "grad_norm": 31.756563186645508, | |
| "learning_rate": 9.99253901741414e-07, | |
| "logits/chosen": -21.307392332824012, | |
| "logits/rejected": -20.84085959531398, | |
| "logps/chosen": -732.371265411377, | |
| "logps/rejected": -503.3115940093994, | |
| "loss": 0.9792959690093994, | |
| "mean_token_accuracy": 0.7251338735222816, | |
| "num_tokens": 7157801.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.018919202295364812, | |
| "rewards/margins": 0.08486578240990639, | |
| "rewards/rejected": -0.06594657967798412, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.1786841079592705, | |
| "epoch": 0.08026336416366202, | |
| "grad_norm": 40.29298782348633, | |
| "learning_rate": 9.99195421565067e-07, | |
| "logits/chosen": -17.529350354706732, | |
| "logits/rejected": -20.833092058953017, | |
| "logps/chosen": -1033.621503829956, | |
| "logps/rejected": -691.7955369949341, | |
| "loss": 0.9725984334945679, | |
| "mean_token_accuracy": 0.7169393450021744, | |
| "num_tokens": 7224323.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.006326087401248515, | |
| "rewards/margins": 0.11025936878286302, | |
| "rewards/rejected": -0.11658545769751072, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.1065169423818588, | |
| "epoch": 0.08089042169619062, | |
| "grad_norm": 30.228065490722656, | |
| "learning_rate": 9.991347370019609e-07, | |
| "logits/chosen": -18.675428265484687, | |
| "logits/rejected": -18.02665901699452, | |
| "logps/chosen": -738.0616884231567, | |
| "logps/rejected": -413.77689933776855, | |
| "loss": 0.9663163423538208, | |
| "mean_token_accuracy": 0.7391728013753891, | |
| "num_tokens": 7273940.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.04217634559608996, | |
| "rewards/margins": 0.1416997853666544, | |
| "rewards/rejected": -0.09952343860641122, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 1.0223164483904839, | |
| "epoch": 0.08151747922871924, | |
| "grad_norm": 36.71884536743164, | |
| "learning_rate": 9.990718483200711e-07, | |
| "logits/chosen": -24.017658505382084, | |
| "logits/rejected": -19.894383210249206, | |
| "logps/chosen": -853.0483455657959, | |
| "logps/rejected": -410.2704782485962, | |
| "loss": 0.9696524739265442, | |
| "mean_token_accuracy": 0.7612569332122803, | |
| "num_tokens": 7330670.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.022751914570108056, | |
| "rewards/margins": 0.12564924580510706, | |
| "rewards/rejected": -0.10289733344689012, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.188691645860672, | |
| "epoch": 0.08214453676124785, | |
| "grad_norm": 45.50562286376953, | |
| "learning_rate": 9.990067557971066e-07, | |
| "logits/chosen": -20.96738395725814, | |
| "logits/rejected": -18.577314710392834, | |
| "logps/chosen": -1276.1438827514648, | |
| "logps/rejected": -671.3540458679199, | |
| "loss": 0.9635441303253174, | |
| "mean_token_accuracy": 0.7195305675268173, | |
| "num_tokens": 7400528.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.027424347819760442, | |
| "rewards/margins": 0.14744434040039778, | |
| "rewards/rejected": -0.1200199886225164, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.9636916220188141, | |
| "epoch": 0.08277159429377645, | |
| "grad_norm": 28.21497344970703, | |
| "learning_rate": 9.989394597205082e-07, | |
| "logits/chosen": -17.83059240747361, | |
| "logits/rejected": -17.95696408960033, | |
| "logps/chosen": -485.29137802124023, | |
| "logps/rejected": -400.46766471862793, | |
| "loss": 0.976447343826294, | |
| "mean_token_accuracy": 0.7697746828198433, | |
| "num_tokens": 7462922.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.010323267662897706, | |
| "rewards/margins": 0.09466969268396497, | |
| "rewards/rejected": -0.08434642176143825, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.9702051728963852, | |
| "epoch": 0.08339865182630507, | |
| "grad_norm": 35.21070861816406, | |
| "learning_rate": 9.98869960387447e-07, | |
| "logits/chosen": -24.15228929902058, | |
| "logits/rejected": -17.62097141810482, | |
| "logps/chosen": -707.7485370635986, | |
| "logps/rejected": -328.29246520996094, | |
| "loss": 0.9750052690505981, | |
| "mean_token_accuracy": 0.7517875507473946, | |
| "num_tokens": 7516053.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.020313383429311216, | |
| "rewards/margins": 0.10041370801627636, | |
| "rewards/rejected": -0.08010032417951152, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.080765277147293, | |
| "epoch": 0.08402570935883368, | |
| "grad_norm": 33.306419372558594, | |
| "learning_rate": 9.98798258104824e-07, | |
| "logits/chosen": -16.50647893746725, | |
| "logits/rejected": -18.638188273587172, | |
| "logps/chosen": -394.3768768310547, | |
| "logps/rejected": -530.8435726165771, | |
| "loss": 0.9684998393058777, | |
| "mean_token_accuracy": 0.7539431154727936, | |
| "num_tokens": 7560146.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.008416369266342372, | |
| "rewards/margins": 0.12770695355720818, | |
| "rewards/rejected": -0.13612332614138722, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.0699984654784203, | |
| "epoch": 0.08465276689136228, | |
| "grad_norm": 29.02651596069336, | |
| "learning_rate": 9.987243531892676e-07, | |
| "logits/chosen": -17.323968607265364, | |
| "logits/rejected": -17.327844017915886, | |
| "logps/chosen": -423.5040798187256, | |
| "logps/rejected": -401.37097549438477, | |
| "loss": 0.9706511497497559, | |
| "mean_token_accuracy": 0.7508202418684959, | |
| "num_tokens": 7604430.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.010786252591060475, | |
| "rewards/margins": 0.11822709790430963, | |
| "rewards/rejected": -0.10744084196630865, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.1741472780704498, | |
| "epoch": 0.0852798244238909, | |
| "grad_norm": 29.518667221069336, | |
| "learning_rate": 9.98648245967133e-07, | |
| "logits/chosen": -17.057511505199, | |
| "logits/rejected": -15.816799192033697, | |
| "logps/chosen": -578.4385671615601, | |
| "logps/rejected": -470.2986297607422, | |
| "loss": 0.9768874645233154, | |
| "mean_token_accuracy": 0.7322021424770355, | |
| "num_tokens": 7661280.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.018278606235980988, | |
| "rewards/margins": 0.09282787260599434, | |
| "rewards/rejected": -0.07454926625359803, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.1715349406003952, | |
| "epoch": 0.0859068819564195, | |
| "grad_norm": 35.8231086730957, | |
| "learning_rate": 9.985699367745007e-07, | |
| "logits/chosen": -20.207632968359622, | |
| "logits/rejected": -18.918033251926897, | |
| "logps/chosen": -1063.0584182739258, | |
| "logps/rejected": -546.3697662353516, | |
| "loss": 0.9809889793395996, | |
| "mean_token_accuracy": 0.7140867561101913, | |
| "num_tokens": 7723139.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.016168745700269938, | |
| "rewards/margins": 0.07651804899796844, | |
| "rewards/rejected": -0.09268679865635931, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.0441111102700233, | |
| "epoch": 0.08653393948894811, | |
| "grad_norm": 32.78045654296875, | |
| "learning_rate": 9.984894259571743e-07, | |
| "logits/chosen": -19.221359907309978, | |
| "logits/rejected": -18.10666979652929, | |
| "logps/chosen": -489.88498306274414, | |
| "logps/rejected": -398.86695098876953, | |
| "loss": 0.9633641242980957, | |
| "mean_token_accuracy": 0.7486372217535973, | |
| "num_tokens": 7766818.0, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.011141044669784606, | |
| "rewards/margins": 0.14769388129934669, | |
| "rewards/rejected": -0.1365528372116387, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 1.1274549514055252, | |
| "epoch": 0.08716099702147673, | |
| "grad_norm": 28.61403465270996, | |
| "learning_rate": 9.984067138706801e-07, | |
| "logits/chosen": -20.09536989108541, | |
| "logits/rejected": -19.089721130331522, | |
| "logps/chosen": -668.453311920166, | |
| "logps/rejected": -400.32433700561523, | |
| "loss": 0.9768990278244019, | |
| "mean_token_accuracy": 0.7357787117362022, | |
| "num_tokens": 7805514.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.008357231738045812, | |
| "rewards/margins": 0.09283104329369962, | |
| "rewards/rejected": -0.08447381528094411, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.072766751050949, | |
| "epoch": 0.08778805455400533, | |
| "grad_norm": 36.328330993652344, | |
| "learning_rate": 9.983218008802647e-07, | |
| "logits/chosen": -16.597205351543526, | |
| "logits/rejected": -17.38877890508226, | |
| "logps/chosen": -845.426420211792, | |
| "logps/rejected": -446.5038776397705, | |
| "loss": 0.969933271408081, | |
| "mean_token_accuracy": 0.7438737154006958, | |
| "num_tokens": 7867552.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.004711989313364029, | |
| "rewards/margins": 0.12162661645561457, | |
| "rewards/rejected": -0.12633860250934958, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.1710950955748558, | |
| "epoch": 0.08841511208653394, | |
| "grad_norm": 35.29788589477539, | |
| "learning_rate": 9.982346873608936e-07, | |
| "logits/chosen": -17.457327570012882, | |
| "logits/rejected": -17.907635026265908, | |
| "logps/chosen": -594.5470962524414, | |
| "logps/rejected": -608.6735458374023, | |
| "loss": 0.9617944359779358, | |
| "mean_token_accuracy": 0.7367723286151886, | |
| "num_tokens": 7913056.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.0014770900015719235, | |
| "rewards/margins": 0.15395231172442436, | |
| "rewards/rejected": -0.15247522108256817, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.0754098296165466, | |
| "epoch": 0.08904216961906256, | |
| "grad_norm": 35.45695877075195, | |
| "learning_rate": 9.981453736972495e-07, | |
| "logits/chosen": -19.118562752807563, | |
| "logits/rejected": -16.91145482295967, | |
| "logps/chosen": -698.3301868438721, | |
| "logps/rejected": -497.7921562194824, | |
| "loss": 0.9720945954322815, | |
| "mean_token_accuracy": 0.7595574334263802, | |
| "num_tokens": 7980591.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.01288341250619851, | |
| "rewards/margins": 0.11340800416655838, | |
| "rewards/rejected": -0.10052459384314716, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.9044511765241623, | |
| "epoch": 0.08966922715159116, | |
| "grad_norm": 30.17085075378418, | |
| "learning_rate": 9.98053860283731e-07, | |
| "logits/chosen": -21.207617728808614, | |
| "logits/rejected": -20.905731823651053, | |
| "logps/chosen": -628.0943202972412, | |
| "logps/rejected": -420.4750385284424, | |
| "loss": 0.9711873531341553, | |
| "mean_token_accuracy": 0.7811061069369316, | |
| "num_tokens": 8034884.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.023002621717751026, | |
| "rewards/margins": 0.1186411960516125, | |
| "rewards/rejected": -0.09563857619650662, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.1677963212132454, | |
| "epoch": 0.09029628468411977, | |
| "grad_norm": 31.993118286132812, | |
| "learning_rate": 9.9796014752445e-07, | |
| "logits/chosen": -18.57265198556839, | |
| "logits/rejected": -17.995440262698004, | |
| "logps/chosen": -658.4226865768433, | |
| "logps/rejected": -438.4370231628418, | |
| "loss": 0.9786888360977173, | |
| "mean_token_accuracy": 0.7285968512296677, | |
| "num_tokens": 8082039.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.02490088331978768, | |
| "rewards/margins": 0.08490909356623888, | |
| "rewards/rejected": -0.10980997630394995, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0427600964903831, | |
| "epoch": 0.09092334221664838, | |
| "grad_norm": 31.311111450195312, | |
| "learning_rate": 9.978642358332307e-07, | |
| "logits/chosen": -19.139753277032113, | |
| "logits/rejected": -17.59120642360813, | |
| "logps/chosen": -567.9225654602051, | |
| "logps/rejected": -465.25221252441406, | |
| "loss": 0.9686312675476074, | |
| "mean_token_accuracy": 0.7571733519434929, | |
| "num_tokens": 8123718.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.008705203887075186, | |
| "rewards/margins": 0.12602692190557718, | |
| "rewards/rejected": -0.117321718018502, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.8850021287798882, | |
| "epoch": 0.09155039974917699, | |
| "grad_norm": 37.63220977783203, | |
| "learning_rate": 9.97766125633608e-07, | |
| "logits/chosen": -19.910044793415654, | |
| "logits/rejected": -22.54540787489115, | |
| "logps/chosen": -699.3141222000122, | |
| "logps/rejected": -466.68331146240234, | |
| "loss": 0.9604589939117432, | |
| "mean_token_accuracy": 0.7936916127800941, | |
| "num_tokens": 8187632.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.003929961123503745, | |
| "rewards/margins": 0.168057446135208, | |
| "rewards/rejected": -0.17198741296306252, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0326995179057121, | |
| "epoch": 0.0921774572817056, | |
| "grad_norm": 37.081241607666016, | |
| "learning_rate": 9.976658173588243e-07, | |
| "logits/chosen": -21.190682950448576, | |
| "logits/rejected": -17.69587061048208, | |
| "logps/chosen": -751.942907333374, | |
| "logps/rejected": -442.78441619873047, | |
| "loss": 0.9758281707763672, | |
| "mean_token_accuracy": 0.7523355558514595, | |
| "num_tokens": 8243290.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.02370329963741824, | |
| "rewards/margins": 0.09733096603304148, | |
| "rewards/rejected": -0.12103426642715931, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.9734203144907951, | |
| "epoch": 0.09280451481423421, | |
| "grad_norm": 36.707550048828125, | |
| "learning_rate": 9.97563311451829e-07, | |
| "logits/chosen": -23.493140481868807, | |
| "logits/rejected": -19.432473725597365, | |
| "logps/chosen": -1202.7809944152832, | |
| "logps/rejected": -374.36139488220215, | |
| "loss": 0.9666430950164795, | |
| "mean_token_accuracy": 0.7533522471785545, | |
| "num_tokens": 8312496.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.040649566042702645, | |
| "rewards/margins": 0.13564491388387978, | |
| "rewards/rejected": -0.0949953489471227, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 1.3850471526384354, | |
| "epoch": 0.09343157234676282, | |
| "grad_norm": 31.51274871826172, | |
| "learning_rate": 9.974586083652757e-07, | |
| "logits/chosen": -18.153076228160014, | |
| "logits/rejected": -16.684204876050245, | |
| "logps/chosen": -845.3816833496094, | |
| "logps/rejected": -408.8254728317261, | |
| "loss": 0.9770760536193848, | |
| "mean_token_accuracy": 0.6601794064044952, | |
| "num_tokens": 8362689.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.018910931539721787, | |
| "rewards/margins": 0.09186943899840117, | |
| "rewards/rejected": -0.11078036949038506, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.0344312191009521, | |
| "epoch": 0.09405862987929142, | |
| "grad_norm": 37.89040756225586, | |
| "learning_rate": 9.97351708561521e-07, | |
| "logits/chosen": -23.15418936171772, | |
| "logits/rejected": -19.21865452626319, | |
| "logps/chosen": -769.2827854156494, | |
| "logps/rejected": -666.4356002807617, | |
| "loss": 0.9749352335929871, | |
| "mean_token_accuracy": 0.7564720064401627, | |
| "num_tokens": 8420985.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.009593813680112362, | |
| "rewards/margins": 0.10142657672986388, | |
| "rewards/rejected": -0.1110203885473311, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.175799421966076, | |
| "epoch": 0.09468568741182004, | |
| "grad_norm": 40.132625579833984, | |
| "learning_rate": 9.972426125126207e-07, | |
| "logits/chosen": -21.38852635915963, | |
| "logits/rejected": -18.672145327724344, | |
| "logps/chosen": -1471.715404510498, | |
| "logps/rejected": -486.47255516052246, | |
| "loss": 0.980172336101532, | |
| "mean_token_accuracy": 0.721579059958458, | |
| "num_tokens": 8489644.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.03523680008947849, | |
| "rewards/margins": 0.0802477840334177, | |
| "rewards/rejected": -0.11548458551988006, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 1.4164262264966965, | |
| "epoch": 0.09531274494434865, | |
| "grad_norm": 27.696420669555664, | |
| "learning_rate": 9.971313207003307e-07, | |
| "logits/chosen": -13.93982345493672, | |
| "logits/rejected": -14.11517608202279, | |
| "logps/chosen": -740.9725232124329, | |
| "logps/rejected": -564.2864780426025, | |
| "loss": 0.9797288179397583, | |
| "mean_token_accuracy": 0.6809670105576515, | |
| "num_tokens": 8537512.0, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0021716501796618104, | |
| "rewards/margins": 0.08156625635456294, | |
| "rewards/rejected": -0.08373790187761188, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.263432890176773, | |
| "epoch": 0.09593980247687725, | |
| "grad_norm": 31.5176944732666, | |
| "learning_rate": 9.970178336161016e-07, | |
| "logits/chosen": -16.973323202222108, | |
| "logits/rejected": -19.614638086614725, | |
| "logps/chosen": -711.4418649673462, | |
| "logps/rejected": -372.44454193115234, | |
| "loss": 0.9762611389160156, | |
| "mean_token_accuracy": 0.7092464938759804, | |
| "num_tokens": 8591662.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.0145274052338209, | |
| "rewards/margins": 0.09459308302029967, | |
| "rewards/rejected": -0.10912049002945423, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.1620648950338364, | |
| "epoch": 0.09656686000940587, | |
| "grad_norm": 30.509321212768555, | |
| "learning_rate": 9.969021517610792e-07, | |
| "logits/chosen": -13.79756665559363, | |
| "logits/rejected": -15.715619490328542, | |
| "logps/chosen": -604.1418495178223, | |
| "logps/rejected": -382.564510345459, | |
| "loss": 0.9641399383544922, | |
| "mean_token_accuracy": 0.726889930665493, | |
| "num_tokens": 8636893.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0023322205524891615, | |
| "rewards/margins": 0.14497205498628318, | |
| "rewards/rejected": -0.1473042806610465, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.1641441136598587, | |
| "epoch": 0.09719391754193447, | |
| "grad_norm": 41.579978942871094, | |
| "learning_rate": 9.967842756461002e-07, | |
| "logits/chosen": -20.334094398749123, | |
| "logits/rejected": -22.011842279254914, | |
| "logps/chosen": -1403.928207397461, | |
| "logps/rejected": -554.649658203125, | |
| "loss": 0.9708878397941589, | |
| "mean_token_accuracy": 0.72523083537817, | |
| "num_tokens": 8717868.0, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.00970022683031857, | |
| "rewards/margins": 0.11776156397536397, | |
| "rewards/rejected": -0.10806133644655347, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.2410652860999107, | |
| "epoch": 0.09782097507446308, | |
| "grad_norm": 125.10015106201172, | |
| "learning_rate": 9.966642057916914e-07, | |
| "logits/chosen": -18.70830338783564, | |
| "logits/rejected": -19.97097714965005, | |
| "logps/chosen": -1191.791633605957, | |
| "logps/rejected": -752.3146705627441, | |
| "loss": 0.9524157643318176, | |
| "mean_token_accuracy": 0.7021138742566109, | |
| "num_tokens": 8807483.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.0013844413042534143, | |
| "rewards/margins": 0.19747850112617016, | |
| "rewards/rejected": -0.19886294193565845, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 1.029944323003292, | |
| "epoch": 0.0984480326069917, | |
| "grad_norm": 35.78042221069336, | |
| "learning_rate": 9.965419427280668e-07, | |
| "logits/chosen": -23.38625175610134, | |
| "logits/rejected": -20.01934285422626, | |
| "logps/chosen": -1151.3675441741943, | |
| "logps/rejected": -498.4595642089844, | |
| "loss": 0.9675576090812683, | |
| "mean_token_accuracy": 0.7536375895142555, | |
| "num_tokens": 8887962.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.03968535171588883, | |
| "rewards/margins": 0.13185083586722612, | |
| "rewards/rejected": -0.09216548292897642, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 1.1238584071397781, | |
| "epoch": 0.0990750901395203, | |
| "grad_norm": 35.993568420410156, | |
| "learning_rate": 9.964174869951254e-07, | |
| "logits/chosen": -13.67164112165123, | |
| "logits/rejected": -19.3182056629662, | |
| "logps/chosen": -457.62388134002686, | |
| "logps/rejected": -487.38970375061035, | |
| "loss": 0.9535990953445435, | |
| "mean_token_accuracy": 0.7514778524637222, | |
| "num_tokens": 8930150.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.004519644775427878, | |
| "rewards/margins": 0.18916182266548276, | |
| "rewards/rejected": -0.19368146173655987, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.9919542148709297, | |
| "epoch": 0.09970214767204891, | |
| "grad_norm": 35.438880920410156, | |
| "learning_rate": 9.962908391424487e-07, | |
| "logits/chosen": -24.406944580639333, | |
| "logits/rejected": -21.38588868915605, | |
| "logps/chosen": -899.7554340362549, | |
| "logps/rejected": -343.76156425476074, | |
| "loss": 0.9654215574264526, | |
| "mean_token_accuracy": 0.7644909620285034, | |
| "num_tokens": 8991665.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.006943491520360112, | |
| "rewards/margins": 0.14082542480900884, | |
| "rewards/rejected": -0.1338819395750761, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 1.0232055224478245, | |
| "epoch": 0.10032920520457753, | |
| "grad_norm": 31.05710220336914, | |
| "learning_rate": 9.961619997292983e-07, | |
| "logits/chosen": -17.982335887836616, | |
| "logits/rejected": -20.611772617446324, | |
| "logps/chosen": -540.6755952835083, | |
| "logps/rejected": -586.5883369445801, | |
| "loss": 0.9546467065811157, | |
| "mean_token_accuracy": 0.7635128647089005, | |
| "num_tokens": 9042126.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0020738002785947174, | |
| "rewards/margins": 0.19118777592666447, | |
| "rewards/rejected": -0.19326158007606864, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.0774603635072708, | |
| "epoch": 0.10095626273710613, | |
| "grad_norm": 30.445066452026367, | |
| "learning_rate": 9.960309693246134e-07, | |
| "logits/chosen": -16.290460512960674, | |
| "logits/rejected": -18.012763543697705, | |
| "logps/chosen": -576.4469928741455, | |
| "logps/rejected": -511.25352478027344, | |
| "loss": 0.9666774868965149, | |
| "mean_token_accuracy": 0.7399578765034676, | |
| "num_tokens": 9088125.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.01442447875160724, | |
| "rewards/margins": 0.1348671750165522, | |
| "rewards/rejected": -0.14929165970534086, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 1.0612441897392273, | |
| "epoch": 0.10158332026963474, | |
| "grad_norm": 37.424896240234375, | |
| "learning_rate": 9.958977485070087e-07, | |
| "logits/chosen": -19.54973934978431, | |
| "logits/rejected": -21.830906008805396, | |
| "logps/chosen": -839.8476104736328, | |
| "logps/rejected": -619.4777336120605, | |
| "loss": 0.9631219506263733, | |
| "mean_token_accuracy": 0.7454415857791901, | |
| "num_tokens": 9147591.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.027470878849271685, | |
| "rewards/margins": 0.14951888378709555, | |
| "rewards/rejected": -0.17698976676911116, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.8433318734169006, | |
| "epoch": 0.10221037780216335, | |
| "grad_norm": 36.499000549316406, | |
| "learning_rate": 9.957623378647708e-07, | |
| "logits/chosen": -22.97117871622693, | |
| "logits/rejected": -23.077180808340206, | |
| "logps/chosen": -762.8622913360596, | |
| "logps/rejected": -496.52293968200684, | |
| "loss": 0.9598798155784607, | |
| "mean_token_accuracy": 0.7907682359218597, | |
| "num_tokens": 9204397.0, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.008882903959602118, | |
| "rewards/margins": 0.16420582123100758, | |
| "rewards/rejected": -0.15532291657291353, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 1.1806890442967415, | |
| "epoch": 0.10283743533469196, | |
| "grad_norm": 45.862754821777344, | |
| "learning_rate": 9.956247379958574e-07, | |
| "logits/chosen": -19.059974763772217, | |
| "logits/rejected": -18.85946041293872, | |
| "logps/chosen": -1369.5862731933594, | |
| "logps/rejected": -567.7572498321533, | |
| "loss": 0.9552696943283081, | |
| "mean_token_accuracy": 0.7177683860063553, | |
| "num_tokens": 9271429.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.03492974303662777, | |
| "rewards/margins": 0.18170535750687122, | |
| "rewards/rejected": -0.14677561353892088, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 1.0775589682161808, | |
| "epoch": 0.10346449286722056, | |
| "grad_norm": 29.601449966430664, | |
| "learning_rate": 9.954849495078926e-07, | |
| "logits/chosen": -19.275060518402277, | |
| "logits/rejected": -19.166819179421008, | |
| "logps/chosen": -660.1427116394043, | |
| "logps/rejected": -383.6678161621094, | |
| "loss": 0.958690881729126, | |
| "mean_token_accuracy": 0.7361882030963898, | |
| "num_tokens": 9312257.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.03519108361797407, | |
| "rewards/margins": 0.1664116713218391, | |
| "rewards/rejected": -0.13122059125453234, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 1.1816764548420906, | |
| "epoch": 0.10409155039974918, | |
| "grad_norm": 30.252086639404297, | |
| "learning_rate": 9.953429730181652e-07, | |
| "logits/chosen": -16.37164589704853, | |
| "logits/rejected": -15.937881459823364, | |
| "logps/chosen": -442.10915756225586, | |
| "logps/rejected": -464.68394470214844, | |
| "loss": 0.9728706479072571, | |
| "mean_token_accuracy": 0.7251901105046272, | |
| "num_tokens": 9350579.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.025675334269180894, | |
| "rewards/margins": 0.10957675683312118, | |
| "rewards/rejected": -0.13525208923965693, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 1.0316157564520836, | |
| "epoch": 0.10471860793227779, | |
| "grad_norm": 39.15115737915039, | |
| "learning_rate": 9.95198809153627e-07, | |
| "logits/chosen": -17.97388225518009, | |
| "logits/rejected": -17.878072330124738, | |
| "logps/chosen": -963.8222351074219, | |
| "logps/rejected": -576.2222747802734, | |
| "loss": 0.9726594686508179, | |
| "mean_token_accuracy": 0.7661974504590034, | |
| "num_tokens": 9420912.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.039964041672647, | |
| "rewards/margins": 0.10996103240177035, | |
| "rewards/rejected": -0.14992507733404636, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.9888377711176872, | |
| "epoch": 0.10534566546480639, | |
| "grad_norm": 33.86361312866211, | |
| "learning_rate": 9.950524585508875e-07, | |
| "logits/chosen": -21.71417541647197, | |
| "logits/rejected": -21.1007052103952, | |
| "logps/chosen": -570.1340103149414, | |
| "logps/rejected": -569.658317565918, | |
| "loss": 0.965457558631897, | |
| "mean_token_accuracy": 0.7609636634588242, | |
| "num_tokens": 9472501.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.004693154362030327, | |
| "rewards/margins": 0.13876159954816103, | |
| "rewards/rejected": -0.13406844343990088, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 1.1498691216111183, | |
| "epoch": 0.10597272299733501, | |
| "grad_norm": 35.466957092285156, | |
| "learning_rate": 9.949039218562137e-07, | |
| "logits/chosen": -23.389534862650184, | |
| "logits/rejected": -20.17964972359958, | |
| "logps/chosen": -982.7829933166504, | |
| "logps/rejected": -726.9613132476807, | |
| "loss": 0.9566149711608887, | |
| "mean_token_accuracy": 0.7251748219132423, | |
| "num_tokens": 9543720.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.003413940197788179, | |
| "rewards/margins": 0.1751425163820386, | |
| "rewards/rejected": -0.17855645716190338, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.8980679214000702, | |
| "epoch": 0.10659978052986362, | |
| "grad_norm": 40.1265754699707, | |
| "learning_rate": 9.947531997255256e-07, | |
| "logits/chosen": -24.576026786001893, | |
| "logits/rejected": -21.24743446770542, | |
| "logps/chosen": -646.5030174255371, | |
| "logps/rejected": -609.3380126953125, | |
| "loss": 0.946999728679657, | |
| "mean_token_accuracy": 0.8074663206934929, | |
| "num_tokens": 9599025.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.024876392912119627, | |
| "rewards/margins": 0.21698989067226648, | |
| "rewards/rejected": -0.19211349356919527, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.041010521352291, | |
| "epoch": 0.10722683806239222, | |
| "grad_norm": 27.908248901367188, | |
| "learning_rate": 9.946002928243938e-07, | |
| "logits/chosen": -17.12985163970272, | |
| "logits/rejected": -18.323306945407023, | |
| "logps/chosen": -343.0621109008789, | |
| "logps/rejected": -436.75281524658203, | |
| "loss": 0.9608134031295776, | |
| "mean_token_accuracy": 0.7628256380558014, | |
| "num_tokens": 9635752.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.014670340926386416, | |
| "rewards/margins": 0.15794761665165424, | |
| "rewards/rejected": -0.1726179551333189, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.9685352593660355, | |
| "epoch": 0.10785389559492084, | |
| "grad_norm": 44.593017578125, | |
| "learning_rate": 9.94445201828037e-07, | |
| "logits/chosen": -25.693284187291074, | |
| "logits/rejected": -20.638393007437365, | |
| "logps/chosen": -1019.63330078125, | |
| "logps/rejected": -641.4812908172607, | |
| "loss": 0.9540131092071533, | |
| "mean_token_accuracy": 0.7625846937298775, | |
| "num_tokens": 9707928.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.051992423948831856, | |
| "rewards/margins": 0.18558591045439243, | |
| "rewards/rejected": -0.23757833428680897, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 1.035721518099308, | |
| "epoch": 0.10848095312744944, | |
| "grad_norm": 36.23087692260742, | |
| "learning_rate": 9.942879274213183e-07, | |
| "logits/chosen": -25.004740833477207, | |
| "logits/rejected": -21.763571870178154, | |
| "logps/chosen": -1005.9208698272705, | |
| "logps/rejected": -417.8051815032959, | |
| "loss": 0.9568801522254944, | |
| "mean_token_accuracy": 0.7389874830842018, | |
| "num_tokens": 9762747.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.041769477422349155, | |
| "rewards/margins": 0.17441253177821636, | |
| "rewards/rejected": -0.13264305610209703, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 1.2502099946141243, | |
| "epoch": 0.10910801065997805, | |
| "grad_norm": 26.709156036376953, | |
| "learning_rate": 9.941284702987425e-07, | |
| "logits/chosen": -15.603563936993165, | |
| "logits/rejected": -17.525335746655358, | |
| "logps/chosen": -483.58291244506836, | |
| "logps/rejected": -384.8349323272705, | |
| "loss": 0.9618538618087769, | |
| "mean_token_accuracy": 0.706192672252655, | |
| "num_tokens": 9801642.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.01173106487840414, | |
| "rewards/margins": 0.15353717282414436, | |
| "rewards/rejected": -0.1418061126023531, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 1.0089079961180687, | |
| "epoch": 0.10973506819250667, | |
| "grad_norm": 34.94546890258789, | |
| "learning_rate": 9.939668311644527e-07, | |
| "logits/chosen": -21.48884231436644, | |
| "logits/rejected": -20.73044133310641, | |
| "logps/chosen": -809.1402287483215, | |
| "logps/rejected": -620.0923671722412, | |
| "loss": 0.9594979286193848, | |
| "mean_token_accuracy": 0.764327310025692, | |
| "num_tokens": 9861136.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0033170885872095823, | |
| "rewards/margins": 0.1640703366138041, | |
| "rewards/rejected": -0.1607532473281026, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 1.134946659207344, | |
| "epoch": 0.11036212572503527, | |
| "grad_norm": 40.56920623779297, | |
| "learning_rate": 9.938030107322283e-07, | |
| "logits/chosen": -20.60884003968547, | |
| "logits/rejected": -21.315807587757533, | |
| "logps/chosen": -1011.4535865783691, | |
| "logps/rejected": -677.3356189727783, | |
| "loss": 0.9518853425979614, | |
| "mean_token_accuracy": 0.7143147438764572, | |
| "num_tokens": 9940296.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.020753700169734657, | |
| "rewards/margins": 0.2017311709932983, | |
| "rewards/rejected": -0.2224848661571741, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 1.1413284689188004, | |
| "epoch": 0.11098918325756388, | |
| "grad_norm": 34.17391586303711, | |
| "learning_rate": 9.936370097254803e-07, | |
| "logits/chosen": -18.22259319683248, | |
| "logits/rejected": -16.596884329014106, | |
| "logps/chosen": -748.4427871704102, | |
| "logps/rejected": -550.8146286010742, | |
| "loss": 0.9616140127182007, | |
| "mean_token_accuracy": 0.7435401454567909, | |
| "num_tokens": 9992025.0, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.020526117412373424, | |
| "rewards/margins": 0.15512995416065678, | |
| "rewards/rejected": -0.1346038356423378, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 1.1366123706102371, | |
| "epoch": 0.1116162407900925, | |
| "grad_norm": 42.503440856933594, | |
| "learning_rate": 9.93468828877249e-07, | |
| "logits/chosen": -22.75767775859101, | |
| "logits/rejected": -21.918987652590392, | |
| "logps/chosen": -1206.1099195480347, | |
| "logps/rejected": -610.3419342041016, | |
| "loss": 0.9570979475975037, | |
| "mean_token_accuracy": 0.7211766019463539, | |
| "num_tokens": 10059360.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.0131734365131706, | |
| "rewards/margins": 0.18104426749050617, | |
| "rewards/rejected": -0.1942176972515881, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 1.107018142938614, | |
| "epoch": 0.1122432983226211, | |
| "grad_norm": 39.66263198852539, | |
| "learning_rate": 9.93298468930201e-07, | |
| "logits/chosen": -23.260314784767324, | |
| "logits/rejected": -21.11647381786282, | |
| "logps/chosen": -1436.7120723724365, | |
| "logps/rejected": -508.69267654418945, | |
| "loss": 0.9501864910125732, | |
| "mean_token_accuracy": 0.7304199710488319, | |
| "num_tokens": 10132130.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.028971436579013243, | |
| "rewards/margins": 0.20222028624266386, | |
| "rewards/rejected": -0.17324885539710522, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 1.021133229136467, | |
| "epoch": 0.1128703558551497, | |
| "grad_norm": 29.389991760253906, | |
| "learning_rate": 9.93125930636625e-07, | |
| "logits/chosen": -18.06104104884531, | |
| "logits/rejected": -19.473802853816192, | |
| "logps/chosen": -539.9062232971191, | |
| "logps/rejected": -461.96774101257324, | |
| "loss": 0.9612171053886414, | |
| "mean_token_accuracy": 0.7571789473295212, | |
| "num_tokens": 10182254.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.02405679877847433, | |
| "rewards/margins": 0.1570815034210682, | |
| "rewards/rejected": -0.1330247106961906, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.1228575333952904, | |
| "epoch": 0.11349741338767833, | |
| "grad_norm": 31.7424373626709, | |
| "learning_rate": 9.929512147584296e-07, | |
| "logits/chosen": -19.25161771955138, | |
| "logits/rejected": -19.300870767626026, | |
| "logps/chosen": -471.5840435028076, | |
| "logps/rejected": -377.43126487731934, | |
| "loss": 0.9580326080322266, | |
| "mean_token_accuracy": 0.7341411262750626, | |
| "num_tokens": 10231221.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.00470810174010694, | |
| "rewards/margins": 0.1703320173546672, | |
| "rewards/rejected": -0.16562391445040703, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 1.2480486258864403, | |
| "epoch": 0.11412447092020693, | |
| "grad_norm": 33.407691955566406, | |
| "learning_rate": 9.927743220671389e-07, | |
| "logits/chosen": -15.707493700178858, | |
| "logits/rejected": -18.14101813743978, | |
| "logps/chosen": -644.9055366516113, | |
| "logps/rejected": -403.51587295532227, | |
| "loss": 0.9577570557594299, | |
| "mean_token_accuracy": 0.695245198905468, | |
| "num_tokens": 10278764.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.00990894460119307, | |
| "rewards/margins": 0.1714292955584824, | |
| "rewards/rejected": -0.18133824318647385, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.9243633225560188, | |
| "epoch": 0.11475152845273554, | |
| "grad_norm": 34.56248474121094, | |
| "learning_rate": 9.925952533438897e-07, | |
| "logits/chosen": -17.46200834389154, | |
| "logits/rejected": -16.492948873374484, | |
| "logps/chosen": -617.6435585021973, | |
| "logps/rejected": -372.62390518188477, | |
| "loss": 0.948718786239624, | |
| "mean_token_accuracy": 0.7732345685362816, | |
| "num_tokens": 10341069.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.010069805663079023, | |
| "rewards/margins": 0.2102643116377294, | |
| "rewards/rejected": -0.22033411543816328, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.9938921704888344, | |
| "epoch": 0.11537858598526415, | |
| "grad_norm": 30.834369659423828, | |
| "learning_rate": 9.924140093794277e-07, | |
| "logits/chosen": -19.204634086255844, | |
| "logits/rejected": -19.86160843964533, | |
| "logps/chosen": -502.1897392272949, | |
| "logps/rejected": -514.1468658447266, | |
| "loss": 0.9647988080978394, | |
| "mean_token_accuracy": 0.7703093513846397, | |
| "num_tokens": 10385519.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.006156077841296792, | |
| "rewards/margins": 0.14176303520798683, | |
| "rewards/rejected": -0.13560695759952068, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.9982673227787018, | |
| "epoch": 0.11600564351779276, | |
| "grad_norm": 33.376678466796875, | |
| "learning_rate": 9.922305909741046e-07, | |
| "logits/chosen": -20.081957609627672, | |
| "logits/rejected": -20.08288046634073, | |
| "logps/chosen": -563.1763916015625, | |
| "logps/rejected": -455.9494934082031, | |
| "loss": 0.940411388874054, | |
| "mean_token_accuracy": 0.7691720277070999, | |
| "num_tokens": 10451619.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.03211024316260591, | |
| "rewards/margins": 0.24388167914003134, | |
| "rewards/rejected": -0.21177144069224596, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 1.2043246403336525, | |
| "epoch": 0.11663270105032136, | |
| "grad_norm": 35.30168151855469, | |
| "learning_rate": 9.92044998937874e-07, | |
| "logits/chosen": -15.935400744656912, | |
| "logits/rejected": -17.80423133241425, | |
| "logps/chosen": -507.5350112915039, | |
| "logps/rejected": -506.1169013977051, | |
| "loss": 0.9446260929107666, | |
| "mean_token_accuracy": 0.7261253371834755, | |
| "num_tokens": 10504967.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.011272144154645503, | |
| "rewards/margins": 0.2257434045895934, | |
| "rewards/rejected": -0.21447127033025026, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.8656372576951981, | |
| "epoch": 0.11725975858284998, | |
| "grad_norm": 36.30891799926758, | |
| "learning_rate": 9.918572340902878e-07, | |
| "logits/chosen": -20.357606409612657, | |
| "logits/rejected": -20.43430765009451, | |
| "logps/chosen": -806.364107131958, | |
| "logps/rejected": -409.4738140106201, | |
| "loss": 0.9610611796379089, | |
| "mean_token_accuracy": 0.7912320047616959, | |
| "num_tokens": 10559810.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.01855588040780276, | |
| "rewards/margins": 0.16032809671014547, | |
| "rewards/rejected": -0.14177220640704036, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 1.2360781207680702, | |
| "epoch": 0.11788681611537859, | |
| "grad_norm": 36.44474411010742, | |
| "learning_rate": 9.916672972604927e-07, | |
| "logits/chosen": -21.232208354402246, | |
| "logits/rejected": -20.78721834595899, | |
| "logps/chosen": -872.3558025360107, | |
| "logps/rejected": -562.6851234436035, | |
| "loss": 0.956852912902832, | |
| "mean_token_accuracy": 0.720037579536438, | |
| "num_tokens": 10620148.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.012437668745405972, | |
| "rewards/margins": 0.17596057945047505, | |
| "rewards/rejected": -0.16352291277144104, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 1.016458660364151, | |
| "epoch": 0.11851387364790719, | |
| "grad_norm": 29.050859451293945, | |
| "learning_rate": 9.914751892872274e-07, | |
| "logits/chosen": -19.08313772226747, | |
| "logits/rejected": -18.82169734271658, | |
| "logps/chosen": -434.9751796722412, | |
| "logps/rejected": -346.7390670776367, | |
| "loss": 0.9528908133506775, | |
| "mean_token_accuracy": 0.7646205425262451, | |
| "num_tokens": 10670772.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.008685210370458663, | |
| "rewards/margins": 0.19308780319988728, | |
| "rewards/rejected": -0.20177301485091448, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 1.1021007224917412, | |
| "epoch": 0.11914093118043581, | |
| "grad_norm": 44.599769592285156, | |
| "learning_rate": 9.91280911018817e-07, | |
| "logits/chosen": -21.5532820720735, | |
| "logits/rejected": -20.40933043838709, | |
| "logps/chosen": -1575.5354919433594, | |
| "logps/rejected": -422.48606395721436, | |
| "loss": 0.941632866859436, | |
| "mean_token_accuracy": 0.7219045013189316, | |
| "num_tokens": 10758488.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06574870133772492, | |
| "rewards/margins": 0.2363713993690908, | |
| "rewards/rejected": -0.1706227008253336, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.1249773353338242, | |
| "epoch": 0.11976798871296442, | |
| "grad_norm": 37.6546745300293, | |
| "learning_rate": 9.910844633131712e-07, | |
| "logits/chosen": -17.602501168387953, | |
| "logits/rejected": -18.726467814742886, | |
| "logps/chosen": -641.0849552154541, | |
| "logps/rejected": -560.3315982818604, | |
| "loss": 0.935768723487854, | |
| "mean_token_accuracy": 0.7447556182742119, | |
| "num_tokens": 10819612.0, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.0099241798161529, | |
| "rewards/margins": 0.26406861934810877, | |
| "rewards/rejected": -0.27399280294775963, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 1.0111653581261635, | |
| "epoch": 0.12039504624549302, | |
| "grad_norm": 33.29735565185547, | |
| "learning_rate": 9.908858470377793e-07, | |
| "logits/chosen": -17.99586764005896, | |
| "logits/rejected": -16.641471216812302, | |
| "logps/chosen": -754.2721481323242, | |
| "logps/rejected": -414.00395679473877, | |
| "loss": 0.9521582126617432, | |
| "mean_token_accuracy": 0.7499677836894989, | |
| "num_tokens": 10882013.0, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.00994637084659189, | |
| "rewards/margins": 0.19447646429762244, | |
| "rewards/rejected": -0.1845300872810185, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 1.0526621490716934, | |
| "epoch": 0.12102210377802164, | |
| "grad_norm": 35.13934326171875, | |
| "learning_rate": 9.906850630697066e-07, | |
| "logits/chosen": -17.88888213857138, | |
| "logits/rejected": -17.117701311736873, | |
| "logps/chosen": -626.3125686645508, | |
| "logps/rejected": -390.99532318115234, | |
| "loss": 0.9473018646240234, | |
| "mean_token_accuracy": 0.7478787750005722, | |
| "num_tokens": 10932194.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.013837772188708186, | |
| "rewards/margins": 0.21603740751743317, | |
| "rewards/rejected": -0.22987518273293972, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 1.2843475490808487, | |
| "epoch": 0.12164916131055024, | |
| "grad_norm": 33.156471252441406, | |
| "learning_rate": 9.904821122955914e-07, | |
| "logits/chosen": -16.072002517290578, | |
| "logits/rejected": -17.32703283993392, | |
| "logps/chosen": -858.3284645080566, | |
| "logps/rejected": -468.63574600219727, | |
| "loss": 0.957085132598877, | |
| "mean_token_accuracy": 0.6953159794211388, | |
| "num_tokens": 10989560.0, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.0002469784813001752, | |
| "rewards/margins": 0.174753800034523, | |
| "rewards/rejected": -0.1750007774680853, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.9444542303681374, | |
| "epoch": 0.12227621884307885, | |
| "grad_norm": 33.4073371887207, | |
| "learning_rate": 9.90276995611639e-07, | |
| "logits/chosen": -19.142496042660422, | |
| "logits/rejected": -21.297342713346943, | |
| "logps/chosen": -639.1740913391113, | |
| "logps/rejected": -354.38869857788086, | |
| "loss": 0.9653919339179993, | |
| "mean_token_accuracy": 0.7545767053961754, | |
| "num_tokens": 11034532.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0012790057808160782, | |
| "rewards/margins": 0.1389640721026808, | |
| "rewards/rejected": -0.13768507237546146, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 1.106497973203659, | |
| "epoch": 0.12290327637560747, | |
| "grad_norm": 30.54036521911621, | |
| "learning_rate": 9.900697139236208e-07, | |
| "logits/chosen": -17.157277160405563, | |
| "logits/rejected": -18.095409943495174, | |
| "logps/chosen": -551.8531856536865, | |
| "logps/rejected": -366.1446056365967, | |
| "loss": 0.9476866722106934, | |
| "mean_token_accuracy": 0.7291347607970238, | |
| "num_tokens": 11079071.0, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.026466174283996224, | |
| "rewards/margins": 0.21335551515221596, | |
| "rewards/rejected": -0.18688933923840523, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 1.0959510654211044, | |
| "epoch": 0.12353033390813607, | |
| "grad_norm": 36.96934127807617, | |
| "learning_rate": 9.898602681468674e-07, | |
| "logits/chosen": -19.027734293968553, | |
| "logits/rejected": -19.864234419673636, | |
| "logps/chosen": -954.4189186096191, | |
| "logps/rejected": -566.7688503265381, | |
| "loss": 0.9575784206390381, | |
| "mean_token_accuracy": 0.7271228209137917, | |
| "num_tokens": 11136634.0, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.016784888110123575, | |
| "rewards/margins": 0.17304366454482079, | |
| "rewards/rejected": -0.18982854578644037, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.8774717822670937, | |
| "epoch": 0.12415739144066468, | |
| "grad_norm": 36.82571792602539, | |
| "learning_rate": 9.896486592062659e-07, | |
| "logits/chosen": -28.647222960438814, | |
| "logits/rejected": -22.060415168768344, | |
| "logps/chosen": -836.5278701782227, | |
| "logps/rejected": -480.254337310791, | |
| "loss": 0.9511983394622803, | |
| "mean_token_accuracy": 0.7737741991877556, | |
| "num_tokens": 11197525.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.008797007380053401, | |
| "rewards/margins": 0.20592515252064914, | |
| "rewards/rejected": -0.21472215885296464, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 1.1285011321306229, | |
| "epoch": 0.1247844489731933, | |
| "grad_norm": 42.2977409362793, | |
| "learning_rate": 9.89434888036256e-07, | |
| "logits/chosen": -18.49698845016767, | |
| "logits/rejected": -17.254445681297014, | |
| "logps/chosen": -1127.2061748504639, | |
| "logps/rejected": -956.0397682189941, | |
| "loss": 0.9597939848899841, | |
| "mean_token_accuracy": 0.731256939470768, | |
| "num_tokens": 11292505.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.003246246255002916, | |
| "rewards/margins": 0.16256380267441273, | |
| "rewards/rejected": -0.1658100476488471, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.9618688002228737, | |
| "epoch": 0.1254115065057219, | |
| "grad_norm": 35.041629791259766, | |
| "learning_rate": 9.892189555808251e-07, | |
| "logits/chosen": -23.16837855908106, | |
| "logits/rejected": -22.01573163400953, | |
| "logps/chosen": -595.0505418777466, | |
| "logps/rejected": -505.8145923614502, | |
| "loss": 0.9585968852043152, | |
| "mean_token_accuracy": 0.7569021657109261, | |
| "num_tokens": 11345306.0, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": -0.027557444758713245, | |
| "rewards/margins": 0.16784314159303904, | |
| "rewards/rejected": -0.19540058448910713, | |
| "step": 200 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 1595, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.084673057646182e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |