Instructions to use cragtmp/task1s with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/task1s with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/task1s") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.6925373134328359, | |
| "eval_steps": 500, | |
| "global_step": 140, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 16.09375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.011940298507462687, | |
| "grad_norm": 3.1591623828063176, | |
| "kl": 0.0, | |
| "learning_rate": 2.2222222222222223e-05, | |
| "loss": -3.725290298461914e-09, | |
| "memory(GiB)": 77.11, | |
| "reward": 0.1484375, | |
| "reward_std": 0.7272911071777344, | |
| "rewards/Response_no_think_reward_1/mean": 0.1484375, | |
| "rewards/Response_no_think_reward_1/std": 0.9646495580673218, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.001668 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "epoch": 0.023880597014925373, | |
| "grad_norm": 3.150729002521691, | |
| "kl": 0.0, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "loss": -3.725290298461914e-09, | |
| "memory(GiB)": 77.11, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.002544 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0028647197177633643, | |
| "clip_ratio/low_min": 0.0028647197177633643, | |
| "clip_ratio/region_mean": 0.0028647197177633643, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.59375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.03582089552238806, | |
| "grad_norm": 2.067277005959865, | |
| "kl": 0.0022258755707298405, | |
| "learning_rate": 6.666666666666667e-05, | |
| "loss": -0.0004270445788279176, | |
| "memory(GiB)": 77.3, | |
| "reward": -0.3828125, | |
| "reward_std": 0.707726001739502, | |
| "rewards/Response_no_think_reward_1/mean": -0.3828125, | |
| "rewards/Response_no_think_reward_1/std": 0.923201322555542, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.002313 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003551179339410737, | |
| "clip_ratio/high_mean": 0.003551179339410737, | |
| "clip_ratio/low_mean": 0.025148934859316796, | |
| "clip_ratio/low_min": 0.025148934859316796, | |
| "clip_ratio/region_mean": 0.028700114460662007, | |
| "epoch": 0.04776119402985075, | |
| "grad_norm": 1.6109973009110337, | |
| "kl": 0.007886729676101822, | |
| "learning_rate": 8.888888888888889e-05, | |
| "loss": -0.010280434973537922, | |
| "memory(GiB)": 77.3, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.002696 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0019339247373864055, | |
| "clip_ratio/low_min": 0.0019339247373864055, | |
| "clip_ratio/region_mean": 0.0019339247373864055, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.5390625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.05970149253731343, | |
| "grad_norm": 2.893722550507481, | |
| "kl": 0.010198775078606559, | |
| "learning_rate": 0.00011111111111111112, | |
| "loss": 0.0004082494997419417, | |
| "memory(GiB)": 77.52, | |
| "reward": 0.125, | |
| "reward_std": 0.493943989276886, | |
| "rewards/Response_no_think_reward_1/mean": 0.125, | |
| "rewards/Response_no_think_reward_1/std": 0.9881184101104736, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.002517 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.028469400480389595, | |
| "clip_ratio/high_mean": 0.028469400480389595, | |
| "clip_ratio/low_mean": 0.04948427155613899, | |
| "clip_ratio/low_min": 0.04948427155613899, | |
| "clip_ratio/region_mean": 0.07795367110520601, | |
| "epoch": 0.07164179104477612, | |
| "grad_norm": 1.5585579234945925, | |
| "kl": 0.6935355372261256, | |
| "learning_rate": 0.00013333333333333334, | |
| "loss": -0.005084950476884842, | |
| "memory(GiB)": 79.48, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.002759 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0010160960373468697, | |
| "clip_ratio/low_min": 0.0010160960373468697, | |
| "clip_ratio/region_mean": 0.0010160960373468697, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.9296875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.08358208955223881, | |
| "grad_norm": 1.7579177577957044, | |
| "kl": 0.07463712914614007, | |
| "learning_rate": 0.00015555555555555556, | |
| "loss": 0.0008710746187716722, | |
| "memory(GiB)": 79.48, | |
| "reward": -0.0390625, | |
| "reward_std": 0.6340709924697876, | |
| "rewards/Response_no_think_reward_1/mean": -0.0390625, | |
| "rewards/Response_no_think_reward_1/std": 0.9992307424545288, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.002622 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02714990673121065, | |
| "clip_ratio/high_mean": 0.02714990673121065, | |
| "clip_ratio/low_mean": 0.03809016165905632, | |
| "clip_ratio/low_min": 0.03809016165905632, | |
| "clip_ratio/region_mean": 0.06524006789550185, | |
| "epoch": 0.0955223880597015, | |
| "grad_norm": 1.2730547516178623, | |
| "kl": 0.21840606682235375, | |
| "learning_rate": 0.00017777777777777779, | |
| "loss": -0.013987341895699501, | |
| "memory(GiB)": 79.48, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.002802 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009191176504828036, | |
| "clip_ratio/high_mean": 0.0009191176504828036, | |
| "clip_ratio/low_mean": 0.0018382353009656072, | |
| "clip_ratio/low_min": 0.0018382353009656072, | |
| "clip_ratio/region_mean": 0.0027573530096560717, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.3828125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.10746268656716418, | |
| "grad_norm": 3.3295900087180645, | |
| "kl": 0.35752939723897725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.003791232593357563, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.328125, | |
| "reward_std": 0.5329009890556335, | |
| "rewards/Response_no_think_reward_1/mean": 0.328125, | |
| "rewards/Response_no_think_reward_1/std": 0.9483460783958435, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.002657 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03471234819153324, | |
| "clip_ratio/high_mean": 0.03471234819153324, | |
| "clip_ratio/low_mean": 0.045793990429956466, | |
| "clip_ratio/low_min": 0.045793990429956466, | |
| "clip_ratio/region_mean": 0.08050633978564292, | |
| "epoch": 0.11940298507462686, | |
| "grad_norm": 3.037041883710677, | |
| "kl": 1.3611202164320275, | |
| "learning_rate": 0.00019997998037428526, | |
| "loss": -0.0012767184525728226, | |
| "memory(GiB)": 79.48, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.002798 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0022767678019590676, | |
| "clip_ratio/high_mean": 0.0022767678019590676, | |
| "clip_ratio/low_mean": 0.004576534847728908, | |
| "clip_ratio/low_min": 0.004576534847728908, | |
| "clip_ratio/region_mean": 0.006853302649687976, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.3828125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.13134328358208955, | |
| "grad_norm": 1.1988213220999966, | |
| "kl": 0.176690819360374, | |
| "learning_rate": 0.00019991992951284932, | |
| "loss": 0.0002530772762838751, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.2890625, | |
| "reward_std": 0.36220550537109375, | |
| "rewards/Response_no_think_reward_1/mean": 0.2890625, | |
| "rewards/Response_no_think_reward_1/std": 0.9487027525901794, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.002687 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.010013980441726744, | |
| "clip_ratio/high_mean": 0.010013980441726744, | |
| "clip_ratio/low_mean": 0.0431372388266027, | |
| "clip_ratio/low_min": 0.0431372388266027, | |
| "clip_ratio/region_mean": 0.053151219501160085, | |
| "epoch": 0.14328358208955225, | |
| "grad_norm": 4.4251813995519464, | |
| "kl": 3.680493631065474, | |
| "learning_rate": 0.00019981987145960755, | |
| "loss": 0.022724991664290428, | |
| "memory(GiB)": 79.48, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.002804 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.000480769231216982, | |
| "clip_ratio/high_mean": 0.000480769231216982, | |
| "clip_ratio/low_mean": 0.0022044407669454813, | |
| "clip_ratio/low_min": 0.0022044407669454813, | |
| "clip_ratio/region_mean": 0.0026852099981624633, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.0703125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.15522388059701492, | |
| "grad_norm": 2.0136556426936285, | |
| "kl": 0.14468206313904375, | |
| "learning_rate": 0.00019967984627705548, | |
| "loss": -0.00039299592026509345, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0625, | |
| "reward_std": 0.6480826735496521, | |
| "rewards/Response_no_think_reward_1/mean": 0.0625, | |
| "rewards/Response_no_think_reward_1/std": 0.9861242175102234, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.00269 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.016389093652833253, | |
| "clip_ratio/high_mean": 0.016389093652833253, | |
| "clip_ratio/low_mean": 0.03954102098941803, | |
| "clip_ratio/low_min": 0.03954102098941803, | |
| "clip_ratio/region_mean": 0.05593011493328959, | |
| "epoch": 0.16716417910447762, | |
| "grad_norm": 0.7268697285990734, | |
| "kl": 0.15212981263175607, | |
| "learning_rate": 0.00019949991003022808, | |
| "loss": -0.01738908141851425, | |
| "memory(GiB)": 79.48, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.002789 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005787037080153823, | |
| "clip_ratio/high_mean": 0.0005787037080153823, | |
| "clip_ratio/low_mean": 0.004868808202445507, | |
| "clip_ratio/low_min": 0.004868808202445507, | |
| "clip_ratio/region_mean": 0.005447512026876211, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.8671875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.1791044776119403, | |
| "grad_norm": 1.881956635614757, | |
| "kl": 0.24015408230479807, | |
| "learning_rate": 0.0001992801347642515, | |
| "loss": 0.0037227380089461803, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0625, | |
| "reward_std": 0.15197435021400452, | |
| "rewards/Response_no_think_reward_1/mean": 0.0625, | |
| "rewards/Response_no_think_reward_1/std": 0.9700231552124023, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.002716 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005905566504225135, | |
| "clip_ratio/high_mean": 0.005905566504225135, | |
| "clip_ratio/low_mean": 0.03072124859318137, | |
| "clip_ratio/low_min": 0.03072124859318137, | |
| "clip_ratio/region_mean": 0.036626815563067794, | |
| "epoch": 0.191044776119403, | |
| "grad_norm": 9.037445474392891, | |
| "kl": 4.632834411575459, | |
| "learning_rate": 0.00019902060847549718, | |
| "loss": 0.06257862597703934, | |
| "memory(GiB)": 79.48, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.002802 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.004252503567840904, | |
| "clip_ratio/low_min": 0.004252503567840904, | |
| "clip_ratio/region_mean": 0.004252503567840904, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 46.0, | |
| "completions/mean_length": 7.0, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.20298507462686566, | |
| "grad_norm": 5.483351751991195, | |
| "kl": 3.0633848210127326, | |
| "learning_rate": 0.0001987214350763483, | |
| "loss": 0.026951301842927933, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1640625, | |
| "reward_std": 0.45976677536964417, | |
| "rewards/Response_no_think_reward_1/mean": 0.1640625, | |
| "rewards/Response_no_think_reward_1/std": 0.9116684198379517, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.002741 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02420679770875722, | |
| "clip_ratio/high_mean": 0.02420679770875722, | |
| "clip_ratio/low_mean": 0.029018129454925656, | |
| "clip_ratio/low_min": 0.029018129454925656, | |
| "clip_ratio/region_mean": 0.053224927629344165, | |
| "epoch": 0.21492537313432836, | |
| "grad_norm": 11.084807824277876, | |
| "kl": 4.480629495417816, | |
| "learning_rate": 0.00019838273435359444, | |
| "loss": 0.03358945623040199, | |
| "memory(GiB)": 79.48, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.002818 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.009987752127926797, | |
| "clip_ratio/low_min": 0.009987752127926797, | |
| "clip_ratio/region_mean": 0.009987752127926797, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 8.6875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.22686567164179106, | |
| "grad_norm": 2.774235490038128, | |
| "kl": 1.3207979609724134, | |
| "learning_rate": 0.00019800464192046955, | |
| "loss": 0.012463792227208614, | |
| "memory(GiB)": 79.48, | |
| "reward": -0.0078125, | |
| "reward_std": 0.3263596296310425, | |
| "rewards/Response_no_think_reward_1/mean": -0.0078125, | |
| "rewards/Response_no_think_reward_1/std": 0.9515514969825745, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.002746 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.013878540194127709, | |
| "clip_ratio/high_mean": 0.013878540194127709, | |
| "clip_ratio/low_mean": 0.053771398146636784, | |
| "clip_ratio/low_min": 0.053771398146636784, | |
| "clip_ratio/region_mean": 0.06764993839897215, | |
| "epoch": 0.23880597014925373, | |
| "grad_norm": 18.987604867751966, | |
| "kl": 9.466534710245469, | |
| "learning_rate": 0.00019758730916235356, | |
| "loss": 0.16672615706920624, | |
| "memory(GiB)": 79.48, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.002807 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005019778618589044, | |
| "clip_ratio/high_mean": 0.005019778618589044, | |
| "clip_ratio/low_mean": 0.00046641789958812296, | |
| "clip_ratio/low_min": 0.00046641789958812296, | |
| "clip_ratio/region_mean": 0.005486196518177167, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 8.234375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.2507462686567164, | |
| "grad_norm": 3.1541164754847397, | |
| "kl": 0.4539797595352866, | |
| "learning_rate": 0.00019713090317615876, | |
| "loss": 0.0023644084576517344, | |
| "memory(GiB)": 79.48, | |
| "reward": -0.1015625, | |
| "reward_std": 0.3404619097709656, | |
| "rewards/Response_no_think_reward_1/mean": -0.1015625, | |
| "rewards/Response_no_think_reward_1/std": 0.9788298010826111, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.002748 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02849817555397749, | |
| "clip_ratio/high_mean": 0.02849817555397749, | |
| "clip_ratio/low_mean": 0.02262113688630052, | |
| "clip_ratio/low_min": 0.02262113688630052, | |
| "clip_ratio/region_mean": 0.051119312876835465, | |
| "epoch": 0.2626865671641791, | |
| "grad_norm": 3.225175633228704, | |
| "kl": 0.27581185393501073, | |
| "learning_rate": 0.00019663560670342558, | |
| "loss": 0.0023057509679347277, | |
| "memory(GiB)": 79.48, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.002811 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0015432098880410194, | |
| "clip_ratio/low_min": 0.0015432098880410194, | |
| "clip_ratio/region_mean": 0.0015432098880410194, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.1015625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.2746268656716418, | |
| "grad_norm": 1.602042628934705, | |
| "kl": 0.223259057267569, | |
| "learning_rate": 0.00019610161805715397, | |
| "loss": 0.0012852977961301804, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.25, | |
| "reward_std": 0.45234403014183044, | |
| "rewards/Response_no_think_reward_1/mean": 0.25, | |
| "rewards/Response_no_think_reward_1/std": 0.9474374651908875, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.002763 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02699369314359501, | |
| "clip_ratio/high_mean": 0.02699369314359501, | |
| "clip_ratio/low_mean": 0.024013921502046287, | |
| "clip_ratio/low_min": 0.024013921502046287, | |
| "clip_ratio/region_mean": 0.05100761540234089, | |
| "epoch": 0.2865671641791045, | |
| "grad_norm": 1.2163889618122583, | |
| "kl": 0.48499861752497964, | |
| "learning_rate": 0.00019552915104240065, | |
| "loss": -0.007453325670212507, | |
| "memory(GiB)": 79.48, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.002821 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.001253594527952373, | |
| "clip_ratio/low_min": 0.001253594527952373, | |
| "clip_ratio/region_mean": 0.001253594527952373, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.9375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.29850746268656714, | |
| "grad_norm": 1.3884331155836789, | |
| "kl": 0.5089308844180778, | |
| "learning_rate": 0.00019491843487067306, | |
| "loss": 0.00490172766149044, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.2265625, | |
| "reward_std": 0.46621453762054443, | |
| "rewards/Response_no_think_reward_1/mean": 0.2265625, | |
| "rewards/Response_no_think_reward_1/std": 0.9324832558631897, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.002775 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01939821511041373, | |
| "clip_ratio/high_mean": 0.01939821511041373, | |
| "clip_ratio/low_mean": 0.046715788485016674, | |
| "clip_ratio/low_min": 0.046715788485016674, | |
| "clip_ratio/region_mean": 0.06611400278052315, | |
| "epoch": 0.31044776119402984, | |
| "grad_norm": 7.610505518747904, | |
| "kl": 2.1003341920441017, | |
| "learning_rate": 0.00019426971406815463, | |
| "loss": 0.024694038555026054, | |
| "memory(GiB)": 79.48, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.002827 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0030820727697573602, | |
| "clip_ratio/low_min": 0.0030820727697573602, | |
| "clip_ratio/region_mean": 0.0030820727697573602, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.2265625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.32238805970149254, | |
| "grad_norm": 2.593834753837433, | |
| "kl": 0.6449481542804278, | |
| "learning_rate": 0.00019358324837779863, | |
| "loss": 0.007649811916053295, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.2890625, | |
| "reward_std": 0.6288036704063416, | |
| "rewards/Response_no_think_reward_1/mean": 0.2890625, | |
| "rewards/Response_no_think_reward_1/std": 0.870806872844696, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.00279 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02224817470414564, | |
| "clip_ratio/high_mean": 0.02224817470414564, | |
| "clip_ratio/low_mean": 0.03963817795738578, | |
| "clip_ratio/low_min": 0.03963817795738578, | |
| "clip_ratio/region_mean": 0.061886353767476976, | |
| "epoch": 0.33432835820895523, | |
| "grad_norm": 4.001134871741585, | |
| "kl": 2.057775880966801, | |
| "learning_rate": 0.00019285931265532871, | |
| "loss": 0.024306027218699455, | |
| "memory(GiB)": 79.48, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.002839 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0025941890198737383, | |
| "clip_ratio/low_min": 0.0025941890198737383, | |
| "clip_ratio/region_mean": 0.0025941890198737383, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.6640625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.34626865671641793, | |
| "grad_norm": 2.4322431330202017, | |
| "kl": 0.9759200520347804, | |
| "learning_rate": 0.0001920981967591891, | |
| "loss": 0.009954690001904964, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.234375, | |
| "reward_std": 0.5239416360855103, | |
| "rewards/Response_no_think_reward_1/mean": 0.234375, | |
| "rewards/Response_no_think_reward_1/std": 0.8179518580436707, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.002811 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.05181985488161445, | |
| "clip_ratio/high_mean": 0.05181985488161445, | |
| "clip_ratio/low_mean": 0.03574432339519262, | |
| "clip_ratio/low_min": 0.03574432339519262, | |
| "clip_ratio/region_mean": 0.0875641773454845, | |
| "epoch": 0.3582089552238806, | |
| "grad_norm": 2.469531358214721, | |
| "kl": 0.3759418617701158, | |
| "learning_rate": 0.00019130020543448704, | |
| "loss": 0.030206725001335144, | |
| "memory(GiB)": 79.48, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.002857 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0007102272938936949, | |
| "clip_ratio/low_min": 0.0007102272938936949, | |
| "clip_ratio/region_mean": 0.0007102272938936949, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.4921875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.3701492537313433, | |
| "grad_norm": 25.502961039749618, | |
| "kl": 0.3221544102343614, | |
| "learning_rate": 0.00019046565819097545, | |
| "loss": 0.0061463117599487305, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.265625, | |
| "reward_std": 0.3810158967971802, | |
| "rewards/Response_no_think_reward_1/mean": 0.265625, | |
| "rewards/Response_no_think_reward_1/std": 0.8082680702209473, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.002819 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0004340277810115367, | |
| "clip_ratio/high_mean": 0.0004340277810115367, | |
| "clip_ratio/low_mean": 0.015644782513845712, | |
| "clip_ratio/low_min": 0.015644782513845712, | |
| "clip_ratio/region_mean": 0.01607881032396108, | |
| "epoch": 0.382089552238806, | |
| "grad_norm": 2.386529018247983, | |
| "kl": 0.4242442559116171, | |
| "learning_rate": 0.0001895948891751234, | |
| "loss": 0.005282086320221424, | |
| "memory(GiB)": 79.48, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.002862 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0008561643771827221, | |
| "clip_ratio/high_mean": 0.0008561643771827221, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0008561643771827221, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 36.0, | |
| "completions/mean_length": 6.8984375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.3940298507462687, | |
| "grad_norm": 2.313143797352374, | |
| "kl": 1.4197996056172997, | |
| "learning_rate": 0.00018868824703632657, | |
| "loss": 0.011696252971887589, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.046875, | |
| "reward_std": 0.6391555070877075, | |
| "rewards/Response_no_think_reward_1/mean": 0.046875, | |
| "rewards/Response_no_think_reward_1/std": 0.8215538859367371, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.002823 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03243769891560078, | |
| "clip_ratio/high_mean": 0.03243769891560078, | |
| "clip_ratio/low_mean": 0.057673962553963065, | |
| "clip_ratio/low_min": 0.057673962553963065, | |
| "clip_ratio/region_mean": 0.09011166216805577, | |
| "epoch": 0.4059701492537313, | |
| "grad_norm": 1.7539402550269323, | |
| "kl": 1.9242291511036456, | |
| "learning_rate": 0.00018774609478731046, | |
| "loss": -0.004083915147930384, | |
| "memory(GiB)": 79.48, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.002863 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0010245901066809893, | |
| "clip_ratio/low_min": 0.0010245901066809893, | |
| "clip_ratio/region_mean": 0.0010245901066809893, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.7109375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.417910447761194, | |
| "grad_norm": 2.4226244872635485, | |
| "kl": 1.010538819245994, | |
| "learning_rate": 0.00018676880965878291, | |
| "loss": 0.015125149860978127, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0546875, | |
| "reward_std": 0.5867211818695068, | |
| "rewards/Response_no_think_reward_1/mean": 0.0546875, | |
| "rewards/Response_no_think_reward_1/std": 0.8539726138114929, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.00283 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.030840664519928396, | |
| "clip_ratio/high_mean": 0.030840664519928396, | |
| "clip_ratio/low_mean": 0.06221208241186105, | |
| "clip_ratio/low_min": 0.06221208241186105, | |
| "clip_ratio/region_mean": 0.09305274731013924, | |
| "epoch": 0.4298507462686567, | |
| "grad_norm": 2.284561806665497, | |
| "kl": 2.4607611764222383, | |
| "learning_rate": 0.00018575678294839373, | |
| "loss": 0.010896118357777596, | |
| "memory(GiB)": 79.48, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.002867 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001179245300590992, | |
| "clip_ratio/high_mean": 0.001179245300590992, | |
| "clip_ratio/low_mean": 0.00924376118928194, | |
| "clip_ratio/low_min": 0.00924376118928194, | |
| "clip_ratio/region_mean": 0.010423006489872932, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 27.0, | |
| "completions/mean_length": 5.328125, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.4417910447761194, | |
| "grad_norm": 3.3426494147901047, | |
| "kl": 0.3604982797114644, | |
| "learning_rate": 0.000184710419864062, | |
| "loss": 0.0029986475128680468, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.328125, | |
| "reward_std": 0.34082794189453125, | |
| "rewards/Response_no_think_reward_1/mean": 0.328125, | |
| "rewards/Response_no_think_reward_1/std": 0.8794179558753967, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.002821 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.011844758177176118, | |
| "clip_ratio/high_mean": 0.011844758177176118, | |
| "clip_ratio/low_mean": 0.05284481216222048, | |
| "clip_ratio/low_min": 0.05284481216222048, | |
| "clip_ratio/region_mean": 0.06468957080505788, | |
| "epoch": 0.4537313432835821, | |
| "grad_norm": 0.9022263920887504, | |
| "kl": 0.5205309305310948, | |
| "learning_rate": 0.00018363013936173393, | |
| "loss": -0.011295529082417488, | |
| "memory(GiB)": 79.48, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.002857 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 5.328125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.46567164179104475, | |
| "grad_norm": 1.5271115661229067, | |
| "kl": 0.27687166831583454, | |
| "learning_rate": 0.00018251637397763597, | |
| "loss": 0.0014096113154664636, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.046875, | |
| "reward_std": 0.3280481696128845, | |
| "rewards/Response_no_think_reward_1/mean": 0.046875, | |
| "rewards/Response_no_think_reward_1/std": 0.9379100203514099, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.002785 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.04636762477457523, | |
| "clip_ratio/high_mean": 0.04636762477457523, | |
| "clip_ratio/low_mean": 0.02858343638945371, | |
| "clip_ratio/low_min": 0.02858343638945371, | |
| "clip_ratio/region_mean": 0.07495106221176684, | |
| "epoch": 0.47761194029850745, | |
| "grad_norm": 0.6061436422525854, | |
| "kl": 0.7858691609289963, | |
| "learning_rate": 0.00018136956965509064, | |
| "loss": -0.008444712497293949, | |
| "memory(GiB)": 79.48, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.002819 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001953125, | |
| "clip_ratio/high_mean": 0.001953125, | |
| "clip_ratio/low_mean": 0.0004006410308647901, | |
| "clip_ratio/low_min": 0.0004006410308647901, | |
| "clip_ratio/region_mean": 0.00235376603086479, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 8.296875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.48955223880597015, | |
| "grad_norm": 2.15651488822414, | |
| "kl": 0.5289879650626972, | |
| "learning_rate": 0.000180190185565964, | |
| "loss": 0.006278940010815859, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.140625, | |
| "reward_std": 0.3606899678707123, | |
| "rewards/Response_no_think_reward_1/mean": 0.140625, | |
| "rewards/Response_no_think_reward_1/std": 0.9284173250198364, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.002732 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.019255130202509463, | |
| "clip_ratio/high_mean": 0.019255130202509463, | |
| "clip_ratio/low_mean": 0.049764272407628596, | |
| "clip_ratio/low_min": 0.049764272407628596, | |
| "clip_ratio/region_mean": 0.06901940272655338, | |
| "epoch": 0.5014925373134328, | |
| "grad_norm": 7.678211490755348, | |
| "kl": 4.704732097394299, | |
| "learning_rate": 0.00017897869392681685, | |
| "loss": 0.036949772387742996, | |
| "memory(GiB)": 79.48, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.002764 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0018887363257817924, | |
| "clip_ratio/low_min": 0.0018887363257817924, | |
| "clip_ratio/region_mean": 0.0018887363257817924, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.0390625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.5134328358208955, | |
| "grad_norm": 1.5758982248595066, | |
| "kl": 0.34190677378865075, | |
| "learning_rate": 0.00017773557980983262, | |
| "loss": 0.004829109646379948, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3671875, | |
| "reward_std": 0.355153352022171, | |
| "rewards/Response_no_think_reward_1/mean": 0.3671875, | |
| "rewards/Response_no_think_reward_1/std": 0.8406137228012085, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.002649 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.010433136369101703, | |
| "clip_ratio/high_mean": 0.010433136369101703, | |
| "clip_ratio/low_mean": 0.0495308703975752, | |
| "clip_ratio/low_min": 0.0495308703975752, | |
| "clip_ratio/region_mean": 0.05996400595176965, | |
| "epoch": 0.5253731343283582, | |
| "grad_norm": 0.9699999569587556, | |
| "kl": 0.5136687369667925, | |
| "learning_rate": 0.00017646134094859815, | |
| "loss": -0.008213551715016365, | |
| "memory(GiB)": 79.48, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.00268 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009920635493472219, | |
| "clip_ratio/high_mean": 0.0009920635493472219, | |
| "clip_ratio/low_mean": 0.0006793478387407959, | |
| "clip_ratio/low_min": 0.0006793478387407959, | |
| "clip_ratio/region_mean": 0.0016714113880880177, | |
| "completions/clipped_ratio": 0.0234375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 6.53125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.5373134328358209, | |
| "grad_norm": 2.6187879748810294, | |
| "kl": 0.4996573789976537, | |
| "learning_rate": 0.00017515648753881492, | |
| "loss": 0.00461646867915988, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.390625, | |
| "reward_std": 0.4600672125816345, | |
| "rewards/Response_no_think_reward_1/mean": 0.390625, | |
| "rewards/Response_no_think_reward_1/std": 0.8251401782035828, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.002583 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.023812146624550223, | |
| "clip_ratio/high_mean": 0.023812146624550223, | |
| "clip_ratio/low_mean": 0.030458416498731822, | |
| "clip_ratio/low_min": 0.030458416498731822, | |
| "clip_ratio/region_mean": 0.054270562424790114, | |
| "epoch": 0.5492537313432836, | |
| "grad_norm": 1.046619303634399, | |
| "kl": 1.1794932310585864, | |
| "learning_rate": 0.00017382154203402048, | |
| "loss": -0.007490159012377262, | |
| "memory(GiB)": 79.48, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.002612 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0014244693447835743, | |
| "clip_ratio/low_min": 0.0014244693447835743, | |
| "clip_ratio/region_mean": 0.0014244693447835743, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.59375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.5611940298507463, | |
| "grad_norm": 1.8613572071063658, | |
| "kl": 0.6177221334655769, | |
| "learning_rate": 0.0001724570389364019, | |
| "loss": 0.004859148990362883, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0625, | |
| "reward_std": 0.47469794750213623, | |
| "rewards/Response_no_think_reward_1/mean": 0.0625, | |
| "rewards/Response_no_think_reward_1/std": 0.8761943578720093, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.002518 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.009966709709260613, | |
| "clip_ratio/high_mean": 0.009966709709260613, | |
| "clip_ratio/low_mean": 0.11994545813649893, | |
| "clip_ratio/low_min": 0.11994545813649893, | |
| "clip_ratio/region_mean": 0.12991216825321317, | |
| "epoch": 0.573134328358209, | |
| "grad_norm": 0.9444759818819449, | |
| "kl": 0.9089975492097437, | |
| "learning_rate": 0.00017106352458278522, | |
| "loss": -0.009144289419054985, | |
| "memory(GiB)": 79.48, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.002547 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00021043770539108664, | |
| "clip_ratio/high_mean": 0.00021043770539108664, | |
| "clip_ratio/low_mean": 0.002260449342429638, | |
| "clip_ratio/low_min": 0.002260449342429638, | |
| "clip_ratio/region_mean": 0.0024708870478207245, | |
| "completions/clipped_ratio": 0.1328125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.921875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.5850746268656717, | |
| "grad_norm": 1.7364401500647022, | |
| "kl": 0.6272030578693375, | |
| "learning_rate": 0.00016964155692588616, | |
| "loss": 0.004394113551825285, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1484375, | |
| "reward_std": 0.424231618642807, | |
| "rewards/Response_no_think_reward_1/mean": 0.1484375, | |
| "rewards/Response_no_think_reward_1/std": 0.914363443851471, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.002518 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03189032070804387, | |
| "clip_ratio/high_mean": 0.03189032070804387, | |
| "clip_ratio/low_mean": 0.04090093384729698, | |
| "clip_ratio/low_min": 0.04090093384729698, | |
| "clip_ratio/region_mean": 0.07279125548666343, | |
| "epoch": 0.5970149253731343, | |
| "grad_norm": 4.461755913109612, | |
| "kl": 1.2612105239531957, | |
| "learning_rate": 0.00016819170531091017, | |
| "loss": 0.0014673060504719615, | |
| "memory(GiB)": 79.48, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.002545 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0015625000232830644, | |
| "clip_ratio/high_mean": 0.0015625000232830644, | |
| "clip_ratio/low_mean": 0.0016522249497938901, | |
| "clip_ratio/low_min": 0.0016522249497938901, | |
| "clip_ratio/region_mean": 0.0032147249730769545, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.46875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.608955223880597, | |
| "grad_norm": 2.519038758282151, | |
| "kl": 0.549895275675226, | |
| "learning_rate": 0.00016671455024759067, | |
| "loss": 0.0033532448578625917, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1796875, | |
| "reward_std": 0.39886242151260376, | |
| "rewards/Response_no_think_reward_1/mean": 0.1796875, | |
| "rewards/Response_no_think_reward_1/std": 0.9258628487586975, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.002473 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03367150644771755, | |
| "clip_ratio/high_mean": 0.03367150644771755, | |
| "clip_ratio/low_mean": 0.0576377569232136, | |
| "clip_ratio/low_min": 0.0576377569232136, | |
| "clip_ratio/region_mean": 0.09130926383659244, | |
| "epoch": 0.6208955223880597, | |
| "grad_norm": 0.9238461637378925, | |
| "kl": 0.672293990442995, | |
| "learning_rate": 0.00016521068317775753, | |
| "loss": -0.019059473648667336, | |
| "memory(GiB)": 79.48, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.002499 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0013558201026171446, | |
| "clip_ratio/high_mean": 0.0013558201026171446, | |
| "clip_ratio/low_mean": 0.010322635032935068, | |
| "clip_ratio/low_min": 0.010322635032935068, | |
| "clip_ratio/region_mean": 0.011678455251967534, | |
| "completions/clipped_ratio": 0.1796875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.0390625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.6328358208955224, | |
| "grad_norm": 6.547271710761981, | |
| "kl": 1.0316203383699758, | |
| "learning_rate": 0.00016368070623852792, | |
| "loss": 0.006902866996824741, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1328125, | |
| "reward_std": 0.561459481716156, | |
| "rewards/Response_no_think_reward_1/mean": 0.1328125, | |
| "rewards/Response_no_think_reward_1/std": 0.9081528782844543, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.002484 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014829304564045742, | |
| "clip_ratio/high_mean": 0.0014829304564045742, | |
| "clip_ratio/low_mean": 0.1896184734068811, | |
| "clip_ratio/low_min": 0.1896184734068811, | |
| "clip_ratio/region_mean": 0.19110140530392528, | |
| "epoch": 0.6447761194029851, | |
| "grad_norm": 3.3472874723788295, | |
| "kl": 2.011909826847841, | |
| "learning_rate": 0.00016212523202121544, | |
| "loss": 0.00577022647485137, | |
| "memory(GiB)": 79.48, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.002509 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0017361111240461469, | |
| "clip_ratio/high_mean": 0.0017361111240461469, | |
| "clip_ratio/low_mean": 0.004226236138492823, | |
| "clip_ratio/low_min": 0.004226236138492823, | |
| "clip_ratio/region_mean": 0.0059623472625389695, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.6567164179104478, | |
| "grad_norm": 2.1721724253324193, | |
| "kl": 1.4456337625160813, | |
| "learning_rate": 0.00016054488332605283, | |
| "loss": 0.007076151203364134, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3046875, | |
| "reward_std": 0.4615631103515625, | |
| "rewards/Response_no_think_reward_1/mean": 0.3046875, | |
| "rewards/Response_no_think_reward_1/std": 0.8654214143753052, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.002495 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.07161095441551879, | |
| "clip_ratio/high_mean": 0.07161095441551879, | |
| "clip_ratio/low_mean": 0.0391811344306916, | |
| "clip_ratio/low_min": 0.0391811344306916, | |
| "clip_ratio/region_mean": 0.11079208552837372, | |
| "epoch": 0.6686567164179105, | |
| "grad_norm": 1.6216131312943962, | |
| "kl": 0.9301650315364896, | |
| "learning_rate": 0.00015894029291282758, | |
| "loss": -0.018307652324438095, | |
| "memory(GiB)": 79.48, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.002519 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0028409091755747795, | |
| "clip_ratio/high_mean": 0.0028409091755747795, | |
| "clip_ratio/low_mean": 0.007847597065847367, | |
| "clip_ratio/low_min": 0.007847597065847367, | |
| "clip_ratio/region_mean": 0.010688506241422147, | |
| "completions/clipped_ratio": 0.0703125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 8.2109375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.6805970149253732, | |
| "grad_norm": 4.528309911623671, | |
| "kl": 1.2233935340000244, | |
| "learning_rate": 0.00015731210324752972, | |
| "loss": 0.015045193955302238, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.171875, | |
| "reward_std": 0.5126261711120605, | |
| "rewards/Response_no_think_reward_1/mean": 0.171875, | |
| "rewards/Response_no_think_reward_1/std": 0.9315922856330872, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.002481 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.022757820785045624, | |
| "clip_ratio/high_mean": 0.022757820785045624, | |
| "clip_ratio/low_mean": 0.14223288698121905, | |
| "clip_ratio/low_min": 0.14223288698121905, | |
| "clip_ratio/region_mean": 0.1649907068349421, | |
| "epoch": 0.6925373134328359, | |
| "grad_norm": 75.05881389891198, | |
| "kl": 71.87919758663793, | |
| "learning_rate": 0.00015566096624511307, | |
| "loss": 0.9493598341941833, | |
| "memory(GiB)": 79.48, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.002504 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005230125389061868, | |
| "clip_ratio/high_mean": 0.0005230125389061868, | |
| "clip_ratio/low_mean": 0.012553135456983, | |
| "clip_ratio/low_min": 0.012553135456983, | |
| "clip_ratio/region_mean": 0.013076147937681526, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.3828125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.7044776119402985, | |
| "grad_norm": 2.061647426051912, | |
| "kl": 3.4461456341377925, | |
| "learning_rate": 0.00015398754300847343, | |
| "loss": 0.024864066392183304, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3046875, | |
| "reward_std": 0.35084033012390137, | |
| "rewards/Response_no_think_reward_1/mean": 0.3046875, | |
| "rewards/Response_no_think_reward_1/std": 0.9010806679725647, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.002474 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.010577498760540038, | |
| "clip_ratio/high_mean": 0.010577498760540038, | |
| "clip_ratio/low_mean": 0.15099563542753458, | |
| "clip_ratio/low_min": 0.15099563542753458, | |
| "clip_ratio/region_mean": 0.16157313529402018, | |
| "epoch": 0.7164179104477612, | |
| "grad_norm": 6.318543519105419, | |
| "kl": 9.211844031116925, | |
| "learning_rate": 0.00015229250356374804, | |
| "loss": 0.058415383100509644, | |
| "memory(GiB)": 79.48, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.002497 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0023436461633536965, | |
| "clip_ratio/high_mean": 0.0023436461633536965, | |
| "clip_ratio/low_mean": 0.01256567076779902, | |
| "clip_ratio/low_min": 0.01256567076779902, | |
| "clip_ratio/region_mean": 0.014909316785633564, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.0546875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.7283582089552239, | |
| "grad_norm": 8.650077130485371, | |
| "kl": 12.875115153714432, | |
| "learning_rate": 0.00015057652659204197, | |
| "loss": 0.11098186671733856, | |
| "memory(GiB)": 79.48, | |
| "reward": -0.2109375, | |
| "reward_std": 0.3248431980609894, | |
| "rewards/Response_no_think_reward_1/mean": -0.2109375, | |
| "rewards/Response_no_think_reward_1/std": 0.7060185074806213, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.002485 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.04812772118020803, | |
| "clip_ratio/high_mean": 0.04812772118020803, | |
| "clip_ratio/low_mean": 0.016272668377496302, | |
| "clip_ratio/low_min": 0.016272668377496302, | |
| "clip_ratio/region_mean": 0.06440038897562772, | |
| "epoch": 0.7402985074626866, | |
| "grad_norm": 6.330882663211948, | |
| "kl": 4.831557432677073, | |
| "learning_rate": 0.00014884029915768944, | |
| "loss": 0.08532620966434479, | |
| "memory(GiB)": 79.48, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.002507 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009259259095415473, | |
| "clip_ratio/high_mean": 0.0009259259095415473, | |
| "clip_ratio/low_mean": 0.005223244777880609, | |
| "clip_ratio/low_min": 0.005223244777880609, | |
| "clip_ratio/region_mean": 0.006149170687422156, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 49.0, | |
| "completions/mean_length": 6.8203125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.7522388059701492, | |
| "grad_norm": 0.8455863083310526, | |
| "kl": 3.406710424387711, | |
| "learning_rate": 0.00014708451643315827, | |
| "loss": 0.015459287911653519, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.2890625, | |
| "reward_std": 0.09522313624620438, | |
| "rewards/Response_no_think_reward_1/mean": 0.2890625, | |
| "rewards/Response_no_think_reward_1/std": 0.9319553971290588, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.002478 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00038343557389453053, | |
| "clip_ratio/high_mean": 0.00038343557389453053, | |
| "clip_ratio/low_mean": 0.03692773682996631, | |
| "clip_ratio/low_min": 0.03692773682996631, | |
| "clip_ratio/region_mean": 0.037311173509806395, | |
| "epoch": 0.764179104477612, | |
| "grad_norm": 1.460493225059439, | |
| "kl": 3.925420918938471, | |
| "learning_rate": 0.00014530988142070803, | |
| "loss": 0.015160211361944675, | |
| "memory(GiB)": 79.48, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.002499 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.02216397225856781, | |
| "clip_ratio/low_min": 0.02216397225856781, | |
| "clip_ratio/region_mean": 0.02216397225856781, | |
| "completions/clipped_ratio": 0.15625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 8.1484375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.7761194029850746, | |
| "grad_norm": 16.54465377888419, | |
| "kl": 13.583033993607387, | |
| "learning_rate": 0.00014351710467091336, | |
| "loss": 0.09176836162805557, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0, | |
| "reward_std": 0.44421693682670593, | |
| "rewards/Response_no_think_reward_1/mean": 0.0, | |
| "rewards/Response_no_think_reward_1/std": 0.8418202996253967, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.00249 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.016292952001094818, | |
| "clip_ratio/high_mean": 0.016292952001094818, | |
| "clip_ratio/low_mean": 0.02969469508389011, | |
| "clip_ratio/low_min": 0.02969469508389011, | |
| "clip_ratio/region_mean": 0.04598764737602323, | |
| "epoch": 0.7880597014925373, | |
| "grad_norm": 7.478581616879351, | |
| "kl": 9.063416050747037, | |
| "learning_rate": 0.0001417069039981647, | |
| "loss": 0.08187955617904663, | |
| "memory(GiB)": 79.48, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.00251 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0003571428533177823, | |
| "clip_ratio/high_mean": 0.0003571428533177823, | |
| "clip_ratio/low_mean": 0.011069363099522889, | |
| "clip_ratio/low_min": 0.011069363099522889, | |
| "clip_ratio/region_mean": 0.011426505981944501, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 48.0, | |
| "completions/mean_length": 6.75, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.8, | |
| "grad_norm": 2.789323653853436, | |
| "kl": 6.344451879562257, | |
| "learning_rate": 0.00013988000419326072, | |
| "loss": 0.04125535860657692, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.21875, | |
| "reward_std": 0.40496253967285156, | |
| "rewards/Response_no_think_reward_1/mean": 0.21875, | |
| "rewards/Response_no_think_reward_1/std": 0.8778777122497559, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.0025 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.036289573181420565, | |
| "clip_ratio/high_mean": 0.036289573181420565, | |
| "clip_ratio/low_mean": 0.07330909674055874, | |
| "clip_ratio/low_min": 0.07330909674055874, | |
| "clip_ratio/region_mean": 0.10959866992197931, | |
| "epoch": 0.8119402985074626, | |
| "grad_norm": 3.351094606732551, | |
| "kl": 7.85955839138478, | |
| "learning_rate": 0.00013803713673320772, | |
| "loss": 0.0294882133603096, | |
| "memory(GiB)": 79.48, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.00252 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0034414873807691038, | |
| "clip_ratio/high_mean": 0.0034414873807691038, | |
| "clip_ratio/low_mean": 0.017763152020052075, | |
| "clip_ratio/low_min": 0.017763152020052075, | |
| "clip_ratio/region_mean": 0.021204639226198196, | |
| "completions/clipped_ratio": 0.1953125, | |
| "completions/max_length": 50.0, | |
| "completions/mean_length": 9.0390625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.8238805970149253, | |
| "grad_norm": 2.3936208496329043, | |
| "kl": 8.319812071829801, | |
| "learning_rate": 0.00013617903948834155, | |
| "loss": 0.0558692142367363, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1484375, | |
| "reward_std": 0.5162962079048157, | |
| "rewards/Response_no_think_reward_1/mean": 0.1484375, | |
| "rewards/Response_no_think_reward_1/std": 0.7642591595649719, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.002511 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.05922704888507724, | |
| "clip_ratio/high_mean": 0.05922704888507724, | |
| "clip_ratio/low_mean": 0.03970964252948761, | |
| "clip_ratio/low_min": 0.03970964252948761, | |
| "clip_ratio/region_mean": 0.09893669094890356, | |
| "epoch": 0.835820895522388, | |
| "grad_norm": 6.476273530366032, | |
| "kl": 5.813117837678874, | |
| "learning_rate": 0.00013430645642688988, | |
| "loss": 0.04987351968884468, | |
| "memory(GiB)": 79.48, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.00253 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002159281895728782, | |
| "clip_ratio/high_mean": 0.002159281895728782, | |
| "clip_ratio/low_mean": 0.010578428045846522, | |
| "clip_ratio/low_min": 0.010578428045846522, | |
| "clip_ratio/region_mean": 0.012737710087094456, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 44.0, | |
| "completions/mean_length": 9.2421875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.8477611940298507, | |
| "grad_norm": 3.9784798974103217, | |
| "kl": 7.147874560090713, | |
| "learning_rate": 0.00013242013731709287, | |
| "loss": 0.06330341100692749, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.015625, | |
| "reward_std": 0.39743539690971375, | |
| "rewards/Response_no_think_reward_1/mean": 0.015625, | |
| "rewards/Response_no_think_reward_1/std": 0.6985291242599487, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.002526 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.014909500489011407, | |
| "clip_ratio/high_mean": 0.014909500489011407, | |
| "clip_ratio/low_mean": 0.05899865587707609, | |
| "clip_ratio/low_min": 0.05899865587707609, | |
| "clip_ratio/region_mean": 0.07390815508551896, | |
| "epoch": 0.8597014925373134, | |
| "grad_norm": 107.14584369632281, | |
| "kl": 5.481248813099228, | |
| "learning_rate": 0.00013052083742700173, | |
| "loss": 0.5873211026191711, | |
| "memory(GiB)": 79.48, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.002544 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005898644914850593, | |
| "clip_ratio/high_mean": 0.005898644914850593, | |
| "clip_ratio/low_mean": 0.013190844911150634, | |
| "clip_ratio/low_min": 0.013190844911150634, | |
| "clip_ratio/region_mean": 0.01908948994241655, | |
| "completions/clipped_ratio": 0.1484375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.8716417910447761, | |
| "grad_norm": 5.671656969858763, | |
| "kl": 5.887194114271551, | |
| "learning_rate": 0.0001286093172220748, | |
| "loss": 0.05823807045817375, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0078125, | |
| "reward_std": 0.47193682193756104, | |
| "rewards/Response_no_think_reward_1/mean": 0.0078125, | |
| "rewards/Response_no_think_reward_1/std": 0.8648526072502136, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.002537 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.05940199224278331, | |
| "clip_ratio/high_mean": 0.05940199224278331, | |
| "clip_ratio/low_mean": 0.07782801624853164, | |
| "clip_ratio/low_min": 0.07782801624853164, | |
| "clip_ratio/region_mean": 0.1372300088405609, | |
| "epoch": 0.8835820895522388, | |
| "grad_norm": 5.588550612212405, | |
| "kl": 9.119772452046163, | |
| "learning_rate": 0.00012668634206069304, | |
| "loss": 0.05784386023879051, | |
| "memory(GiB)": 79.48, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.002555 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005630630766972899, | |
| "clip_ratio/high_mean": 0.0005630630766972899, | |
| "clip_ratio/low_mean": 0.009406007709912956, | |
| "clip_ratio/low_min": 0.009406007709912956, | |
| "clip_ratio/region_mean": 0.009969070786610246, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 43.0, | |
| "completions/mean_length": 7.3671875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.8955223880597015, | |
| "grad_norm": 40.351102862526105, | |
| "kl": 37.61209568884806, | |
| "learning_rate": 0.00012475268188771627, | |
| "loss": 0.25722047686576843, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.515625, | |
| "reward_std": 0.3077147901058197, | |
| "rewards/Response_no_think_reward_1/mean": 0.515625, | |
| "rewards/Response_no_think_reward_1/std": 0.5883966684341431, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.00255 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03623928187880665, | |
| "clip_ratio/high_mean": 0.03623928187880665, | |
| "clip_ratio/low_mean": 0.00604772218503058, | |
| "clip_ratio/low_min": 0.00604772218503058, | |
| "clip_ratio/region_mean": 0.04228700394742191, | |
| "epoch": 0.9074626865671642, | |
| "grad_norm": 17.208461552664357, | |
| "kl": 6.087301138206385, | |
| "learning_rate": 0.00012280911092620297, | |
| "loss": 0.16766606271266937, | |
| "memory(GiB)": 79.48, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.002568 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0016891892300918698, | |
| "clip_ratio/high_mean": 0.0016891892300918698, | |
| "clip_ratio/low_mean": 0.012179655604995787, | |
| "clip_ratio/low_min": 0.012179655604995787, | |
| "clip_ratio/region_mean": 0.013868844718672335, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 39.0, | |
| "completions/mean_length": 7.21875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.9194029850746268, | |
| "grad_norm": 4.3979207862679734, | |
| "kl": 7.126492358453106, | |
| "learning_rate": 0.00012085640736741708, | |
| "loss": 0.06262560933828354, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.0546875, | |
| "reward_std": 0.39322251081466675, | |
| "rewards/Response_no_think_reward_1/mean": 0.0546875, | |
| "rewards/Response_no_think_reward_1/std": 0.7561672329902649, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.002562 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.026138584362342954, | |
| "clip_ratio/high_mean": 0.026138584362342954, | |
| "clip_ratio/low_mean": 0.04480157361831516, | |
| "clip_ratio/low_min": 0.04480157361831516, | |
| "clip_ratio/region_mean": 0.07094015786424279, | |
| "epoch": 0.9313432835820895, | |
| "grad_norm": 2.916485581854171, | |
| "kl": 4.029124836612027, | |
| "learning_rate": 0.00011889535305924618, | |
| "loss": 0.04432527720928192, | |
| "memory(GiB)": 79.48, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.002579 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0125213154242374, | |
| "clip_ratio/low_min": 0.0125213154242374, | |
| "clip_ratio/region_mean": 0.0125213154242374, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 41.0, | |
| "completions/mean_length": 7.5703125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.9432835820895522, | |
| "grad_norm": 5.401724081079944, | |
| "kl": 2.715451994285104, | |
| "learning_rate": 0.00011692673319315541, | |
| "loss": 0.025846321135759354, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.15625, | |
| "reward_std": 0.32662156224250793, | |
| "rewards/Response_no_think_reward_1/mean": 0.15625, | |
| "rewards/Response_no_think_reward_1/std": 0.778019905090332, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.002572 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02864583395421505, | |
| "clip_ratio/high_mean": 0.02864583395421505, | |
| "clip_ratio/low_mean": 0.06598890712484717, | |
| "clip_ratio/low_min": 0.06598890712484717, | |
| "clip_ratio/region_mean": 0.09463474014773965, | |
| "epoch": 0.9552238805970149, | |
| "grad_norm": 1.7607357402294221, | |
| "kl": 3.6259496022976236, | |
| "learning_rate": 0.00011495133598980263, | |
| "loss": 0.011118962429463863, | |
| "memory(GiB)": 79.48, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.002589 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0010000000474974513, | |
| "clip_ratio/high_mean": 0.0010000000474974513, | |
| "clip_ratio/low_mean": 0.009746301162522286, | |
| "clip_ratio/low_min": 0.009746301162522286, | |
| "clip_ratio/region_mean": 0.010746301151812077, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 45.0, | |
| "completions/mean_length": 7.421875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.9671641791044776, | |
| "grad_norm": 6.226807855082435, | |
| "kl": 3.5353202793048695, | |
| "learning_rate": 0.00011296995238344084, | |
| "loss": 0.0407019704580307, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.2109375, | |
| "reward_std": 0.3596799373626709, | |
| "rewards/Response_no_think_reward_1/mean": 0.2109375, | |
| "rewards/Response_no_think_reward_1/std": 0.78019118309021, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.002582 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.025790343526750803, | |
| "clip_ratio/high_mean": 0.025790343526750803, | |
| "clip_ratio/low_mean": 0.027053400757722557, | |
| "clip_ratio/low_min": 0.027053400757722557, | |
| "clip_ratio/region_mean": 0.052843744633719325, | |
| "epoch": 0.9791044776119403, | |
| "grad_norm": 43.50825312796573, | |
| "kl": 2.1143818981945515, | |
| "learning_rate": 0.00011098337570523396, | |
| "loss": 0.1263183057308197, | |
| "memory(GiB)": 79.48, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.002599 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0045458003878593445, | |
| "clip_ratio/high_mean": 0.0045458003878593445, | |
| "clip_ratio/low_mean": 0.004786531790159643, | |
| "clip_ratio/low_min": 0.004786531790159643, | |
| "clip_ratio/region_mean": 0.009332332178018987, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 23.0, | |
| "completions/mean_length": 5.6796875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.0119402985074626, | |
| "grad_norm": 5.294876949688284, | |
| "kl": 1.5498897642164593, | |
| "learning_rate": 0.00010899240136561299, | |
| "loss": 0.011598482728004456, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.4453125, | |
| "reward_std": 0.1938612163066864, | |
| "rewards/Response_no_think_reward_1/mean": 0.4453125, | |
| "rewards/Response_no_think_reward_1/std": 0.7187981605529785, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.002589 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.025593542493879795, | |
| "clip_ratio/high_mean": 0.025593542493879795, | |
| "clip_ratio/low_mean": 0.025054577039554715, | |
| "clip_ratio/low_min": 0.025054577039554715, | |
| "clip_ratio/region_mean": 0.05064811953343451, | |
| "epoch": 1.0238805970149254, | |
| "grad_norm": 2.6737027093734143, | |
| "kl": 1.398324867649535, | |
| "learning_rate": 0.00010699782653579973, | |
| "loss": -0.00029344583163037896, | |
| "memory(GiB)": 79.48, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.002605 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0017993993242271245, | |
| "clip_ratio/high_mean": 0.0017993993242271245, | |
| "clip_ratio/low_mean": 0.01037665200419724, | |
| "clip_ratio/low_min": 0.01037665200419724, | |
| "clip_ratio/region_mean": 0.012176051270216703, | |
| "completions/clipped_ratio": 0.171875, | |
| "completions/max_length": 42.0, | |
| "completions/mean_length": 6.125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.035820895522388, | |
| "grad_norm": 2.5145149964606297, | |
| "kl": 3.1435449587497715, | |
| "learning_rate": 0.00010500044982862519, | |
| "loss": 0.024344690144062042, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.4765625, | |
| "reward_std": 0.2772369980812073, | |
| "rewards/Response_no_think_reward_1/mean": 0.4765625, | |
| "rewards/Response_no_think_reward_1/std": 0.8414914011955261, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.002595 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.021866617840714753, | |
| "clip_ratio/high_mean": 0.021866617840714753, | |
| "clip_ratio/low_mean": 0.07049822807312012, | |
| "clip_ratio/low_min": 0.07049822807312012, | |
| "clip_ratio/region_mean": 0.09236484486609697, | |
| "epoch": 1.0477611940298508, | |
| "grad_norm": 2.607332219212116, | |
| "kl": 4.641115245953188, | |
| "learning_rate": 0.00010300107097877114, | |
| "loss": 0.010013583116233349, | |
| "memory(GiB)": 79.48, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.00261 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0018382353009656072, | |
| "clip_ratio/high_mean": 0.0018382353009656072, | |
| "clip_ratio/low_mean": 0.0032051282469183207, | |
| "clip_ratio/low_min": 0.0032051282469183207, | |
| "clip_ratio/region_mean": 0.005043363547883928, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 20.0, | |
| "completions/mean_length": 5.4375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.0597014925373134, | |
| "grad_norm": 8.56914849705318, | |
| "kl": 0.7865612751156732, | |
| "learning_rate": 0.00010100049052256235, | |
| "loss": 0.013117787428200245, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.53125, | |
| "reward_std": 0.1860944628715515, | |
| "rewards/Response_no_think_reward_1/mean": 0.53125, | |
| "rewards/Response_no_think_reward_1/std": 0.7202088236808777, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.002597 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.009521116502583027, | |
| "clip_ratio/high_mean": 0.009521116502583027, | |
| "clip_ratio/low_mean": 0.0203368536895141, | |
| "clip_ratio/low_min": 0.0203368536895141, | |
| "clip_ratio/region_mean": 0.029857969493605196, | |
| "epoch": 1.0716417910447762, | |
| "grad_norm": 3.3791848142288035, | |
| "kl": 0.6961851019823371, | |
| "learning_rate": 9.899950947743767e-05, | |
| "loss": 0.00659452797845006, | |
| "memory(GiB)": 79.48, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.002612 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.004996612435206771, | |
| "clip_ratio/low_min": 0.004996612435206771, | |
| "clip_ratio/region_mean": 0.004996612435206771, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 31.0, | |
| "completions/mean_length": 5.2265625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.0835820895522388, | |
| "grad_norm": 3.6519414582158323, | |
| "kl": 4.849585925694555, | |
| "learning_rate": 9.699892902122886e-05, | |
| "loss": 0.06144208833575249, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1640625, | |
| "reward_std": 0.3352247476577759, | |
| "rewards/Response_no_think_reward_1/mean": 0.1640625, | |
| "rewards/Response_no_think_reward_1/std": 0.8303053379058838, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.002606 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.017538156593218446, | |
| "clip_ratio/high_mean": 0.017538156593218446, | |
| "clip_ratio/low_mean": 0.03697483101859689, | |
| "clip_ratio/low_min": 0.03697483101859689, | |
| "clip_ratio/region_mean": 0.054512988310307264, | |
| "epoch": 1.0955223880597016, | |
| "grad_norm": 13.104523239395307, | |
| "kl": 2.37760816863738, | |
| "learning_rate": 9.499955017137484e-05, | |
| "loss": 0.10894370079040527, | |
| "memory(GiB)": 79.48, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.002621 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004422514699399471, | |
| "clip_ratio/high_mean": 0.004422514699399471, | |
| "clip_ratio/low_mean": 0.007080804323777556, | |
| "clip_ratio/low_min": 0.007080804323777556, | |
| "clip_ratio/region_mean": 0.01150331913959235, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 7.0, | |
| "completions/mean_length": 4.6640625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.1074626865671642, | |
| "grad_norm": 3.292956583617785, | |
| "kl": 3.1563512758002616, | |
| "learning_rate": 9.30021734642003e-05, | |
| "loss": 0.03713127598166466, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.421875, | |
| "reward_std": 0.2630079686641693, | |
| "rewards/Response_no_think_reward_1/mean": 0.421875, | |
| "rewards/Response_no_think_reward_1/std": 0.7382611632347107, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.002603 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012390351388603449, | |
| "clip_ratio/high_mean": 0.012390351388603449, | |
| "clip_ratio/low_mean": 0.01934311306104064, | |
| "clip_ratio/low_min": 0.01934311306104064, | |
| "clip_ratio/region_mean": 0.03173346375115216, | |
| "epoch": 1.1194029850746268, | |
| "grad_norm": 6.523254504794387, | |
| "kl": 2.134530827694107, | |
| "learning_rate": 9.100759863438702e-05, | |
| "loss": 0.04548652470111847, | |
| "memory(GiB)": 79.48, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.002618 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0018115942366421223, | |
| "clip_ratio/high_mean": 0.0018115942366421223, | |
| "clip_ratio/low_mean": 0.010487846680916846, | |
| "clip_ratio/low_min": 0.010487846680916846, | |
| "clip_ratio/region_mean": 0.012299440917558968, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 17.0, | |
| "completions/mean_length": 4.7109375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.1313432835820896, | |
| "grad_norm": 2.8653500050121345, | |
| "kl": 3.8929527901345864, | |
| "learning_rate": 8.901662429476607e-05, | |
| "loss": 0.04490555822849274, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1796875, | |
| "reward_std": 0.25065141916275024, | |
| "rewards/Response_no_think_reward_1/mean": 0.1796875, | |
| "rewards/Response_no_think_reward_1/std": 0.9173188805580139, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.00261 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.019497282337397337, | |
| "clip_ratio/high_mean": 0.019497282337397337, | |
| "clip_ratio/low_mean": 0.05975891789421439, | |
| "clip_ratio/low_min": 0.05975891789421439, | |
| "clip_ratio/region_mean": 0.07925620023161173, | |
| "epoch": 1.1432835820895522, | |
| "grad_norm": 8.612775013595648, | |
| "kl": 4.982872966560535, | |
| "learning_rate": 8.703004761655917e-05, | |
| "loss": 0.07919233292341232, | |
| "memory(GiB)": 79.48, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.002625 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0027173913549631834, | |
| "clip_ratio/high_mean": 0.0027173913549631834, | |
| "clip_ratio/low_mean": 0.005094834603369236, | |
| "clip_ratio/low_min": 0.005094834603369236, | |
| "clip_ratio/region_mean": 0.007812225958332419, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 10.0, | |
| "completions/mean_length": 4.9375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.155223880597015, | |
| "grad_norm": 10.776677331970285, | |
| "kl": 9.849615207003808, | |
| "learning_rate": 8.504866401019737e-05, | |
| "loss": 0.1374131143093109, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3203125, | |
| "reward_std": 0.14966703951358795, | |
| "rewards/Response_no_think_reward_1/mean": 0.3203125, | |
| "rewards/Response_no_think_reward_1/std": 0.6266219019889832, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.002622 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.019021738320589066, | |
| "clip_ratio/high_mean": 0.019021738320589066, | |
| "clip_ratio/low_mean": 0.005626177066005766, | |
| "clip_ratio/low_min": 0.005626177066005766, | |
| "clip_ratio/region_mean": 0.024647915386594832, | |
| "epoch": 1.1671641791044776, | |
| "grad_norm": 3.0583039624376402, | |
| "kl": 4.468168576029711, | |
| "learning_rate": 8.307326680684461e-05, | |
| "loss": 0.07699939608573914, | |
| "memory(GiB)": 79.48, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.002636 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.007378174108453095, | |
| "clip_ratio/high_mean": 0.007378174108453095, | |
| "clip_ratio/low_mean": 0.00924376118928194, | |
| "clip_ratio/low_min": 0.00924376118928194, | |
| "clip_ratio/region_mean": 0.016621935297735035, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 12.0, | |
| "completions/mean_length": 4.9453125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.1791044776119404, | |
| "grad_norm": 9.444776640622303, | |
| "kl": 3.863095655280631, | |
| "learning_rate": 8.110464694075383e-05, | |
| "loss": 0.02421477437019348, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.4375, | |
| "reward_std": 0.25460314750671387, | |
| "rewards/Response_no_think_reward_1/mean": 0.4375, | |
| "rewards/Response_no_think_reward_1/std": 0.7290377616882324, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.002626 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02187895681709051, | |
| "clip_ratio/high_mean": 0.02187895681709051, | |
| "clip_ratio/low_mean": 0.005211503244936466, | |
| "clip_ratio/low_min": 0.005211503244936466, | |
| "clip_ratio/region_mean": 0.027090460062026978, | |
| "epoch": 1.191044776119403, | |
| "grad_norm": 4.753171281552747, | |
| "kl": 3.498804785136599, | |
| "learning_rate": 7.914359263258295e-05, | |
| "loss": 0.02348589338362217, | |
| "memory(GiB)": 79.48, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.00264 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014204545877873898, | |
| "clip_ratio/high_mean": 0.0014204545877873898, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0014204545877873898, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 11.0, | |
| "completions/mean_length": 5.5859375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.2029850746268655, | |
| "grad_norm": 4.853951435141314, | |
| "kl": 7.24955918840169, | |
| "learning_rate": 7.719088907379706e-05, | |
| "loss": 0.08564330637454987, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.359375, | |
| "reward_std": 0.1706565022468567, | |
| "rewards/Response_no_think_reward_1/mean": 0.359375, | |
| "rewards/Response_no_think_reward_1/std": 0.6608795523643494, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.002636 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01420454541221261, | |
| "clip_ratio/high_mean": 0.01420454541221261, | |
| "clip_ratio/low_mean": 0.0028409091755747795, | |
| "clip_ratio/low_min": 0.0028409091755747795, | |
| "clip_ratio/region_mean": 0.017045455053448677, | |
| "epoch": 1.2149253731343284, | |
| "grad_norm": 2.2986744180745324, | |
| "kl": 4.886410776793127, | |
| "learning_rate": 7.524731811228374e-05, | |
| "loss": 0.06466365605592728, | |
| "memory(GiB)": 79.48, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.00265 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00620507646817714, | |
| "clip_ratio/high_mean": 0.00620507646817714, | |
| "clip_ratio/low_mean": 0.008002021699212492, | |
| "clip_ratio/low_min": 0.008002021699212492, | |
| "clip_ratio/region_mean": 0.014207098283804953, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 19.0, | |
| "completions/mean_length": 6.2890625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.2268656716417912, | |
| "grad_norm": 35.84498974880178, | |
| "kl": 13.474940237792907, | |
| "learning_rate": 7.331365793930698e-05, | |
| "loss": 0.23400571942329407, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3671875, | |
| "reward_std": 0.1965562105178833, | |
| "rewards/Response_no_think_reward_1/mean": 0.3671875, | |
| "rewards/Response_no_think_reward_1/std": 0.7410472631454468, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.002642 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.011945601785555482, | |
| "clip_ratio/high_mean": 0.011945601785555482, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.011945601785555482, | |
| "epoch": 1.2388059701492538, | |
| "grad_norm": 27.884607230951485, | |
| "kl": 1.4154490869450456, | |
| "learning_rate": 7.139068277792523e-05, | |
| "loss": 0.2148125171661377, | |
| "memory(GiB)": 79.48, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.002655 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.007009345572441816, | |
| "clip_ratio/low_min": 0.007009345572441816, | |
| "clip_ratio/region_mean": 0.007009345572441816, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 40.0, | |
| "completions/mean_length": 5.640625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.2507462686567163, | |
| "grad_norm": 2.3687718583378876, | |
| "kl": 1.394652240909636, | |
| "learning_rate": 6.94791625729983e-05, | |
| "loss": 0.018386229872703552, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.6328125, | |
| "reward_std": 0.20033246278762817, | |
| "rewards/Response_no_think_reward_1/mean": 0.6328125, | |
| "rewards/Response_no_think_reward_1/std": 0.6258360743522644, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.002645 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.031393789453431964, | |
| "clip_ratio/high_mean": 0.031393789453431964, | |
| "clip_ratio/low_mean": 0.01482532313093543, | |
| "clip_ratio/low_min": 0.01482532313093543, | |
| "clip_ratio/region_mean": 0.04621911211870611, | |
| "epoch": 1.2626865671641792, | |
| "grad_norm": 1.3586707954485446, | |
| "kl": 1.0225394079461694, | |
| "learning_rate": 6.757986268290712e-05, | |
| "loss": 0.011677918955683708, | |
| "memory(GiB)": 79.48, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.002658 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00795477326028049, | |
| "clip_ratio/high_mean": 0.00795477326028049, | |
| "clip_ratio/low_mean": 0.007858287775889039, | |
| "clip_ratio/low_min": 0.007858287775889039, | |
| "clip_ratio/region_mean": 0.015813061269000173, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 32.0, | |
| "completions/mean_length": 5.828125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.2746268656716417, | |
| "grad_norm": 16.43559312212207, | |
| "kl": 1.8490474935271664, | |
| "learning_rate": 6.569354357311014e-05, | |
| "loss": 0.03543264418840408, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3671875, | |
| "reward_std": 0.31494253873825073, | |
| "rewards/Response_no_think_reward_1/mean": 0.3671875, | |
| "rewards/Response_no_think_reward_1/std": 0.7923958897590637, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.002652 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.011914517963305116, | |
| "clip_ratio/high_mean": 0.011914517963305116, | |
| "clip_ratio/low_mean": 0.03227056178729981, | |
| "clip_ratio/low_min": 0.03227056178729981, | |
| "clip_ratio/region_mean": 0.04418508114758879, | |
| "epoch": 1.2865671641791045, | |
| "grad_norm": 2.5408508655554636, | |
| "kl": 1.8903868702007571, | |
| "learning_rate": 6.382096051165847e-05, | |
| "loss": 0.014127654023468494, | |
| "memory(GiB)": 79.48, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.002665 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0030637255404144526, | |
| "clip_ratio/high_mean": 0.0030637255404144526, | |
| "clip_ratio/low_mean": 0.015822806861251593, | |
| "clip_ratio/low_min": 0.015822806861251593, | |
| "clip_ratio/region_mean": 0.018886532401666045, | |
| "completions/clipped_ratio": 0.109375, | |
| "completions/max_length": 47.0, | |
| "completions/mean_length": 6.7109375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.2985074626865671, | |
| "grad_norm": 5.1535076282650945, | |
| "kl": 2.8769574181642383, | |
| "learning_rate": 6.19628632667923e-05, | |
| "loss": 0.038440439850091934, | |
| "memory(GiB)": 79.48, | |
| "reward": -0.0625, | |
| "reward_std": 0.4184814691543579, | |
| "rewards/Response_no_think_reward_1/mean": -0.0625, | |
| "rewards/Response_no_think_reward_1/std": 0.8394786715507507, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.002655 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.011060049437219277, | |
| "clip_ratio/high_mean": 0.011060049437219277, | |
| "clip_ratio/low_mean": 0.05394765589153394, | |
| "clip_ratio/low_min": 0.05394765589153394, | |
| "clip_ratio/region_mean": 0.06500770541606471, | |
| "epoch": 1.31044776119403, | |
| "grad_norm": 38.3461665329109, | |
| "kl": 2.019717270624824, | |
| "learning_rate": 6.011999580673931e-05, | |
| "loss": 0.16980835795402527, | |
| "memory(GiB)": 79.48, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.002668 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0016025641234591603, | |
| "clip_ratio/high_mean": 0.0016025641234591603, | |
| "clip_ratio/low_mean": 0.0032051282469183207, | |
| "clip_ratio/low_min": 0.0032051282469183207, | |
| "clip_ratio/region_mean": 0.004807692486792803, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 25.0, | |
| "completions/mean_length": 5.703125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.3223880597014925, | |
| "grad_norm": 1.9241770555383604, | |
| "kl": 0.4095292093356875, | |
| "learning_rate": 5.829309600183536e-05, | |
| "loss": 0.003778851358219981, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.453125, | |
| "reward_std": 0.24464011192321777, | |
| "rewards/Response_no_think_reward_1/mean": 0.453125, | |
| "rewards/Response_no_think_reward_1/std": 0.8405039310455322, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.00266 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.016826923470944166, | |
| "clip_ratio/high_mean": 0.016826923470944166, | |
| "clip_ratio/low_mean": 0.025240384973585606, | |
| "clip_ratio/low_min": 0.025240384973585606, | |
| "clip_ratio/region_mean": 0.042067307978868484, | |
| "epoch": 1.3343283582089551, | |
| "grad_norm": 4.00720293405374, | |
| "kl": 0.3944609015534297, | |
| "learning_rate": 5.648289532908666e-05, | |
| "loss": 0.0013700753916054964, | |
| "memory(GiB)": 79.48, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.002673 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.012351020704954863, | |
| "clip_ratio/low_min": 0.012351020704954863, | |
| "clip_ratio/region_mean": 0.012351020704954863, | |
| "completions/clipped_ratio": 0.2265625, | |
| "completions/max_length": 23.0, | |
| "completions/mean_length": 6.03125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.346268656716418, | |
| "grad_norm": 5.342919033145562, | |
| "kl": 6.366508552979212, | |
| "learning_rate": 5.4690118579292015e-05, | |
| "loss": 0.08252155035734177, | |
| "memory(GiB)": 79.48, | |
| "reward": -0.0703125, | |
| "reward_std": 0.5281283259391785, | |
| "rewards/Response_no_think_reward_1/mean": -0.0703125, | |
| "rewards/Response_no_think_reward_1/std": 0.7954951524734497, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.002667 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0056201552506536245, | |
| "clip_ratio/high_mean": 0.0056201552506536245, | |
| "clip_ratio/low_mean": 0.07672008802182972, | |
| "clip_ratio/low_min": 0.07672008802182972, | |
| "clip_ratio/region_mean": 0.08234024350531399, | |
| "epoch": 1.3582089552238805, | |
| "grad_norm": 4.841852348859136, | |
| "kl": 7.482738017570227, | |
| "learning_rate": 5.291548356684177e-05, | |
| "loss": 0.06593235582113266, | |
| "memory(GiB)": 79.48, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.00268 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.00446532026398927, | |
| "clip_ratio/low_min": 0.00446532026398927, | |
| "clip_ratio/region_mean": 0.00446532026398927, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 10.0, | |
| "completions/mean_length": 5.328125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.3701492537313433, | |
| "grad_norm": 2.4231207405852158, | |
| "kl": 2.7402262951763987, | |
| "learning_rate": 5.115970084231059e-05, | |
| "loss": 0.021689381450414658, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.4453125, | |
| "reward_std": 0.33350807428359985, | |
| "rewards/Response_no_think_reward_1/mean": 0.4453125, | |
| "rewards/Response_no_think_reward_1/std": 0.7817665934562683, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.002673 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02434239676222205, | |
| "clip_ratio/high_mean": 0.02434239676222205, | |
| "clip_ratio/low_mean": 0.0223974745022133, | |
| "clip_ratio/low_min": 0.0223974745022133, | |
| "clip_ratio/region_mean": 0.046739870798774064, | |
| "epoch": 1.382089552238806, | |
| "grad_norm": 1.0551090300064008, | |
| "kl": 2.37436256357978, | |
| "learning_rate": 4.9423473407958035e-05, | |
| "loss": 0.008349667303264141, | |
| "memory(GiB)": 79.48, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.002685 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.011147994082421064, | |
| "clip_ratio/low_min": 0.011147994082421064, | |
| "clip_ratio/region_mean": 0.011147994082421064, | |
| "completions/clipped_ratio": 0.15625, | |
| "completions/max_length": 11.0, | |
| "completions/mean_length": 5.3515625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.3940298507462687, | |
| "grad_norm": 35.484376517766954, | |
| "kl": 24.603704601235222, | |
| "learning_rate": 4.7707496436252e-05, | |
| "loss": 0.3364083468914032, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.1328125, | |
| "reward_std": 0.28117600083351135, | |
| "rewards/Response_no_think_reward_1/mean": 0.1328125, | |
| "rewards/Response_no_think_reward_1/std": 0.8264437913894653, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.002678 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002314814832061529, | |
| "clip_ratio/high_mean": 0.002314814832061529, | |
| "clip_ratio/low_mean": 0.0054197743302211165, | |
| "clip_ratio/low_min": 0.0054197743302211165, | |
| "clip_ratio/region_mean": 0.007734589162282646, | |
| "epoch": 1.4059701492537313, | |
| "grad_norm": 7.954623939964381, | |
| "kl": 12.087648045126116, | |
| "learning_rate": 4.601245699152659e-05, | |
| "loss": 0.2005119025707245, | |
| "memory(GiB)": 79.48, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.00269 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005434782360680401, | |
| "clip_ratio/high_mean": 0.0005434782360680401, | |
| "clip_ratio/low_mean": 0.004596828715875745, | |
| "clip_ratio/low_min": 0.004596828715875745, | |
| "clip_ratio/region_mean": 0.005140306951943785, | |
| "completions/clipped_ratio": 0.0703125, | |
| "completions/max_length": 40.0, | |
| "completions/mean_length": 5.8671875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.417910447761194, | |
| "grad_norm": 3.80570877135741, | |
| "kl": 3.121465804113541, | |
| "learning_rate": 4.433903375488697e-05, | |
| "loss": 0.044249728322029114, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3046875, | |
| "reward_std": 0.38101160526275635, | |
| "rewards/Response_no_think_reward_1/mean": 0.3046875, | |
| "rewards/Response_no_think_reward_1/std": 0.8562746047973633, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.002684 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.014024957199580967, | |
| "clip_ratio/high_mean": 0.014024957199580967, | |
| "clip_ratio/low_mean": 0.0131244600052014, | |
| "clip_ratio/low_min": 0.0131244600052014, | |
| "clip_ratio/region_mean": 0.02714941732119769, | |
| "epoch": 1.4298507462686567, | |
| "grad_norm": 3.857626589553114, | |
| "kl": 2.146273965074215, | |
| "learning_rate": 4.268789675247029e-05, | |
| "loss": 0.03236865624785423, | |
| "memory(GiB)": 79.48, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.002695 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0012886597542092204, | |
| "clip_ratio/high_mean": 0.0012886597542092204, | |
| "clip_ratio/low_mean": 0.0051683366764336824, | |
| "clip_ratio/low_min": 0.0051683366764336824, | |
| "clip_ratio/region_mean": 0.006456996430642903, | |
| "completions/clipped_ratio": 0.0703125, | |
| "completions/max_length": 22.0, | |
| "completions/mean_length": 5.6171875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.4417910447761195, | |
| "grad_norm": 3.2126971808505513, | |
| "kl": 1.1720350683217475, | |
| "learning_rate": 4.105970708717244e-05, | |
| "loss": 0.018675971776247025, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.5625, | |
| "reward_std": 0.22125522792339325, | |
| "rewards/Response_no_think_reward_1/mean": 0.5625, | |
| "rewards/Response_no_think_reward_1/std": 0.6490453481674194, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.002674 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.020605165394954383, | |
| "clip_ratio/low_min": 0.020605165394954383, | |
| "clip_ratio/region_mean": 0.020605165394954383, | |
| "epoch": 1.4537313432835821, | |
| "grad_norm": 1.102830732170957, | |
| "kl": 1.583265769013451, | |
| "learning_rate": 3.945511667394719e-05, | |
| "loss": 0.003417772939428687, | |
| "memory(GiB)": 79.48, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.002685 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.007155258092097938, | |
| "clip_ratio/low_min": 0.007155258092097938, | |
| "clip_ratio/region_mean": 0.007155258092097938, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 23.0, | |
| "completions/mean_length": 5.6640625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.4656716417910447, | |
| "grad_norm": 2.9093250272424034, | |
| "kl": 1.8708921101060696, | |
| "learning_rate": 3.787476797878459e-05, | |
| "loss": 0.01941162720322609, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.59375, | |
| "reward_std": 0.3198433816432953, | |
| "rewards/Response_no_think_reward_1/mean": 0.59375, | |
| "rewards/Response_no_think_reward_1/std": 0.692337155342102, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.002659 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02566964237485081, | |
| "clip_ratio/high_mean": 0.02566964237485081, | |
| "clip_ratio/low_mean": 0.01106150820851326, | |
| "clip_ratio/low_min": 0.01106150820851326, | |
| "clip_ratio/region_mean": 0.03673115174751729, | |
| "epoch": 1.4776119402985075, | |
| "grad_norm": 1.6206572311785468, | |
| "kl": 2.092067622463219, | |
| "learning_rate": 3.631929376147207e-05, | |
| "loss": 0.00795831624418497, | |
| "memory(GiB)": 79.48, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.00267 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 16.0, | |
| "completions/mean_length": 5.140625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.48955223880597, | |
| "grad_norm": 1.1898236332850007, | |
| "kl": 0.5545606576924911, | |
| "learning_rate": 3.47893168222425e-05, | |
| "loss": 0.005211046896874905, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.5078125, | |
| "reward_std": 0.2012200653553009, | |
| "rewards/Response_no_think_reward_1/mean": 0.5078125, | |
| "rewards/Response_no_think_reward_1/std": 0.763292670249939, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.002638 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.015350877307355404, | |
| "clip_ratio/high_mean": 0.015350877307355404, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.015350877307355404, | |
| "epoch": 1.5014925373134327, | |
| "grad_norm": 0.3409132689994619, | |
| "kl": 0.5577427046882804, | |
| "learning_rate": 3.328544975240932e-05, | |
| "loss": -0.0002708420215640217, | |
| "memory(GiB)": 79.48, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.002649 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.00601851858664304, | |
| "clip_ratio/low_min": 0.00601851858664304, | |
| "clip_ratio/region_mean": 0.00601851858664304, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 30.0, | |
| "completions/mean_length": 5.8671875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.5134328358208955, | |
| "grad_norm": 5.906541393453947, | |
| "kl": 6.567164011168643, | |
| "learning_rate": 3.180829468908986e-05, | |
| "loss": 0.07308901846408844, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3671875, | |
| "reward_std": 0.1412346363067627, | |
| "rewards/Response_no_think_reward_1/mean": 0.3671875, | |
| "rewards/Response_no_think_reward_1/std": 0.8406137228012085, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.002642 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.010185185354202986, | |
| "clip_ratio/low_min": 0.010185185354202986, | |
| "clip_ratio/region_mean": 0.010185185354202986, | |
| "epoch": 1.5253731343283583, | |
| "grad_norm": 1.637348051569756, | |
| "kl": 3.2303040275146486, | |
| "learning_rate": 3.035844307411384e-05, | |
| "loss": 0.04529271274805069, | |
| "memory(GiB)": 79.48, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.002652 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00046296295477077365, | |
| "clip_ratio/high_mean": 0.00046296295477077365, | |
| "clip_ratio/low_mean": 0.004759002127684653, | |
| "clip_ratio/low_min": 0.004759002127684653, | |
| "clip_ratio/region_mean": 0.0052219650824554265, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 29.0, | |
| "completions/mean_length": 6.4453125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.537313432835821, | |
| "grad_norm": 1.5814533572332585, | |
| "kl": 1.9979073457579943, | |
| "learning_rate": 2.8936475417214794e-05, | |
| "loss": 0.022465700283646584, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3359375, | |
| "reward_std": 0.17123225331306458, | |
| "rewards/Response_no_think_reward_1/mean": 0.3359375, | |
| "rewards/Response_no_think_reward_1/std": 0.7453514337539673, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.00264 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014710274408571422, | |
| "clip_ratio/high_mean": 0.0014710274408571422, | |
| "clip_ratio/low_mean": 0.022759197046980262, | |
| "clip_ratio/low_min": 0.022759197046980262, | |
| "clip_ratio/region_mean": 0.024230224487837404, | |
| "epoch": 1.5492537313432835, | |
| "grad_norm": 0.9057768060895434, | |
| "kl": 1.9242111706989817, | |
| "learning_rate": 2.7542961063598104e-05, | |
| "loss": 0.013444737531244755, | |
| "memory(GiB)": 79.48, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.002651 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0026041667442768812, | |
| "clip_ratio/high_mean": 0.0026041667442768812, | |
| "clip_ratio/low_mean": 0.010856111068278551, | |
| "clip_ratio/low_min": 0.010856111068278551, | |
| "clip_ratio/region_mean": 0.013460277812555432, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 28.0, | |
| "completions/mean_length": 5.6875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.5611940298507463, | |
| "grad_norm": 2.279027191303148, | |
| "kl": 1.264391661035006, | |
| "learning_rate": 2.617845796597954e-05, | |
| "loss": 0.005756520200520754, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3671875, | |
| "reward_std": 0.15756267309188843, | |
| "rewards/Response_no_think_reward_1/mean": 0.3671875, | |
| "rewards/Response_no_think_reward_1/std": 0.7410472631454468, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.002635 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0026041667442768812, | |
| "clip_ratio/high_mean": 0.0026041667442768812, | |
| "clip_ratio/low_mean": 0.06580501515418291, | |
| "clip_ratio/low_min": 0.06580501515418291, | |
| "clip_ratio/region_mean": 0.06840918306261301, | |
| "epoch": 1.573134328358209, | |
| "grad_norm": 1.198012219937442, | |
| "kl": 1.689065290265944, | |
| "learning_rate": 2.484351246118507e-05, | |
| "loss": -0.000346488319337368, | |
| "memory(GiB)": 79.48, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.002646 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0059523810632526875, | |
| "clip_ratio/low_min": 0.0059523810632526875, | |
| "clip_ratio/region_mean": 0.0059523810632526875, | |
| "completions/clipped_ratio": 0.0234375, | |
| "completions/max_length": 25.0, | |
| "completions/mean_length": 5.15625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.5850746268656717, | |
| "grad_norm": 2.595184247375665, | |
| "kl": 0.8083602132865053, | |
| "learning_rate": 2.353865905140187e-05, | |
| "loss": 0.009201270528137684, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.4296875, | |
| "reward_std": 0.13553348183631897, | |
| "rewards/Response_no_think_reward_1/mean": 0.4296875, | |
| "rewards/Response_no_think_reward_1/std": 0.7496308088302612, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.002635 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0019841270986944437, | |
| "clip_ratio/high_mean": 0.0019841270986944437, | |
| "clip_ratio/low_mean": 0.01378506887704134, | |
| "clip_ratio/low_min": 0.01378506887704134, | |
| "clip_ratio/region_mean": 0.01576919574290514, | |
| "epoch": 1.5970149253731343, | |
| "grad_norm": 1.0694122716373746, | |
| "kl": 0.8849439112927939, | |
| "learning_rate": 2.226442019016739e-05, | |
| "loss": 0.0032178200781345367, | |
| "memory(GiB)": 79.48, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.002646 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014880952658131719, | |
| "clip_ratio/high_mean": 0.0014880952658131719, | |
| "clip_ratio/low_mean": 0.004777232185006142, | |
| "clip_ratio/low_min": 0.004777232185006142, | |
| "clip_ratio/region_mean": 0.0062653274508193135, | |
| "completions/clipped_ratio": 0.0703125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.703125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.608955223880597, | |
| "grad_norm": 8.857193213468985, | |
| "kl": 6.557242290626164, | |
| "learning_rate": 2.1021306073183167e-05, | |
| "loss": 0.09046173840761185, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.5625, | |
| "reward_std": 0.3117782771587372, | |
| "rewards/Response_no_think_reward_1/mean": 0.5625, | |
| "rewards/Response_no_think_reward_1/std": 0.6728714108467102, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.002636 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0043966451194137335, | |
| "clip_ratio/high_mean": 0.0043966451194137335, | |
| "clip_ratio/low_mean": 0.0072958533419296145, | |
| "clip_ratio/low_min": 0.0072958533419296145, | |
| "clip_ratio/region_mean": 0.01169249857775867, | |
| "epoch": 1.6208955223880597, | |
| "grad_norm": 5.293380513533871, | |
| "kl": 4.1661525671806885, | |
| "learning_rate": 1.9809814434036e-05, | |
| "loss": 0.05591786280274391, | |
| "memory(GiB)": 79.48, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.002646 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006793478387407959, | |
| "clip_ratio/high_mean": 0.0006793478387407959, | |
| "clip_ratio/low_mean": 0.008976120705483481, | |
| "clip_ratio/low_min": 0.008976120705483481, | |
| "clip_ratio/region_mean": 0.009655468544224277, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 29.0, | |
| "completions/mean_length": 6.125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.6328358208955223, | |
| "grad_norm": 2.599750460948482, | |
| "kl": 2.9140283690503566, | |
| "learning_rate": 1.863043034490938e-05, | |
| "loss": 0.026728810742497444, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3828125, | |
| "reward_std": 0.2688143849372864, | |
| "rewards/Response_no_think_reward_1/mean": 0.3828125, | |
| "rewards/Response_no_think_reward_1/std": 0.7542122602462769, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.002641 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006793478387407959, | |
| "clip_ratio/high_mean": 0.0006793478387407959, | |
| "clip_ratio/low_mean": 0.01892346324166283, | |
| "clip_ratio/low_min": 0.01892346324166283, | |
| "clip_ratio/region_mean": 0.019602811022195965, | |
| "epoch": 1.644776119402985, | |
| "grad_norm": 1.7776881222618184, | |
| "kl": 2.936662324536883, | |
| "learning_rate": 1.748362602236403e-05, | |
| "loss": 0.021627021953463554, | |
| "memory(GiB)": 79.48, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.002651 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0003906250058207661, | |
| "clip_ratio/low_min": 0.0003906250058207661, | |
| "clip_ratio/region_mean": 0.0003906250058207661, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 24.0, | |
| "completions/mean_length": 6.6953125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.6567164179104479, | |
| "grad_norm": 2.8008543153134777, | |
| "kl": 1.5049916390344151, | |
| "learning_rate": 1.63698606382661e-05, | |
| "loss": 0.022346211597323418, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.3828125, | |
| "reward_std": 0.15467959642410278, | |
| "rewards/Response_no_think_reward_1/mean": 0.3828125, | |
| "rewards/Response_no_think_reward_1/std": 0.7436988949775696, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.002647 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.004379986581625417, | |
| "clip_ratio/low_min": 0.004379986581625417, | |
| "clip_ratio/region_mean": 0.004379986581625417, | |
| "epoch": 1.6686567164179105, | |
| "grad_norm": 1.5764765403480743, | |
| "kl": 1.4290150789947802, | |
| "learning_rate": 1.528958013593801e-05, | |
| "loss": 0.0181417278945446, | |
| "memory(GiB)": 79.48, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.002657 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009469697251915932, | |
| "clip_ratio/high_mean": 0.0009469697251915932, | |
| "clip_ratio/low_mean": 0.009301686193794012, | |
| "clip_ratio/low_min": 0.009301686193794012, | |
| "clip_ratio/region_mean": 0.010248655918985605, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 25.0, | |
| "completions/mean_length": 5.15625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.680597014925373, | |
| "grad_norm": 2.987112951446729, | |
| "kl": 2.2646760795032606, | |
| "learning_rate": 1.4243217051606283e-05, | |
| "loss": 0.022022899240255356, | |
| "memory(GiB)": 79.48, | |
| "reward": 0.5625, | |
| "reward_std": 0.3713865876197815, | |
| "rewards/Response_no_think_reward_1/mean": 0.5625, | |
| "rewards/Response_no_think_reward_1/std": 0.6958821415901184, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.002652 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0010245901066809893, | |
| "clip_ratio/high_mean": 0.0010245901066809893, | |
| "clip_ratio/low_mean": 0.008475731243379414, | |
| "clip_ratio/low_min": 0.008475731243379414, | |
| "clip_ratio/region_mean": 0.009500321350060403, | |
| "epoch": 1.6925373134328359, | |
| "grad_norm": 2.122472644745234, | |
| "kl": 2.2440224051242694, | |
| "learning_rate": 1.3231190341217081e-05, | |
| "loss": 0.017425674945116043, | |
| "memory(GiB)": 79.48, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.002662 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 166, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 5, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |